Introduzione
Negli ultimi mesi i modelli di intelligenza artificiale orientati alla decisione hanno guadagnato visibilità, grazie alla capacità di restituire risposte strutturate che il software può utilizzare senza ulteriori parsing. Il primo modello di massa è stato lanciato da TypeSafe AI con Jev, definito “System One model” in riferimento al pensiero veloce di Daniel Kahneman. In poco più di tre settimane Fastino Labs ha pubblicato due controparti, mentre la comunità open‑source ha iniziato a replicare lo stesso approccio.
Cos’è un modello di IA decisionale?
Un modello decisionale accetta un “stato” – una stringa, un array o un set di coppie nome‑valore – e una o più domande tipizzate. La risposta è sempre un valore discreto: una scelta da un elenco, un punteggio su una scala o una probabilità binaria. Questo rende la risposta immediatamente utilizzabile per diramazioni logiche, routing o controlli di sicurezza, senza dover interpretare testo generato.
Come funziona Jev
Secondo la documentazione di TypeSafe, Jev supporta tre primitive fondamentali:
- Choice: seleziona un’opzione da un elenco (fino a 255 voci) restituendo probabilità e livello di confidenza.
- Score: assegna un punteggio su una scala ordinata, anch’esso con probabilità e confidenza.
- Noul: fornisce una probabilità compresa tra 0 e 1 che una affermazione sia vera, nome abbreviato di Bernoulli.
Le domande vengono valutate in parallelo e in isolamento rispetto allo stesso stato; aggiungere ulteriori interrogativi influisce poco sul tempo di risposta. Poiché Jev non genera stringhe, TypeSafe afferma che il modello non può incorrere in errori di tipo.
Architettura e metodo di addestramento
Il cuore di Jev è una “parallel sampler” combinata con il metodo Reinforcement Learning for Calibrated Decisions (RLCD). Mentre il tradizionale RLHF ottimizza per le preferenze umane, l’RLCD mira a calibrare le probabilità: una maggiore confidenza deve corrispondere a una maggiore accuratezza.
Costi e prestazioni
Il prezzo è un elemento distintivo: Jev costa 0,042 $ per milione di token di input, mentre l’output è gratuito. OpenRouter segnala una finestra di contesto di 32 K token e tempi di risposta compresi tra 70 e 500 ms, a seconda della complessità della domanda.
Benchmark di accuratezza e latenza
TypeSafe ha condotto valutazioni su quattro task: incidenti di sicurezza, osservabilità degli agenti, elaborazione di fatture e servizio clienti. I riferimenti di verità provengono da una media tra GPT‑6 Astra e Claude Fable 5.1 ad alta capacità di ragionamento.
- Jev: 67,8 % di accuratezza, costo 0,0004 $ per caso, tempo medio 0,4 s.
- Claude Sonnet 5 (stesso workflow): 67,8 % di accuratezza, 0,1174 $ per caso, 78,1 s**.
- Miglior modello LLM (OpenAI “sol”): 74,1 % di accuratezza, 0,0836 $ per caso, 23,3 s**.
Jev e Sonnet 5 hanno pari accuratezza, ma Jev è più di 200 volte più economico e più di 190 volte più veloce. Tuttavia resta 6,3 punti dietro alla configurazione di frontiera più performante. Per task specifici Jev raggiunge il 76,0 % su servizio clienti e solo 61,8 % su elaborazione fatture.
Quando utilizzare un modello decisionale
La regola pratica è semplice: se il codice necessita di una risposta limitata e direttamente azionabile, è consigliabile un modello decisionale; se invece l’output deve essere letto da un umano o richiede spiegazioni dettagliate, è preferibile un LLM tradizionale.
- Controllo del flusso degli agenti: scegliere lo strumento o il sotto‑agente successivo (ad es. Vercel lo indica come caso d’uso primario).
- Routing dei modelli: inviare richieste semplici a modelli economici e quelle complesse a modelli di frontiera (Fastino suggerisce routing per destinazione, complessità o livello di escalation).
- Classificazione e triage: smistamento di ticket di supporto, filtraggio di email, rilevamento di intenti – componenti principali del benchmark a 17 dataset di Fastino.
- Sicurezza e verifica: guardrail, rilevamento di jailbreak, scoring di prompt, tracciamenti di ragionamento (Jev è promosso per questi compiti).
- Controlli di sicurezza congiunti: GLiNER2.5-Decide può decodificare “sicurezza” e “tipo di danno” simultaneamente, evitando contraddizioni.
- Osservabilità e CI/CD: Arize e Langfuse usano Jev come giudice per valutare tracce; Buddy permette di inserire decisioni come gate nei pipeline.
- Reranking e map‑reduce: valutare 100 candidati BM25 in una chiamata parallela, trasformare grandi dataset in feature a basso costo.
- Applicazioni in tempo reale: giochi, simulazioni, UX a latenza sub‑secondo (demonstrazione di Jev in Doom e Wikiracing).
Quando non è consigliato un modello decisionale
Situazioni in cui è necessario generare testo, riassunti o spiegazioni richiedono un LLM tradizionale. Compiti che coinvolgono aritmetica esatta, conteggio o calcoli di date sono fuori portata di Jev; la sua “jaggedness guide” versione 1.13 segnala tutti questi casi. Inoltre, decisioni che influenzano direttamente le vite delle persone – ad esempio la selezione del personale – richiedono una valutazione più approfondita dei bias, come avverte Simon Willison.