Introduzione
La scorsa settimana TypeSafe AI ha presentato Jev, il suo primo modello System One. Il fondatore Diogo Almeida, ex ricercatore di OpenAI sul training di istruzioni per ChatGPT, descrive Jev come un “decision engine” che non conversa, non scrive codice e non riassume, ma elabora stato non strutturato restituendo decisioni tipizzate con probabilità calibrate.
Questa caratteristica lo rende particolarmente adatto a gestire le migliaia di piccole valutazioni che compongono un ciclo agente: scegliere quale modello invocare, verificare la sicurezza di un comando, determinare la rilevanza di un passaggio o confermare che l’agente abbia terminato il compito.
Come funziona Jev
Ogni chiamata a Jev invia uno stato – testo o JSON – insieme a un dizionario di domande tipizzate. Le domande vengono valutate in parallelo rispetto allo stesso stato in un’unica richiesta, restituendo per ciascuna una risposta strutturata.
Il training di Jev avviene mediante Reinforcement Learning for Calibrated Decisions (RLCD), un metodo che allinea la fiducia delle risposte con la loro accuratezza.
Primitivi fondamentali
TypeSafe definisce tre primitive di base:
- Choice: sceglie un’opzione da una lista, restituisce la probabilità per ogni opzione e un valore di confidenza.
- Score: valuta lo stato su una scala ordinata (rubrica) e fornisce probabilità e confidenza per ciascun livello.
- Noul: indica la probabilità (da 0 a 1) che una affermazione sia vera.
Tutte le primitive supportano un massimo di 255 opzioni per Choice. La capacità di gestire più domande contemporaneamente riduce drasticamente la latenza.
Prestazioni e benchmark
Le affermazioni chiave di TypeSafe sono 193,6× più veloce e 444,6× più economico rispetto ai flussi di lavoro tradizionali, basate su valutazioni interne. I confronti sono stati effettuati usando GPT‑6 Astra e Fable 5.1 come riferimento.
Nel test “Banking77” su OpenRouter, Jev ha raggiunto l’81,0 % di accuratezza, 13 volte più veloce rispetto a Claude Opus 5 e a un costo circa 1/22 rispetto al concorrente.
20 casi d’uso agentici per Jev
Routing e orchestrazione
- Model routing: utilizza Score per valutare la difficoltà della richiesta e indirizzarla verso un modello veloce o potente; implementazione disponibile in LangChain come ModelRouterMiddleware.
- Skill selection: il “skill suggestion cookbook” sceglie al massimo una skill tra 182 catalogate da Nous Research’s Hermes, usando solo 2 richieste.
- Typed function calling: il “function calling cookbook” mappa richieste di trading in linguaggio naturale a nomi di funzione e argomenti chiusi, filtrati per confidenza.
Ticket triage e routing di intenti
- Una singola chiamata restituisce dipartimento, frustrazione e urgenza; il pattern “intent routing” dirige la richiesta verso logica deterministica, un LLM specializzato o un operatore umano.
Sicurezza e guardrail
- Tool‑call risk gating: pi-warden valuta se un comando bash, write o edit è irreversibile o fuori tema, distinguendo “db:reset” dopo “reset the database” da “db:reset” dopo “add a column”.
- Read‑only auto‑approval: jev-auto-approve è un hook per Claude Code che approva solo se la probabilità supera 0,95; nella calibrazione pubblicata non ha approvato nessuno dei 8 comandi che modificano lo stato.
- Secret‑leak guard: jev-secret-guard blocca tutti i 6 segreti testati e non segnala falsi positivi su stringhe innocue.
- Prompt‑injection screening: nel “RAG passages cookbook”, la similarità coseno ha ordinato un’iniezione di prova al primo posto (0,584); Jev l’ha valutata con 0,99 e l’ha scartata.
- LLM input e output guardrails: il “guardrails cookbook” imposta soglie di probabilità di rischio per passare, revisionare, bloccare o deviare ogni messaggio.
Recupero e grounding
- Reranking: su 40 query legali CLERC, il “reranking cookbook” ha aumentato la precisione top‑1 dal 5 % al 18 % e la top‑10 dal 38 % al 62 %.
- Citation verification: il “citation check cookbook” usa una singola Choice per decidere se una sezione di fonte supporta, contraddice o è neutra rispetto a una affermazione.
Controllo di computer, browser e tempo reale
- Browser agents: “Browser Use’s Jev Ultrafast” sceglie operazione ed elemento DOM in una singola richiesta, completando una ricerca su Google Flights in circa 7,1 secondi.
- Desktop computer use: typesafe-computer-use esegue OCR dello schermo macOS e consente a Jev di classificare l’azione successiva per circa $0,0002 per passo.
- Mobile agents: “Mobile Jev” decide ogni tap su Android, raggiungendo la schermata di pagamento Uber in circa 21 secondi e 9 azioni.
- Real‑time game agents: la demo “Doom” di TypeSafe esegue circa 10 query al secondo, costando circa $7 all’ora su stato di gioco strutturato.
Qualità dell’agente e memoria
- Loop stagnation detection: ProgressGate valuta la traiettoria del ciclo, restituendo CONTINUE, WARN, REPLAN o HALT.
- “Done” claim verification