Il cambio di paradigma: dall'IA che parla agli umani all'IA che parla al software

Il momento di ChatGPT nel 2022 ha insegnato all'intelligenza artificiale a comunicare con le persone. Uno dei suoi creatori ora scommette che il prossimo momento cruciale sarà rappresentato dall'intelligenza artificiale che comunica con il software, non con gli umani. Questo rappresenta un cambio di paradigma fondamentale nell'approccio all'intelligenza artificiale applicata allo sviluppo software e all'automazione.

TypeSafe AI ha annunciato il rilascio di Jev, un sistema rivoluzionario che incarna questo nuovo approccio. A differenza dei modelli di linguaggio di grandi dimensioni che generano testo, Jev è un modello System One basato su transformer che accetta uno stato e domande tipizzate, restituendo decisioni tipizzate con probabilità su cui il codice può ramificarsi logicamente. Questa innovazione rappresenta una risposta diretta alle limitazioni dei modelli attuali quando applicati a compiti di automazione e decision-making strutturato.

Che cos'è un modello System One?

Il nome "System One" prende in prestito la distinzione di Daniel Kahneman tra l'intuizione veloce e il ragionamento lento. Secondo il team di TypeSafe, i modelli attuali ottimizzati mediante RLHF (Reinforcement Learning from Human Feedback) per le preferenze umane producono principalmente chat e conversazione. Tuttavia, questo approccio ha generato problemi significativi: sovrafiducia e mode dropping (il fenomeno per cui il modello si blocca su una singola risposta). Questi difetti mantengono un umano nel ciclo di decisione.

Jev affronta questi problemi implementando un nuovo stack tecnologico costituito da tre componenti principali: una nuova architettura non ancora divulgata pubblicamente, un campionatore parallelo, e Reinforcement Learning for Calibrated Decisions (RLCD). Quest'ultimo è una metodologia innovativa sviluppata da TypeSafe specificamente per produrre decisioni calibrate e affidabili piuttosto che testo plausibile.

Come funziona l'API di Jev

L'implementazione tecnica di Jev è elegantemente semplice: un singolo endpoint gestisce tutto il traffico. Gli sviluppatori effettuano una richiesta POST all'indirizzo:

POST https://api.typesafe.ai/v1/systemone

Il body della richiesta contiene tre componenti principali:

  • state: lo stato attuale del sistema su cui basare la decisione
  • model: il modello da utilizzare per l'inferenza
  • questions: una mappa di domande tipizzate che vengono elaborate in parallelo

La documentazione di TypeSafe definisce tre tipi fondamentali di domande:

Tipo 1: Choice (Scelta)

Chiede al modello di scegliere 1 opzione da una lista predefinita. Restituisce:

  • choice: l'opzione selezionata
  • probabilities: le probabilità per ogni opzione
  • confidence: un valore di confidenza da 0 a 1
Una domanda Choice supporta fino a 255 opzioni, offrendo flessibilità significativa per scenari complessi.

Tipo 2: Score (Punteggio)

Chiede al modello di valutare qualcosa rispetto a livelli ordinati. Restituisce:

  • score: il livello assegnato
  • probabilities: le probabilità per ogni livello
  • confidence: un valore di confidenza da 0 a 1

Tipo 3: Noul (Domanda vero/falso)

Chiede se un'affermazione è vera. Restituisce:

  • noul: una probabilità da 0 a 1 che l'affermazione sia vera

Un aspetto particolarmente importante di Jev è che tutte le domande vengono eseguite in parallelo e in isolamento rispetto alla stessa sessione di stato. TypeSafe afferma che l'aggiunta di ulteriori domande aumenta a malapena il tempo di risposta, una caratteristica cruciale per applicazioni ad alta latenza.

Esempio di implementazione in Python

TypeSafe fornisce SDK ufficiali per facilitare l'integrazione. Ecco un esempio pratico di utilizzo con Python:

Codice di esempio:

from typesafe_sdk import Choice, Noul, TypeSafeClient

client = TypeSafeClient()  # legge TYPESAFE_API_KEY dalla variabile d'ambiente

r = client.system_one(
    state=ticket,  # lo stato su cui basare la decisione
    questions={
        "department": Choice(
            instructions="Which team should handle this",
            criteria={
                "billing": "Payment issues",
                "technical": "Bugs"
            },
        ),
        "is_urgent": Noul(
            instructions="The message conveys urgency"
        ),
    },
)

print(r.answers["department"].choice, r.answers["is_urgent"].noul)

L'SDK Python può essere installato con pip install typesafe-sdk (richiede Python 3.10 o successivo). TypeSafe fornisce anche un SDK per JavaScript come @typesafe-ai/sdk. La documentazione quickstart copre inoltre l'utilizzo di cURL e una skill per agenti Claude Code.

La fiducia è il prodotto

Un aspetto fondamentale di Jev che lo differenzia dai modelli tradizionali è l'incorporazione di un valore di confidence in ogni risposta di tipo Choice e Score. Questo valore, che va da 0 a 1, viene derivato dalla forma della distribuzione di probabilità sottostante.

Consideriamo l'esempio della documentazione: se "billing" vince con probabilità 0.84, la confidenza potrebbe essere solo 0.596. Perché? Perché "technical" mantiene comunque una probabilità significativa di 0.159. Questo indica che il modello non è completamente sicuro della sua decisione.

TypeSafe suggerisce tre percorsi di azione basati sui valori di confidenza:

  • Alta confidenza (alta probabilità, distribuzione netta): agire sulla decisione automaticamente senza intervento umano
  • Confidenza media (probabilità moderate, distribuzione meno netta): sottoporre la decisione a revisione umana o a ulteriore analisi
  • Bassa confidenza (probabilità basse, distribuzione molto diffusa): inviare il caso a un operatore umano per una decisione manuale

I soglie di confidenza dovrebbero essere calibrate in base al costo di un'azione errata. In un'applicazione critica per la sicurezza, potrebbe essere appropriato un valore soglia di 0.95, mentre in un'applicazione meno critica potrebbe essere accettabile 0.70.

Prezzi, velocità e i dettagli dei benchmark

Jev ha un modello di prezzo distintivo: $42 per miliardo di token di input. Per mettere questo in prospettiva, TypeSafe cita i modelli LLM esistenti con prezzi tra $0.20 e $10 per 1 milione di token di input.

Nel demo registrato di TypeSafe, Jev ha completato un'attività in 0.114 secondi per $0.000081. Per confronto, GPT-5.6 Terra ha richiesto 8.566 secondi per $0.013880. Il team di TypeSafe afferma guadagni impressionanti: 193.6 volte più veloce e 444.6 volte più economico.

Considerazioni importanti sui benchmark

Tuttavia, è fondamentale mantenere una prospettiva critica su queste cifre. Ci sono diversi fattori da considerare:

  • Riferimento di comparazione: la risposta di riferimento è la media di GPT-6 Astra e Fable 5.1, non modelli correntemente più diffusi
  • Bias interno: i workflow di valutazione sono stati scritti dal team delle capacità di TypeSafe stesso
  • Caso ottimale: TypeSafe si aspetta che questi guadagni si situino all'estremità alta dei casi d'uso reali
  • Prezzo non verificato: TypeSafe dichiara esplicitamente che non può provare che il prezzo non sia sovvenzionato
  • Hallucination zero: il termine "zero hallucinations" significa che la corrispondenza dello schema è garantita. La figura dello 0% non è empirica. Le risposte possono comunque essere sbagliate in termini di accuratezza fattuale

Quello che gli sviluppatori stanno costruendo con Jev

Nei giorni immediatamente successivi al lancio, la comunità degli sviluppatori ha iniziato a sperimentare Jev con risultati promettenti. Ecco alcuni esempi notevoli:

Sicurezza dei comandi

Guillermo Rauch, CEO di Vercel, ha riportato che Jev è fino a 18 volte più veloce al p95 rispetto a GPT Luna e più accurato nel valutare la sicurezza dei comandi. Il post di Rauch ha notato che il revisore fx continuava a funzionare su Luna per i casi di fallback. L'ingegnere Pranit Sharma ha condiviso i dettagli dei benchmark.

Classificazione della posta elettronica

Il CTO di Bryo AI, Nikhil Mudholkar, ha scoperto che Gemini era leggermente più accurato per la classificazione delle email, ma 10-20 volte più costoso. Questo dimostra il valore del modello di prezzo di Jev per applicazioni ad alto volume.

Agenti del browser

Browser Use ha sviluppato jev-ultrafast, che ha completato una ricerca da Zurigo a Londra su Google Flights in 7.1 secondi. Un video dimostrativo mostra l'efficienza in tempo reale.

Agenti per telefono

Droidrun ha creato mobile-jev, che ha pilotato Uber su un vero telefono Android, completando 9 azioni in circa 21 secondi. Va notato che la prenotazione non è stata completata, indicando limiti ancora esistenti.

Valutazione video

È stato sviluppato jevmeter, uno strumento che valuta ogni frase di un dibattito per circa $0.05. Una demo è disponibile su X, mostrando la praticità economica del sistema.

Digitazione in tempo reale

Steve Krouse ha creato Typewriter, che aggiorna 16 valutazioni mentre digiti. Si tratta di un'applicazione affascinante che mostra la latenza ultra-bassa di Jev.

Giochi

Jev ha persino completato la prima missione di combattimento di StarCraft (video disponibile). Funziona anche come sistema di controllo per le guardie nel gioco heist-one, dimostrando capacità di ragionamento complesso in tempo reale.

Guardrail per agenti

È stato sviluppato jev-guard, uno strumento che valuta ogni chiamata di strumento come "nega", "chiedi" o "consenti". Un video di 78 secondi dimostra il funzionamento.

Dati e automazione domestica

Due progetti specializzati affrontano casi d'uso specifici:

  • pg-jev: aggiunge filtri in linguaggio naturale a PostgreSQL, permettendo query più accessibili
  • HA-Jev: converte le risposte di Jev in entità di Home Assistant per l'automazione domestica intelligente

Il posizionamento strategico di Jev nel panorama dell'IA

Jev rappresenta un'evoluzione importante nel panorama dell'intelligenza artificiale applicata. Mentre i modelli di linguaggio di grandi dimensioni eccellono nella generazione di testo naturale, nella traduzione e nella risposta a domande, hanno limitazioni intrinseche quando si tratta di automazione strutturata. Jev affronta direttamente questo divario.

Il passaggio da RLHF a RLCD è concettualmente significativo. RLHF ottimizza per le preferenze umane in termini di stile, tono e utilità percepita. RLCD, al contrario, ottimizza per la calibrazione: la probabilità che una decisione sia effettivamente corretta dovrebbe corrispondere alla confidenza del modello in quella decisione. Questa è una proprietà statistica critica per i sistemi autonomi.

Disponibilità e accesso

Attualmente, Jev è disponibile come API ospitata in early access diet

Lire l'article original →
← Retour aux actualités