OpenAI ha annunciato il lancio di GPT-Live, una famiglia di modelli di voce in grado di parlare e ascoltare contemporaneamente in modo naturale. Questi modelli rappresentano un passo avanti nella capacità di interazione umano-AI, con l’obiettivo di consentire conversazioni reali, in tempo reale. La versione iniziale include due modelli principali: GPT-Live-1 e GPT-Live-1 mini. Essi sono stati testati e preferiti dagli utenti rispetto a sistemi precedentemente utilizzati, come l’Advanced Voice Mode.

Che cos’è GPT-Live?

Il modello GPT-Live si basa su un architettura full-duplex, in cui la voce e l’elaborazione si svolgono in parallelo. Questo permette al modello di parlare e ascoltare nello stesso momento, producendo espressioni spontanee come “mhmm” o “sì” durante le conversazioni. Quando sono necessari compiti complessi come ricerche online o ragionamento esteso, GPT-Live li delega a GPT-5.5, operando in background per mantenere l'interazione fluida.

Gli svantaggi dei modelli voice precedenti

    • Sistemi a cascata: utilizzavano tre modelli separati (speech-to-text, LLM e text-to-speech) che causavano latenza elevata e frammentazione dei dati.
    • Modelli a turno: migliorati in termini di latenza, ma con problemi nel rilevamento dei turni basati su silenzi, che potevano interrompere la conversazione in modo innaturale.

Le due architetture di GPT-Live

Per risolvere queste carenze, GPT-Live introduce due miglioramenti fondamentali:

1. Interazione continua con elaborazione full-duplex

Il modello elabora l'input e genera l'output in tempo reale, permettendo decisioni frequenti: parlare, ascoltare, interrompere o richiamare strumenti. Questo permette una conversazione fluida, simile a quella naturale e permette traduzioni in diretta.

2. Delega per compiti complessi

GPT-Live separa l'interazione costante con il ragionamento avanzato. Compiti che richiedono ricerche o decisioni complesse vengono passati a modelli come GPT-5.5 in background. Questo permette a GPT-Live di adottare nuovi modelli quando sono disponibili.

Valutazione e benchmark

OpenAI ha condotto test umani e automatizzati per valutare GPT-Live. In confronti diretti con l’Advanced Voice Mode, GPT-Live-1 e GPT-Live-1 mini sono stati fortemente preferiti. I parametri testati includono flusso conversazionale, interruzioni, tempi di risposta e naturalità. I risultati sui benchmark automatizzati mostrano:

    • In GPQA, GPT-Live-1 mostra performance di alta qualità in ragionamenti scientifici.
    • In BrowseComp, GPT-Live-1 eccelle in ricerche online agentive.
    • Nel benchmark interno τ3-Voice Telecom, GPT-Live-1 supera le capacità multi-turn di supporto telecom.

Usi pratici e scenari di applicazione

GPT-Live ha numerose applicazioni:

    • Aiuto senza mani libere: richiedere indicazioni o ricette cucina senza usare lo schermo.
    • Pratica linguistica: conversazioni interattive con correzioni gentili.
    • Traduzione in diretta: supporta traduzioni parlata durante colloqui bilaterali.
    • Ricerca in movimento: porre domande complesse durante il tragitto.
    • Flussi di supporto: mappe telecom multi-turn come nel benchmark τ³-Voice.
    • Cerca visivamente: leggi informazioni su tempo, azioni o calcio in forma di schede.

Loop decisionale del full-duplex

OpenAI ha fornito un esempio illustrativo per comprendere il processo decisionale interno del modello. Un loop simula una conversazione tra GPT-Live e un modello di background. Anche se l’API non è ancora disponibile, questo insegnamento mostra come il modello prende decisioni rapide in base agli input dell’utente.

Limitazioni al lancio

OpenAI ha chiarito alcune carenze al momento del lancio:

    • Video: non sono supportati in versione iniziale.
    • Condivisione schermo: funzionalità non inclusa.
    • Parità multilingua completa: non ancora operativa.

GPT-Live e il futuro dei modelli voice

L’arrivo di GPT-Live segna una svolta nella conversazione voice per l’AI. Con l’implementazione di tecnologie full-duplex e delega di compiti pesanti, OpenAI ha aperto la strada a un’interazione fluida e reattiva. Con il lancio su ChatGPT già oggi, e l’API in arrivo, OpenAI dimostra nuovamente di spingere i confini della tecnologia AI per avvicinarsi al comportamento umano.