OpenAI ha annunciato il lancio di GPT-Live, una famiglia di modelli di voce in grado di parlare e ascoltare contemporaneamente in modo naturale. Questi modelli rappresentano un passo avanti nella capacità di interazione umano-AI, con l’obiettivo di consentire conversazioni reali, in tempo reale. La versione iniziale include due modelli principali: GPT-Live-1 e GPT-Live-1 mini. Essi sono stati testati e preferiti dagli utenti rispetto a sistemi precedentemente utilizzati, come l’Advanced Voice Mode.
Che cos’è GPT-Live?
Il modello GPT-Live si basa su un architettura full-duplex, in cui la voce e l’elaborazione si svolgono in parallelo. Questo permette al modello di parlare e ascoltare nello stesso momento, producendo espressioni spontanee come “mhmm” o “sì” durante le conversazioni. Quando sono necessari compiti complessi come ricerche online o ragionamento esteso, GPT-Live li delega a GPT-5.5, operando in background per mantenere l'interazione fluida.
Gli svantaggi dei modelli voice precedenti
- Sistemi a cascata: utilizzavano tre modelli separati (speech-to-text, LLM e text-to-speech) che causavano latenza elevata e frammentazione dei dati.
- Modelli a turno: migliorati in termini di latenza, ma con problemi nel rilevamento dei turni basati su silenzi, che potevano interrompere la conversazione in modo innaturale.
Le due architetture di GPT-Live
Per risolvere queste carenze, GPT-Live introduce due miglioramenti fondamentali:
1. Interazione continua con elaborazione full-duplex
Il modello elabora l'input e genera l'output in tempo reale, permettendo decisioni frequenti: parlare, ascoltare, interrompere o richiamare strumenti. Questo permette una conversazione fluida, simile a quella naturale e permette traduzioni in diretta.
2. Delega per compiti complessi
GPT-Live separa l'interazione costante con il ragionamento avanzato. Compiti che richiedono ricerche o decisioni complesse vengono passati a modelli come GPT-5.5 in background. Questo permette a GPT-Live di adottare nuovi modelli quando sono disponibili.
Valutazione e benchmark
OpenAI ha condotto test umani e automatizzati per valutare GPT-Live. In confronti diretti con l’Advanced Voice Mode, GPT-Live-1 e GPT-Live-1 mini sono stati fortemente preferiti. I parametri testati includono flusso conversazionale, interruzioni, tempi di risposta e naturalità. I risultati sui benchmark automatizzati mostrano:
- In GPQA, GPT-Live-1 mostra performance di alta qualità in ragionamenti scientifici.
- In BrowseComp, GPT-Live-1 eccelle in ricerche online agentive.
- Nel benchmark interno τ3-Voice Telecom, GPT-Live-1 supera le capacità multi-turn di supporto telecom.
Usi pratici e scenari di applicazione
GPT-Live ha numerose applicazioni:
- Aiuto senza mani libere: richiedere indicazioni o ricette cucina senza usare lo schermo.
- Pratica linguistica: conversazioni interattive con correzioni gentili.
- Traduzione in diretta: supporta traduzioni parlata durante colloqui bilaterali.
- Ricerca in movimento: porre domande complesse durante il tragitto.
- Flussi di supporto: mappe telecom multi-turn come nel benchmark τ³-Voice.
- Cerca visivamente: leggi informazioni su tempo, azioni o calcio in forma di schede.
Loop decisionale del full-duplex
OpenAI ha fornito un esempio illustrativo per comprendere il processo decisionale interno del modello. Un loop simula una conversazione tra GPT-Live e un modello di background. Anche se l’API non è ancora disponibile, questo insegnamento mostra come il modello prende decisioni rapide in base agli input dell’utente.
Limitazioni al lancio
OpenAI ha chiarito alcune carenze al momento del lancio:
- Video: non sono supportati in versione iniziale.
- Condivisione schermo: funzionalità non inclusa.
- Parità multilingua completa: non ancora operativa.
GPT-Live e il futuro dei modelli voice
L’arrivo di GPT-Live segna una svolta nella conversazione voice per l’AI. Con l’implementazione di tecnologie full-duplex e delega di compiti pesanti, OpenAI ha aperto la strada a un’interazione fluida e reattiva. Con il lancio su ChatGPT già oggi, e l’API in arrivo, OpenAI dimostra nuovamente di spingere i confini della tecnologia AI per avvicinarsi al comportamento umano.