OpenAI ha annunciato l'introduzione di GPT-Live, un'intera classe di nuovi modelli KI progettati per interazioni vocali in tempo reale. Questo avanzato sistema permette a ChatGPT di parlare e ascoltare simultaneamente, creando conversazioni più simili a un dialogo tra persone, grazie a una architettura full-duplex innovativa.
Disponibilità e varianti
GPT-Live è ora disponibile in due versioni: GPT-Live-1 per gli utenti abbonati (Go, Plus, Pro) e GPT-Live-1 mini per gli account gratuiti. Il nuovo sistema è supportato su iOS, Android e ChatGPT.com. I developer API potranno accedere al modello mediante una breve registrazione tramite un form ufficiale.
Un modello con architettura full-duplex
Differente dalla modalità vocale tradizionale, in cui l’utente parla e la KI risponde, GPT-Live permette alla KI di parlare e ascoltare in contemporanea. Questo funziona in modo simile a una conversazione tra due persone, con interruzioni, paushe di ascolto e feedback verbali come "mhmm" o "capito".
OpenAI ha realizzato uno studio comparativo dove l'80 percento degli utenti ha espresso una preferenza per GPT-Live in tutti i casi di test. La percentuale risulta del 75,7 per GPT-Live-1 e del 69,2 per GPT-Live-1 mini.
Ricchezza di nuove funzionalità
- La possibilità di visualizzare durante le chiamate informazioni visive su argomenti come meteo, risultati sportivi o quote azionarie.
- Stili di voce rivisti per offrire un suono più naturale.
- Un aggiornamento che include funzionalità audio come video e screen sharing, previsto in un prossimo futuro.
Nel frattempo, le vecchi versioni (Voice Mode avanzato e Standard) rimangono comunque in servizio.
Delega di compiti complessi a GPT-5.5
La caratteristica più significativa di GPT-Live è la capacità di delegare ad un modello sottostante (GPT-5.5 al lancio) compiti complessi come ricerche web o attività logiche. Questa separazione permette a GPT-Live di mantenere la conversazione in corso, mentre GPT-5.5 compie il ragionamento necessario in background.
Gli utenti possono inoltre definire il livello di ragionamento che ChatGPT deve utilizzare per rispondere: Instant per risposte rapide, Medium per domande complesse con un tempo moderato e High per domande che richiedono una meditazione più approfondita.
Risultati nei test
- Nel test GPQA per ragionamento scientifico, GPT-Live-1 mostra una precisione del 84,2% con il livello di ragionamento “High”, rispetto al 45,3% del Advanced Voice Mode.
- Il modello migliora significativamente negli test per ricerche web agentive, con una performance del 75,2% rispetto ad appena 0,7% del Advanced Voice Mode.
- Persino la mini variante, nonostante la sua limitata potenza, raggiunge una percentuale di precisione del 31,6%.
Supporto in tempo reale in contesti professionali
Nel test interno di telecomunicazioni tau3-Voice-Telecom, GPT-Live-1 ha risolto circa il 65% degli scenari di supporto al cliente in 385 secondi medi, rispetto a soli 30% per il Advanced Voice Mode, anche se con un tempo simile.
Con il livello di ragionamento “Instant”, GPT-Live-1 raggiunge il 37% delle risposte corrette in una media di 225 secondi, offrendo quindi una soluzione più rapida.
Sicurezza avanzata
OpenAI ha implementato misure di sicurezza in tempo reale per evitare interazioni pericolose. Il sistema è in grado di:
- Correggere il modello verso risposte più sicure;
- Mostrare informazioni di avvertimento durante il parlato;
- Interrompere la conversazione in caso di rischio;
- Offrire numeri di supporto in caso di emergenze;
- Includere protezioni speciali per gli utenti giovani, con controlli parental per limitare l'accesso.
Per assicurare l'immagine, GPT-Live non imiterà mai voci reali, ma utilizzerà solo quelle preregistrate previste.
Approfondimenti sulla sicurezza
OpenAI ha pubblicato una "System Card" dove descrive tutte le misure adottate per gestire il rischio di umanizzazione pericolosa, riconducendolo a casi con dati concreti e risultati scientifici.
Un passo avanti nella competizione KI
GPT-Live rappresenta un progresso significativo nella conversazione umano-KI, integrando le capacità full-duplex con un modello sottostante di alto livello. Il modello dimostra un’efficacia tecnica superiore ai predecessori, soprattutto in scenari reali e complessi.
Chi è interessato
Questo modello si rivolge a:
- Utenti finali che desiderano conversazioni con assistente vocale più naturali;
- Aziende che cercano soluzioni di supporto clienti avanzate;
- Developer che sperimentano con nuovi modelli di interazione;
- Ricercatori interessati a benchmark per modelli KI.
La prossima frontiera delle interazioni vocali sta arrivando, grazie alla combinazione di intelligenza artificiale e architetture moderne. OpenAI, con GPT-Live, si pone nuovamente in testa a questa rivoluzione.