Dal momento in cui è entrata in funzione, la versione ChatGPT Voice non ha mai potuto parlare e ascoltare al contempo: era un processo turni basato su pause e riprese. Ora, con il modello GPT-Live, OpenAI introduce un sistema full-duplex grazie al quale il modello ascolta e parla in tempo reale, senza attese. GPT-Live non aspetta una pausa ma lavora in modo continuo sull’audio, decidendo istantaneamente quando parlare e quando ascoltare. Risposte corte, come un semplice «Mhmm», e vere interruzioni sono ora parte integrante del confronto con il modello.

Architettura Evoluta

La funzione ChatGPT Voice, lanciata nel 2023, si basava su di una pipeline in tre tappe: convertiva l’audio in testo, generava una risposta testuale e poi parlava. Nell’Advanced Voice Mode introdotto nel 2024 questa architettura è stata sostituita da un’unica catena end-to-end, riducendo la latenza e migliorando la fluidità ma mantenendo il funzionamento basato su turni. Con GPT-Live si passa a un modello in cui non c’è più bisogno di aspettare la fine di un’interlocuzione per parlare di nuovo.

Delega In Background

Oltre al full-duplex, GPT-Live introduce una novità chiave per rendere le conversazioni più fluide: la delega di compiti reattivi in background. Quando l’utente chiede qualcosa che richiede ricerca online o ragionamento avanzato, GPT-Live passa i dettagli ai modelli di elaborazione (come GPT-5.5), permettendo al dialogo stesso di proseguire senza interruzioni. L’utente ha a disposizione tre livelli specifici per il tipo di domande: istantanee, medie e complesse, affrontate in base alle esigenze del modello.

Le performance di GPT-Live si confrontano in modo significativo rispetto al modello precedente. In test interni, il 75,7 per cento dei tester ha preferito GPT-Live-1 rispetto a Advanced Voice Mode, mentre il 69,2 per cento ha scelto GPT-Live-1 mini. In benchmark scientifici, GPQA mostra un incremento delle risposte corrette da 45,3 a 84,2 per cento. Analogamente, in BrowseComp (benchmark relativo alla ricerca online), le risposte aumentano da 0,7 a 75,2 per cento.

Gestione Proattiva E Sicurezza

Per la sicurezza, OpenAI ha implementato una gestione proattiva dei rischi. GPT-Live non attende la moderazione post interazione ma interviene in tempo reale se necessario: modifica il dialogo, offre risorse o, in casi estremi, interrompe la conversazione. I modelli destinati ai minori integrano da subito comportamenti adatti all’età, offerti direttamente dall'algoritmo. I genitori hanno controlli personalizzati tramite funzioni di blocco. In situazioni di pericolo, GPT-Live attiva un supporto adatto alla situazione, incluso il collegamento diretto a linee di ascolto specializzate.

Differenza Rispetto Alla Realtime API

Va specificato che GPT-Live non deve essere confuso con la Realtime API lanciata da OpenAI nel 2024. La Realtime API rappresenta una struttura aperta a scopo sviluppo e non è disponibile come funzione diretta per gli utenti finali. La Realtime API opera in maniera turn-based e si differenzia da GPT-Live per obiettivi e accesso privilegiato ad essa.

Limitazioni E Funzionalità Non Disponibili Al Lancio

Al momento del lancio, GPT-Live manca di alcune funzioni presenti precedentemente con Advanced Voice Mode, come la condivisione video e lo screenshot durante le conversazioni vocali. OpenAI specifica inoltre che in alcune lingue meno comuni potrebbe verificarsi un accento fuori luogo o interruzioni nella voce, causate da problemi di riconoscimento linguistico.

Disponibilità

    • GPT-Live-1 è il modello standard, riservato agli abbonamenti Pro (Go, Plus, Pro).
    • GPT-Live-1 mini è una variante ridotta, disponibile gratuitamente.
    • Il nuovo modello è compatibile con dispositivi iOS, Android e con l’applicazione ChatGPT.com.