OpenAI ha recentemente rilasciato due nuovi modelli nel suo API per il supporto vocale in tempo reale. Si tratta di gpt-realtime-2.1 e gpt-realtime-2.1-mini, entrambi concepiti per offrire esperienze interattive audio e multimediali con bassa latenza. Questi modelli sono particolarmente adatti per agenti vocali, con un'enfasi sull'efficienza e sulla velocità rispetto ai modelli precedenti.

Che cos'è GPT-Realtime-2.1-mini?

Il modello gpt-realtime-2.1-mini è un'opzione compatta progettata per interazioni con la voce in tempo reale. Risponde in tempo reale a input audio o testi attraverso una connessione attiva, fornendo una soluzione veloce ed economica. OpenAI lo presenta come un'alternativa più leggera rispetto agli altri modelli, ma non per questo meno importante, grazie alla sua flessibilità e costi ridotti.

Il modello Realtime API utilizza un solo modello per processare e generare audio, eliminando la necessità di concatenare sistemi separati per conversione vocale in testo (speech-to-text) e testo in audio (text-to-speech). Questa struttura riduce la latenza e mantiene la coerenza nel trattamento delle voci.

Capacità centrali del modello

La funzione chiave del modello è il ragionamento. Questo consente al modello di "pensare" internamente prima di parlare e di eseguire funzioni o tools (chiamate esterne a funzioni definite). Insieme, il ragionamento e l'uso di strumenti permettono al modello mini di pianificare un passo, eseguire una funzione e fornire risposte appropriate.

Il modello maggiore e il suo ruolo

L'altro modello, gpt-realtime-2.1, rappresenta uno sviluppo migliorato rispetto al predecessore GPT-Realtime-2. Esso offre riconoscimento alfanumerico migliorato, gestione migliorata di rumore e silenzio, e una migliore gestione delle interruzioni. Supporta inoltre il passaggio vocale diretto (speech-to-speech) con configurazioni diversificate per il ragionamento, la seguente istruzioni e l’uso degli strumenti.

Suggerimento veloce per scelta dei modelli

    • Usa gpt-realtime-2.1 quando si richiede il massimo nel ragionamento in tempo reale, nell’uso dello strumento, nella seguente istruzione e nella gestione voce.
    • Usa gpt-realtime-2.1-mini quando desideri un’alternativa più veloce ed economica.

Perché il ragionamento e l'uso degli strumenti sono importanti

I sistemi vocali spesso si bloccano durante le chiamate di funzione. Il modello inizializza una chiamata funzione, rimane silenzioso e l'utente pensa che la chiamata non abbia funzionato, interrompendo il dialogo. In questo sistema il modello invece emette un'introduzione verbale prima di agire, mantenendo coerenza nel flusso delle richieste a multi-passo.

Impostazioni di sforzo di ragionamento

Lo sforzo di ragionamento può essere configurabile su diversi livelli: minimo, basso, medio, alto e xalto. Per la maggior parte degli agenti vocali di produzione, OpenAI consiglia iniziare con il livello basso per mantenere bassa latenza. Gli livelli superiori influiscono sulla latenza e sul consumo di token di output.

Miglioramenti della latenza e della cache

La coda di latenza al 95° percentile (p95) si riferisce al 95° percentile del tempo di risposta. La riduzione della latenza di almeno un 25% migliora significativamente le esperienze con il suono in tempo reale. Questi miglioramenti sono ottenuti grazie ad una migliore cache.

La cache migliora non solo la latenza ma anche il costo. Gli token di input in cache vengono fatturati con un prezzo molto inferiore. Per gpt-realtime-2.1-mini, la quota dell’input audio in cache è scesa a $0,30 per 1M, rispetto ai $10 di input audio fresco.

Prezzi e confronto

Capacità / Prezzo (per 1M) gpt-realtime-2.1 gpt-realtime-2.1-mini gpt-realtime-mini (antecedente)
Ragionamento Sì (sforzo configurabile) No
Utilizzo strumenti / Chiamata funzioni
Input testo $4.00 $0.60 $0.60
Input testo in cache $0.40 $0.06 $0.06
Output testo $24.00 $2.40 $2.40
Input audio $32.00 $10.00 $10.00
Input audio in cache $0.40 $0.30 $0.30
Output audio $64.00 $20.00 $20.00
Input immagini $5.00 $0.80 $0.80
Input immagini in cache $0.50 $0.08 $0.08

Appllicazioni e casi d’uso

Ricezione clienti: Un utente chiama segnalando un errore di fatturazione. Il modello mini esegue il ragionamento a