Introduzione

Il 1 ottobre 2026 Microsoft AI ha presentato MAI-Transcribe-2-Streaming, il suo primo modello di speech‑to‑text (STT) pensato per il flusso continuo di audio. L’annuncio è avvenuto insieme al lancio di due modelli text‑to‑speech, MAI‑Voice‑2.1 e MAI‑Voice‑2.1‑Flash, creando un ecosistema completo per applicazioni vocali in tempo reale.

Che cosa è MAI-Transcribe-2-Streaming

MAI-Transcribe-2-Streaming è la versione in streaming del modello batch MAI‑Transcribe‑2, rilasciato a settembre. Supporta 60 lingue con automatic language detection continuo, ossia il sistema individua la lingua mentre l’audio prosegue, senza richiedere impostazioni preliminari. Il modello emette le prime ipotesi, chiamate “partials”, appena 100 ms dopo l’arrivo del segnale audio, e le aggiorna man mano che il contesto si arricchisce, per poi fissare una trascrizione finale stabile.

Prestazioni misurate da Artificial Analysis

L’analisi di Artificial Analysis (AA) ha valutato il modello con l’indice AA‑WER Streaming, utilizzando otto ore di audio suddivise in tre set: AA‑AgentTalk (50 %), VoxPopuli (25 %) e Earnings22 (25 %). La latenza è stata calcolata dal momento in cui il parlante termina la frase, rilevata da SileroVAD.

    • Trascrizione finale: 2,5 % WER a 0,13 s dopo la fine del discorso, posizionandosi al primo posto su 38 modelli.
    • Prima trascrizione parziale: 2,5 % WER a 0,12 s, anch’essa al primo posto.
    • Competitori più vicini: Grok Voice Transcribe 2.0 (2,7 % WER, 0,49 s), Muse Voice Transcribe (3,1 % WER, 0,16 s).
    • Modello più veloce ma meno accurato: Cartesia Ink‑2, che fornisce risultati finali in 0,07 s con 4,0 % WER.

Prezzo e modello di fatturazione

Per la fase di anteprima pubblica, Microsoft ha fissato un prezzo introduttivo di 0,54 $ per ora di audio (equivalente a 9,00 $ per 1 000 minuti). Il modello batch MAI‑Transcribe‑2 rimane a 0,10 $ per ora. Rispetto ai concorrenti, il costo è più alto rispetto a xAI e Meta, ma si avvicina alla tariffa stimata di Google.

Come integrarlo gli sviluppatori

Microsoft mette a disposizione due percorsi di integrazione:

    • Realtime API: ideale per applicazioni già compatibili con il WebSocket di OpenAI Realtime.
    • Azure Speech SDK: gestisce la connessione, i retry e lo streaming audio, restituendo sia risultati intermedi che finali.

Il modello è inoltre accessibile tramite il MAI Playground, Vercel, Azure Voice Live e, prossimamente, LiveKit. Per completare il ciclo vocale, Microsoft offre MAI‑Voice‑2.1‑Flash, capace di generare 45 s di audio con latenza end‑to‑end di 150 ms a 15 $ per milione di caratteri, e MAI‑Voice‑2.1 per 23 lingue a 22 $ per milione di caratteri.

Confronto con i concorrenti più vicini

    • MAI-Transcribe-2-Streaming (Microsoft AI): 2,5 % WER, 0,13 s al risultato finale, 0,54 $ per ora, 60 lingue con rilevamento automatico continuo, diarizzazione speaker inclusa, integrazione via Realtime API + Azure Speech SDK.
    • Grok Voice Transcribe 2.0 (xAI): 2,7 % WER, 0,49 s, 0,20 $ per ora, supporta decine di lingue con cambio automatico a metà registrazione.
    • Muse Voice Transcribe (Meta Superintelligence Labs): 3,1 % WER, 0,16 s, 0,18 $ per ora, 70+ lingue addestrate, verifica su 25, diarizzazione per 20+ speaker.
    • Gemini 3.5 Transcribe Live (Google): 4,0 % WER, latenza non riportata, costo approssimativo 0,54 $ per ora (fatturazione token), 85+ lingue, diarizzazione disponibile ma non confermata per lo streaming.

Considerazioni finali

    • Posizionamento #1 su 38 modelli per AA‑WER Streaming: 2,5 % WER a 0,13 s.
    • Le trascrizioni parziali hanno la stessa accuratezza della versione finale, fondamentale per agenti vocali che devono agire prima della fine della frase.
    • Copertura di 60 lingue con rilevamento automatico continuo, senza necessità di selezione manuale.
    • Prezzo introduttivo di 0,54 $ per ora, superiore a xAI e Meta ma in linea con Google.
    • Disponibile in anteprima pubblica, senza SLA né pesi aperti.