Sarvam AI ha rilasciato Saaras V4, la più recente generazione del proprio modello di riconoscimento vocale. Il nuovo modello copre tutte le 22 lingue indiane programmate più l'inglese, includendo ora accenti globali. Secondo le dichiarazioni di Sarvam, la precisione raggiunge lo stato dell'arte su ciascuna delle lingue supportate.
È pronto per la produzione?
Sì. Saaras V4 è accessibile subito tramite l’API di Sarvam, utilizzando il parametro model="saaras:v4". I pesi del modello non sono pubblici e la documentazione per l’auto‑hosting su SageMaker copre ancora solo la versione v3.
Che cosa contiene Saaras V4?
Il modello è basato su un’architettura encoder‑decoder. L’encoder audio converte la forma d’onda in embedding che conservano dettagli fonetici e acustici. Un adattatore di down‑sampling temporale accorpa la sequenza e la proietta nello spazio di embedding del linguaggio, consentendo di mantenere registrazioni lunghe entro il budget di contesto del decoder.
Il decoder è Sarvam‑3B, un modello ibrido di stato‑spazio da 3 billion di parametri, addestrato da zero internamente. Il decoder legge le caratteristiche audio insieme a un prompt testuale e genera la trascrizione in maniera autoregressiva, reinserendo ogni token prodotto come input per il token successivo.
Risultati dei benchmark
Inglese
Sarvam ha valutato il modello su sette dataset in lingua inglese. Sei provengono dall’Open ASR Leaderboard di Hugging Face: AMI, GigaSpeech, LibriSpeech clean, LibriSpeech other, SPGISpeech e VoxPopuli. Il settimo è il dataset indiano con accento “Svarah” di AI4Bharat. La valutazione utilizza il codice di normalizzazione della leaderboard. Saaras V4 registra il più basso Word Error Rate medio tra i modelli testati.
Lingue indiane (Indic)
Su Vistaar, Sarvam riporta risultati per 10 lingue indiane, misurati sia con WER sia con LLM‑WER. Quest’ultimo aggiunge un controllo semantico, distinguendo errori di significato da semplici varianti ortografiche o di formattazione tipiche degli script indic.
Audio rumoroso
Nel benchmark Kathbath Noisy, misurato con LLM‑WER, Saaras V4 riduce il tasso di errore a meno della metà rispetto a Deepgram Nova‑3 e GPT‑4o Transcribe. Il set comprende registrazioni compresse, tagliate e con forte rumore di fondo.
Identificazione della lingua
Su enunciati verificati di IndicVoices, l’errore di identificazione linguistica è del 2,9 % per le prime 10 lingue indiane e del 5,22 % su tutte le 22 lingue supportate.
Nota: tutti i numeri sopra sono riportati dal fornitore; non è ancora disponibile una riproduzione indipendente.
Cinque modalità di output da un unico modello
Lo stesso audio può restituire cinque rappresentazioni diverse, selezionabili tramite il parametro mode:
- transcribe (predefinito): script nativo con numeri e date normalizzati.
- verbatim: ogni parola pronunciata, inclusi riempitivi e numeri parlati.
- codemix: script nativo, ma le parole in inglese rimangono in inglese.
- translit: l’intera enunciazione in alfabeto latino.
- translate: traduzione in inglese con numeri normalizzati.
Sarvam sostiene che gestire queste varianti all’interno del modello elimina passaggi di post‑processing soggetti a errori.
Prompting con parole chiave (Keyterm Prompting)
La funzionalità di keyterm prompting è introdotta in V4 e funziona esclusivamente con saaras:v4. Si passa una lista JSON al campo keyterms, con fino a 50 termini lunghi al massimo 64 caratteri ciascuno. Le parole chiave influenzano il riconoscimento, senza però garantire l’output.
Per brand come PhonePe che devono rimanere in script latino, è consigliato utilizzare la modalità codemix.
Nel paper IndicContextEval (Interspeech 2026), Saaras V4 ottiene un WER del 16,03 % nella impostazione L5 di keyword‑prompting, il risultato più basso sul benchmark.
Streaming, audio lungo e prezzi
- Streaming: WebSocket con risultati parziali e tempo al primo token (time to first token) inferiore a 150 ms.
- REST: trascrizione sincrona per clip fino a 30 secondi.
- Batch: job asincroni fino a 2 ore per file, con diarizzazione speaker opzionale.
- SDK: supporto per Python 3.9+ e Node.js 18+, oltre a integrazioni con LiveKit Agents, Pipecat e Vercel AI SDK.
- Prezzo: Sarvam indica 30 ₹/ora per trascrizione in tempo reale, streaming e batch; 45 ₹/ora con diarizzazione.
Il modello predefinito rimane Saaras v3; V4 utilizza la stessa struttura di richiesta, quindi il passaggio richiede una sola riga di codice.
Saaras V4 vs concorrenti più vicini
Di seguito la comparazione con tre sistemi benchmarkati da Sarvam (dati estratti dalle documentazioni pubbliche dei fornitori al 26 settembre 2026):
- Lingue indiane programmate (di 22): Saaras V4 = 22; Deepgram Nova‑3 = 11; ElevenLabs Scribe v2 = 14; OpenAI GPT‑4o Transcribe = non specificato.