Interfaze, una startup sostenuta da Y Combinator, ha da poco rilasciato un nuovo modello open-source per il riconoscimento vocale, battezzato 'diffusion-gemma-asr-small'. Questo modello sfrutta un'architettura non autoregressiva, in particolare il meccanismo di differimento diffusion, una tecnica innovativa rispetto alle tradizionali architetture basate su modelli generativi sequenziali.

Che cos’è diffusion-gemma-asr-small?

Il modello diffusion-gemma-asr-small si basa su DiffusionGemma, un modello di 26 miliardi di parametri sviluppato da Google. DiffusionGemma è una versione di una rete "Moltiprofessional-Expert", che sfrutta 128 esperti attivabili, con routing top-8, in grado di generare testo tramite diffusion piuttosto che tramite approccio autoregressivo.

Mentre la maggior parte dei modelli di diffusion utilizza lo schema assorbente, DiffusionGemma utilizza una tecnica di diffusion basata su token casuali uniformi. Questo approccio consente di generare testo in parallelo, anziché in modo sequenziale.

Interfaze ha incluso il riconoscimento vocale in questo modello, pur mantenendolo come modello testuale. Il modello non riceve direttamente input audio ma utilizza un adattatore formato da circa 42 milioni di parametri, per la conversione degli audio in testo. Il modello congelato (backbone) viene scaricato separatamente.

Architettura e funzionamento

Piuttosto di passare il segnale audio al modello LLM come input diretto, Interfaze ha optato per un utilizzo diverso di DiffusionGemma. Il modello ha sperimentato inizialmente l’utilizzo diretto di waveforms, ma questo ha fallito per la mancanza di esperienza del modello con audio.

Il design implementato prevede l’utilizzo di un encoder "whisper-small", che funziona solo come estrattore di feature, non come decodificatore. In questo schema, whisper-small converte i 30 secondi di audio in 1500 frame. Ogni frame contiene informazioni acustiche a 768 dimensioni. Queste feature sono poi composte in un vettore ridotto tramite un modulo "projector".

Sono utilizzati strati convoluzionali che riducono le dimensioni per un fattore di 8 e una mappa lineare. L’output finale è una sequenza di 188 token acustici con 2816 dimensioni. Questi token vengono distribuiti nei slot riservati per l’audio del modello DiffusionGemma, grazie a un’applicazione di adattatori LoRA che permette al backbone di focalizzarsi sui nuovi input.

Istanza di training

Le prime istanze di training hanno mostrato un problema ricorrente: il modello non era in grado di associare la trascrizione audio alle parole corrette, inoltre non riusciva a ottenere alcun gradiente significativo sul proiettore. Questo problema ha portato ad un addestramento inibito con la perdita di dati che si è mantenuta piuttosto alta.

L’approccio di "proiezione diretta" ha risolto questa problematica. Il team ha applicato una perdita CTC (Connectionist Temporal Classification) ai token audio per addestrare il modello ad associare i feature audio alle parole corrette. Questo ha portato ad un rapido miglioramento delle prestazioni.

Prestazioni e benchmark

Il modello ha dato risultati interessanti sugli standard benchmark, incluso LibriSpeech, FLEURS e VoxPopuli. Di seguito un confronto rispetto ad altri modelli non autoregressivi:

    • TransFusion (2022) - Diffusion multinomial: WER ~6–7% (proof-of-concept)
    • Whisfusion (Agosto 2025) - Diffusion con Whispher-large-v3: WER 8.3%
    • diffusion-gemma-asr-small (2026) - Diffusion con Whispher-small: WER 6.6%

Rispetto ai modelli autoregressivi, però, esiste un gap prestazionale che il team attribuisce alla scarsità di dati, non all’architettura.

    • Whisper-small (Wer 3.4%) è più performante su LibriSpeech
    • Whisper-large-v3 (Wer 2.0%) mostra ulteriore vantaggio sugli altri modelli

I test hanno dimostrato che i passi di denoising non influiscono significativamente sulle prestazioni, con una curva di performance quasi piatta. Inoltre, il modello converge in circa 8 passaggi paralleli, rendendo il tempo di elaborazione molto efficiente.

Utilizzo e casi pratici

I pipeline per la trascrizione su larga scala beneficiano del decodificatore in parallelo di questo modello. Il costo computazionale non dipende dalla lunghezza dell'audio ma dal numero di passaggi di denoising applicati. Questo rende i modelli estremamente scalabili per l'elaborazione in batch.

    • Multi-lingua: supporta inglese, tedesco, francese, spagnolo, hindi, mandarino con un adattatore singolo.
    • R&S (Ricerca e Sviluppo): fornisce una baseline riproducibile per esperimenti futuri, ad esempio espandibili con token audio o encoder più grandi.

Guida all’utilizzo

Per utilizzare il modello, basta scaricarlo da Hugging Face Hub. Il modello include i seguenti file: adattatore, model.py, audio.py e inference.py. Per supportare DiffusionGemma, è necessario l’ultimo branch da GitHub:

Scarica il modello come:

    • Adattatore (~170 MB) con `snapshot_download("interfaze-ai/diffusion-gemma-asr-small")`
    • Modulo di inferenza da `inference.py`

Un esempio di utilizzo in Python:

```python

import sys, soundfile as sf

from huggingfacehub import snapshotdownload

repo = snapshot_download("interfaze-ai/diffusion-gemma-asr-small") # adapter, ~170 MB

sys.path.insert(0, repo)

from inference import load, transcribe

Loads frozen DiffusionGemma-26B + whisper-small + this adapter.

model, tok, fe = load(f"{repo}/diffusionasrsmall.pt", device="cuda")

wav, sr = sf.read("audio.wav") # 16 kHz mono float32

print(transcribe(wav, model, tok, fe, max_steps=16))

```

L’utilizzo da riga di comando funziona all’interno del repository scaricato:

```bash

python inference.py audio.wav

```

Il modello funziona con licenze distintive: DiffusionGemma è rilasciato sotto termini Gemma, whisper-small sotto MIT.

Conclusione

L'uscita open-source di diffusion-gemma-asr-small rappresenta un avanzamento significativo nel settore dei modelli ASR. L’utilizzo di DiffusionGemma apre la strada a una trascrizione di audio parallela e altamente efficiente, con una base estendibile a ulteriori lingue o miglioramenti in chiave Ricerca e Svilup