Introduzione

Negli ultimi decenni l’intelligenza artificiale ha rivoluzionato il modo in cui le lingue parlate vengono elaborate: traduzione automatica, dettatura e assistenti conversazionali sono diventati strumenti di uso quotidiano per chi sente. Tuttavia, più di 200 lingue dei segni esistenti e i circa 70 milioni di persone sorde o ipoudenti non hanno ancora beneficiato di queste innovazioni. Con SL2T (sign‑language‑to‑text) Google inaugura una svolta nella qualità e nella generalità della traduzione dei segni, portando la tecnologia fuori dal laboratorio e direttamente nei prodotti consumer.

Come funziona SL2T

SL2T trasforma i segni in testo in streaming, consentendo di “dettare” con le mani al proprio smartphone. Il modello interpreta i segni come una sequenza di punti di posa sul corpo del firmante e li converte direttamente in parole scritte, senza passare per le tradizionali “glosse” intermedie. Questo approccio elimina i limiti di vocabolario artificiale e permette alla qualità della traduzione di migliorare proporzionalmente all’aumento dei dati di addestramento.

Dati di addestramento

Il modello è stato costruito con una strategia centrata sull’utente e culturalmente informata, sfruttando una scala di dati senza precedenti:

    • oltre 100 000 ore di video e dati di pose
    • più di 50 lingue dei segni diverse, con circa il 25 % dei dati dedicati all’American Sign Language (ASL)
    • varietà di dialetti, livelli di competenza e contesti d’uso

Allenare simultaneamente su un ampio spettro di lingue e varianti ha consentito al modello di apprendere strutture sottostanti condivise, superando le prestazioni dei modelli monolingua nei test interni.

Privacy e sicurezza

Per proteggere la privacy degli utenti, SL2T non trasmette il video grezzo. Un modello on‑device (MediaPipe Holistic) individua i punti di riferimento del corpo e invia solo le coordinate geometriche al server di traduzione; il filmato originale viene eliminato immediatamente. In questo modo la tecnologia rispetta i più alti standard di riservatezza, riducendo al minimo i dati sensibili conservati.

Prestazioni e benchmark

Secondo i benchmark più autorevoli, SL2T è il modello di traduzione lingua‑segni più capace finora realizzato. Sul test FLEURS‑ASL (ASL → inglese) ottiene un punteggio zero‑shot di 70 BLEURT, decisamente superiore a qualsiasi risultato pubblicato precedentemente. Tuttavia, le metriche accademiche non sono l’unico criterio di valutazione: il team ha ottimizzato latenza in streaming, ridotto le allucinazioni su input non firmati, garantito l’equità per il 10 % di utenti mancini e migliorato la precisione nella firma con una sola mano, tipica quando si tiene il telefono con l’altra.

Le sfide tecniche della lingua dei segni

La traduzione dei segni presenta due difficoltà fondamentali rispetto alla trascrizione della voce:

    • Le lingue dei segni non sono semplici “parole in mano”; hanno grammatica e lessico propri, quindi richiedono una vera traduzione macchina, non una mappatura sequenziale segno‑parola.
    • Il modello deve “vedere” e comprendere movimenti fisici simultanei di mani, braccia, torso, testa e volto. Rilevare questi segnali a elevati frame rate è un compito di visione artificiale complesso e dispendioso.

Queste sfide spiegano perché le prime tecnologie, come i guanti per la lingua dei segni, erano intrinsecamente limitate: i guanti riducono la lingua dei segni a una semplice trascrizione di “inglese sulle mani”, ignorando la ricchezza dei movimenti corporei.

Coinvolgimento della comunità sorda

Il progetto è stato costruito “con la comunità sorda, non solo per essa”. Le prospettive sorde hanno guidato ogni fase, dalla concezione da parte di Sam Sepah, un dipendente sordo di Google, alla raccolta dati con partner sordi, fino alle valutazioni tramite studi con utenti sordi. Un esempio concreto è l’adozione di test di usabilità in cui i firmanti hanno confermato che firmare in ASL è più rapido, naturale e piacevole rispetto alla digitazione in inglese.

Governance responsabile: AISLAC

Per garantire una diffusione responsabile, è stato istituito l’AiSLAC (AI Sign Language Advisory Committee), un comitato consultivo che riunisce organizzazioni sorde globali ed esperti di settore. Attraverso questo modello partecipativo, le comunità più colpite influenzano direttamente le priorità di sviluppo. Il team ha co‑redatto un rapporto d’impatto congiunto per il rilascio di SL2T 1.0 in Gboard e Live Transcribe, descrivendo apertamente capacità e limitazioni attuali.

Impatto e prossimi passi

SL2T rappresenta solo l’inizio di una roadmap più ambiziosa. Gli obiettivi futuri includono:

    • estendere la copertura a ulteriori lingue dei segni oltre all’ASL
    • sviluppare la generazione di lingua dei segni (segno‑da‑video) per consentire conversazioni bidirezionali
    • integrare capacità AI di frontiera per migliorare la comprensione contestuale e la personalizzazione
    • standardizzare l’accesso tramite lingua dei segni in tutti i prodotti digitali

Disponibilità

Gli utenti possono sperimentare SL2T in Gboard e Live Transcribe a partire dal Pixel 11, con ulteriori dispositivi in arrivo senza costi aggiuntivi. L’esperienza è progettata per funzionare ovunque l’utente normalmente digiterà: ricerche web, messaggi, documenti o richieste a Gemini.

Ringraziamenti e crediti

Il lavoro è stato realizzato congiuntamente dai team di Google DeepMind e Android. Il team centrale che ha sviluppato il modello SL2T comprende:

    • Garrett Tanzer
    • Benoit Brard
    • Elizabeth Clark
    • Tim Dozat
    • Sebastian Ebert
    • Dan Garrette
    • Manfred Georg
    • Vicky Holgate
    • Shankar Kumar
    • Mohammad Saboorian