Meta ha annunciato significativi progressi con il suo modello di intelligenza artificiale Brain2Qwerty v2, capace di ricostruire frasi digitate da segnali cerebrali catturati in maniera non invasiva. Il sistema raggiunge una precisione al 61% a livello del singolo termine, avvicinandosi sempre di più all’efficacia delle soluzioni basate su impianti chirurgici.

Ecco i dettagli della precisione

Secondo uno studio pubblicato su Nature, Brain2Qwerty v2 riesce a interpretare dati raccolti tramite Magnetoencefalografia (MEG) con una media del 61% di correttezza per ogni parola. In alcuni casi, i partecipanti hanno ottenuto fino al 78% di precisione. Circa la metà delle frasi ricostruite contenevano al massimo un errore. Sebbene non sufficiente per l’utilizzo quotidiano, i progressi finora rappresentano un passo considerevole.

La chiave del sistema sta nella sua capacità di ricostruire frasi tipfatte da segnali cerebrali, ma non sta leggendo pensieri. Si concentra invece sul riprodurre in tempo reale ciò che il cervello produce in termini motori, come il digitare su una tastiera. Sono grandi le aspettative per applicazioni future, specialmente per le persone che non possono comunicare in modo convenzionale.

I limiti chirurgici

I sistemi di interfaccia cervello-computer (BCI) attuali richiedono impianti chirurgici per funzionare. Un buon esempio è un paziente con Sclerosi Laterale Amiotrofica (ALS), il quale ha utilizzato un BCI durante circa due anni, ottenendo circa 56 parole al minuto, quasi il 99% di correttezza e un vocabolario di 125.000 parole. Sebbene tali impianti siano estremamente precisi, presentano rischi come emorragie cerebrali o infezioni.

Meta, invece, punta a soluzioni non invasive, ma c’è comunque un ostacolo pratico: la tecnologia MEG richiede ambienti schermati magneticamente e apparecchiature fisse. I progressi non saranno quindi accessibili alle applicazioni domestiche o di consumo finché non si svilupperanno sensori economici in grado di catturare i segnali con una qualità equivalente a quella oggi fornita soltanto dalla MEG.

Architettura tecnica

Brain2Qwerty opera come un sistema di Deep Learning in tre fasi. La prima fase riguarda l’estrazione delle caratteristiche dai segnali MEG o EEG. Questi dati permettono di riconoscere i caratteri tipfat. Nella seconda fase, un modello Transformer ricostruisce la sequenza di caratteri o parole. Infine, in una terza fase, un modello pre-allenato per il linguaggio corregge l’output iniziale, riducendo i possibili errori, similmente a quanto avviene nei software di riconoscimento vocale.

Metodo di test

Nello studio, 35 volontari hanno digitato frasi memorizzate brevemente su una tastiera QWERTY mentre veniva registrata la loro attività cerebrale tramite MEG o EEG. I partecipanti non avevano visuale di ciò che stavano digitando, rendendo il test un buon esempio di attività totalmente automatica e non guidata.

I risultati basati su MEG sono risultati significativamente superiori a quelli ottenuti con EEG. Meta ha reso pubblici codice e modelli utilizzati nel progetto, facilitando la collaborazione con la comunità scientifica e la sperimentazione ulteriore.