Meta AI Rilascia Brain2Qwerty v2
Meta AI ha recentemente annunciato il rilascio di Brain2Qwerty v2, una tecnologia che decodifica frasi naturali da registrazioni cerebrali non invasive in tempo reale. I dati provengono da una misurazione effettuata con magnetoencefalografia (MEG) durante l'atto di digitare. Il sistema ricostruisce il testo digitato, fornendo un'alternativa all'implantazione e all'intervento chirurgico.
TL;DR
Brain2Qwerty v2 decodifica frasi scritte da segnali MEG non invasivi, alcanando un'accuratezza media del 61%. Per i partecipanti migliori, l'accuratezza può raggiungere il 78%. Il sistema si basa su un'architettura con componente convolutionale, transformatori e modelli linguistici di livello carattere.
Che Cos'è Brain2Qwerty v2
Brain2Qwerty v2 è un sistema che trasforma l'attività cerebrale in caratteri testuali, per poi costruire parole e frasi. Meta ha addestrato il modello su circa 22.000 frasi di nove volontari. Ogni partecipante ha trascorso 10 ore in sessioni di typing while MEG recordings have been taken into consideration.
I dati vengono registrati utilizzando un dispositivo MEG. Questo strumento mappa i campi magnetici prodotti dall'attività neuronale, con un'alta risoluzione temporale. Il modello sfrutta rappresentazioni a livello di carattere, parola e frase permettendogli di correggere gli errori locali con contesti più ampi.
È bene sottolineare che Brain2Qwerty è stato progettato come un esperimento e non come un dispositivo per il consumatore. Il modello è stato testato su un gruppo ristretto di volontari e i dati appartenenti al Centro di Ricerca sulla Cognizione, il Cervello e la Lingua (BCBL) in Spagna.
La Pipeline di Decodifica
I sistemi non invasivi precedenti si affidavano alle pipeline manuale per la rilevazione di eventi neurologici. Brain2Qwerty v1 ha sostituito questo approccio con un'apprendimento profondo a livello end-to-end. Secondo il repository di Meta, il modello si compone di tre part: un encoder convolutionale, un transformer e un linguaggio modello a livello carattere.
L'encoder riconosce i segnali MEP e impara caratteristiche direttamente da dati sperimentali invece di utilizzare rilevatori di eventi programmati. Il transformer strutturizza i dati temporali, mentre il modello linguistico a livello di carattere produce testi realistici.
L’Utilità della Tecnologia AI
Il team di ricerca di Meta descrive tre modi in cui l'AI ha reso possibile Brain2Qwerty v2. Ogni elemento riflette decisioni ingegneristiche riconoscibili. L'AI ha sostituito il rilevamento manuale di eventi con modelli di apprendimento automatico. L'addestramento a lungo raggio di modelli linguistici sfruttano rappresentazioni semantiche raffinate. Infine, agenti AI hanno continuato a perfezionare la pipeline di decodifica in modo iterativo.
Come Funziona in Pratica
Un modello linguistico addestrato rifiuta sequenze di caratteri che non formano parole genuine. In questo modo, spinge il decodificatore verso le frasi che un essere umano potrebbe digitare. Nell'architettura illustrativa, si osserva un modello che ripercorre le componenti descritte da Meta.
Ecco un frammento di codice illustrativo:
- Utilizzo di import torch
- Definizione della classe Brain2QwertySketch
- Encoder: utilizza Conv1d per l'encoding MEG
- Transformer: implementa una struttura temporale
- Testa livello carattere: produce output linguistico di bassa entropia
I Rilievi Accurati
Brain2Qwerty v2 raggiunge una media di accuratezza al 61%. Per il migliore partecipante, è stata ottenuta un'accuratezza di un 78%. Tuttavia, gli altri metodi non invasivi hanno raggiunto solo un 8% di accuratezza a livello di parole.
- Accuracy media (parola): 61% vs 8% per metodi non invasivi
- Rapporto di errore (WER): 39%
- Prestazioni per il partecipante migliore: 78% di accuratezza
- Metodo di registrazione: MEG
Questi dati provengono da un contesto controllato e non da studi clinici su pazienti con lesioni cerebrali.
Confronto tra v1 e v2
Brain2Qwerty v1 e v2 offrono misure diverse. La versione v2 ha un miglioramento in termini di rappresentazione del livello frasi e precisione parola a una misurazione del 61%:
- v1: 80% carattere; v2: 61% parola
- Metriche: v1 su carattere, v2 su parole e frasi
- Numero di partecipanti: v1 da 35 volontari a solo 9 in v2
- Decodifica a tempo reale: v2 permette la decodifica frasi a tempo reale
Applicazioni
L'obiettivo principale è la restituzione del dialogo. Sono milioni le persone affette da patologie che le impediscono di parlare o di muoversi.
- Invasive come la stimolazione elettromagnetica sono richieste ma limitanti
- Un decodificatore non invasivo potrebbe facilitare l'accesso a persone con disabilità
- I ricercatori possono utilizzare il codice fornito per esperimenti riproducibili
- Per gli ingegneri AI, il modello funge da schema per decodifica segnali biologici
- Gli scienziati dati possono prevedere precisione basata su volume dati
Pro e Contro
- Vantaggi: Migliora significativamente l'accuratezza parola da 8% a 61%
- Vantaggi: Usa apprendimento automatico end-to-end
- Flessibilità: Accuratezza cresce con dati addizionali
- Vantaggi: Codice di addestramento disponibile liberamente sotto licenza CC BY-NC 4.0
- Limite: Applicabile solo in contesti controllati e non in cliniche
- Limite: Non è un prodotto commerciale
- Limite: Applica solo ai seg