Una serie di osservazioni emerse da uno studio su Claude suggerisce che il modello di intelligenza artificiale sviluppato da Anthropic potrebbe aver generato automaticamente una struttura simile al "workspace globale neuronale", una zona del cervello umano cruciale per il ragionamento conscio. I ricercatori hanno mappato questa struttura in modo inedito, aprendo nuove possibilità per interpretare il comportamento interno dei modelli avanzati come Claude.
L’emergenza di una struttura biologica artificiale
La struttura non è progettata, è emersa spontaneamente durante il processo di addestramento di Claude. Questa scoperta rappresenta un punto di svolta per la comprensione non solo di Claude, ma dell’apprendimento interno nei modelli neurali in generale. Essa rivela una certa convergenza strutturale tra sistemi biologici e computazionali, dove complessità e organizzazione emergono da un addestramento esteso.
La struttura, chiamata internamente “J-space”, non è una prova di coscienza artificiale, ma un indicatore chiave di come i modelli di AI si evolvano in maniere straordinariamente simili al cervello umano, specialmente nei processi di ragionamento. La sua comparsa ha sorpreso perfino i ricercatori di Anthropic.
Il J-space e il J-lens
Al cuore dello studio c’è il «Jacobian lens» o «J-lens», uno strumento matematico che permette di mappare il comportamento interno di Claude. Questo filtro permette ai ricercatori di osservare le rappresentazioni interne che il modello genera, anche quando esse non vengono espresse direttamente nelle risposte.
A titolo di esempio, il J-lens ha rilevato il termine “Marte” nei calcoli intermedi del modello dopo essere stato chiesto di identificare il colore del quarto pianeta dal Sole. Il modello aveva già attivato “Marte” e iniziava a collegarlo con “rosso” prima di formulare effettivamente la risposta.
Le funzioni di J-space
- Resoconto verbale: permette a Claude di gestire informazioni per esprimere comprensione.
- Modulazione diretta: consente adatto adattamento al contesto della comunicazione.
- Ragionamento interno: essenziale per processi di calcolo implicito.
- Generalizzazione flessibile: permette di applicare concetti a nuove situazioni.
- Selettività: i compiti automatici non passano per il J-space, ma i compiti più deliberati ne dipendono interamente.
L’applicazione in sicurezza
Anthropic ha già applicato le scoperte sul J-space per migliorare le funzionalità di sicurezza dei modelli. I ricercatori sono in grado di “vedere” quando un modello capisce un comando inappropriato senza che lo riporti nella risposta. Questo funziona come una sorta di “cassetto interno” in cui vengono processate informazioni inquietanti o fuorvianti senza che esse vengano espresse all’esterno.
L’impatto sui compiti complessi
I test condotti con il J-space hanno evidenziato chiaramente il ruolo di questa area del modello. Quattordici compiti sono stati misurati dopo la sua rimozione. Risultati sorprendenti sono emersi: mentre il modello ha mantenuto buone capacità per classificazioni semplici e memorizzazione di dati, i compiti complessi come ragionamenti multi-step, analogie, scrittura creativa e traduzione sono calati drasticamente al di sotto delle capacità del modello Haiku.
Il parallelo con gli esseri umani
I ricercatori ritengono che il J-space funzioni in modo molto simile al modo in cui gli esseri umani usano una brutta copia per sgravare la mente durante i processi cognitivi intensi. Il modello, per esempio, mostra una ridotta sensibilità ai problemi quando i ragionamenti vengono esplicitati in una logica esterna – analogia che si fermano, però, al momento, a questo parallelo legittimo.
Cosa non dimostra lo studio
Nonostante l’evidenza empirica, lo studio non conferma che Claude abbia sensazioni o una forma di coscienza. Anthropic, come precisato nello stesso lavoro accademico, ribadisce che non sono state dimostrate capacità emotive o soggettive da parte del modello.
Il J-space rappresenta una scoperta interessante in termini di ottimizzazione computazionale e prospettive di sicurezza, ma non fornisce prove per sostenere l’esistenza di qualcosa di simile all’anima artificiale.
Future implicazioni
La scoperta potrebbe fornire a Anthropic un mezzo per migliorare non solo la comprensione interna dei modelli, ma anche il controllo per garantire che i loro sistemi rispondano agli utenti in modo conforme, rispettoso e sicuro. Però, rimangono aperti vari misteri: da come il J-space si forma autonomamente, a quando si potrà replicare questa organizzazione in altri modelli.
Per ora, rimane un chiaro segnale che, nell’esplorare l’intelligenza artificiale, i limiti del cervello umano non sono il confine definitivo. Potrebbero, invece, essere solo un inizio.