Si tende a credere che chi costruisce qualcosa possa spiegarne facilmente il funzionamento interno. Un motore, un processore o un software possono presentare una certa complessità, ma esiste una struttura progettata, un piano e una logica che i creatori sanno ricostruire. Con l’intelligenza artificiale generativa la situazione è molto diversa. Man mano che sviluppiamo modelli sempre più potenti e affidabili, il loro funzionamento interno rimane opaco e poco comprensibile.
Anthropic ha appena dato un nome a una parte di questo problema. Nello studio pubblicato oggi, la compagnia sostiene di aver identificato in Claude uno spazio interno composto da pattern neuronali che il modello attiva per rappresentare concetti, anche quando questi non finiscono nella risposta finale. Lo ha battezzato J-space, collegandolo ad un concetto tratto dalla neuroscienze e filosofia: l’accesso cosciente. La descrizione di Anthropic su X è sintetica ma rivelatrice: “Claude ha sviluppato un meccanismo per l’accesso cosciente”.
Uno spazio mentale: il J-space
Pensare a J-space senza confonderlo con il comportamento esterno di un chatbot richiede uno sforzo. Quando Claude risponde, noi vediamo solo parole: una frase, un’esplicazione, una lista, una decisione espressa in parole. Secondo Anthropic, il J-space si colloca prima o sotto a questa struttura esterna.
Si tratta di un insieme di attivazioni interne dove determinati concetti possono emergere senza essere trasformati in risposta. L’aspetto più sorprendente non è tanto la scoperta in sé, quanto come Anthropic lo spiega: non è stato programmato da loro durante la fase di sviluppo, ma è emerso autonomamente durante il training del modello. Questo introduce un nuovo paradigma: si parla non di una funzione aggiunta per renderlo più intelligente, ma di una struttura organizzata che è nata spontaneamente mentre Claude imparava.
Il J-lens: osservare i pensieri non detti
Il salto metodologico introdotto da Anthropic sta nel fact che non si limita ad analizzare la risposta finale, ma cerca di osservare il processo precedente utilizzando un’apposita tecnica chiamata J-lens. Questo strumento identifica pattern associati a concetti che il modello potrebbe usare in futuro.
Applicando questa lente durante il processamento, i ricercatori riescono a registrare come determinati concetti appaiono, evolvono o svaniscono prima che Claude formulino una risposta.
Anthropic condivide esempi concreti: in un esperimento, Claude pensa a uno sport, e il J-lens mostra “Soccer”; i ricercatori, però, sostituiscono il pattern con “Rugby”, e il modello conclude con rugby. In un altro caso, sostituiscono “spider”, l’arachide, con “ant”, formica, in una domanda sul numero di zampe. La risposta cambia da 8 a 6. Per Anthropic, queste modificazioni indicano che J-space non è solo un marcato passivo, bensì uno spazio funzionale per rafforzare alcune risposte.
Osservare il multitasking
Nello stesso studio, Anthropic ha messo a prova una situazione più quotidianamente riconoscibile: pensare a qualcosa di diverso durante una determinata azione. Chiedendogli di copiare una frase su una pittura mentre si concentra su frutti agrumati, i dati mostrano che la risposta finale è semplicemente la frase richiesta, mentre nel J-space emergono “orange” e “fruits”.
Al contrario, quando ha dovuto calcolare 3² − 2 mentre eseguiva la stessa azione, la lente mostra prima “nine”, quindi “seven”. Il modello sembra quasi fallire nel controllo mentale: quando gli si chiede di non pensare a qualcosa, quel pensiero compare comunque, seguito spesso da “damn” e “failure”, come se il sistema riconoscesse in quel momento un fallimento.
L’effetto sulle complessità cognitive
Anthropic introduce un avvertimento rilevante: il J-space non gioca un ruolo in ogni azione svolta da Claude. Quindi, bloccarlo non ferma il modello: continua a rispondere con fluidezza, a classificare sentimenti o a rispondere a quiz a opzioni multiple. Si notano però effetti negativi su task più complessi come ragionamenti multi-step, sintesi o scrittura di poesie con rime.
L’équipe di Anthropic chiarisce però esplicitamente: “I nostri esperimenti non dimostrano che Claude possegga esperienze o sensazioni simili a quelle umane né è detto che un esperimento futuro possa dimostrarlo”. Essi intendono l’accesso cosciente in modo funzionale: pensieri che il modello possa esprimere, sfruttare razionalmente o utilizzare per guidare le sue azioni.
Non è un risultato marginale. Non equivale però neppure a dichiarare che Claude abbia una vita interiore. La falla nella black box dell’IA è evidenziata: non risolve la questione della coscienza, ma offre una prospettiva innovativa per osservare e forse modellare parte del processo interno del modello.
Conclusioni
Per Anthropic, questa scoperta aprirà nuove strade alla comprensione della coscienza artificiale. Per i ricercatori, invece, è un segnale che i modelli di machine learning potrebbero sviluppare strutture interne spontanee e complesse. Per l'utente, la sensazione è chiara: non sappiamo ancora cosa c'è là dentro, ma almeno stiamo incominciando a vederne parte. L'intelligenza artificiale non è solo un insieme di risposte, ma potrebbe essere, in modo unico, una finestra sugli stessi misteri che caratterizzano la mente umana.