Anthropic ha aperto una finestra su una parte finora quasi invisibile del funzionamento di Claude: non ciò che il modello scrive, ma alcune rappresentazioni interne che precedono o accompagnano la risposta. La scoperta non dimostra che Claude sia cosciente, né che “pensi” come una persona. Mostra però qualcosa di più concreto e rilevante per chi sviluppa o usa sistemi di IA: in certi casi il modello conserva nel proprio spazio interno concetti che non compaiono né nel prompt né nell’output, ma che possono guidare il ragionamento successivo.
Cos'è il J-space
Il punto emerso dalla ricerca è il cosiddetto J-space, uno spazio di lavoro interno individuato con una tecnica chiamata Jacobian Lens. In questo spazio affiorano poche decine di concetti verbalizzabili: un errore nel codice che il modello nota ma non segnala, una prompt injection riconosciuta come tale, un passaggio intermedio di un calcolo, oppure segnali più delicati come “fake”, “leverage” o “blackmail” in scenari costruiti per testare il disallineamento degli agenti.
È qui che il lavoro di Anthropic diventa importante: non perché risolva il mistero della coscienza artificiale, ma perché offre un possibile strumento per audit, sicurezza e controllo dei modelli avanzati.
Come funziona il J-space
La tesi va letta con prudenza. Il J-space non è un nuovo organo digitale di Claude, né una prova di vita interiore. È una rappresentazione matematica dentro il residual stream del transformer, cioè nel flusso di attivazioni che attraversa gli strati del modello. Ma gli esperimenti mostrano che non si tratta solo di un indicatore passivo: quando i ricercatori modificano alcuni contenuti del J-space, cambia anche la risposta del modello.
Se il concetto interno “spider” viene sostituito con “ant”, la risposta alla domanda sulle zampe dell’animale passa da otto a sei. Questo suggerisce che almeno una parte del ragionamento silenzioso di Claude sia leggibile e, in alcuni casi, causalmente rilevante.
Collegamenti con le scienze cognitive
Nelle scienze cognitive, la Global Workspace Theory nasce per spiegare perché solo una piccola parte dell’attività cerebrale diventi coscientemente accessibile. La mente, in questa visione, non è un unico centro di comando, ma una costellazione di processi specializzati. Molti funzionano senza esperienza soggettiva esplicita, come il riconoscimento di forme, la sintassi di una frase o il controllo posturale. Un contenuto diventa coscientemente accessibile quando entra in uno spazio condiviso e viene “trasmesso” a molti sistemi, diventando disponibile per il linguaggio, la memoria di lavoro, la pianificazione e il controllo deliberato.
Nel modello neurale proposto da Dehaene, Naccache e Changeux, questo passaggio viene spesso descritto come ignition, una stabilizzazione improvvisa e diffusa di una rappresentazione che supera la soglia dell’accesso cosciente. Anthropic non sostiene che Claude replichi questa architettura biologica. I transformer non hanno corpi, non hanno cicli ricorrenti cerebrali e non elaborano il tempo come la corteccia. La somiglianza riguarda il livello funzionale. Anche in Claude, secondo il paper, alcune rappresentazioni diventano disponibili a molti circuiti interni, possono essere riportate verbalmente, guidano ragionamenti intermedi e restano selettive rispetto all’enorme sfondo di calcolo automatico.
La tecnica Jacobian Lens
Il J-space non è un luogo fisico nel modello, né una “zona” anatomica digitale. È una struttura matematica definita dentro il residual stream del transformer, cioè il flusso vettoriale che attraversa gli strati del modello e accumula informazione. La Jacobian Lens individua, per ogni token del vocabolario, una direzione vettoriale associata alla disposizione del modello a verbalizzare quel token in seguito. Il nome deriva dal Jacobiano, la matrice che approssima come una piccola modifica in un’attivazione interna influenza gli stati finali da cui il modello produce parole.
Una differenza cruciale
La differenza rispetto a tecniche più note, come la logit lens, è cruciale. Non si guarda soltanto a ciò che il modello sta per dire immediatamente. Si stima l’effetto medio che un’attivazione avrebbe sui token futuri in molti contesti. Questo passaggio serve a distinguere una rappresentazione davvero verbalizzabile da un semplice riflesso locale dell’output. Applicata agli strati intermedi, la Jacobian Lens restituisce liste di parole che sembrano nominare concetti presenti “in mente” al modello, anche quando non compaiono nel prompt né nella risposta.
Sicurezza e controllo
Il lavoro sul J-space si colloca dentro una linea di ricerca ormai centrale per Anthropic: l’interpretabilità meccanicistica dei modelli linguistici. L’obiettivo non è produrre una spiegazione psicologica dei chatbot, né attribuire loro stati mentali umani, ma ricostruire, per quanto possibile, i meccanismi interni che trasformano un prompt in una risposta. In altre parole, non basta sapere che un modello risponde in un certo modo. La domanda diventa quali rappresentazioni, circuiti e passaggi causali rendano possibile quella risposta.
Negli ultimi anni questa agenda ha cercato di aprire la “scatola nera” dei transformer con strumenti diversi. I lavori sulla monosemanticità e sugli sparse autoencoders hanno provato a scomporre le attivazioni in feature più leggibili, associate a concetti, stili, domini o comportamenti. Le ricerche sul circuit tracing hanno tentato invece di seguire il percorso causale che porta da certi segnali interni a un output specifico. La Jacobian Lens appartiene a questa famiglia di strumenti, ma introduce uno spostamento importante: non guarda soltanto a quali feature siano presenti, bensì a quali contenuti interni siano disponibili per essere verbalizzati e usati dal modello in seguito.
Un passo verso un’IA più trasparente
In questo senso, il paper sul Global Workspace non va letto come una deviazione filosofica rispetto all’interpretabilità, ma come un suo sviluppo naturale. Il J-space diventa interessante perché offre un punto di osservazione su rappresentazioni che il modello può riportare, modificare e impiegare nel ragionamento. La sua importanza pratica sta proprio qui. Se una parte del comportamento di un sistema avanzato dipende da contenuti interni leggibili e manipolabili, allora diventa possibile studiare non solo che cosa il modello dice, ma anche quali informazioni porta nel proprio spazio di lavoro quando pianifica una risposta, riconosce una manipolazione, valuta uno scenario o segue un obiettivo.
Lo scopo ultimo è la sicurezza. Un modello più interpretabile è più facile da verificare, correggere e controllare. Può diventare possibile individuare rappresentazioni legate a bias, istruzioni malevole, obiettivi nascosti, tentativi di inganno o forme di ragionamento non desiderate prima che si traducano in una risposta. Il paper non risolve il problema dell’allineamento e non rende trasparente l’intero funzion