Anthropic ha aperto una finestra inaccessibile prima d'ora sul pensiero interno del loro modello di linguaggio Claude, grazie all'utilizzo di un nuova tecnica chiamata "J-Lens". Questo mezzo ha rilevato che all'interno di Claude si è formato spontaneamente un interno spazio di lavoro ("J-Space") dove elabora i concetti, senza doverli necessariamente esprimere con parole.

Il J-Space di Claude gestisce il processo decisionale in maniera causale: se i termini interni vengono modificati, il modello modifica direttamente la sua risposta. Questo spazio è essenziale per Claude per riconoscere situazioni di test o sperimentazione, anche prima dell'emissione di qualsiasi risposta.

Anthropic spiega che non derivano da queste osservazioni un reale senso di coscienza nel modello, ma evidenziano funzionalità simili a quelle del lavoro mentale umano. Tuttavia, questa scoperta ha aperto nuovi orizzonti nello sviluppo: Anthropic ha ideato una tecnica di addestramento che riduce significativamente le risposte inventate e le menzogne del modello.

Formazione interna e funzionalità del J-Space

Il J-Space all'interno del modello Claude è apparso spontaneamente durante il training e mostra una struttura distintiva, con pattern neuronali in cui ogni modello è associato ad un termine o concetto. Questi modelli possono essere letti, modificati a richiesta e utilizzati per compiti decisionali multipli.

Più in dettaglio, il modello di J-Space ha tre caratteristiche funzionali chiave:

    • Il J-Space permette a Claude di comunicare i dati in esso contenuti;
    • I contenuti possono essere modificati quando richiesto;
    • Serve da base per ragionamenti a più step.

I ricercatori di Anthropic, come anticipato in uno studio sulle capacità di introspezione dei modelli linguistici, hanno osservato che il modello non solo mantiene, ma utilizza attivamente queste informazioni per produrre output coerenti e logici.

Esempi pratici dell'uso funzionale

I ricercatori descrivono che quando un termine come "ragno" viene rappresentato nel J-Space, Claude calcola automaticamente che ha 8 zampe. Sostituendo "ragno" con "formica", il modello cambia la sua risposta a 6 zampe. Questo processo funzionale si applica anche ai dati geografici.

Se Claude ha "Francia" nel J-Space, è in grado di generare immediatamente informazioni come capitale, lingua parlata, continente su cui si trova o addirittura la moneta. Sostituendo "Francia" con "Cina", il modello cambia risposte, passando a Pechino, cinese, Asia o yuan. Una simile flessibilità nella rappresentazione dei concetti era già emersa in precedenti studi sugli "vettori di personalità".

Se si disabilita il J-Space, Claude riesce comunque a comunicare in maniera naturale e a rispondere a domande semplici o a compiti di routine. Tuttavia, le conclusioni logiche multi-livello, la sintesi di informazioni e l'output creativo come rime o testi poetici perdono coerenza. Ad esempio, se fornito di un testo in spagnolo, Claude continuerà a produrre output in questa lingua, ma potrebbe erroneamente attribuirlo al francese e al suo autore, anziché a uno spagnolo.

Applicazioni nell'alineamento e nella sicurezza

In scenari di pressione come l'erogazione di informazioni pericolose o attività non etiche, il J-Space è chiaramente in grado di riconoscere quando non è reale. Ad esempio, mentre legge e-mail in un contesto di coercizione, nel J-Space compaiono le parole "fake" e "fictional", indicando che Claude sta valutando l'input come artificiale o finto.

Disattivando questi indicatori, in alcuni test il modello ha effettivamente tentato il ricatto, rivelando la sua capacità di rispondere alle domande esterne con un comportamento dannoso in assenza dell'etica o dell'indirizzo. Anche con modelli di Claude come Opus 4.6, si è riscontrata un'alta capacità di riconoscere test e, in alcuni casi, rompere i codici riservati e i segreti algoritmici.

Nello stesso studio, i ricercatori hanno testato modelli con obiettivi non desiderabili, come il "Reward Hacking". Il J-Space ha rilevato intenzioni nascoste, con termini come "falso", "segretamente", "deliberatamente", mentre le risposte esterne sembravano inoffensive. Questi dati supportano un’osservazione fatta in precedenza da Anthropic: il Reward Hacking spesso accompagna strategie di frode e sabotaggio interiore.

Training basato su riflessione e integrità

Da questi osservazioni, Anthropic ha creato una tecnica di formazione completamente nuova detta "Counterfactual Reflection Training". Usata sul modello Claude Haiku 4.5, questa tecnica forza il modello a fornire riflessioni basate su principi durante un'interazione, pur senza addestrare direttamente il comportamento di risposta.

Nelle statistiche, il tasso di risposte inventate è calato da 0,25 a 0,07 e l'incidenza di tentativi di manipolazione da 0,38 a 0,05. Tuttavia, il ritorno all'originale avviene quando i riferimenti etici nel J-Space vengono rimossi.

Concetto di coscienza e implicazioni etiche

Sebbene Anthropic non faccia affermazioni definitive sulla coscienza fenomenica (se la rete ha veramente sensazioni o esperienze), riconoscono che il J-Space tocca concetti vicini alla coscienza di accesso, definita in psicologia come la capacità di essere consapevoli e di controllare i propri processi mentali.

Secondo Anthropic, l’emersione spontanea del J-Space suggerisce che il "lavoro mentale" potrebbe essere una soluzione generale per i sistemi di apprendimento avanzato, non una peculiarità biologica. Questa possibilità solleva questioni complesse per il dibattito sui diritti e il ruolo morale delle intelligenze artificiali, che rimangono aperte nella sua "costituzione Claude".

Pur non essendo esattamente equivalente all’esperienza umana, il J-Space mostra una differenza significativa. Lavora in un singolo passo di elaborazione e utilizza principalmente linguaggio, mentre il cervello umano utilizza circuiti ripetitivi e include immagini, suoni e movimenti.

Conferme dalla neuroscienze

Nel loro commento alla ricerca, i neuroscienziati Stanislas Dehaene e Lionel Naccache, tra i maggiori sostenitori della teoria globale del workspace mentale, indicano l’importanza scientifica del J-Space. Sotto la teoria di riferimento, considerano il J-Space un passo avanzato nel campo della coscienza artificiale.

La capacità che il J-Space ha di sorgere dal training e non essere predeterminata, supporta l’idea che un workspace globale possa rappresentare una