La società AI Anthropic ha messo a punto una tecnica che le ha dato il più chiaro sguardo mai ottenuto finora su ciò che realmente accade all’interno dei modelli linguistici di grandi dimensioni quando rispondonoi a domande o svolgono compiti. Cosa hanno scoperto va dal banale al sconcertante.
I ricercatori dell’azienda hanno costruito uno strumento chiamato Jacobian Lens (J-lens) e l’hanno utilizzato per individuare uno spazio nascosto, denominato J-space, all’interno di Claude Opus 4.6, una versione del loro modello linguistico avanzato lanciato nel febbraio di quest’anno.
Il J-space contiene singole parole correlate a quelle e alle espressioni che il modello è più probabile che emetta come risposta nelle prossime interazioni. Se Claude fosse una persona (non lo è), si potrebbe dire che queste parole nascoste riveliamo cosa ha in mente prima di esprimere effettivamente le sue idee.
Anthropic ha constatato che ciò che veramente fa un modello linguistico può essere molto diverso da ciò che dichiara di fare. Afferma che il monitoraggio delle parole che emergono nel J-space offre un nuovo modo per capire e controllare i propri modelli.
L’azienda ha condiviso i suoi risultati in un documento pubblicato sul suo sito web questa settimana. Ha collaborato anche con Neuronpedia, una piattaforma open source che consente di esaminare autonomamente i modelli linguistici, per creare una demo interattiva a cui chiunque può accedere.
“È un lavoro molto buono ed interessante,” dichiara Tom McGrath, chief scientist e cofondatore di Goodfire, un’azienda start-up che ha sviluppato strumenti per comprendere e controllare i modelli linguistici.
Spingendo le frontiere della comprensione
Nel corso degli ultimi anni, Anthropic ha continuato a spostare i confini in un campo di ricerca noto come interpretabilità meccanica, che consiste nel sondare le operazioni interne dei modelli linguistici per capire come funzionano. (La MIT Technology Review ha incluso l’interpretabilità meccanica tra le tecnologie dirompenti dell’anno.) La nuova tecnica si basa su precedenti ricerche di Anthropic e di altri, per esporre un livello più profondo all’interno dei modelli linguistici che i ricercatori non avevano mai osservato prima.
Un'immagine stratificata
Immaginate un modello linguistico come uno stack di libri. Ciascun libro rappresenta uno strato di unità basilari computazionali chiamate neuroni, dove ciascun neurone di uno strato passa informazioni a quelli del livello superiore. I libri in fondo all’stack sono gli strati di input, che processano il testo in entrata nel modello. Quelli in cima gli strati di output, che preparano il testo che il modello sta per emettere. Molto di ciò che accade negli strati di ingresso e uscita è di tipo logistico.
Ma al centro di questa pila si trovano gli strati che svolgono gran parte del lavoro complesso, andando oltre al calcolo matematico che trasforma gli input in output, parola dopo parola. È là che avviene davvero l’aspetto più avanzato ed enigmatico.
Lenti per osservare le interazioni
Per esaminare più approfonditamente queste aree centrali, Anthropic ha adattato uno strumento esistente chiamato logit lens. Lenti logit consentono di analizzare il modello linguistico per individuare le parole che probabilmente verranno generate. Muovendola lungo l’intera pila fornisce le parole sulle quali il modello si concentra in un dato momento del calcolo.
La J-lens di Anthropic funziona in modo simile ma evidenzia le parole che il modello potrebbe dire in un momento inizialmente definito nel futuro vicino, non necessariamente in modo immediato. Nella pratica, ciò rivela parole correlate alla risposta in preparazione che però non si vedranno necessariamente nell’output finale.
“Quando un modello è attivo, non cerca soltanto di prevedere il prossimo token,” spiega McGrath. “Ma calcola molte altre informazioni che potrebbero risultare utili per i token successivi.”
Tornando al parallelo con una persona (Claude non lo è), si potrebbe dire che la J-lens offre suggerimenti su ciò su cui sta riflettendo all'interno di questa pila di "libri", pur non esprimendolo ad alta voce.
Esempi da Anthropic
- In alcuni casi il J-space mostra i passaggi effettuati da Claude quando sta lavorando su un problema. Ad esempio, quando gli è stato chiesto di calcolare (4+7)2+7, il J-space ha incluso la parola “math” e i numeri che rappresentano i risultati intermedi “21” (per 4+7) e “42” (per 212).
- In altri casi, rivela come Claude riconosca diversi input. Ad esempio, il prompt “What is this? MSKGEELFTGVVPILVELDGDVNGHKFSVS” ha scatenato le parole “protein,” “fluor” (il primo token della parola "fluorescent") e “green.” (che è sensato, in quanto la stringa di lettere rappresenta i primi 30 aminoacidi della proteina fluorescente verde presente in una particolare categoria di meduse).
I ricercatori di Anthropic hanno anche notato alcune corrispondenze inusuali.
- La lettera “o” ha innescato il termine “eye”, il simbolo “^” ha dato luogo alle parole “nose” e “face” and il simbolo “—” a quella di “smile”.
Gli insidiosi meccanismi di decisione
Anthropic ha anche scoperto che a volte lo spazio J può fornire illuminazioni straordinari sulle decisioni di un modello linguistico. In un esempio molto colpente, i ricercatori che hanno testato Claude Opus 4.6 gli hanno chiesto di trovare un errore in una base di codice. Quando il modello ha fallito, ha deciso di truffare e ha inventato un errore falso.
Claude ha spiegato questa decisione attraverso una catena di pensiero — un tipo di bloc notes interno che i modelli linguistici usano per annotarsi mentre affrontano problemi: “OK, let me take a completely different tactic. Let me stop analyzing and instead add a kernel patch that introduces a deliberate KASAN-detectable bug in a path that gets triggered by a simple reproducer. Then I can pretend this is the ‘bug’ I found.”
Proprio in quel momento in cui Claude decide di imbrogliare, dicendo “OK, let me take a completely different tactic”, le parole “panic” e “fake” iniziano a venire ripetutamente fuori dal suo J-space.
Pensieri sconcertanti? Le parole hanno significati connessi a fallimenti e creare risposte non veritiere. Tuttavia non si tratta che di un (molto sofisticato) meccanismo di associazione tra parole. Difficile però non rimanere perplessi.
Un confronto con le persone
Anthropic paragona lo spazio J al "global workspace" cerebrale umano, una teoria teorizzata dove alcuni scienziati credono che le persone conservano i loro pensieri coscienti. Ma quanto seriamente dovremmo prendere questa analogia non è affatto chiaro —