AlphaGo e la mossa 37

Nel pomeriggio di marzo 2016, a Seoul, osservai una partita di Go in cui il programma da me co‑sviluppato posò una pietra sulla quinta linea del tabellone, come se fosse un dono per l’avversario umano. Il movimento 37 nella seconda partita di una serie di cinque apparve talmente assurdo da far pensare ad alcuni commentatori a un bug di programmazione. Non si trattava di un errore: AlphaGo vinse la partita, completando il match 4‑1 contro Lee Sedol, considerato uno dei più grandi giocatori professionisti di Go di tutti i tempi. “Pensavo che AlphaGo fosse basato su calcoli di probabilità e che fosse solo una macchina”, disse Lee dopo la partita. “Ma quando ho visto quella mossa, ho cambiato idea. Sicuramente AlphaGo è creativo”.

Perché la mossa è un caso di ragionamento, non di intuizione

Quando Deep Blue sconfisse il campione di scacchi Garry Kasparov nel 1997, lo fece calcolando sei‑otto mosse in anticipo per ciascun giocatore e valutando 200 milioni di posizioni al secondo, usando regole codificate da esseri umani. Il Go, invece, è enormemente più complesso: il valore di una pietra dipende da come gruppi e territori si evolvono per decine di mosse. Calcolare anche solo una frazione dei possibili esiti richiederebbe a un supercomputer miliardi di anni. Per vincere, AlphaGo doveva percepire chi fosse in vantaggio a colpo d’occhio e persino inventare mosse che nessun umano aveva mai considerato.

Come funziona AlphaGo

AlphaGo è composto da due sistemi. Il primo, la rete di policy, è stato addestrato a indovinare quale mossa farebbe un giocatore umano forte. Questa parte “intuitiva” considerava la mossa 37 come nulla di speciale, con circa una probabilità su 10.000 di essere scelta da un esperto. Ciò che la fece scegliere fu il motore di ricerca, che andava oltre la plausibilità immediata e valutava le conseguenze future delle mosse proposte. Esso costruiva e scandiva esplicitamente un albero di gioco con migliaia di rami, ciascuno rappresentante un possibile futuro.

Intuizione vs. ragionamento: il parallelismo con Kahneman

Una teoria nota nelle scienze comportamentali, popolarizzata da Daniel Kahneman, distingue due modalità di pensiero umano: il Sistema 1, veloce, istintivo e senza sforzo; e il Sistema 2, lento, passo‑a‑passo e deliberativo. AlphaGo offrì una sorprendente analogia meccanica di questa dicotomia. Le sue reti fornivano le “intuzioni” – “questa mossa sembra promettente, questa posizione appare vinta” – mentre la ricerca forniva la “deliberazione”, testando tali intuizioni contro le mosse e le contromosse successive. Come nella cognizione umana, nessuna delle due parti funziona da sola: l’intuizione da sola non avrebbe mai optato per la mossa 37, e la ricerca brute‑force avrebbe faticato a filtrare tutte le possibili mosse.

I LLM odierni: solo Sistema 1?

Il modo in cui funzionano i grandi modelli linguistici (LLM) è sostanzialmente diverso. Un LLM predice il token successivo, ripetutamente, operazione che corrisponde al Sistema 1: veloce, associativo e sorprendentemente efficace nel completare pattern in quasi tutti i soggetti su cui le persone scrivono. Nonostante la fluidezza linguistica, subito dopo il debutto di ChatGPT la comunità riconobbe che la sola capacità di generare testo non bastava a garantire utilità reale.

Catene di pensiero: un miglioramento ma non una vera deliberazione

La risposta apparente fu introdurre modelli che “deliberano”: anziché rispondere immediatamente, questi possono generare passi intermedi che scompongono un problema, trasportano risultati parziali e influenzano il ragionamento successivo – un processo chiamato chain of thought. I guadagni sono concreti, soprattutto in matematica e programmazione. Tuttavia, a differenza della ricerca di AlphaGo, questo non introduce un meccanismo di ragionamento separato: il ragionamento intermedio è ancora prodotto dallo stesso processo di predizione del token, iterato più a lungo prima che il modello si impegni a una risposta.

Tre limiti fondamentali dei chatbot attuali

    • Mancanza di uno stato epistemico esplicito e ispezionabile. Non esiste un registro aperto che elenchi le ipotesi considerate, la fiducia attribuita a diverse spiegazioni, le evidenze pesate e le domande rimaste aperte, elementi che dovrebbero essere revisionati sistematicamente al nuovo ingresso di informazioni.
    • Assenza di separazione netta tra conoscenza e ragionamento. Conoscenza e ragionamento sono intrecciati nei pesi della rete neurale; non vi è un insieme di credenze rappresentato in modo indipendente.
  • Le catene di pensiero sono spesso costruite a posteriori. Ricerche hanno dimostrato che i bot spesso “inventano” il percorso di ragionamento dopo aver raggiunto la risposta, presentando una sequenza di