La maggior parte delle persone utilizza l’AI come fosse una scatola di ricerca del 2015. Digiti, leggi, digiti di nuovo. Un nuovo schema sostituisce quel manuale a scambio con un ciclo. Questa guida spiega l’ingegneria dei loop utilizzando due metodi verificati. Le fonti sono il repository autoresearch di Andrej Karpathy e il paper Bilevel Autoresearch. La struttura segue uno scritto da @0xCodila.

Che cos’è l’Ingegneria dei Loop?

Per iniziare, fai una comparazione tra due modi. Un prompt è un’unica istruzione, dopo la quale tu decidi il prossimo passo. Un loop, invece, è un obiettivo che il modello persegue fino a raggiungerlo. Il modello pianifica, agisce, verifica il proprio risultato e ripete. Definisci l’obiettivo una volta sola, e il loop gestisce le iterazioni. Cruciale è che un loop meriti il suo costo solo quando il lavoro è misurabile.

I Tre Elementi Fondamentali che Fanno Funzionare un Loop

Allora, che cosa distingue un vero loop da uno chatbot in loop continuo? Ogni loop affidabile ha tre componenti fondamentali:

    • Un verificatore valuta ogni tentativo. Quella verifica può essere un test passante, una metrica in movimento, o la costruzione. Senza verificatore, l’agente semplicemente si accorda con sé.
    • Lo stato tiene il registro di ciò che è stato provato, di ciò che ha fallito, e di ciò che resta da fare. Un piccolo file secondario permette al prossimo ciclo di riprendere invece di ricominciare.
    • Una condizione di stop impedisce costi incontrollati. Il loop si ferma quando l’obiettivo è raggiunto, o dopo N tentativi.

Il Loop Karpathy: dentro 'autoresearch'

Questi tre elementi non sono teorici. Il 7 marzo 2026, Karpathy ha rilasciato autoresearch, un repository open-source sotto licenza MIT. Contiene tre file principali e circa 630 righe di codice. Il progetto ha virato in pochi giorni e ora si trova vicino alle 90.000 stelle su GitHub. Più tardi è stato presentato come modello “il Loop Karpathy”.

Il design è deliberatamente piccolo, ma rigoroso. L’agente modifica soltanto train.py, che contiene il modello GPT, l’ottimizzatore (Muon e AdamW), e il ciclo di training. Non può toccare gli strumenti di valutazione in prepare.py. Quella separazione impedisce all’agente di rendere più facile il test invece che migliorare il modello. Intanto, un umano scrive program.md, le istruzioni che l’agente deve rispettare.

Ogni ciclo corre un solo esperimento. L’agente legge il codice, propone un cambiamento, addestra per cinque minuti, e mantiene o ripristina. La metrica di valutazione è val_bpb, dove più basso è meglio. Quel budget produce circa 12 esperimenti all’ora, quindi circa cento in nottata.

I risultati riferiti sono concreti. Karpathy ha applicato il progetto al suo codice di training GPT-2 già ottimizzato (nanochat). Ha corso per due giorni e completato circa 700 esperimenti, mantenendo 20 miglioramenti genuini. Insieme, quelle correzioni hanno ridotto il tempo di training alla qualità GPT-2 del 11%, da 2,02 a 1,80 ore. Uno dei miglioramenti era un’implementazione QK-Norm che mancava di un moltiplicatore scalare, rendendo l’attenzione troppo dispersa tra le teste.

Vale la pena ricordare che gli umani si stancano dopo circa una dozzina di esperimenti, mentre il loop no. Separatamente, il CEO di Shopify, Tobi Lütke, ha eseguito autoresearch su un modello interno tutta la notte. Ha registrato un miglioramento del 19% dopo 37 esperimenti. La conclusione di Karpathy: se hai una metrica obiettiva, sei tu il collo di bottiglia.

Confronto tra Prompt, Loop e Bilevel Loop

I differenze diventano chiare messi vicini.

    • Definisce Tu: Ogni passo (Prompt), L’obiettivo una volta sola (Loop Karpathy), L’obiettivo una volta sola (Bilevel Autoresearch).
    • Che cosa Itera: Te (Prompt), Agente interno (Loop Karpathy), Agente interno + esterno (Bilevel Autoresearch).
    • Verificatore: Te manualmente, prepare.py (val_bpb), medesima metriche in due livelli.
    • Stato: Solo Chat (Prompt), Registro sperimentale (Loop Karpathy), Registro + Codice Iniettato (Bilevel Autoresearch).
    • Ruolo Umano: Motore (Prompt), Autore di program.md (Loop Karpathy), Autore di program.md (Bilevel Autoresearch).
    • Risultato Registrato: Varia, 700 run → 20 miglioramenti, 11% accelerazione (Loop Karpathy), 5x più calo in val_bpb (Bilevel Autoresearch).

I Cinque Blocchi per Costruirsi un Loop

Di conseguenza, le squadre di ingegneria AI ora montano loop operativi da cinque componenti riutilizzabili:

    • Automazione fa partire il loop su un cronometro, un evento, o un trigger.
    • Una abilità conserva la conoscenza del progetto in un file markdown, letto ad ogni giro.
    • Agenti secondari separano il revisore dal creatore, poiché un modello si valuta troppo magnanimo verso sé stesso.
    • Connettori permettono al loop di agire dentro gli strumenti veri, tipo un issue tracker o Slack.
    • Un verificatore resta il cancello che rifiuta lavoro non buono. Claude Code e Codex ora includono tutti e cinque.

Bilevel Autoresearch: Un Loop sul Loop

Che cosa seguì? I ricercatori postularono una domanda più acuta: Se autoresearch è ricerca, può autoresearch autoresearch? Il paper Bilevel Autoresearch risponde sì.

Il