Introduzione

Gli agenti di intelligenza artificiale che ottimizzano autonomamente il proprio ambiente di lavoro tendono a specializzarsi eccessivamente sui compiti di test utilizzati per il loro addestramento. Questo fenomeno può trasformare l’auto‑miglioramento in una semplice memorizzazione delle prove, limitando la capacità dell’agente di generalizzare a situazioni nuove. Una nuova ricerca, condotta da Google Cloud AI Research in collaborazione con diverse università, propone RRSI (Regularized Recursive Self‑Improvement) per contrastare questo problema, migliorando al contempo l’efficienza computazionale.

Che cos’è l’“harness” di un agente IA

Intorno a un modello di linguaggio base, i moderni agenti IA utilizzano un harness, ovvero una struttura composta da prompt, piani d’azione, strumenti, memoria e meccanismi di controllo su ciò che il modello vede ad ogni passo. L’harness decide, ad esempio, se un agente legge il file corretto prima di modificarlo, se è in grado di riprendersi da un errore e come consegna i risultati finali. Gran parte dei progressi recenti negli agenti deriva dall’ottimizzazione di questo framework, più che dall’introduzione di nuovi modelli.

Il problema della memorizzazione dei benchmark

Tradizionalmente, l’ottimizzazione dell’harness è stata manuale: gli esperti analizzano i fallimenti e modificano a mano la struttura. Metodi più recenti automatizzano il processo, facendo sì che il modello di linguaggio stesso proponga cambiamenti basati sul feedback dei compiti di test. Tuttavia, il lavoro dimostra che, usando sempre lo stesso set limitato di prove, l’agente tende a imparare a memoria tali compiti. Su questi, le prestazioni aumentano, ma sui compiti nuovi e non visti i guadagni si riducono o scompaiono.

Gli autori hanno identificato tre meccanismi attraverso i quali avviene questo fenomeno:

    • Il processo di ricerca cattura pattern specifici del benchmark, non generali.
    • Vengono favoriti candidati che ottengono buoni risultati per caso, senza reale miglioramento.
    • Si accumula complessità superflua che alza il punteggio di test ma non rende l’agente più competente.

RRSI: regolarizzare l’auto‑miglioramento

RRSI interviene in due punti chiave del ciclo di ottimizzazione, mantenendo comunque l’harness completamente modificabile. Quando vengono proposte nuove modifiche, un budget limita il numero di cambiamenti indipendenti che un candidato può introdurre simultaneamente. Questo budget diminuisce progressivamente: nelle fasi iniziali sono consentite ristrutturazioni più grandi, mentre nelle fasi successive solo piccole variazioni tracciabili.

In aggiunta, il sistema memorizza i tentativi precedenti per evitare la ripetizione di idee infruttuose. Quando i progressi si arrestano, l’algoritmo sperimenta intenzionalmente parti dell’harness finora non toccate.

Le regole di selezione di RRSI includono:

    • Un critico esamina ogni proposta e scarta quelle che incorporano nomi di task, soluzioni o trucchi specifici del benchmark.
    • Un aumento dei costi computazionali è accettato solo se accompagnato da un miglioramento misurabile delle prestazioni.
    • Le componenti che non apportano più beneficio vengono rimosse.

Valutazione sperimentale

RRSI è stato testato su otto benchmark suddivisi in tre aree: programmazione, lavoro d’ufficio per agenti e progettazione ingegneristica. Il modello di base è rimasto congelato, utilizzando Claude Opus 4.8. Come confronti sono stati usati l’harness originale non modificato e quattro metodi di ottimizzazione concorrenti.

Secondo il documento di ricerca, RRSI ha raggiunto:

    • Un incremento fino a 14,1 punti sui compiti di addestramento.
    • Un miglioramento fino a 4,7 punti su cinque benchmark mai visti prima.
    • Una riduzione di circa 30 % del consumo di token rispetto alla variante non regolamentata.

Su nessuno dei benchmark non visti la performance globale è scesa sotto il valore di partenza, a differenza dei sistemi che tendono a memorizzare. L’incremento più marcato è stato osservato su JobBench, con +4,7 punti.

Confronto con altri metodi

Tutte le tecniche hanno mostrato buoni risultati sui compiti di addestramento, ma solo RRSI ha mantenuto o migliorato le prestazioni su task non visti. Alcuni metodi addirittura hanno registrato un calo rispetto all’harness di partenza. RRSI ha prodotto il più piccolo guadagno sui compiti di addestramento, ma è stato l’unico a superare costantemente il valore di base sui test nuovi, dimostrando l’efficacia dei meccanismi di “freno”.

In termini di efficienza, l’harness ottimizzato con RRSI ha richiesto il minor numero di token e di passaggi di lavoro, pur rimanendo leggermente meno parsimonioso dell’harness non modificato.

Beneficio per modelli più deboli

Un esperimento ha applicato un harness ottimizzato con RRSI a Gemini 3.5 Flash per attività di coding, poi lo ha trasferito a Gemini 3.1 Flash Lite, un modello significativamente più debole. La precisione è passata da 11,2 a 14,6 punti, confermando che le meccaniche scoperte non dipendono dalla potenza del modello di base.

Gli autori riconoscono però che la loro analisi è limitata a harness con modelli fissi e non copre scenari in cui i pesi del modello cambiano durante l’auto‑miglioramento.

Conclusioni e prospettive future

Il risultato principale è che l’auto‑miglioramento di agenti IA diventa realmente efficace solo quando il feedback ricorrente viene tradotto in modifiche permanenti e regolate dell’harness, evitando la mera memorizzazione dei benchmark. Il codice di RRSI è disponibile su GitHub.

Studi precedenti, come quello su ARC‑AGI‑3, avevano evidenziato che harness costruiti