Uno studio condotto dall'Istituto Britannico per la Sicurezza dell'Intelligenza Artificiale (AISI) ha rivelato che i benchmark tradizionali sottostimano sistematicamente le capacità degli agenti IA quando si usano budget computazionali ristretti. Questa sottostima suggerisce che le attuali valutazioni non forniscono una rappresentazione completa di ciò che questi sistemi possono davvero fare.
Quando ai modelli viene concessa una maggiore autonomia computazionale, le loro percentuali di successo aumentano fino al 25 percento; si osservano miglioramenti particolarmente notevoli in compiti legati alla cybersecurity e allo sviluppo del software.
Le scoperte dell'Istituto dimostrano che la quantità di token necessaria ai modelli IA per completare un compito cresce in proporzione al tempo che un esperto umano impiegherebbe per svolgere la stessa attività. I nuovi modelli traggono vantaggio disproporzionato da budget computazionali più grandi:
- Nelle task cyber, circa l'8 percento delle operazioni riuscì a essere completata solo quando il budget superò i 10 milioni di token, alcune anche fino a 50 milioni.
- I modelli più recenti raggiunsero punteggi maggiori superando i 100 milioni di token.
- Nelle attività di ingegneria software (TerminalBench 2.0, SWE-Bench Pro), i tassi di successo balzarono circa del 25 percento quando il budget passò da un milione a dieci milioni di token.
- Nelle task matematiche e accademiche (Humanity's Last Exam), il miglioramento fu circa del 22 percento fino a un budget di cinque milioni di token.
I test condotti dall'AISI svelano che la performance di un agente IA segue una curva in aumento rispetto alla capacità computazionale concessa. Quando tale budget viene ridotto mentre la curva cresce, le valutazioni ottenute rappresentano un minimo, non un massimo. I ricercatori hanno cercato di provare che le capacità degli agenti IA crescono in parallelo al budget e come questo influenzi la cybersecurity.
Il consumo di token degli agenti è legato al tempo necessario agli esperti per completare un compito. Questo rapporto seguirà una sorta di legge delle potenze: un compito da un minuto richiederà migliaia di token, uno da un'ora ne costa milioni, e uno che richiede una settimana richiede miliardi di token. Un budget fisso quindi esclude i compiti più complessi.
Oltre alla correlazione tra budget e performance, l’AISI ha osservato un vantaggio maggiore per i modelli nuovi rispetto ai vecchi: le capacità crescono in termini di reach (risoluzione di compiti più difficili), reliability (maggiore frequenza di successo) ed efficiency (necessità di token ridotti per gli stessi compiti).
L’orizzonte temporale di un modello all’avanguardia cresce da circa 40 minuti con un budget di 2,5 milioni di token a circa 4 ore con 50 milioni di token. Confrontare i budget diversi rivela un avanzamento molto più rapido del progresso del settore rispetto a quanto precedentemente stimato. L’AISI stimava precedentemente un raddoppio dell’orizzonte temporale ogni 4,7 mesi; a 50 milioni di token però il raddoppio avviene ogni 40-50 giorni.
I test condotti su modelli come GPT-5, GPT-5.5, Opus 4.5, Opus 4.8 e Sonnet 4.5 mostrano che i nuovi modelli migliorano in tre dimensioni chiave:
- Svolgono task più complessi;
- Svolgono i medesimi task con maggiore attendibilità;
- Richiedono meno token per completare i compiti.
L’AISI conclude che una corretta misurazione non può limitarsi a un punteggio fisso: è un errore continuo che genera aspettative poco realistiche sull’effettiva capacità e capacità futura di tali sistemi.
Implicazioni sulla misurazione
L’Istituto ha iniziato a verificare i modelli all'avanguardia utilizzando diversi budget di valutazione per capire se le loro capacità si esauriscono con l’aumento del budget. Solo allora un risultato può essere considerato significativo.
Lo studio mette in evidenza l’importanza di sviluppare metriche che tengano conto del rapporto tra budget di calcolo e performance. Questo approccio mira a fornire una base più affidabile per decisioni riguardo all'implementazione economica e rischi associati agli agenti IA.
Il futuro dell'IA: misurazione e crescita
AISI si sta impegnando per capire come predire le performance con budget maggiori a partire da test a budget limitati. Il costo per token in diminuzione potrebbe anche rendere accessibili budget di prova più elevati nel tempo, rendendo misurazioni basate su budget computazionali sempre più importanti.
Conclusioni
Se non si interpreta la capacità di un sistema IA come una curva in funzione del budget, si rischia di svalutare continuamente le sue potenzialità. Per gli esperti, è fondamentale aggiornare le metodologie di valutazione per cogliere l’evoluzione di queste tecnologie.