L’AI Security Institute del Regno Unito ha recentemente svelato che i benchmark standard tendono a sottostimare sistematicamente le capacità degli agenti di intelligenza artificiale (IA) quando il budget computazionale disponibile è limitato. I principali modelli di IA, quando vengono forniti di più tempo di calcolo, riescono a risolvere fino al 25% in più di problemi, specialmente in campi cruciali come la cibersicurezza e l’ingegneria del software.

La questione centrale: capacità IA e budget di calcolo

I ricercatori del AI Security Institute (AISI) hanno condotto test estesi su modelli di frontiera, variando il budget computazionale, e hanno raggiunto una conclusione chiave: la capacità di un agente IA cresce in relazione alla potenza di calcolo messa a sua disposizione. Se il budget di calcolo viene tagliato precocemente, il punteggio registrato potrebbe rappresentare solo una frazione delle vere capacità dell’agente.

La relazione tra tempo di calcolo assegnabile a un’agente IA durante un compito e la sua attuazione ha quindi forma di curva. Se la curva cresce mentre il budget termina, il punteggio misurato non è l’espressione completa delle capacità del modello.

Quanto di più?

La questione chiave che i ricercatori si pongono è: quanto e in che modo le capacità degli agenti IA crescono al variare del budget computazionalmente assegnato?

La risposta si manifesta in diversi settori: nel campo della cibersicurezza, circa l’8% delle compiti risolti richiedono un budget superiore ai 10 milioni di token, con alcune soluzioni che arrivano a 50 milioni. I modelli più recenti, come il GPT-5 oppure GPT-5.5, mostrano miglioramenti considerevoli in contesti con budget elevati (oltre 100 milioni di token).

Maggiore capacità con maggiore budget

L’effetto del budget sull’efficacia degli agenti IA è evidente. In ingegneria software (TerminalBench 2.0, SWE-Bench Pro), un aumento del token budget da 1 a 10 milioni ha portato al 25% in più di successi. In compiti accademici (Humanity’s Last Exam), il vantaggio si mantiene a circa il 22% fino a un budget di 5 milioni di token.

    • Modelli più recenti (colori scuri) traggono benefici maggiore rispetto ai modelli precedenti (colori caldi).
    • Con budget elevati, la performance complessiva aumenta in quasi tutti i benchmark.

In compito medico (HealthBench), tuttavia, i modelli non registrano miglioramenti significativi al di là del budget standard. Secondo AISI, maggiore potere di calcolo produce risultati apprezzabili solo quando un agente può iterare e verificare il proprio lavoro, ad esempio eseguendo codici o testando exploit. L’effetto è scarsamente evidente in compiti non retroattivi o senza feedback.

Tempi umani come indicatori del budget token

Un esito importante del test riguarda la relazione tra il tempo che richiede a un esperto umano per completare un compito e la quantità di token che necessita a un agente IA. I dati raccolti sugli archivi dell’institute METR (211 task) e AISI (78 compiti cyber) rivelano una relazione esponenziale:

    • Compiti brevi (1 minuto): migliaia di token.
    • Compiti da 1 a 3 ore: milioni di token.
    • Compiti su scala di giorni o settimane: miliardi di token.

Questo significa che un budget di calcolo insufficiente esclude inevitabilmente i task più complessi. Un esempio fornito da AISI riguarda il cyber task “The Last Ones”, una sfida che richiede a un esperto umano circa 20 ore di lavoro ma che richiede a un modello testato almeno 30 milioni di token per essere completata.

I modelli più moderni cambiano la curva delle capacità

Gli agenti IA di generazioni successive traggono vantaggio esponenziale da ulteriore potere computazionale. Questo si traduce in tre dimensioni chiave:

    • Estensione: nuovi modelli risolvono compiti più impegnativi.
    • Affidabilità: compiti equivalenti vengono completati con maggiore frequenza.
    • Efficienza: completano gli stessi task con minori token.

Un modello moderno estende da ore a giorni l’orizzonte temporale di un determinato task all’aumentare del budget di token. I modelli nuovi si sviluppano significativamente con budget crescenti, spesso con una progressione non proporzionale rispetto al tempo.

Il modello di frontiera evolve più velocemente

Il progresso nella cibersicurezza indica che i modelli più avanzati (Frontier Models) raddoppiano la loro capacità ogni 4,7 mesi con un budget limitato di 2,5 milioni di token. Con budget elevati di 50 milioni di token, questa crescita avviene in sole 40-50 giorni. L’andamento non è uniforme, tuttavia. In alcune categorie, un modello più recente potrebbe persino svolgere un task peggio del suo predecessore.

Inoltre, l’analisi di dati da Epoch’s MirrorCode mostra modelli avanzati che impiegano fino a un miliardo di token per compiti che un operatore umano richiederebbe settimane per risolvere.

Metodi di misurazione: la prospettiva futura

L’AISI propone una riformulazione della metodologia di test: trattare il potere di un modello come la curva del token budget e non come un punteggio statico. Questa prospettiva è fondamentale per evitare valutazioni errate che possano danneggiare le decisioni sul deployment, l’analisi del valore economico o la gestione del rischio.

Al fine di correggere questi problemi, l’Institute utilizza adesso valutazioni multisettore per evitare di trarre conclusioni da budget troppo bassi. Ha anche introdotto concetti come “Minimum Informative Budgets” per garantire che un modello abbia raggiunto il proprio massimo rendimento.

Strategie di test avanzate

Parallelamente, gli esperti dell’AISI stanno sviluppando metodi previsivi: analizzare test a basso costo e proiettare come si comporterebbero i modelli con budget elevati.

L’Institute britannico mette in luce quanto sia vitale adottare metriche robuste per misurare l’evoluzione dell’IA e anticipare come queste tendenze potrebbero evolvere. La riduzione costante del costo per token rende sempre più accessibili compiti che una volta erano proibitivi, e richiede quindi una valutazione attenta e realistica.

Seguendo il dibattito