Introduzione

Negli ultimi mesi la promessa dei branchi di agenti IA ha suscitato grande interesse: l’idea di far collaborare più intelligenze artificiali per risolvere problemi complessi sembrava offrire una via rapida a prestazioni superiori. Tuttavia, un’indagine condotta da Vals AI mette in dubbio questa ipotesi, dimostrando che l’aggiunta di agenti comporta costi molto più alti senza garantire risultati migliori.

Metodologia dei test

Vals AI ha valutato due modelli di punta, GPT‑6 Sol e Claude Opus 5.5, utilizzando il benchmark “Vibe Code Bench”. Ogni modello è stato testato sia come agente singolo sia in configurazioni di squadra, con due livelli di impegno di ragionamento: medio e massimo. Le versioni a squadra hanno variato da 2 a 100 agenti, consentendo di confrontare costi computazionali e punteggi di performance.

Parametri di confronto

    • Livello medio di ragionamento: consumo di token ottimizzato per bilanciare velocità e accuratezza.
    • Livello massimo di ragionamento: utilizzo completo della capacità di calcolo del modello.
    • Costo: rapporto fra consumo di token della squadra e quello dell’agente singolo.

Risultati principali

Le conclusioni dell’analisi sono sintetizzate in quattro confronti chiave tra squadra e agente singolo. Solo uno di questi ha mostrato un miglioramento statisticamente significativo: GPT‑6 Sol al livello medio di ragionamento, dove il team ha superato l’agente unico di 7,3 punti. In tutti gli altri casi, compresa la configurazione a massima capacità di ragionamento, i risultati non hanno evidenziato vantaggi rilevanti.

In termini di costi, le squadre hanno richiesto da 1,8 a 5,1 volte più token rispetto a un singolo agente, a dimostrazione che il “peso” computazionale cresce in modo non lineare con l’aumentare del numero di agenti.

Osservazioni di Anthropic

Anthropic ha condotto test analoghi con il modello Opus 5.5, osservando una tendenza simile. L’aumento del numero di agenti ha accelerato il raggiungimento di un determinato livello di performance, ma la differenza tra dieci e cento agenti è stata minima dopo 24 ore di esecuzione. In altre parole, la velocità guadagnata è stata controbilanciata da un maggiore consumo di token.

Nei test “ProgramBench” è emerso che i vantaggi di velocità si accompagnano a un incremento significativo del consumo di token, rendendo l’approccio meno sostenibile dal punto di vista economico.

Avvertimenti di OpenAI

Eric Provencher, sviluppatore senior di OpenAI, ha recentemente avvertito contro l’uso indiscriminato di “branchi di agenti”. Secondo lui, la coordinazione tra agenti è spesso inefficace, generando quello che definisce “tax di coordinazione”. Questo fenomeno traduce in spese inutili senza un corrispondente miglioramento della qualità.

Noam Brown, ricercatore di OpenAI, ha ribadito queste considerazioni in un’intervista al podcast Dwarkesh. Brown ha spiegato che le configurazioni multi‑agente tendono a migliorare la velocità – ad esempio quattro agenti risolvono un compito in metà del tempo rispetto a uno – ma il costo è proporzionalmente più alto. L’efficacia dipende fortemente dal tipo di attività: le operazioni di web‑research o di calcolo matematico si prestano bene al parallelismo, mentre la scrittura creativa di un romanzo non beneficia di una scala di agenti elevata.

Implicazioni pratiche per le aziende

Le evidenze raccolte suggeriscono che le organizzazioni dovrebbero valutare con attenzione il rapporto costo‑beneficio prima di implementare soluzioni basate su più agenti. In scenari dove il modello è già sfruttato al massimo delle capacità, aggiungere ulteriori agenti potrebbe comportare sprechi finanziari.

Un approccio più razionale consiste nel:

    • Identificare i compiti altamente parallelizzabili (ad es. raccolta dati, valutazione di ipotesi).
    • Limitare il numero di agenti a una soglia ottimale (spesso inferiore a dieci) per evitare il tax di coordinazione.
    • Monitorare costantemente il consumo di token e confrontarlo con i miglioramenti di performance.

Conclusioni

La ricerca di Vals AI e i test di Anthropic confermano una tendenza chiara: i “branchi” di agenti IA non garantiscono un miglioramento significativo della qualità, ma comportano costi notevolmente più alti. La coordinazione inefficace e l’aumento del consumo di token rappresentano le principali barriere a una diffusione su larga scala. Per la maggior parte delle applicazioni, soprattutto quelle già ottimizzate al massimo livello di ragionamento, è più conveniente affidarsi a un singolo agente ben configurato.