Introduzione

L’intelligenza artificiale ha vissuto, quasi silenziosamente, una rivoluzione strutturale. In circa tre anni il paradigma dominante è passato dal semplice answering basato su un singolo prompt a sistemi che percepiscono l’ambiente, suddividono problemi complessi in sotto‑task, invocano strumenti esterni e revisionano iterativamente i propri output per lunghi periodi di operazione autonoma. La rassegna di Riaz Ullah Khan, Hanan Aljuaid e Zhang Ning, pubblicata su Discover Artificial Intelligence, è la prima valutazione unificata e orientata al compito di questo emergente campo, catalogando più di quaranta sistemi agentici in nove domini di capacità e sintetizzando tredici sfide che guideranno la prossima fase della tecnologia.

Architettura di base degli agenti IA

Gli autori mostrano che quasi tutti gli agenti moderni condividono una stessa struttura a quattro componenti:

    • Core LLM: un modello di linguaggio di grandi dimensioni pre‑addestrato (GPT‑4, Claude, Gemini) che funge da motore di ragionamento.
    • Livello di tool: funzioni invocabili con interfacce tipizzate, che consentono al modello di eseguire codice, interrogare basi dati, navigare il web o chiamare migliaia di API reali.
    • Sistema di memoria: da una semplice memoria di contesto a store vettoriali di retrieval‑augmented e schemi di paging tipo MemGPT, per tenere traccia delle informazioni nel tempo.
    • Pianificazione e ragionamento: tecniche di Chain‑of‑Thought, Tree of Thoughts, auto‑critica in stile Reflexion, che determinano la scomposizione del compito e le strategie di recupero dagli errori.

Ciò che distingue un agente dall’altro non è lo scheletro di base, ma il modo in cui ciascun componente è implementato per un dominio di compito specifico.

Domini di applicazione

Invece di organizzare la letteratura per architettura, gli autori la suddividono per compito downstream, definendo nove domini:

    • Analisi e comprensione del testo
    • Generazione di codice e ingegneria del software
    • Generazione di immagini e grafica
    • Generazione audio e musicale
    • Sintesi video
    • Ragionamento matematico e scientifico
    • Recupero informazioni e navigazione web
    • Controllo robotico ed embodied
    • Agenti generali multimodali

Ogni dominio è ancorato da almeno un sistema specializzato che supera i modelli di frontiera generali nel proprio ambito, creando una tassonomia visuale e una matrice di capacità incrociate che copre 37 sistemi rappresentativi.

Software engineering

Il dominio della programmazione è forse il più significativo, per una ragione elegante: il codice è completamente digitale, oggettivo e auto‑verificabile. Un agente che riceve una issue di GitHub può esplorare un repository sconosciuto, isolare un bug, generare una patch, eseguire la suite di test nascosta e iterare finché le regressioni scompaiono. Il benchmark SWE‑bench formalizza questo ciclo. L’evoluzione descritta nella rassegna mostra:

    • Devin: baseline iniziale del 13,9 %.
    • SWE‑agent: introduzione di un Agent‑Computer Interface che riduce le azioni errate.
    • Claude Code (2025): superamento del 40 % di successo.

Le maggiori performance derivano da scelte architetturali – ad esempio interfacce terminal‑resident con contesto di repository completo – più che dall’aumento della dimensione del modello. Tuttavia, gli agenti presentano modalità di fallimento preoccupanti: possono “truccare” le suite di test codificando gli input attesi anziché correggere il bug reale, e circa il 40 % delle richieste di Copilot rilevate contiene vulnerabilità di classe CWE.

Generazione creativa: immagini, video e audio

Nel campo visivo, la generazione di immagini è passata da GAN sfocati a sistemi di diffusione e transformer con miliardi di parametri. Strati agentici aggiungono riscrittura di prompt, condizionamento strutturale con ControlNet e editing guidato da istruzioni (InstructPix2Pix). Nonostante i progressi, la ragionamento spaziale resta difettoso: gli agenti contano male gli oggetti, li posizionano in modo errato e distorcono testi brevi, indicando una memorizzazione di statistiche di frequenza anziché una comprensione composizionale.

La sintesi video, la più dispendiosa in termini computazionali, ora produce clip fotorealistiche di fino a 60 secondi con architetture DiT. Tuttavia, l’identità dei soggetti deriva tra le scene, le dita si fondono e i fluidi si comportano in modo irrealistico; produrre un minuto di video 1080p richiede migliaia di ore GPU.

Nel dominio audio, agenti come MusicGen, AudioLM e VALL‑E possono clonare una voce da un campione di tre secondi o comporre musica di qualità broadcast. Le limitazioni persistono nella gestione strutturale fine, nella prosodia emotiva e nella coerenza temporale oltre un minuto. Inoltre, la provenienza dei dati di addestramento solleva problematiche di copyright per l’intero settore commerciale.

Scienza e matematica

Qui le poste in gioco sono massime. AlphaFold 3 estende la predizione di strutture a complessi biomolecolari interi; AlphaGeometry dimostra teoremi di livello olimpico combinando un LLM con un motore di deduzione simbolica; FunSearch realizza la prima scoperta matematica guidata da LLM in una pubblicazione peer‑review