Introduzione
Un gruppo di ricercatori ha documentato in modo dettagliato la collaborazione tra esseri umani e agenti di intelligenza artificiale (IA) nella creazione di un nuovo modello di IA. Lo studio, condotto da un team guidato dalla Fudan University in Cina, analizza più di 700 protocolli di compiti svolti da 56 partecipanti, includendo i log degli agenti coinvolti. L’obiettivo è comprendere chi prende realmente le decisioni quando le IA partecipano attivamente allo sviluppo di modelli avanzati.
Il modello Atria Dawn Preview
Il progetto ha prodotto un modello linguistico basato su un’architettura “Mixture‑of‑Experts” con 744 miliardi di parametri, denominato Atria Dawn Preview. Il modello è stato concepito per compiti di ricerca e ingegneria, e viene addestrato attraverso una pipeline che collega ogni attività a un ambiente di esecuzione reale. Durante il processo, il modello invoca strumenti, genera risultati intermedi e viene valutato mediante segnali esterni quali test, metriche o riferimenti a fonti.
Performance e benchmark
Secondo gli autori, Atria Dawn Preview si colloca al primo posto in cinque dei sedici benchmark testati, in particolare nelle categorie “ricerca web” e “cybersicurezza”. Tuttavia, non mostra un vantaggio generale rispetto alla concorrenza. Nei benchmark AutomationBench, CyberGym e MLE‑Bench Lite il modello è leader, mentre in GDPval e SWE‑Bench Pro si trova nella parte bassa del confronto.
Uso dell’IA e aumento dell’automazione
Il 96,5 % delle attività esaminate ha coinvolto l’IA. Nel corso di quattro settimane, il rapporto tra azioni degli agenti e input umani è cresciuto notevolmente: il valore mediano è passato da 11 a 28,5 azioni per ogni inserimento umano. Nonostante questo aumento, gli autori avvertono contro un’interpretazione di crescente autonomia: ogni decisione umana viene semplicemente prolungata da più passaggi dell’IA, non sostituita.
Compiti impossibili senza IA
I partecipanti hanno valutato, per ciascuna attività, se avrebbero potuto completarla senza l’aiuto dell’IA mantenendo la stessa portata e qualità. Su 455 compiti completati con supporto IA, 151 (circa un terzo) sono stati giudicati “non realizzabili senza IA”. Questi compiti sono stati distribuiti su 27 dei 56 partecipanti, dimostrando che non si tratta di pochi utenti esperti ma di un fenomeno diffuso. In questi casi, l’IA non ha solo accelerato il lavoro, ma lo ha reso possibile.
Processo decisionale: proposte dell’IA, scelta umana
Per quanto riguarda metodi e parametri, il modello “IA propone, uomo sceglie” è stato osservato nel 55,4 % dei casi, risultando la modalità più frequente. In termini assoluti, gli esseri umani hanno preso l’85,5 % delle decisioni su metodi e parametri, mentre l’IA ha assunto solo il 9,2 % delle decisioni finali. Per gli obiettivi e la portata delle attività, la decisione finale umana sale al 93,4 %.
Il contributo dell’IA alle proposte varia dal 17 al 55 % a seconda del tipo di decisione, ma la sua influenza sulle decisioni finali rimane costantemente a una cifra a una cifra (unità). Anche nelle 151 attività valutate come indispensabili per l’IA, gli esseri umani hanno scelto l’obiettivo nel 95,4 % dei casi.
Ruolo umano: contesto, non lavoro manuale
Nel caso dei problemi, l’analisi di 588 compiti con difficoltà registrata mostra che il 76 % è stato risolto grazie a interventi umani, mentre il 23 % è stato gestito autonomamente dall’agente. L’intervento umano consiste quasi sempre in informazioni aggiuntive (35,2 %) o in diagnosi e cambi di metodo (34,7 %). L’effettiva “lavorazione manuale” da parte dell’uomo è rara: solo il 3,2 % delle sotto‑attività è stato eseguito direttamente da persone, e solo lo 0,7 % è stato interamente preso in mano dall’uomo.
Revisione dei risultati dell’IA
Quando i risultati prodotti dall’IA sono stati rivisti, la macchina ha effettuato il 75,4 % delle modifiche in modo autonomo, basandosi su feedback forniti dagli esseri umani. In pratica, il giudizio critico resta umano, ma l’esecuzione è delegata quasi interamente all’IA.
Fasi di evoluzione dell’IA
- Fase 1: IA come puro oggetto di ricerca.
- Fase 2: IA esegue compiti singoli.
- Fase 3: IA diventa partner di progetto, elaborando piani all’interno di obiettivi fissati dagli umani.
Gli autori ipotizzano una possibile quarta fase, caratterizzata da “auto‑miglioramento ricorsivo”, in cui modelli più potenti generano a loro volta versioni successive più avanzate.
Auto‑miglioramento ricorsivo
Il team sottolinea che un modello può migliorare nella risoluzione dei propri compiti di addestramento senza necessariamente diventare più efficace nel creare il suo successore. Resta incerto, ad esempio, come l’IA possa generare molteplici direzioni di ricerca e valutarne il valore prima che i risultati