La costruzione di agenti AI è complicata, poiché il mondo reale non si comporta come un benchmark. Un agente che non riesca a recuperare da un'API rovinata o da un flusso di lavoro mai visto non è veramente un agente. È un completatore automatico con strumenti. Passare da un completatore a un agente è un problema di dati: tracce di ingegneria del software, fallimenti nell'uso degli strumenti, ragionamento multistep, recupero, sicurezza, simulazione dell'utente, esecuzione del flusso di lavoro e infine interazione con il mondo fisico. È in questo punto che vivono i prodotti di dati open di NVIDIA Nemotron.
NVIDIA ha recentemente evidenziato come i modelli aperti stiano spingendo la ricerca in AI e si presentino durante la popolare International Conference on Machine Learning (ICML), con quasi 145 articoli che citano i modelli e i set di dati Nemotron. I dati synthetic giocano un ruolo importante in questo ecosistema:
- Parte del motivo per cui NVIDIA rilascia set di dati aperti è per imparare insieme alla comunità per espandere queste varie applicazioni.
I pesi aperti contano. Ma per gli agenti, i pesi sono solo una parte della storia. La riproducibilità dipende anche dai set di dati, da scelte di curazione, ricette di formazione e metodi di valutazione.
Comportamento degli agenti e dati
Il comportamento degli agenti deve essere ispezionabile. Se un modello chiama strumenti, esegue workflow, recupera informazioni e agisce in diversi sistemi, gli sviluppatori devono capire i dati che hanno plasmato tali comportamenti. I dati aperti rendono i comportamenti controllabili e spiegabili. I dati synthetic rappresentano una parte fondamentale del puzzle.
Il vicepresidente di Ricerca Applicata su AI di NVIDIA Bryan Catanzaro ha recentemente notato che "ogni azienda ruota intorno ad un segreto" — un workflow, un corpus o un modello del cliente che i concorrenti non possiedono. Questi segreti rendono l’AI utile, ma le aziende non dovrebbero esporli facilmente. I dati synthetic forniscono agli team un modo per conservare segnali utili senza esporre la sorgente sottostante.
Ecosistema diversificato
Bryan parla anche dello sviluppo di un ecosistema AI diversificato e partecipativo dove aziende, ricercatori, governi e comunità varie possano contribuire. Questo non è solo un valore. È una dichiarazione su dati.
Se ogni modello impara da uno stesso pool ristretto di dati, non dovremmo stupirci che i modelli comincino a sentirsi simili. La parte difficile è che i dati più utili si trovano spesso dentro organizzazioni che non possono o non vogliono rilasciarli direttamente. Tutti traggono beneficio da uno strato di dati condiviso. Nessuno vuole essere il primo a lasciare andare via la cosa che lo rende speciale.
Utilizzo dei dati synthetic
I dati synthetic rilasciati apertamente sono un modo per cambiarlo in modo matematico.
Nei dati aperti di Nemotron, abbiamo rilasciato oltre 10 trilioni di token di pre-allenamento e milioni di esempi post-allenamento che si spalmano su molti domini e forme di dati. Questi numeri sono difficili da gestire — e le tabelle grezze non aiutano molto.
Per rendere più semplice l'esplorazione del contenuto effettivo dei dati post-allenamento di Nemotron, abbiamo costruito l'atlas delle domande Nemotron Post-Training v3: una mappa visiva interattiva dove ogni punto rappresenta un esempio di domanda, estratto dalla collezione post-allenamento di Nemotron v3 e campionati per riflettere sincere proporzioni del set.
Gli sovrapposizioni di colore e filtri ti permettono di reorganizzare la mappa in base al dataset, alla fase di pipeline, al dominio o all'utilizzo degli strumenti. Poiché le domande simili si raggruppano semanticamente, puoi concentrarti su una zona — algoritmi di codifica, sicurezza, matematica, comportamento degli agenti — esaminare esempi rappresentativi e utilizzare questo segnale per curare i dati, costruire valutazioni, o comprendere perché un modello si comporta in un certo modo.
Dati di qualità locale
Gli agenti hanno bisogno di capire le persone che devono supportare, e qui "qualità" diventa un concetto locale, non universale. Un classificatore di tossicità addestrato sui dati dell'internet inglese potrebbe mancare i messaggi ostili in coreano o giapponese, dove l’aggressività è spesso codificata nei livelli di cortesia anziché con vocaboli ovvi. Lo stesso segnale, contesto diverso. Le squadre stanno già implementando questo tipo di agenti.
Nemotron-Personas
Nemotron-Personas è uno sforzo per affrontare questo problema: synthetic personas locali che catturano la diversità e complessità della popolazione. Realizzato utilizzando NeMo Data Designer, il tool per generazione di dati synthetic avanzati di NVIDIA, nemotron-Personas riflette statistiche demografiche e geografiche ufficiali regionali. L'obiettivo non è creare persone vere. In un certo senso, è per aiutare gli sviluppatori a testare se i loro sistemi riflettono effettivamente gli utenti, le lingue, le regioni e le occupazioni che dicono di servire. Lo scorso mese a VivaTech a Parigi, abbiamo lanciato il nostro decimo paese nella collezione, rappresentando ormai oltre 2,4 miliardi di persone.
Quando la qualità è locale, solo coloro che conoscono quel contesto possono costruirla — ricercatori locali, parlanti nativi, esperti di settore, stakeholder che si possono iscrivere e correggere con voi. Questo è apprendere in pubblico: non rilasciare dati in isolamento, ma costruirli collaborativamente.
Integrazione di dati synthetic
I dati synthetic devono essere integrati come parte di un sistema di fonti di dati. Ci sono compromessi. Possono ridurre i rischi, ma non eliminano il bisogno di fondamento, tracciabilità, cura, valutazione e giudizio umano.
Soglie synthetic
Un modo utile per pensarci è con "soglie synthetic": punti in cui i dati non possono essere trattati soltanto come reali. Questa linea non è sempre evidente. I workflow reali, il feedback umano, le tracce generate dal modello, gli utenti simulati e i label synthetic possono intrecciarsi. La risposta non è fingere che i dati synthetic siano fittizi o innocui. È documentare cosa è stato generato, cosa è fondato, cosa è stato rivisto e a cosa i dati sono destinati. Mentre più sistemi AI vengono addestrati su informazioni artificiali, abbiamo bisogno di abitudini condivisi per esaminarli, documentarli e dibattere queste tecnologie in pubblico.
La qualità ha significati diversi in contesti diversi. I dati sul ragionamento devono contenere problemi più difficili e tracce pulite. I dati sulle persone necessitano di fedeltà distributiva e revisione locale. Gli workflow agentic richiedono una varietà di attività