Il recupero di informazioni è cruciale nei flussi di lavoro a multi-step dove un cattivo recupero può causare agli agenti l'individuazione di contesti irrilevanti, query ripetute, spreco del budget di token e introduzione di rumore nei passaggi successivi del ragionamento.

Oggi, NVIDIA annuncia il lancio di NVIDIA Nemotron 3 Embed, una collezione di modelli di embedding open-source e commerciali progettati per migliorare la qualità del recupero, offrendo agli sviluppatori opzioni pratiche per il deployment su larga scala in contesti RAG, recupero agente, recupero del codice e memoria per agenti.

Modelli Nemotron 3 Embed e Leaderboard

La collezione include tre modelli aperti che raggiungono standard di stato dell'arte in termini di qualità-efficienza, guidati da un modello 8B che si piazza in cima alla RTEB, nonché da efficienti varianti da 1B adatte a deployment su larga scala:

    • Nemotron-3-Embed-8B-BF16
    • Nemotron-3-Embed-1B-BF16
    • Nemotron-3-Embed-1B-NVFP4

Nel giugno 2024, Nemotron-3-Embed-8B-BF16 si è classificato al primo posto nella leaderboard multilingua RTEB. Questo rappresenta un significativo avanzamento per il settore del recupero.

Oltre ai risultati del RTEB, Nemotron 3 Embed introduce un set funzionale pronto per i deployment aziendali.

Valutazione di Qualità, Efficienza e Distribuzione di Modelli

Valutiamo i modelli Nemotron 3 Embed in base a tre dimensioni principali: qualità del recupero, efficienza agente e trade-off di deployment. Il modello da 8B definisce il limite della qualità di questa suite, mentre le varianti da 1B BF16 e NVFP4 portano lo stesso focus al recupero in contesti a basso costo e alta efficienza operativa.

Prestazioni sui Benchmark

Iniziamo valutando i modelli su RTEB, dove Nemotron-3-Embed-8B-BF16 ha ottenuto il ranking #1. Abbiamo inoltre testato i modelli su ViDoRe V3 Text, MMTEB Retrieval e LongEmbed utilizzando una media NDCG@10.

La figura seguente mostra l’accuratezza del recupero calcolata in termini di NDCG@10 su RTEB, ViDoRe V3 Text, MMTEB Retrieval e LongEmbed, con confronti con le generazioni precedenti di modelli Nemotron.

Recupero in Contesti Agentici

Per valutare il recupero in contesti agentici, abbiamo utilizzato un agente di ricerca potenziato da Nemotron 3 Ultra, variando il modello di embedding utilizzato nel sistema di recupero.

Un recupero più accurato può restituire prove rilevanti molto prima, aiutando l'agente a evitare ricerche ripetute, ragionamenti inutili e ispezioni del contesto. Confrontiamo l’accuratezza media del recupero con il costo stimato in termini di token agente per query su ViDoRe V3, BRIGHT e BrowseComp-Plus.

I test mostrano chiaramente che un miglior recupero riduce il costo agente medio in termini di token utilizzati. I recuperatori più precisi forniscono prove rilevanti tempestivamente, permettendo agli agenti di completare compiti con meno ricerche ripetute e turni di ragionamento. In questi test, i modelli Nemotron 3 Embed avanzano il fronte del recupero agente, con il modello da 8B che fornisce sia la massima accuratezza media del recupero che il minimo costo stimato in termini di token.

Efficienza in Ambienti ad Alta Efficienza

Per ambienti ad alta efficienza, spesso si preferiscono modelli di embedding più piccoli per rispettare obiettivi di latenza e costi. Nemotron-3-Embed-1B-NVFP4 cerca di ridurre il divario tra efficienza e accuratezza utilizzando accelerazione nativa NVFP4 sulle architetture NVIDIA Blackwell. Questo modello quantizza i pesi e le attivazioni delle celle lineari a NVFP4 per un'efficienza inferenziale maggiore e utilizza Quantization-Aware Distillation (QAD) per recuperare accuratezza in lunghe stringhe di input.

Confronto con Modelli di Base

La figura seguente mostra la precisione del recupero nel benchmark ViDoRe V3 rispetto all'efficienza di servizio, confrontando Nemotron-3-Embed-1B-NVFP4 con alcuni modelli open-source più piccoli, come Qwen3-Embedding-0.6B e EmbeddingGemma-300M.

Prestazioni ad Enterprise Scale

Nel contesto di sistemi di recupero su larga scala, la stack di servizio deve mantenere questa efficienza anche con carichi reali di richieste, diversi tipi di lunghezze di input e una vasta gamma di obiettivi hardware.

Per rendere Nemotron 3 Embed performante a livello enterprise, presentiamo anche un NVIDIA NIM microservizio ottimizzato per il modello da 1B token. Come mostrato nella figura seguente, il servizio Nemotron 3 Embed in Rust corrisponde o supera il checkpoint vLLM su GPU NVIDIA GB200 e RTX PRO 6000 per lunghezze di input di 256 e 1024 token.

Architettura e Allenamento

Nemotron-3-Embed-8B-BF16 utilizza la struttura base Ministral-3-8B-Instruct-2512, convertendo il decoder causale in un encoder bidirezionale per il recupero su lunghe sequenze. Il modello è stato addestrato con un pre-addestramento contrastivo su dati web e synthetici, seguito da un addestramento fine-tunable su dataset curati multilingue per settori come legale, finanziario, medico, aziendali e scolastico.

Questo modello da 8B è il fulcro della suite, mentre checkpoint da 8B di versioni precedenti sono stati utilizzati nell'insegnamento per la generazione di modelli 1B ad alta efficienza.

Compressione e