Il ruolo cruciale della performance, dell'efficienza e dell'ottimizzazione nel calcolo inferenziale

Nel panorama contemporaneo dell'intelligenza artificiale, tre fattori determinano l'economia dell'inferenza: la performance del sistema, l'efficienza nell'infrastruttura scalabile e l'ottimizzazione software continua. Questi tre elementi costituiscono i pilastri su cui si costruisce il valore duraturo per le organizzazioni che investono in infrastrutture AI. Una performance di sistema più elevata si traduce direttamente in una generazione di più token, il che a sua volta significa ricavi più alti per le piattaforme di servizio. Un'efficienza di scaling superiore implica che la velocità di elaborazione cresca proporzionalmente all'aggiunta di hardware, richiedendo meno risorse per servire gli utenti su larga scala. Un'ottimizzazione continua del software consente di estrarre più valore dagli investimenti infrastrutturali già effettuati.

Alla base di tutti questi fattori risiede un principio fondamentale: la fungibilità della piattaforma. L'infrastruttura NVIDIA è stata concepita per eseguire qualsiasi modello, qualsiasi carico di lavoro, dai compiti di training all'inferenza, dai sistemi di raccomandazione ai modelli di ragionamento, dal processing del linguaggio naturale all'elaborazione video. Questa versatilità garantisce un'utilizzazione dell'hardware sempre elevata, minimizzando i tempi di inattività e massimizzando il ritorno sull'investimento tecnologico.

Il debutto della Vera Rubin NVL72 in MLPerf Inference v6.1

I risultati di MLPerf Inference v6.1, resi pubblici oggi, confermano come la piattaforma NVIDIA sia stata progettata espressamente per ottimizzare tutti questi aspetti critici. La novità più significativa è il debutto della Vera Rubin NVL72, sistema che rappresenta un salto generazionale in termini di capacità computazionali per l'inferenza AI.

Nella sua prima presentazione come submission preview a MLPerf Inference v6.1, il sistema NVIDIA Vera Rubin NVL72 ha registrato prestazioni leader, consegnando un throughput fino a 3.7 volte superiore rispetto al sistema GB300 NVL72. Questi risultati sono stati ottenuti su due dei benchmark più esigenti dell'intera suite MLPerf Inference v6.1: DeepSeek-R1 e Qwen3-VL. Su DeepSeek-R1, utilizzando la libreria NVIDIA TensorRT-LLM, il throughput del Vera Rubin è risultato fino a 2.5 volte superiore rispetto a GB300 NVL72. Questi numeri illustrano chiaramente l'accelerazione del ritmo di innovazione di NVIDIA e come la performance continuerà a migliorare attraverso ottimizzazioni software incessanti.

Per comprendere l'importanza pratica di questi numeri, è necessario considerare le implicazioni economiche. Ogni rack Vera Rubin NVL72 è ora in grado di consegnare significativamente più token, servire un numero maggiore di utenti e generare più ricavi rispetto a un rack GB300 NVL72, il tutto mantenendo un costo per token inferiore. Questo rappresenta un vantaggio competitivo sostanziale per le organizzazioni che operano infrastrutture di inferenza AI su larga scala.

Architettura e design cointegrato hardware-software

I risultati eccezionali ottenuti dal Vera Rubin NVL72 sono il frutto di un design cointegrato che abbraccia l'intera catena di sviluppo: hardware e software sono stati sviluppati in parallelo con l'obiettivo di massimizzare le sinergie tra i due componenti. L'architettura Vera Rubin incorpora Tensor Core migliorati e un Transformer Engine potenziato che accelerano sia la fase di prefill che quella di decode dell'inferenza. Questi due stadi sono cruciali: il prefill è responsabile dell'elaborazione del contesto iniziale, mentre il decode genera i token successivi uno alla volta.

Un elemento chiave del design è l'adozione della precisione NVFP4, che riduce significativamente l'impronta di memoria necessaria per i pesi del modello, l'attenzione e la cache KV (Key-Value). Questa riduzione della memoria consente di aumentare il throughput mantenendo una qualità dell'output minima perdita. Per modelli particolarmente grandi come DeepSeek-R1 e Qwen3-VL, questa ottimizzazione rappresenta un cambio di gioco decisivo.

Le submission del Vera Rubin hanno fatto un ampio utilizzo della serving disaggregata, una tecnica sofisticata che separa le operazioni di prefill e decode, combinandola con parallelismo di esperti su larga scala per massimizzare l'efficienza attraverso i layer di mixture-of-experts che alimentano modelli come DeepSeek-R1 e Qwen3-VL. Questa architettura permette di allocare le risorse computazionali in modo più intelligente e granulare.

L'infrastruttura di interconnessione è fornita dall'NVLink di sesta generazione di NVIDIA e da NVLink Switch, che consente di raggiungere velocità di packet 10 volte superiori e latenze 3 volte inferiori rispetto alle soluzioni Ethernet commerciali standard. Questa fondazione di interconnessione è quella che rende possibile l'implementazione effettiva di tecniche avanzate come la disaggregated serving a livello di rack.

Performance su modelli specifici e scenari di utilizzo

Analizzando i risultati in dettaglio su specifici benchmark e scenari, emerge un quadro ancora più ricco della capacità del Vera Rubin NVL72. Su Qwen3-VL, il sistema ha registrato un throughput fino a 3.7 volte superiore rispetto a GB300 NVL72 attraverso scenari offline, server e interattivi, utilizzando vLLM insieme al framework di inferenza open source NVIDIA Dynamo. Questi tre scenari rappresentano diverse modalità di utilizzo nel mondo reale: offline si riferisce all'elaborazione batch asincrona, server ai servizi in tempo reale con bassa latenza, e interattivo alle applicazioni che richiedono risposte rapide durante un'interazione in corso.

Il codesign si estende anche all'ecosistema dei partner di NVIDIA. Nebius, un importante provider infrastrutturale, ha anch'esso presentato submission preview results per il Vera Rubin NVL72, dimostrando performance eccellente e validando la capacità della piattaforma di fornire valore coerente attraverso partner diversi.

Inferenza agentica e il nuovo paradigma di misurazione

Un aspetto particolarmente interessante emerso dai test è la performance superiore del Vera Rubin NVL72 su carichi di lavoro di intelligenza artificiale agentica. Gli agenti AI, che ragionano, pianificano e agiscono attraverso molteplici step decisionali, stanno trasformando il modo in cui la performance dell'inferenza viene misurata e valutata. Nei benchmark appositamente progettati per catturare questo cambio di paradigma, come SemiAnalysis AgentX, il Vera Rubin NVL72 ha consegnato una performance 30 volte superiore rispetto a GB300 NVL72 nei test preview. Questo risultato suggerisce che la nuova architettura è particolarmente ben ottimizzata per i workload agentico, una categoria destinata a crescere significativamente nei prossimi anni.

In anticipazione di questa tendenza, il prossimo benchmark MLPerf Endpoints porterà misurazione standardizzata ai workload di inferenza agentica, andando oltre quello che i benchmark tradizionali di throughput possono catturare. Questo rappresenta un importante passo verso la creazione di metriche più rappresentative dei carichi di lavoro reali che le organizzazioni si trovano ad affrontare.

Efficienza di scaling del GB300 NVL72

Mentre il Vera Rubin NVL72 rappresenta l'innovazione più recente, il sistema GB300 NVL72 continua a dimostrare eccellenza in aree specifiche, in particolare nell'efficienza di scaling. L'efficienza di scaling è un indicatore critico della produttività dell'infrastruttura AI, poiché misura quanto effettivamente le GPU aggiuntive si traducono in guadagni di throughput. Non è sufficiente che un'organizzazione acquisti più GPU; è essenziale che quelle GPU siano interconnesse e orchestrate in modo tale che ogni GPU contribuisca effettivamente a un aumento proporzionale della performance complessiva.

NVIDIA consegue questa efficienza attraverso tre canali complementari: interconnessioni scale-up ad alta larghezza di banda e bassa latenza all'interno di ogni rack, networking ad alta larghezza di banda tra i rack e orchestrazione efficiente delle richieste attraverso i nodi. L'implementazione tecnica di queste tre componenti richiede un allineamento meticoloso tra hardware, firmware e software di orchestrazione.

Nel test di scaling DeepSeek-R1, la submission di NVIDIA è partita da un singolo rack GB300 NVL72 (contenente 72 GPU) e ha scalato fino a quattro rack completi (totalizzando 288 GPU), raggiungendo un'efficienza di scaling del 99% nello scenario offline. Il throughput è cresciuto quasi proporzionalmente all'hardware aggiunto, risultato che evidenzia l'eccellenza dell'architettura progettuale. Questo tipo di efficienza di scaling è decisivo dal punto di vista economico: se l'aggiunta di quasi il doppio del numero di GPU generasse solo un miglioramento a una singola cifra percentuale nel throughput, il costo dell'infrastruttura supererebbe di gran lunga il ritorno in termini di performance. L'architettura, l'interconnessione e il software devono scalare insieme in armonia.

Il GB300 NVL72 ha inoltre dimostrato eccellenza nell'efficienza a livello di rack sul benchmark WAN 2.2 text-to-video, raggiungendo 0.65 video 720p al secondo con una latenza di 5.7 secondi per video. Questo rappresenta un throughput 9 volte superiore e una latenza 7.5 volte inferiore rispetto a un singolo nodo, illustrando come l'architettura di interconnessione superiore consenta miglioramenti significativi anche per carichi di lavoro video-generativi, un campo di crescente importanza commerciale.

Ottimizzazioni software e cicli di innovazione continua

Un altro elemento differenziante della piattaforma NVIDIA è il ciclo continuo di sviluppo software che genera miglioramenti persistenti di performance e funzionalità. La base di codice NVIDIA per l'inferenza è sottoposta a sviluppo incessante, con team dedicate che identificano colli di bottiglia, implementano ottimizzazioni specifiche per il dominio e sfruttano le nuove caratteristiche dell'hardware appena rilasciato.

Nella transizione dalla versione v6.0 alla v6.1 di MLPerf, il sistema GB300 NVL72 ha registrato miglioramenti di performance su Qwen3-VL di fino a 1.6 volte. Questi guadagni sono stati ottenuti attraverso un insieme di ottimizzazioni tecniche complementari: riduzione della precisione della cache KV, ulteriore fusione di kernel, sviluppo di kernel migliorati e implementazione della serving disaggregata utilizzando vLLM in combinazione con NVIDIA Dynamo. Ogni una di queste ottimizzazioni rappresenta mesi di lavoro ingegneristico mirato.

Particolarmente rilevante è il fatto che l'ottimizzazione software ha continuato a progredire anche dopo la deadline di submission per v6.1. I risultati post-submission, non ancora verificati formalmente da MLCommons, su benchmark come GPT-OSS-120B e DLRMv3 mostrano ulteriori guadagni di performance. Questo ciclo continuo di miglioramento rappresenta un impegno strategico di NVIDIA verso il mantenimento della leadership attraverso velocità di innovazione sostenuta.

Stack tecnologico completo da edge a cloud

Oltre ai risultati dei sistemi Grace Blackwell e Vera Rubin NVL72, NVIDIA ha anche presentato i risultati del Jetson AGX Thor utilizzando NVIDIA TensorRT Edge-LLM sul benchmark Edge-Agentic appena introdotto, eseguendo il modello Qwen3.6-27B. Questa presentazione evidenzia il commitment di NVIDIA verso il supporto dell'inferenza AI lungo l'intero spettro dei dispositivi e delle scale, dal margine della rete (edge) fino ai più grandi data center (cloud e AI factories).

L'ecosistema di partner di NVIDIA ha partecipato in modo estremamente ampio alle submission di MLPerf Inference v6.1, con un totale di 19 partner che hanno presentato risultati. Tra questi partner, otto hanno operato sistemi multi-node Blackwell NVL72, dimostrando performance eccellente. L'elenco completo dei partner partecipanti include: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE (Hewlett Packard Enterprise), Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro e Wiwynn. Questa partecipazione estesa valida la posizione centrale di NVIDIA nell'ecosistema infrastrutturale globale e dimostra la capacità dei partner di implementare e sfruttare efficacemente la piattaforma NVIDIA.

Implicazioni strategiche per le decisioni infrastrutturali

Per le organizzazioni che si trovano a prendere decisioni critiche riguardanti gli investimenti in infrastruttura AI, i risultati di MLPerf Inference v6.1 forniscono dati empirici significativi. La performance assoluta, l'efficienza di scaling e la velocità di innovazione software sono tre variabili che determinano direttamente l'economia dell'inferenza nel lungo termine. Un'infrastruttura che consegna performance superiore permette di servire più utenti con lo stesso numero di GPU, o di raggiungere gli stessi livelli di servizio con un numero inferiore di GPU.

L'efficienza di scaling è particolarmente importante per le organizzazioni che prevedono di espandere i loro workload nel tempo. Un sistema che scala inefficientemente diventa rapidamente antieconomico man mano che cresce. La velocità di innov

Lire l'article original →
← Retour aux actualités