NVIDIA ha presentato Nemotron-Labs-3-Puzzle-75B-A9B, una versione compressa del modello ibrido MoE Nemotron-3-Super. Lo scopo principale è stato quello di raggiungere un throughput doppio per i server, mantenendo il livello di precisione e di utilizzare meno risorse per gestire più utenti contemporaneamente.

Compressione del modello

Il modello originale Nemotron-3-Super ha 120,7 miliardi di parametri totali e 12,8 miliardi attivi. Il modello compresso presenta invece 75,3 miliardi di parametri totali e 9,3 miliardi attivi. La compressione ha portato a un uso più efficiente della memoria e a un aumento significativo dell'efficienza computazionale.

    • Super Total Parameters: 120,7B
    • A9B Total Parameters: 75,3B (62,4%)
    • Super Active Parameters: 12,8B
    • A9B Active Parameters: 9,3B (73,1%)

Le dimensioni del modello sono state ridotte in modo mirato. Ad esempio, i canali Mamba SSM sono passati da 128 a 96 (75%) e i parametri attivi dei blocchi MoE sono ridotti in media al 30,9%.

Prestazioni e throughput

La versione A9B ha mostrato aumento del throughput del server quando utilizzato su dispositivi B200 e H100. I dati riportati in tabella confermano miglioramenti significativi in diversi scenari di richiesta:

    • Scenario 50K/2K: aumento del throughput da 5.128 a 8.210 token/s (1,60x)
    • Scenario 8K/64K: aumento del throughput da 20.939 a 42.601 token/s (2,03x)

Il miglioramento maggiore si verifica nei test di decodifica più intensi. In particolare, il modello A9B riesce a gestire fino a 8 richieste contemporanee su un unico chip H100 grazie alla riduzione delle dimensioni della memoria.

I dati della risposta

Di seguito sono mostrati i dati specifici di compressione e riduzione della capacità:

Componente Super A9B Rapporto
Parametri totali 120,7B 75,3B 62,4%
Parametri attivi 12,8B 9,3B 73,1%
Stato Mamba SSM 128 96 75%
Dimensione intermedia esperti MoE 2688 1280-2688 Media del 59,9%
Attivazione esperti per token 22 4-18 Media del 50%
Capacità attivata 100% 8,7%-62,3% Media del 30,9%

Comprese e ottimizzate

Il modello A9B mantiene la stessa architettura bloccata della versione originale. Tuttavia, l'approccio di ricerca iterativa ha permesso il mantenimento ottimizzato delle capacità specifiche. L'implementazione Puzzletron ha utilizzato un'architettura di ricerca neurale per selezionare le implementazioni ottimali per ogni livello, rispettando i vincoli di utilizzo.

Le tecniche di pruning utilizzate sono state:

    • Puning dei canali intermedi: valutare il contributo di ogni canale e ridurre in base al contesto.
    • Riduzione di top-k: ridurre il numero di esperti attivati a seconda dello strato, fino al massimo k=22.
    • Pruning Mamba SSM: abbassare il numero di canali dal 128 al 96, con miglioramenti della velocità di decodifica fino al 1,3x.

Il processo di ricerca è stato iterativo, con tre fasi specifiche:

    • Prima fase: riduzione del 75% dei parametri MoE e SSM, riallineamento con dati di 24B token.
    • Seconda fase: riduzione del 60% dei parametri MoE, riallineamento con dati di 43,2B token.
    • Terza fase: riduzione del 50% della capacità di attivazione, riallineamento con dati di 52,8B token.

Queste fasi hanno permesso alla versione A9B di mantenere una buona performance nei benchmark MMLU-Pro, GPQA, HLE, AA-LCR, LiveCodeBench, SciCode e RULER-256K.

La quantizzazione e l'efficacia dell'insegnamento

I dati mostrano che la versione A9B è ottimizzata per dispositivi moderni, come Hopper e Blackwell. La versione FP8 supporta Hopper e la versione NVFP4 ha un'ottima adesione a Blackwell.

Le tecniche utilizzate sono state:

    • Calibrare la quantizzazione su dati post-addestrati.
    • Utilizzare il formato FP8 per la cache KV e le matrici GEMM.
    • Mantenere una precisione elevata con FP8 per lo stato Mamba.

La versione A9B richiede meno memoria e ha un miglioramento del throughput di circa 1,91x rispetto a Super su nodi 8xH100, e 1,82x sui nodi H100.

Conclusione

Nemotron-Labs-3-Puzzle-75B-A9B rappresenta un progresso significativo nella gestione della potenza computazionale e della larghezza di banda. La sua capacità di supportare fino a 8 richieste contese e di raggiungere un throughput superiore dimostra la robustezza e l'efficienza del modello. Tale risultato si traduce in un risparmio di risorse e in una maggiore capacità di gestione dei carichi di lavoro intensivi.

Gli sviluppatori potranno sfruttare questa tecnologia per migliorare la scalabilità e la capacità di elaborazione, riduce i tempi di decodifica e ottimizzare la gestione dei dati.