NVIDIA ha presentato Nemotron-Labs-TwoTower, un modello linguistico di diffusione costruito su un backbones autoregressivi congelato: Nemotron-3-Nano-30B-A3B. Questo modello viene distribuito con i pesi aperti in base alla NVIDIA Nemotron Open Model License ed è ideato per superare i limiti di throughput nella generazione del testo.

Come Funziona il Modello

I modelli autoregressivi (AR) generano testo token per token in un processo seriale, che limita la velocità complessiva di generazione. Al contrario, i modelli di diffusione generano token in parallelo e iterativamente raffinano i risultati.

Due Torri, Diverse Funzioni

Nemotron-Labs-TwoTower differisce da molti modelli di diffusione in quanto divide le attività principali in due torri distinte. Una torre è utilizzata per rappresentare i token “puliti” (context), l'altra (denoisier) serve per raffinare i token corrotti. Questa separazione mantiene il 98.7% della qualità di base e raggiunge un throughput di generazione 2,42 volte più veloce rispetto al modello seriale (gamma=0.8, S=16, 2×H100).

    "
    • La torre di contesto congelata fornisce uno stato Mamba-2 che inizializza la torre denoisier.
    "
    • La torre denoisier viene addestrata su circa 2.1T token. Il backbone, invece, ha beneficiato di 25T token per il preprocessamento.
    "
    • Sono disponibili tre modi di inferenza: mask diffusion (default), mock-AR, ed AR tradizionale.
    "

Scheda Tecnica

Ogni torre contiene 52 strati, suddivisi in 23 Mamba-2, 6 attention e 23 Mixture-of-Experts (MoE) (128 esperti, di cui 6 attivi, 2 condivisi). Le due torri sommano circa 60B di parametri totali. Il modello richiede circa 59GB per GPU in BF16 per l'elevata precisione.

Dettaglio di Funzionamento delle Due Torri

La torre AR context legge in modo causale i token forniti e genera una cache per ogni strato. Questo mantiene la capacità autoregressiva del backbone.

La torre denoisier affina i blocchi rumorosi in blocco, mantenendo una struttura causale rispetto ai blocchi puliti. L'attenzione cross-layer tra torri (stesso strato) consente l’accesso multiscala alla rappresentazione delle informazioni presenti nel modello.

Miglioramenti

    "
    • Il denoisier utilizza un conditioning adaLN-time per ciascun layer.
    "
    • I parametri aggiunti per il conditioning adaLN sono circa 1.5M, il che rende il modello leggermente più snello.
    "

Generazione Token per Token

Il modello opera a blocchi di dimensioni fisse S. In ogni passo, ogni blocco inizia come una serie di token mascherati, che vengono raffinati nell’arco di T step (stepsperblock). Il passo successivo aggiunge nuovi blocchi, con un numero variabile di token generati per passo.

Esempio di Generazione

DueTower genera in parallelo diversi token a ogni step iniziale, superando l’approssimazione token per token dei classici AR. Questo permette di mantenere buone performance qualità-velocità.

Risultati dei Test

I test sono stati effettuati con BF16 su 2×H100. Con le impostazioni predefinite (confidence threshold=0.8, block size=16), la tabella mostra il confronto con il modello AR di base.

" " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " " "
TaskNemotron-3-Nano-30B-A3B (AR)Nemotron-Labs-TwoTower (diffusion)
MMLU (5-shot, acc)78.5678.24
MMLU-Pro (5-shot, CoT EM)62.5960.93
ARC-Challenge (25-shot, acc_norm)91.7292.66
WinoGrande (5-shot, acc)76.0976.09
RACE (0-shot, acc)88.9088.90
HumanEval (0-shot)79.2775.58
MBPP-Sanitized (3-shot)74.7174.28
GSM8K (8-shot, acc)92.4990.14
MATH-500 (4-shot)84.4080.60
MMLU Global Lite (5-shot)73.9773.94
MGSM (8-shot, avg acc)80.8080.40
Quality retained100%98.7%
Generation throughput (× AR)1.0×2.42×

Usi Pratici

I tre modi principali di utilizzo di Nemotron-Labs-TwoTower sono:

    "
    • Mask Diffusion: utilizza block_size tokens a ogni passo per massimizzare la velocità.
    "
    • Mock-AR: funziona come un modello AR simulato, ottimizzato per trade-off specifici.
    "
    • AR diretto: per confronto e validazione.
    "

I Vantaggi

    "
    • DueTower mantiene una quota molto alta della qualità AR in condizioni di massima throughput.
    "
    • Il modello è adatto ad applicazioni che richiedono generazioni rapide su base batch: ad esempio, il generatore di dati sintetici.
    "
    • Può essere utilizzato per testare e scegliere il più adatto trade-off qualità/velocità in base al valore di gamma.
    "
    • Supporta diverse generazioni di token in base alla richiesta: AR, diffusion o mock.
    "

I Limiti

    "
    • Richiede due GPU per funzionare a piena potenza (59 GB cadauna in BF16).
    "
    • In ambienti interattivi e ad alte prestazioni di output, i miglioramenti non superano i 3 volte il throughput base per non compromettere troppo la qualità.
    "
    • La capacità matematica e di programmazione degradano più velocemente di quelle generaliste.
    "
  • La versione rilasci