La Svolta da Costi di Chip al Costo per Token

Con il passaggio da sperimentazioni AI a vere e proprie fabbriche AI, le decisioni sull'infrastruttura si sono spostate dalle prestazioni massime delle GPU alle prestazioni per token. Il costo per token diventa un metro di valutazione centrale: quante unità utili di token può fornire un sistema per dollaro, per wattato, e entro i target temporali.

I stack software per l'inferenza, co-progettati con GPU, CPU, networking e sistemi NVIDIA, migliorano continuamente le prestazioni hardware. Sulla piattaforma NVIDIA Blackwell, la riduzione del costo per token è arrivata fino a 5 volte per il modello DeepSeek V4 in meno di un mese.

Applicazioni e Aziende che Beneficiano del Stack Inference NVIDIA

Numerose aziende e fornitori di servizi stanno oggi sperimentando un valore multiplo grazie al software di inferenza NVIDIA su NVIDIA Blackwell:

    • Baseten utilizza TensorRT-LLM per servire DeepSeek V4 Pro per ragionamenti, coding e contenuti di lunga durata, con un aumento del 50% di token per secondo grazie a ottimizzazioni del runtime proprietarie.
    • Cognition gestisce i GPU con Dynamo Inference Framework, offrendo una soluzione scalabile per il Machine Learning senza dover sviluppare l'infrastruttura da zero.
    • Deep Infra utilizza il stack NVIDIA per servire modelli open source su Blackwell fin dal primo giorno.
    • DigitalOcean ha aiutato Hippocratic AI con il software NVIDIA per aumentare il throughput dell'inferenza del 30%, mantenendo un tempo di risposta sotto mezzo secondo su 10 milioni di chiamate.
    • Together AI ha utilizzato TensorRT-LLM per ottenere migliori risultati real-time di modello sull’inferenza per Cursor.

Perché il Software è Critico per l'Economia dell'Inferenza

Trasformazioni complesse richiedono ottimizzazione su stack software completo. A differenza dei tradizionali carichi di lavoro web e servizi online, l'AI agente distribuisce e gestisce workflow tra diverse componenti, spesso con interazioni di stato complesse.

I software stack determinano se tutta questa complessità può essere gestita efficientemente o finisca in sprechi. Il costo per token si riduce quando il software ottimizza le prestazioni di sistema. Il stack di inferenza NVIDIA lo fa collegando tre livelli chiave:

Gestione Operativa

Questo livello coordina la distribuzione, la gestione del memory e l'autoscaling, permettendo l'esecuzione dell'inferenza su risorse ottimizzate.

Accelerazione Applicativa

Con modeli ad alte performance, e permettendo ai developer di ottenere risultati tramite ottimizzazioni run-time, come fusione kernel e sovrapposizione di calcolo e comunicazione.

Accesso all'Infrastruttura

Espongono le capacità delle GPU NVIDIA senza richiedere ai sviluppatori di gestire ogni protocollo di dati o set di istruzioni del dispositivo singolarmente.

Il software di NVIDIA include ottimizzazioni model serving, scheduling runtime e accesso hardware-aware, consentendo di raggiungere performance significative e ridurre i costi sull'utilizzo.

Ottimizzazione Composta e Prestazioni Moltiplicate

Insieme, ottimizzazioni software e hardware si compone e producono effini esponenziali: servizi disaccoppiati, parallelismo esperto, precisione NVFP4 e predizione multi-token possono aumentare fino al 20x la capacità throughput su Blackwell per GPU.

Il grafico sottostante mostra i risultati ottenuti: miglioramenti complessivi, riconducibili a una coordinazione di tutto lo stack, da operazioni di servizio a librerie di comunicazione e gestione memory. Il framework NVIDIA inference software stack è progettato appositamente per far interagire tra loro ogni strato, in modo che ogni ottimizzazione si costruisca su un altra.

Open Source Aumenta l’Avvantaggio del Stack Completo

Gli sviluppi open source amplificano la forza del modello completo. I framework AI open source più utilizzati oggi si basano originariamente su CUDA, il che ne implica una performance nativa su GPU NVIDIA fin dalla release.

Ad esempio, PyTorch dal 2016 ha native support for CUDA. Collaborando, NVIDIA e PyTorch hanno introdotto nuove innovazioni come Tensor Core, Transformer Engine e NVFP4 che aumentano efficienza e capacità su GPU.

Rotture di paradigma come DFlash, che può offrire velocità 15 volte superiore, o l’elaborazione video con FastVideo, in grado di realizzare video 1080p in 5 secondi, sono disponibili su PyTorch e immediatamente sfruttabili su NVIDIA. Quando modelli di frontiera come DeepSeek V4 vengono pubblicati, vLLM e SGLang li integrano in day-zero deployment recipes per architetture NVIDIA GB200.

Il motore di ottimizzazione open source di CUDA permette di ottenere incrementi di token throughput e di ridurre il costo per token su NVIDIA Blackwell già a 5x rispetto al mese precedente.

Un Ecosistema che Moltiplica la Performance

Ciò che distingue NVIDIA è la capacità di moltiplicare le performance hardware attraverso software complesso. Collaborando con framework open source, CUDA-native, permette ai sviluppatori di accelerare il progresso in campo AI.

Lo stesso meccanismo open source che ha reso possibili miglioramenti rapidi su modelli specifici, si estende al mondo reale. Le aziende che implementano questi framework sperimentano miglioramenti che, a loro volta, ritornano all’ecosistema con nuove ottimizzazioni. Così, il software migliora, il costo per token si riduce ulteriormente, e l’intero stack si rafforza.

Se desideri approfondire come il software moltiplica le performance hardware, consulta questo Podcast NVIDIA AI sul tokenomics e visita questa pagina sulle soluzioni di inferenza.