Massimi CPU a singolo thread a scala rappresentano una nuova categoria di CPU create per l'era dell'AI agenziale.
Cross the creation and deployment of an agentic system, the CPU is on the critical path for reasoning, response time and learning. CPUs are the processor which executes the work the AI model commands: the tool calling, code execution, data processing, KV-cache and result analysis.
Velocità e Prestazioni: La Chiave Del Successo Degli Agenti
Per gli agenti nel ciclo di produzione dell'AI, la velocità è fondamentale. Più velocemente il CPU riesce ad eseguire un compito, più rapidamente l'agente completa il suo lavoro.
Negli impianti AI, l'utilizzazione dei GPU è la risorsa più preziosa del data center. Ogni volta che un agente deve attendere un compito completato, questo limita il guadagno dell'impianto AI o peggio, influisce sull'uso dei GPU che attendono il risultato del CPU.
I Limiti Degli Attuali Data Center CPU
Per anni, i data center hanno preferito CPU ad alte prestazioni per workstation, ma i nuovi CPU del cloud si stanno spostando verso design a basso costo.
- L'aumento del numero di core per chip ha portato a sacrifici in termini di performance per nucleo
- I chiplet hanno ridotto costi ma ridotto la capacità di accesso alla memoria
- La perdita di prestazioni si traduce in limitazioni per i carichi di lavoro agenziali
Per gli agenti AI, è necessario uno specifico progetto CPU orientato alla massima prestazione a singolo thread a scala.
Che Cos'è Un Max Single-Threaded CPU A Scala?
Un CPU a singolo thread con prestazioni massime mantiene ogni passo di un agente rapido, anche quando il sistema è carico. Ogni nucleo esegue i compiti a piena velocità senza essere compromesso dagli altri nuclei. Questi CPU sono progettati con:
- Forte prestazione per nucleo sotto carico
- Sufficiente larghezza di banda di memoria per alimentare i nuclei attivi
- Latenza prevista
- Capacità per ogni nucleo di completare il compito senza essere influenzato da un altro
NVIDIA Vera: Un Esempio Di Questa Nuova Classe
NVIDIA Vera rappresenta questa nuova classe di CPU. È realizzata per funzionare ottimamente in contesti come agenti, processi di dati, esecuzione di codice e verifiche.
Il motore interno di Vera è Olympus, un core CPU personalizzato di NVIDIA che fornisce un 50% in più di istruzioni per ciclo rispetto alla NVIDIA Grace. Questo è fondamentale perché molti passaggi dell'agente sono sequenziali.
- Vera ha un consumo di memoria LPDDR5X di 1.2TB/s a meno di 40 watt
- Ogni core beneficia della piena performance di memoria del CPU
- 3.4TB/s di larghezza di banda core-carico
In carichi di lavoro CPU saturo, Vera mostra 1.8x prestazione core a core superiori alle CPU x86. Questi miglioramenti si sommano per migliorare la produttività dell'AI factory.
I Partner Testano NVIDIA Vera
Partner e aziende, utilizzando NVIDIA Vera per il loro lavoro quotidiano, hanno registrato risultati impressionanti:
- Completamento 1.5x più veloce di un processo di clone di una repository e test in sandbox
- Avvio simultaneo di sandbox fino a 1.9x più veloce
- 3x miglioramento nella gestione di SQL analytics
- 6x riduzione della latenza in streaming in tempo reale
Un'unica Architettura Per Tutto
Un singolo Vera gestisce l’intera gamma di attività che richiedevano diverse CPU prima:
- Processore GPU host NVIDIA Vera Rubin
- Processore di storage NVIDIA BlueField-4 STX
- Tutti su un architettura singola e un toolchain compatibile
L’Evoluzione Dell’Architettura
NVIDIA non si è fermata alla Vera. Il prossimo CPU Rosa, costruito sul core Rigel, continuerà lo sviluppo di CPU per il periodo agenziale dell’AI.
Rigel, progettato in base alla sua CPU basata su Arm v9.2, offrirà prestazioni per nucleo superiori a quelle di Olympus, mantenedo lo stesso footprint in silicio. I miglioramenti chiave includono:
- Consegna di istruzioni migliorate
- Cache L2 più grande
- Gestione della memoria più efficiente
Verso Il Futuro Dell’AI Agenziale
Nell’era dell’AI Agenziale, miliardi di agenti agiranno in continuo. Ogni azione richiederà l'interazione con un processo CPU. L’efficienza della loop agente si tradurrà in più tempo generatore di guadagno per ogni GPU.
NVIDIA Vera è costruita per quel futuro.