Una decade di co‑engineering tra NVIDIA e CoreWeave
Da quasi dieci anni CoreWeave integra hardware, networking e software NVIDIA in un cloud costruito specificamente per l’intelligenza artificiale. Questa sinergia ha permesso di mantenere un ritorno sull’investimento (ROI) positivo attraverso più generazioni di deployment, dimostrando che le GPU V100 della serie Volta sono ancora operative in workload di clienti a più di un decennio dal loro lancio. Ora, grazie alla nuova infrastruttura Vera Rubin, CoreWeave porta la prossima generazione di capacità NVIDIA in produzione.
Disponibilità di NVIDIA Vera Rubin NVL72 su CoreWeave Cloud
Durante l’evento CoreWeave Fully Connected, tenutosi a San Francisco, è stata annunciata la disponibilità dei sistemi NVIDIA Vera Rubin NVL72 dotati di networking Spectrum‑X da 102,4 Tbit/s Ethernet. Il primo cliente a eseguire workload di produzione su Vera Rubin è Cognition, il laboratorio di IA applicata dietro l’ingegnere software AI Devin.
Cognition sfrutta Vera Rubin con un throughput token 4,8× superiore
Cognition utilizza CoreWeave per il training, il reinforcement learning e l’inferenza in produzione di Devin. In nove mesi la startup è passata a migliaia di GPU su CoreWeave, alimentando i carichi di inferenza. Dopo la consegna dei primi rack di produzione Vera Rubin, Cognition ha confrontato le prestazioni di inferenza con un baseline GB200 NVL72 usando un carico di lavoro reale di ingegneria del software, estratto da un sottoinsieme di task di FrontierCode.
I risultati preliminari mostrano un aumento fino a 4,8 volte del throughput totale di token per i carichi di lavoro SWE‑2 rispetto al GB200. Per Devin ciò si traduce in una generazione di codice in tempo reale più rapida e in ragionamenti a più passi più reattivi.
“Il coding agentico è un workload complesso: contesti lunghi, alta concorrenza e volumi di token dove il costo per token determina cosa possiamo distribuire”, ha dichiarato Silas Alberti di Cognition. “Avere tutto su un’unica piattaforma, con ingegneri NVIDIA e CoreWeave che affrontano i problemi più difficili al nostro fianco, è più importante di qualsiasi singola specifica tecnica.”
CoreWeave Vera CPU e sandbox per carichi agentici
La CPU NVIDIA Vera è progettata appositamente per i carichi di lavoro agentici, dove la latenza bassa e la scalabilità sono critiche. Un indicatore chiave di performance è il numero di ambienti isolati (sandbox) che possono essere eseguiti contemporaneamente mantenendo costanza e velocità.
Un rack Vera CPU ospita 128 CPU e 11 264 core, consentendo più di 11 000 ambienti concorrenti, ciascuno con un core dedicato. Grazie a CoreWeave Sandboxes, questi ambienti sono isolati a livello hardware e operano accanto ai job di training, sfruttando switch Spectrum‑X e DPUs BlueField‑4 per garantire comunicazioni sicure e a bassa latenza.
Nei test interni, CoreWeave ha registrato tempi di avvio delle sandbox più veloci di oltre 3× sui CPU Vera rispetto alle soluzioni precedenti, accelerando significativamente il layer di esecuzione per reinforcement learning, utilizzo di tool da parte degli agenti e valutazione dei modelli.
Su Benchmark Terminal‑Bench, le CPU Vera hanno ottenuto un miglioramento di 1,7× su tutti i task superati, confermando la superiorità della piattaforma per applicazioni agentiche ad alta concorrenza.
CoreWeave Forge: chiudere il ciclo IA dalla produzione al training
Il miglioramento continuo di modelli e agenti avviene attraverso un ciclo: i dati di produzione informano il prossimo training e ogni valutazione affina la versione successiva. Storicamente questo ciclo è frammentato tra strumenti di fornitori diversi, con perdita di segnale a ogni passaggio.
CoreWeave Forge unifica Weights & Biases, l’expertise post‑training di OpenPipe e il progetto open source marimo notebook in un unico ambiente connesso, pensato per il miglioramento continuo di modelli e agenti. La piattaforma rimane aperta a tutti i modelli, framework e cloud.
Nuove funzionalità e servizi
- CoreWeave ARIA (ora disponibile per tutti) assiste gli utenti nella ricerca, codifica e iterazione lungo il ciclo IA, analizzando run, proponendo esperimenti, suggerendo modifiche al codice e archiviandole su GitHub.
- CoreWeave Agent Lens (servizio nuovo) trasforma l’osservabilità degli agenti in miglioramento continuo, aumentando la rilevazione dei fallimenti del 20 % e riducendo i costi di correzione della metà.
- CoreWeave Sandboxes (ora disponibili) consentono l’esecuzione di agenti, chiamate a tool, RL e valutazioni in ambienti isolati su CPU o GPU, sia su infrastruttura serverless che su quella di training esistente.
- Fine‑tuning supervisionato serverless e serverless RL permettono agli utenti di sperimentare ricette di training proprie; il RL serverless è 1,4× più veloce e costa il 40 % in meno rispetto a un setup gestito autonomamente.
- NVIDIA Dynamo, framework open source per l’inferenza in fabbriche AI, alimenta il servizio di inferenza gestita da CoreWeave e il nuovo RL Rollouts (preview privata), che carica checkpoint live senza ri‑deploy, garantendo continuità di apprendimento.
Le prime aziende a costruire su Forge includono Canva, Capital One e MasterClass. I modelli open NVIDIA Nemotron offrono un percorso diretto per personalizzare e distribuire modelli di ragionamento e multimodali per workflow agentici.
Impatto concreto: dalle startup alle imprese globali
Laboratori di IA, aziende native AI