Una nuova frontiera per il supercomputer AI personale

Local AI sta diventando più utile ad ogni token elaborato, grazie alla capacità dei modelli aperti di ridursi abbastanza da poter girare su dispositivi più piccoli. Con l’arrivo di NVIDIA DGX Spark, gli sviluppatori hanno ora a disposizione una workstation compatta capace di eseguire agenti AI in modalità completamente locale, senza dipendere dal cloud.

Il nuovo SKU, disponibile a partire dal venerdì 23 ottobre e venduto dai principali partner OEM – Acer, ASUS, Dell, Gigabyte, HP e MSI – offre 64 GB di memoria unificata e un’intera suite software NVIDIA pronta all’uso fin dal primo avvio.

Specifiche tecniche e configurazione

DGX Spark combina il processore Grace Blackwell GB10, la rete NVIDIA ConnectX‑7 e lo stack software CUDA‑accelerated AI in un unico sistema. La memoria unificata da 64 GB permette di gestire modelli fino a 100 miliardi di parametri direttamente sul dispositivo.

Le caratteristiche chiave includono:

    • Grace Blackwell Superchip GB10 con architettura a basso consumo
    • DGX OS preinstallato con l’intera suite AI di NVIDIA
    • Supporto nativo a toolkit per agenti, librerie CUDA‑X AI, modelli open Nemotron e runtime popolari come Ollama, vLLM e PyTorch con CUDA
    • Connettività integrata NVIDIA ConnectX‑7, pronta per collegamenti QSFP a 200 GbE

Il prezzo di partenza è di 4 999 $, un punto di ingresso accessibile rispetto ai modelli da 128 GB, senza sacrificare la potenza del chip Grace Blackwell.

Scalabilità con NVIDIA Sync Cluster Assistant

Una delle innovazioni più importanti è la capacità di collegare due unità DGX Spark in cluster tramite NVIDIA Sync Cluster Assistant. La connessione diretta con cavo QSFP unisce le memorie in un pool da 128 GB, consentendo di eseguire modelli fino a 200 miliardi di parametri e raddoppiando la larghezza di banda della memoria.

Nel test con il modello Qwen 3.8 27B, due sistemi da 64 GB hanno fornito un aumento di performance fino a 1,7× rispetto a un singolo unità, dimostrando che la scalabilità non è solo teorica ma misurabile in carichi reali.

L’applicazione NVIDIA Sync rileva automaticamente i nodi collegati, valida le configurazioni hardware e imposta la rete ConnectX‑7, eliminando la necessità di interventi manuali. Quando il carico di lavoro supera le capacità di una singola unità, il passaggio a due nodi avviene senza modificare lo stack software.

Pronto all’uso: tool e runtime preinstallati

DGX Spark arriva con un ecosistema completo per lo sviluppo di agenti AI:

    • NVIDIA Agent Toolkit per la creazione di agenti conversazionali
    • Biblioteche CUDA‑X AI per accelerare operazioni di training e inferenza
    • Modelli Nemotron open source pre‑configurati
    • Runtime Ollama, vLLM, llama.cpp e LM Studio per l’inferenza locale
    • Supporto a Blender con un installer pre‑compilato in arrivo

Grazie a queste integrazioni, gli sviluppatori possono passare dallo spegnimento all’esecuzione di un modello in pochi minuti, senza dover installare manualmente dipendenze o configurare ambienti complessi.

Use case pratici per sviluppatori e ricercatori

Il nuovo DGX Spark 64 GB supporta una serie di scenari reali fin dal primo giorno. Di seguito tre esempi di workflow tipici:

Esecuzione continua di un agente AI

Un agente di codifica o ricerca può restare attivo 24 ore su DGX Spark, pronto a rivedere codice, analizzare documenti o svolgere compiti a più fasi. Un cluster a due nodi fornisce capacità aggiuntiva per modelli più grandi, finestre di contesto più lunghe o più agenti simultanei.

Potenziare applicazioni creative sul PC di tutti i giorni

Modelli di generazione testuale o d’immagine possono girare su DGX Spark mentre l’utente utilizza laptop o desktop per altre attività. Il supercomputer gestisce l’inferenza, liberando le risorse del PC per il lavoro di editing, rendering o sviluppo.

Scalare quando il carico di lavoro cresce

Se un singolo compito supera le capacità di una singola unità – per esempio un modello più grande, una finestra di contesto più estesa o richieste concorrenti – due DGX Spark collegati tramite la rete 200 GbE formano un pool di 128 GB. Il workflow originale si trasferisce al cluster senza dover riconfigurare l’ambiente software.

Come iniziare con DGX Spark

Per mettere subito le mani sul nuovo hardware, è sufficiente seguire questi passaggi:

    • Acquistare DGX Spark 64 GB da uno dei partner elencati
    • Scaricare un framework di inferenza supportato – llama.cpp, Ollama, vLLM o LM Studio
    • Scaricare il modello locale consigliato per il proprio caso d’uso
    • Per scalare a due unità, collegarle tramite le porte ConnectX‑7 e avviare NVIDIA Sync Cluster Assistant, che configurerà automaticamente la rete e distribuirà il carico

Per playbook specifici sull’uso di agenti AI, visitare le pagine NemoClaw, OpenClaw, Hermes Agent e OpenShell su build.nvidia.com.

Prospettive future e aggiornamenti

Nel corso del mese verranno rilasciati ulteriori playbook per i dispositivi da 64 GB, tra cui:

  • Servire L