Introduzione
Il nuovo DGX Spark 64 GB, disponibile da partner OEM come Acer, ASUS, Dell, Gigabyte, HP e MSI, rappresenta una risposta diretta alla crescente necessità di eseguire agenti intelligenti e modelli di grandi dimensioni senza dipendere da API a consumo di token. Con un singolo box è possibile gestire modelli da 30‑35 B di parametri, mentre la possibilità di clusterizzare due unità consente di scalare a 128 GB di memoria unificata e a oltre 2 PetaFLOP di calcolo.
Specifiche tecniche
- Superchip: NVIDIA GB10 Grace Blackwell
- CPU: 20‑core Arm (10× Cortex‑X925 + 10× Cortex‑A725)
- AI compute: fino a 1 PetaFLOP FP4 con sparsità
- Memoria: 64 GB LPDDR5x, unificata e coerente
- Larghezza di banda memoria: 273 GB/s
- Storage: 1, 2 o 4 TB NVMe M.2, auto‑crittografante
- Networking: ConnectX‑7 NIC, 200 GbE; Wi‑Fi 7, BT 5.3
- Display: 1× HDMI 2.1a
- Sistema operativo: NVIDIA DGX OS (basato su Ubuntu)
- Dimensioni / peso: 150 × 150 × 50,5 mm / 1,2 kg
- Modello massimo locale: fino a 100 B parametri
- Disponibilità: ottobre 2026 tramite NVIDIA Marketplace, partner OEM e canali retail
Memoria unificata: il cuore del design
La caratteristica distintiva del DGX Spark è la memoria unificata, in cui CPU e GPU condividono un unico pool attraverso NVLink‑C2C con una larghezza di banda cinque volte superiore a PCIe Gen 5. Questo elimina la necessità di copiare i pesi tra RAM di sistema e VRAM, permettendo a più modelli, alle loro cache KV e ai processi degli strumenti di coesistere nello stesso spazio di indirizzi. Per gli agenti, ciò si traduce in tempi di risposta più rapidi e in una gestione più semplice delle dipendenze di modello.
Software pronto all’avvio
DGX OS arriva preinstallato con l’intero stack NVIDIA AI, inclusi PyTorch, Jupyter e Ollama. Con un singolo comando è possibile installare NVIDIA NemoClaw, che aggiunge controlli di privacy e sicurezza per gli agenti OpenClaw. NVIDIA OpenShell™, parte del NVIDIA Agent Toolkit™, introduce guardrails basati su policy, mentre i modelli NVIDIA Nemotron™ sono ottimizzati per l’hardware. Il sistema si collega a una presa di corrente standard, senza necessità di sale server o raffreddamento speciale, rendendolo adatto a un utilizzo continuo.
Modelli open compatibili con 64 GB
I modelli di classe 30 B sono ora abbastanza efficienti da funzionare su questa configurazione. Di seguito alcuni esempi:
- Muse Glimmer (Meta) – 29,6 B denso, testo + immagine, licenza Apache 2.0, footprint ~17 GB (quantizzato). È il modello principale per agenti locali, con capacità di contesto fino a 131 K token.
- Nemotron 3.5 Lightning (NVIDIA) – 30 B MoE (30B‑A3B), checkpoint NVFP4, ottimizzato per esecuzioni rapide di agenti a lungo termine.
- Qwen 3.8‑27B (Alibaba) – 27 B denso, footprint ~13,5 GB (4‑bit), adatto a compiti generali e di programmazione.
Le stime di footprint si riferiscono solo ai pesi; la cache KV e l’overhead di runtime aumentano ulteriormente il consumo di memoria.
Cinque progetti realizzabili con un singolo box
- Agente personale sempre‑attivo: installare Hermes, collegarlo a Muse Glimmer o Nemotron 3.5 Lightning, fornire accesso a repository GitHub, test runner e feed RSS di arXiv. Durante la notte l’agente può triage issue, riprodurre test falliti e generare pull request, mantenendo dati privati sul dispositivo.
- Fine‑tuning di un modello di codifica: con QLoRA è possibile addestrare un modello da 70 B all’interno dei 64 GB, usando il proprio codice, documentazione interna e revisioni PR. NVIDIA ha misurato circa 18 400 token/s per il fine‑tuning distribuito nanochat su un nodo singolo.
- Banco di valutazione day‑1: scaricare un nuovo modello open‑weight da Hugging Face, eseguirlo tramite Ollama o vLLM e valutare su un set di domande personalizzato. Si misurano accuratezza, tempo al primo token (TTFT) e token al secondo, senza costi API per le ripetute valutazioni.
- Team di agenti multi‑modello: la memoria unificata consente a più modelli di condividere lo stesso pool. Ad esempio, usare Bonsai 2 come router e Glimmer come agente di ragionamento, occupando circa 23 GB di pesi, lasciando spazio per cache e processi di strumento.
- Prototipazione edge e robotica: fine‑tuning di un Vision Transformer per il rilevamento di anomalie su una telecamera di produzione, validazione locale con lo stack CUDA, quindi deployment su un dispositivo NVIDIA Jetson per inferenza al bordo.
Clustering con NVIDIA Sync
Ogni DGX Spark è equipaggiato con ConnectX‑7 a 200 GbE, rendendo il clustering una funzionalità nativa. La configurazione più semplice prevede due unità da 64 GB collegate via cavo QSFP diretto, senza switch, per ottenere 128 GB di memoria unificata e fino a 2 PetaFLOP di calcolo.
| Configurazione | Memoria totale | AI compute (FP4 ← Volver a las noticias |
|---|