L'intelligenza artificiale locale diventa più veloce e accessibile
La frontiera dell'intelligenza artificiale si sta spostando verso il locale. A IFA 2026, NVIDIA, Microsoft e i loro partner stanno collaborando per fornire inferenza più veloce e nuovi strumenti che rendono gli agent AI più facili da configurare ed eseguire localmente su hardware NVIDIA. Questo rappresenta un cambiamento significativo nel modo in cui gli utenti, gli sviluppatori e i creatori possono accedere e utilizzare le capacità dell'IA senza dipendere completamente dai servizi cloud.
Gli annunci di questa settimana segnano un momento cruciale per l'ecosistema dell'IA locale. NVIDIA sta eliminando le barriere che hanno tradizionalmente reso difficile l'esecuzione di modelli AI potenti sui PC consumer. Con hardware sempre più capace e software sempre più ottimizzato, la visione di un'intelligenza artificiale personale e privata sta diventando una realtà concreta per milioni di utenti in tutto il mondo.
Nuovi PC NVIDIA RTX Spark in arrivo a ottobre
Uno dei grandi protagonisti degli annunci di questa settimana è l'arrivo dei nuovi NVIDIA RTX Spark PC Windows, che arriveranno a ottobre. Questi sistemi compatti sono progettati specificamente per gli entusiasti di AI, sviluppatori e creatori che desiderano eseguire agent AI capaci localmente e in modo sicuro, senza doversi affidare ai servizi cloud.
Lenovo e Acer sono tra i principali partner che porteranno i nuovi Windows PC RTX Spark al mercato, offrendo una varietà di configurazioni per soddisfare diverse esigenze e budget. Questi PC rappresentano una nuova categoria di hardware consumer, ottimizzati specificamente per l'esecuzione di modelli AI locali piuttosto che per le tradizionali attività informatiche generiche.
La rilevanza di questi sistemi è ulteriormente sottolineata dal supporto che ricevono dai più grandi editori di videogiochi del mondo. Electronic Arts, Embark e Ubisoft stanno portando i loro blockbuster sugli NVIDIA RTX Spark, dimostrando che questi sistemi sono sufficientemente potenti non solo per gli agent AI, ma anche per applicazioni grafiche intense come i videogiochi moderni.
Supporto semplificato per agent AI locali
Una delle sfide principali nel rendere l'IA locale accessibile al grande pubblico è stata la complessità della configurazione. Tradizionalmente, chi desiderava eseguire modelli AI locali doveva affrontare numerose decisioni: quale modello scegliere, quale server di inferenza utilizzare, come configurare la quantizzazione e come mantenere tutto aggiornato. Questi ostacoli stanno scomparendo sui sistemi RTX e DGX.
NVIDIA sta collaborando con tre delle applicazioni agent più utilizzate per fornire un'esperienza di configurazione semplificata per il modello locale su Windows. Queste tre piattaforme sono:
- Hermes Agent — sviluppato da Nous Research, è un agent general-purpose utilizzato da milioni di persone che eccelle in affidabilità e auto-miglioramento
- OpenClaw — il più grande progetto di agenti aperti su GitHub con più di 380.000 stelle
- Perplexity Portable Computer — un'applicazione che permette di eseguire Perplexity localmente con modelli, orchestrazione e strumenti in un'unica esperienza app
Ognuna di queste applicazioni è costruita su llama.cpp e incorpora le ultime ottimizzazioni di inferenza di NVIDIA. Le nuove esperienze di configurazione sono progettate per ridurre la configurazione manuale e rendere più facile l'avvio di agent locali.
Hermes Agent: configurazione con un clic
Hermes Agent rappresenta un'eccellente illustrazione di come questi miglioramenti stiano semplificando l'accesso all'IA locale. Hermes è agnostico rispetto al modello e al provider, costruito per funzionare tutto il giorno su sistemi locali, il che lo rende un candidato naturale per PC RTX, workstation RTX PRO e DGX Spark.
La configurazione di un modello locale in Hermes fornirà agli utenti una configurazione con un solo clic su sistemi RTX e DGX su Windows. L'agent rileverà automaticamente la GPU NVIDIA, selezionerà un modello e una configurazione appropriati, e lo eseguirà attraverso llama.cpp integrato con le ottimizzazioni di inferenza NVIDIA già in posizione, eliminando il download manuale del modello e l'ottimizzazione. Il supporto per Linux sta arrivando a breve.
Una volta in esecuzione, Hermes funziona come altrove. Utilizza strumenti, mantiene il contesto tra i compiti, ricorda le informazioni tra le sessioni e crea competenze riutilizzabili nel tempo, permettendo all'agent di diventare più capace con l'uso continuo. L'esecuzione del modello localmente su una GPU mantiene le prestazioni veloci mantenendo i dati sul sistema, proteggendo la privacy dell'utente.
Perplexity Portable Computer: ricerca senza limiti di crediti
Perplexity ha introdotto il mese scorso il suo Portable Computer agent, fornendo agli utenti un modo semplice per eseguire Perplexity localmente su sistemi Linux come NVIDIA DGX Spark con i modelli, l'orchestrazione e gli strumenti confezionati in un'unica esperienza app. Ora, Perplexity Portable Computer è disponibile su GPU NVIDIA RTX con almeno 24GB di VRAM su Linux, con il supporto Windows in arrivo a breve, portando quella stessa configurazione razionalizzata a un gruppo più ampio di utenti PC.
Gli utenti possono eseguire flussi di lavoro completi localmente senza consumare crediti, escalando selettivamente parti di un compito a uno dei 15+ modelli frontier nel cloud quando è necessaria una ricerca o un ragionamento aggiuntivo. Portable Computer chiede il permesso prima di inviare contenuti al cloud, aiutando gli utenti a mantenere le informazioni sensibili sul loro dispositivo.
I casi d'uso di esempio includono:
- Ingegneria: rivedere i PR aperti in un repository GitHub connesso e ordinarli in pronto, bloccato, stantio e ha bisogno di revisione, ognuno etichettato con il passaggio successivo. I documenti che sono rimasti fuori sincronia con l'ultimo merge vengono catturati e corretti, con un PR aperto per le modifiche.
- Finanza: indirizzare l'agent a due anni di riepiloghi di intermediazione, consolidati 1099 e dichiarazioni dei redditi e farlo tracciare le partecipazioni ricorrenti che creano le spese più evitabili e il trascinamento fiscale, con ogni cifra citata al file e alla pagina esatti — tutto senza che un documento raggiunga mai un chatbot.
- Startup: chiedere perché l'attivazione si è fermata, e l'agent analizza localmente l'esportazione del funnel per trovare dove i nuovi iscritti si staccano tra l'installazione e il primo compito completato, quindi pubblica i migliori approfondimenti direttamente sul canale Slack del team.
OpenClaw: il più grande progetto agente open-source
OpenClaw è diventato uno dei progetti definitori del movimento open-agent, il più grande progetto AI su GitHub con più di 380.000 stelle e una comunità in rapida crescita che costruisce strumenti e competenze tra ricerca, ingegneria, gestione dei progetti e produttività quotidiana.
NVIDIA, Microsoft e OpenClaw hanno collaborato per rendere quell'esperienza più facile da configurare su PC Windows. Per ridurre l'attrito dell'onboarding, l'app OpenClaw Windows semplifica il processo di configurazione di un modello locale ottimizzato su qualsiasi GPU RTX con almeno 24GB di VRAM.
Accelerazione dell'inferenza: velocità fino a 1,9x più veloce
Le prestazioni di inferenza sono critiche per mantenere gli agent AI locali reattivi. NVIDIA continua a collaborare con le comunità open-source llama.cpp e vLLM per accelerare i carichi di lavoro agentici su piattaforme NVIDIA locali.
I miglioramenti di velocità sono significativi e tangibili:
- llama.cpp: offre fino a 1,9x di throughput superiore attraverso ottimizzazioni del kernel su una GeForce RTX 5090, tecniche di decodifica speculativa migliorate e prefill più veloce
- vLLM: offre 1,2x sulla RTX PRO 6000 Blackwell Workstation Edition e fino a 1,4x su due cluster DGX Spark. I nuovi kernel di attenzione XQA in FlashInfer e le ottimizzazioni di backend aiutano ad accelerare l'inferenza su entrambe le piattaforme
Questi guadagni sono disponibili sui backend di inferenza llama.cpp e vLLM e gli utenti possono sperimentarli anche attraverso le applicazioni LM Studio e Ollama. Questo significa che chi utilizza già questi strumenti popolari beneficerà automaticamente dei miglioramenti di velocità senza dover cambiare il loro flusso di lavoro.
NVIDIA PAIR: distribuire l'IA su più PC domestici
Più della metà delle famiglie statunitensi possiede due o più PC, e gran parte di quella potenza di calcolo rimane inattiva durante il giorno. NVIDIA Personal AI Router (PAIR) è uno strumento software gratuito e open source che mette quei sistemi a lavorare insieme per l'IA locale.
I flussi di lavoro agentici spesso dividono i compiti complessi in lavori più piccoli che possono essere eseguiti in parallelo, ma le prestazioni possono rallentare quando ogni richiesta compete per la stessa GPU. PAIR scopre automaticamente i PC compatibili su una rete locale e instrada le richieste di inferenza indipendenti al sistema che ha capacità disponibile. Funziona con Ollama e LM Studio e può adattarsi mentre i dispositivi si uniscono o lasciano la rete.
Per esempio, un utente potrebbe chiedere a Hermes di creare un piano "domenicale di reset" ordinando una casella di posta disordinata e dando priorità a ciò che ha bisogno di attenzione ora, a ciò che può aspettare e a ciò che può essere saltato. Hermes può dividere quel lavoro tra più subagenenti, mentre PAIR distribuisce quei lavori su PC disponibili invece di farli aspettare tutti su una singola GPU.
Il risultato è più potenza di calcolo per gli agent locali, con più compiti in esecuzione in parallelo e la flessibilità di spostare i carichi di lavoro dell'IA su un altro PC mentre il sistema principale viene utilizzato per i giochi, la creazione o altri lavori.
Il beta di NVIDIA PAIR è disponibile per Windows, macOS e Linux attraverso interfacce grafiche e terminali, supportando GPU NVIDIA GeForce RTX 20 Series e più recenti, GPU workstation NVIDIA RTX PRO (architettura Turing e più recenti), NVIDIA DGX Spark e silicio Apple M4 o più recente.
Modelli AI locali lanciati ad agosto
Il mese di agosto è stato particolarmente fervido per l'IA locale, con il lancio di diversi modelli potenti e ottimizzati per l'esecuzione su hardware NVIDIA locale:
Nemotron 3.5 Lightning
Nemotron 3.5 Lightning è un modello con 30 miliardi di parametri che può essere eseguito su PC NVIDIA RTX, workstation RTX PRO, DGX Spark e Jetson. Questo modello rappresenta un punto di equilibrio ideale tra capacità e efficienza, permettendo agli utenti di eseguire modelli potenti su hardware consumer.
Z.ai GLM-5.3-Flash
Z.ai's GLM-5.3-Flash è un modello multimodale mixture-of-experts (MoE) che sta portando l'IA agentiva a DGX Station. I modelli MoE sono particolarmente interessanti perché usano solo una frazione dei loro parametri per ogni compito, rendendo l'inferenza più veloce e efficiente.
Qwen modelli
Qwen ha rilasciato due modelli significativi:
- Qwen3.8-Flash-Next: un modello MoE multimodale di peso aperto che può essere eseguito localmente su DGX Spark e DGX Station
- Qwen3.8-27B: un modello aperto con 27 miliardi di parametri ottimizzato per carichi di lavoro agentici e di codifica locale su GPU NVIDIA
LTX 2.5: generazione video locale
LTX's LTX 2.5 è un modello di generazione video open-world ottimizzato per GPU NVIDIA RTX, DGX Spark e DGX Station, con nuovi miglioramenti NVFP4, FastVideo e ComfyUI per una generazione più veloce e efficiente in termini di memoria. Questo apre la possibilità di creare video completamente localmente, senza caricare il contenuto nei servizi cloud.
MiniMax-H3 e FastH3
MiniMax-H3 è un modello di generazione video con peso aperto con audio sincronizzato che può essere eseguito localmente su GPU NVIDIA attraverso ComfyUI. FastVideo ha collaborato con i ricercatori NVIDIA per migliorare ulteriormente questo, rilasciando FastH3 — una versione distillata aperta in quattro fasi che migliora le prestazioni di 7x. Le ricette FastVideo ottimizzate per GPU NVIDIA RTX e DGX Spark stanno arrivando a breve.