Holo4 rappresenta l’ultima evoluzione dei modelli agentici sviluppati dalla nostra azienda. La serie è distribuita in due configurazioni: una variante “dense” da 27 billion di parametri e una variante “Mixture of Experts” da 35 billion‑A3B. Entrambe le versioni sono accessibili tramite l’API H Models, così come la versione aggiornata di Holotron 3, denominata Holotron4 Nano.

Panoramica di Holo4

Il modello si basa sulla nostra architettura precedente, ma introduce la capacità di interagire con qualsiasi interfaccia software disponibile: interfacce grafiche (GUI), codice sorgente, MCP (Meta‑Control Protocol) e API. Questa flessibilità è il risultato di un addestramento combinato supervisionato e per rinforzo, effettuato su un ampio set di ambienti e compiti generati dal nostro Agentic Task Factory.

Dimensioni e disponibilità

    • Holo4 27B: modello dense, ottimizzato per operazioni generali.
    • Holo4 35B‑A3B: modello Mixture of Experts, più efficiente su compiti specifici.
    • Entrambi disponibili sull’API H Models.
    • Pesi rilasciati su Hugging Face in formati BF16, FP8, NVFP4 e GGUF 4‑bit.

Capacità multi‑interfaccia

Holo4 è progettato per “cliccare e digitare” su schermi, scrivere e eseguire codice autonomamente, e chiamare strumenti MCP o API a seconda delle necessità del compito. La maggior parte dei modelli agentici è limitata a una sola interfaccia (solo GUI o solo tool‑calling), mentre Holo4 combina queste modalità, rispondendo alle esigenze di flussi di lavoro aziendali che richiedono più approcci simultaneamente.

Prestazioni su benchmark

Su OSWorld 2.0, uno dei benchmark più difficili per il controllo desktop, Holo4 27B ottiene il 61,7 % contro l’81,8 % di Opus 5.5, mentre la variante 35B‑A3B raggiunge il 30,9 %. Nonostante il divario di punteggio, Holo4 utilizza ordini di grandezza inferiori di parametri e costa molto meno. I dettagli delle traiettorie di esecuzione sono disponibili su atrajectories.hcompany.ai o su Hugging Face.

Costi e confronto con modelli concorrenti

I costi sono stimati in base ai token di input e output per ogni esecuzione agentica. Holo4 utilizza le tariffe dell’API H Models (esecuzione singola). Per confronto:

    • Qwen 3.8 27B: costo calcolato secondo i list‑price di Alibaba Cloud.
    • Qwen 3.6 35B‑A3B: costo con cache hit al 20 % del prezzo di input.
    • OpenAI GPT e Opus: dati di lancio forniti da OpenAI per le metriche di sforzo.

Nel grafico costi‑performance, Holo4 si posiziona al di sotto della “linea di dominio” dei modelli chiusi, dimostrando un miglior rapporto qualità‑prezzo.

Esempi di compiti complessi

Di seguito alcuni prompt usati per valutare Holo4 27B rispetto al suo modello base Qwen 3.8 27B, con lo stesso harness:

Modellazione 3D della Torre Eiffel in FreeCAD

Costruire un modello 3D scalato 1 mm : 1 m, con quattro gambe quadrate che seguono profili di larghezza variabile (62,5 mm al suolo, 32,5 mm a 57 mm di altezza, 17,5 mm a 115 mm, 9,35 mm a 276 mm) e tre piattaforme solide, oltre a un'asta finale. Ogni parte deve essere un solido chiuso con volume non nullo.

Logo H aziendale

Creare un disco pieno accanto a una lettera “H” sans‑serif, entrambi estrusi alla stessa spessore, con il centro del disco allineato al centro verticale della H, entrambi neri.

Gioco Pac‑Man in Godot

Generare un labirinto rettangolare con pellet, un agente controllato da euristica (avvicinarsi al pellet più vicino, allontanarsi dai fantasmi) e tre fantasmi inseguitori. Il gioco deve funzionare in modo autonomo e infinito, senza input da tastiera.

Pipeline di addestramento e infrastruttura

Il nostro set interno di pipeline agentiche genera ambienti interattivi e compiti verificabili a partire da documentazione, screenshot di siti web reali o software open‑source. Finora sono stati creati circa 10 000 compiti su applicazioni web, server MCP e ambienti desktop, inclusi ambienti ibridi con stato esposto sia tramite GUI sia MCP.

Durante l’addestramento abbiamo ricostruito il nostro “harness”, il ciclo che esegue le azioni del modello e gestisce il contesto per centinaia di passaggi, usando feedback da OSWorld 2.0. Le modifiche più importanti includono una memoria affidabile per centinaia di step e una shell integrata nella macchina desktop.

Estensioni verso altri modelli

Il nostro stack post‑training è concepito per adattarsi a nuovi modelli di base e produrre agenti che generalizzano su interfacce ed ambienti diversi. In qualità di membro della NVIDIA Nemotron Coalition, abbiamo applicato la stessa ricetta al modello Nemotron 3 Nano Omni, creando Holotron4 Nano. I guadagni, espressi in punti percentuali assoluti, confermano che la nostra metodologia si trasferisce bene e non dipende dalla dimensione del modello.

Disponibilità e prossimi rilasci

Entrambe le versioni di Holo4 sono disponibili oggi tramite l’API H Models. Nei prossimi giorni saranno rilasciati checkpoint ottimizzati “DSpark drafter” per accelerare ulteriormente l’inferenza. Gli utenti possono scaricare i pesi, sperimentare le capacità multi‑interfaccia e contribuire al miglioramento continuo del modello.