introduzione ai nuovi modelli d1

La famiglia di modelli decisionali d1 si arricchisce di due nuove versioni open source: d1‑3B e d1‑omni‑600M, quest’ultimo in fase sperimentale. A differenza dei modelli generativi, i modelli decisionali non producono una sequenza di token ma forniscono una risposta completa in un singolo forward pass, garantendo velocità e coerenza nelle decisioni strutturate.

architettura e backbone

Entrambi i modelli sono costruiti sui Liquid Foundation Models (LFM). D1‑3B è basato sul backbone LFM2.5‑VL‑3B, che integra capacità visive avanzate, mentre d1‑omni‑600M utilizza un backbone progettato per gestire simultaneamente testo, immagine e audio, offrendo una copertura multimodale completa.

benchmark e performance

Le valutazioni sono state condotte su sette dataset pubblici, coprendo ambiti quali reading comprehension, rilevamento della tossicità, classificazione di intenti, question answering medico e comprensione cross‑linguistica. D1‑3B ha raggiunto un punteggio medio di 82,9, il più alto della tabella e superiore a Decider 4B. D1‑omni‑600M ha ottenuto 78,4, superando Decider 2B (77,1) pur avendo solo un quarto dei parametri.

In aggiunta, d1‑3B ha mantenuto le capacità visive del suo backbone su benchmark standard, mentre d1‑omni‑600M ha dimostrato di gestire correttamente le tre modalità richieste. Non sono stati riportati benchmark specifici per visione o audio, poiché il Decision Index v0.3 include solo una divisione privata per la visione e le valutazioni audio rimangono un problema aperto.

collaborazione con nvidia e inferenza edge

In partnership con NVIDIA, i modelli sono stati testati sulla suite NVIDIA, includendo GeForce RTX 4090, Jetson AGX Thor, Jetson AGX Orin 64 GB e Jetson Orin Nano. D1‑3B risponde a una singola domanda in meno di 50 ms su tutti i dispositivi misurati; tre domande richiedono solo 1,3 × il tempo di una singola, con l’AGX Thor che passa da 16 ms a 20 ms.

D1‑omni‑600M, in fase di ricerca precoce, non è stato ancora valutato in termini di velocità su queste piattaforme.

performance su gpu

Su GPU, d1‑3B risponde a una domanda in meno di 10 ms e processa un’immagine di 384 px in meno di 18 ms su entrambe le piattaforme testate, dimostrando un elevato livello di efficienza sia per il testo che per la visione.

casi d’uso consigliati

I modelli decisionali d1 sono ideali quando è necessario prendere decisioni rapide e strutturate, anche in presenza di input multimodali. D1‑3B offre la migliore qualità decisionale nella sua fascia di dimensioni, mentre d1‑omni‑600M è pensato per scenari in cui lo spazio di memoria è limitato.

installazione e utilizzo

Per installare le dipendenze è richiesto transformers>=5.14. I modelli includono il proprio codice, quindi è necessario caricarli con trustremotecode=True. Di seguito è riportato un esempio sintetico per d1‑3B; per d1‑omni‑600M si rimanda alla relativa model card.

    • installare la libreria transformers
    • impostare l’ambiente di esecuzione con Python 3.9+
    • caricare il modello da Hugging Face usando il flag di fiducia

disponibilità e citazione

Entrambi i modelli decisionali sono open‑weight e disponibili su Hugging Face a partire da oggi. Gli utenti che impiegano questi modelli nelle proprie ricerche o applicazioni sono invitati a citare il blog di rilascio ufficiale.