Panoramica generale

Il progetto vLLM Semantic Router ha presentato Decision 3.0, una collezione di modelli decisionali multimodali. Questi modelli accettano come input testo, file JSON e immagini, per poi rispondere a domande di tipo “Scelta”, “Sì/No” o “Punteggio” fornendo direttamente le probabilità associate a ogni risposta. L’approccio elimina la necessità di parsare l’output di un grande modello linguistico, consentendo di impostare soglie di decisione calibrate.

TL;DR

    • Dimensioni: cinque modelli – d3‑lite (0,85 B), d3‑nano (2,21 B), d3‑mini (4,54 B), d3‑flash (8,39 B) e d3 (26,09 B). La lunghezza del contesto non è stata divulgata.
    • Piattaforma di esecuzione: benchmark effettuati su una GPU AMD Instinct MI325X, con pesi BF16; non sono state rilasciate varianti quantizzate ufficiali.
    • Prestazioni: il modello da 27 B (d3) guida le classifiche sia per testo che per visione nella valutazione interna del team.
    • Miglior risultato: 97,7 su KIE (CORD + FUNSD) per l’estrazione di documenti (d3).
    • Punizione: 34,1 su R‑Bench‑M (d3).
    • Conclusioni: un modello da 9 B supera la generazione precedente da 27 B; le metriche riportate sono auto‑dichiarate su dati reali.

Come funziona d3?

Ogni modello è una fine‑tuning di una base Qwen. Il modello più grande (27 B) utilizza Qwen3.8‑27B, mentre le versioni più piccole si basano su checkpoint Qwen3.5 a 0,8 B, 2 B, 4 B e 9 B. Tutte le varianti includono un encoder visivo: 0,10 B in d3‑lite, 0,33 B in d3‑nano e d3‑mini, 0,46 B in d3‑flash e d3.

Le richieste possono contenere più immagini in formato PNG, JPEG o WebP, ciascuna con una risoluzione massima di 1,6 megapixel. Ogni domanda viene valutata su tutte le immagini fornite, garantendo una visione completa del contesto multimediale.

Ogni domanda genera un proprio forward pass sullo stesso input, consentendo risposte simultanee per un insieme di domande. Per l’installazione è consigliato transformers==5.17.0 e, facoltativamente, il pacchetto flash-linear-attention per accelerare gli strati di attenzione lineare. Il caricamento richiede trustremotecode=True.

Prestazioni sui benchmark

Il team fornisce il Jev Decision Index versione 0.3.1, una classifica di riproduzioni open del sistema Jev di TypeSafe. I valori riportati sono il risultato di valutazioni interne.

Nel settore testuale, d3 ottiene 64,1, superando Perplexity Decider v1.1 (62,8) e Jev (60,1). Una nota di riserva: Torchcast Decision 27B registra un punteggio pubblico più alto (65,1 contro 64,9). Sul tavolo della visione, d3 segna 71,6 contro 70,6 per Perplexity Decider v1.1.

La storia delle dimensioni è la più significativa: d3‑flash (9 B) ottiene 59,0, superando Decision 2.0 da 27 B (55,9). Nella suite pubblica, i miglioramenti rispetto a Decision 2.0 variano da +8,0 (27 B) a +15,1 (0,8 B).

Leadership non uniforme:

    • d3‑mini (4 B) e d3‑flash (9 B) guidano entrambe le classifiche testuali e visive.
    • d3‑lite (0,8 B) domina il testo ma si piazza terzo nella visione (41,1, dietro JPT‑0,8 B a 42,1).
    • d3‑nano (2 B) è il migliore nella sua tabella visiva, ma resta dietro LiquidAI d1‑3B sul testo (35,8 contro 40,1).

Su task pubblici di visione, d3 segna 97,3 su InfographicVQA e 89,9 su Mind2Web, entrambi ricostruiti approssimativamente. Le performance calano su MMMU‑Pro vision (46,2) e sulla moderazione Hateful Memes (44,6).

Velocità di risposta

I valori mediani di latenza sono stati misurati per una singola richiesta su una GPU AMD Instinct MI325X:

    • d3‑nano: 21,7 ms per testo, 92,0 ms con immagine.
    • d3‑lite: 23,5 ms per testo, 60,7 ms con immagine.
    • d3‑mini: 28,5 ms per testo, 115,0 ms con immagine.
    • d3‑flash: 29,7 ms per testo, 171,8 ms con immagine.
    • d3 (27 B): 84 ms per testo, 342 ms con immagine.

Tutti i modelli sono stati addestrati su GPU AMD Instinct MI325X.

Confronto con altri modelli decisionali

Caratteristicad3 (vLLM SR)Perplexity Decider v1.1Decision 2.0 Vega‑27BLiquidAI d1‑3
Read original article →
← Back to news