TL;DR

    • Dimensione: 27 M parametri, 7,89 GB in GGUF contro 54 GB in BF16.
    • Esecuzione su: llama.cpp stock e applicazioni basate su di esso, con supporto al full GPU offload. Add‑on visione opzionale da 629 MB o 928 MB.
    • Prestazioni: 96 % di ritenzione media su 9 benchmark rispetto al modello completo.
    • Miglior risultato: chiamate di tool in parallelo, 42 vs 35 per il modello originale (120 % di ritenzione).
    • Pezzo più debole: AIME 2025, 79,2 vs 96,7 (circa 82 % di ritenzione).
    • Conclusione: supera l’originale nelle chiamate di tool con un file sotto gli 8 GB, ma perde 12‑18 punti in matematica e ragionamento multi‑step.

Cos’è Underdog Saluki 27B?

Saluki 27B è una versione a 2 bit, a precisione mista, in formato GGUF di Qwen3.8‑27B, pensata specificamente per agenti locali. Il modello è il risultato di tre “strati” di elaborazione:

    • Strato base: Qwen3.8‑27B, un modello dense da 27 M parametri sviluppato dal team Qwen. Presenta 64 layer, combina l’attenzione lineare Gated DeltaNet con gated attention e supporta nativamente fino a 262 144 token.
    • Secondo strato: il lavoro di ISTA‑DASLab, in particolare il modello Qwen3.8‑27B‑GSQ‑RCO‑GGUF. La tecnica GSQ (Gradient‑based Scalar Quantization) apprende griglie scalari a bassa precisione per ogni tensore, mentre RCO assegna un tipo di quantizzazione a ciascun tensore rispettando un budget di dimensione fisso. Il file più piccolo prodotto da ISTA, denominato IQ2XS, pesa 8,4 GB a 2,50 bit per peso.
    • Terzo strato: la passata proprietaria di Underdog, che ha ridotto ulteriormente il file a 7,89 GB e ha ottimizzato la preservazione della capacità di tool calling. Il file è etichettato IQ2‑mix con tag imatrix. La ricetta completa non è stata resa pubblica.

Prestazioni sui benchmark

Underdog ha organizzato i risultati in due gruppi distinti.

Gruppo 1 – Confronto diretto nello stesso harness

    • Underdog Bench: 120 task tratti da BFCL v4, con temperature 0 e ragionamento disattivato. Saluki ottiene 88 punti, il modello completo 84, mentre PrismML Bonsai 2 segna 70.
    • Chiamate di tool in parallelo: 100 task BFCL v4 paralleli con il checker ufficiale. Saluki ottiene 42, il modello completo 35.
    • SWE‑bench Verified: 50 problemi reali. Saluki risolve 30, il modello completo 33.

Gruppo 2 – Confronto con punteggi pubblici del modello completo

Di seguito la tabella riassuntiva dei risultati. I valori sono espressi in percentuale di punteggio rispetto al massimo possibile.

BenchmarkSaluki 27BQwen3.8‑27B (pubblico)
IFEval (prompt‑loose)93,591,5
IFBench (prompt‑loose)72,771,0
MBPP+78,083,9
MuSR67,579,6
AIME 2025 (avg@4)79,296,7
AIME 2026 (avg@4)80,094,6

Confronto con altre versioni compatte di Qwen3.8‑27B

La tabella seguente mette a fuoco le differenze tra Saluki 27B e altre implementazioni note.

CaratteristicaUnderdog Saluki 27BQwen3.8‑27B (BF16)ISTA GSQ‑RCO IQ2XSPrismML Bonsai 2 27B (PTQ1_0)
OrganizzazioneUnderdog (Conway Research)Team QwenISTA‑DASLabPrismML
Parametri27 B27 B27 B27,36 B
Dimensione file7,89 GB54 GB8,4 GB5,95 GB
Bit per pesoNon divulgato (mix 2‑bit)162,501,75
Context lengthNon divulgato262 144 nativiNon divulgato262 K
VisionAdd‑on 629 MB o 928 MBNative0,9 GB mmprojOpzionale 0,63 GB
Originalartikel lesen →
← Zurück zu den Nachrichten