TL;DR
- Dimensione: 27 M parametri, 7,89 GB in GGUF contro 54 GB in BF16.
- Esecuzione su: llama.cpp stock e applicazioni basate su di esso, con supporto al full GPU offload. Add‑on visione opzionale da 629 MB o 928 MB.
- Prestazioni: 96 % di ritenzione media su 9 benchmark rispetto al modello completo.
- Miglior risultato: chiamate di tool in parallelo, 42 vs 35 per il modello originale (120 % di ritenzione).
- Pezzo più debole: AIME 2025, 79,2 vs 96,7 (circa 82 % di ritenzione).
- Conclusione: supera l’originale nelle chiamate di tool con un file sotto gli 8 GB, ma perde 12‑18 punti in matematica e ragionamento multi‑step.
Cos’è Underdog Saluki 27B?
Saluki 27B è una versione a 2 bit, a precisione mista, in formato GGUF di Qwen3.8‑27B, pensata specificamente per agenti locali. Il modello è il risultato di tre “strati” di elaborazione:
- Strato base: Qwen3.8‑27B, un modello dense da 27 M parametri sviluppato dal team Qwen. Presenta 64 layer, combina l’attenzione lineare Gated DeltaNet con gated attention e supporta nativamente fino a 262 144 token.
- Secondo strato: il lavoro di ISTA‑DASLab, in particolare il modello Qwen3.8‑27B‑GSQ‑RCO‑GGUF. La tecnica GSQ (Gradient‑based Scalar Quantization) apprende griglie scalari a bassa precisione per ogni tensore, mentre RCO assegna un tipo di quantizzazione a ciascun tensore rispettando un budget di dimensione fisso. Il file più piccolo prodotto da ISTA, denominato IQ2XS, pesa 8,4 GB a 2,50 bit per peso.
- Terzo strato: la passata proprietaria di Underdog, che ha ridotto ulteriormente il file a 7,89 GB e ha ottimizzato la preservazione della capacità di tool calling. Il file è etichettato
IQ2‑mixcon tagimatrix. La ricetta completa non è stata resa pubblica.
Prestazioni sui benchmark
Underdog ha organizzato i risultati in due gruppi distinti.
Gruppo 1 – Confronto diretto nello stesso harness
- Underdog Bench: 120 task tratti da BFCL v4, con temperature 0 e ragionamento disattivato. Saluki ottiene 88 punti, il modello completo 84, mentre PrismML Bonsai 2 segna 70.
- Chiamate di tool in parallelo: 100 task BFCL v4 paralleli con il checker ufficiale. Saluki ottiene 42, il modello completo 35.
- SWE‑bench Verified: 50 problemi reali. Saluki risolve 30, il modello completo 33.
Gruppo 2 – Confronto con punteggi pubblici del modello completo
Di seguito la tabella riassuntiva dei risultati. I valori sono espressi in percentuale di punteggio rispetto al massimo possibile.
| Benchmark | Saluki 27B | Qwen3.8‑27B (pubblico) |
|---|---|---|
| IFEval (prompt‑loose) | 93,5 | 91,5 |
| IFBench (prompt‑loose) | 72,7 | 71,0 |
| MBPP+ | 78,0 | 83,9 |
| MuSR | 67,5 | 79,6 |
| AIME 2025 (avg@4) | 79,2 | 96,7 |
| AIME 2026 (avg@4) | 80,0 | 94,6 |
Confronto con altre versioni compatte di Qwen3.8‑27B
La tabella seguente mette a fuoco le differenze tra Saluki 27B e altre implementazioni note.
| Caratteristica | Underdog Saluki 27B | Qwen3.8‑27B (BF16) | ISTA GSQ‑RCO IQ2XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| Organizzazione | Underdog (Conway Research) | Team Qwen | ISTA‑DASLab | PrismML |
| Parametri | 27 B | 27 B | 27 B | 27,36 B |
| Dimensione file | 7,89 GB | 54 GB | 8,4 GB | 5,95 GB |
| Bit per peso | Non divulgato (mix 2‑bit) | 16 | 2,50 | 1,75 |
| Context length | Non divulgato | 262 144 nativi | Non divulgato | 262 K |
| Vision | Add‑on 629 MB o 928 MB | Native | 0,9 GB mmproj | Opzionale 0,63 GB |
| ← Zurück zu den Nachrichten |