Ternary Bonsai 2 27B: una svolta nella compressione dei modelli linguistici
PrismML ha annunciato il rilascio di Ternary Bonsai 2 27B, una versione straordinariamente compressa del modello Qwen3.8 27B che rappresenta un significativo progresso nel campo della quantizzazione ternaria. Questo modello dimostra come sia possibile mantenere prestazioni eccellenti pur riducendo drammaticamente le dimensioni e i requisiti computazionali. Con un'impronta di soli 5,93 GB, il modello è quasi 9,1 volte più piccolo della versione a precisione completa, pur mantenendo il 98,2% delle prestazioni medie su 20 benchmark diversi.
Il rilascio di Ternary Bonsai 2 27B arriva due mesi dopo la presentazione del primo modello Bonsai 27B, il cui variant ternario ha mantenuto circa il 95% delle prestazioni. Questo nuovo rilascio rappresenta un miglioramento considerevole nella tecnologia di compressione, offrendo un ulteriore incremento nella retention delle prestazioni di oltre 3 punti percentuali.
Specifiche tecniche e architettura del modello
Il modello mantiene l'architettura di Qwen3.8 27B completamente invariata, possedendo 27,36 miliardi di parametri distribuiti in modo specifico. La struttura interna si divide in tre componenti principali: un backbone linguistico di 24,35 miliardi di parametri, 2,54 miliardi di parametri negli embedding e nella testa LM, e una tower visiva di 0,47 miliardi di parametri.
Una delle caratteristiche più interessanti dell'architettura è l'uso dell'attenzione ibrida nel backbone. Il modello impiega circa il 75% di strati con attenzione lineare e il 25% con attenzione completa. Questa combinazione consente di mantenere una capacità di modellazione sofisticata riducendo al contempo i costi computazionali associati all'attenzione completa su sequenze lunghe.
La quantizzazione ternaria viene applicata selettivamente ai diversi componenti del modello. I pesi ternari coprono gli embedding, le proiezioni di attenzione, le proiezioni MLP e la testa LM. Tuttavia, solo 26,2 milioni di parametri, pari allo 0,0976% del totale, rimangono a precisione superiore. Questi parametri ad alta precisione includono il percorso dello stato ricorrente e i pesi di normalizzazione, che sono critici per la stabilità del modello.
In formato GGUF, la tower visiva viene fornita separatamente come file di 0,63 GB, caricato solo quando è necessario elaborare input immagine. Questo approccio modulare consente di ridurre ulteriormente l'impronta di memoria quando non sono necessarie capacità di elaborazione visiva.
Come funziona il formato ternario
Il cuore della compressione di Ternary Bonsai 2 27B risiede nel suo innovativo formato ternario. Ogni peso assume uno di soli tre valori: -1, 0 o +1. Questo approccio radicalmente semplificato rispetto ai pesi a virgola mobile tradizionali consente una compressione straordinaria.
L'implementazione pratica del formato ternario funziona come segue: ogni gruppo di 128 pesi condivide una singola scala FP16. Un valore ternario richiede log₂(3), ovvero circa 1,585 bit per essere rappresentato. Aggiungendo 16 bit di scala per ogni 128 pesi, si ottiene una media di 1,71 bit per peso. Quando si contano anche i tensori a precisione superiore menzionati precedentemente, la media complessiva raggiunge 1,72 bit per peso.
Poiché i kernel reali richiedono un layout pacchettizzato, PrismML ha descritto due diversi metodi di pacchettizzazione GGUF nel suo whitepaper. Il primo, PTQ1_0, pacchettizza i trit in modo denso raggiungendo 1,76 bit per peso per un totale di 5,93 GB. Il secondo, PQ2_0, memorizza ogni trit in uno slot di 2 bit raggiungendo 7,25 GB, che è meno efficiente ma più economico da decomprimere in termini di computazione.
Un aspetto particolarmente interessante della tecnica è l'uso di una base ruotata per la memorizzazione dei pesi. PrismML applica una rotazione Hadamard blocco per blocco con dimensione di blocco 1.024 prima dell'assegnazione ternaria. Durante l'esecuzione, il runtime applica la trasformazione corrispondente alle attivazioni prima di ogni moltiplicazione. Questo approccio è ispirato dalla tecnica SpinQuant precedentemente pubblicata. Tuttavia, PrismML non rende pubblico il metodo esatto con cui assegna i valori ternari ai pesi.
Performance su benchmark standardizzati
PrismML ha condotto una valutazione completa di tutti i modelli in modalità thinking utilizzando EvalScope e vLLM su GPU H100. I risultati forniscono una visione dettagliata di come Ternary Bonsai 2 27B si confronta con il modello originale su diverse categorie di capacità:
| Capacità | Qwen3.6 27B | Qwen3.8 27B | Ternary Bonsai 2 | Retention |
|---|---|---|---|---|
| Conoscenza e ragionamento | 84,71 | 86,66 | 83,95 | 96,9% |
| Matematica | 94,64 | 97,06 | 96,57 | 99,5% |
| Coding | 82,57 | 82,17 | 81,58 | 99,3% |
| Agentic e tool calling | 80,05 | 79,74 | 77,57 | 97,3% |
| Instruction following | 74,53 | 81,25 | 82,66 | 101,7% |
| Visione | 79,82 | 81,64 | 78,59 | 96,3% |
| Media complessiva (20 benchmark) | 83,6 | 85,4 | 83,9 | 98,2% |
Particolarmente notevole è il risultato nella categoria "Instruction following", dove il modello Bonsai 2 ottiene effettivamente 101,7% di retention, sovraperformando il baseline in questa area specifica. I risultati in matematica e coding sono anch'essi eccezionali, con retention rispettivamente del 99,5% e 99,3%.
Confronto con la quantizzazione convenzionale
Un confronto ancora più impressionante emerge quando Ternary Bonsai 2 viene confrontato con metodi di quantizzazione convenzionali. Una build IQ2_XXS di Qwen3.8 27B raggiunge una media di 75,2 su 20 benchmark occupando 7,3 GB di spazio, ben più grande di Ternary Bonsai 2 pur mantenendo significativamente meno performance.
Su benchmark specifiche come AIME26, il divario diventa ancora più marcato. Mentre la build IQ2_XXS ottiene 78,6 punti, Ternary Bonsai 2 raggiunge 95,83, rappresentando un miglioramento drammatico. Su LiveCodeBench v6, il contrasto è ancora più netto: 70,05 per IQ2_XXS contro 90,07 per Ternary Bonsai 2. Questi risultati dimostrano chiaramente che il metodo ternario non è solo più efficiente nello spazio, ma anche significativamente superiore in qualità rispetto alle tecniche di quantizzazione più tradizionali.
Dove il modello perde qualità
Sebbene il 98,2% di retention media sia impressionante, è importante sottolineare che le perdite non sono uniformi tra le diverse capacità e casi d'uso. La visione mantiene il 96,3% delle prestazioni, mentre la conoscenza e il ragionamento conservano il 96,9%, entrambi risultati solidi.
Le perdite più significative si manifestano nei compiti di agenti a lungo termine. Ternary Bonsai 2 ottiene 52,8 su Terminal-Bench 2.1, comparato ai 69,7 di Qwen3.8 27B, rappresentando una retention di circa il 76%. Su SWE-bench Verified, il modello ottiene 60,8 contro 80,6 del baseline, una retention ancora del 75% circa. Entrambi questi benchmark si situano al di fuori della media dei 20 benchmark utilizzati per il calcolo complessivo di retention.
Un altro fattore importante è l'impatto dello sforzo di ragionamento sulla qualità. A sforzo medio, il modello raggiunge una media di 79,3, comparato ai 82,6 del baseline FP16. Lo sforzo basso non è supportato affatto. È essenziale notare che tutti questi risultati sono proprietari di PrismML e non sono stati ancora indipendentemente riprodotti dalla comunità di ricerca.
Velocità di inferenza su hardware reale
Le prestazioni di velocità sono state misurate il 16 settembre 2026 con batch size 1 in modalità decode utilizzando i kernel personalizzati di PrismML. I risultati forniscono una visione pratica di come il modello si comporta su diversi hardware comuni:
- RTX 5090: 142