Introduzione
BottleCap AI ha rilasciato ThinkingCap‑Qwen3.8‑27B, il secondo modello della serie ThinkingCap. Si tratta di un fine‑tuning del modello Qwen3.8‑27B del team Qwen, con un unico obiettivo: accorciare le tracce di ragionamento. Il risultato è una riduzione media del 37,2% dei token di pensiero, con una perdita di accuratezza macro di soli 0,86 punti percentuali (da 86,65 % a 85,79 %).
Obiettivo del modello
Molti modelli di ragionamento spendono più token di quanti ne siano realmente necessari per rispondere a una domanda. BottleCap sostiene che gran parte di questi token aggiuntivi non influiscono sulla risposta finale. Il primo modello della serie, basato su Qwen3.6‑27B, aveva già dimostrato il potenziale di questa idea; la nuova versione punta a una riduzione più conservativa, senza aggiungere conoscenza, modificare lo stile di risposta o alterare la sicurezza.
L’obiettivo era mantenere inalterate la capacità di ragionamento, il rispetto delle istruzioni e i comportamenti di sicurezza, concentrandosi invece su compiti di matematica, ragionamento complesso, contesti lunghi e benchmark agentici.
Risultati sui benchmark a sforzo “xhigh”
Tutte le metriche sono state misurate con reasoning_effort=xhigh, l’impostazione predefinita del template chat. I risultati mostrano una riduzione dei token di ragionamento che varia dal 10,7 % al 65,5 % a seconda del benchmark.
- MMMLU: riduzione del 65,5 % (da 1 656 a 571 token)
- MMLU‑Pro: riduzione del 57,3 %
- GPQA‑Diamond: da 12 772 a 7 267 token (‑43,1 %)
- IFBench: 46,4 % di token in meno, accuratezza quasi invariata (79,75 % → 79,71 %)
- AA‑LCR: accuratezza +2,25pp (81,75 % → 84,00 %) con 38,6 % di token in meno
- LiveCodeBench v6: +0,07pp con riduzione del 20,3 % dei token
- τ²‑bench: -1,01pp con -30,9 % di token
- Terminal‑Bench: -0,56pp (entro l’intervallo ±4,26) con -10,7 % di token
- AIME 2026: -3,85pp, da 98,13 % a 94,27 %, con -30,2 % di token
La media delle riduzioni per i 12 benchmark è del 37,2 %; il numero medio di token di pensiero scende da 15 735 a 12 144.
Curva di budget e tracciati truncati
Under a 16 K‑token cap per risposta, ThinkingCap supera il modello di base. I tracciati troncati diminuiscono dallo 0,51 % allo 0,34 % e i loop dal 0,06 % allo 0,05 %.
Interazione con il “dial” di effort
Qwen3.8‑27B espone un parametro reasoning‑effort. ThinkingCap si integra con questo meccanismo, mostrando miglioramenti rispetto al modello base a tutti i livelli:
- Medium: base –52,1 % di token, -9,16pp; ThinkingCap –60,2 % di token, -9,90pp
- Low: base –55,4 % di token, -9,71pp; ThinkingCap –62,3 % di token, -10,79pp
- Thinking off: ThinkingCap è inferiore al base di 5,7pp
Il team raccomanda l’impostazione xhigh per il miglior bilanciamento tra accuratezza e consumo di token, promettendo ulteriori approfondimenti sui diversi modi di pensiero in future release.
Come è stata condotta la valutazione
Entrambi i modelli sono stati testati con lo stesso harness su una NVIDIA H200, usando vLLM 0.29.0. La configurazione di campionamento era identica: temperatura 1.0, topp 0.95, topk 20, min_p 0.0. L’accuratezza multi‑seed è la media con intervallo del 95 %.
Le seed variano da 32 per AIME 2026 a 1 per MMLU‑Pro e MMMLU. MMMLU utilizza un campione fisso di 10 000 domande, mentre gli altri 11 benchmark eseguono il set completo.
Il decoding speculativo MTP (3 token di bozza) è stato valutato come neutro in termini di accuratezza su AIME 2026, accettando il 53 % dei token proposti (circa 2,6 token per passo), in linea con il modello base.
Distribuzione, build e licenza
Il checkpoint bf16 comprende 28 B di parametri e accetta input immagine e testo. BottleCap pubblica cinque build quantizzate:
- FP8: 31 GB, compatibile con vLLM, Hopper e Blackwell
- NVFP4 weight‑only: 21 GB, vLLM, Hopper (kernel Marlin) e Blackwell
- NVFP4 W4A4 (AWQ): 23 GB, solo Blackwell
- GGUF: da 16 a 55 GB, per llama.cpp, LM Studio e Ollama
- MLX 4‑bit DWQ: 21 GB, per Mac Apple Silicon con 32 GB di RAM
Il serving utilizza la ricetta del modello base:
--reasoning-parser qwen3--tool-call-parser qwen3_xml
Il ragionamento restituito appare in un campo separato chiamato “reasoning”. La licenza è PolyForm Small Business 1.0.0 più una concessione d’uso personale di BottleCap; per usi commerciali è necessario un accordo specifico. I materiali upstream di Qwen