Che cos'è Mellum2.1?

Mellum2.1 è la nuova versione di Mellum2 Thinking, il modello di ragionamento open‑source introdotto da JetBrains a giugno 2026. Il checkpoint rilasciato, Mellum2.1-12B-A2.5B-Thinking, è progettato per emettere una catena di pensiero prima di fornire la risposta finale, rendendolo adatto a tre scenari principali: agente worker, assistente di ragionamento generale e deployment privato self‑hosted.

TL;DR

    • Dimensione: 12 B totali, 2,5 B attivi (64 esperti, 8 attivi), contesto di 131 072 token
    • Esecuzione: su GPU proprie via vLLM o SGLang (test su 1 NVIDIA H200). Build GGUF a partire da 7,0 GB per llama.cpp, Ollama e LM Studio
    • Performance: supera Mellum2 in 15 su 17 benchmark; vince 5 su 17 contro Qwen3.5‑9B
    • Miglior punteggio: 82,0 su LiveCodeBench v6, davanti a Qwen3.5‑9B (75,4) e Gemma 4 E4B (69,4)
    • Punteggio più basso: 17,4 su Terminal‑Bench 2.1, sotto Qwen3.5‑9B (21,7)
    • Conclusione (punti forti): punteggi di coding elevati e alta velocità con solo 2,5 B parametri attivi
    • Conclusione (punti deboli): ancora indietro rispetto a Qwen3.5‑9B su compiti software agentici complessi

Architettura di Mellum2.1

Il modello mantiene l'architettura di Mellum2: 28 layer, 64 esperti, con un router che attiva 8 esperti per token. L'attenzione utilizza grouped‑query attention con 32 teste di query e 4 teste KV. Tre layer su quattro impiegano una finestra mobile di 1 024 token. La lunghezza del contesto è di 131 072 token, il vocabolario conta 98 304 token e i pesi sono forniti in bfloat16.

Come è stato addestrato Mellum2.1?

Quasi tutto il lavoro è stato svolto nella fase post‑training. L'apprendimento per rinforzo (RL) è stato spostato da una breve fase finale al cuore dell'addestramento. JetBrains ha inserito task di RL in matematica, programmazione competitiva, scienza, uso di tool e ingegneria del software. I dataset RL sono stati filtrati per rimuovere test rotti, risposte non verificabili e compiti troppo facili o impossibili. Per l'ingegneria del software il modello è stato addestrato in repository reali con una shell e strumenti di modifica file, ricevendo ricompense quando tutti i test passavano. Sono stati lanciati milioni di sandbox in migliaia di ambienti differenti.

Prestazioni sui benchmark

JetBrains ha valutato Mellum2.1, Mellum2, Qwen3.5‑9B e Gemma 4 E4B con una pipeline unica in modalità thinking. Tutti i punteggi sono auto‑riportati da JetBrains.

Benchmark chart

Il salto più significativo è nel coding agentico: SWE‑bench Verified è passato da 2,0 a 47,0, SWE‑bench Pro da 0,0 a 28,0 e Terminal‑Bench 2.1 da 0,6 a 17,4. Le esecuzioni agentiche hanno utilizzato il harness open‑source Pi v0.73.1 con un contesto di 114 K token.

Mellum2.1 guida il gruppo su LiveCodeBench v6 (82,0), HumanEval+ (91,5), MBPP+ (79,4) e BFCL v4 (62,3). Qwen3.5‑9B rimane al top su SWE‑bench Verified (50,0), SWE‑bench Pro (38,0), AIME 25/26 (86,7) e GPQA Diamond (77,8). La sicurezza è migliorata: HarmBench è sceso da 21,5 a 8,5, dove valori più bassi indicano migliori performance.

Le pipeline influiscono sui risultati: la scheda tecnica di Qwen riporta 65,6 su LiveCodeBench v6 e 81,7 su GPQA Diamond, mentre JetBrains misura 75,4 e 77,8 per lo stesso modello.

Velocità di Mellum2.1

Poiché l'architettura è rimasta invariata rispetto a Mellum2, la velocità è identica. Su una singola H200 sotto carico pesante, Mellum2.1 fornisce quasi il doppio dei token di Qwen3.5‑9B. Per una singola richiesta, la predizione multi‑token (MTP) lo rende circa 1,6 volte più veloce. La testa MTP per lo speculative decoding di vLLM sarà disponibile a breve.

Esecuzione locale di Mellum2.1

Il modello completo può essere servito con vLLM usando l'opzione --reasoning-parser qwen3. Per abilitare la chiamata di tool è necessario aggiungere --enable-auto-tool-choice --tool-call-parser hermes