Nel settore dell'AI open-source, si registra un nuovo rilevante sviluppo. La consorziata tedesca Soofi ha appena rilasciato il modello Soofi S 30B-A3B, una base multi-paese per lingue tedesche e inglesi, addestrata end-to-end sulla piattaforma cloud industriale di Deutsche Telekom a Monaco di Baviera. Il modello è ora disponibile sul mercato come un modello open-source su Hugging Face. Si segnala tra i modelli completamente open che presentano i punteggi più alti in lingua inglese e tedesca.
Che cos'è Soofi S 30B-A3B?
Il modello Soofi S 30B-A3B è un modello ibrido di tipo MoE (Mixture of Experts) che si basa su un design di fondo Mamba Transformer. Il modello si compone di circa 31,6 miliardi di parametri e attiva 3,2 miliardi per token. Essendo un modello base non ha subito alcuna operazione di tuning istruzione, allineamento o tuning di sicurezza. Il consorzio responsabile della pubblicazione è guidato dal KI Bundesverband e finanziato dal Ministero tedesco dell'economia e dell'energia. I membri principali comprendono Fraunhofer IAIS, DFKI, TU Darmstadt, ellamind, e Merantix Momentum.
Come funziona l'architettura
L'efficienza del modello parte dallo stack per strato. La rete presenta 52 strati, di cui 23 per la diffusione di sequenza Mamba-2, 23 per gli esperti granulari MoE, e 6 strati di Attention Gruppo di Query (GQA). Solo 6 GQA mantengono una cache KV (chiave-valore). Ogni strato MoE contiene 128 esperti attivati per 6 token e aggiunge 2 esperti condivisi. Ulteriori dettagli: dimensione modellata 2688, funzione di attivazione ReLU al quadrato, normalizzazione RMSNorm e nessuna mappa posizionale.
Il modello Soofi S adotta il design di riferimento Nemotron 3 Nano senza modifiche. Il team di ricerca spiega la scelta con tre ragioni principali: deployabilità su stack come vLLM, efficienza per il servizio e controllo scientifico. Essendo la spina dorsale fissata, Nemotron 3 Nano diventa una baseline con architettura identica. L'unica parte variabile è la ricetta dei dati.
La ricetta di addestramento: 26,68T token consumati in tre fasi
La ricetta segue un piano Warmup–Stable–Decay (WSD) con segmento di decadimento minus_sqrt. Nella Fase 1, consuma circa 20T token su un mix eterogeneo e di alta qualità, mantenendo plateau a 1e-3. Nella Fase 2, consuma circa 6,58T token di dati "annealing" di alta qualità, che degradano da 1e-3 a 1e-5, e proseguono continuamente a 1e-5. Nella Fase 3, consuma 0,10T token a una lunghezza di sequenza di 1.048.576 token, estendendo la finestra di contesto utilizzabile fino a 1 milione di token.
La lingua tedesca è la variabile deliberata di questa ricetta. Rispetto ai token della Fase 1, aumenta da 7,2% a 15,32% con la Fase 2. La ricetta di riferimento Nemotron 3 Nano alloca circa il 5% per tutte le lingue non inglesi. Le risorse tedesche includono HPLT v3 e v4, German Commons, German FinePDFs, FineWiki. Genios aggiunge 193 milioni di articoli provenienti da archivi di giornali e di stampa di settore commerciale.
Infrastruttura e addestramento
La scelta di infrastruttura segue la stessa logica di sovranità. L'esecuzione ha utilizzato fino a 512 GPU NVIDIA B200 dal 24 marzo al 13 maggio del 2026. Il modello ha consumate 253.000 ore-GPU delle B200.
Prestazioni
Le scelte architetturali si riflettono nei risultati. Il Soofi S è stato testato insieme a 16 modelli open-source base. Tutti seguivano lo stesso pipeline lm-evaluation-harness, suggerimenti e set per il confronto.
- Benchmark inglese aggregato: 70,1% (Soofi S); 67,3% (Olmo 3 32B); 62,4% (Apertus 70B); 61,2% (EuroLLM 22B); 59% (Alia 40B)
- Benchmark tedesco aggregato: 79,1% (Soofi S); 69,2% (Olmo 3 32B); 72,8% (Apertus 70B); 70,6% (EuroLLM 22B); 68,4% (Alia 40B)
- Benchmark con tenuta (inglese/tedesco): 41,4/41,8% (Soofi S); 33,1/36,2% (Olmo 3 32B); 27,6/33,5% (Apertus 70B); 30,8/33,9% (EuroLLM 22B); 28/29,4% (Alia 40B)
- HumanEval (pass@1): 73,8% (Soofi S); 63% (Olmo 3 32B); 30,2% (Apertus 70B); 39,3% (EuroLLM 22B); 23,8% (Alia 40B)
- MBPP-DE (pass@1): 84,2% (Soofi S); 70,8% (Olmo 3 32B); 50,9% (Apertus 70B); 59,4% (EuroLLM 22B); 45,6% (Alia 40B)
- LBPP (pass@1): 31% (Soofi S); 32,1% (Olmo 3 32B); 6,4% (Apertus 70B); 10,7% (EuroLLM 22B); 8,6% (Alia 40B)
- GSM8K: 86,1% (Soofi S); 80,7% (Olmo 3 32B); 65,4% (Apertus 70B); 25,1% (EuroLLM 22B); 65,4% (Alia 40B)
- Minerva MATH-DE: 56% (Soofi S); 48,5% (Olmo 3 32B); 29% (Apertus 70B); 28,4% (EuroLLM 22B); 12,9% (Alia 40B)
- INCLUDE-DE: 61,2