Un consorzio tedesco, coordinato dall’Associazione Tedesca per l’Intelligenza Artificiale (KI Bundesverband), ha recentemente rilasciato il modello linguistico open-source Soofi S 30B-A3B. Secondo il suo report di pre-addestramento, Soofi S consegna i punteggi più alti fra i modelli open-source in lingua inglese e tedesca, superando modelli come OLMo 3 32B e Apertus 70B, leader precedenti. L’architettura ibrida Mamba-Transformer adottata da Soofi S ne permette l'uso efficace anche con input molto lunghi e permette di mantenersi costante in termini di velocità generativa.

Un’architettura ibrida progettata per contesti lunghi

Soofi S è un modello ibrido di esperti misti (Mixture-of-Experts) con 31,6 miliardi di parametri totali, ma che durante la generazione attiva solo circa 3,2 miliardi di essi per token. Questa progettazione riduce i costi computazionali, avvicinandolo alle prestazioni di un modello da 3 miliardi di parametri tradizionale. L’architettura si basa sul design di Nvidia’s Nemotron 3 Nano, unendo strati di tipo Mamba-2 a strati standard di attenzione.

La principale differenza rispetto ai modelli transformers tradizionali è il comportamento riguardo alla memoria. In questi modelli, la cache KV, che conserva informazioni sui token preesistenti, cresce linearmente con la lunghezza del contesto. In contesti lunghi o con richieste parallele, caricare nuovamente questa cache può diventare un collo di bottiglia. Solo 6 dei 52 strati di Soofi S mantengono una cache KV.

Una struttura addestrata intorno al tedesco

I ricercatori hanno processato circa 27 trilioni di token in totale, divisi in tre fasi principali: nella prima fase, il modello impara dal linguaggio di base, attingendo a 20 trilioni di token da testi web, codice, matematica e contesti specifici. La seconda fase utilizza circa 6 trilioni di token da fonti di migliore qualità per raffinare i pattern precedentemente appresi. Una breve terza fase estende infine la finestra di contesto ad allenandosi su documenti molto lunghi, lunghezza di fino un milione di token.

Nel corso delle tre fasi di addestramento, il mix di dati si sposta progressivamente verso fonti di qualità più alta e una quota significativamente maggiore di testi in tedesco. Questo focus sul tedesco è centrale per ottenere risultati elevati nei benchmark tedeschi. Nella prima fase, il tedesco costituisce il 7,2% del mix di addestramento; nella seconda, il rapporto aumenta al 15,3%. Per confronto, nel riferimento di Nvidia per l’addestramento, nemmeno il 5% dei dati non inglesi combinati è utilizzato.

Punteggi superiori in tedesco e inglese nei benchmark aperti

    • Nei test di valutazione condotti contro 16 modelli open-source, Soofi S ha registrato punteggi superiori per i benchmark tedeschi e inglesi combinati.
    • Il modello domina anche in contesti europei, spesso con margini doppi rispetto ai suoi competitor.
    • Conciliando tedesco e inglese, Soofi S batte modelli come OLMo 3 32B e Apertus 70B, dimostrando una buona bilanciatura tra le due lingue.

Risultati nei benchmark di programmazione

Nelle valutazioni di programmazione, Soofi S ha riportato i migliori risultati per codice open-source, con punteggi specifici come 73,8% (HumanEval), 70,2% (MBPP) e 84,2% (German MBPP).

Nel test specifico per conoscenze locali tedesche, INCLUDE-DE, Soofi S ha raggiunto il primo posto a pari merito con Qwen3.5 35B-A3B, ottenendo 61,2 punti. Rispetto al modello riferimento Nemotron, il mix di dati tedeschi ha migliorato la proficienza linguistica di 15,1 punti e il test scientifico GPQA-Diamond di 9,6 punti, mantenendo comunque buone prestazioni in inglese.

Prestazioni nei test matematici tedeschi

    • Soofi S non è stato in grado di raggiungere le stesse performance nei test di matematica tedesca.
    • Nei test Minerva MATH-DE ha ottenuto 56 punti, un risultato inferiore rispetto a Qwen3.5 35B-A3B (76,5) e Gemma 3 27B (65,6).
    • Il modello ha registrato anche una performance inferiore in NaturalQuestions, probabile conseguenza del numero limitato di parametri (3B) che ne limita la capacità di mantenere informazioni generale.

Testing a lungo contesto

Nel test di estrazione di parole frequenti (RULER), Soofi S rivela una debolezza specifica: la sua capacità di estrazione di frequenze scende a circa il 3% dopo 32.000 token di contesto, confrontando male rispetto a Nemotron, che mantiene una percentuale alta del 60-64%, grazie a una maggiore quota di dati sintetici mirati su estrazione.

Infrastruttura sovranana e apertura documentata

L’addestramento di Soofi S è avvenuto su fino a 512 GPU Nvidia B200 presso l’Industrial AI Cloud della Deutsche Telekom a Monaco, per un totale di circa 253.000 ore GPU. Il centro funziona interamente su energia rinnovabile, utilizza acqua del canale Eisbach per il raffreddamento e reinserisce il calore residuo nella zona Tucherpark.

Partner del consorzio

    • Istituti di ricerca tedeschi come Fraunhofer IAIS e IIS, German Research Center for Artificial Intelligence (DFKI), TU Darmstadt, TU Würzburg, L3S Research Center, Berlin University of Applied Sciences.
    • Le aziende di AI Ellamind e Merantix Momentum.
    • I partner sono finanziati dal governo federale tedesco, nell’ambito del programma IPCEI-CIS europeo.

Il consorzio ha rilasciato i pesi modelli, alcuni checkpoint intermedi, il codice di allenamento, l’inventario completo dei dati (token grezzi, numeri di epoche, contributi fonti), e una descrizione chiara degli esclusi.

Standard aperti

Soofi S soddisfa la definizione di Open Source AI 1.0 dell’Open Source Initiative, che richiede documentazione chiara, accesso pubblico e trasparenza. Il team ha anche proposto una versione più stretta per l’Unione Europea al fine di rafforzare il controllo sull’AI su infrastruttura europea e a livello interno.