Un consorzio tedesco di ricerca ha pubblicato il modello Soofi S, un modello linguistico open source interamente addestrato sulla piattaforma cloud dell'industria dell'intelligenza artificiale della Deutschen Telekom. Il modello, che presenta una architettura ibrida efficiente, utilizza solo il 3,2% dei suoi 31,6 miliardi di parametri attivati per ogni token, mantenendo prestazioni costanti anche con input molto lunghi.

Soofi S addestrato su infrastruttura tedesca

Soofi S è uno dei primi modelli linguistici di grandi dimensioni ad essere stato addestrato interamente sulla Industrial AI Cloud della Deutschen Telekom a Monaco. Con 30 miliardi di parametri, utilizza un approccio sparsa e un addestramento focalizzato su dati tedeschi. Sotto la guida del KI Bundesverband, il consorzio ha sviluppato il modello come parte del programma europeo IPCEI-CIS finanziato dal Ministero tedesco dell'Economia ed Energia.

Superiorità in test linguistici

Secondo il pretraining report, Soofi S ha ottenuto i migliori risultati tra i modelli open source per lingua tedesca, inglese e programmazione, superando modelli come Olmo 3 32B e Apertus 70B. L'approccio ibrido a Mamba-Transformer mantiene il throughput costante anche a lunghezze di contesto estese, mentre modelli densi come Apertus 70B o Qwen3 32B vedono una notevole riduzione delle prestazioni.

Struttura ibrida efficace

Soofi S è un modello di tipo Mixture-of-Experts (MoE), che dispone di 31,6 miliardi di parametri ma ne utilizza effettivamente solo 3,2 miliardi per ogni token generato. Il consorzio ha modificato la struttura esistente di Nvidias Nemotron 3 Nano, integrando Mamba-2-Layer e Attention-Layer tradizionali. Solo 6 dei 52 layer conservano un cache KV, che tradizionalmente cresce linearmente con la lunghezza del testo.

Approccio sparsa migliora le prestazioni

Nei test, i risultati pratici dimostrano come Soofi S genera circa otto volte più token al secondo per GPU rispetto a modelli densi con dimensioni simili. La capacità di Soofi S di mantenersi costante in termini di throughput su contesti molto lunghi, fino a 256.000 token, rappresenta un miglioramento considerevole rispetto a quelli tradizionali. Un comportamento simile è stato osservato in Alibaba's Qwen3.5 35B-A3B.

Focus specifico sulla lingua tedesca

Nel corso di tre fasi complessive di addestramento, il consorzio ha processato circa 27 trilioni di token. Nella prima fase, il modello impara le strutture di base con 20 trilioni di token da fonti varie. La seconda fase, con 6 trilioni di token, utilizza fonti di alta qualità per affinare i pattern precedentemente appresi. Nella terza fase, il contesto viene allungato fino a 1 milione di token.

Il focus deliberato su contenuti tedeschi è evidente nel rapporto delle lingue addestrate: inizialmente il tedesco rappresenta il 7,2% del dataset, per salire al 15,3% nella seconda fase. La struttura di riferimento Nemotron prevede circa il 5% per lingue non inglesi.

I dati includono testi tedeschi derivati da fonti come HPLT, German Commons, FinePDFs, FineWiki, e il corpus Genios di 193 milioni di articoli periodici tedeschi. Sono stati utilizzati anche testi tedeschi tradotti meccanicamente e sintetici.

Classificazione per benchmark linguistici

In confronto con 16 modelli aperti, Soofi S si pone in vetta per il tedesco e l'inglese in termini di benchmark aggregati. Lottando con modelli aperti di grandi dimensioni come Apertus 70B, Soofi S si mantiene competitivo e supera modelli aperti di grandi dimensioni in ogni categoria.

Risultati eccellenti in programmazione e contesti tedeschi

Soofi S registra i migliori risultati open source per benchmark di programmazione con un punteggio del 73,8% in HumanEval, 70,2% su MBPP e 84,2% su MBPP tedesca. Nel test INCLUDE-DE, che valuta conoscenze locali tedesche, Soofi S divide la vittoria con Qwen3.5 35B-A3B a 61,2 punti. L'addestramento basato su dati tedeschi incrementa del 15,1% la competenza nella lingua e migliora di 9,6 punti i risultati GPQA-Diamond senza sacrificare le prestazioni dell'inglese.

Limiti nel calcolo e nei dati fatti

Soofi S registra risultati peggiori in ambiti matematici tedeschi, con soli 56 punti a Minerva MATH-DE, rispetto a Qwen3.5 35B-A3B (76,5) e Gemma 3 27B (65,6). L'approccio sparsa, con solo 3 miliardi di parametri attivi, riduce la capacità di immagazzinare il mondo reale rispetto a un modello tradizionale denso da 27B.

Debolezza nei test a lungo raggio

Negli esperimenti con testo lungo RULER, Soofi S mostra una debolezza specifica nella capacità di estrarre parole frequenti da testi a lungo raggio. Oltre i 32.000 token contesto, il tasso di riconoscimento di Soofi S scende a circa il 3%, rispetto al 60-64% del modello Nemotron comparabile. Tuttavia, i due modelli hanno prestazioni simili su molte altre prove RULER.

Infrastruttura sostenibile

L'addestramento è avvenuto tra marzo e maggio su un massimo di 512 GPU Nvidia B200 della Industrial AI Cloud della Deutschen Telekom, con un uso totale di circa 253.000 ore GPU. L'infrastruttura utilizza energia rinnovabile e acqua dell'acquedotto Eisbach per il raffreddamento, con l'incidenza sul quartiere Tucherpark adiacente. Soofi S è stato tra i primi addestramenti su questa infrastruttura.