Introduzione
Aikido Security ha annunciato il rilascio di Altar‑1, il primo modello di sicurezza open‑weight sviluppato per operare all’interno dell’infrastruttura controllata dal cliente. Altar‑1 è una versione compressa del modello MoE GLM‑5.3, progettata per l’esecuzione su reti on‑premise e ambienti air‑gapped. I pesi sono pubblici su Hugging Face e il modello può essere servito con vLLM su un singolo nodo dotato di quattro GPU NVIDIA H200.
Il problema della residenza dei dati
I modelli “closed‑frontier” tradizionali risiedono su infrastrutture di terze parti, il che obbliga a inviare codice sorgente, documentazione di architettura e risultati di test fuori dalla rete aziendale. Questo è inaccettabile per settori soggetti a normative di residenza dei dati, come le banche o gli operatori di tecnologie operative (OT) che non hanno accesso a Internet. I modelli open‑weight risolvono la questione della residenza, ma introducono un nuovo divario di distribuzione: i modelli MoE conservano tutti gli esperti anche quando il carico di lavoro ne utilizza solo pochi, e la cache di contesto (KV cache) compete con i pesi per la memoria GPU.
Come è stato costruito Altar‑1
GLM‑5.3 è un modello MoE da 753 miliardi di parametri, dove ogni token viene indirizzato verso 8 esperti su 256 disponibili per ciascuna layer, corrispondenti a circa 40 miliardi di parametri attivi. Aikido ha applicato due passaggi di compressione per ottenere Altar‑1.
Passaggio 1 – Quantizzazione
Il punto di partenza è il checkpoint cyankiwi GLM‑5.3‑AWQ‑INT4. La tecnica AWQ riduce i pesi degli esperti a 4 bit, mantenendo le attivazioni a 16 bit (W4A16). Gli strati di attenzione, l’esperto condiviso, i layer densi e la testa di output restano in BF16.
Passaggio 2 – Potatura degli esperti
Aikido ha impiegato la tecnologia Cerebras REAP (Router‑weighted Expert Activation Pruning). REAP valuta ogni esperto in base al peso del router e all’intensità dell’output, non solo alla frequenza di selezione. Il risultato è la conservazione di 168 esperti su 256 per layer, eliminando 88 esperti (34,4 %). La potatura avviene senza alcun retraining.
La calibrazione è stata eseguita usando tracce del proprio framework di pentesting, includendo codice, chiamate a tool, ragionamento e testi multilingue di Wikipedia. Nessun dato cliente è stato utilizzato. Ogni esperto è valutato sulla base della più alta quota di lavoro instradato da un singolo dominio, preservando così specialisti per codice, lingue rare e output strutturato.
Il router rimane invariato: per ogni token vengono ancora selezionati 8 esperti, ora tra i 168 rimasti, mantenendo circa 40 miliardi di parametri attivi.
Dimensioni dei checkpoint
- GLM‑5.3 BF16: 1 506,7 GB
- GLM‑5.3 AWQ INT4: 488,2 GB
- Altar‑1 pruned W4A16: 328,0 GB
Altar‑1 risulta quindi 78,2 % più piccolo rispetto al formato BF16 originale e 32,8 % più piccolo rispetto al checkpoint AWQ.
Fidelity del modello
Su un panel di 25 prompt sigillati, Altar‑1 registra una divergenza KL di 0,506 nats rispetto al modello BF16 completo. Un modello costruito con EXL3 nella stessa configurazione ottiene 0,511 nats. I risultati dettagliati sono disponibili nello studio di fidelity pubblico.
Risultati del benchmark di vulnerabilità
Aikido ha valutato Altar‑1 su un benchmark interno di CVE, comprendente 32 vulnerabilità note distribuite su 30 repository, con tre esecuzioni per caso.
| Modello | Recall medio per run | Copertura (almeno una volta) |
|---|---|---|
| GLM‑5.3 BF16 | 65,6 % | 25 di 32 |
| GLM‑5.3 AWQ INT4 | 61,5 % | 23 di 32 |
| Altar‑1 | 60,4 % | 23 di 32 |
Rispetto al checkpoint AWQ, la potatura comporta una perdita di circa 1 punto di recall senza ridurre la copertura. Rispetto al modello BF16, Altar‑1 mantiene 23 delle 25 vulnerabilità coperte (92 %) con una diminuzione di 5,2 punti di recall.
È importante notare che il benchmark è focalizzato sulla riscoperta mirata di CVE in una pipeline che utilizza altri modelli per le fasi circostanti; non misura la scoperta “cieca”, la validazione di exploit o le proposte di fix. Aikido segnala, inoltre, che Al