Introduzione
Una delle tecniche più semplici e allo stesso tempo più efficaci per accelerare un modello linguistico di grandi dimensioni è la rimozione di interi blocchi transformer. Riducendo la profondità del modello, la depth pruning garantisce velocità di inferenza prevedibili e risparmi di memoria, oltre a integrarsi bene con quantizzazione, compressione a rango basso e altre strategie di ottimizzazione. Il vero problema, però, è decidere quali blocchi tagliare: rimuovere i blocchi sbagliati può far crollare le prestazioni, e l’effetto di eliminare un blocco dipende da quali altri vengono rimossi contemporaneamente.
Questo rende la selezione un problema combinatorio, non di semplice ranking. I problemi combinatori con variabili binarie interagenti sono esattamente l’ambito di applicazione della fisica dei sistemi di spin, e il nostro ultimo lavoro, LLM Compression by Block Removal with Constrained Binary Optimization, sfrutta questa corrispondenza in modo letterale.
Da blocchi a spin: la formulazione Ising
Riformuliamo la scelta dei blocchi come un problema di ottimizzazione binaria vincolata (CBO) che si mappa direttamente su un vetro di Ising, un sistema di spin disordinato con interazioni “all‑to‑all” e un numero fissato di spin “su”. L’energia di questo sistema di spin si dimostra un proxy forte e a basso costo per la qualità del modello potato: configurazioni a bassa energia corrispondono a modelli potati con alte prestazioni sui benchmark.
Grazie a questa proprietà possiamo valutare un’enorme quantità di configurazioni candidate senza eseguire effettivamente il modello, affidandoci a solver classici e ispirati al quantum usati in Multiverse. Nei casi di compressione profonda, i guadagni sono notevoli: con il 50 % di compressione di Llama‑3.3‑70B‑Instruct otteniamo quasi 23 punti percentuali in più su MMLU rispetto al miglior metodo concorrente di rimozione blocchi.
Limiti dei metodi tradizionali
La maggior parte dei metodi esistenti valuta ogni blocco singolarmente, poi rimuove quelli ritenuti meno importanti usando euristiche basate su magnitudine, sensibilità o “block influence”. In termini fisici, questi sono metodi mean‑field: trattano ogni blocco come se la sua contribuzione fosse indipendente dalle altre, analogamente alla teoria del campo medio che sostituisce i vicini di uno spin con un campo medio unico.
Un’altra scorciatoia comune è rimuovere un unico blocco consecutivo, riducendo la dimensione del problema ma scartando la maggior parte dello spazio di ricerca.
Interazioni tra blocchi
I blocchi non sono indipendenti, proprio come gli spin in un magnete reale. Rimuovere il blocco 20 può avere un impatto diverso a seconda che si rimuovano anche il blocco 19 o il blocco 24: esistono interazioni – o accoppiamenti – tra le decisioni. Man mano che i modelli diventano più profondi e più eterogenei, ignorare questi accoppiamenti comporta una perdita di qualità, specialmente quando si vogliono rimuovere molti blocchi contemporaneamente.
Quello che realmente occorre è esplorare combinazioni di blocchi tenendo conto delle loro interazioni, ma il numero di combinazioni cresce esponenzialmente, rendendo il brute force apparentemente impossibile. È proprio in questi spazi di configurazione esponenzialmente grandi con accoppiamenti pairwise che gli strumenti della fisica statistica trovano la loro utilità.
Costruzione dell’Hessian
Associamo a ciascun blocco transformer una variabile binaria: 0 significa mantenere, 1 significa rimuovere, analogamente a uno spin che può puntare verso il basso o verso l’alto. Eseguiamo quindi un’espansione di Taylor di ordine due della loss del modello rispetto a queste variabili, ottenendo una matrice Hessiana approssimata.
La diagonale dell’Hessian indica quanto ciascun blocco sia importante da solo; le voci fuori diagonale rappresentano gli accoppiamenti pairwise, la “fisica a molti corpi” che i metodi mean‑field trascurano.
Formulazione matematica del problema
Il problema diventa: trovare l’insieme di M blocchi la cui rimozione minimizza l’energia xᵀ H⁰ x, soggetto al vincolo di rimuovere esattamente M blocchi su N totali. Matematicamente, è un CBO; fisicamente, è un vetro di Ising con magnetizzazione conservata (il numero fisso di blocchi rimossi è la “magnetizzazione” totale).
Stabilito che l’energia è un forte proxy per la qualità finale, minimizzare l’energia equivale a massimizzare il punteggio sui benchmark.
Costo computazionale ridotto
Il vantaggio pratico risiede nel costo. L’Hessian – l’intero set di accoppiamenti – viene calcolato una sola volta, mediante passate forward e backward su un piccolo dataset di calibrazione. Dopo di che, valutare qualsiasi configurazione candidata richiede un’unica, economica, operazione di calcolo dell’energia, senza bisogno di eseguire il modello né di benchmarkarlo. Inoltre, poiché gli accoppiamenti non dipendono dal target di compressione, la stessa Hessian può essere riutilizzata per risolvere diversi valori di M.
Brute force su GPU e scalabilità
Per la maggior parte dei modelli lo spazio di configurazione è ampio ma ancora verificabile. Grazie alla rapidità del calcolo dell’energia, è possibile effettuare un brute force su una singola GPU, controllando fino a decine di miliardi di configurazioni di spin. Alcuni milioni vengono valutati in pochi secondi; il caso più difficile affrontato, la rimozione di 8 blocchi su 80 di Llama‑3.3‑70B (circa 29 miliardi di configurazioni), ha richiesto circa due giorni.
Superato questo limite, l’approccio esatto non è più praticabile, ed è qui che la formulazione Ising offre un secondo vantaggio.
Solver quantistici e ispirati al quantum
In forma QUBO (Quadratic Unconstrained Binary Optimization), con il vincolo incorporato in un termine di penalità, lo stesso compito può essere affidato a solver altamente ottimizzati – classici, quantistici e ispirati al quantum – progettati per questo tipo di Hamiltoniano. Le tecnologie di quantum annealing, QAOA, tabu search e branch‑and‑bound sono tutte disponibili nella nostra infrastruttura.
Abbiamo scoperto che un solver tabu open‑source raggiunge in pochi secondi gli stati a più bassa energia anche nei casi più difficili verificati tramite brute force. Questo consente di scalare a modelli dove l’enumerazione è impossibile, sfruttando solver già presenti nel dominio di Multiverse.