Il mercato dell’intelligenza artificiale sta entrando in una fase cruciale dove la variabile chiave non è più solo la potenza dei modelli, ma il costo effettivo per token durante l’inferenza. Secondo un importante report di McKinsey, intitolato “Frontiers of compute: The technologies to reduce AI inference costs”, pubblicato nel giugno 2026, il costo unitario di elaborazione dei token sta diventando un fattore decisivo per la sostenibilità economica dello sviluppo e dell’adozione di modelli AI su larga scala.

Questo cambio di paradigma deriva da una precisa constatazione: il costo marginale di gestire un singolo token in sé può sembrare irrilevante, ma considerando un volume industriale e l’uso diffuso nei chatbot, nell’assistenza digitale, nella generazione di contenuti e negli agenti autonomi, il problema si ingrandisce esponenzialmente. McKinsey sottolinea che alcune applicazioni aziendali non riescono a generare margini significativi e avranno bisogno di una riduzione significativa dei costi per diventare economicamente sostenibili.

Il mercato AI ha lungo tempo osservato l’evoluzione in termini di FLOPs, cioè operazioni floating point al secondo, ma oggi il vero metro del competitività sta nel rapporto tra energia e token, e in ultima analisi nel costo per token. Il report di McKinsey evidenzia che sono emerse tredici tecnologie potenzialmente in grado di ridurre i costi dell’inferenza, con quattro ritenute particolarmente promettenti.

Che cosa possono cambiare queste leve?

Dopo un attento analisi, McKinsey ha selezionato quattro leve che possono portare riduzioni strutturali dei costi:

    • ottimizzazione del software;
    • packaging avanzato 3D;
    • silicio su misura (ASIC per l’inferenza);
    • ottica integrata.

Queste tecnologie, se adottate insieme, potrebbero ridurre il costo per token fino a due ordini di grandezza rispetto al livello attuale.

La leva software: un punto di partenza concreto

La prima leva riguarda l’ottimizzazione software, che include tecniche come la quantizzazione (riduzione della precisione numerica) e il pruning (eliminazione dei parametri non essenziali). Nella simulazione condotta da McKinsey, queste tecnologie possono ridurre il costo per token tra l’85 e il 95%, rendendo commercialmente conveniente l’uso di modelli su larga scala anche con le GPU attuali.

Ridurre la distanza tra memoria e logica: il packaging 3D

Il secondo intervento si concentra sul packaging avanzato 3D, il cui obiettivo è ridurre la distanza fisica tra i componenti di memoria e quelli logici. Questo permette di ridurre notevolmente i ritardi e i consumi di energia. Secondo McKinsey, questa tecnologia potrebbe ridurre il costo per token fino all’80-90%, a patto che venga implementata su larga scala con soluzioni come l’hybrid bonding.

Perché il silicio su misura conta

La terza leva riguarda gli acceleratori hardware su misura, come i cosiddetti ASIC. Il report indica che un chip appositamente disegnato per compiti specifici di inferenza può ridurre il costo per token tra il 70 e l’80%. Tuttavia, il vantaggio non riguarda solo il chip: sono fondamentali l’ecosistema software che lo supporta, la scalabilità e l’adattabilità a nuove tipologie di workload. Anche Google e AWS stanno espandendo i propri progetti in questa direzione, come Ironwood e Trainium.

Qual è il ruolo dell’ottica integrata?

Quando i modelli AI crescono e occupano interi server farm, il passaggio dati diventa una sfida. L’ottica integrata, come il co-packaged optics, potrebbe abbattere i costi di trasmissione e ridurre il consumo energetico. McKinsey stima fino al 65% di risparmio per bit rispetto alle soluzioni tradizionali. Questo è un fattore critico per il futuro delle grandi infrastrutture AI.

L’importanza della catena di produzione

Un aspetto meno evidente, ma fondamentale, è l’efficienza della catena di produzione. McKinsey sottolinea che la disponibilità di macchinari avanzati, l’efficacia nella produzione di HBM e le capacità di fonderie e impianti di packaging 3D giocano un ruolo determinante. Il vantaggio di oggi è non solo nei laboratori, ma nei processi di fabbricazione.

Nuove strategie e investimenti industriali

Questo cambio di paradigma ha spinto i giganti tecnologici ad ampliare le proprie infrastrutture AI. Secondo McKinsey, nel 2026 i quattro principali hyperscalers avevano programmato investimenti complessivi di oltre 700 miliardi di dollari, quasi interamente destinati all’infrastruttura AI. Le notizie più recenti rispecchiano questa accelerazione:

    • Google ha annunciato un aumento di capitale da 84,75 miliardi di dollari;
    • Microsoft ha registrato un aumento dei costi dovuto agli investimenti in calcolo e talenti;
    • Amazon ha investito fino a 50 miliardi di dollari per infrastrutture AI;
    • Meta ha stretto accordi pluriennali con AMD per garantirsi fino a 6 gigawatt di GPU.

Il settore mostra una chiara tendenza: la domanda di hardware AI non è mai stata così alta, ma i giganti preferiscono diversificare i loro fornitori per ridurre i rischi di dipendenza da un singolo produttore.

Il ruolo di TSMC e l’evoluzione del packaging 3D

TSMC sta accelerando nell’industrializzazione di tecnologie chiave come il packaging CoWoS e la piattaforma 3DFabrice. Questo rappresenta uno spostamento di paradigma fondamentale: l’integrazione eterogenea di chip, memoria e interposer diventa una componente strategica, non solo una tecnologia accessoria.

Nvidia e la fotonica: un futuro in luce

Nvidia sta investendo pesantemente nella fotonica con l’obiettivo di risolvere i limiti dei collegamenti elettrici in grandi impianti AI. Nella sua roadmap 2026, la società ha lanciato switch basati su silicon photonics, in grado di collegare milioni di GPU con una riduzione significativa dei consumi. McKinsey indica inoltre investimenti per 2 miliardi di dollari ciascuno in Lumentum e Coherent, sottolineando quindi l’importanza strategica dell’ottica nel prossimo ciclo di crescita AI.

La strategia di Google: modelli più hardware integrati

Google sta rafforzando il rapporto tra modelli AI e hardware fisico. La documentazione relativa al TPU v6e Trillium mostra una strada chiara: progetti future-proof, infrastrutture pensate non solo per hardware isolato, ma per sistemi ibridi hardware-software-servizi. Questo rappresenta una svolta rispetto al passato, dove la separazione fra layer era più marcata.

In sintesi, il costo per token sta diventando un parametro centrale per l’industria AI. Le tecnologie più