Il mercato dell'intelligenza artificiale (IA) sta vivendo una dinamica apparentemente contraddittoria: i prezzi dei token, unità di fatturazione dei modelli linguistici, scendono costantemente, ma la disponibilità di hardware specializzato, in particolare le GPU H100 di Nvidia, rimane limitata e costosa. Il fenomeno è stato definito da analisti di a16z come un classico Paradosso di Jevons, dove l'aumento dell'efficienza (costo più basso dei token) stimola un consumo ancora maggiore, neutralizzando i benefici di prezzo.
Che cosa indicano i dati recenti
Secondo le statistiche raccolte da Ornn, Silicon Data e Bloomberg fino ad agosto 2026, il Token‑Price Index è sceso del 28 % rispetto all'anno precedente, mentre il prezzo medio di noleggio di una GPU H100 su piattaforme cloud è aumentato del 12 %. La discrepanza tra questi due indicatori è evidente nel grafico diffuso su X, che mostra una tendenza opposta tra costi di consumo e costi di provisioning.
Meccanismi alla base del paradosso
Il paradosso di Jevons si basa su due assunzioni chiave:
- Domanda elastica: la riduzione dei prezzi dei token rende l'IA più accessibile a una gamma più ampia di utenti, dalle piccole startup alle grandi imprese.
- Capacità di scaling limitata: l'infrastruttura hardware non può espandersi in modo proporzionale alla crescita della domanda, a causa di colli di bottiglia nella produzione di chip, nella disponibilità di memoria e nei costi energetici.
Queste due forze generano un ciclo di retroazione: più token a basso costo spingono gli sviluppatori a creare agenti AI più complessi, che consumano token in maniera “sprecante”. Il risultato è una domanda di GPU che supera l'offerta, mantenendo alti i prezzi di noleggio.
Impatto sui diversi attori del mercato
Il fenomeno ha conseguenze su più livelli:
- Produttori di chip: Nvidia registra un aumento della domanda di H100, ma le capacità produttive di TSMC e Samsung rimangono vincolate da una carenza di wafer a 5 nm.
- Fornitori di energia: i data center consumano più energia per mantenere attivi i cluster GPU, spingendo le utility a rinegoziare i contratti di fornitura.
- Investitori e mercati finanziari: la notizia di un possibile ribasso del fatturato annuale di OpenAI ha provocato una reazione negativa sui titoli tecnologici statunitensi, evidenziando la sensibilità del mercato a queste dinamiche.
Esempi concreti di consumo eccessivo di token
Le applicazioni di agentic AI (intelligenze artificiali autonome) sono particolarmente affamate di token. Un singolo agente di assistenza clienti, integrato in una piattaforma di e‑commerce, può consumare fino a 15 token al secondo durante picchi di traffico, traducendosi in centinaia di migliaia di token al giorno. Un altro caso studio riguarda i sistemi di generazione di contenuti video, dove la combinazione di modello di linguaggio e modello di diffusione richiede in media 40 token per ogni minuto di video prodotto, generando una spesa notevole nonostante il calo del prezzo unitario.
Strategie operative per startup e imprese
Per mitigare gli effetti del paradosso, le aziende possono adottare diverse strategie:
- Ottimizzazione dei prompt: ridurre il numero di token richiesti mediante prompt più concisi e strutturati.
- Cache locale dei risultati: memorizzare le risposte più frequenti per evitare chiamate ripetute al modello.
- Uso ibrido di hardware: combinare GPU on‑premise con soluzioni di inferenza edge per distribuire il carico.
- Negoziazione di contratti a lungo termine: assicurarsi tariffe fisse per il noleggio delle GPU, riducendo l'esposizione a fluttuazioni di prezzo.
Prospettive future e raccomandazioni per i policymaker
Le autorità di regolamentazione e le istituzioni pubbliche possono influenzare positivamente il mercato:
- Incentivi alla produzione di chip: sgravi fiscali per fabbriche che aumentano la capacità di produzione di GPU di ultima generazione.
- Standard energetici: promozione di data center alimentati da fonti rinnovabili per contenere i costi energetici associati al training e all'inferenza.
- Trasparenza dei prezzi: obbligare i fornitori di cloud a pubblicare indici di prezzo dei token e delle GPU in modo periodico.
Implementare queste misure può ridurre la dipendenza da pochi fornitori di hardware, migliorare la prevedibilità dei costi per le imprese e favorire una crescita sostenibile del settore IA.
Conclusioni
Il Paradosso di Jevons nel mercato dell'IA dimostra come l'abbassamento dei costi di consumo non garantisca automaticamente un miglioramento dei costi di produzione. La scarsità di GPU H100, unita a un aumento esponenziale della domanda di token, sta creando una tensione che coinvolge tutti gli attori della catena di valore. Le aziende che sapranno adottare pratiche di ottimizzazione dei token, diversificare le proprie architetture hardware e negoziare contratti stabili saranno meglio posizionate per affrontare le sfide future, mentre i decisori politici dovranno intervenire per garantire una capacità produttiva adeguata e un contesto energetico sostenibile.