Il report «The plunging price of thought», firmato da Luke Emberson e David Roodman e pubblicato il 22 settembre, fornisce la prima misura sistematica di quanto costi raggiungere un determinato livello di prestazione con un modello linguistico e di quanto rapidamente tale costo diminuisca. Secondo i dati di Epoch AI, dal 2023 il prezzo scende del 47 % a trimestre, cioè si divide per tredici in un anno, una velocità di deprezzamento mai osservata in altre tecnologie, nemmeno in quelle che hanno trasformato l’economia come l’elettricità o il sequenziamento del DNA.

Metodo di misurazione innovativo

Le analisi precedenti, tra cui quella di Andreessen Horowitz sul fenomeno «LLM inflation», valutavano il costo per token, cioè il prezzo di un frammento di testo elaborato. Con l’avvento dei modelli di ragionamento, che consumano molti più token per generare catene intermedie, il costo per token è diventato un indicatore poco rappresentativo. Epoch, invece, misura il costo per compito, ovvero quanto si spende in media per rispondere a una domanda di un benchmark standard.

Il metodo si basa su cinque benchmark principali:

    • Matematica da competizione
    • Matematica di ricerca
    • Scienze a livello di dottorato
    • Problemi di scacchi
    • Un gioco tenuto segreto per evitare addestramenti mirati

Per ogni modello, Epoch ricostruisce l’intera curva tra spesa e punteggio simulando budget di token progressivamente più stretti, con una procedura sviluppata dal CAISI, il centro federale americano per gli standard sull’AI. Da questa curva deriva la frontiera di Pareto, che indica, in ogni momento, il modello più economico capace di raggiungere un dato punteggio.

Esempio leggibile: GPQA Diamond

GPQA Diamond è un esame a scelta multipla di fisica, chimica e biologia a livello dottorale. Nel 2025‑03, GPT‑4‑o, modello di ragionamento di OpenAI, raggiungeva il 75 % del punteggio utile spendendo circa 0,30 $ per domanda. Meno di un anno e mezzo dopo, GPT‑5.6 Luna, il modello economico di OpenAI il cui listino è stato ridotto dell’80 % a fine luglio, ottiene lo stesso risultato con soli 0,0004 $ per domanda, un calo di 725 volte.

Confronto con altre tecnologie di trasformazione

Per dare una scala a questi numeri, Epoch confronta l’AI con altre tecnologie che hanno cambiato interi settori:

    • Prezzo medio dell’elettricità domestica negli USA (1892‑1973): 1,05 × all’anno
    • Batterie agli ioni di litio (1991‑2024): 1,16 × all’anno
    • Potenza di calcolo (1940‑2001): 1,51 × all’anno
    • Sequenziamento del genoma (dal 2001): 1,84 × all’anno

Misurato in punti logaritmici, il prezzo dell’inferenza dell’AI cala quattro volte più velocemente del sequenziamento del DNA, sei volte più del calcolo, diciotto volte più delle batterie e cinquanta‑quattro volte più dell’elettricità. Tradotto su un orizzonte di tre anni, l’elettricità perde circa un settimo del suo prezzo, mentre l’AI lo divide per oltre duemila.

Una discesa già in atto prima del 2023

Una prova più grezza suggerisce che il trend discendente sia iniziato prima del 2023. Nel novembre 2021, GPT‑3 (uso commerciale) otteneva 43,9 punti nel test MMLU a 60 $ per milione di token. Nel luglio 2023, Llama 2‑7B di Meta superava quel punteggio a 0,20 $, corrispondente a un calo composto di 31 × all’anno. Gli autori ritengono plausibile che il costo si riduca di almeno tredici volte all’anno fin dagli esordi dell’inferenza commerciale.

Impatto sulla pianificazione aziendale

Il rapido calo dei costi influisce più della bolletta energetica sulla pianificazione aziendale. Un caso d’uso che oggi non è profittevole può diventare redditizio in pochi trimestri, mentre contratti a prezzo fisso su più anni rischiano di invecchiare prima della scadenza, perdendo competitività rispetto a soluzioni più recenti.

La dinamica è particolarmente marcata nei primi trimestri dopo che un certo livello di prestazione è raggiunto per la prima volta. Su tre dei cinque benchmark, il costo scende del 66 % a trimestre al debutto (divisione per 75 in un anno) per poi stabilizzarsi al 32 % a trimestre due anni dopo, corrispondente a un fattore annuo di 4,7.

Motivi commerciali della discesa dei prezzi

Gli autori ipotizzano che la ragione principale sia commerciale: chi lancia per primo una nuova capacità la può vendere a premio per un breve periodo; poi i concorrenti (sia chiusi che aperti) raggiungono la stessa capacità, facendo crollare i prezzi fino a quando la competizione si stabilizza. Di conseguenza, i profitti superiori alla media nella vendita di inferenza sono fugaci e legati a cicli di innovazione rapidi.

Concorrenza chiusa vs aperta

Nel periodo vicino allo stato dell’arte, la concorrenza più accesa è avvenuta tra modelli chiusi. L’unico caso in cui il secondo modello più economico fosse open‑source è stato QwQ‑32B di Alibaba, utilizzato nella matematica da competizione AIME. Tuttavia, i tagli di listino di luglio‑agosto hanno mostrato che i modelli aperti, soprattutto cinesi, hanno avuto l’effetto più visibile nella fascia dell’«intelligenza sufficiente», contribuendo indirettamente alla pressione sui prezzi.

Strategie di acquisto consigliate

Contrariamente all’intuito, acquistare lo stato dell’arte appena rilasciato significa pagare la fase più cara di una curva di costo che nei trimestri successivi scende rapidamente. È conveniente farlo solo quando la capacità è indispensabile immediatamente e il valore generato supera il sovrapprezzo. In altri casi, è più saggio attendere una o due iterazioni,