L’innovativo strumento open-source pxpipe riduce i costi associati all’elaborazione di input di testo estesi in Claude Code e Fable 5 nascondendoli in immagini PNG. Questo trucco funziona capitalizzando la strategia di prezzo di Anthropic per le immagini. Mentre il testo costa circa un token per carattere, le immagini costano un numero fisso di token in base alle loro dimensioni in pixel, indipendentemente da quanto testo esse contengano. Convertendo contenuti densi come codice o JSON in immagini, si possono immettere circa 3.1 caratteri ogni token di immagine.
pxpipe attua questa tecnica funzionando come un proxy locale. Cattura le richieste inviate a Claude Code e trasforma le parti statiche e di peso maggiore in immagini, incluso il prompt del sistema, la documentazione di strumenti e l’ultima cronologia delle chat. I messaggi recenti e le uscite del modello vengono invece gestite come testo normale. L’immagine sottostante mostra cosa effettivamente vede il modello: circa 48.000 caratteri del prompt del sistema e della documentazione degli strumenti vengono compressi su una singola pagina PNG densamente confezionata. Se fosse testo, questo equivalerebbe a circa 25.000 token. In formato immagine, non supera i 2.700.
Secondo lo sviluppatore Steven Chong, i risparmi totali oscillano tra il 59% e il 70%. In un demo con Fable 5, i costi di una sessione si sono ridotti da $42,21 a $6,06. Se questa pratica, abbastanza insolita, dovesse prendere piede, le aziende di AI potrebbero rispondere aumentando i prezzi dell'elaborazione di immagini.
Il compromesso tra precisione e velocità
Questo approccio non è privo di svantaggi. Poiché basa tutto sul rendering e riconoscimento ottico, è un processo parzialmente lossy; stringhe esatte e contenuti complessi come hash potrebbero tornare distorti. Inoltre, il tempo di elaborazione è più lento poiché il modello deve passare le immagini renderizzate attraverso un vision encoder invece di leggere direttamente il testo.
Per default, pxpipe supporta Claude Fable 5 e GPT 5.6. Benchmark ed analisi dettagliate sono documentati nel repository su GitHub. In test su problemi matematici con numeri casuali nuovi ogni volta (che il modello non può aver memorizzato), Fable 5 ha raggiunto l’intera precisione del 100%. Secondo Chong, i modelli Opus 4.7 e 4.8 interpretano male circa il 7% delle immagini, mentre GPT 5.5 non riesce bene nemmeno con il contesto immagine. Questi modelli sono disabilitati per default e possono essere attivati solo manualmente.
Innovazioni precedenti di Deepseek
Il concetto di inviare testo ai modelli di intelligenza artificiale come immagini comprimate non è nuovo: l’azienda Deepseek ha costruito un sistema OCR per processare documenti di testo come immagini, compressi fino a un fattore dieci mantendone il 97% dell’informazione.