Introduzione

Asana aiuta i clienti ad automatizzare il lavoro su più applicazioni aziendali tramite StackAI, una piattaforma acquisita per consentire l’esecuzione incrociata di sistemi da parte di team composti da agenti umani e software. Con StackAI, gli utenti costruiscono flussi di lavoro capaci di navigare siti web, compilare moduli e raccogliere informazioni senza scrivere codice. A scala Asana, anche piccole inefficienze in questi flussi si traducono in costi significativi.

Identificazione delle inefficienze del browser‑agent con GPT‑6 Astra

Il CTO di StackAI, Frank Hidalgo, PhD, ha affidato a GPT‑6 Astra in Codex il compito di mappare il codebase dell’agente e spiegare come venivano generate le richieste al modello. Astra ha scoperto due problemi principali:

    • Il caching veniva applicato solo alle istruzioni fisse e alle definizioni degli strumenti, ma non alla cronologia testuale e agli screenshot raccolti durante la navigazione, facendo sì che ogni richiesta includesse nuovamente l’intera cronologia a prezzo pieno.
    • L’agente eliminava regolarmente screenshot più vecchi e riduceva il testo a quasi ogni passo, alterando la cronologia e obbligandolo a rileggere pagine già esaminate.

Da due mesi di ricerca a una settimana con GPT‑6 Astra

Hidalgo ha valutato le proposte di correzione di Astra e ne ha selezionate tre da testare:

    • Estendere il caching alla cronologia di navigazione dell’agente.
    • Aumentare la quantità di testo che l’agente può conservare.
    • Rimuovere gli screenshot in batch anziché ad ogni singolo passo.

Astra ha iniziato con test rapidi per identificare le variabili più influenti. Poiché il codice originale non era predisposto per esperimenti controllati, è stato ristrutturato in modo che un unico front‑end e back‑end potessero gestire più flussi in parallelo, ciascuno con impostazioni proprie.

Studio a 144 esecuzioni

Lo studio ha valutato budget di cronologia di 120 000 e 480 000 caratteri, sei politiche di caching e screenshot, testate tre volte su ciascuno dei quattro modelli (Modelli A, B, C e GPT‑6.1 Sol). La politica più efficace ha consentito agli screenshot di accumularsi fino a 20 prima di tornare a mantenere solo l’ultimo, preservando così la cronologia più vecchia per periodi più lunghi. In combinazione con il budget di cronologia più ampio, è nato il flusso di lavoro ottimizzato.

Ogni configurazione ha eseguito lo stesso compito: raccogliere sei campi per ognuno dei 32 libri di un catalogo demo pubblico, un’attività rappresentativa di molti clienti Asana su StackAI.

ModelloDescrizionePrezzo
Modello AModello più piccolo e meno costoso di un altro laboratorio frontier, rilasciato nell’autunno 2025Metà del prezzo di GPT‑6.1 Sol
Modello BModello usato originariamente in produzione, dallo stesso laboratorio del Modello A, rilasciato nell’estate 2026Stesso prezzo di GPT‑6.1 Sol
Modello CVersione aggiornata del Modello B, rilasciata nell’autunno 2026Stesso prezzo di GPT‑6.1 Sol
GPT‑6.1 SolModello di OpenAI—

Tutte le richieste, i tracciati di dati e i risultati sono stati registrati in Command, la piattaforma di consegna software di Asana, per consentire una revisione completa dopo lo studio. Da Command, le scoperte sono state trasformate in ticket, poi in pull request, e infine implementate in produzione.

“Questo è ciò che team di umani e agenti sembrano nella pratica. Un ingegnere definisce la direzione, GPT‑6 Astra esegue gli esperimenti, e i risultati passano attraverso Command verso la produzione.” — Arnab Bose, CPO di Asana

Portare il costo del modello sotto $0,50 per esecuzione

Con il Modello B, l’ottimizzazione ha ridotto il costo stimato da almeno $36,21 (alcune esecuzioni originali hanno raggiunto il limite di passaggi prima di terminare) a $1,24 per run, una diminuzione di 29 volte. Il flusso ottimizzato su GPT‑6.1 Sol è stato ancora 2,6 volte più economico, arrivando a $0,47 per run, con tutti i task completati correttamente.

Con il budget di cronologia più ampio, la nuova politica di caching e gestione degli screenshot ha abbattuto il costo da $1,97 a $0,47 per esecuzione, riducendo il prezzo di ogni chiamata di circa 3 volte perché l’89 % dell’input proveniva dalla cache al 5 % del prezzo non cached. I tempi di esecuzione sono passati da almeno 22,5 minuti (setup originale su Modello B) a circa quattro minuti con GPT‑6.1 Sol.

Un ulteriore risultato è stato l’aumento della percentuale di esecuzioni che producevano una risposta valida: con il budget di cronologia più piccolo solo 3 su 18 run hanno restituito una risposta, mentre con il budget più grande tutte e 18 hanno fornito la risposta corretta.

“Il costo limitava i modelli che potevamo offrire ai clienti per questi carichi di lavoro. Rendendo l’agente più efficiente, possiamo fornire un modello più veloce e migliore riducendo al contempo i costi operativi.” — Frank Hidalgo, PhD, CTO di StackAI

Scalare la sperimentazione e i test di prodotto

Asana ha già rilasciato le modifiche al motore di navigazione browser in StackAI e sta sviluppando strumenti per rendere questi esperimenti più facili da ripetere. L’obiettivo a medio