I ricercatori del Alaya Lab in collaborazione con l'università di Shanghai Jiao Tong e altri istituti accademici hanno introdotto un'architettura innovativa per agenti KI, chiamata AgenticSTS, testandola nell'ambito del gioco Slay the Spire 2. Questo approccio differisce notevolmente da sistemi tradizionali in cui l'agente deve gestire in tempo reale un crescente prompt con decisioni e azioni passate.
Un problema noto: il context rot
I modelli tradizionali, come ReAct o Reflexion, accumulano contesto in ogni iterazione, portando a problemi come il cosiddetto Context Rot, dove il prompt si ingrandisce e si complica al punto da rendere inefficace l'operazione. Questo fenomeno rende l'utilizzo di tali modelli su sistemi che richiedono decisioni rapide e ripetute sempre più economico, lento e impreciso.
Slay the Spire 2 come test per i modelli KI
Il gioco Slay the Spire 2 presenta una sequenza decisionale complessa, in cui il giocatore deve affrontare centinaia di scelte: seleziona carte, gestisce combattimenti, sceglie rotte, acquista oggetti. Questo contesto è quindi ideale per testare e confrontare le capacità decisionali degli agenti KI. I modelli avanzati come Gemini 3.1 Pro, DeepSeek V4-Pro e Qwen 3.6-27B hanno mostrato risultati scarsissimi.
- Solo il 16% di vittoria per giocatori umani su A0.
- Zero vittorie nei modelli tradizionali nei sette run analizzati.
Il gioco rappresenta quindi una sfida estrema per l'intelligenza artificiale, ma allo stesso tempo si presta a testare architetture alternative.
I Cinque Livelli di Memoria in AgenticSTS
AgenticSTS introduce un sistema a cinque livelli di archiviazione per migliorare la gestione delle informazioni su lunghe sequenze decisionali.
- L1: Protocolli fissi, come le istruzioni di gioco.
- L2: Schema di stato con l'insieme delle azioni attualmente ammissibili.
- L3: Regole di gioco recuperate sul momento.
- L4: Esercizi o esperienze maturate in precedenti sessioni.
- L5: Strategie e skill dedicate, come tattiche per situazioni ricorrenti.
Alla base dell'architettura c'è un rifiuto dell'accumulazione lineare: ogni nuova decisione non si basa sul crescente prompt, ma si costruisce con una combinazione mirata di informazioni organizzate negli specifici livelli.
Risultati sperimentali
I test condotti su questo sistema hanno dimostrato un miglioramento significativo. Senza alcuna struttura di memoria, l'agente vince il 30% dei turni. Con l'introduzione della "biblioteca di skill" (L5), la percentuale balza al 60%. Inoltre, quando questa informazione viene accumulata e aggiornata fra un run e l’altro, l'agente riesce a vincere in difficoltà più impegnative:
- Fino al livello A2 con memoria inattiva.
- Fino al livello A6-A8 con memoria viva e aggiornata.
La capacità di acquisire e migliorare la strategia su base iterativa è quindi un aspetto cruciale del modello.
Efficienza e token utilizzati
Uno dei benefici più rilevanti di AgenticSTS riguarda il consumo di risorse. A differenza dei modelli rivali, che per un run potrebbero raggiungere i 527.000 token a causa dell’aggiornamento continuo del prompt, AgenticSTS mantiene il costo a circa 5.000 token per ogni run, indipendentemente da quanto sia avanzata la partita.
Per fare un confronto diretto:
- Agenti tradizionali come STS2MCP e CharTyr richiedono 57-89 volte più token rispetto ad AgenticSTS.
- I run in AgenticSTS sono quattro volte più veloci.
Il tempo inizialmente attribuito all'accumulo del contesto (context accumulation) si riduce notevolmente, grazie al sistema a cinque strati.
Applicabilità a diversi contesti
Uno degli obiettivi futuri del team è di verificare l'applicabilità dell'approccio a tipi di agenti diversi. Fino ad oggi, i test sono riferiti:
- A solo un personaggio (Silent).
- A solo una versione del gioco.
I ricercatori hanno però reso pubblici 298 trascrizioni complete di giocate e gli snapshot del sistema su platform come Hugging Face. Questi dati aprono la strada per altre squadre di ricerca a sperimentare in ambienti simili. Nonostante i dati siano limitati, l'approccio offre già una straordinaria base per futuri sviluppi.
Un modello non isolato
AgenticSTS non è il primo tentativo di risolvere il problema del context rot. Anche altri laboratori e aziende si sono impegnate nello studio e sviluppo di modelli con memoria artificiale:
- Anthropic utilizza il Memory Tool e il Context Editing per gestire contesti grandi con un approccio organizzato.
- GAM (da un laboratorio cinese) ha approcciato il problema di archiviazione e retrieval da diversi angoli.
Confrontando il lavoro con questi rivali, il documento rivela un vantaggio decisivo per AgenticSTS in termini di token utilizzati e risultati raggiunti.
Conclusioni e futuri sviluppi
AgenticSTS non mira a sostituire la ricerca in corso, bensì a offrire nuovi paradigmi per gestire decisioni in lunghe sequenze. Con un sistema a cinque strati, l’agente mostra una maggiore capacità decisionale e migliore efficienza in termini di token e tempo. Questo approccio, se ulteriormente sviluppato e testato in contesti diversi, potrebbe influenzare notevolmente il futuro dell'intelligenza artificiale, rendendola più adatta a compiti complessi come la strategia, il ragionamento o la gestione di informazioni di lunga durata.