Exa ha rilasciato Agent Ultra, la modalità di massimo impegno della sua Exa Agent API, destinata a ricerche che devono arrivare a esaurimento: costruzione di liste su larga scala, arricchimento di entità e interrogazioni che richiedono migliaia di fonti. Secondo il team Exa, Ultra batte Opus 5.5, GPT‑6 Astra e Perplexity Agent, tutti impostati al loro livello di sforzo massimo, su quattro benchmark di ricerca.
Che cos’è Exa Agent Ultra?
Exa Agent divide un compito in sotto‑task e assegna sub‑agenti a più domini contemporaneamente. Il sistema instrada i modelli più avanzati verso le fasi che ne hanno bisogno e utilizza modelli più veloci dove la potenza è sufficiente. Ultra è la modalità che impiega la più grande quantità di calcolo; secondo la documentazione, il processo dura più a lungo di qualsiasi altra impostazione per restituire i risultati più completi.
Le esecuzioni tipiche di Ultra completano compiti complessi in circa trenta minuti; i compiti molto difficili possono richiedere fino a tre ore.
Risultati dei benchmark
Tutte le cifre provengono dal post di lancio di Exa; i concorrenti sono stati testati al loro massimo livello di sforzo. I risultati principali sono:
- WANDR (soft recall): Agent Ultra 81,4 % – Opus 5.5 72,3 % – GPT‑6 Astra 26,0 % – Perplexity Agent 40,1 %
- DeepSearchQA (F1): Agent Ultra 93,9 % – Opus 5.5 77,6 % – GPT‑6 Astra 85,3 % – Perplexity Agent 89,7 %
- WideSearch (F1 a livello di riga): Agent Ultra 58,9 % – Opus 5.5 51,6 % – GPT‑6 Astra 54,7 % – Perplexity Agent 56,0 %
- Company Find‑All (media entità trovate per task): Agent Ultra 2 451 – Opus 5.5 146 – GPT‑6 Astra 113 – Perplexity Agent 98
Exa accompagna ogni risultato con un’affermazione di costo:
- WANDR: +12,6 % rispetto a Opus 5.5, a metà del suo costo per task.
- DeepSearchQA: +4,7 % rispetto a Perplexity, con un costo inferiore del 46 % rispetto a GPT‑6 Astra.
- WideSearch: +5,2 % rispetto a Perplexity, al costo più basso tra i quattro sistemi.
- Company Find‑All: +1 579 % rispetto a Opus 5.5, al costo più basso per entità trovata.
Questi guadagni sono relativi, non punti percentuali. Su WANDR il divario assoluto rispetto a Opus 5.5 è di 9,1 punti.
Comprendere questi numeri
WANDR è il benchmark di Perplexity su 500 task di raccolta dati ampi e profondi, con un harness aperto. Il grader di Exa condivide la logica di valutazione a monte, sostituendo Exa come strumento di contenuto, modificando la logica di trasporto e usando gpt‑6‑luna come giudice. Quando un fornitore aveva pubblicato un risultato su questo harness, Exa riporta quel dato; altrimenti, Exa ha eseguito il benchmark internamente.
DeepSearchQA è il benchmark di Google DeepMind su 900 prompt di ricerca multistep.
WideSearch verifica la capacità di raccogliere informazioni su larga scala. Exa ha valutato fino a 200 task per WANDR e DeepSearchQA, e 100 per WideSearch e Company Find‑All. Il numero di task valutati varia per fornitore; tutti i risultati sono riportati dai venditori e non ancora verificati indipendentemente.
Dove si colloca Agent Ultra
Exa individua tre gruppi di utenti target:
- Fornitori di modelli: assemblare dati di addestramento, ad esempio ogni articolo e repository che implementa una data tecnica, verificando criteri come “pesi rilasciati, non solo un’API”.
- Servizi finanziari: costruire mappe di mercato per due diligence, condurre ricerche KYC su documenti societari e registri giudiziari, monitorare segnali di portafoglio.
- Team go‑to‑market: creare liste di account e arricchire righe con campi giudicati, ciascuno supportato da un URL citato.
Ultra può anche espandere una lista esistente: basta fornire le righe già presenti e queste verranno escluse dai nuovi risultati.
API, prezzi e controlli
Ultra utilizza l’endpoint standard di esecuzione di Agent. La richiesta supporta outputSchema, input.data e lo streaming.
Esempio di codice
from exa_py import Exa
exa = Exa()
run = exa.agent.runs.create(
query="Find all companies building browser automation tools in the United States.",
effort="ultra",
)
run = exa.agent.runs.polluntilfinished(run.id, timeout_ms=3 60 60 * 1000)
print(run.stop_reason)
Pricing: fatturazione a consumo secondo le tariffe standard di utilizzo di Agent, fino a un massimo predefinito di 20 $ per esecuzione. Le esecuzioni che terminano prima costano meno.
Budget: maxCostDollars accetta valori da 1 a 100 $; maxDurationSeconds accetta da 300 a 10 800 secondi.
Interruzione: una chiamata di stop termina l’esecuzione in anticipo, conserva i risultati e fattura solo l’utilizzo fino