Exa ha rilasciato Agent Ultra, la modalità di massimo impegno della sua Exa Agent API, destinata a ricerche che devono arrivare a esaurimento: costruzione di liste su larga scala, arricchimento di entità e interrogazioni che richiedono migliaia di fonti. Secondo il team Exa, Ultra batte Opus 5.5, GPT‑6 Astra e Perplexity Agent, tutti impostati al loro livello di sforzo massimo, su quattro benchmark di ricerca.

Che cos’è Exa Agent Ultra?

Exa Agent divide un compito in sotto‑task e assegna sub‑agenti a più domini contemporaneamente. Il sistema instrada i modelli più avanzati verso le fasi che ne hanno bisogno e utilizza modelli più veloci dove la potenza è sufficiente. Ultra è la modalità che impiega la più grande quantità di calcolo; secondo la documentazione, il processo dura più a lungo di qualsiasi altra impostazione per restituire i risultati più completi.

Le esecuzioni tipiche di Ultra completano compiti complessi in circa trenta minuti; i compiti molto difficili possono richiedere fino a tre ore.

Risultati dei benchmark

Tutte le cifre provengono dal post di lancio di Exa; i concorrenti sono stati testati al loro massimo livello di sforzo. I risultati principali sono:

    • WANDR (soft recall): Agent Ultra 81,4 % – Opus 5.5 72,3 % – GPT‑6 Astra 26,0 % – Perplexity Agent 40,1 %
    • DeepSearchQA (F1): Agent Ultra 93,9 % – Opus 5.5 77,6 % – GPT‑6 Astra 85,3 % – Perplexity Agent 89,7 %
    • WideSearch (F1 a livello di riga): Agent Ultra 58,9 % – Opus 5.5 51,6 % – GPT‑6 Astra 54,7 % – Perplexity Agent 56,0 %
    • Company Find‑All (media entità trovate per task): Agent Ultra 2 451 – Opus 5.5 146 – GPT‑6 Astra 113 – Perplexity Agent 98

Exa accompagna ogni risultato con un’affermazione di costo:

    • WANDR: +12,6 % rispetto a Opus 5.5, a metà del suo costo per task.
    • DeepSearchQA: +4,7 % rispetto a Perplexity, con un costo inferiore del 46 % rispetto a GPT‑6 Astra.
    • WideSearch: +5,2 % rispetto a Perplexity, al costo più basso tra i quattro sistemi.
    • Company Find‑All: +1 579 % rispetto a Opus 5.5, al costo più basso per entità trovata.

Questi guadagni sono relativi, non punti percentuali. Su WANDR il divario assoluto rispetto a Opus 5.5 è di 9,1 punti.

Comprendere questi numeri

WANDR è il benchmark di Perplexity su 500 task di raccolta dati ampi e profondi, con un harness aperto. Il grader di Exa condivide la logica di valutazione a monte, sostituendo Exa come strumento di contenuto, modificando la logica di trasporto e usando gpt‑6‑luna come giudice. Quando un fornitore aveva pubblicato un risultato su questo harness, Exa riporta quel dato; altrimenti, Exa ha eseguito il benchmark internamente.

DeepSearchQA è il benchmark di Google DeepMind su 900 prompt di ricerca multistep.

WideSearch verifica la capacità di raccogliere informazioni su larga scala. Exa ha valutato fino a 200 task per WANDR e DeepSearchQA, e 100 per WideSearch e Company Find‑All. Il numero di task valutati varia per fornitore; tutti i risultati sono riportati dai venditori e non ancora verificati indipendentemente.

Dove si colloca Agent Ultra

Exa individua tre gruppi di utenti target:

    • Fornitori di modelli: assemblare dati di addestramento, ad esempio ogni articolo e repository che implementa una data tecnica, verificando criteri come “pesi rilasciati, non solo un’API”.
    • Servizi finanziari: costruire mappe di mercato per due diligence, condurre ricerche KYC su documenti societari e registri giudiziari, monitorare segnali di portafoglio.
    • Team go‑to‑market: creare liste di account e arricchire righe con campi giudicati, ciascuno supportato da un URL citato.

Ultra può anche espandere una lista esistente: basta fornire le righe già presenti e queste verranno escluse dai nuovi risultati.

API, prezzi e controlli

Ultra utilizza l’endpoint standard di esecuzione di Agent. La richiesta supporta outputSchema, input.data e lo streaming.

Esempio di codice

from exa_py import Exa

exa = Exa()

run = exa.agent.runs.create(

query="Find all companies building browser automation tools in the United States.",

effort="ultra",

)

run = exa.agent.runs.polluntilfinished(run.id, timeout_ms=3 60 60 * 1000)

print(run.stop_reason)

Pricing: fatturazione a consumo secondo le tariffe standard di utilizzo di Agent, fino a un massimo predefinito di 20 $ per esecuzione. Le esecuzioni che terminano prima costano meno.

Budget: maxCostDollars accetta valori da 1 a 100 $; maxDurationSeconds accetta da 300 a 10 800 secondi.

Interruzione: una chiamata di stop termina l’esecuzione in anticipo, conserva i risultati e fattura solo l’utilizzo fino