Quando abbiamo introdotto GPT‑6 Astra, abbiamo dimostrato quanto i nostri modelli siano evoluti nell’uso del computer per attività professionali, dalla preparazione di documenti al testing di siti web. Il nuovo obiettivo è rendere gli agenti più capaci ed efficienti nell’utilizzare software specializzati per risolvere problemi aziendali complessi, addestrandoli a comprendere le regole di business, eseguire workflow multistep e verificare che il risultato soddisfi i requisiti originali.

Per accelerare questa ricerca, collaboriamo direttamente con un numero limitato di aziende software che conoscono a fondo questi workflow. Insieme identifichiamo compiti sfidanti e di alto valore, trasformandoli in problemi di ricerca per addestrare e valutare i nostri modelli, con l’obiettivo finale di renderli più utili nelle applicazioni reali.

Il nostro primo partner è Ironclad, leader nell’intelligenza artificiale per i contratti. Lavorando a stretto contatto con il team di Ironclad, abbiamo sviluppato compiti che richiedono agli agenti di configurare accordi, approvazioni e clausole legali riutilizzabili, dimostrando progressi su questi workflow complessi. L’expertise di Ironclad è stata fondamentale per definire cosa significhi avere successo e per portare esigenze reali dei clienti direttamente nello sviluppo dei modelli di frontiera.

Trasformare i workflow contrattuali in compiti di addestramento

Immaginiamo un team di operazioni legali che imposta un processo per l’acquisto di software. Il reparto finanziario può dover approvare acquisti superiori a una certa soglia, la sicurezza deve revisionare richieste specifiche e il legale deve esaminare clausole non standard. Chi progetta il processo deve trasformare questa breve lista in un modulo di intake, in modelli di documento, in regole di approvazione e in un registro dell’accordo finale.

Un agente di IA che svolge lo stesso lavoro deve tenere presenti questi requisiti mentre si muove nel software. Ad esempio, deve configurare l’approvazione finanziaria sopra la soglia di spesa e verificare che le richieste sopra e sotto tale soglia seguano i percorsi corretti. Non basta eseguire i singoli passaggi: il processo finale deve funzionare in tutti gli scenari per i quali è stato progettato.

Dipendenti di Ironclad e utenti di Ironclad presso OpenAI hanno aiutato i ricercatori a individuare 11 compiti nei settori legale, commerciale e di procurement. Questi includono:

    • Impostare accordi di non divulgazione (NDA)
    • Creare processi di approvazione per gli acquisti
    • Aggiornare una clausola legale riutilizzabile in base alla giurisdizione selezionata dal richiedente
    • Definire flussi di revisione per termini contrattuali non standard
    • Generare modelli di contratto basati su criteri di rischio
    • Automatizzare la raccolta di firme elettroniche
    • Configurare regole di escalation per richieste non conformi
    • Integrare policy di sicurezza nei contratti di software
    • Personalizzare clausole di privacy secondo le normative locali
    • Impostare notifiche automatiche per scadenze contrattuali
    • Validare la coerenza di termini legali attraverso più versioni di documento

Stimiamo che un utente esperto impieghi circa 30‑40 minuti per completare ciascuno di questi compiti. Abbiamo valutato ogni compito rispetto a 8‑50 criteri, a seconda della sua complessità, per capire quali parti il modello esegue correttamente e dove fallisce. Ironclad ha fornito ambienti software ospitati dove i modelli possono praticare i compiti. I ricercatori hanno poi creato compiti sintetici basati su workflow rappresentativi e hanno utilizzato l’apprendimento per rinforzo per migliorare i modelli attraverso pratica e feedback. Questa combinazione di compiti scelti da esperti, criteri dettagliati e ambienti di pratica garantisce che i progressi siano direttamente rilevanti per le esigenze dei clienti.

Come ha performato Astra

Abbiamo confrontato Astra e GPT‑5.6 Sol utilizzando rispettivamente le impostazioni “Max reasoning” per Astra e “High reasoning” per Sol, i parametri in cui ciascun modello ottiene il punteggio più alto. Su 11 compiti di ricerca, Astra ha raggiunto un punteggio medio del 55,0 %, contro il 41,6 % di GPT‑5.6 Sol, mentre il tempo medio stimato per tentativo è sceso da 37,0 minuti a 19,2 minuti.[3] Un modello interno usato nello sviluppo di Astra ha ottenuto un punteggio ancora più alto, 63,7 %, e miriamo a trasferire questi guadagni ai futuri modelli.

Astra ha soddisfatto un numero maggiore di requisiti di task con meno tempo simulato per tentativo. Nei due clip mostrati, Astra ha coperto circa il 94 % dei criteri in un tempo stimato di 20 minuti, mentre GPT‑5.6 Sol ha coperto circa l’85 % in 32 minuti.

GPT‑6 Astra ha raggiunto circa il 94 % dei criteri in 20 minuti.

GPT‑5.6 Sol ha raggiunto circa il 85 % dei criteri in 32 minuti.

Cosa significa questa collaborazione per Ironclad

Il ruolo di Ironclad in questo