Che cos’è verifiers v1?

Verifiers v1 rappresenta l’ambiente principale di Prime Intellect per il rinforzo e la valutazione degli agenti intelligenti. In precedenza, ogni ambiente combinava dati, logica e infrastruttura. Ora, invece, v1 separa queste componenti in tre parti modulari: taskset (definisce il lavoro), harness (gestisce la soluzione), e runtime (dove il lavoro si svolge).

Architettura di Funzionamento

Il componente centrale del sistema è il "server di intercettazione", che funziona come intermediario tra il runtime dell’agente e il server di inferenza. Questo server registra le tracce, imposta i parametri di campionamento e può modificare le risposte degli strumenti. Le modifiche mirano a evitare manipolazioni del compenso durante il training.

Server e Multiplexing

Ogni server gestisce un certo numero di rollouts, di cui il valore predefinito è 32. I server si ridimensionano automaticamente in base alla concorrenza osservata e includono un client che rilancia le richieste. Durante le valutazioni, un EvalClient funziona come un proxy HTTP, mentre durante il training, un TrainClient include i renderizzatori per l’apprendimento fedele basato su token.

Supporto ai Diversi Dialects

Verifiers v1 gestisce diversi linguaggi di invio, inclusi OpenAI Chat Completions, OpenAI Responses e Anthropic Messages. Un adattatore di dizionari normalizza ogni formato in un tipo comune, garantendo che il tuo criterio di punteggio rimanga indipendente dal modello in uso.

Confronto tra v0 e v1

Le differenze principali tra v0 e v1 includono: il modello ambiente, la crescita della traccia, la gestione dei rollouts non lineari, il runtime e i rapporti tra harness e ambiente, e l’uso dei dati di formazione.

    • Modello ambiente: v0 ha tutti i componenti in un'unica struttura; v1 li separa in taskset, harness e runtime.
    • Crescita traccia: v0 è quadratica, v1 é lineare.
    • Ramificazione: v0 assume lineare; v1 supporta compattazione e sub-agenti.
    • Gestione runtime: v0 gestisce interamente il ciclo, v1 lo delega al framework.
    • Dati di formazione: v0 li rigenerava, v1 li utilizza direttamente.

Uso Pratico con Esempi

Ad esempio, puoi eseguire Nemotron 3 Ultra su Terminal-Bench 2 utilizzando Codex. Altri esempi includono il riutilizzo dei dataset Harbor senza riscrivere la logica di ricompensa, come nel caso in cui Prime Intellect abbia migrato Terminal Bench 2 alla versione v1 con un piccolo set di classi.

Addestramento con verifiers

Gli ambienti di verifiers sono direttamente compatibili con prime-rl, un framework di addestramento di agenti. In un esperimento, GLM-4.5-Air ha svolto un’ablazione del limite di lunghezza utilizzando ScaleSWE su sei nodi H200. L’addestramento ha richiesto due giorni e l’ha valutato su SWE-Bench-Verified。

Esempio di Taskset Minimo

Ecco un esempio base per un taskset:

La definizione del taskset inizia con i dati e i criteri di punteggio, indipendentemente da qualsiasi framework:

Utilizza TOML per selezionare un ambiente e un framework:

Esegui l’evaluazione dal terminale:

Punti Chiave

    • Verifiers v1 separa taskset (cos’è), harness (come), e runtime (dove).
    • Il server di intercettazione gestisce le richieste e traccia le interazioni in tempo reale.
    • Un tracciamento grafico lineare sostituisce i precedenti modelli quadratici, permettendo addestramenti a lungo termine.
    • Supporta completamente prime-rl per il training diretto; il codice precedente è ora congelato.
    • Dataset Harbor e framework Codex o Terminus 2 funzionano senza modifiche.

Per ulteriori informazioni tecnologiche visita i dettagli tecnici.