Che cos’è verifiers v1?
Verifiers v1 rappresenta l’ambiente principale di Prime Intellect per il rinforzo e la valutazione degli agenti intelligenti. In precedenza, ogni ambiente combinava dati, logica e infrastruttura. Ora, invece, v1 separa queste componenti in tre parti modulari: taskset (definisce il lavoro), harness (gestisce la soluzione), e runtime (dove il lavoro si svolge).
Architettura di Funzionamento
Il componente centrale del sistema è il "server di intercettazione", che funziona come intermediario tra il runtime dell’agente e il server di inferenza. Questo server registra le tracce, imposta i parametri di campionamento e può modificare le risposte degli strumenti. Le modifiche mirano a evitare manipolazioni del compenso durante il training.
Server e Multiplexing
Ogni server gestisce un certo numero di rollouts, di cui il valore predefinito è 32. I server si ridimensionano automaticamente in base alla concorrenza osservata e includono un client che rilancia le richieste. Durante le valutazioni, un EvalClient funziona come un proxy HTTP, mentre durante il training, un TrainClient include i renderizzatori per l’apprendimento fedele basato su token.
Supporto ai Diversi Dialects
Verifiers v1 gestisce diversi linguaggi di invio, inclusi OpenAI Chat Completions, OpenAI Responses e Anthropic Messages. Un adattatore di dizionari normalizza ogni formato in un tipo comune, garantendo che il tuo criterio di punteggio rimanga indipendente dal modello in uso.
Confronto tra v0 e v1
Le differenze principali tra v0 e v1 includono: il modello ambiente, la crescita della traccia, la gestione dei rollouts non lineari, il runtime e i rapporti tra harness e ambiente, e l’uso dei dati di formazione.
- Modello ambiente: v0 ha tutti i componenti in un'unica struttura; v1 li separa in taskset, harness e runtime.
- Crescita traccia: v0 è quadratica, v1 é lineare.
- Ramificazione: v0 assume lineare; v1 supporta compattazione e sub-agenti.
- Gestione runtime: v0 gestisce interamente il ciclo, v1 lo delega al framework.
- Dati di formazione: v0 li rigenerava, v1 li utilizza direttamente.
Uso Pratico con Esempi
Ad esempio, puoi eseguire Nemotron 3 Ultra su Terminal-Bench 2 utilizzando Codex. Altri esempi includono il riutilizzo dei dataset Harbor senza riscrivere la logica di ricompensa, come nel caso in cui Prime Intellect abbia migrato Terminal Bench 2 alla versione v1 con un piccolo set di classi.
Addestramento con verifiers
Gli ambienti di verifiers sono direttamente compatibili con prime-rl, un framework di addestramento di agenti. In un esperimento, GLM-4.5-Air ha svolto un’ablazione del limite di lunghezza utilizzando ScaleSWE su sei nodi H200. L’addestramento ha richiesto due giorni e l’ha valutato su SWE-Bench-Verified。
Esempio di Taskset Minimo
Ecco un esempio base per un taskset:
La definizione del taskset inizia con i dati e i criteri di punteggio, indipendentemente da qualsiasi framework:
Utilizza TOML per selezionare un ambiente e un framework:
Esegui l’evaluazione dal terminale:
Punti Chiave
- Verifiers v1 separa taskset (cos’è), harness (come), e runtime (dove).
- Il server di intercettazione gestisce le richieste e traccia le interazioni in tempo reale.
- Un tracciamento grafico lineare sostituisce i precedenti modelli quadratici, permettendo addestramenti a lungo termine.
- Supporta completamente prime-rl per il training diretto; il codice precedente è ora congelato.
- Dataset Harbor e framework Codex o Terminus 2 funzionano senza modifiche.
Per ulteriori informazioni tecnologiche visita i dettagli tecnici.