Introduzione

L'Olimpiade Internazionale di Informatica (IOI) e l'Olimpiade Internazionale di Matematica (IMO) valutano competenze molto differenti: l'IOI richiede algoritmi ottimizzati e codice che supera test nascosti sotto limiti di tempo e sottomissione, mentre l'IMO richiede dimostrazioni rigorose scritte in linguaggio naturale. Riuscire a ottenere medaglie d'oro in entrambe le competizioni è estremamente difficile e suggerisce l'esistenza di un approccio più ampio e versatile.

Strategia di adattamento di Nemotron

I risultati recenti dimostrano che la famiglia Nemotron costituisce una base solida e adattabile per la creazione di modelli specialistici di livello mondiale. Partendo da Nemotron 3, i nostri team hanno impiegato supervised fine‑tuning (SFT), reinforcement learning (RL) e inferenza guidata dal feedback per costruire sistemi che hanno raggiunto il livello di medaglia d'oro sia all'IMO 2026 sia all'IOI 2026.

Il risultato all'IOI è stato ottenuto in una corsa dal vivo, rispettando gli stessi vincoli di tempo, accesso a Internet e numero di sottomissioni dei concorrenti umani. Si trattava di un benchmark non ufficiale, non incluso nella classifica ufficiale dell'IOI. Per l'IMO, le dimostrazioni generate sono state valutate dagli stessi correttori ufficiali dell'IMO.

Il concetto di “facile da fine‑tune” deve andare oltre il semplice addestramento di un checkpoint; deve indicare che un modello di fondazione capace può essere adattato a un dominio impegnativo con una ricetta chiara e riutilizzabile.

La ricetta in quattro fasi

    • Curazione dei dati: raccolta di set di problemi e tracce di ragionamento sintetico.
    • Supervised fine‑tuning (SFT): addestramento supervisionato su dati filtrati di alta qualità.
    • Reinforcement learning (RL): ottimizzazione basata su ricompense legate a performance specifiche.
    • Inferenza feedback‑driven: generazione, valutazione, critica e raffinamento iterativo (GenCorrect).

Le operazioni di training e inferenza sono state consistenti, ma l'approccio rimane familiare e riproducibile: non è stato necessario creare un nuovo modello di fondazione per ogni sfida, ma semplicemente specializzare Nemotron per il compito desiderato.

Specializzazione per la programmazione competitiva (IOI)

Per il contesto della programmazione competitiva, sono stati curati 22.000 problemi e sono state generate tracce di ragionamento sintetico per addestrare due specialisti.

Gli specialisti sviluppati sono:

    • Nemotron‑3‑Nano‑CC: 30 miliardi di parametri totali, 3 miliardi di parametri attivi; ha ricevuto sia SFT che RL.
    • Nemotron‑3‑Ultra‑CC: 550 miliardi di parametri totali, 55 miliardi di parametri attivi; ha ricevuto solo SFT.

La progressione sui risultati dell'IOI 2025 rende evidente il valore della specializzazione. Il modello Nano è passato da 130 punti (prima del post‑training) a 280 punti dopo SFT e a 291 punti dopo RL. Con GenCorrect, la strategia iterativa genera‑valuta‑rifinisci, ha raggiunto 468 punti, superando la soglia d'oro di 438,3. L'Ultra‑CC, con la stessa strategia al test‑time, ha totalizzato 502 punti.

Questi esperimenti hanno inoltre mostrato che l'adattamento non deve essere identico a ogni scala. Per Nano, la maggior parte del guadagno è derivata da SFT, con RL che aggiunge un miglioramento più piccolo ma costante. Per il modello Ultra, un solo epoch di SFT è stato sufficiente a superare il modello Nano post‑addestrato su IOI, ICPC e LiveCodeBench Pro. Tale scoperta ha guidato la creazione del sistema Ultra‑CC specifico per l'IOI 2026, che ha segnato 535,4 su 600 punti.

Specializzazione per la matematica olimpica (IMO)

Il progetto IMO ha applicato la stessa idea al dominio della matematica olimpica, partendo da Nemotron 3 Ultra.

Due specialisti sono stati addestrati:

    • SFT: basato su un corpus di 414.890 esempi filtrati provenienti da 15.818 problemi di dimostrazione unici. Il corpus non si limitava a fornire risposte finali, ma includeva generazione di dimostrazioni, raffinamento, verifica e meta‑verifica, insegnando al modello a costruire argomenti, identificare lacune, rispondere a critiche e valutare la completezza di una dimostrazione.
    • RL: addestrato su 9.597 problemi scelti vicino al “confine di capacità” del modello.

Entrambi i checkpoint post‑addestrati hanno superato il modello generale disponibile in fase di sviluppo. Il checkpoint SFT è risultato più forte nel primo round di ricerca, mentre il checkpoint RL ha ottenuto il miglior risultato complessivo con un singolo checkpoint. Le loro forze complementari hanno portato all'uso combinato dei due specialisti assieme al modello generale nella pipeline finale.

Pipeline di inferenza per l'IMO

Per ogni problema dell'IMO, la pipeline ha seguito i seguenti passi:

    • Generazione di prove candidate da parte dei modelli.
    • Scoring interno delle prove.
    • Produzione di critiche (feedback) sulle prove più promettenti.
    • Raffinamento iterativo delle prove sulla base delle critiche.
    • Fase di selezione ad alta capacità computazionale per scegliere la sottomissione finale.

Tutta la procedura è avvenuta in linguaggio naturale, senza l'uso di prover formali, strumenti esterni o accesso a Internet. Il risultato finale è stato 30 su 42 punti, includendo credito pieno su quattro dei sei problemi, superando la soglia di medaglia d'oro dell'IMO.

Analisi dei fattori chiave di successo

I risultati precedenti dell'IOI 2025 avevano dimostrato come la potenza di