Introduzione al benchmark VELC‑Bench
Il benchmark VELC‑Bench (Verification in Long‑Context Benchmark) è stato ideato per misurare la precisione dei modelli di linguaggio nella localizzazione di una metrica specifica all’interno di un contesto esteso, nel confronto del valore con un’affermazione e nella successiva conferma o rifiuto. Questo test mette alla prova la corrispondenza fine‑grana dei valori in condizioni di contesto lungo, richiedendo al modello sia il recupero del valore sia un confronto preciso.
Meccanismo di valutazione
Per ciascuna metrica estratta, la punteggio è calcolato così:
- Puntscore = 1,0 se la predizione coincide con l’atteso;
- Puntscore = 0,0 altrimenti.
La priorità di rilevamento è impostata su NOT MENTIONED > NO > YES**, al fine di evitare che “not mentioned” venga accidentalmente riconosciuto come “no”.
Modelli testati e risultati preliminari
I modelli sono valutati su tre fasce del contesto: 0,1, 0,5 e 0,9 della lunghezza totale, per osservare le variazioni di accuratezza in diverse posizioni del “fieno” di token. I risultati più rilevanti sono:
- claude‑fable‑5 ottiene 90,0 % su Verify YES e 94,0 % su Verify NO;
- L’asimmetria riscontrata indica che confermare un valore richiede la sua individuazione, mentre rifiutarlo basta riconoscere una deviazione.
Esempi di affermazioni testate
Affidamento su due casi concreti per Adobe (ADBE) nel primo trimestre 2026:
- “Il fatturato per Q1 2026 di Adobe è di 6,40 miliardi di dollari.” – Atteso: SÌ;
- “Il fatturato per Q1 2026 di Adobe è di 7,92 miliardi di dollari.” – Atteso: NO.
Dettagli sui modelli di nuova generazione
Claude Sonnet 5, lanciato il 30 giugno 2026, dispone di una finestra nativa da 1 milione di token a prezzo standard; Claude Opus 4.8 condivide la stessa capacità. Entrambi sono parte del set di test.
In parallelo, due modelli open‑weight hanno iniziato a operare nel regime di contesto lungo:
- Meituan LongCat‑2.0: modello MoE da 1,6 trillion di parametri, finestra nativa da 1 milione di token, basato su acceleratori AI cinesi;
- Huawei openPangu‑2.0‑Flash: modello MoE da 92 miliardi di parametri, finestra da 512 mila token, addestrato su chip Ascend.
L’asimmetria tra “YES” e “NO”
Le differenze tra le due categorie sono illuminanti. Una risposta “YES” richiede l’identificazione positiva di un valore, operazione più complessa quando il valore si trova più in profondità nella sequenza. Al contrario, “NO” basta riconoscere che il valore proposto differisce da quello presente, operazione più semplice se il valore è stato letto di recente.
Le soglie di performance sono fissate così:
- Fase 2: YES ≥ 80 % e NO ≥ 80 % indicano che il modello può sia confermare sia rifiutare attraverso l’intero “fieno” di token.
Un modello con alta precisione su “NO” ma bassa su “YES” tende a rifiutare troppo frequentemente; viceversa, un modello con alta precisione su “YES” ma bassa su “NO” mostra un’eccessiva fiducia verso le affermazioni.
Definizione e importanza della finestra di contesto
Secondo la documentazione tecnica di Anthropic, la finestra di contesto è “l’intero testo che un modello di linguaggio può riferire durante la generazione di una risposta, inclusa la risposta stessa”. IBM la definisce analogamente come la quantità di token che il modello può “ricordare” in un dato momento. McKinsey la paragona alla memoria a breve termine umana, sottolineando che il modello può osservare solo una quantità fissa di informazioni prima di combinarle con i parametri pre‑addestrati per produrre un output.
Unità di misura: il token
Un token corrisponde approssimativamente a 4 caratteri o 0,75 parole per testi in inglese, con variazioni a seconda della lingua e del contenuto (OpenAI). IBM descrive il token come la più piccola unità utilizzata dai modelli di linguaggio, rappresentante di una parola, di una sua parte o di un segno di punteggiatura.
Composizione della finestra di contesto
La finestra comprende:
- Il prompt di sistema;
- Ogni messaggio, inclusi risultati di tool e documenti;
- La risposta generata.
Anthropic specifica che anche il “pensiero esteso” prodotto da Claude in un turno conta nella lunghezza totale. OpenAI conferma che prompt più output non devono superare la lunghezza massima di contesto.
Caratteristiche architetturali
La dimensione della finestra di contesto è una proprietà architetturale fissa determinata al momento del training e non può essere modificata dall’utente senza un nuovo addestramento o tecniche di estensione specifiche. Hugging Face spiega che i transformer di base senza modifiche per lunghi contesti sono limitati a una sequenza massima fissa e falliscono o troncheranno l’input se superata tale soglia, sebbene tecniche avanzate permettano ora a certi modelli di gestire sequenze molto più lunghe.
Il termine “context length” è sinonimo di “finestra di contesto”; IBM li usa intercambiabilmente, mentre OpenAI utilizza “maximum context length” per indicare la stessa soglia combinata di prompt più output.
Distinzione dal limite di token di output
Il limite di token di output è un parametro separato (es. max_tokens) che controlla solo la parte generata dalla risposta, mentre la finestra di contesto comprende sia l’input sia l’output.
Memoria persistente vs. finestra di contesto
Anthropic chiarisce che la finestra di contesto è volatile e legata alla sessione: può essere resettata in qualsiasi momento, con il rischio di perdere tutti i progressi non salvati in una directory di memoria. La memoria persistente, invece, conserva