Introduzione al benchmark VELC‑Bench
Il benchmark VELC‑Bench (Verification in Long‑Context Benchmark) è stato progettato per misurare la capacità fine‑grained dei modelli di linguaggio di confrontare valori numerici estratti da testi molto lunghi con affermazioni proposte. In pratica, il modello deve recuperare il valore richiesto, eseguire un confronto preciso con l’affermazione e restituire una risposta di Verifica Sì (JA) o Verifica No (NEIN).
Metodo di verifica
Per ogni metrica estratta, la valutazione avviene così:
- Se la risposta predetta coincide con l’attesa, il punteggio è 1,0.
- Altrimenti il punteggio è 0,0.
La priorità di riconoscimento è NOT MENTIONED > NO > JA, per evitare che la stringa “not” venga interpretata erroneamente come “no”.
Esempi di affermazioni testate
Affermazione 1: “Il fatturato del Q1 2026 di Adobe (ADBE) è di $6,40 miliardi.” – Atteso: JA
Affermazione 2: “Il fatturato del Q1 2026 di Adobe (ADBE) è di $7,92 miliardi.” – Atteso: NEIN
Modelli e risultati
I modelli sono stati testati su tre porzioni del contesto: il 10 %, il 50 % e il 90 % della lunghezza totale, per osservare le variazioni di precisione a seconda della posizione del valore nel “grande mucchio di token”.
Di seguito i risultati più significativi:
- claude‑fable‑5 ottiene 90,0 % su Verify JA e 94,0 % su Verify NEIN.
- La differenza tra i due valori evidenzia l’asimmetria: confermare richiede l’individuazione esatta del valore, mentre rifiutare basta notare una discrepanza.
Asimmetria tra JA e NEIN
L’asimmetria è fondamentale per interpretare le prestazioni:
- JA richiede l’identificazione positiva di un valore, più difficile se il valore è situato in una zona profonda del contesto.
- NEIN richiede solo il riconoscimento di una deviazione, più facile quando il valore è stato letto di recente.
Un modello che eccelle in NEIN ma è scarso in JA tende a rifiutare per default; al contrario, un modello con alte prestazioni in JA ma basse in NEIN mostra una propensione a accettare affermazioni senza verifica approfondita.
Modelli testati e caratteristiche tecniche
Nel set di test sono inclusi:
- Claude Sonnet 5: introdotto il 30 giugno 2026 con finestra nativa di 1 milione di token.
- Claude Opus 4.8: stesso limite di 1 M token, anch’esso parte del set.
- Meituan LongCat‑2.0: modello MoE da 1,6 trillion di parametri, finestra nativa di 1 M token, basato su acceleratori cinesi.
- Huawei openPangu‑2.0‑Flash: modello MoE da 92 B parametri, finestra di 512 K token, addestrato su chip Ascend.
Tutti i modelli hanno ricevuto lo stesso “mucchio di 850 000 token” come file e hanno dovuto ricercare le metriche usando strumenti di retrieval, senza leggere direttamente l’intero contesto.
Definizione di finestra di contesto
Secondo la documentazione tecnica di Anthropic, la finestra di contesto è “l’intero testo che un modello può referenziare durante la generazione di una risposta, compresa la risposta stessa”. IBM la definisce analogamente come “la quantità di testo in token che il modello può considerare o ‘memorizzare’ in un dato momento”. McKinsey la paragona alla memoria a breve termine umana, sottolineando che il modello può “vedere” solo una quantità fissa di informazioni prima di combinarle con i parametri pre‑addestrati per produrre una risposta.
Misura dei token
Il token è l’unità di base. OpenAI indica che un token corrisponde approssimativamente a 4 caratteri o 0,75 parole in inglese, con variazioni a seconda della lingua. IBM descrive il token come la più piccola unità leggibile dalla macchina, che può rappresentare una parola intera, una sua parte o un segno di punteggiatura.
Composizione della finestra di contesto
La finestra comprende:
- Il system‑prompt.
- Ogni messaggio dell’utente, inclusi i risultati di tool e documenti.
- La risposta generata dal modello.
Anthropic specifica che anche “l’output generato da Claude per il turno, incluso il ragionamento esteso, conta”. OpenAI ribadisce che prompt più output non devono superare la lunghezza massima consentita.
Caratteristiche architettoniche della finestra di contesto
La dimensione della finestra è una proprietà fissa impostata durante l’addestramento e non è modificabile dall’utente senza ri‑addestrare il modello o utilizzare tecniche speciali. Hugging Face sottolinea che i transformer di base hanno una lunghezza di sequenza massima fissa; superarla porta a truncamenti o crash, salvo l’uso di metodologie per contesti lunghi.
Il termine “context length” è sinonimo di “finestra di contesto”; IBM usa entrambe le denominazioni indistintamente, mentre OpenAI parla di “maximum context length” per indicare il limite combinato di prompt più output.
Differenza tra limite di token di output e finestra di contesto
Il limite di token di output (ad esempio il parametro max_tokens di OpenAI) riguarda solo la parte generata della risposta, mentre la finestra di contesto limita la somma di token di input e output.
Finestra di contesto vs. memoria persistente
Il contesto è volatile e legato alla singola sessione: può essere resettato in qualsiasi momento, comportando la perdita di informazioni non salvate in memoria esterna. La memoria persistente, invece, è archiviata in file o database e