Gli utenti, gli esperti di ricerca e gli addetti ai lavori hanno da tempo lamentato la difficoltà di confrontare tra loro i risultati delle valutazioni AI. Ora, Ogni Valutazione Mai Avuta (EEE) e Hugging Face Community Evals offrono una soluzione intercompatibile, unita a una piattaforma condivisa dove i risultati di valutazione vengono collegati in modo comprensibile.
EEE è nato nel febbraio 2026 come un'iniziativa dell'Eval Eval Coalition, un sforzo interistituzionale per migliorare il modo in cui vengono riportati i risultati delle valutazioni AI, sia da parte dei soggetti principali che di terzi. Hugging Face ha lanciato Community Evals nello stesso mese per decentralizzare il reporting dei punteggi di benchmark su Hub.
Come i Problemi Di Confronto Vengono Affrontati
Attualmente, i risultati delle valutazioni dei modelli AI sono dislocati in formati variabili: articoli accademici, classifiche, blog e log dei test. Lo stesso modello può mostrare punteggi differenti sullo stesso benchmark in base a chi lo ha eseguito e in che modo. Prendiamo ad esempio LLaMA 65B: è stato riportato con punteggi di 63.7 e 48.8 su MMLU.
Il problema spesso deriva da impostazioni di valutazione comunemente non dichiarate. Per risolvere questo, EEE introduce uno schema JSON che standardizza la registrazione dei risultati. Questo schema riceve input da varie fonti, come log delle piattaforme di test, dati di classifiche e punteggi riportati nei paper. Il GitHub repository di EEE contiene i convertitori, esempi e una guida per i contributori.
Da quando è stato lanciato, il datastore su Hugging Face ha accumulato circa 229.000 risultati di valutazione, coprendo più di 22.000 modelli e 2.200 benchmark. Questi dati provengono da 31 formatti diversi. Ricostruire questi dati da zero costerebbe centinaia di migliaia di dollari, un'argomentazione a favore del mantenimento di un archivio centralizzato.
Integrazione e Attribuzione Semplificata
Con l'introduzione di nuove funzionalità, è possibile inviare risultati di EEE direttamente a Hugging Face Community Evals. È stato sviluppato un convertitore che trasforma i vostri records di EEE in YAML, nel formato richiesto da Hugging Face. Questo evita la gestione manuale doppia del formato.
Chiunque reporti o legga valutazioni — da esperti interni a terzi — può ora contribuire a entrambi gli archivi. I risultati appariranno con un timbro verificato su EvalEval, segnalando l'autenticità dei dati.
Come Funzionano Le Valutazioni Comunitarie
Un benchmark è ospitato su un dataset repository e si registra aggiungendo un file evaluazione.yaml.
Una volta registrato, questa pagina raccoglie e visualizza una classifica di tutti i punteggi riportati su Hub.
I punteggi dei modelli si trovano in .eval_results/*.yaml dentro il repository del modello.
I punteggi mostrati sulla carta del modello contribuiscono alla leaderboard.
Entrambi i risultati ottenuti dagli autori e quelli inviati da terzi vengono aggregati con un badge relativo al loro stato.
Qualunque persona può aggiungere un punteggio a un modello aprire un PR.
Un esempio pratico è la leaderboard per l'esame umano “Humanity's Last Exam” sull'Hub di Hugging Face. Invia i tuoi risultati attraverso EEE e Hugging Face per mostrare un punteggio leggibile e contestualizzato.
Interoperabilità Tra Sorgenti
Gli utenti che inviano i loro risultati a entrambi gli archivi vedranno che il loro score appare sulla pagina del modello Hugging Face e nella classifica del benchmark. Inoltre verrà visualizzato un badge che farà riferimento direttamente al record dettagliato in EEE.
I Ruoli Dei Due Archivi
Hugging Face mette i tuoi risultati dove i visitatori guardano i modelli, con un collegamento al source originale. EEE mantiene il record strutturato completo per interpretare i risultati e genera le schede di valutazione. Inviare i tuoi dati a entrambi permette di ottenere una visualizzazione coerente.
Quindi, inviare il tuo punteggio a entrambi gli archivi non è solo pratico, ma fornisce una rappresentazione chiara e verificabile del risultato.
Il Convertitore Funziona Così
Hugging Face salva i punteggi in YAML nel model repository dentro la .eval_results/. I campi richiesti includono il benchmark dataset, il task, e il valore. Il blocco sorgente è la sezione che crea il collegamento indietro a EEE.
Il convertitore automatizza il processo. Mappa sourcedata.hfrepo a dataset.id, evaluationname a taskid, scoredetails.score a value, e evaluationtimestamp a date. Inserisce l'URL del record JSON EEE come sorgente al record.
Il convertitore gestisce quattro benchmark ufficiali: MMLU-Pro, GPQA, HLE, e GSM8K.
Controlli E Riscontri Preventivi
Il convertitore non solo ridistribuisce campi, ma effettua un download di una raccolta EEE e trova i record collegati. Esamina gli hash degli oggetti e cerca punteggi corrispondenti a benchmark supportati. Prima di pubblicare, analizza i dati presenti all'interno del repository del modello.
Processo Di Approvazione
Report Predefinito
I dati non vengono mai inviati automaticamente. Il tool produce una anteprima Yaml locale e un report che ti permette di visionare ciò che è pronto e richiede la tua approvazione esplicita. Devi semplicemente scrivere “OPEN PRS” seguito da un messaggio per aprire le modifiche. Se esegui nuovamente, i dati cache verranno riutilizzati a meno che non venga fornito l'argomento --force.
Revisione Dei File
Il tool di conversione genera un rapporto di revisione dove, ad esempio, sono elencati i modelli senza corrispondente repository su Hugging Face con i rispettivi URL di origine EEE e i PR pronti per l'apertura.
I risultati del modello devono quindi essere approvati manualmente. Una volta completato questo processo, i records vengono sincronizzati e i dati vengono resi accessibili a entrambi i repository, assicurando accessibilità e leggibilità del risultato.
Attivare Il Processo Di Conversione
L’attivazione di EEE richiede solo un passo aggiuntivo, che il convertitore automatizza per la maggior parte. Il tool di conversione della valutazione comunitaria è reperibile sul repository GitHub. Per processare una raccolta, segui questi passi:
Processa una raccolta.
Verifica l'anteprima dei records e il corrispondente report.
Scrivi “OPEN PRS” per inviare i records quando sei pronto.