Il problema dei benchmark obsoleti nell'era moderna dell'IA

Il benchmarking è diventato la norma standard del settore per il modo in cui le aziende di intelligenza artificiale convalidano le capacità dei loro modelli e, quando le metriche si muovono a loro favore, si distinguono dai concorrenti e pubblicizzano la loro superiorità. In altre parole, i buoni benchmark quasi sempre significano buone relazioni pubbliche. Tuttavia, le aziende hanno anche imparato come aggirare i sistemi di benchmarking legacy — molti dei quali sono più vecchi e non sono stati costruiti per misurare le capacità dei modelli moderni.

Questo divario tra la capacità di valutazione e la velocità dell'innovazione rappresenta uno dei problemi più critici nel panorama attuale dell'intelligenza artificiale. Mentre i modelli diventano sempre più sofisticati e capaci, gli strumenti utilizzati per misurarli rimangono spesso ancorati a metodologie del passato. Le conseguenze di questo disallineamento sono significative: permette alle aziende di ottenere risultati favorevoli sui benchmark pubblici attraverso l'ottimizzazione, pratica comunemente nota come "overfitting", dove i modelli vengono addestrati specificamente per eccellere nei test noti piuttosto che sviluppare genuine capacità di problem-solving.

Vals: una nuova visione del benchmarking dell'IA

Vals, una startup fondata nel 2024, sostiene di essere in una missione per correggere questo sistema molto imperfetto. Nel giro di meno di due anni, l'azienda si è affermata come una presenza notevole nel settore tecnologico e lo scorso anno è riuscita a ottenere un round seed guidato da 8VC e Bloomberg Beta. Quindi, il mese scorso, dopo un periodo di crescita rapida, ha raccolto 40 milioni di dollari in una serie A guidata da Andreessen Horowitz — un voto di fiducia importante da uno dei più influenti venture capital firm del mondo.

Rayan Krishnan, il co-fondatore ventcinquenne dell'azienda, in precedenza ha fatto uno stage presso Palantir e, come studente universitario presso Stanford, ha lavorato per Microsoft e il rinomato laboratorio di intelligenza artificiale della scuola. Krishnan afferma che Vals è nata dalle sue stesse osservazioni su come il benchmarking stava rimanendo indietro rispetto ai progressi dell'industria che era stato progettato per misurare.

"Stavamo vedendo un sacco di modelli nuovi e molto capaci arrivare sul mercato rapidamente, e i benchmark accademici non stevano al passo con quell'avanzamento di frontiera," condivide Krishnan. Con l'IA integrata in ogni parte della società, i benchmark dovrebbero davvero esistere per verificare che i modelli possono fare quello che le aziende pubblicizzano che possono fare, ha detto Krishnan.

L'ufficio storico e la visione dell'azienda

La scorsa settimana, il giovane fondatore ha mostrato in giro il suo ufficio aziendale a due piani sulla Folsom Street di San Francisco — un vecchio edificio in mattoni che, un secolo fa, era il sito di un grande birrificio. Invece di una produzione industriale di birra, la struttura storica è ora sede di un certo numero di startup diverse che cercano di spedire il futuro dell'industria tecnologica. Questa cornice simbolica rimane significativa per la missione dell'azienda: riformare e rinnovare un aspetto critico del modo in cui valutiamo il progresso tecnologico.

"Storicamente, penso che la valutazione sia stata fatta per valutare l'intelligenza in modo molto astratto," dice Krishnan. "Come, i modelli sanno abbastanza informazioni per poter sostenere un test di tipo esame da avvocato?"

Come Vals si differenzia dalla concorrenza

È qui che Vals cerca di differenziarsi. Mentre molti sistemi di benchmarking offrono test pubblicamente disponibili (questo può consentire a un'azienda di addestrare il suo modello contro questi test, quindi presumibilmente barare nell'esame), Vals non divulga pubblicamente i suoi materiali di test specifici. Invece di misurare la conoscenza generale di un modello di IA, Vals valuta anche i modelli sulla loro capacità di completare compiti complessi associati a industrie specifiche come legge, finanza e codifica.

"Quello che stiamo facendo è effettivamente guardare quali sono gli impatti reali dei modelli," ha detto Krishnan. "Possono fare un lavoro che produce un prodotto della stessa qualità di un umano all'interno di ogni dominio?"

L'idea è di controllare non solo i risultati positivi ma anche quelli negativi, dice. La speranza è di analizzare come, "se questi modelli si scatenassero nel mondo, quali sarebbero le implicazioni negative."

Espansione nei settori emergenti e sensibili

Le capacità che Vals sta misurando stanno crescendo. Oltre alle industrie più tradizionali, la startup continua a spingersi in terreni più unici e complessi. "Abbiamo un benchmark sul miglioramento ricorsivo autonomo. Stiamo facendo dei lavori sulla salute mentale, la sicurezza informatica, la biosicurezza, e persino il diritto dei conflitti armati per i modelli per capire come applicare la Convenzione di Ginevra," condivide Krishnan.

Questo approccio rappresenta un'evoluzione significativa nel modo in cui pensiamo alla sicurezza e all'affidabilità dell'IA. Valutando come i modelli potrebbero potenzialmente essere utilizzati in contesti sensibili — dalla salute mentale alla biosicurezza — Vals non sta semplicemente misurand le prestazioni, ma anche esaminando i potenziali rischi e le applicazioni non intenzionali. Questo è particolarmente importante dato il crescente ruolo dell'IA nella società e la necessità di garantire che questi strumenti siano utilizzati responsabilmente.

Il modello di business e la crescita dell'azienda

Le aziende pagano Vals per testare i loro modelli, il che può essere un concetto strano da comprendere. Perché un'azienda dovrebbe pagare per scoprire che il suo modello non sta funzionando bene? Ma avere una misurazione efficace aiuta le aziende a risolvere i problemi e migliorare nel tempo. Krishnan paragona il loro modello di ricavi a come uno studente potrebbe pagare il College Board per sostenere l'SAT.

A loro volta, queste valutazioni stanno diventando fattori chiave per il processo decisionale delle aziende che cercano di acquisire nuovi modelli di IA. Le aziende riconoscono che comprendere veramente come un modello si comporterà nei loro scenari d'uso specifici è vale la pena dell'investimento, proprio come gli istituti educativi investono nella valutazione standardizzata per prendere decisioni di ammissione più informate.

La startup ha recentemente rivelato che il suo ricavo è attualmente otto volte quello dell'anno scorso — una crescita straordinaria che evidenzia la domanda di mercato per il tipo di servizio che offre. Il suo staff sta anche crescendo rapidamente. Vals, che ha iniziato l'anno con solo otto persone, ha già triplicato a un team di 25 persone. Krishnan ha detto che mentre la startup cresce, il piano è di trasferirsi in un ufficio significativamente più grande, così come portare ancora 10 a 15 persone. L'azienda ha anche recentemente lanciato un programma incentrato sulla fornitura di valutazioni dei modelli alle agenzie federali.

Il ruolo dei benchmark nel panorama normativo futuro

Krishnan vede il sistema di benchmarking della sua azienda come il futuro di come le aziende di IA pensano di far crescere i loro affari e stabilire la fiducia pubblica. "Le aziende di IA stanno iniziando ad andare in borsa. SpaceX è andata in borsa. Anthropic è programmata per più tardi in questo anno. Sospetto che OpenAI sarà presto in borsa. Penso che man mano che i modelli di IA diventeranno una parte fondamentale dell'economia e si diffonderanno più ampiamente, i tipi di benchmark e valutazioni che facciamo comporteranno il loro utilizzo e saranno una parte centrale di come queste aziende presentano i depositi pubblici o parlano degli investimenti prospettici che faranno in IA," ha detto.

Questa prospettiva evidenzia come Vals non stia semplicemente costruendo uno strumento per il presente, ma stia anticipando il ruolo critico che il benchmarking giocherà nel futuro della regolamentazione dell'IA e della conformità normativa. Mentre i governi di tutto il mondo cominciano a sviluppare quadri normativi per l'intelligenza artificiale, standard di benchmarking robusti e indipendenti come quelli offerti da Vals diventeranno probabilmente parte integrante dei requisiti di divulgazione e di governance.

L'impatto più ampio sulla fiducia e sull'adozione dell'IA

Il lavoro di Vals tocca un tema fondamentale nel dibattito sull'intelligenza artificiale: come possiamo fidarci che l'IA funzioni come promesso? In un'epoca in cui l'IA sta influenzando decisioni critiche in campi come la salute, la finanza e la giustizia penale, la necessità di metriche affidabili e indipendenti diventa sempre più urgente. I benchmark tradizionali, spesso costruiti anni fa, non riescono a catturare la complessità delle applicazioni moderne dell'IA e il loro potenziale impatto sulla società.

Vals sta quindi non solo risolvendo un problema tecnico, ma anche affrontando una questione di importanza sociale. Fornendo valutazioni rigorose e affidabili dei modelli di IA, l'azienda sta contribuendo a creare le infrastrutture di fiducia necessarie per un'adozione diffusa e responsabile della tecnologia. Con il supporto di Andreessen Horowitz e il riconoscimento del suo modello di business da parte del mercato, Vals sembra ben posizionata per diventare davvero lo standard aureo del benchmarking dell'IA che aspira a essere.