Recentemente, il fondo di hedge Bridgewater e il laboratorio Thinking Machines Lab hanno annunciato il successo di un nuovo e innovativo modello di AI open-source, specializzato nell'analisi dei documenti finanziari. Questo modello, battezzato Qwen3-235B e addestrato con le conoscenze interne degli esperti, ha sorpassato le principali AI commerciali, raggiungendo una precisione del 84,7% in test interni. Inoltre, il suo costo operativo è il 14% inferiore rispetto alle controparti di punta. Questo sviluppo evidenzia come le aziende possano creare soluzioni AI potenti sfruttando i propri dati, mantenendo riservate le informazioni sensibili senza affidarsi ai giganti della tecnologia.
La sfida: Automatizzare il giudizio del mercato
Gli investitori sono quotidianamente sommersi da un'ampia miriade di informazioni: notizie, analisi finanziarie, dati delle aziende e e-mail. Secondo un rapporto di Bridgewater AIA Labs e del Thinking Machines Lab, guidato da Mira Murati, ex CTO di OpenAI, leggere non è il vero lavoro. Il reale lavoro consiste nell'effettuare giudizi costantemente e ripetitivamente su ciò che realmente ha rilievo. Questo processo è stato il target principale per l'automazione.
Definizione dei compiti
I ricercatori hanno definito sei task che riflettono le attività tipiche di un investitore finanziario. Ad esempio:
- Determinare se un articolo finanziario riguarda un esecutivo.
- Analizzare se un documento delle banche centrali indica le prospettive future sui tassi di interesse.
Queste decisioni, apparentemente semplici per un investitore, risultano estremamente complesse da esplicitare in istruzione testuale. Un caso specifico è l'esempio fornito nel rapporto: un titolo sull'annuncio di Trump riguardo alla Groenlandia è ritenuto irrilevante, mentre minacce di nuove tariffe della Cina sono altamente rilevanti, nonostante entrambi toccino i temi geopolitici e finanziari.
Performance e limiti dei modelli di frontiera
I modelli AI di frontiera, come Gemini, Claude e GPT, hanno fallito in questi test. Le versioni di questi modelli hanno raggiunto solamente circa il 50% di accuratezza con un semplice prompt. Addirittura con istruzioni esperte e un sistema di valutazione a tre livelli ("rilevante e interessante", "rilevante ma non interessante", "non rilevante"), l'accuratezza è migliorata al massimo all'incirca attorno al 75%, non raggiungendo però la soglia attesa del 80% per un utilizzo attendibile.
Riconoscere il giudizio umano
I ricercatori hanno identificato che il reale valore risiede nei giudizi umani degli investitori. Inizialmente, contractor esterni poco costosi sono stati incaricati di etichettare i documenti, ma hanno prodotto molti errori. Per ovviare a questo ostacolo, un modello preliminare ha appreso da questi etichettaggi discutibili e ha riesaminato gli stessi documenti. I casi in cui il modello e l'etichetta originale erano in disaccordo sono stati segnalati come errori e inviati agli investitori per la correzione.
Un'alternativa più economica ed efficace
Il modello Qwen3-235B è stato aggiustato utilizzando la piattaforma Tinker del Thinking Machines Lab, costruita su un modello open-source. Questo modello ha raggiunto una migliorata precisione del 84,7%, rispetto al 78,2% del migliore modello di frontiera testato. Il costo operativo è stato quasi 14 volte inferiore. Chiaramente, questa non è un’analisi totalmente indipendente, dato l’interesse diretto delle aziende coinvolte. Tuttavia, il concetto emerso è significativo: i grandi laboratori AI non hanno ancora raccolto tutti i dati disponibili.
Le opportunità di miglioramento
I pool di dati finanziari propri di grandi aziende e le competenze umane non ancora formalizzate rappresentano un’importante area di potenziale miglioramento. Questo scenario è particolarmente evidente quando le aziende mantengono i propri dati più preziosi riservati. Inoltrare tali informazioni a un laboratorio di AI di frontiera potrebbe compromettere la competitività, in quanto gli stessi potrebbero sviluppare un prodotto fondato su quei dati. L’addestramento finemente calibrato di modelli open-source mediante piattaforme come Tinker offre una buona alternativa. Le aziende mantengono il controllo sui dati, sui modelli e, a seconda del setup, persino sui propri hardware come le GPU.
Un abbonamento per restare aggiornati
Chi desidera rimanere aggiornato sull'evoluzione dell’AI senza eccesso di marketing o pubblicità può iscriversi al servizio THE DECODER. Offre lettura senza pubblicità, una newsletter settimanale sull'intelligenza artificiale, accesso esclusivo al rapporto annuale "AI Radar" sei volte all'anno e accesso completo all'archivio.