Introduzione

I modelli di linguaggio hanno già dimostrato di poter assistere i ricercatori nella ricerca della letteratura, nella sintesi delle evidenze e nell’esplorazione di domande complesse. Tuttavia, la ricerca scientifica impone requisiti particolari: le risposte devono rimanere ancorate alle prove, il modello deve preservare ciò che la evidenza supporta senza ampliare le conclusioni e i ricercatori devono poter verificare i risultati finali.

Motivazione dietro AstaBrief

Nel contesto di Asta, la nostra piattaforma agentica per il lavoro scientifico, abbiamo osservato che gli utenti non si limitano a ricerche con parole chiave, ma forniscono contesti ricchi e molteplici vincoli (metodi, popolazioni, impostazioni). Inoltre, i report generati vengono spesso riutilizzati come artefatti di ricerca, non come risposte una tantum. Da qui nasce la necessità di un modello che generi report citati in maniera più veloce e che possa essere eseguito localmente.

Obiettivi del progetto

Volevamo dimostrare che un modello di piccole dimensioni, open‑source e addestrato specificamente per la generazione di report scientifici, potesse eguagliare la qualità dei modelli proprietari, riducendo al contempo i tempi di generazione e i costi di servizio.

Costruzione di AstaBrief 8B

AstaBrief è stato sviluppato a partire da Qwen‑3‑8B, concentrando gli sforzi su dati post‑training, valutazione e sull’infrastruttura di generazione dei report. La pipeline è stata ridisegnata per produrre l’intero report in una singola passata, evitando la generazione sezione per sezione tipica del “Thinking mode” basato su Claude.

Dati di addestramento

Il training ha richiesto:

    • Decine di migliaia di query reali provenienti da utenti di Asta.
    • Filtraggio rigoroso per qualità, rilevanza e privacy, eliminando traffico di beta‑tester, bot e richieste non scientifiche.
    • Un pool finale di 90 000 query focalizzate sulla ricerca.

Per il Supervised Fine‑Tuning (SFT) sono stati generati 47 000 esempi di report completi usando la pipeline ScholarQA, che combina recupero della letteratura, organizzazione in sezioni e sintesi tramite modelli proprietari (Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4‑mini, GPT‑4.1). Dopo un filtro di qualità, questi esempi sono stati utilizzati per addestrare il modello.

Ottimizzazione delle preferenze (DPO)

Il Direct Preference Optimization (DPO) ha richiesto coppie di report per la stessa query, con una versione preferita rispetto all’altra. Le coppie sono state create da un sottoinsieme separato di query non usate nel SFT. Una versione proviene dalla pipeline ScholarQA (spesso basata su Claude 3.5/3.7 Sonnet), mentre l’altra è prodotta da un modello alternativo, consentendo al DPO di apprendere le preferenze di qualità.

Scelta di una strategia di addestramento più semplice

Abbiamo considerato metodi basati su reinforcement learning (RL), che hanno dimostrato miglioramenti nella generazione di report lunghi (es. DR Tulu). Tuttavia, RL risulta instabile e costoso. Per mantenere il progetto gestibile e più facile da debug, abbiamo optato per una combinazione di SFT e DPO, dimostrando che è possibile ottenere alta qualità senza ricorrere a RL.

Pipeline di generazione rapida

La chiave della velocità è la generazione del report completo in una sola passata, usando la query dell’utente e i frammenti di letteratura recuperati. Questo elimina le costose fasi di sintesi dei frammenti e clustering utilizzate dal “Thinking mode”.

Risultati di benchmark sulla pipeline completa di Asta:

    • Modo Fast (AstaBrief): 51,1 secondi per report.
    • Modo Thinking (Claude): 178,5 secondi per report.
    • Accelerazione complessiva: 3,5× più veloce, quasi un ordine di grandezza rispetto ai modelli proprietari.

Impatto dell’open‑source

Rilasciare i pesi e i dati di training permette alle istituzioni di eseguire AstaBrief sulla propria infrastruttura, una necessità quando le domande di ricerca coinvolgono dati sensibili o non pubblicati. Insieme ai pesi, forniamo un workflow di esempio per trasformare PDF in report locali, offrendo un punto di partenza per la generazione di report su scala privata.

Lezioni apprese sulla radicazione scientifica

Le analisi dei log hanno evidenziato che gli scienziati forniscono contesti più ampi, più vincoli e relazioni complesse rispetto agli utenti di chatbot generali. Pertanto, il modello deve mantenere una forte tracciabilità delle fonti e consentire agli utenti di vedere esattamente quali estratti sono stati citati. Inoltre, la capacità di filtrare contenuti non scientifici e di preservare la privacy è fondamentale.

Prospettive future

Il progetto AstaBrief si inserisce nell’iniziativa NSF OMAI, volta a creare infrastrutture AI completamente aperte per la scoperta scientifica. Continueremo a collaborare con comunità scientifiche per capire le necessità specifiche di ciascun campo e migliorare i modelli open‑weight. Future ricerche includeranno:

    • Studio delle differenze di utilizzo tra discipline.
    • Integrazione di metodi di RL più stabili, se necessario.
    • Espansione del dataset di training con ulteriori query reali e report più diversificati.

Conclusioni

AstaBrief dimostra che è possibile costruire un modello open‑source di piccole dimensioni, altamente specializzato nella sintesi scientifica, capace di generare report citati rapidamente e con qualità comparabile a modelli proprietari. La riduzione dei tempi di generazione, la trasparenza dei pesi e la disponibilità di un workflow replicabile aprono nuove opportunità per la ricerca collaborativa e per l’adozione di AI affidabili nelle istituzioni accademiche.