OpenScience rappresenta una svolta per la ricerca scientifica grazie al suo approccio open-source e alla sua natura agnostica rispetto al modello. Rilasciato da Synthetic Sciences, il workshop unisce modelli AI, scientific databases, e strumenti di lavoro, tutto in un’unica interfaccia.

Che cos'è OpenScience

OpenScience è uno strumento completamente open-source sotto licenza Apache 2.0. Si distingue per la sua capacità di ospitare un workflow completo di analisi scientifica: lettura della letteratura, formazione di ipotesi, scrittura ed esecuzione di codice, esperimenti e relazione dei risultati, tutto in una sessione unica.

Utilizza modelli AI come Claude, GPT, Gemini, DeepSeek e modelli locali, consentendo agli utenti di alternare i fornitori e i modelli senza interrompere il workflow. Non richiede conto e i modelli scelti vengono eseguiti con le chiavi API dei singoli utenti.

Per installarlo, gli utenti possono utilizzare npm:

npm install -g @synsci/openscience

openscience

Funzionalità di OpenScience

OpenScience dispone di:

    • Centinaia di strumenti (250+), inclusi DeepSpeed, PEFT, TRL, cheminformatics e tool per la scrittura di articoli, figure e codice.
    • Databank scientifici accessibili come strumenti, tra cui UniProt, PDB, ChEMBL e arXiv.
    • Agenti specializzati per fisica, chimica, biologia e machine learning, accompagnati da sub-agenti per recensioni e ricerche.
    • Modello di esecuzione su infrastruttura locale, con sessioni condivisibili tramite link, mantenendo la privacy e la flessibilità.

Come Funziona OpenScience

OpenScience ha una struttura interna in cui un server locale gestisce l'interfaccia, l'agente e la sua architettura di base. L'agente pianifica la ricerca e esegue strumenti come shell, LSP, compiler e database scientifici.

La gestione dei modelli avviene per richiesta, permettendo di cambiare modello o eseguirli localmente in un click. Il lavoro dell'agente viene mostrato in tempo reale nel browser.

OpenScience vs Claude Science

OpenScience e Anthropic's Claude Science hanno entrambi un focus sull'integrazione scientifica e sull'utilità per la produzione di ricerca. Tuttavia, OpenScience introduce la libertà in materia di modelli, mentre Claude Science si basa esclusivamente sui modelli di Anthropic.

Le differenze principali includono:

    • OpenScience è open-source e funziona su qualsiasi modello o infrastruttura, mentre Claude Science utilizza solo i propri modelli.
    • OpenScience ha un'ampia gamma di strumenti (250+), mentre Claude Science ha una scelta più ristretta, ma selezionata.
    • OpenScience permette di utilizzare i propri modelli, mentre Claude Science richiede una sottoscrizione a pagamento.

Applicazioni Con Esempi

OpenScience trova utilizzo in contesti diversificati. Vediamo alcuni esempi:

Ricerca nel Machine Learning

Un ingegnere ML può testare una sua idea di sottocampionamento grazie al supporto di un agente ML che effettua query su arXiv, utilizza strumenti di PEFT e TRL per la scrittura di codice.

Biolinformatica

Uno scienziato dati utilizza il modulo biologia per indagare una proteina. L'agente consulta PDB e UniProt, visualizza la struttura e propone mutazioni candidate.

Cheminformatica

Un chimico esplora composti in ChEMBL e PubChem, filtra i dati in codice e ordina le molecole in base a effetti biologici o strutturali.

Confronto di Modelli a Costo Ridotto

Un team confronta modelli tra Claude, GLM e sottocampionamenti locali in un ambiente interamente gestito in OpenScience, valutando qualità e costi su dati propri.

Punti Forti e Deboli

OpenScience si presenta con molti vantaggi:

    • Licenza Apache 2.0 e accesso ai codici sorgente per modifiche aperte;
    • Agnosticità modellistica per evitare blocco di un singolo fornitore;
    • Gestione delle risorse scientifiche locali, ideale per dati sensibili o privati;
    • Estensibilità grazie al supporto per plugin, LSP, e SDK TypeScript;
    • Ricca copertura strumentale con centinaia di strumenti e decine di database scientifici;

Tuttavia, presenta alcune limitazioni:

    • Non esiste isolamento tra gli agenti;
    • Per la sicurezza, conviene eseguirlo in un contenitore o macchina virtuale;
    • Essendo un progetto relativamente nuovo, potrebbe mostrare caratteristiche non perfette;
    • Il costo relativo alle chiavi API e limiti di velocità sono a carico dell'utente;
    • La qualità dipende fortemente dal modello utilizzato.

Risorsa per Approfondimento

Eseguendo un'analisi interattiva, il repository GitHub di OpenScience è un punto centrale per scoprire in dettaglio il progetto. Si consiglia inoltre di seguire il progetto su Twitter e Twitter, unirsi al subreddit di 150.000 utenti appassionati di ML, e iscriversi al newsletter. Anche Telegram è una piattaforma disponibile per seguire aggiornamenti.