La Beijing Academy of Artificial Intelligence (BAAI) ha rilasciato il "modello del mondo fondamentale" Orca, che rompe con l'approccio dominante nell'intelligenza artificiale. Invece di predire il prossimo token o il prossimo fotogramma video, il sistema sviluppato da BAAI modella lo stato successivo del mondo in una rappresentazione interna astratta.

Due metodi di apprendimento che operano in sinergia

Orca utilizza due modalità principali di apprendimento. L'apprendimento "inconscio" si basa su video grezzi non etichettati. Il modello osserva un'immagine e predice il contenuto della prossima, non a livello di pixel ma in uno spazio astratto, rilevando modelli di movimento, occlusioni e dinamiche comuni delle scene.

L'"apprendimento cosciente" aggiunge istruzioni verbali. I video vengono suddivisi in segmenti etichettati con descrizioni sugli eventuali cambiamenti di stato. In questo modo, il modello apprende come un'azione specifica influenza un sistema. Allo stesso tempo, si addestra con compiti ben definiti di domanda e risposta legati ai video per migliorare ulteriormente l'interazione con il linguaggio naturale.

Un nucleo congelato e moduli di output intercambiabili

Il modello Qwen3.5, precedentemente addestrato, serve come base e rimane congelato una volta completata la fase iniziale. Per ogni tipo di output, i ricercatori collegano moduli separati e indipendenti che convertono lo stato interno in forma di testo, immagini od azioni robotiche.

    • Il testo viene elaborato attraverso la testa esistente di Qwen3.5.
    • Le immagini vengono prodotte da un piccolo strato di adattatore su Stable Diffusion 3.5.
    • Le azioni robotiche, invece, escono da un modulo di controllo specificamente addestrato dal nome "Action Expert".

Dati di addestramento e dimensioni del modello

Per addestrarsi, Orca si basa su 125.000 ore di video, 160 milioni di descrizioni di eventi ed 11,5 milioni di domande e risposte. I video coprono scene diverse, da riprese in prima persona a immagini robotiche senza informazioni azionali.

I ricercatori hanno addestrato Orca in due dimensioni, una con 800 milioni di parametri e l’altra con 4 miliardi. L’addestramento mostra una riduzione stabile delle perdite con più dati e modelli di dimensioni maggiori. Test iniziali indicano anche che un miglior stato interno del modello durante l’addestramento iniziale favorisce un miglior risultato in tutti i modi di output.

Performance nei test di generazione testuale

Sui benchmark di testo, Orca-4B ha ottenuto una media del 51,8% per un totale dei quattro test MVBench, TemporalBench, 3DSRBench e SWITCH, battendo diversi modelli di base (VLM) come Qwen3.5-4B, Gemma 4-4B e DeepSeek-VL2-3B.

Nonostante alcuni test siano stati dominati da Qwen3.5-4B, ad esempio per il benchmark MVBench, il modello Orca si distingue nel complessivo e anche nei confronti di modelli molto più grandi come Emu3 (8B) e Emu3.5 (34B).

Eccellenza nella generazione di immagini

Per la previsione visiva, i ricercatori hanno creato un benchmark chiamato PRICE-V0.1. Il modello è stato provato su scene reali generate da robot e registrazioni in prima persona, dove doveva produrre un'immagine illustrativa del risultato di un comando, ad esempio "chiudere il forno a microonde".

Orca-4B ha ottenuto una media del 59,8%, superando modelli specializzati come FLUX.2 small, FLUX.1-Context e OmniGen2. Il modello mostra una rappresentazione più coerente degli oggetti, dei contatti con essi e del collegamento all'istruzione rispetto a generatori puramente immaginativi.

Controllo robotico senza dati azionali

Nel contesto di cinque compiti di manipolazione robotica, come sistemare libri, impilare ciotole e versare zucchero, Orca ha ottenuto risultati paragonabili a π0.5, un sistema specificamente sviluppato su dati robotici.

La base di Orca non ha mai visto associazione tra immagini e movimenti durante l'addestramento iniziale. Il supporto azionale è stato aggiunto successivamente sfruttando 200 registrazioni reali per compito, in cui vengono mappate immagini con le azioni eseguite.

Riconoscimenti e limiti

Tuttavia, il modello non è perfetto. La base di addestramento si limita a immagini e testo, mancando completamente informazioni sonore, forza e tatto. I movimenti visivi sono generati attraverso un’encoder di immagini preaddestrato e non vengono sviluppati autonomamente.

I modelli di Orca, con rispettivamente 800 milioni e 4 miliardi di parametri, non sono ancora di dimensioni sufficienti per rappresentare completamente il mondo. Inoltre, le descrizioni degli eventi coprono solo finestre temporali brevi di pochi minuti.

Potenziamenti futuri e risoluzione problemi

Nonostante questi limiti, BAAI considera il modello sviluppato una base solida per un sistema di modellazione del mondo autonomo. I progressi in quest’area potrebbero contribuire ad affrontare il problema cronico della mancanza di dati azionali etichettati nella robotica.

I ricercatori stanno sperimentando con soluzioni di apprendimento supervisionato, in cui vengono combinati la previsione dei cambiamenti di stato con la generazione di azioni specifiche. Questo modello, chiamato "World Action Models", potrebbe permettere l’acquisizione di informazioni da scene ordinarie in assenza di etichette di azione.

Conclusione

In sintesi, Orca rappresenta un passo significativo verso un modello del mondo versatile e adattabile. L’approccio basato su dati non etichettati promette soluzioni robuste e flessibili per applicazioni robotiche e visive, rivedendo il concetto tradizionale di modelli d’intelligenza artificiale focalizzati sull’apprendimento supervisato. La ricerca si apre quindi a nuove possibilità, ma richiede ulteriori sforzi per integrare sensazioni e dati diversi, come suoni, forza e tatto, per un’applicazione completa e naturale in contesti reali.