Robbyant ha rilasciato LingBot-VLA 2.0, un modello fondamentale di Intelligenza Artificiale per l'azione robotica, dotato di un'interfaccia visione-linguaggio-azione. Disponibile come codice open-source, il rilascio include un checkpoint da 6 miliardi di parametri, un rapporto tecnico e un codice Apache-2.0. L’obiettivo della squadra di ricerca è colmare una lacuna conosciuta: i modelli VLA spesso funzionano bene in laboratorio, ma hanno difficoltà nell’ambiente reale.
Che cos’è LingBot-VLA 2.0?
LingBot-VLA 2.0 è una politica robotica generale basata su un mezzo vision-language. Esso converte immagini della fotocamera e istruzioni linguistiche in azioni robotiche. Il modello pubblico disponibile è lingbot-vla-v2-6b, un checkpoint con 6 miliardi di parametri. Utilizza Qwen3-VL-4B-Instruct come base del VLM. Due modelli esperti, LingBot-Depth e DINO-Video, supervisionano l’addestramento attraverso la distillazione.
Una singola chiamata di inferenza richiede circa 130 ms su un’NVIDIA GeForce RTX 4090D, utilizzando 10 passaggi di denoising. L’esperto di azione utilizza una struttura Mixture-of-Experts (MoE) per scalabilità.
Pipeline di dati: 60.000 ore su 20 configurazioni robotiche
La generalizzazione inizia dai dati. Il team raccoglie circa 60.000 ore totali da diverse fonti. Queste includono:
- 50.000 ore di traiettorie robotiche
- 10.000 ore di video egocentrici umani
Questi dati coprono 20 configurazioni robotiche, da singoli bracci a completi umanoidi. Il set originale è molto più ampio: circa 90.000 ore da robot e 20.000 da fonte egocentrica. La pipeline ha selezionato solo i dati con alta qualità.
Filtro dati esplicito e misurabile
Il processo di filtro include calcolare jerk e Z-score per la velocità, accelerazione e movimento per ogni unità di robot. Vengono scartate le traiettorie irregolari o di lunga staticità. I video passano attraverso un controllo basato sui parametri URDF di ogni robot. Annotatori rimuovono immagini sfocate, nascoste, con frame saltati o allineamenti errati. Dopo la verifica, i video passano da vision-language model (VLM) ad analisi SLAM e ricostruzione della mano con MANO.
L’annotation avviene automaticamente con un modello di visione-linguaggio Qwen3.6-27B, che divide ogni video in sottotitoli temporali coerenti. Ogni sottotitolo ha azioni atomiche da un vocabolario chiuso di 18 categorie. Le azioni più comuni sono “muovi” e “transit”.
Rappresentazione azioni unificata
LingBot-VLA 2.0 utilizza un vettore canonico da 55 dimensioni, per rappresentare in modo unificato azioni e stati. La struttura fissa per ogni corpo robotico permette ad un singolo modello di controllare bracci, mani articolate, ganci di prensione, collo, torso, attuatori mobili, e altri componenti.
- Articolazione braccio: 14D
- Articolazione fine (end-effector): 14D
- Articolazione gancio: 2D
- Articolazione mano: 12D
- Articolazione collo/mobilità: 2-3D
- Articolazione tronco: 4D
- Riservato: 4D
MoE per esperto d’azione
L’esperto di azione sostituisce la rete feed-forward con strati Mixture-of-Experts (MoE). Ogni strato MoE ha esperti condivisi e altri assegnati dinamicamente. Ogni token attiva solo i primi K esperti, mantenendo i parametri computazionali stabili. Gli esperti sono realizzati come SwiGLU MLP con larghezza inferiore al modello originale.
Il routing avviene tramite una strategia senza perdita ausiliaria ispirata a DeepSeek-V3. Ogni esperto ha un bias per bilanciare il carico. Il modello MoE raggiunge una bassa perdita di addestramento rispetto a una rete densa, e una minore errore di validazione su compiti GM-100.
Distillazione per dinamica predittiva
Per anticipare il futuro e non solo reagire, LingBot-VLA 2.0 aggiunge due query apprendibili. Una puntata al presente (Qt) e una al futuro (Qt+T). La distanza T è data da chunk delle azioni.
Due insegnanti supervisionano: LingBot-Depth introduce informazioni geometriche, mentre DINO-Video introduce contesti semantici temporali. Gli esperimenti dimostrano che DINO-Video eccelle in 3 su 4 metriche su LARYBench.
Risultati Benchmark
Robbyant valuta il modello su GM-100, un benchmark bilaterale su diverse piattaforme. Su ogni modello viene addestrata una politica multi-task per 9 attività.
Ecco i risultati:
| Platform | GR00T N1.7 | π0.5 | LingBot-VLA-1.0 | LingBot-VLA-2.0 |
|---|---|---|---|---|
| AgileX Cobot Magic | 36.3 / 17.8 | 59.1 / 32.2 | 58.2 / 30.0 | 66.2 / 34.4 |
| Galaxea R1Pro | 16.4 / 5.6 | 27.4 / 8.9 | 32.7 / 15.6 | 34.6 / 15.6 |
Test su manipolazione mobile
In due ambienti: In-domain usa i dati di addestramento, OID aggiunge distorsioni.
- Astribot S1 - Ordinamento frutta/liquidi refrigerante success rate:
In-domain: 60% → 77.1%
OID: 46.7% →