Ant Group ha appena lanciato LingBot-VLA 2.0, un modello fondamentale Vision-Language-Action (VLA) open-source. Questo sistema robotico ha ricevuto ampio supporto dalla comunità tecnologica grazie al suo approccio avanzato di AI agente.
Che cosa è LingBot-VLA 2.0?
LingBot-VLA 2.0 si basa su una struttura visivo-linguistica e converte immagini e istruzioni in azioni robotiche. Il modello pubblico utilizza circa 6 miliardi di parametri e incorpora Qwen3-VL-4B-Instruct come componente principale. Due modelli principali, LingBot-Depth e DINO-Video, contribuiscono con processi di distillatura supervisionata.
L'esecuzione di un singolo calcolo richiede circa 130 millisecondi utilizzando GPU NVIDIA GeForce RTX 4090D e 10 passaggi di denoising. Il modulo di azione adotta un design Misto di Esperti (MoE) per scalabilità e precisione.
Pipeline dati: 60.000 ore su 20 configurazioni robotiche
La capacità di generalizzazione di LingBot-VLA 2.0 inizia da un vasto set di dati, raccolto per circa 60.000 ore. Questo include 50.000 ore di dati robotici e 10.000 ore di video in prima persona.
La selezione dei dati utilizza processi rigorosamente misurabili. Il team di ricerca esclude episodi con movimenti poco fluidi e dati statici. I video vengono esaminati per l'allineamento e le anomalie, e i contenuti sono annotati automaticamente con un modello vision-linguaggio.
Utilizzando Qwen3.6-27B, i video vengono segmentati in sottotask temporali. Ciascuno riceve un'azione da un vocabolario chiuso di 18 categorie. "Muoversi" e "Trasferimento" sono tra le azioni più comuni.
Rappresentazione unificata delle azioni
Differenti robot espongono articolazioni diverse, per cui LingBot-VLA 2.0 unifica le informazioni in un vettore canonico da 55 dimensioni. Questo formato fisso garantisce flessibilità in ogni scenario robotico.
- Posizione articolare: 14
- Presa: 14
- Presa di attuazione: 2
- Posizione della mano articolata: 12
- Posizione lombare: 4
- Posizione del capo: 2
- Segnale di mobilità: 3
- Riservato: 4
Ciascuna prensa utilizza coordinate (X, Y, Z) e un quaternione rotazionale, per un totale di 7 dimensioni per ogni braccio. I robot inadeguati o incompleti vengono corretti o completati, permettendo ai robot di controllare ogni loro componente.
Il modulo MoE:
Il modulo di azione sostituisce la rete di forwarding tradizionale con strati MoE. Ogni strato contiene esperti condivisi e strati di esperti direzionali. Per ogni token, vengono attivati solo i principali K esperti, rendendo il calcolo attivo controllabile.
Ogni esperto utilizza un MLP di tipo SwiGLU, con una struttura intermedia ridotta.
- Strategia di routing: basata su sigmoide
- Correzione del carico per ogni esperto
- Non include loss di bilanciamento
Con la stessa quantità di parametri attivi, il modello MoE ottiene un minor training loss e un errore d'azione di validazione più basso rispetto ai modelli densi.
Distillazione predittiva doppia
L'esecuzione reale richiede anticipazione di eventi futuri, non solo una risposta immediata. LingBot-VLA 2.0 utilizza due query apprese sui token visivi e testuali.
- QT mira all'osservazione corrente
- Qt+T mira a un'osservazione futura
I due principali insegnanti, LingBot-Depth e DINO-Video, supervisionano queste richieste. Il primo fornisce informazioni geometriche esplicite; il secondo apporta priorità semantiche temporali. DINO-Video utilizza la base DINOv3 con attenzione causale a blocchi e 3D-RoPE. Sul benchmark LARYBench, DINO-Video guida in tre delle quattro metriche.
Risultati sui benchmark
Il modello è stato testato su un benchmark di manipolazione bi-manuale chiamato GM-100 (Great March 100). Una singola politica è addestrata simultaneamente su nove compiti per ognuna delle configurazioni robotiche.
I risultati vengono indicati come punteggio di progresso / tasso di successo.
| Platform | GR00T N1.7 | π0.5 | LingBot-VLA 1.0 | LingBot-VLA 2.0 |
|---|---|---|---|---|
| AgileX Cobot Magic | 36.3 / 17.8 | 59.1 / 32.2 | 58.2 / 30.0 | 66.2 / 34.4 |
| Galaxea R1Pro | 16.4 / 5.6 | 27.4 / 8.9 | 32.7 / 15.6 | 34.6 / 15.6 |
Nei compiti di manipolazione mobile a lungo termine, i test vengono effettuati in due contesti: “in-domain” e “out-of-domain”.
- Domanda: Refrigerazione (in-domain) - LingBot-VLA 2.0: 77.1 / 60.0; π0.5: 65.3 / 46.7
- Domanda: Refrigerazione (out-of-domain) - LingBot-VLA 2.0: 37.0 / 13.3; π0.5: 30.3 / 6.7
- Domanda: Pulizia fornelli (in-domain) - LingBot-VLA 2.0: 84.3 / 66.7; π0.5: 79.9 / 60.0
- Domanda: Pulizia fornelli (out-of-domain) - LingBot-VLA 2.0: 67.