Ant Group ha appena lanciato LingBot-VLA 2.0, un modello fondamentale Vision-Language-Action (VLA) open-source. Questo sistema robotico ha ricevuto ampio supporto dalla comunità tecnologica grazie al suo approccio avanzato di AI agente.

Che cosa è LingBot-VLA 2.0?

LingBot-VLA 2.0 si basa su una struttura visivo-linguistica e converte immagini e istruzioni in azioni robotiche. Il modello pubblico utilizza circa 6 miliardi di parametri e incorpora Qwen3-VL-4B-Instruct come componente principale. Due modelli principali, LingBot-Depth e DINO-Video, contribuiscono con processi di distillatura supervisionata.

L'esecuzione di un singolo calcolo richiede circa 130 millisecondi utilizzando GPU NVIDIA GeForce RTX 4090D e 10 passaggi di denoising. Il modulo di azione adotta un design Misto di Esperti (MoE) per scalabilità e precisione.

Pipeline dati: 60.000 ore su 20 configurazioni robotiche

La capacità di generalizzazione di LingBot-VLA 2.0 inizia da un vasto set di dati, raccolto per circa 60.000 ore. Questo include 50.000 ore di dati robotici e 10.000 ore di video in prima persona.

La selezione dei dati utilizza processi rigorosamente misurabili. Il team di ricerca esclude episodi con movimenti poco fluidi e dati statici. I video vengono esaminati per l'allineamento e le anomalie, e i contenuti sono annotati automaticamente con un modello vision-linguaggio.

Utilizzando Qwen3.6-27B, i video vengono segmentati in sottotask temporali. Ciascuno riceve un'azione da un vocabolario chiuso di 18 categorie. "Muoversi" e "Trasferimento" sono tra le azioni più comuni.

Rappresentazione unificata delle azioni

Differenti robot espongono articolazioni diverse, per cui LingBot-VLA 2.0 unifica le informazioni in un vettore canonico da 55 dimensioni. Questo formato fisso garantisce flessibilità in ogni scenario robotico.

    • Posizione articolare: 14
    • Presa: 14
    • Presa di attuazione: 2
    • Posizione della mano articolata: 12
    • Posizione lombare: 4
    • Posizione del capo: 2
    • Segnale di mobilità: 3
    • Riservato: 4

Ciascuna prensa utilizza coordinate (X, Y, Z) e un quaternione rotazionale, per un totale di 7 dimensioni per ogni braccio. I robot inadeguati o incompleti vengono corretti o completati, permettendo ai robot di controllare ogni loro componente.

Il modulo MoE:

Il modulo di azione sostituisce la rete di forwarding tradizionale con strati MoE. Ogni strato contiene esperti condivisi e strati di esperti direzionali. Per ogni token, vengono attivati solo i principali K esperti, rendendo il calcolo attivo controllabile.

Ogni esperto utilizza un MLP di tipo SwiGLU, con una struttura intermedia ridotta.

    • Strategia di routing: basata su sigmoide
    • Correzione del carico per ogni esperto
    • Non include loss di bilanciamento

Con la stessa quantità di parametri attivi, il modello MoE ottiene un minor training loss e un errore d'azione di validazione più basso rispetto ai modelli densi.

Distillazione predittiva doppia

L'esecuzione reale richiede anticipazione di eventi futuri, non solo una risposta immediata. LingBot-VLA 2.0 utilizza due query apprese sui token visivi e testuali.

    • QT mira all'osservazione corrente
    • Qt+T mira a un'osservazione futura

I due principali insegnanti, LingBot-Depth e DINO-Video, supervisionano queste richieste. Il primo fornisce informazioni geometriche esplicite; il secondo apporta priorità semantiche temporali. DINO-Video utilizza la base DINOv3 con attenzione causale a blocchi e 3D-RoPE. Sul benchmark LARYBench, DINO-Video guida in tre delle quattro metriche.

Risultati sui benchmark

Il modello è stato testato su un benchmark di manipolazione bi-manuale chiamato GM-100 (Great March 100). Una singola politica è addestrata simultaneamente su nove compiti per ognuna delle configurazioni robotiche.

I risultati vengono indicati come punteggio di progresso / tasso di successo.

Platform GR00T N1.7 π0.5 LingBot-VLA 1.0 LingBot-VLA 2.0
AgileX Cobot Magic 36.3 / 17.8 59.1 / 32.2 58.2 / 30.0 66.2 / 34.4
Galaxea R1Pro 16.4 / 5.6 27.4 / 8.9 32.7 / 15.6 34.6 / 15.6

Nei compiti di manipolazione mobile a lungo termine, i test vengono effettuati in due contesti: “in-domain” e “out-of-domain”.

    • Domanda: Refrigerazione (in-domain) - LingBot-VLA 2.0: 77.1 / 60.0; π0.5: 65.3 / 46.7
    • Domanda: Refrigerazione (out-of-domain) - LingBot-VLA 2.0: 37.0 / 13.3; π0.5: 30.3 / 6.7
    • Domanda: Pulizia fornelli (in-domain) - LingBot-VLA 2.0: 84.3 / 66.7; π0.5: 79.9 / 60.0
  • Domanda: Pulizia fornelli (out-of-domain) - LingBot-VLA 2.0: 67.