Robbyant, una società di AI embodied all'interno di Ant Group, ha reso open-source LingBot-Vision, una famiglia di Vision Transformers auto-supervisionati studiati per la percezione spaziale densa. I pesi sono stati rilasciati sotto licenza Apache-2.0 su Hugging Face in quattro dimensioni diverse: ViT-giant, ViT-large, ViT-base e ViT-small, insieme ad un report tecnico e al codice per l'inferenza.
I modelli visivi di base tradizionali sono addestrati per raggiungere un invariante semantico: si concentrano su rispondere alla domanda che cosa è presente in un'immagine, trascurando la struttura fine, come i contorni, i dettagli spaziali e le discontinuità di profondità. Questo è problematico, soprattutto per i sistemi fisici e i robot. LingBot-Vision ha invertito questa priorità. Tratta i contorni come segnale primario di addestramento, e il risultato è un modello da 1B parametri che eguaglia o supera modelli fino a 7 volte più grandi in compiti spaziali densi, tra cui il DINOv3 da 7B parametri.
Che cos’è LingBot-Vision?
LingBot-Vision è un encoder preaddestrato per compiti a struttura spaziale. Il modello di punta, ViT-g/16, ha circa 1.1B parametri ed è stato addestrato con un'obiettività chiamata masked boundary modeling su un corpus di circa 161M immagini, selezionate da un pool web di 2B, senza etichette umane, senza rivelatori di bordi esterni e senza un modello preaddestrato come punto di partenza. L'addestramento è economico: il corpus è un ordine di grandezza più piccolo rispetto a LVD-1689M di DINOv3 e il modello utilizza meno di un terzo delle immagini di addestramento di DINOv3.
L'encoder produce caratteristiche di token di patch dense utili per output di lettura congelati. Per deployment a costi più ridotti, il modello di punta è stato distillato in modelli studente più piccoli: ViT-L (300M), ViT-B (86M) e ViT-S. Questi guidano le prestazioni di previsione densa all'interno delle rispettive classi di dimensione.
Funzionamento del Masked Boundary Modeling
Il metodo si basa sul paradigma di distillazione autodidatta DINO/iBOT: un insegnante, una copia EMA dello studente, genera target online e lo studente li ripristina da viste mascherate.
L'immagine modellata standard nasconde patch a caso, ignorando che cosa esse raffigurano. Una patch interna semplice è facile da recuperare dai vicini, mentre una patch che attraversa un confine di oggetto non ha contesto sufficiente per essere ricostruita da sola. I confini sono le aree meno ridondanti ed informative del'immagine— ma il mascheramento casuale li tratta allo stesso modo.
Forzatura del Confine
L'insegnante predice un campo di confini denso online e identifica i token con contenuti di confine B. Questi sono forzatamente inclusi nel set mascherato dello studente, aggiungendo al mascheramento casuale M per ottenere il mascheramento combinato M⁺ = M ∪ B. I token mascherati vengono poi instradati geometricamente: i token di confine ricevono un obiettivo geometrico esplicito oltre all'obiettivo semantico della distillazione, mentre quelli interni mantengono l'obiettivo semantico standard. In questo modo, i target geometrici forniscono un'informazione chiara lì dove i modelli tradizionali di mascheramento falliscono di più, permettendo l'insieme comune di rappresentazioni semantiche e geometriche.
Campo di confine categorico
I confini sono modellati come segmenti di linea, sollevati a campo denso: ogni pixel vicino memorizza un vettore di attributi a(p) = (d, θ, φ¹, φ²) che registra la distanza al segmento più vicino e tre angoli necessari per localizzarlo. Regredire direttamente questo campo in un ciclo insegnante-studente fallisce. La soluzione consiste nel discretizzare ogni canale in K = 32 bin, riformulando la previsione del confine come classificazione a pixel singola, che consente al modello di utilizzare la stessa macchina di centratura e affinazione usata per stabilizzare la distillazione moderna.
Obiettivo Complessivo
Il termine finale somma quattro contributi:
- L_DINO: contributo principale per invariante semantico;
- λᵢ · L_iBOT: contributo per invariante semantico;
- λᵦ · L_bnd: contributo specifico per segnali di confine;
- λₖ · L_KoLeo: contributo per struttura di confine.
Benchmark e Prestazioni
Per i risultati densi mostrati qui, sono utilizzate caratteristiche congelate con uno strato lineare singolo, quindi le prestazioni derivato direttamente dal modello di rappresentazione, e non da un decoder.
| Model | Parametri | NYUv2 RME ↓ | KITTI RMSE ↓ | ADE20K mIoU | Cityscapes mIoU | VOC mIoU |
|---|---|---|---|---|---|---|
| LingBot-Vision ViT-g | 1B/16 | 0.296 | 2.552 | 53.5 | 79.6 | 87.5 |
| DINOv3 | 7B/16 | 0.309 | 2.346 | 55.9 | 81.1 | 86.6 |
| V-JEPA 2.1 ViT-G | 2B/16 | 0.307 | 2.461 | 47.9 | 73.5 | 85.0 |
| AM-RADIOv2.5 | 1B/14 | 0.340 | 2.918 | 53.0 | 78.4 | 85.4 |
| DINOv2 | 1B/14 | 0.372 | 2.624 | 49.5 | 75.6 | 83.1 |
| SigLIP 2 | 1B/16 | 0.494 | 3.273 | 42.7 | 64.8 | 72.7 |