Robostral Navigate è il primo modello sviluppato da Mistral AI per l’intelligenza artificiale incorporata, mirato alla navigazione robotica in ambienti complessi. Questo modello da 8 miliardi di parametri si basa su istruzioni in linguaggio naturale e su immagini RGB provenienti da una singola fotocamera senza necessitare di sensori di profondità o LiDAR. Il modello ottiene un risultato notevole del 76.6% di successo nello scenario standard di benchmarking R2R-CE (Room-to-Room in Continuous Environment) con un’unico sensore RGB.

Che cos’è Robostral Navigate?

Robostral Navigate è progettato per spostare robot attraverso un ampio range di ambienti diversi: uffici, edifici residenziali, strade e spazi commerciali. Fornito con un’istruzione, il modello riesce a completare interamente il compito autonomamente, come nell’esempio seguente:

    • “Esci dall’atrio, cammina lungo il corridoio, entra nella stanza del magazzino e ferma il robot di fronte alla seconda scaffalatura.”

Eccellente tanto in spazi affollati quanto in aree con ostacoli inaspettati.

Contrariamente alle soluzioni tradizionali, Robostral Navigate utilizza un solo sensore RGB e non necessita di sensori aggiuntivi come LiDAR o profondità. Questo approccio riduce costi e complessità, rendendo il sistema più efficiente rispetto ad altre tecnologie multi-sensore.

Navigation via Pointing: Come Funziona

Il modello usa una tecnica chiamata “pointing” (puntamento) per decidere dove spostare il robot. Con l’input del compito e l’osservazione storica, il modello prevede dove il robot deve muoversi. Questo processo include:

    • Identificare le coordinate dell’immagine del bersaglio nella vista corrente.
    • Prevedere l’orientamento desiderato al momento del raggiungimento del bersaglio.

I vantaggi di questa tecnica includono la robustezza rispetto a variazioni nella scala o alla camera. Tuttavia, quando il bersaglio non è nel campo visivo, il modello cade a un sistema basato su spostamenti in un frame locale, ad esempio:

    • “Muoviti 2 metri avanti, 1.5 metri a sinistra e gira a sinistra di 25 gradi.”

Costruito Dall’Inizio

Robostral Navigate non si basa su modelli vision-language esistenti open-source, ma su un modello interno sviluppato da Mistral per compiti di grounding. Questi includono puntamento, conto oggetti e localizzazione di oggetti. La navigazione emerge come un’estensione naturale di queste tecnologie.

Per l’addestramento, Mistral ha creato una pipeline in ambiente simulato, producendo circa 400.000 traiettorie diverse raccolte su 6.000 ambienti virtuali.

Efficiente Training e Apprendimento Rafforzativo Online

Un elemento fondamentale del design è l’efficienza nell’addestramento. Il modello utilizza un algoritmo di tipo prefix-caching, un approccio che comprime l’intera sequenza in una singola sequenza. Questo permette al modello di addestrarsi in un singolo passaggio su tutti i passi temporali e di prevenire la perdita di informazioni.

Grazie a questa tecnica, i tempi di addestramento vengono ridotti di 22 volte: ciò che prima richiedeva mesi può adesso essere completato in pochi giorni. Successivamente, Mistral ha utilizzato CISPO, un algoritmo di apprendimento rafforzativo online, che ha migliorato il tasso di successo di 3.2 punti percentuali.

Benchmark e Prestazioni

Sul fronte delle valutazioni, Robostral Navigate ha ottenuto risultati all’avanguardia nel benchmark R2R-CE. Il benchmark standard misura la capacità di seguire le istruzioni in un ambiente 3D continuo. Il modello ottiene il 79.4% di successo sulle ambienti visto ("validation seen") e il 76.6% nei dati non visti ("validation unseen").

Tabella Comparativa

Per un confronto diretto, qui di seguito viene presentata una tabella che mette a confronto Robostral Navigate con sistemi multi-sensore tipici:

    • Sensori: Fotocamera RGB singola vs. sensori a profondità, LiDAR o multi-camera
    • Dimensioni del modello: 8B da Mistral vs. Dimensione variabile
    • Modello base: VLM di grounding interno vs. VLM open-source
    • Dati addestramento: ~400.000 traiettorie simulative in 6.000 scenari
    • Metodi decisionali: Puntamento + fallback in spostamenti locali vs. spostamenti metrici o pianificazione basata su mappa
    • R2R-CE score: 76.6% vs. 4.5% in meno per i migliori sistemi a profondità/multi-camera
    • Supporto robotico: Ruotante, a gambe o rotelle vs. Solitamente limitato alle piattaforme

Il modello rappresenta quindi una soluzione versatile con potenzialità di essere utilizzata in robot di varie tipologie, adattati al singolo utilizzo o adatti a flotte robotiche.

Utilizzi Pratici

Le applicazioni di questo modello sono numerose. Tra queste:

    • In settori industriali dove un robot può trasferire componenti tra stazioni.
    • Nel trasporto e logistica, dove un robot si muove per consegnare pacchi in un magazzino.
    • Nel settore dell’ospitalità, dove un robot accompagna i visitatori da un piano all’altro.

Un Codice Semplificato

Ecco un esempio di pseudo codice illustrativo per comprendere l’approccio utilizzato per i movimenti in base ai puntamenti:


obs_history = [] # quadrate di osservazione passate

instruction = "Esci dall’atrio, cammina fino alla seconda scaffalatura, ferma."

done = False

while not done:

frame = camera.read() # singola immagine RGB

obs_history.append(frame)

azione = modello.prevedi(instruction, obs_history)

if azione.tipo == "point": # bersaglio visibile

robot.vaiapixel(azione.x, azione.y, azione.orientamento)

altro: # bersaglio fuori campo

robot.muovilocale(azione.inavantim, azione.sinistram, azione.girare_gradi)

done = azione.stop

Questo codice non è la versione ufficiale ma fornisce una panoramica del processo decisionale.

Conclusioni Principali

Robostral Navigate è un modello AI di navigazione incorporato da Mistral AI.

Ottiene un punteggio del 76.6% sul benchmark R2R-CE con una singola fotocamera RGB.

Utilizza il puntamento per trovare i bersagli visivi e il fallback locale per gli obiettivi nascosti.

Grazie