Introduzione a Gemini Robotics ER 2
Google ha presentato Gemini Robotics ER 2, il modello più avanzato finora per il ragionamento incorporato nei robot. Agisce come un cervello di alto livello, capace di comprendere il mondo fisico attraverso flussi video continui, dialogare con gli esseri umani e orchestrare sequenze di azioni complesse. Il nuovo modello supera di gran lunga il predecessore ER 1.6, consentendo ai robot di monitorare i propri progressi, adattarsi a errori in tempo reale e collaborare con altri robot in ambienti condivisi.
Funzionalità chiave del modello
Gemini Robotics ER 2 integra diverse capacità fondamentali, tra cui:
- Comprensione video in tempo reale: analisi continua del feed video per tracciare lo stato del compito.
- Orchestrazione di task multi‑passo: pianificazione dinamica che consente di passare da un’azione all’altra senza interruzioni.
- Collaborazione multi‑robot: scambio semantico di informazioni per completare workflow che un singolo robot non può gestire.
- Accesso a strumenti esterni: chiamate native a Google Search o a funzioni personalizzate definite dall’utente.
- Integrazione con modelli Vision‑Language‑Action (VLA): delega l’esecuzione motoria a modelli specializzati.
Architettura di orchestrazione
Gli sviluppatori possono dichiarare interfacce di controllo a basso livello (API di navigazione, modelli VLA, sensori audio) come “strumenti” e inviare al modello flussi multimodali di video, audio o testo. Gemini Robotics ER 2 gestisce la sequenza degli strumenti, valutando continuamente i risultati per decidere il passo successivo.
Monitoraggio del progresso e intelligenza temporale
Uno dei maggiori ostacoli nella robotica è capire quando un compito è concluso. ER 2 introduce due capacità fondamentali:
- Classificazione continua del progresso: ogni fotogramma è etichettato in una delle cinque fasce di avanzamento (0‑20 %, 20‑40 %, 40‑60 %, 60‑80 %, 80‑100 %). Il modello raggiunge il 57,4 % di accuratezza, superando le versioni precedenti.
- Rilevamento di momenti critici: identifica il frame esatto in cui avviene un evento decisivo (ad esempio, il momento in cui fermare il versamento del caffè). L’accuratezza è del 91,3 % con una distanza media assoluta di 0,96 secondi, fornendo una risposta quasi istantanea.
Queste metriche consentono al robot di interrompere un’azione nel momento giusto, verificare il risultato e, se necessario, correggere l’errore senza ricominciare l’intero processo.
Collaborazione multi‑robot
Gemini Robotics ER 2 permette a robot di tipologie diverse di cooperare in modo fluido. Un rover a ruote può preparare l’ambiente, mentre un robot umanoide affronta compiti di precisione. Gli esempi più evidenti includono:
- Il collaborazione tra Apollo 2 di Apptronik e Franka F3 Duo, dove il rover trasporta materiali e il duo umanoide esegue assemblaggi complessi.
- Il demo con Spot di Boston Dynamics, in cui ER 2 orchestra le API di navigazione e manipolazione per far raccogliere a Spot snack su comando vocale.
Questa capacità si basa su una “comprensione semantica condivisa” che consente ai robot di trasferire compiti e informazioni senza perdita di contesto.
Benchmark di intelligenza spaziale
ER 2 migliora significativamente le seguenti metriche di ragionamento spaziale:
- Rilevamento di successo/fallimento: ora opera su feed video continui, individuando errori come fuoriuscite, scivolamenti o allineamenti errati durante l’esecuzione.
- Lettura di strumenti generici: riconosce quadranti, display digitali, scale lineari, righelli e termometri a liquido, testata su 10 tipologie diverse di strumenti.
- Visual Question Answering (VQA) spaziale: risponde a domande visive con maggiore accuratezza grazie a una comprensione multimodale avanzata.
In tutti i test, ER 2 registra il punteggio più alto rispetto ai modelli concorrenti, dimostrando la sua superiorità nella percezione e interpretazione dello spazio.
Sicurezza e gestione della prossimità umana
La sicurezza è una priorità per i robot fisici. ER 2 è stato valutato su due benchmark cruciali:
- Follow‑through delle istruzioni di sicurezza: il modello rispetta rigorosamente i vincoli fisici forniti nelle istruzioni.
- Rilevamento della prossimità umana: identifica la presenza di persone intorno al robot, fermando immediatamente l’azione se necessario.
Grazie a questi miglioramenti, ER 2 è considerato il modello più sicuro della famiglia Gemini per applicazioni embodiment.
Accesso e integrazione per gli sviluppatori
Il modello è disponibile attraverso tre canali principali:
- Gemini API: endpoint REST per richieste sincrone e streaming.
- Google AI Studio: interfaccia visuale per sperimentare prompt e configurazioni.
- Gemini Enterprise Agent Platform (preview privata): ambiente dedicato per agenti aziendali con integrazioni avanzate.
Per ottimizzare le operazioni a bassa latenza, ER 2 utilizza la Gemini Live API, un endpoint di streaming bidirezionale progettato per compiti sensibili al tempo, eliminando le classiche pause “stop‑and‑think”.
Esempi pratici e codice open‑source
Tra gli esempi rilasciati, spicca il progetto che collega ER 2 a Spot di Boston Dynamics. Il codice, pubblicato su