Il nuovo cervello robotico di Google sa guardare, pianificare e collaborare con altri robot

Gemini Robotics ER 2 fornisce alle macchine un "pensatore" di alto livello più intelligente che traccia i progressi dai video e affida i movimenti effettivi a un controller di livello inferiore.

AI2Day Newsdesk4 min read
A large, brightly lit modern factory floor filled with orange industrial robotic arms in motion, assembling metal components on a conveyor line, overhead fluore
Share

Punti chiave

  • Google DeepMind ha lanciato Gemini Robotics ER 2, un nuovo modello di "embodied reasoning" che funge da cervello di alto livello per i robot.
  • Il modello raggiunge il 57,4% nella classificazione dei progressi e il 91,3% nella ricerca del momento, individuando il frame esatto del video quando un passaggio dell'attività è completato.
  • Supporta la collaborazione multi-robot, consentendo a un robot a ruote e a un umanoide di condividere un'attività attraverso una comprensione comune.
  • Gli sviluppatori possono provarlo subito tramite l'API Gemini e Google AI Studio, con un'anteprima privata sulla Piattaforma Agente Gemini Enterprise.
  • Una demo abbina il modello al robot Spot di Boston Dynamics per recuperare oggetti su comando vocale.

Google DeepMind ha rilasciato un nuovo modello che vuole essere la parte pensante della testa di un robot. Si chiama Gemini Robotics ER 2, dove ER sta per "embodied reasoning", che è un modo elaborato di dire che il modello comprende il mondo fisico che lo circonda.

Ecco il quadro semplice. Il modello osserva attraverso la telecamera del robot, vi ascolta, pianifica i passaggi, e poi dice a un controller separato di livello inferiore come muovere effettivamente gli arti e le ruote. Questo controller di livello inferiore è chiamato modello vision-language-action, o VLA: software che trasforma un piano in movimenti motori specifici.

Pensate a ER 2 come il manager e al VLA come alle mani.

Che cosa può effettivamente fare?

Può guardare video continuo, tracciare come sta procedendo un compito, e passare al passaggio successivo al momento giusto. Questo è il grande cambiamento rispetto alla versione precedente, ER 1.6.

Diciamo che un robot sta versando il caffè. ER 2 dovrebbe vedere il frame esatto in cui la tazza è piena e dire al braccio di smettere. I test di Google lo mettono al 91,3% di precisione in questa abilità di "ricerca del momento", con un errore di tempistica medio inferiore a un secondo.

Gestisce anche il tracciamento dei progressi dell'attività, classificando ogni frame video in uno di cinque stati da 0% completato a 100% completato. Questo dà al robot il senso di "sono quasi finito, oppure ho sbagliato e devo riprovare?"

In che cosa è diverso da altri sistemi di intelligenza artificiale per robot?

Velocità e multitasking. ER 2 si collega all'API Gemini Live, una connessione di streaming bidirezionale costruita per bassissima latenza, quindi il robot non si blocca ogni volta che deve pensare.

Può anche chiamare strumenti esterni durante l'attività, come Google Search, o una funzione personalizzata che uno sviluppatore scrive. Google ha mostrato una demo con Spot, il robot quadrupede giallo di Boston Dynamics, che recupera un sacchetto di popcorn su una richiesta vocale.

Un altro nuovo trucco: più robot che lavorano insieme. Un robot a ruote e un umanoide possono ora condividere una comprensione semantica del compito e trasferire attività l'uno all'altro. Google lo ha mostrato con l'umanoide Apollo 2 di Apptronik e un braccio Franka F3 Duo.

I numeri che contano

Capacità Punteggio ER 2 Cosa significa
Classificazione dei progressi 57,4% Quanto bene traccia i progressi dell'attività dal video
Precisione nella ricerca del momento 91,3% Individuazione del frame esatto in cui si verifica un evento
Tempistica della ricerca del momento Errore medio di 0,96s Reazione subseconda, abbastanza veloce per robot reali

Chi può usarlo, e quanto costa?

Gli sviluppatori possono accedere a ER 2 oggi tramite l'API Gemini e Google AI Studio, con un'anteprima privata sulla Piattaforma Agente Gemini Enterprise. Google non ha pubblicato prezzi per la robotica per token, quindi gli hobbisti dovrebbero aspettarsi tariffe standard dell'API Gemini più i costi dell'hardware. Il codice di esempio è su GitHub.

È rivolto a sviluppatori di robotica e aziende, non ai consumatori. Non potete comprare un robot ER 2 in un negozio.

E la sicurezza?

Google dice che ER 2 è il suo modello di robotica più sicuro finora, con punteggi migliori nel "rispetto delle istruzioni di sicurezza" e nella "prossimità umana", il che significa che è più cauto nel tenersi lontano dalle persone e nel rifiutare comandi non sicuri. È rassicurante sulla carta. La vera prova sarà nelle case, nei magazzini e negli ospedali, dove il caffè versato è un fastidio ma un braccio mosso male non lo è.

Una nota sulla privacy in parole semplici: qualsiasi robot che esegue questo modello sta trasmettendo video e audio ai server di Google per pensare. Se queste macchine finissero nella vostra cucina un giorno, vale la pena ricordarlo. Per ora, è uno strumento per sviluppatori, e le telecamere sono nei laboratori.

© 2026 AI2Day