El nuevo cerebro robótico de Google puede observar, planificar y trabajar en equipo con otros robots

Gemini Robotics ER 2 proporciona a las máquinas un "pensador" de alto nivel más inteligente que monitorea el progreso en video y delega los movimientos reales a un controlador de nivel inferior.

AI2Day Newsdesk4 min read
A large, brightly lit modern factory floor filled with orange industrial robotic arms in motion, assembling metal components on a conveyor line, overhead fluore
Share

Puntos clave

  • Google DeepMind lanzó Gemini Robotics ER 2, un nuevo modelo de "razonamiento encarnado" que actúa como cerebro de alto nivel para robots.
  • El modelo obtiene un 57,4% en clasificación de progreso y un 91,3% en búsqueda de momentos, identificando el fotograma exacto donde se completa un paso de tarea.
  • Admite colaboración entre múltiples robots, permitiendo que un robot con ruedas y un humanoide compartan una tarea mediante comprensión común.
  • Los desarrolladores pueden probar ahora a través de la API de Gemini y Google AI Studio, con una vista previa privada en la Plataforma de Agentes Empresariales de Gemini.
  • Una demostración empareja el modelo con el robot Spot de Boston Dynamics para buscar objetos por comando de voz.

Google DeepMind ha lanzado un nuevo modelo que pretende ser la parte pensante de la cabeza de un robot. Se llama Gemini Robotics ER 2, donde ER significa "razonamiento encarnado", una forma sofisticada de decir que el modelo comprende el mundo físico que lo rodea.

Aquí está la idea simple. El modelo observa a través de la cámara del robot, te escucha, planifica los pasos y luego le dice a un controlador de nivel inferior separado cómo mover realmente los brazos y ruedas. Ese controlador de nivel inferior se llama modelo de visión-lenguaje-acción, o VLA: software que convierte un plan en movimientos motores específicos.

Piensa en ER 2 como el gerente y el VLA como las manos.

¿Qué puede hacer realmente?

Puede observar video continuo, monitorear cómo va una tarea y cambiar al siguiente paso en el momento correcto. Este es el cambio principal respecto a la versión anterior, ER 1.6.

Supongamos que un robot está sirviendo café. Se supone que ER 2 ve el fotograma exacto donde la taza está llena y le dice al brazo que se detenga. Las pruebas propias de Google lo sitúan en un 91,3% de precisión en esta habilidad de "búsqueda de momentos", con un error de sincronización promedio inferior a un segundo.

También gestiona el seguimiento del progreso de la tarea, clasificando cada fotograma de video en uno de cinco grupos, desde 0% completo hasta 100% completo. Esto le da al robot una sensación de "¿estoy casi ahí, o cometí un error y necesito intentarlo de nuevo?"

¿En qué se diferencia esto de otras IA robóticas?

Velocidad y capacidad de múltiples tareas. ER 2 se conecta a la API en directo de Gemini, una conexión de streaming bidireccional diseñada para baja latencia, para que el robot no se quede congelado cada vez que tiene que pensar.

También puede llamar herramientas externas durante la tarea, como Google Search, o una función personalizada que escriba un desarrollador. Google mostró una demostración con Spot, el robot de cuatro patas amarillo de Boston Dynamics, buscando una bolsa de palomitas de maíz por solicitud hablada.

Otro truco nuevo: múltiples robots trabajando juntos. Un robot con ruedas y un humanoide ahora pueden compartir una comprensión semántica del trabajo e intercambiar tareas entre ellos. Google mostró esto con el humanoide Apollo 2 de Apptronik y un brazo Franka F3 Duo.

Los números que importan

Capacidad Puntuación ER 2 Qué significa
Clasificación de progreso 57,4% Qué tan bien monitorea el progreso de la tarea en video
Precisión en búsqueda de momentos 91,3% Identificar el fotograma exacto donde ocurre un evento
Sincronización en búsqueda de momentos Error promedio de 0,96s Reacción subsegundo, lo suficientemente rápido para robots reales

¿Quién puede usarlo y cuál es el costo?

Los desarrolladores pueden acceder a ER 2 hoy a través de la API de Gemini y Google AI Studio, con una vista previa privada en la Plataforma de Agentes Empresariales de Gemini. Google no ha publicado precios de robótica por token, así que los aficionados deben esperar tarifas estándar de la API de Gemini más lo que sea que señales con tu hardware. El código de ejemplo está en GitHub.

Esto está dirigido a desarrolladores de robótica y empresas, no a consumidores. No puedes comprar un robot ER 2 en Argos.

¿Y la seguridad?

Google dice que ER 2 es su modelo de robótica más seguro hasta ahora, con mejores puntuaciones en "seguimiento de instrucciones de seguridad" y "proximidad humana", lo que significa que es más cuidadoso al mantener distancia de las personas y rechazar comandos inseguros. Eso es tranquilizador en papel. La verdadera prueba será en hogares, almacenes y hospitales, donde un café derramado es una molestia pero un movimiento de brazo mal calculado no lo es.

Una nota de privacidad en palabras simples: cualquier robot que ejecute este modelo está transmitiendo video y audio a los servidores de Google para pensar. Si estas máquinas terminan en tu cocina algún día, vale la pena recordarlo. Por ahora, es una herramienta para desarrolladores y las cámaras están en laboratorios.

© 2026 AI2Day