El nuevo cerebro robótico de Google puede observar, planificar y trabajar en equipo con otros robots

Gemini Robotics ER 2 dota a las máquinas de un pensador de nivel superior más inteligente que sigue el progreso en video y delega los movimientos reales a un controlador de nivel inferior.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
A large, brightly lit modern factory floor filled with orange industrial robotic arms in motion, assembling metal components on a conveyor line, overhead fluore
Share

Puntos clave

  • Google DeepMind lanzó Gemini Robotics ER 2, un nuevo modelo de 'razonamiento encarnado' que actúa como cerebro de alto nivel para robots.
  • El modelo obtiene un 57,4% en clasificación de progreso y 91,3% en búsqueda de momentos, identificando el fotograma exacto de video cuando se completa un paso de la tarea.
  • Admite colaboración entre múltiples robots, permitiendo que un robot con ruedas y un humanoide compartan una tarea mediante comprensión común.
  • Los desarrolladores pueden probarlo ahora a través de la API de Gemini y Google AI Studio, con una vista previa privada en la Plataforma Gemini Enterprise Agent.
  • Una demostración empareja el modelo con el robot Spot de Boston Dynamics para recuperar objetos por comando de voz.

Google DeepMind ha lanzado un nuevo modelo que pretende ser la parte pensante del cerebro de un robot. Se llama Gemini Robotics ER 2, donde ER significa 'razonamiento encarnado': el modelo comprende el mundo físico que lo rodea, no solo una imagen plana del mismo.

La configuración es bastante simple. El modelo observa a través de la cámara del robot, recibe tus instrucciones, determina qué hacer a continuación y luego le dice a un controlador de nivel inferior separado cómo mover físicamente los brazos y las ruedas. Ese controlador de nivel inferior se llama modelo visión-lenguaje-acción, o VLA: software que convierte un plan en movimientos motores específicos. Piensa en ER 2 como el gestor y en el VLA como las manos.

¿Qué puede hacer realmente?

Observa video continuo, sigue cómo progresa un trabajo y cambia al siguiente paso en el momento adecuado. Este es el cambio principal respecto a la versión anterior, ER 1.6.

Digamos que un robot está vertiendo café. Se supone que ER 2 ve el fotograma exacto donde la taza está llena y le dice al brazo que se detenga. Las propias pruebas de Google la sitúan con una precisión del 91,3% en esta habilidad de 'búsqueda de momentos', con un error de tiempo promedio de 0,96 segundos. También maneja el seguimiento del progreso de tareas, clasificando cada fotograma de video en uno de cinco niveles del 0% completado al 100% completado. Esto le da al robot una idea de si está casi terminado o si ha cometido un error silencioso y necesita reintentar.

¿En qué se diferencia esto de otra IA robótica?

La velocidad importa aquí. ER 2 se conecta a la API Gemini Live, una conexión de transmisión bidireccional construida para baja latencia, por lo que el robot no se congela cada vez que tiene que pensar. También puede llamar a herramientas externas durante la tarea: Google Search o una función personalizada que escriba un desarrollador. Google mostró una demostración con Spot, el robot de cuatro patas de Boston Dynamics, recuperando una bolsa de palomitas en una solicitud hablada. Cubrimos por primera vez las integraciones de IA de Spot en 13 de julio de 2026.

Otro truco nuevo es que múltiples robots trabajen juntos. Un robot con ruedas y un humanoide pueden compartir una comprensión semántica del trabajo e intercambiar tareas entre sí. Google mostró esto con Apollo 2, el humanoide de Apptronik, y un brazo Franka F3 Duo.

Los números que importan

Capacidad Puntuación ER 2 Qué significa
Clasificación de progreso 57,4% Cómo de bien sigue el progreso de tareas en video
Precisión de búsqueda de momentos 91,3% Identificar el fotograma exacto cuando ocurre un evento
Tiempo de búsqueda de momentos Error promedio de 0,96s Reacción subsegundo, lo suficientemente rápido para robots reales

¿Quién puede usarlo y cuál es el costo?

Los desarrolladores pueden acceder a ER 2 hoy a través de la API de Gemini y Google AI Studio, con una vista previa privada en la Plataforma Gemini Enterprise Agent. Google no ha publicado precios de robótica por token, por lo que los aficionados deben esperar tarifas estándar de API de Gemini además de cualquier hardware que apuntes a él. El código de ejemplo está en GitHub.

Esto está dirigido a desarrolladores y empresas de robótica, no a consumidores. No puedes comprar un robot ER 2 en Argos.

¿Deberías preocuparte por la privacidad?

Google dice que ER 2 es su modelo de robótica más seguro hasta ahora, con mejores puntuaciones en seguimiento de instrucciones de seguridad y proximidad humana, lo que significa que es más cuidadoso al mantenerse alejado de las personas y al rechazar comandos inseguros. Tranquilizador sobre el papel. La prueba real está en almacenes y hospitales, donde un movimiento de brazo mal calculado es una cuestión diferente que una bebida derramada.

Una cosa que vale la pena saber en términos claros: cualquier robot que ejecute este modelo transmite video y audio a los servidores de Google para pensar. Si estas máquinas terminan en tu cocina algún día, vale la pena tenerlo en cuenta. Por ahora las cámaras están en laboratorios, y es allí donde se quedan.

© 2026 AI2Day