Este Robot Vio un Video Corto y Descubrió el Resto por Sí Solo

La startup de Cambridge Generalist AI ha construido brazos robóticos que aprenden nuevas tareas físicas a partir de un único clip de video, sin necesidad de entrenamiento específico para cada tarea. Los resultados son imperfectos pero sorprendentes.

AI2Day NewsdeskAsistido por IAPublicado Updated Editor: Lee Brown4 min read
A sleek white and silver wheeled robot with a humanoid upper torso and articulated five-fingered hands stands in a bright modern warehouse, rows of shelving vis
Ilustración creada con IA. No es una fotografía de los hechos descritos.
Share

Puntos clave

  • Generalist AI, una startup de Cambridge, Massachusetts, ha construido brazos robóticos que pueden aprender una nueva tarea física después de ver un clip de video corto.
  • Los robots actualmente completan tareas con éxito aproximadamente el 59 por ciento de las veces, muy por debajo del umbral del 99 por ciento que la empresa dice que necesita para el uso en el mundo real.
  • Los tres cofundadores trabajaron anteriormente en Google DeepMind o Boston Dynamics.
  • Generalist construyó su modelo de IA completamente desde cero en lugar de adaptar un sistema de código abierto existente.
  • Un robótico de Georgia Tech que revisó el trabajo llamó a Generalist "lo más cercano a algo implementable" entre los competidores que buscan robots de propósito general.

Los brazos robóticos que adquieren nuevas habilidades sobre la marcha, sin meses de entrenamiento especializado, han sido uno de los problemas más difíciles en el aprendizaje automático. Recientemente, AI2Day tuvo la oportunidad de observar de primera mano una startup que afirma estar más cerca de resolverlo que casi cualquier otro.

Generalist AI, con sede en Cambridge, Massachusetts, mostró a un reportero sus brazos robóticos realizando tareas en las que nunca habían sido entrenados explícitamente: apilar tazas, clasificar bloques en cuencos. Las máquinas aprendieron a partir de un video instructivo corto en lugar de miles de repeticiones de práctica.

¿Qué hicieron realmente los robots?

Las demostraciones fueron concretas y, en algunos momentos, genuinamente sorprendentes. Se le pidió a un brazo que barriera un bloque hacia un cuenco usando una pala y un cepillo. Cuando el cepillo desapareció, utilizó la pala como cepillo en su lugar, lanzando el bloque al cuenco. Nadie programó esa solución improvisada.

Un robot de dos brazos vio un clip corto de alguien descifrando una cartera y sacando billetes. Luego descifrió una cartera de estilo diferente y sacó los billetes. Cuando su pinza derecha no pudo agarrar bien, cambió a la izquierda en un ángulo nuevo. Un ingeniero que lo observaba dijo que el robot nunca había hecho eso antes.

En una sesión de madrugada grabada en video, un ingeniero dejó tazas sobre una mesa frente a un robot de dos brazos solo para ver qué sucedería. El robot comenzó a apilarlas junto al ingeniero, terminando la pila ordenadamente por su cuenta.

El cofundador y CEO Pete Florence comparó el momento con GPT-3, el modelo de lenguaje grande (un sistema de IA generadora de texto) que OpenAI publicó en 2020. Ese modelo podía intentar tareas que nunca había visto simplemente leyendo una descripción. Generalist está intentando algo similar en el mundo físico.

¿Cómo funciona el entrenamiento?

Generalist recopila datos de movimiento a escala utilizando guantes personalizados que se asemejan a pinzas robóticas y llevan pequeñas cámaras. Trabajadores en México y otros lugares usan los guantes para realizar tareas físicas cotidianas, registrando exactamente cómo se mueve una mano humana a través de una tarea. La empresa ha construido su modelo de IA desde cero sobre esa biblioteca de datos, sin adaptar ningún sistema de código abierto existente.

La robótica de Stanford Karen Liu expresa la lógica claramente: recopilar datos de interacción física amplia sin vincularlo a un cuerpo robótico específico le da al modelo una comprensión más general de cómo se comportan los objetos. "Sus resultados más sólidos sugieren que esta apuesta puede estar funcionando", le dijo a AI2Day.

Esa elección de diseño también aborda un modo de falla que reportamos el 12 de agosto en "El Problema de Datos Sucios Que Está Frenando la Próxima Ola de Robots de IA": los datos deficientes y recopilados de manera estrecha, no los algoritmos débiles, son típicamente lo que mata la IA física antes de que llegue al mundo real.

Métrica Detalle
Tasa de éxito actual de tareas ~59% en promedio
Tasa de éxito objetivo 99%+
Método de entrenamiento Clip de video único, sin ejemplos específicos de tareas
Herramienta de recopilación de datos Guantes de pinza equipados con cámaras
Antecedentes del equipo fundador Google DeepMind, Boston Dynamics

¿Deberían importarle a las personas ordinarias todavía?

No inmediatamente, pero la dirección importa. Una tasa de éxito del 59 por ciento significa que el robot falla casi la mitad de las veces, lo que descarta una línea de ensamblaje o una sala de suministros de hospital. Generalist dice que lo sabe.

La imagen a más largo plazo es diferente. Un robot que aprende una nueva tarea a partir de un único video en lugar de semanas de programación hace que la implementación en manufactura o almacenería sea dramáticamente más económica. Eso eventualmente afectará empleos construidos alrededor de manipulación o clasificación física repetitiva.

Danfei Xu, un robótico de Georgia Tech que sigue la empresa de cerca, dice que Generalist ha "llevado esto al extremo" de una manera que pocos rivales han hecho, y la llamó el equipo más cercano a un producto genuinamente implementable. La lectura honesta: la ciencia es creíble, la brecha entre el 59 por ciento y el 99 por ciento es enorme, y cerrarla requerirá años de trabajo arduo que ningún video de demostración puede acelerar.

© 2026 AI2Day