NVIDIA Cosmos 3 Edge: Los Cerebros de Robots Llegan a la Realidad

Un nuevo modelo de IA compacto permite que robots y cámaras de fábrica piensen por sí solos, sin necesidad de un centro de datos cercano.

AI2Day Newsdesk· 3 min read
Photoreal news-editorial style, 16:9 framing, full-frame edge-to-edge composition
Share

Puntos clave

  • NVIDIA lanzó Cosmos 3 Edge en 2025, un modelo de mundo de IA con 4 mil millones de parámetros diseñado para ejecutarse en dispositivos periféricos pequeños en lugar de grandes servidores de centros de datos.
  • El modelo ocupa el primer lugar entre modelos de tamaño similar en VANTAGE-Bench, una prueba de referencia para tareas de IA basadas en visión en edificios inteligentes y robótica.
  • Al ejecutarse en hardware NVIDIA Jetson Thor, el modelo procesa 32 acciones de robot predichas por ciclo de inferencia a 15 fotogramas por segundo, lo suficientemente rápido para control en tiempo real.
  • NVIDIA también lanzó un modelo de política complementario entrenado en el conjunto de datos DROID, una colección disponible públicamente de grabaciones de manipulación de robots, para tareas de recoger y colocar.

Imagina un brazo robótico en una sala de suministros de un hospital. Necesita detectar una caja, extender la mano hacia ella, predecir qué sucede cuando sus dedos entran en contacto y ajustarse si algo se mueve. Hasta hace poco, hacer todo eso a la vez requería una conexión a un servidor potente a kilómetros de distancia. NVIDIA quiere cambiar eso.

El martes, NVIDIA publicó Cosmos 3 Edge en Hugging Face, el repositorio de IA de código abierto donde los investigadores comparten modelos gratuitamente. El modelo es lo suficientemente compacto como para ejecutarse directamente en el dispositivo que realiza el trabajo, ya sea un robot de almacén, una cámara de fábrica o un vehículo autónomo.

La frase clave aquí es "modelo de mundo". Un modelo de mundo, en términos generales, es software de IA que aprende cómo cambia una escena con el tiempo. No solo reconoce objetos. Predice cómo se moverán, qué acción causará, y qué movimiento hacer a continuación. Piénsalo como dar a una máquina una imagen mental aproximada de causa y efecto.

Cosmos 3 Edge hace esto con 4 mil millones de parámetros, donde un parámetro es un único número ajustable dentro del modelo que forma la manera en que piensa. Suena grande, pero los principales modelos de IA utilizados para chatbots llevan cientos de miles de millones. Con 4 mil millones, el modelo cabe en dispositivos periféricos, las pequeñas computadoras integradas en máquinas en pisos de fábricas y pasillos de hospitales, en lugar de estar en un centro de datos en la nube.

¿Cómo controla realmente un robot?

El modelo predice qué hacer y muestra lo que debería suceder a continuación en el mismo paso. Dale una imagen de una mesa con un plátano y la instrucción "recoge el plátano y ponlo en el plato", y genera tanto los movimientos físicos para el brazo del robot como una simulación visual de cómo debería verse la escena una vez que ocurran esos movimientos.

NVIDIA construyó el modelo con dos sistemas de procesamiento vinculados que funcionan a partir de una comprensión compartida de la escena. Un sistema maneja el razonamiento del lenguaje y visual. El otro maneja la predicción y generación de acciones. Comparten una capa de atención común, la parte del modelo que decide qué información es más importante en cualquier momento, para que ambos lados permanezcan sincronizados.

Las acciones de máquinas muy diferentes, una pinza de robot, una cámara en una carretilla elevadora, un sistema de dirección de vehículo, todas se traducen al mismo formato matemático compacto. Eso significa que un modelo puede servir potencialmente a varios tipos diferentes de máquinas con mínimo reentrenamiento.

Para los desarrolladores, NVIDIA está lanzando scripts de entrenamiento y una versión lista para usar ajustada para tareas de robots de recoger y colocar. Los equipos pueden adaptar el modelo base utilizando un pequeño grupo de GPU de gama alta, los chips especializados que realizan el trabajo numérico intensivo que requiere la IA, antes de implementarlo en hardware periférico más económico en el campo.

NVIDIA también lanzó una versión más rápida de un modelo complementario más grande que reduce el número de pasos de procesamiento interno de hasta 50 a solo 4, generando generación de imágenes y videos hasta 25 veces más rápida.

Cosmos 3 Edge está disponible ahora como descarga gratuita desde Hugging Face.

© 2026 AI2Day