Investigadores de Apple Construyen una Forma Más Inteligente para que la IA Entienda el Espacio 3D

Una nueva técnica llamada RayRoPE ayuda a los modelos de IA a determinar dónde están las cosas en el mundo usando rayos de luz, no solo coordenadas planas. Es un paso discreto pero significativo hacia una IA que realmente entienda el espacio físico.

AI2Day Newsdesk· 3 min read
A grid of overlapping photographs of the same indoor space shot from multiple angles, with faint geometric ray lines traced from each image converging toward a
Share

Puntos clave

  • Apple ML Research publicó RayRoPE, un nuevo método de codificación de posición para modelos de IA multivista, en 2025.
  • RayRoPE permite que una IA identifique correctamente la posición de cualquier parche, o pequeño mosaico, en un conjunto de fotos tomadas desde diferentes ángulos.
  • La técnica funciona incluso cuando la cámara se mueve de formas complejas, una propiedad llamada invariancia SE(3) que métodos anteriores no tenían.
  • RayRoPE utiliza un punto predicho a lo largo de un rayo de luz en lugar de solo la dirección del rayo, dándole una precisión geométrica mayor que enfoques previos.

Imagina entregarle a alguien veinte fotografías de la misma habitación tomadas desde diferentes rincones. Una persona puede mentalmente unir esas fotos y entender la habitación en tres dimensiones. Lograr que una IA haga lo mismo, de manera confiable y precisa, es sorprendentemente difícil. Ese es el problema en el que está trabajando Apple ML Research.

El nuevo artículo del equipo presenta RayRoPE, un método para decirle a un modelo de IA exactamente dónde se sitúa cada pequeño mosaico de una imagen en el mundo real. La parte "Rope" se refiere a Rotary Position Encoding, un truco ampliamente utilizado para ayudar a los modelos de IA a entender el orden y la ubicación de la información. La parte "Ray" es nueva: en lugar de usar coordenadas de cuadrícula planas, RayRoPE describe la posición de un parche usando el rayo físico de luz que pasó a través de la lente de la cámara para capturarlo.

¿Por qué importa eso? Los enfoques estándar marcan cada mosaico de imagen con una dirección simple, como fila cinco, columna tres. Eso funciona bien para una sola foto. Pero cuando tienes docenas de imágenes tomadas desde posiciones y ángulos diferentes, esas direcciones planas se desmoronan. Un mosaico en "fila cinco, columna tres" en una foto podría describir la misma esquina de pared que "fila dos, columna nueve" en otra. El modelo se confunde.

RayRoPE resuelve esto anclando cada mosaico a un punto en el espacio tridimensional real. Lo hace tomando el rayo de cámara para ese mosaico y prediciendo un punto específico a lo largo del rayo, no solo su dirección. El resultado es una descripción de posición que permanece consistente sin importar qué cámara tomó la foto.

El artículo también muestra que los esquemas anteriores de codificación relativa y absoluta fallan en al menos una de tres pruebas clave: identificar únicamente cada parche, manejar movimiento de cámara en cualquier dirección o rotación, y adaptarse a la geometría real de la escena que se está fotografiando. RayRoPE supera todas tres.

Para las personas ordinarias, la recompensa no es inmediata. Esta es investigación fundamental, el tipo que mejora silenciosamente los sistemas de IA antes de que lleguen a un producto. Pero las aplicaciones son concretas: mejor reconstrucción de escenas 3D para aplicaciones de mapas, superposiciones de realidad aumentada más precisas, y comprensión espacial más nítida para robótica.

¿Qué significa esto para la tecnología cotidiana?

Nada llega a tu teléfono hoy. Este es un artículo de investigación, no un anuncio de producto. Pero técnicas como RayRoPE se integran en los modelos de IA que alimentan aplicaciones de cámara, navegación y características de AR. Una mejor comprensión espacial significa menos errores cuando tu teléfono intenta medir una habitación o superponer direcciones en una vista de calle. La mejora es el tipo que solo notas cuando las cosas dejan de funcionar mal.

© 2026 AI2Day