Исследователи Apple разработали более умный способ для ИИ понимать трёхмерное пространство

Новый метод под названием RayRoPE помогает моделям искусственного интеллекта определять положение объектов в мире, используя лучи света, а не плоские координаты. Это тихий, но важный шаг на пути к ИИ, который по-настоящему понимает физическое пространство.

AI2Day Newsdesk· 3 min read
A grid of overlapping photographs of the same indoor space shot from multiple angles, with faint geometric ray lines traced from each image converging toward a
Share

Ключевые моменты

  • Apple ML Research опубликовала RayRoPE, новый метод позиционного кодирования для многовидовых моделей ИИ, в 2025 году.
  • RayRoPE позволяет ИИ корректно определить положение любого участка или небольшого фрагмента на наборе фотографий, сделанных с разных углов.
  • Метод работает даже при сложных движениях камеры — свойство, называемое SE(3)-инвариантностью, которого не было в предыдущих методах.
  • RayRoPE использует предсказанную точку вдоль луча света, а не просто направление луча, что даёт ему лучшую геометрическую точность в сравнении с предыдущими подходами.

Представьте, что вы передали кому-то двадцать фотографий одной комнаты, сделанные с разных углов. Человек может мысленно совместить эти снимки и понять комнату в трёх измерениях. Заставить ИИ делать то же самое, надёжно и точно, на удивление сложно. Именно над этой проблемой работает Apple ML Research.

В новой статье команда представляет RayRoPE — метод для того, чтобы сказать модели ИИ точное местоположение каждого небольшого фрагмента изображения в реальном мире. Часть «Rope» относится к ротационному позиционному кодированию (Rotary Position Encoding) — широко используемому приёму для помощи моделям ИИ в понимании порядка и местоположения информации. Часть «Ray» — это новое: вместо использования плоских координат сетки RayRoPE описывает положение фрагмента, используя физический луч света, который прошёл через объектив камеры и запечатлел его.

Почему это важно? Стандартные подходы помечают каждый фрагмент изображения простым адресом, например строка пять, столбец три. Это прекрасно работает для одной фотографии. Но когда у вас есть десятки изображений, снятых с разных позиций и углов, эти плоские адреса перестают работать. Фрагмент в позиции «строка пять, столбец три» на одной фотографии может описывать тот же угол стены, что и «строка два, столбец девять» на другой. Модель запутывается.

RayRoPE решает эту проблему, привязывая каждый фрагмент к точке в реальном трёхмерном пространстве. Это делается путём взятия луча камеры для этого фрагмента и предсказания конкретной точки вдоль луча, а не просто его направления. В результате получается описание положения, которое остаётся согласованным независимо от того, какая камера сделала снимок.

В статье также показано, что все более ранние схемы относительного и абсолютного кодирования терпят неудачу по крайней мере в одном из трёх ключевых тестов: уникальная идентификация каждого фрагмента, обработка движения камеры в любом направлении или вращении и адаптация к реальной геометрии фотографируемой сцены. RayRoPE проходит все три теста.

Для обычных людей результат не очевиден сразу. Это фундаментальное исследование, такое, которое тихо улучшает системы ИИ до того, как они попадут в продукт. Но применение практическое: улучшенная трёхмерная реконструкция сцен для приложений навигации, более точные наложения дополненной реальности и лучшее пространственное понимание для робототехники.

Что это означает для повседневных технологий?

Сегодня ничего не поступает на ваш телефон. Это исследовательская статья, а не объявление о продукте. Но методы, подобные RayRoPE, внедряются в модели ИИ, которые питают приложения камеры, навигацию и функции дополненной реальности. Лучшее пространственное понимание означает меньше ошибок, когда ваш телефон пытается измерить комнату или наложить указания на вид улицы. Улучшение — это то, что вы замечаете только когда всё перестаёт работать неправильно.

© 2026 AI2Day