Дослідники Apple розробили розумніший спосіб для AI розуміти тривимірний простір
Новий метод під назвою RayRoPE допомагає моделям AI визначити, де знаходяться предмети у світі, використовуючи промені світла замість простих плоских координат. Це тиха, але змістовна крок у напрямку AI, який справді розуміє фізичний простір.

Ключові моменти
- Apple ML Research опублікувала RayRoPE, новий метод позиційного кодування для багатовиглядових моделей AI, у 2025 році.
- RayRoPE дозволяє AI правильно визначити позицію будь-якої плитки, або малого фрагмента, на наборі фотографій, зроблених під різними кутами.
- Метод працює навіть при складних рухах камери, властивість, яка називається SE(3)-інваріантністю, якої не було в попередніх методах.
- RayRoPE використовує передбачену точку вздовж променю світла замість просто напрямку променя, даючи їй кращу геометричну точність ніж попередні підходи.
Уявіть, що ви вручаєте комусь двадцять фотографій однієї кімнати, зроблених з різних куточків. Людина може подумки змонтувати ці зображення разом і зрозуміти кімнату в трьох вимірах. Зробити те ж саме з AI, надійно та точно, несподівано складно. Саме над цією проблемою працює Apple ML Research.
Нова стаття команди представляє RayRoPE, метод для повідомлення моделі AI про те, де точно розташовується кожна мала плитка зображення в реальному світі. Частина "Rope" стосується Rotary Position Encoding, широко використовуваного прийому, який допомагає моделям AI розуміти порядок та місцезнаходження інформації. Частина "Ray" нова: замість використання плоских координат сітки, RayRoPE описує позицію плитки, використовуючи фізичний промінь світла, який пройшов через об'єктив камери, щоб захопити її.
Чому це важливо? Стандартні підходи позначають кожну плитку зображення простою адресою, як рядок п'ять, стовпець три. Це добре працює для однієї фотографії. Але коли у вас є десятки зображень, зроблених з різних позицій та кутів, ці плоскі адреси розпадаються. Плитка на "рядку п'ять, стовпець три" на одній фотографії може описувати той же кут стіни, що й "рядок два, стовпець дев'ять" на іншій. Модель розгублюється.
RayRoPE вирішує це, прив'язуючи кожну плитку до точки в реальному тривимірному просторі. Це робиться шляхом прийняття променя камери для цієї плитки та передбачення конкретної точки вздовж променя, а не просто його напрямку. Результат — опис позиції, який залишається послідовним незалежно від того, яка камера зробила знімок.
У статті також показано, що всі попередні схеми відносного та абсолютного кодування не проходять принаймні один з трьох ключових тестів: унікальне виявлення кожної плитки, обробка руху камери у будь-якому напрямку або обертання, та адаптація до фактичної геометрії сцени, що фотографується. RayRoPE проходить усі три.
Для звичайних людей результат не є миттєвим. Це фундаментальне дослідження, того виду, що тихо покращує системи AI перед тим, як вони дійдуть до продукту. Але застосування конкретні: кращша тривимірна реконструкція сцени для додатків карт, точніші оверлеї доповненої реальності та гостріше просторове розуміння для робототехніки.
Що це означає для повсякденних технологій?
Сьогодні ніщо не потрапляє на ваш телефон. Це науковий документ, а не оголошення про продукт. Але методи, подібні до RayRoPE, живлять моделі AI, які керують додатками камери, навігацією та функціями AR. Краще розуміння простору означає менше помилок, коли ваш телефон намагається виміряти кімнату або накласти маршрут на вид вулиці. Покращення — це того роду, яке ви помічаєте лише тоді, коли речі перестають йти невірно.


