Роботам нужно чувствовать трение, чтобы по-настоящему понять физический мир

Новый класс моделей под названием VμA ставит физику захвата в центр робототехнического мышления. Вот почему это важно для каждого робота, который что-либо поднимает.

AI2Day Newsdesk· 4 min read
A modern urban street at dusk photographed from street level, showing a sleek electric vehicle with a sensor array on its roof waiting at a glowing crosswalk, s
Share

Ключевые моменты

  • Contactile, компания, разрабатывающая тактильные датчики, предлагает новый класс моделей AI под названием VμA (vision-mu-action), который поставляет роботам данные о трении в реальном времени наряду с видеоданными с камер.
  • Текущие модели робототехнического AI упускают важную физическую величину: коэффициент статического трения (mu), который определяет, проскальзывает ли захватываемый объект или держится.
  • Датчик PapillArray от Contactile вычисляет трение и состояние проскальзывания прямо на датчике без задержки обработки в режиме реального времени.
  • Разрыв между обучением робота в симуляции и реальной производительностью в основном объясняется отсутствием физики трения в тренировочных средах.

Манипулятор робота протягивается в коробку, захватывает мокую бутылку и роняет её. Камера видела бутылку. Суставы ощутили нагрузку. Но ни одна из них не сказала роботу, насколько скользкой была поверхность. Этот единственный недостающий факт — причина того, что захватывающие устройства робота по-прежнему дают сбой при выполнении задач, которые годовалый ребёнок решает без размышлений.

Contactile, австралийская компания-производитель датчиков, утверждает в новом техническом материале, впервые опубликованном The Robot Report, что этот разрыв глубже, чем кто-либо исправил до сих пор. Проблема находится внутри моделей AI, которые роботы используют для рассуждений о мире.

Что такое модель мира и почему ей нужно трение?

Модель мира — это внутреннее представление робота о физической реальности: программное обеспечение, которое предсказывает, что произойдёт дальше, чтобы робот мог планировать. Представьте это как робот, задающий себе вопрос: «Если я сожму немного сильнее, потрескается ли это яйцо?» Хорошая модель мира означает, что робот не должен запоминать каждую задачу. Он может рассуждать о новых.

Но модель мира хороша ровно настолько, насколько хороша информация, с которой она начинает. Сегодняшние модели в основном опираются на два входных сигнала: изображения с камер и положения суставов из собственных моторов робота. Для передвижения в открытом пространстве это приемлемо. Для захвата и манипулирования объектами — нет.

Недостающее число называется коэффициентом статического трения, обозначаемым как mu. Это физическое значение, которое определяет, остаётся ли захватанный объект захватанным. Оно изменяется в зависимости от материала, мокрая ли поверхность, изношенная или покрытая, а также от температуры. Камера не может его увидеть. Токи двигателей не могут его рассчитать точно. Карта давления может сказать вам, что что-то захватывается, но не предскажет, вот-вот ли упадёт захват.

Без mu модель мира робота рассуждает на основе неполной картины реальности. Он может усвоить закономерности из обучающих данных, но не может надёжно перенести эти уроки на новый объект или изменённую поверхность, потому что единственная переменная, которая управляет успехом захвата, просто отсутствует.

Датчик, который измеряет то, что камеры не видят

Модуль Contactile PapillArray Tactile Compute Module — это сенсорный массив размером с кончик пальца, устанавливаемый на захватывающее устройство робота. Каждая маленькая точка сенсирования, называемая таксель, измеряет силу во всех трёх направлениях. Затем датчик вычисляет mu напрямую в режиме реального времени на самом датчике, не отправляя сначала данные на отдельный компьютер.

Выходные данные включают полную трёхмерную силу в каждом такселе, общую силу и крутящий момент по всей контактной поверхности, текущее значение трения, проскальзывает ли каждая точка или держится, и минимальную силу захвата, необходимую для предотвращения падения. Это основано на контактной физике, а не на выученных предположениях.

Contactile предлагает назвать модели, использующие этот полный набор сигналов, VμA: vision-mu-action. Более ранние поколения моделей получали собственные названия, когда новый входной сигнал становился достаточно важным. Модели Vision-language-action (VLA) добавили естественный язык к робототехническому обучению. Модели Vision-force-action (VFA) добавили силу. VμA добавляет реальную физику трения, которой не было ни в одном предыдущем подходе.

На этапе обучения данные VμA обогащают наборы данных причинно-следственными физическими сигналами, а не статистическими прокси. На этапе развёртывания робот, оснащённый PapillArray, знает значение трения того, что он держит прямо сейчас, и может мгновенно адаптировать свой захват, если условия изменятся. Никаких предположений. Никаких обходных путей с доменной рандомизацией.

Для отраслей, где роботы обрабатывают мокрые продукты, упакованные материалы или переменные материалы, правильное понимание физики захвата — это не научное любопытство. Это разница между работающим производственным конвейером и тем, который требует постоянного человеческого вмешательства.

© 2026 AI2Day