Скрытая проблема с рабочей силой в буме гуманоидных роботов
Миллиарды в финансировании тихо направляются на оплату труда людей, управляющих роботами дистанционно. Один исследователь утверждает, что это не ступень к машинному интеллекту, а ловушка.

Ключевые моменты
- Компании, производящие гуманоидных роботов, привлекли миллиарды долларов за последние 18 месяцев, большая часть которых финансирует крупномасштабные программы дистанционного управления операторами.
- Наборы данных телеоперации, где люди записывают себя, выполняющих задачи, чтобы обучить роботов, более чем в 100 000 раз меньше, чем наборы данных, используемые для обучения современных языковых моделей.
- Рабочие в Китае, Индии, Европе и США нанимаются для съемки домашних дел и дистанционного управления роботами, формируя коммерческую отрасль по поставке данных.
- Никита Рудин, соучредитель и генеральный директор стартапа робототехники Flexion, утверждает, что обучение с подкреплением в симуляции — единственный подход, который может разорвать зависимость от данных, демонстрируемых человеком.
- Flexion привлекла 50 миллионов долларов финансирования от DST Global и NVentures для создания того, что Рудин называет универсальным «мозгом» для гуманоидных роботов.
Аргумент в пользу гуманоидных роботов всегда был простым: люди не смогут заполнить определенные должности в будущем, поэтому их место займут роботы. Но резкая статья мнения, опубликованная на этой неделе The Robot Report, поднимает неудобный вопрос. А что если самим роботам нужна постоянная поддержка человеческих работников, чтобы функционировать?
Проблема в телеоперации. Это когда оператор-человек, часто находящийся далеко, управляет роботом через устройство дистанционного управления, как если бы вы управляли игрушечной машинкой с пультом. Каждое движение записывается. Затем робот изучает эту запись и пытается ее повторить.
Обучение робота таким способом кажется разумным. Проблема, согласно Никите Рудину, который защитил докторскую диссертацию в лаборатории робототехники ETH Zurich и работал над инструментами симуляции роботов в Nvidia, заключается в том, что это плохо масштабируется.
Полка движется. Дверная ручка немного отличается. На заводском полу появляется новая форма коробки. Каждое крошечное изменение означает, что кто-то должен снять задачу с нуля. Реальный мир никогда не перестает меняться, и человеческой рабочей силе, генерирующей демонстрации, никогда не удается его догнать.
Качество этих данных также ненадежно. Операторы, управляющие роботом удаленно, не могут ощутить, что касается робот, и не могут точно оценить расстояние, поэтому они движутся медленно и чрезмерно корректируют. Затем робот учится на записи кого-то, борющегося с контроллером, и борьба — это именно то, что он практикует.
Помогут ли больше операторов-людей решить эту проблему?
Нет, и это суть аргумента Рудина. Он проводит резкое сравнение с ранними днями больших языковых моделей, технологии искусственного интеллекта, лежащей в основе чатботов, таких как ChatGPT. Эти ранние модели были обучены на огромных объемах текста и могли примерно копировать стиль Шекспира, но не могли на самом деле рассуждать. Настоящий прорыв произошел благодаря обучению с подкреплением — методу обучения, при котором программное обеспечение учится путем попыток, неудач, корректировок и повторных попыток в миллионах попыток без указания человека на каждом шаге.
Рудин утверждает, что гуманоидная робототехника застряла на этом более раннем этапе, только имитирующем. Больше данных телеоперации просто означает больше имитации при огромных затратах.
Альтернатива, которую он описывает, — это обучение с подкреплением в компьютерных симуляциях. Программное обеспечение робота может терпеть неудачу миллионы раз в виртуальном мире, мгновенно перезагружаться и пробовать снова, работая параллельно на множестве компьютеров одновременно. Больше вычислительной мощности напрямую означает более быстрый прогресс. Это совсем другое уравнение, чем найм большего количества рабочих в странах с более низкой заработной платой для съемки себя, занимающихся стиркой.
Для людей, выполняющих эту работу телеоперации сегодня, и для инвесторов, финансирующих эти компании, вызов Рудина прямолинеен: если подлинная цель — автономность робота, данные должны показывать, что участие человека с течением времени уменьшается. Если оно не уменьшается, телеоперация перестала быть мостом и тихо стала постоянным методом.



