Проблема некачественных данных, замораживающая следующую волну роботов на основе ИИ
Новый опрос более 700 инженеров в области ИИ показывает, что плохие данные, а не слабые алгоритмы, являются основной причиной отказа физических систем ИИ до их выхода в реальный мир.

Ключевые моменты
- Опрос 2026 года более чем 700 специалистов в области ИИ, о котором сообщает IEEE Spectrum AI, показывает, что проблемы качества данных вызывают большинство сбоев в системах физического ИИ.
- 78% команд уже видят измеримые результаты от визуального и физического ИИ, однако 74% считают, что область получает значительно меньше инвестиций, чем она заслуживает.
- Команды, которые успешно выпускают продукты с физическим ИИ, тратят почти в три раза больше времени на подготовку и обработку данных, чем команды, чьи проекты застопорились.
- 92% специалистов согласны с тем, куда движется область дальше, что указывает на сильный консенсус относительно того, что потребуется физическому ИИ.
В течение последних десяти лет самые крупные прорывы в области ИИ, большие языковые модели, технология, лежащая в основе чатботов типа ChatGPT, генераторы изображений, голосовые помощники, все были построены на текстах. На словах, предложениях и абзацах, собранных из интернета.
Теперь граница сместилась в физический мир.
Системы, которые управляют автомобилями, направляют роботизированные манипуляторы на фабриках или управляют доставочными дронами, не читают предложения. Они анализируют видеопотоки, сканы LiDAR (трёхмерные карты окружающего пространства на основе лазеров) и потоки данных датчиков, поступающие тысячи раз в секунду. Создание ИИ, который понимает и действует в физическом пространстве, по-настоящему сложнее, чем обучение его написанию письма.
Так что же на самом деле идёт не так?
Проблемы с данными вызывают большинство отказов, а не слабые модели ИИ. Опрос 2026 года более чем 700 специалистов, проведённый с поддержкой Voxel51 и освещённый IEEE Spectrum AI, показал, что команды собирают огромные объёмы видео и данных датчиков, но с трудом превращают этот сырой материал во что-то полезное.
Наиболее очевидным узким местом является аннотирование: медленный и дорогостоящий процесс разметки содержимого каждого кадра видео, чтобы ИИ мог учиться на нём. Команды часто размечают всё, что они собирают, а затем выбрасывают большую часть до того, как система когда-либо будет выпущена. Такие впустую потраченные усилия истощают бюджеты и замедляют сроки.
Что отличает команды, которые выпускают продукты, от команд, которые застопорились?
Время, потраченное на работу с данными, а не лучшие алгоритмы. Успешные команды инвестируют почти в три раза больше времени в обработку, очистку и отбор своих обучающих данных по сравнению с командами, чьи проекты никогда не доходят до производства.
Это поразительный вывод. Инстинкт в разработке ИИ часто состоит в том, чтобы стремиться к более крупной модели или более новой архитектуре. Этот опрос говорит, что более умная тактика — жестко отбирать данные, которые вы подаёте модели с самого начала.
| Вывод | Данные |
|---|---|
| Команды, видящие измеримую ценность от физического ИИ | 78% |
| Команды, считающие область недоинвестированной | 74% |
| Преимущество работы с данными для успешных команд | ~в 3 раза больше времени |
| Специалисты, согласные с направлением развития области | 92% |
Что это означает для обычных людей?
Физический ИИ уже окружает нас: складские роботы, сортирующие посылки, больничные роботы, доставляющие расходные материалы, программное обеспечение для автономного вождения в новых автомобилях. Опрос показывает, что эти системы будут продолжать появляться, но медленно и неравномерно, потому что их качественное создание — это неприметная, трудоёмкая работа.
74% тех, кто верит, что область недоинвестирована, вполне могут быть правы. Если больше ресурсов будет направлено в инфраструктуру данных, а не в громкие запуски моделей, продукты физического ИИ, доходящие до потребителей, могут стать значительно более надёжными.
На данный момент сообщение от людей, строящих эти системы, ясно: алгоритм редко является проблемой. Проблема в данных.



