Почему системы компьютерного зрения пропускают то, что находится прямо перед ними
Apple ML Research представила новый инструмент, который выявляет скрытые закономерности ошибок в системах распознавания объектов, и эти результаты важны для всех, кто полагается на ИИ при обнаружении объектов в реальном мире.

Ключевые моменты
- Apple ML Research опубликовала новый метод GH-ESD для выявления систематических слепых пятен в системах компьютерного зрения с искусственным интеллектом.
- Существующие инструменты ИИ для работы со зрением дают сбои так, как существующие тесты не могут надежно отловить, особенно в задачах распознавания объектов и сегментации изображений.
- GH-ESD направлена на выявление «срезов ошибок» — конкретных групп изображений, на которых ИИ систематически работает хуже, а не просто на случайные единичные ошибки.
- Обнаруженные сбои часто связаны с пространственными взаимосвязями и визуальным контекстом, а не только с тем, как объект выглядит в изоляции.
Когда система компьютерного зрения с искусственным интеллектом, которая идентифицирует объекты на фотографиях или видео, допускает ошибку, это редко бывает случайностью. Часто одна и та же система дает сбой на одних и тех же типах изображений, снова и снова, без чьего-либо внимания. Исследователи называют эти повторяющиеся закономерности сбоев «срезами ошибок».
Apple ML Research опубликовала новый подход под названием GH-ESD (Grounded Hypothesis-Driven Error Slice Discovery), разработанный для автоматического обнаружения этих срезов.
Почему это важно для обычных людей?
Системы компьютерного зрения уже принимают реальные решения. Они анализируют медицинские снимки, отмечают элементы на конвейерных линиях и обеспечивают работу камер беспилотных автомобилей. Систематическое слепое пятно в любом из этих инструментов — это не просто досадное недоразумение.
Если система постоянно пропускает пешеходов при слабом контрастном освещении или не замечает дефект, когда он находится рядом с определенным фоном, то такая закономерность — это проблема. Один неправильный ответ выглядит как невезение. Сотня неправильных ответов в одной и той же ситуации выглядит как конструктивный недостаток.
Что было не так в предыдущих методах?
Предыдущие инструменты для выявления срезов ошибок хорошо работали для простой классификации изображений, определения того, есть ли на фотографии кошка или собака. Они рассматривали сбои как кластеры похожих на вид изображений или как комбинации предустановленных ярлыков.
Такой подход не работает для более сложных задач: распознавания объектов, где система должна обвести рамкой каждый объект на сцене, и сегментации, где она должна обвести точный контур каждого объекта. В этих задачах место расположения объекта в кадре и его окружение определяют, правильно ли ИИ его обработает. Более простой кластерный метод не может это уловить.
Что именно делает GH-ESD?
Метод генерирует конкретные, понятные гипотезы о том, почему могут происходить сбои, а затем проверяет каждую из них на реальных данных, чтобы увидеть, какие закономерности подтверждаются. Подумайте об этом как о структурированном процессе отладки: вместо того чтобы гадать, он предлагает «система может испытывать затруднения, когда небольшой объект частично скрыт другим объектом», а затем проверяет, является ли это действительно правдой.
Поскольку она работает на уровне отдельных экземпляров, а не целых изображений, она может выявить сбои, связанные с пространственным контекстом и взаимосвязями между объектами на сцене.
Что дальше?
GH-ESD — это пока что исследовательский метод, а не готовый продукт. Его непосредственной аудиторией являются инженеры, которые создают и проверяют системы компьютерного зрения. Однако инструменты, которые разрабатывают исследователи сегодня, как правило, формируют стандарты безопасности, которые появляются в развернутых продуктах в течение нескольких лет.
Для всех, чья работа или безопасность зависит от системы компьютерного зрения с искусственным интеллектом, ключевой вывод прост: узнайте, какое систематическое тестирование было проведено. Разовые показатели точности могут скрывать повторяющиеся сбои, которые проявляются только в определенных условиях реального мира.
Часто задаваемые вопросы
Что такое срез ошибки?
Срез ошибки — это конкретная группа изображений или ситуаций, в которых система ИИ последовательно дает неправильный ответ, не просто случайно, а как закономерность, связанная с чем-то общим для этих случаев.
Влияет ли это на инструменты ИИ, которые я использую сегодня?
Косвенно да. Большинство инструментов ИИ для компьютерного зрения, используемых сегодня, были протестированы методами, которые могут не выявить эти зависящие от контекста сбои. Это исследование направлено на развитие лучших стандартов аудита.
Доступна ли GH-ESD для использования?
Это опубликованный исследовательский метод от Apple ML Research, предназначенный для других исследователей и инженеров, на основе которого они могут развивать свои работы, а не потребительский инструмент, который вы можете скачать сегодня.



