Чому системи штучного інтелекту для зору пропускають те, що знаходиться прямо перед ними

Apple ML Research розробила новий інструмент, який виявляє приховані закономірності помилок штучного інтелекту при детекції об'єктів, і її висновки важливі для кожного, хто покладається на штучний інтелект для розпізнавання предметів у реальному світі.

AI2Day Newsdesk3 min read
A timeline of cybersecurity evolution over 20 years, featuring AI and cloud icons
Share

Ключові моменти

  • Apple ML Research опублікувала новий метод GH-ESD для виявлення систематичних сліпих плям у системах штучного інтелекту для зору.
  • Сучасні інструменти штучного інтелекту для зору дають помилки так, як не можуть надійно виявити існуючі тести, особливо в завданнях детекції об'єктів та сегментації зображень.
  • GH-ESD спрямована на «ломиння помилок» — конкретні групи зображень, де штучний інтелект постійно показує гірші результати, а не випадкові одиничні помилки.
  • Виявлені помилки часто пов'язані з просторовими відносинами та візуальним контекстом, а не лише з тим, як виглядає об'єкт окремо.

Коли система штучного інтелекту для зору — програмне забезпечення, яке розпізнає об'єкти на фотографіях або відео — допускає помилку, це рідко буває випадковою випадковістю. Часто та ж система дає помилку на зображеннях того ж типу, раз за разом, без того щоб це хтось помітив. Дослідники називають ці повторювані закономірності помилок «ломиння помилок».

Apple ML Research опублікувала новий підхід, названий GH-ESD (Grounded Hypothesis-Driven Error Slice Discovery), розроблений для автоматичного виявлення цих ломинь.

Чому це важливо звичайним людям?

Системи штучного інтелекту для зору вже приймають реальні рішення. Вони аналізують медичні скани, позначають предмети на конвеєрах і забезпечують роботу камер автомобілів без водія. Систематична сліпа пляма в будь-якому з цих інструментів — це не дрібна неприємність.

Якщо система постійно пропускає пішоходів у слабкому освітленні або не позначає дефект, коли він з'являється поблизу певного фону, ця закономірність — це проблема. Одна невірна відповідь виглядає як невдача. Сто невірних відповідей в одній ситуації виглядають як конструктивний дефект.

Що було неправильно в існуючих підходах?

Попередні інструменти для виявлення ломинь помилок добре працювали для простої класифікації зображень — визначення того, на фотографії кіт чи собака. Вони розглядали помилки як групи схожих за виглядом зображень або як комбінації попередньо встановлених категорій.

Цей підхід не працює для складніших завдань: детекція об'єктів, де система повинна провести коробку навколо кожного об'єкта на сцені, та сегментація, де вона повинна обвести точний контур кожного об'єкта. У цих завданнях те, де щось розташоване в кадрі, та те, що його оточує, впливає на те, чи правильно справиться штучний інтелект. Простіший метод на основі групування не може це охопити.

Що насправді робить GH-ESD?

Метод генерує конкретні, простою мовою гіпотези про те, чому можуть виникати помилки, а потім перевіряє кожну з них на реальних даних, щоб побачити, які закономірності підтримуються. Думайте про це як про структурований процес налагодження: замість вгадування воно припускає «система може мати труднощі, коли невеликий об'єкт частково приховується іншим об'єктом» і потім перевіряє, чи це насправді так.

Оскільки вона працює на рівні окремих екземплярів, а не цілих зображень, вона може виявляти помилки, пов'язані з просторовим контекстом та відносинами між об'єктами на сцені.

Що буде далі?

GH-ESD — це метод дослідження, а не готовий продукт. Його безпосередня аудиторія — інженери, які будують та аудирують системи зору. Але інструменти, які розробляють дослідники сьогодні, зазвичай формують перевірки безпеки, які потрапляють на розгорнуті продукти протягом кількох років.

Для тих, чия робота чи безпека залежить від системи штучного інтелекту для зору, основний висновок простий: запитайте, які систематичні тести були проведені. Одноразові показники точності можуть приховати повторювані помилки, які з'являються лише за конкретних умов реального світу.

Поширені питання

Що таке ломиння помилок?

Ломиння помилок — це конкретна група зображень або ситуацій, де система штучного інтелекту постійно дає неправильну відповідь, не просто час від часу, а як закономірність, пов'язана з чимось спільним у цих випадках.

Чи це впливає на інструменти штучного інтелекту, які я використовую сьогодні?

Опосередковано, так. Більшість інструментів штучного інтелекту для зору, які використовуються сьогодні, були протестовані методами, які можуть не виявити ці залежні від контексту помилки. Це дослідження спрямоване на кращі стандарти аудиту.

Чи доступна GH-ESD для використання?

Це опублікований метод дослідження від Apple ML Research, призначений для того, щоб інші дослідники та інженери на ньому розвивалися, а не інструмент для користувачів, який можна завантажити сьогодні.

© 2026 AI2Day