Дослідники Apple знайшли приховану помилку, яка може потихцю пошкодити зображення, створені штучним інтелектом
Невелика кількість аномальних точок даних, які називаються аномальними токенами, можуть дезорієнтувати системи, що створюють зображення штучного інтелекту. Нові дослідження пояснюють, що це таке й як це виправити.

Ключові моменти
- Apple ML Research виявила специфічний дефект, названий аномальними токенами, всередину систем генерування зображень штучним інтелектом, побудованих на основі конструкції, відомої як Diffusion Transformers.
- Ці аномальні токени з'являються як у частині системи, що читає зображення, так і в частині, що створює нові зображення.
- Проблема найгірша в середніх шарах моделі штучного інтелекту, у етапах обробки між входом та остаточним виходом.
- Якщо залишити без контролю, аномальні токени можуть звернути увагу моделі на неправильні місця, знижуючи якість і точність генерованих зображень.
Уявіть класну кімнату, де один дуже голосний учень постійно перериває кожен урок. Навіть якщо цей учень ніколи не говорить нічого корисного, весь клас все одно звертає на нього увагу. Щось дуже подібне відбувається всередину систем штучного інтелекту, які генерують зображення з текстових запитів.
Дослідники Apple ML Research детально визначили проблему. Винуватці називаються аномальні токени. Токен у цьому контексті — це невелика частина інформації, яку обробляє штучний інтелект, приблизно як слово в реченні, але для зображень. Аномальний токен — це той, що має незвично велике числове значення, що робить його таким, що виглядає набагато важливішим, ніж він насправді є.
Що саме йде не так?
Аномальні токени привертають увагу. Штучний інтелект витрачає обчислювальну потужність на них, навіть хоча вони містять дуже мало реальної інформації про зображення, що будується.
Дослідження зосереджується на класі моделей, названому Diffusion Transformers, або DiTs. Це двигуни, що приводять в дію багато з найкращих генераторів зображень штучного інтелекту сьогодні. Вони працюють у два основних етапи. По-перше, кодер (подумайте про нього як про очки для читання моделі) перетворює справжнє зображення в компактний математичний опис. Потім денойзер (творчий двигун) поступово будує нове зображення з шуму, керуючись цим описом.
Команда Apple виявила, що аномальні токени створюють проблеми на обох етапах. Попередньо навчені кодери можуть передати спотворені представлення денойзеру, перш навіть ніж він почне роботу. І сам денойзер може розвивати свої власні аномальні токени під час обробки, особливо глибоко всередину його середніх шарів.
Чи це впливає на зображення, які люди насправді використовують?
Потенційно так, хоча в статті описується знахідка дослідження, а не недолік в готовому продукті.
Коли увага моделі звертається до безсмислених токенів, остаточне зображення може відхилитися від того, що просив користувач. Деталі втрачаються. Послідовність страждає. Чим складніший запит, тим більше можливостей у аномальних токенів спричинити проблеми.
Гарна новина: дослідники також вивчали способи придушення цих аномалій. Їхня робота вказує на практичні виправлення, які можна було б вбудувати в майбутні моделі.
Для кожного, хто сьогодні використовує інструменти генерування зображень штучним інтелектом, це дослідження не вимагає жодних дій. Воно розташоване на фундаментальному рівні — це той вид знахідки, який інженери використовують для створення кращих систем у наступному поколінні інструментів.
Що буде далі?
Дослідження знаходиться на ранній, дослідницькій стадії. Жодних змін продукту або оновлень публічної моделі не оголошено.
Те, що робить цю роботу значною, — це те, що вона вносить відому проблему зі старшого класу моделей штучного інтелекту (Vision Transformers, використовуються в розпізнаванні зображень) в новіший світ генерування зображень. Дослідники помітили аномальні токени в моделях розпізнавання раніше, але їхня роль в генеративних системах була значною мірою не вивчена до цього часу.
Тщательно вивчати хворобу — це необхідний перший крок перед її лікуванням.
Часті запитання
Чи це вплине на інструменти генерування зображень штучним інтелектом, які я вже використовую?
Не безпосередньо й не негайно. Це фундаментальне дослідження, а не оновлення продукту. Ці знахідки, ймовірно, вплинуть на те, як майбутні моделі генерування зображень розроблятимуться й навчатимуться.
Що таке Diffusion Transformer простими словами?
Це тип архітектури штучного інтелекту, або внутрішня структура, яка використовується багатьма сучасними інструментами генерування зображень. Він працює, починаючи з випадкового шуму й поступово формуючи його в послідовне зображення, керуючись вашим текстовим запитом.



