Чому моделі AI для генерації зображень продовжують вигадувати, і що роблять дослідники Apple
Нове дослідження Apple ML Research розглядає, чому мультимодальні моделі AI видаються галюцинаціями — описують зображення впевненими деталями, яких насправді немає, — і як метод навчання preference alignment міг би це виправити.

Ключові моменти
- Мультимодальні великі мовні моделі, системи AI, які обробляють і зображення, і текст, часто "галюцинують", генеруючи описи, які суперечать тому, що насправді зображено на фото.
- Preference alignment — метод навчання, який вчить модель надавати перевагу точним відповідям над правдоподібними — добре зарекомендував себе для текстових систем AI, але набагато менше досліджений для моделей розуміння зображень.
- Apple ML Research опубліквала комплексне дослідження щодо впливу методів вирівнювання на моделі image-language, з охопленням того, що працює, що не працює та чому.
- Ці результати мають значення за межами дослідницьких лабораторій: ці моделі забезпечують функції типу додання підписів до зображень, пошуку за зображеннями та інструментів доступності, які щодня використовують мільйони людей.
Скажіть AI описати фото, і зазвичай вона все зробить правильно. Але іноді впевнено добавляє об'єкти, людей чи текст, яких насправді немає на фото. Дослідники називають це галюцинацією, і це відомо як стійка проблема класу систем AI, які називаються мультимодальними великими мовними моделями, або МВММ, — це моделі AI, навчені розуміти одночасно і зображення, і письмову мову.
Для текстового чатбота галюцинація означає неправильне твердження. Для моделі зображення це може означати щось дезорієнтуюче: описання червоного автомобіля як синього, вигадування написи на стіні магазину або твердження, що людина посміхається, коли вона цього не робить. Модель не брешить, у неї просто немає надійного зв'язку з зображенням перед нею.
Чому це продовжує трапляться?
Текстові моделі AI були величезно поліпшені завдяки методу навчання preference alignment. Коротко: після початкового навчання дослідники показують моделі пари відповідей і вчать її надавати перевагу точнішій, корисніший. На тисячах прикладів модель вчиться самовиправлятися.
Проблема в тому, що цей крок корекції набагато менше досліджений для моделей, які обробляють зображення. Модель, навчена переважно на тексті, розвиває сильні інстинкти щодо того, як мають звучати речення. Коли ви додаєте зображення, ці інстинкти не автоматично передаються на перевірку візуальних фактів.
Що виявило дослідження Apple?
Дослідження, опубліковане Apple ML Research та вперше висвітлене в ширшому огляді препринту, мало на меті систематично картувати проблему. Команда розглянула, як різні стратегії preference alignment змінюють поведінку моделей image-language, тестуючи, які підходи зменшують галюцинації, а які виявляються неадекватними.
Ключовим висновком дослідження є те, що вирівнювання для МВММ повинне враховувати другий вимір точності: не лише "чи є це речення фактично правильним?", але й "чи відповідає це речення тому, що зображено на зображенні?" Це різні питання, і методи навчання, розроблені лише для тексту, не автоматично справляються з візуальною перевіркою.
Дослідження позиціонується як ресурс для ширшої дослідницької спільноти, картуючи те, що зрозуміло, що залишається відкритим питанням та де знаходяться найперспективніші напрямки.
Що це означає для звичайних користувачів?
Якщо ви використовуєте додаток, який читає описи зображень, автоматично позначає фото або відповідає на питання про зображення, які ви завантажуєте, ви покладаєтесь на цю технологію. Галюцинації в таких контекстах — це більше ніж цікавість: неправильний опис у інструменті доступності може справді ввести в оману користувача з вадами зору.
Краще навчання вирівнювання — один із найчітких шляхів до моделей, які залишаються чесними щодо того, що вони насправді бачать. Прогрес тут не вимагає від користувачів робити щось інакше. Це відбувається всередині процесу навчання, набагато раніше, ніж продукт потрапить на ваш телефон.
Часті запитання
Чи означає галюцинація те саме в моделях зображень, що й у текстових чатботах?
Не зовсім. Текстові чатботи видаються галюцинаціями через невірні твердження. Моделі зображень можуть це робити, але можуть також суперечити візуальному свідченню прямо перед ними, описуючи те, чого там немає, або пропускаючи те, що явно присутнє.
Чи змінює це дослідження якісь продукти, які я можу використовувати прямо зараз?
Ні. Це фундаментальне дослідження, не оголошення про продукт. Його значення полягає в тому, що надати іншим дослідникам чіткішу карту проблеми, щоб майбутні моделі в багатьох компаніях можна було будувати з більш потужним навчанням вирівнювання з самого початку.



