Исследователи Apple обнаружили скрытый сбой, который может незаметно испортить AI-генерируемые изображения
Небольшое количество аномальных точек данных, называемых токенами выбросов, могут нарушить работу систем, создающих AI-изображения. Новое исследование объясняет, что это такое и как это исправить.

Ключевые моменты
- Apple ML Research выявила специфический дефект, называемый токенами выбросов, внутри систем генерации AI-изображений, построенных на архитектуре, известной как Diffusion Transformers.
- Эти токены выбросов появляются как в части системы, которая читает изображения, так и в части, которая создает новые.
- Проблема наиболее острая в средних слоях AI-модели — этапах обработки между входом и финальным выходом.
- Без контроля токены выбросов могут направить внимание модели в неправильные места, снижая качество и точность сгенерированных изображений.
Представьте класс, где один очень громкий ученик постоянно прерывает каждый урок. Даже если он ничего полезного не говорит, весь класс все равно оборачивается на него посмотреть. Что-то очень похожее происходит внутри AI-систем, которые генерируют изображения из текстовых описаний.
Исследователи Apple ML Research выявили эту проблему подробно. Виновники называются токены выбросов. Токен в этом контексте — это небольшой фрагмент информации, который обрабатывает AI, примерно как слово в предложении, но для изображений. Токен выброса — это токен, который имеет необычно большое числовое значение, что делает его на вид гораздо более важным, чем он есть на самом деле.
Что именно идет не так?
Токены выбросов перехватывают внимание. AI уделяет вычислительные ресурсы им, хотя они содержат очень мало реальной информации об изображении, которое строится.
Исследование сосредоточено на классе моделей под названием Diffusion Transformers или DiT. Это движки, питающие многие из лучших современных генераторов AI-изображений. Они работают в два основных этапа. Сначала кодировщик (представьте себе очки модели для чтения) преобразует реальное изображение в компактное математическое описание. Затем денойзер (творческий механизм) постепенно строит новое изображение из шума, руководствуясь этим описанием.
Команда Apple обнаружила, что токены выбросов вызывают проблемы на обоих этапах. Предварительно обученные кодировщики могут передавать искаженные представления денойзеру еще до того, как он начнет работу. И сам денойзер может развить собственные токены выбросов при обработке, особенно глубоко в своих средних слоях.
Влияет ли это на изображения, которые люди действительно используют?
Потенциально да, хотя статья описывает исследовательский результат, а не недостаток в поставляемом продукте.
Когда внимание модели отвлекается на бессмысленные токены, финальное изображение может отклониться от того, что запросил пользователь. Теряются детали. Снижается согласованность. Чем сложнее описание, тем больше возможностей у токенов выбросов вызвать проблемы.
Хорошая новость: исследователи также изучали способы подавления этих выбросов. Их работа указывает на практические решения, которые можно встроить в будущие модели.
Для всех, кто в настоящее время использует инструменты AI-изображений, это исследование не требует никаких действий. Оно находится на фундаментальном уровне — это тот вид открытий, который инженеры используют для создания лучших систем в следующем поколении инструментов.
Что дальше?
Исследование находится на ранней, поисковой стадии. Никаких изменений продуктов или обновлений публичных моделей не объявлено.
Значимость этой работы в том, что она переносит известную проблему из старого класса AI-моделей (Vision Transformers, используемые в распознавании изображений) в более новый мир генерации изображений. Исследователи замечали токены выбросов в моделях распознавания раньше, но их роль в генеративных системах была практически не изучена до сих пор.
Внимательное изучение болезни — необходимый первый шаг перед ее лечением.
Часто задаваемые вопросы
Повлияет ли это на инструменты AI-изображений, которые я уже использую?
Не напрямую и не сразу. Это фундаментальное исследование, а не обновление продукта. Эти результаты вероятно повлияют на то, как будут разработаны и обучены будущие модели генерации изображений.
Что такое Diffusion Transformer в простых терминах?
Это тип AI-архитектуры или внутренней структуры, используемой многими современными инструментами генерации изображений. Она работает, начиная со случайного шума и постепенно формируя его в связное изображение, руководствуясь вашим текстовым описанием.



