Исследователи Apple нашли более эффективный способ ускорить генерацию видео с помощью AI

Новая методика от Apple ML Research сокращает время, необходимое ИИ для преобразования текстовых запросов в видео, за счет обучения модели пропускать ненужные вычисления.

AI2Day Newsdesk3 min read
A glowing abstract grid of interconnected light nodes against a deep blue-black background, most connections fading to darkness while a selective few pulse brig
Share

Ключевые моменты

  • Apple ML Research опубликовала статью, описывающую метод калибруемого разреженного внимания, который ускоряет генерацию видео с помощью ИИ из текста.
  • Исследователи обнаружили, что большая часть внутренних вычислений в текущих видеомоделях дает результаты, близкие к нулю, и их можно безопасно пропустить.
  • Паттерны пропусков повторяются надежно во всех различных видеозапросах, поэтому система может изучить их заранее, а не переоткрывать каждый раз.
  • Исключение этих избыточных вычислений сокращает время обработки без видимого изменения качества выходного видео.

Создание короткого видео из текстового запроса кажется простым. Введите «кот ходит по осенним листьям», и модель построит каждый кадр пиксель за пикселем. На практике это занимает много времени, потому что ИИ должен обрабатывать огромное количество информации о том, как каждая часть каждого кадра соотносится со всеми остальными частями.

Техническое название для этого процесса — пространственно-временное внимание, что просто означает, что модель проверяет, как каждый небольшой участок видео связан с любым другим участком, как в пространстве, так и во времени. Эти проверки дорогостоящи. Современные видеомодели выполняют их миллиарды раз за одну генерацию.

Исследователи Apple ML Research обнаружили что-то полезное в этих вычислениях. Значительная часть связей между участками имеет оценки столь близкие к нулю, что они практически не изменяют финальное изображение. Пропуск этих связей не должен иметь значения.

Что еще лучше, эти низкооцениваемые связи имеют тенденцию появляться в одних и тех же местах, независимо от того, что вводит пользователь. Паттерны согласованны и повторяемы.

Эта согласованность является ключевым инсайтом. Поскольку пропускаемые связи повторяются в разных запросах, система может быть откалибрована заранее: запустить модель на небольшом наборе эталонных видео, выявить, какие связи постоянно имеют оценку близкую к нулю, а затем встроить эту карту. После этого модель заранее знает, какие вычисления пропустить, без необходимости проверки каждый раз.

Методика работает на двух уровнях. Отдельные участки с близкими к нулю связями пропускаются. Также пропускаются небольшие локальные группы участков, называемые блоками токенов, когда связи всей группы в целом незначительны.

Будут ли видео выглядеть хуже?

Нет, по крайней мере, не так, чтобы это было видно зрителю. Поскольку пропущенные вычисления уже практически не вносили никакого вклада в финальное изображение, их удаление не изменит то, что отображается на экране. Исследователи описывают эффект на качество выходного изображения как незначительный.

Для обычных людей это важно, потому что влияет на то, как быстро инструменты ИИ для создания видео могут ответить на запрос. Более быстрая генерация означает меньшие вычислительные затраты для компаний, запускающих эти модели, и потенциально более быстрые результаты для пользователей потребительских видеоинструментов, построенных на их основе. Это также может сделать более практичным запуск мощных видеомоделей на менее производительном оборудовании.

Такой подход не требует переобучения базовой модели с нуля, что облегчает разработчикам интеграцию в существующие системы. Это практическое преимущество перед многими методами ускорения, которые требуют дорогостоящих переделок.

Apple не объявила о продукте, основанном на этом исследовании, но эта методика указывает на создание инструментов ИИ для видео, которые дешевле в эксплуатации и быстрее реагируют на запросы.

© 2026 AI2Day