Дослідники Apple знайшли розумніший спосіб значно прискорити генерацію відео штучним інтелектом
Нова техніка від Apple ML Research скорочує час, необхідний ШІ для перетворення текстових запитів на відео, навчаючи модель пропускати розрахунки, які їй насправді не потрібні.

Ключові моменти
- Apple ML Research опублікувала статтю з описом методу, названого калібровано розрідженою увагою, який прискорює генерацію відео штучним інтелектом на основі текстових запитів.
- Дослідники виявили, що значна частина внутрішніх обчислень у поточних відеомоделях дає результати, близькі до нуля, і їх можна безпечно пропускати.
- Схеми пропускання надійно повторюються для різних запитів на відео, тому система може вивчити їх заздалегідь, замість того щоб переживати їх кожного разу.
- Скорочення цих надлишкових розрахунків зменшує час обробки без помітного впливу на якість вихідного відео.
Генерація короткого відео на основі текстового запиту звучить просто. Введіть «кіт, що йде через осіннє листя» — і модель будує кожний кадр, піксель за пікселем. Насправді це займає багато часу, оскільки ШІ повинен оперувати величезною кількістю інформації про те, як кожна частина кожного кадру пов'язана з кожною іншою частиною.
Технічна назва для цієї манери обращення — спатіотемпоральна увага, що означає модель перевіряє, як кожен невеликий фрагмент відео пов'язується з кожним іншим фрагментом, у просторі та часі. Ці перевірки дорогі. Сучасні відеомоделі запускають їх мільярди разів для кожної генерації.
Дослідники Apple ML Research виявили щось корисне, сховане в цих розрахунках. Значна частина зв'язків між фрагментами набирає такий низький бал, що практично не змінює остаточну картину. Пропускання їх не повинно матисвотстати.
І що ще краще, ці малозначущі зв'язки, як правило, з'являються в одних і тих же місцях, незалежно від того, що вводить користувач. Схеми послідовні та повторювальні.
Ця послідовність — ключова ідея. Оскільки зв'язки, гідні пропускання, повторюються для різних запитів, система може бути заздалегідь відкалібрована: запустіть модель на невеликому еталонному наборі відео, визначте, які зв'язки послідовно набирають близькі до нуля балами, а потім вбудуйте цю карту. З цього моменту модель заздалегідь знає, які розрахунки пропускати, без необхідності перевіряти кожного разу.
Техніка працює на двох рівнях. Окремі фрагменти з майже нульовими зв'язками пропускаються. Так само й малі локальні групи фрагментів, звані блоками токенів, коли зв'язки всієї групи несуттєві разом.
Чи гіршатимуться відео?
Ні, принаймні не так, щоб це було помітно для глядача. Оскільки пропущені розрахунки вже практично нічого не сприяли створенню остаточного зображення, їх вилучення не змінює те, що з'являється на екрані. Дослідники описують вплив на якість виходу як незначний.
Для звичайних людей це важливо, оскільки це впливає на те, наскільки швидко інструменти генерації відео ШІ можуть реагувати на запит. Швидша генерація означає нижчі обчислювальні витрати для компаній, які запускають ці моделі, та потенційно швидші результати для користувачів інструментів генерації видео для споживачів, побудованих на їх основі. Це також може зробити більш практичним запуск здатних відеомоделей на менш потужному обладнанні.
Цей підхід не вимагає перенавчання базової моделі з нуля, що полегшує розробникам інтегрувати його в існуючі системи. Це практична перевага над багатьма методами прискорення, які вимагають дорогих переробок.
Apple не оголосила про продукт, заснований на цих дослідженнях, але техніка вказує на інструменти генерації видео ШІ, які дешевше запускати й швидше реагувати.



