Дослідники розробили тест, щоб перевірити, чи може штучний інтелект насправді резюмувати 16-хвилинне відео
Новий бенчмарк LVSum показує, наскільки погано сучасні інструменти ШІ для роботи з відео втрачають контроль над часом подій у довгих записах.

Ключові моменти
- Apple ML Research представила LVSum — бенчмарк для тестування якості резюмування довгих відео у статті дослідження 2024 року.
- LVSum містить 72 відео з 13 галузей, середня тривалість кожного відео — 16 хвилин.
- Кожне відео в набір даних має до 10 написаних людиною резюме з конкретними позначками часу, тобто ШІ повинен сказати не лише що сталося, а й коли.
- Сучасні мультимодальні великі мовні моделі — системи ШІ, які можуть одночасно читати й переглядати відео — борються з тим, щоб утримати події в правильній послідовності у довгих записах.
Уявіть, що ви просите колегу резюмувати запис 16-хвилинної наради. Ви хочете, щоб він розповів вам, що було вирішено, але й коли трапився ключовий момент, щоб ви могли швидко до нього перейти. Виявляється, що цей базовий навик виявляється для ШІ дивовижно складним.
Саме цей пробіл і був покликаний вимірювати LVSum.
Бенчмарк, описаний у статті Apple ML Research, підпорядковує системи ШІ структурованому тесту. Дослідники зібрали 72 відео, розподілені по 13 різним галузям — від демонстрацій готування до судових розглядів. Кожне відео триває в середньому близько 16 хвилин. Потім люди-аннотатори написали до 10 окремих резюме на відео, кожне з яких прив'язане до конкретних позначок часу у записі.
Позначки часу — це все суть. Резюме, яке каже «доповідач обговорював контракт», майже непридатне, якщо вам потрібно швидко знайти цей момент. LVSum ставить питання, чи може ШІ робити краще, створюючи те, що дослідники називають «резюме, обґрунтованими в часі», тобто текст, який розповідає вам як про зміст, так і про те, коли саме він трапляється.
Тестовані моделі — це мультимодальні великі мовні моделі, системи ШІ, навчені обробляти відео, зображення та текст разом, а не лише текст. Уявіть їх як технологію, що стоїть за інструментами, які можуть переглядати кліп та його описати. Існуючі системи цього типу вже непогано справляються з короткими кліпами. Довге відео — це зовсім інша проблема.
Протягом 16 хвилин модель повинна утримати в пам'яті велику кількість інформації й зберегти послідовність подій. Дослідження виявило, що збереження того, що стаття називає «точністю в часі» — тобто точне розуміння того, що передувало чому — це місце, де сучасні системи виявляються найбільш уразливими.
Що це означає для звичайних користувачів?
Якщо ви зараз користуєтесь інструментом ШІ для резюмування запису довгої наради, лекції чи документального фільму, ви повинні розглядати результат як грубий орієнтир, а не надійний запис. ШІ може правильно розібратися в фактах, але розмістити їх у неправильному порядку або взагалі упустити позначки часу. Завжди перевіряйте проти оригіналу перед тим, як ділитися резюме, створеним ШІ, з колегами чи клієнтами.
LVSum сам по собі не вирішує проблему. Це мірило, стандартизований спосіб для дослідників порівняти, як різні системи ШІ працюють на одному й тому ж наборі відео. Бенчмарки, такі як цей, зазвичай сприяють покращенню: як тільки з'являється узгоджений тест, лабораторії можуть чітко бачити, де їхні моделі відстають, і працювати до конкретної мети.
Набір даних навмисне охоплює 13 галузей, оскільки ШІ, що добре резюмує лише рецепти, має обмежену практичну користь. Різноманітність тесту змушує моделі узагальнювати.
У статті не названо, які комерційні продукти були оцінені. Ці деталі та повна розбивка оцінок знаходяться в повному тексті дослідження.


