Исследователи создали тест, чтобы проверить, может ли ИИ действительно суммировать видео длиной 16 минут

Новый бенчмарк LVSum показывает, как плохо современные инструменты ИИ отслеживают время события в длительных записях.

AI2Day Newsdesk· 3 min read
A glowing timeline bar stretching across a dark surface, with small bright markers at irregular intervals representing timestamps, soft blue and amber light, ne
Share

Ключевые моменты

  • Apple ML Research представила LVSum, бенчмарк для тестирования качества суммирования длительных видео ИИ, в исследовательской работе 2024 года.
  • LVSum содержит 72 видео из 13 предметных областей со средней длиной 16 минут на видео.
  • Каждое видео в наборе данных содержит до 10 написанных человеком резюме с конкретными временными метками, что означает, что ИИ должен сказать не только то, что произошло, но и когда.
  • Существующие мультимодальные большие языковые модели, системы ИИ, которые могут одновременно читать и смотреть видео, испытывают сложности с сохранением правильного порядка событий в длительных записях.

Представьте, что вы просите коллегу суммировать 16-минутную запись встречи. Вы хотите, чтобы он рассказал вам, что было решено, да, но также когда произошел ключевой момент, чтобы вы могли перейти прямо к нему. Этот базовый навык оказывается удивительно сложным для ИИ.

Именно такой разрыв LVSum был создан для измерения.

Бенчмарк, описанный в работе Apple ML Research, подвергает системы ИИ структурированному тесту. Исследователи собрали 72 видео, распределенных по 13 различным предметным областям, от кулинарных демонстраций до судебных разбирательств. Каждое видео длится в среднем около 16 минут. Затем люди-аннотаторы написали до 10 отдельных резюме на видео, каждое привязанное к конкретным временным меткам в записи.

Временные метки — это суть всего. Резюме, которое говорит «выступающий обсуждал контракт», практически бесполезно, если вам нужно быстро найти этот момент. LVSum проверяет, может ли ИИ делать лучше, создавая то, что исследователи называют временно привязанными резюме, то есть текст, который рассказывает вам как содержание, так и точное время его возникновения.

Тестируемые модели — это мультимодальные большие языковые модели, системы ИИ, обученные одновременно обрабатывать видео, изображения и текст, а не только текст. Думайте о них как о технологии, лежащей в основе инструментов, которые могут смотреть видеоклип и описывать его. Существующие системы этого типа уже достаточно хорошо справляются с короткими клипами. Длительное видео — совсем другая проблема.

На протяжении 16 минут модель должна держать в памяти много информации и сохранять правильный порядок событий. Исследование показало, что сохранение того, что в работе называется «временной верностью», то есть точное понимание того, что произошло раньше, — это то, где текущие системы наиболее ярко дают сбой.

Что это означает для обычных пользователей?

Прямо сейчас, если вы используете инструмент ИИ для суммирования длительной записи встречи, лекции или документального фильма, вы должны рассматривать результат как приблизительное руководство, а не надежный отчет. ИИ может в общих чертах правильно понять факты, но расставить их в неправильном порядке или полностью пропустить временные подсказки. Всегда проверяйте исходный материал перед тем, как делиться резюме, созданным ИИ, с коллегами или клиентами.

LVSum сам по себе не решает проблему. Это мерка, стандартизированный способ для исследователей сравнивать производительность различных систем ИИ на одном и том же наборе видео. Такие бенчмарки обычно способствуют улучшению: когда появляется согласованный тест, лаборатории могут четко увидеть, где их модели отстают, и работать над конкретной целью.

Набор данных намеренно охватывает 13 областей, потому что ИИ, который хорошо суммирует только кулинарные видео, не очень полезен на практике. Разнообразие в тесте заставляет модели обобщать.

В работе не указываются названия оцениваемых коммерческих продуктов. Эта деталь и полная таблица оценок содержатся в полном тексте исследования.

© 2026 AI2Day