Des chercheurs créent un test pour évaluer si l'IA peut vraiment résumer une vidéo de 16 minutes

Un nouveau benchmark appelé LVSum révèle à quel point les outils d'IA vidéo actuels perdent la notion du temps dans les longs enregistrements.

AI2Day Newsdesk· 3 min read
A glowing timeline bar stretching across a dark surface, with small bright markers at irregular intervals representing timestamps, soft blue and amber light, ne
Share

Points clés

  • Apple ML Research a présenté LVSum, un benchmark pour tester la qualité des résumés d'IA pour les longues vidéos, dans un article de recherche de 2024.
  • LVSum contient 72 vidéos réparties sur 13 domaines différents, avec une durée moyenne de 16 minutes par vidéo.
  • Chaque vidéo de l'ensemble de données est accompagnée de jusqu'à 10 résumés rédigés par des humains qui incluent des codes temporels spécifiques, ce qui signifie que l'IA doit non seulement dire ce qui s'est passé, mais aussi quand.
  • Les modèles de langage multimodaux actuels, les systèmes d'IA qui peuvent lire et regarder des vidéos simultanément, ont du mal à maintenir les événements dans le bon ordre sur de longs enregistrements.

Imaginez demander à un collègue de résumer un enregistrement de réunion de 16 minutes. Vous voulez qu'il vous dise ce qui a été décidé, bien sûr, mais aussi quand le moment clé s'est produit, afin que vous puissiez accéder directement à ce passage. Cette compétence basique s'avère étonnamment difficile pour l'IA.

C'est l'écart que LVSum a été conçu pour mesurer.

Le benchmark, décrit dans un article de Apple ML Research, soumet les systèmes d'IA à un test structuré. Les chercheurs ont rassemblé 72 vidéos réparties sur 13 domaines différents, allant de démonstrations culinaires à des procédures judiciaires. Chaque vidéo dure environ 16 minutes en moyenne. Des annotateurs humains ont ensuite rédigé jusqu'à 10 résumés distincts par vidéo, chacun lié à des codes temporels spécifiques de la vidéo.

Les codes temporels sont l'essentiel. Un résumé qui dit « l'orateur a discuté du contrat » est pratiquement inutile si vous devez trouver ce moment rapidement. LVSum teste si une IA peut faire mieux, en produisant ce que les chercheurs appellent des résumés temporellement ancrés, c'est-à-dire un texte qui vous dit à la fois le contenu et le moment exact où il se produit.

Les modèles testés sont des modèles de langage multimodaux, des systèmes d'IA entraînés à traiter les vidéos, les images et le texte ensemble plutôt que le texte seul. Pensez à la technologie derrière les outils qui peuvent regarder un clip et le décrire. Les systèmes existants de ce type gèrent déjà plutôt bien les clips courts. Les vidéos longues constituent un problème entièrement différent.

Sur 16 minutes, un modèle doit retenir beaucoup d'informations et maintenir la séquence des événements. La recherche a montré que le maintien de ce que l'article appelle la « fidélité temporelle », c'est-à-dire une perception précise de ce qui s'est passé avant, est l'endroit où les systèmes actuels s'effondrent le plus visiblement.

Que signifie cela pour les utilisateurs ordinaires ?

Pour l'instant, si vous utilisez un outil d'IA pour résumer un enregistrement de réunion long, un cours ou un documentaire, vous devriez traiter le résultat comme un guide approximatif plutôt que comme un document fiable. L'IA peut avoir raison sur les faits globalement, mais peut les placer dans le mauvais ordre ou ignorer complètement les codes temporels. Vérifiez toujours par rapport à l'original avant de partager un résumé généré par l'IA avec des collègues ou des clients.

LVSum ne résout pas le problème en lui-même. C'est un instrument de mesure, un moyen standardisé pour les chercheurs de comparer la performance de différents systèmes d'IA sur le même ensemble de vidéos. Les benchmarks de ce type ont tendance à favoriser l'amélioration : une fois qu'il y a un test convenu, les laboratoires peuvent voir clairement où leurs modèles sont défaillants et travailler vers un objectif spécifique.

L'ensemble de données couvre 13 domaines délibérément, car une IA qui ne résume bien que les vidéos culinaires ne sert pas à grand-chose en pratique. La diversité du test force les modèles à généraliser.

L'article s'abstient de nommer les produits commerciaux qui ont été évalués. Ce détail, ainsi que la ventilation complète des scores, se trouve dans le texte complet de la recherche.

© 2026 AI2Day