शोधकर्ताओं ने एक परीक्षण बनाया है यह देखने के लिए कि क्या AI वास्तव में 16-मिनट के वीडियो को सारांशित कर सकता है

LVSum नामक एक नए बेंचमार्क से पता चलता है कि आज के AI वीडियो उपकरण लंबी रिकॉर्डिंग में घटनाओं के समय का ट्रैक कैसे खो देते हैं।

AI2Day Newsdesk· 3 min read
A glowing timeline bar stretching across a dark surface, with small bright markers at irregular intervals representing timestamps, soft blue and amber light, ne
Share

मुख्य बिंदु

  • Apple ML Research ने 2024 के एक शोध पत्र में LVSum पेश किया, जो परीक्षण करने के लिए एक बेंचमार्क है कि AI लंबे वीडियो को कितना अच्छा सारांशित करता है।
  • LVSum में 13 विषय क्षेत्रों में 72 वीडियो हैं, जिनकी औसत लंबाई प्रति वीडियो 16 मिनट है।
  • डेटासेट में प्रत्येक वीडियो में 10 तक मानव-लिखित सारांश होते हैं जिनमें विशिष्ट टाइमस्टैम्प होते हैं, जिसका अर्थ है कि AI को न केवल यह कहना चाहिए कि क्या हुआ बल्कि कब हुआ।
  • वर्तमान मल्टीमोडल बड़े भाषा मॉडल, AI सिस्टम जो एक ही समय में वीडियो पढ़ और देख सकते हैं, लंबी रिकॉर्डिंग में घटनाओं को सही क्रम में रखने के लिए संघर्ष करते हैं।

कल्पना कीजिए कि आप किसी सहकर्मी से एक 16-मिनट की बैठक की रिकॉर्डिंग का सारांश देने के लिए कहते हैं। आप चाहते हैं कि वे आपको बताएं कि क्या निर्णय लिया गया, हाँ, लेकिन यह भी कि मुख्य क्षण कब हुआ, ताकि आप सीधे वहां जा सकें। यह बुनियादी कौशल AI के लिए आश्चर्यजनक रूप से कठिन साबित होता है।

यह वह अंतर है जिसे मापने के लिए LVSum बनाया गया था।

Apple ML Research के एक पत्र में वर्णित यह बेंचमार्क AI सिस्टम को एक संरचित परीक्षा के माध्यम से डालता है। शोधकर्ताओं ने 13 विभिन्न विषय क्षेत्रों में फैले 72 वीडियो एकत्र किए, खाना पकाने के प्रदर्शन से लेकर कानूनी कार्यवाही तक। प्रत्येक वीडियो औसतन लगभग 16 मिनट चलता है। मानव एनोटेटर ने फिर प्रत्येक वीडियो के लिए 10 तक अलग-अलग सारांश लिखे, प्रत्येक को फुटेज में विशिष्ट टाइमस्टैम्प के लिए तैयार किया गया।

टाइमस्टैम्प ही पूरा मुद्दा है। एक सारांश जो कहता है "वक्ता ने अनुबंध पर चर्चा की" लगभग बेकार है अगर आपको वह क्षण जल्दी से ढूंढना है। LVSum पूछता है कि क्या कोई AI बेहतर कर सकता है, जिसे शोधकर्ता "अस्थायी रूप से आधारित सारांश" कहते हैं, जिसका अर्थ है पाठ जो आपको सामग्री और बताता है कि यह ठीक कब होता है।

परीक्षण किए जा रहे मॉडल मल्टीमोडल बड़े भाषा मॉडल हैं, AI सिस्टम जो अकेले टेक्स्ट के बजाय वीडियो, इमेज और टेक्स्ट को एक साथ संसाधित करने के लिए प्रशिक्षित हैं। उन्हें उस तकनीक के रूप में सोचें जो उन उपकरणों के पीछे है जो एक क्लिप को देख सकते हैं और उसका वर्णन कर सकते हैं। इस प्रकार की मौजूदा प्रणालियाँ छोटे क्लिप को पहले से ही उचित तरीके से संभालती हैं। लंबा वीडियो एक पूरी तरह से अलग समस्या है।

16 मिनट से अधिक, एक मॉडल को मेमोरी में बहुत कुछ रखना चाहिए और घटनाओं के अनुक्रम को सीधा रखना चाहिए। शोध में पाया गया कि जिसे पेपर "अस्थायी निष्ठा" कहता है, वह बनाए रखना, जिसका अर्थ है कि क्या पहले आया इसकी सटीक समझ, वह है जहां वर्तमान सिस्टम सबसे स्पष्ट रूप से टूटते हैं।

इसका मतलब सामान्य उपयोगकर्ताओं के लिए क्या है?

अभी के लिए, यदि आप किसी लंबी बैठक की रिकॉर्डिंग, व्याख्यान या डॉक्यूमेंटरी को सारांशित करने के लिए एक AI उपकरण का उपयोग करते हैं, तो आपको आउटपुट को एक विश्वसनीय रिकॉर्ड के बजाय एक मोटा मार्गदर्शन माना चाहिए। AI को तथ्य मोटे तौर पर सही मिल सकते हैं लेकिन उन्हें गलत क्रम में रखें या समय संकेत पूरी तरह से मिस करें। सहकर्मियों या ग्राहकों के साथ कोई भी AI-जनित सारांश साझा करने से पहले हमेशा मूल के विरुद्ध जांच करें।

LVSum स्वयं समस्या को ठीक नहीं करता है। यह एक मापने की छड़ी है, शोधकर्ताओं के लिए एक मानकीकृत तरीका है कि समान वीडियो सेट पर विभिन्न AI सिस्टम कैसे प्रदर्शन करते हैं। इस तरह के बेंचमार्क सुधार चलाते हैं: एक बार एक सहमत परीक्षा होने के बाद, प्रयोगशालाएं स्पष्ट रूप से देख सकती हैं कि उनके मॉडल कहां कमजोर हैं और एक विशिष्ट लक्ष्य की ओर काम कर सकती हैं।

डेटासेट जानबूझकर 13 डोमेन को कवर करता है, क्योंकि एक AI जो केवल खाना पकाने के वीडियो को अच्छी तरह सारांशित करता है, अधिक व्यावहारिक उपयोग नहीं है। परीक्षा में विविधता मॉडल को सामान्य करने के लिए मजबूर करती है।

पेपर किन वाणिज्यिक उत्पादों का मूल्यांकन किया गया था, इसका नाम देने से बचता है। वह विवरण, और पूरा स्कोरिंग ब्रेकडाउन, पूर्ण शोध पाठ में बैठता है।

© 2026 AI2Day