Anderson का एंगल
एआई को किताब पढ़ना ज्यादा पसंद है फिल्म देखने की तुलना में

फ्रेमों का विश्लेषण करने में सक्षम हैं – छवियों के रूप में, जैसे JPEG और PNG – वे उपयोगकर्ता को अपने फ्रेम निकालने और उन्हें छवियों के रूप में अपलोड करने के लिए पसंद करते हैं
यह आश्चर्यजनक रूप से मुश्किल है कि एआई मॉडल वास्तविक वीडियो सामग्री पर टिप्पणी करने के लिए प्राप्त किया जाए, भले ही वे इस कार्य के लिए बनाए गए हों। वे लिखित शब्द में अधिक रुचि रखते हैं। यदि आपने कभी ChatGPT या किसी अन्य लोकप्रिय दृष्टि/भाषा मॉडल में एक छोटा वीडियो क्लिप अपलोड करने की कोशिश की है, तो आपको यह महसूस हो सकता है कि वे वास्तव में वीडियो को पार्स नहीं कर सकते हैं। जबकि मॉडल जैसे ChatGPT-4o+ व्यक्तिगत उद्देश्य (जिन पर वे करने के लिए तैयार हैं)। टिप्पणी ओपनएआई जीपीटी श्रृंखला के मामले में, एक वीडियो क्लिप से पूरे फ्रेम को निकालना और उन्हें ChatGPT को खिलाना संभव है, उदाहरण के लिए, वीडियो के लिए एक एआई-निर्मित कथा ट्रैक बनाने के से: ओपनएआई जीपीटी ट्यूटोरियल से छवियां और कोड वीडियो क्लिप

है कि वीडियो से फ्रेम में रूपांतरण करे, या तो एक बड़े रूटीन में कार्यों को कॉल करके, जैसा कि ऊपर दिए गए उदाहरण में, या FFMPEG या विभिन्न नि:शुल्क और भुगतान वीडियो संपादन समाधानों के साथ फ्रेम निकालकर। एक हद तक, शायद एक बड़े हद तक, उच्च-स्तरीय उत्पादों जैसे ChatGPT में वीडियो विश्लेषण पर सीमाएं पर निर्भर करती हैं: एक ही एआई उदाहरण को सबसे लोकप्रिय वीडियो कोडेक्स के चयन के करना औरसाथ सुसज्जित निकाली गई फ्रेम के डिस्क-भारी और सीपीयू-थ्रॉटलिंग प्रक्रिया के लिए कंप्यूटे संसाधनों को प्रतिबद्ध करना कोई छोटी बात नहीं है, यदि सैकड़ों मिलियन उपयोगकर्ता प्रतिदिन इन सुविधाओं का उपयोग करना शुरू कर दें। संसाधन उपयोग इसके अलावा, समयिक विश्लेषण एक बहुत अलग चित्र पेंट कर सकता है एक एकल फ्रेम की तुलना में (कल्पना कीजिए कि कोई खुश मूड में एक घर में प्रवेश करता है और फिर एक शरीर की खोज करता है); इसलिए, यहां तक कि एक छोटे वीडियो क्लिप के पूरे समयिक ‘चेकसम’ पर विचार करना एक मांग और संसाधन-गहन कार्य है – साथ ही साथ अनुसंधान साहित्य का एक विशेषज्ञ क्षेत्र, उदाहरण के लिए, ऑप्टिकल फ्लो जैसे फ्रेमवर्क के निरंतर विकास के साथ – जो मूल रूप से एक वीडियो को ‘अनफोल्ड’ करता है ताकि यह एक स्थिर दस्तावेज की तरह माना जा सके और कार्रवाई की जा सके: ऑप्टिकल फ्लो आरेख यह दिखाते हैं कि वीडियो अनुक्रम में

क्लिफ की नोट्स के लिए बसना
फिर भी, चूंकि मॉडल जैसे गूगल के नोटबुक एलएम और हाल के चैटजीपीटी प्रवेश वीडियो से जुड़े मेटाडेटा (अर्थात, वीडियो को कुछ तरीके से संदर्भित करने वाली एम्बेडेड पाठ सामग्री) को पढ़ सकते हैं, वे वीडियो फ़ाइल अपलोड पर प्रतिबंध नहीं लगाते हैं; और कभी-कभी, वे एक वीडियो की व्याख्या करने का प्रयास भी करेंगे जिसमें ऐसा कोई डेटा नहीं है。 निम्नलिखित मामले में, मैंने नोटबुक एलएम में इटैलियन मूवी (2021) का 6-सेकंड का रैंडम क्लिप अपलोड किया, यह सुनिश्चित का हेड-टू-हेड पॉडकास्ट शामिल करते हुए कि क्लिप में शून्य उपयोगी पाठ था, चाहे वह मेटाडेटा में हो या फ़ाइल नाम में। द हैंड ऑफ गॉड नोटबुक एलएम तब वीडियो से संबंधित किसी भी सामग्री के बिना सामग्री को विस्तार से कल्पना करने के लिए आगे बढ़ा, जिसमें एक असंबंधित और असंबंधित पांच मिनट

टीएल;डब्ल्यू
यह, यूके के ब्रिस्टल विश्वविद्यालय से एक नए पत्र के अनुसार, जिसका शीर्षक है , हजार शब्दों के लायक नहीं है (वीक्यूए) में भागजिसमें दो लेखक निष्कर्ष निकालते हैं कि वर्तमान राज्य-ऑफ-द-आर्ट विजन भाषा मॉडल (वीएलएम) – मॉडल जो वीडियो का विश्लेषण करने में सक्षम होने के लिए विशेष रूप से डिज़ाइन किए गए हैं और एक वीडियो एक पर – कई मामलों लेने के लिए – भी तब टेक्स्ट-आधारित जानकारी पर चुनते हैं जब वे कर सकते हैं। वीडियो प्रश्न उत्तर देने जब दोनों चलती तस्वीरें और लिखित प्रश्न और बहुविकल्पी उत्तर दिए गए, तो पत्र के लेखकों ने पाया कि मॉडल आमतौर पर पाठ में पैटर्न पर अपनी पसंद के आधार पर निर्णय लेते हैं, न कि स्क्रीन पर होने वाली चीजों प्रश्न । पूरी तरहमें तब भी उतना ही अच्छा प्रदर्शन किया जब से हटा दियागया था जो लगता है वह एक प्रकार का शॉर्टकट या धोखाधड़ी का एक रूप है, जिसमें सबसे महत्वपूर्ण बात यह है कि मॉडल के लिए पैटर्न को संभावित उत्तरों में पहचानना; केवल जब कार्य को अधिक कठिन बनाया गया, तो अधिक उत्तर विकल्प जोड़कर, एआई ने वीडियो पर अधिक ध्यान देना शुरू किया। लेखकों ने विभिन्न संदर्भ लंबाई वाले छह वीएलएम मॉडल पर विभिन्न परीक्षणचलाए; और पाया कि परिणाम मॉडल की वीडियो सामग्री पर निर्भरता की कमी को दर्शाते हैं। अध्ययन से एक

विधि
मॉडल के निर्णय में प्रत्येक इनपुट का कितना योगदान है, यह समझने के लिए नए काम में गेम थ्योरी से एक विधि का उपयोग किया जाताहै जिसे शैपले मूल्य कहा जाता है। मूल रूप से एक गठबंधन में खिलाड़ियों के बीच एक भुगतान को न्यायपूर्ण रूप से विभाजित करने के लिए डिज़ाइन किया गया, शैपले मूल्य प्रत्येक ‘खिलाड़ी’ को उनके व्यक्तिगत प्रभाव के आधार पर श्रेय देते हैं। प्रभावी रूप से, इस दृश्य में खिलाड़ी या तो वीडियो फ्रेम हैं या वीक्यूए कार्य (एनोटेशन, उपशीर्षक, कैप्शन, आदि) के पाठ घटक; और ‘भुगतान’ मॉडल का अंतिम उत्तर है। प्रत्येक भाग को जोड़कर या हटाकर परीक्षण करके, तकनीक यह दर्शाती है कि कौन सा तत्व चुने गए उत्तर में कितना महत्वपूर्ण था। इस मामले में, शैपले मूल्यों को वीडियो और पाठ घटकों को विभिन्न रूप से व्यवहार करने के लिए अनुकूलित किया गया था, और उनके प्रभाव को मॉडल के आउटपुट पर मापा गया था, यह दर्शाते हुए कि क्या वीडियो सामग्री वास्तव में व्याख्या की जा रही थी या लिखित संकेतों का उपयोग शॉर्टकट के रूप में किया जा रहा था।
मेट्रिक्स
दो सरल मेट्रिक्स को परिभाषित किया गया था ताकि यह तुलना की जा सके कि प्रत्येक मोडलिटी (अर्थात, वीडियो, प्रश्न, या उत्तर) मॉडल के निर्णय में कितना योगदान करती है: जैसे वीडियो, अन्य मापता है कि कितना कुल व्याख्या प्रत्येक प्रकार के इनपुट से आती है; यहां, सभी उपलब्ध शैपले मूल्यों को जोड़कर, और प्रत्येक मोडलिटी के हिस्से को कुल के प्रतिशत के रूप में गणना की जाती है। दूसरा, मोडलिटी योगदान यह सही करता है कि कुछ मोडलिटी, प्रमुख है। प्रति-विशेषता योगदान लोगों की तुलना में अधिक विशेषताओं की संख्या होती है। इसके बजाय, प्रत्येक विशेषता के लिए औसत शैपले मूल्य की गणना की जाती है, और वे औसत एक दूसरे के साथ तुलना किए जाते हैं ताकि यह निर्धारित किया जा सके कि कौन सी मोडलिटी का प्रभाव
डेटा और परीक्षण
लेखकों ने छह वीएलएम का परीक्षण किया जो विभिन्न विशेषताओं के साथ थे जो यह सुनिश्चित करने के लिए डिज़ाइन किए गए थे कि परीक्षणों के सिद्धांत व्यापक रूप से लागू और सामान्य हैं। इसलिए, मॉडल का चयन विभिन्न संदर्भ लंबाई, विभिन्न उम्र (अर्थात, यह जारी होने के बाद से कितना समय बीत चुका है), और विभिन्न आर्किटेक्चर कॉन्फ़िगरेशन के लिए कियागया था।प्रतियोगियों मेंफ्रोजनबिल्म ; इंटरनवीडियो; वीडियोलामा2 ; वीडियोलामा3 ; एलएवा-वीडियो (जोक्वेन2 का लीवरेज); और LongVA (जो Quen2 का भी इस्तेमाल करता है)। डाइवर्सिटी के मकसद से, चारलक्ष्य डेटासेट एगोस्कीमा थे, एक वीक्यूए डेटासेट जो वीडियो को पूरी तरह से देखे बिना पूरा करना असंभव है; एचडी-एपिक ,एक रसोई पर केंद्रित डेटासेट जिसमें कुछ असामान्य रूप से लंबे वीडियोहैं; एमवीबेंच , अन्य डेटासेट से योगदान का एक क्यूरेटेड असेंबल;और एलवीबेंच , जो बहुत लंबे वीडियो के लिए वीक्यूए प्रश्न प्रस्तुत करता है। इनसे, लेखकों ने दस प्रत्येक प्रश्न प्रकार से 60 प्रश्न तैयार किए। योगदान मेट्रिक्स ने स्पष्ट किया कि अधिकांश मॉडल वीडियो की तुलना में पाठ पर कम निर्भर थे, विशेष रूप से फ्रेम-दर-फ्रेम। यहां तक कि जहां वीडियो ने समग्र योगदान में एक उचित प्रदर्शन किया, इसका प्रति-विशेषता प्रभाव अक्सर न्यूनतम था, यह सुझाव देते हुए कि जबकि मॉडल समग्र रूप से वीडियो का उपयोग कर सकता था, यह व्यक्तिगत फ्रेम पर बहुत कम ध्यान दे रहा था। वीडियोलामा3 मुख्य अपवाद था, जिसमें लंबी अनुक्रम में एलवीबेंच पर विशेष रूप से भारी दृश्य निर्भरता थी: मॉडल और डेटासेट के माध्यम से

उत्तर को अक्सर अधिक महत्व दिया जाता था, विशेष रूप से मजबूत मॉडल में। यह सबसे ज्यादा एगोस्कीमा जैसे डेटासेट में स्पष्ट था, जहां प्रश्न लंबे और अधिक प्राकृतिक थे, जबकि उत्तर छोटे और कभी-कभी योजनाबद्ध थे। एमवीबेंच ने इसे कुछ हद तक उलट दिया, क्योंकि इसकी द्विआधारी उत्तर संरचना ने उत्तर टोकन के स्पष्ट महत्व को बढ़ा दिया। सभी मॉडल और डेटासेट में, हालांकि, दृष्टि को लगातार हाशिए पर रखा गया था, भाषा ने अधिकांश भारी उठाया था। पत्र में कहा गया है: ‘(लंबे संदर्भ मॉडल के लिए, वीडियो में
योगदान काफी कम हो जाता है, जिसका अर्थ है कि प्रति-फ्रेम शैपले मूल्य उनके पाठ सुविधा समकक्षों की तुलना में बहुत छोटे हैं। शोधकर्ताओं ने मॉडल की सटीकता
के रूप में एक मोडलिटी स्पष्ट रूप से अभी भी बहुत प्रासंगिक है, लेकिन यह साक्ष्य है कि इसके व्यक्तिगत फ्रेम के शैपले मूल्य शून्य के आसपास केंद्रित हैं, और मॉडल का ध्यान उन पर बहुत कम निर्देशित है।’ का उपयोग किया – जानबूझकर एक या एक से अधिक इनपुट
कितनी बदल जाती है यह देखने के लिए कि प्रत्येक इनपुट (वीडियो, पाठ, आदि) मॉडल की सटीकता में कितना योगदान करता है, अतिरिक्त परीक्षण ‘वीडियो या को छुपाना और देखना कि मॉडल की सटीकता कितनी बदलती है जब परिणामस्वरूप। मास्किंग यदि प्रदर्शन तेजी से गिरता है जब एक विशिष्ट इनपुट को हटा दिया जाता है, तो यह संभवतः महत्वपूर्ण है; यदि मॉडल लगभग समान रूप से प्रदर्शन करता है, तो यह सुझाव देता है कि हटाए गए टुकड़े पर बहुत अधिक निर्भर नहीं था। इस अर्थ में, मास्किंग परीक्षण एक प्रकार का अभिलाक्षणिक अध्ययन है। चार वीक्यूए बेंचमार्क पर वीडियो, प्रश्न, उत्तर इनपुटको

परिणाम (ऊपर दिखाया गया है) यह दर्शाते हैं कि उत्तर (पाठ उत्तरों में से एक) सभी के लिए सबसे अधिक वजन रखते हैं। उत्तर को मास्क करने से आमतौर पर सटीकता में सबसे बड़ी गिरावट आती है, अक्सर मॉडल को यादृच्छिक प्रदर्शन तक ले जाती है। हालांकि, प्रश्न हैं। को करने से आमतौर पर बहुत कम प्रभाव पड़ता है, जो पहले के निष्कर्ष का समर्थन करता है कि मॉडल अक्सर प्रश्न को कम आंकते बाद में यह परीक्षण कियामास्क कुछ मामलों में, सटीकता वास्तव में पर बढ़ जाती है, जो यह सुझाव देती है कि मॉडल कभी-कभी उत्तरों को दृश्य या पाठ संकेतों की तुलना में पाठ पैटर्न से मेल खाने के बजाय मिलान के आधार पर मेल खाते हैं। प्रश्न को हटाने मॉडल वीडियो पर अपनी निर्भरता में भिन्न थे: कुछ ने इसके बिना उचित सटीकता बनाए रखी, जो वीडियो सुविधाओं के सीमित योगदान की पुष्टि करता है। शोधकर्ताओं ने के। लेकिन दस कि क्या मॉडल को वीडियो पर निर्भर करने के लिए मजबूर किया जा सकता है bằng जोड़ने के लिए अतिरिक्त जोड़कर। गलत उत्तर जब विकर्ण आसान और अन्य प्रश्नों से पुनर्नवीनता थे, तो प्रदर्शन में सुधार हुआ, क्योंकि मॉडल पाठ पैटर्न से मेल खाते थे बिना बहुत सारे तर्क

से पाठ की प्रमुखता कम हो जाती है और दृश्य और प्रश्न सुविधाओं का सापेक्ष प्रभाव बढ़ जाता है। वीडियोलामा3 के लिए, वीडियो को मास्क करने से ईगोस्कीमा पर 40% और एलवीबेंच पर 15% की सटीकता में कमी आई, जो यह दर्शाता है कि उत्तरों की संख्या में एक सरल वृद्धि मॉडल को पाठ शॉर्टकट से दूर और वास्तविक बहुसंवेदी तर्क की ओर ले जा सकती

पुष्टि करता है कि मॉडल वीडियो की तुलना में
अधिक निर्भर करते हैं। यहां तक कि जब वीडियो ‘हीटमैप के दाहिने हाथ की ओर मूल्यों की तीव्रता बहुत अधिक है, जो प्रश्न और उत्तर विशेषताओं को दर्शाता है। यह सीमा है जहां वीडियो फ्रेम समाप्त होते हैं और पाठ सुविधाएं शुरू होती हैं, यह प्रदर्शित करते हुए कि वीडियो मोडलिटी योगदान प्रश्न/उत्तर की तुलना में बहुत कम
भाषा पर बहुत अधिक निर्भर करते हैं। परिणामों पर टिप्पणी करते हुए, लेखक कहते हैं: सारांश में, सभी डेटासेट में, मूल्य पाठ के अंत में बहुत मजबूत हैं, जो यह दर्शाते हैं कि मॉडल वास्तव में भाषा पर बहुत नकारात्मक है। ‘ उपयोग किया जाता है, तो योगदान विभिन्न फ्रेम में फैला होता है, अक्सर कोई सुसंगत पैटर्न के बिना। का नीचे हम एगोस्कीमा का एक उदाहरण देखते हैं। शैपले मूल्यों का उपयोग करके 16 सबसे ‘महत्वपूर्ण’ फ्रेम का चयन किया गया था और उनके प्रभाव के अनुसार रंगीन किया गया था, नीला सकारात्मक योगदान और लाल

को दर्शाता है। परिणाम यह है कि लगभग हर फ्रेम का प्रभाव प्रश्न और उत्तरों में शब्दों की तुलना में बहुत कमजोर है। दृश्य संकेत असंगत और दुर्लभ हैं, जबकि संज्ञाएं जैसे ‘कुर्सी’ और ‘बाड़’ मॉडल को सही विकल्प की ओर ले जाती हैं – या इसे दूर ले जाती हैं, संदर्भ के आधार पर।
निष्कर्ष
जो कोई भी वीडियो संपादन या वीडियो विश्लेषण में खिलवाड़ करता है वह पहले से ही जानता है कि ये प्रक्रियाएं कितनी संसाधन-गहन हैं, और समझता है कि कंपनियां जो दैनिक आधार पर लाखों एआई-आधारित अनुरोधों को संसाधित करती हैं, उपयोगकर्ताओं द्वारा हो तो चलाए जा सकने वाले वीडियो संपादन और व्याख्या प्रक्रियाओं की अनुमति देने का जोखिम नहीं उठा सकती हैं। अधिक इस संबंध में एक बात याद रखनी चाहिए कि लगभग हर एआई इंटरफेस (एक नए वैज्ञानिक अनुसंधान के समर्थन में एक ब्रांड-न्यू और अल्पकालिक डेमो को छोड़कर) उपयोगकर्ताओं की इच्छाओं को पूरा करने का प्रयास करता है न्यूनतम स्तर पर संसाधन व्यय के साथ। इसका अर्थ है कि जहां संभव हो वहां मौजूदा मेटाडेटा पर निर्भर रहना, या आरएजी पुनर्प्राप्ति से यदि संभव अधिक PDFs, डॉक्यूमेंट्स और सिंगल इमेज जैसे समझने लायक फ़ॉर्मैट से मेटाडेटा निकालना। जो बात नहीं है वह है आपके अपलोड किए गए वीडियो को CLIP या Yolo Release, या किसी पावरफ़ुल और टाइम लेने वाले VLM के ज़रिए चलाना। के माध्यम से जो वास्तव में फ्रेम में क्या है और आपूर्ति की गई वीडियो में क्या हो रहा है, इसकी व्याख्या कर सकता है, समय के लिए खाता है। हालांकि, यह तथ्य कि वर्तमान पत्र में दस्तावेज़ की गई घटना लागत-काटने वाले आर्किटेक्चरल दृष्टिकोण से उत्पन्न होती है, इसका संकेत नहीं देता है। लेखकों का अवलोकन करते हैं कि पाठ वर्तमान में बहुसंवेदी प्रशिक्षण परिदृश्यों में प्रमुख है, जो यह सुझाव देता है कि ‘दृश्य भाषा’ बहुसंवेदी संदर्भ में कम विकसित, कम महत्वपूर्ण या जानकारीपूर्ण है, या (कम से कम अभी के लिए) कम समझ में आता है, * दिलचस्प बात यह है कि नोटबुक एलएम द्वारा तैयार की गई सामग्री पूरी तरह से मूल या गूगल द्वारा अनुक्रमित नहीं की जा सकती है, क्योंकि मैं कोई परिणाम नहीं ढूंढ पा रहा हूं जो प्रशिक्षण डेटा में छिप सकता था और इस आउटपुट को प्रेरित कर सकता था। पहले
प्रकाशित शुक्रवार, 31 अक्टूबर, 2025; 14:20 को प्रारूपण के लिए संपादित किया गया












