Anderson का एंगल

एआई का उपयोग करके लंबे ‘कैसे करें’ वीडियो का सारांश बनाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यदि आप यूट्यूब के ‘कैसे करें’ वीडियो की गति को बढ़ाने के लिए तैयार हैं ताकि आप वास्तव में जिस जानकारी की आवश्यकता है उसे प्राप्त कर सकें; वीडियो की प्रतिलिपि को देखने के लिए परामर्श दें ताकि लंबे और अक्सर प्रायोजित रनटाइम में छिपी हुई आवश्यक जानकारी प्राप्त की जा सके; या अन्यथा आशा है कि विकिहाउ ने सूचना का एक कम समय लेने वाला संस्करण बनाने के लिए निर्देशात्मक वीडियो में जाने का फैसला किया है, तो यूसी बर्कले, गूगल रिसर्च और ब्राउन विश्वविद्यालय से एक नया परियोजना आपके लिए दिलचस्प हो सकती है।

शीर्षक TL;DW? निर्देशात्मक वीडियो का सारांश करना कार्य प्रासंगिकता और क्रॉस-मॉडल सैलिएंसी के साथ, नया पत्र एआई-सहायता प्राप्त वीडियो सारांश प्रणाली के निर्माण के विवरण को रेखांकित करता है जो वीडियो से प्रासंगिक चरणों की पहचान कर सकती है और बाकी सब कुछ को हटा सकती है, जिसके परिणामस्वरूप संक्षिप्त सारांश तैयार होते हैं जो जल्दी से मुद्दे को समझाने में मदद करते हैं।

विकिहाउ के द्वारा मौजूदा लंबे वीडियो क्लिप का शोषण दोनों पाठ और वीडियो जानकारी के लिए IV-योग परियोजना द्वारा नकली सारांश तैयार करने के लिए उपयोग किया जाता है जो प्रणाली को प्रशिक्षित करने के लिए आधार सत्य प्रदान करता है। स्रोत: https://arxiv.org/pdf/2208.06773.pdf

विकिहाउ के द्वारा मौजूदा लंबे वीडियो क्लिप का शोषण दोनों पाठ और वीडियो जानकारी के लिए IV-योग परियोजना द्वारा नकली सारांश तैयार करने के लिए उपयोग किया जाता है जो प्रणाली को प्रशिक्षित करने के लिए आधार सत्य प्रदान करता है। स्रोत: https://arxiv.org/pdf/2208.06773.pdf

परिणामी सारांश मूल वीडियो के रनटाइम का एक अंश है, जबकि बहु-मोडल (यानी, पाठ-आधारित) जानकारी भी प्रक्रिया के दौरान रिकॉर्ड की जाती है ताकि भविष्य की प्रणालियों को संभावित रूप से विकिहाउ-शैली के ब्लॉग पोस्ट के निर्माण को स्वचालित करने में मदद मिल सके जो एक लंबे ‘कैसे करें’ वीडियो को एक संक्षिप्त और खोज योग्य लेख में परिवर्तित कर सकते हैं, जिसमें चित्र शामिल हो सकते हैं, संभावित रूप से समय और निराशा की बचत हो सकती है।

नई प्रणाली को IV-योग (‘निर्देशात्मक वीडियो सारांशक’) कहा जाता है, और खुले स्रोत रेसनेट-50 कंप्यूटर दृष्टि मान्यता एल्गोरिदम का उपयोग करता है, साथ ही साथ कई अन्य तकनीकों का उपयोग करता है, एक लंबे स्रोत वीडियो के प्रासंगिक फ्रेम और खंडों को व्यक्तिगत करने के लिए।

IV-योग के लिए अवधारणात्मक कार्य-प्रवाह।

IV-योग के लिए अवधारणात्मक कार्य-प्रवाह।

प्रणाली विकिहाउ वेबसाइट के सामग्री संरचना से उत्पन्न पseudo-summaries पर प्रशिक्षित है, जहां वास्तविक लोग अक्सर लोकप्रिय निर्देशात्मक वीडियो को एक समतल, पाठ-आधारित मल्टीमीडिया रूप में परिवर्तित करते हैं, अक्सर स्रोत निर्देशात्मक वीडियो से ली गई छोटी क्लिप और एनिमेटेड जीआईएफ का उपयोग करते हैं।

परियोजना के बारे में चर्चा करते हुए, लेखकों ने कहा:

‘विकिहाउ वीडियो वेबसाइट पर प्रत्येक लेख में एक मुख्य निर्देशात्मक वीडियो होता है जो एक कार्य का प्रदर्शन करता है जिसमें अक्सर प्रायोजित सामग्री शामिल होती है, कैमरे के सामने बोलने वाले प्रशिक्षक के क्लिप और कार्य के लिए महत्वपूर्ण नहीं होने वाले चरण शामिल होते हैं। ‘

‘जो दर्शक कार्य का अवलोकन करना चाहते हैं उन्हें एक छोटा वीडियो पसंद आएगा जिसमें उपरोक्त सभी अप्रासंगिक जानकारी न हो। विकिहाउ लेख (जैसे कि सुशी चावल बनाने के लिए कैसे) में यही है: वीडियो में महत्वपूर्ण चरणों को शामिल करने वाला पाठ जो चित्र/क्लिप के साथ चरणों को दर्शाता है।’

परिणामी डेटाबेस को विकिहाउ सारांश कहा जाता है। डेटाबेस में 2,106 इनपुट वीडियो और उनके संबंधित सारांश शामिल हैं। यह वीडियो सारांश परियोजनाओं के लिए सामान्य रूप से उपलब्ध डेटासेट की तुलना में काफी बड़ा है, जिन्हें आमतौर पर महंगा और श्रम-सघन मैनुअल लेबलिंग और एनोटेशन की आवश्यकता होती है – एक प्रक्रिया जिसे नए कार्य में बड़े पैमाने पर स्वचालित किया गया है, विकिहाउ सारांश के अधिक सीमित दायरे के कारण निर्देशात्मक (न कि सामान्य) वीडियो का सारांश तैयार करने के लिए।

IV-योग समय 3D कन्वोल्यूशनल न्यूरल नेटवर्क प्रतिनिधित्व का लाभ उठाता है, पिछले समान कार्यों की विशेषता वाले फ्रेम-आधारित प्रतिनिधित्व के बजाय, और पत्र में विस्तृत एक ablation अध्ययन यह पुष्टि करता है कि इस दृष्टिकोण के सभी घटक प्रणाली के कार्य के लिए आवश्यक हैं।

IV-योग ने विभिन्न तुलनात्मक फ्रेमवर्क के खिलाफ अनुकूल परीक्षण किया, जिनमें CLIP-It (जिस पर पत्र के कई लेखकों ने भी काम किया था) शामिल है।

विधि

सारांश प्रक्रिया में पहला चरण एक अपेक्षाकृत कम-प्रयास, कमजोर-पर्यवेक्षित एल्गोरिदम का उपयोग करना है जो एक बड़ी संख्या में वेब-स्क्रैप्ड निर्देशात्मक वीडियो के लिए pseudo-summaries और फ्रेम-वार महत्व स्कोर बनाने के लिए है, प्रत्येक वीडियो में केवल एक कार्य लेबल है।

इसके बाद, एक निर्देशात्मक सारांश नेटवर्क को इस डेटा पर प्रशिक्षित किया जाता है। प्रणाली स्वचालित रूप से लिखित भाषा (जैसे कि यूट्यूब के अपने एआई-जनित उपशीर्षक) और स्रोत वीडियो को इनपुट के रूप में लेती है।

नेटवर्क में एक वीडियो एनकोडर और एक सेगमेंट स्कोरिंग ट्रांसफॉर्मर (एसएसटी) शामिल है, और प्रशिक्षण pseudo-summaries में सौंपे गए महत्व स्कोर द्वारा निर्देशित है। अंतिम सारांश उच्च महत्व स्कोर वाले खंडों को जोड़कर बनाया जाता है।

पत्र से:

‘हमारे pseudo सारांश जनरेशन पाइपलाइन के पीछे मुख्य अंतर्दृष्टि यह है कि दिए गए कई वीडियो के साथ, कार्य के लिए महत्वपूर्ण चरण कई वीडियो में दिखाई देंगे (कार्य प्रासंगिकता)। ‘

‘इसके अलावा, यदि एक चरण महत्वपूर्ण है, तो यह आमतौर पर प्रदर्शक के लिए इस चरण के बारे में बोलने के लिए होता है, या तो चरण को प्रदर्शित करने से पहले, उसके दौरान या बाद में। इसलिए, वीडियो के लिए स्वचालित भाषण मान्यता (एएसआर) का उपयोग करके प्राप्त उपशीर्षक इन महत्वपूर्ण चरणों को संदर्भित करेंगे (क्रॉस-मॉडल सैलिएंसी)।’

पseudo सारांश को उत्पन्न करने के लिए, वीडियो को पहले समान रूप से खंडों में विभाजित किया जाता है, और खंडों को उनकी दृश्य समानता के आधार पर 'चरणों' (चित्र में विभिन्न रंग) में समूहित किया जाता है। इन चरणों को 'कार्य प्रासंगिकता' और 'क्रॉस-मॉडल सैलिएंसी' (एएसआर पाठ और छवियों के बीच संबंध) के आधार पर महत्व स्कोर सौंपे जाते हैं। उच्च स्कोर वाले चरण pseudo सारांश में चरणों का प्रतिनिधित्व करने के लिए चुने जाते हैं।

पseudo सारांश को उत्पन्न करने के लिए, वीडियो को पहले समान रूप से खंडों में विभाजित किया जाता है, और खंडों को उनकी दृश्य समानता के आधार पर ‘चरणों’ (चित्र में विभिन्न रंग) में समूहित किया जाता है। इन चरणों को ‘कार्य प्रासंगिकता’ और ‘क्रॉस-मॉडल सैलिएंसी’ (एएसआर पाठ और छवियों के बीच संबंध) के आधार पर महत्व स्कोर सौंपे जाते हैं। उच्च स्कोर वाले चरण pseudo सारांश में चरणों का प्रतिनिधित्व करने के लिए चुने जाते हैं।

प्रणाली क्रॉस-मॉडल सैलिएंसी का उपयोग करके प्रत्येक चरण की प्रासंगिकता की स्थापना में मदद करती है, जिसमें व्याख्या की गई भाषा की तुलना वीडियो में छवियों और क्रियाओं से की जाती है। यह एक पूर्व-प्रशिक्षित वीडियो-पाठ मॉडल का उपयोग करके किया जाता है, जहां प्रत्येक तत्व संयुक्त रूप से एमआईएल-एनसीई नुकसान के तहत प्रशिक्षित होता है, जिसमें 3डी सीएनएन वीडियो एनकोडर शामिल है, जिसे डीपमाइंड सहित अन्य लोगों द्वारा विकसित किया गया है।

एक सामान्य महत्व स्कोर इन कार्य प्रासंगिकता और क्रॉस-मॉडल विश्लेषण चरणों से गणना की गई औसत से प्राप्त किया जाता है।

डेटा

प्रक्रिया के लिए एक प्रारंभिक pseudo-summaries डेटासेट उत्पन्न किया गया था, जिसमें दो पूर्व डेटासेट – COIN, 2019 में 11,000 वीडियो शामिल हैं जो 180 कार्यों से संबंधित हैं; और क्रॉस-टास्क, जिसमें 4,700 निर्देशात्मक वीडियो शामिल हैं, जिनमें से 3,675 शोध में उपयोग किए गए थे। क्रॉस-टास्क में 83 अलग-अलग कार्य हैं।

ऊपर, COIN के उदाहरण; नीचे, क्रॉस-टास्क के। स्रोत, क्रमशः: https://arxiv.org/pdf/1903.02874.pdf और https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

ऊपर, COIN के उदाहरण; नीचे, क्रॉस-टास्क के। स्रोत, क्रमशः: https://arxiv.org/pdf/1903.02874.pdf और https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

केवल उन वीडियो का उपयोग करके जो दोनों डेटासेट में शामिल हैं, शोधकर्ता 12,160 वीडियो प्राप्त करने में सक्षम थे, जो 263 अलग-अलग कार्यों को कवर करते हैं, और 628.53 घंटे की सामग्री के लिए।

विकिहाउ-आधारित डेटासेट को आबाद करने और प्रणाली के लिए आधार सत्य प्रदान करने के लिए, लेखकों ने विकिहाउ वीडियो के लिए सभी लंबे निर्देशात्मक वीडियो को स्क्रैप किया, साथ ही साथ प्रत्येक चरण से संबंधित छवियों और वीडियो क्लिप (यानी, जीआईएफ)। इसलिए, विकिहाउ की व्युत्पन्न सामग्री की संरचना नए सिस्टम में चरणों के व्यक्तिगतकरण के लिए एक टेम्पलेट के रूप में कार्य करने के लिए थी।

रेसनेट50 द्वारा निकाले गए विशेषताओं का उपयोग विकिहाउ छवियों में चुनिंदा वीडियो खंडों को क्रॉस-मैच करने और चरणों के स्थानीयकरण के लिए किया गया था। 5-सेकंड वीडियो विंडो के भीतर सबसे समान प्राप्त छवि को एंकर बिंदु के रूप में उपयोग किया गया था।

इन छोटी क्लिप को फिर से वीडियो में जोड़कर मॉडल के प्रशिक्षण के लिए आधार सत्य बनाया गया।

प्रत्येक फ्रेम में लेबल सौंपे गए थे ताकि यह घोषित किया जा सके कि वे इनपुट सारांश में शामिल हैं या नहीं, प्रत्येक वीडियो को शोधकर्ताओं द्वारा एक फ्रेम-स्तरीय बाइनरी लेबल प्राप्त हुआ, और सेगमेंट में सभी फ्रेम के लिए महत्व स्कोर का एक औसत सारांश स्कोर प्राप्त किया गया।

इस चरण पर, प्रत्येक निर्देशात्मक वीडियो में ‘चरण’ अब पाठ-आधारित डेटा से जुड़े हुए थे और लेबल किए गए थे।

प्रशिक्षण, परीक्षण और मेट्रिक्स

अंतिम विकिहाउ डेटासेट को 1,339 परीक्षण वीडियो और 768 सत्यापन वीडियो में विभाजित किया गया था – वीडियो विश्लेषण के लिए समर्पित गैर-कच्चे डेटासेट के औसत आकार में एक उल्लेखनीय वृद्धि।

नेटवर्क के वीडियो और पाठ एनकोडर को एक एस3डी नेटवर्क पर प्रशिक्षित किया गया था, जिसमें एक पूर्व-प्रशिक्षित हाउटू100एम मॉडल से भार लोड किए गए थे जो एमआईएल-एनसीई नुकसान के तहत थे।

मॉडल को एडम ऑप्टिमाइज़र के साथ 0.01 की लर्निंग दर पर प्रशिक्षित किया गया था, 24 के बैच आकार पर, आठ एनवीडिया आरटीएक्स 2080 जीपीयू पर वितरित डेटा समानांतर लिंकिंग के माध्यम से, कुल 24GB वितरित वीआरएएम के लिए।

IV-योग को तब विभिन्न परिदृश्यों में CLIP-It के साथ तुलना की गई, समान पूर्व कार्यों के अनुसार, जिसमें CLIP-It पर एक अध्ययन शामिल था। मेट्रिक्स का उपयोग किया गया था सटीकता, रिकॉल और एफ-स्कोर मान, तीन अनुप्रवेशित बेसलाइन (विवरण के लिए पत्र देखें) पर।

परिणाम पहले की छवि में सूचीबद्ध हैं, लेकिन शोधकर्ता अतिरिक्त रूप से नोट करते हैं कि CLIP-It परीक्षणों के विभिन्न चरणों में संभावित चरणों को याद करता है जो IV-योग नहीं करता है। वे इसे CLIP-It को छोटे डेटासेट का उपयोग करके प्रशिक्षित और विकसित किए जाने के लिए जिम्मेदार ठहराते हैं जो नए विकिहाउ कॉर्पस की तुलना में काफी छोटा है।

निहितार्थ

इस शोध शाखा (जिसे IV-योग साझा करता है) का संभावित दीर्घकालिक मूल्य यह हो सकता है कि निर्देशात्मक वीडियो क्लिप को पारंपरिक खोज इंजन इंडेक्सिंग के लिए अधिक सुलभ बनाना और वीडियो के लिए उस प्रकार के कमी ‘स्निपेट’ को सक्षम करना जो गूगल अक्सर एक लंबे पारंपरिक लेख से निकालता है।

स्पष्ट रूप से, किसी भी एआई-सहायता प्राप्त प्रक्रिया का विकास जो वीडियो सामग्री पर हमारे द्वारा लागू किए जाने वाले रेखीय और अनन्य ध्यान के लिए हमारे दायित्व को कम करता है, इसका विपणनकर्ताओं के लिए जो एक पीढ़ी के लिए वीडियो की अपारदर्शिता के कारण हमें विशेष रूप से आकर्षित करने में सक्षम महसूस करते हैं, इसके परिणामस्वरूप हो सकता है।

चूंकि ‘मूल्यवान’ सामग्री का स्थान निर्धारित करना मुश्किल है, उपयोगकर्ता-योगदान वाले वीडियो ने उत्पाद प्लेसमेंट, प्रायोजक स्लॉट और वीडियो के मूल्य प्रस्ताव में अक्सर शामिल की जाने वाली सामान्य स्वयं-महत्वाकांक्षा के प्रति मीडिया उपभोक्ताओं से व्यापक (यदि अनिच्छुक) सहनशीलता का आनंद लिया है। जैसे IV-योग जैसी परियोजनाएं वीडियो सामग्री के उप-फेसेट्स को अंततः वीडियो के मूल्य प्रस्ताव से अलग और अलग करने का वादा करती हैं जो कई लोगों को सामग्री के विपणन और गैर-सामग्री के बाहर निकलने के लिए मानते हैं।

 

पहली बार 16 अगस्त 2022 को प्रकाशित। 16 अगस्त को 2.52 बजे अपडेट किया गया, दोहराए गए वाक्यांश को हटा दिया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai