Anderson का एंगल
सामाजिक मीडिया वीडियो को मशीन लर्निंग के साथ ओवर-कंप्रेस्ड करने से पुनर्स्थापित करना

चीन से नए शोध में एक प्रभावी और नए तरीके से विवरण और रिज़ॉल्यूशन को उपयोगकर्ता-अपलोडेड वीडियो में पुनर्स्थापित करने का तरीका प्रस्तुत किया गया है, जो वीचैट और यूट्यूब जैसे प्लेटफ़ॉर्म पर बैंडविथ और स्टोरेज स्पेस को बचाने के लिए स्वचालित रूप से संकुचित किया जाता है।

पिछले दृष्टिकोणों की तुलना में नए तरीके की क्षमता की तुलना सामाजिक मीडिया प्लेटफ़ॉर्म के स्वचालित अनुकूलन के दौरान छोड़े गए विवरण को फिर से हल करने के लिए। स्रोत: https://arxiv.org/pdf/2208.08597.pdf
पिछले तरीकों के विपरीत जो जेनरिक प्रशिक्षण डेटा पर आधारित वीडियो को अपस्केल और अपसैम्पल कर सकते हैं, नए तरीके में संकुचित वीडियो के प्रत्येक फ्रेम के लिए एक डिग्रेडेशन फीचर मैप (DFM) व्युत्पन्न किया जाता है – जो फ्रेम में सबसे अधिक क्षतिग्रस्त या खराब हुए क्षेत्रों का एक अवलोकन है जो संकुचित होने से उत्पन्न होता है।

नए पेपर के अपभ्रंश अध्ययन से: दूसरा दाहिना हाथ, ‘शुद्ध’ डिग्रेडेशन फीचर मैप (DFM) के लिए मैदान; तीसरा दाहिना हाथ, DFM के बिना क्षति का अनुमान। बाएं, DFM के साथ एक बहुत अधिक सटीक मानचित्र।
पुनर्स्थापना प्रक्रिया, जो कन्वोल्यूशनल न्यूरल नेटवर्क (CNNs) सहित अन्य प्रौद्योगिकियों का लाभ उठाती है, DFM में जानकारी द्वारा निर्देशित और केंद्रित है, जो नए तरीके को पिछले दृष्टिकोणों के प्रदर्शन और सटीकता को पार करने की अनुमति देता है।
प्रक्रिया के लिए मैदान सत्य को शोधकर्ताओं द्वारा उच्च गुणवत्ता वाले वीडियो को चार लोकप्रिय साझा करने वाले प्लेटफ़ॉर्म पर अपलोड करके प्राप्त किया गया था, संकुचित परिणामों को डाउनलोड किया गया था, और एक कंप्यूटर दृष्टि पाइपलाइन विकसित की गई थी जो संकुचित और विवरण हानि को सीखने में सक्षम थी, ताकि यह विभिन्न प्लेटफ़ॉर्म पर लागू किया जा सके और वीडियो को लगभग मूल गुणवत्ता में पुनर्स्थापित किया जा सके।
शोध में उपयोग किए गए सामग्री को सामाजिक मीडिया पर साझा किए गए उपयोगकर्ता वीडियो (UVSSM) नामक एक HQ/LQ डेटासेट में संकलित किया गया है, और बाद के शोध परियोजनाओं के लिए बaidu पर डाउनलोड (पासवर्ड: rsqw) के लिए उपलब्ध कराया गया है।

डाउनलोडेबल UVSSM डेटासेट (ऊपर दिए गए स्रोत URL के लिए देखें) से दो समान HQ/LQ नमूनों की तुलना। चूंकि यह उदाहरण भी कई बार संकुचित हो सकता है (छवि अनुप्रयोग, CMS, CDN, आदि), इसलिए अधिक सटीक तुलना के लिए मूल स्रोत डेटा को देखें।
सिस्टम कोड, जिसे वीडियो पुनर्स्थापना के माध्यम से अनुकूल दिग्री संवेदन (VOTES) के रूप में जाना जाता है, को गिटहब पर जारी किया गया है, हालांकि इसके कार्यान्वयन में कई पुल-आधारित निर्भरताएं शामिल हैं।
शोध पत्र का शीर्षक सामाजिक मीडिया पर साझा किए गए उपयोगकर्ता वीडियो की पुनर्स्थापना है, और यह शेन्ज़ेन विश्वविद्यालय के तीन शोधकर्ताओं और हांगकांग पॉलिटेक्निक विश्वविद्यालय के इलेक्ट्रॉनिक और सूचना अभियांत्रिकी विभाग के एक शोधकर्ता से आया है।
कलाकृतियों से तथ्यों तक
वेब-स्क्रैप्ड वीडियो की गुणवत्ता को पुनर्स्थापित करने की क्षमता, जिसमें ज़िगापिक्सेल (और अधिकांश लोकप्रिय ओपन सोर्स पैकेजों) जैसे कार्यक्रमों द्वारा प्रदान किए गए विवरण का ‘हॉलुसिनेशन’ शामिल नहीं है, का कंप्यूटर दृष्टि अनुसंधान क्षेत्र पर परिणाम हो सकता है।
वीडियो-आधारित सीवी प्रौद्योगिकियों में शोध अक्सर यूट्यूब और ट्विटर जैसे प्लेटफ़ॉर्म से प्राप्त फुटेज पर निर्भर करता है, जहां संकुचित तरीके और कोडेक्स बंद हैं, और उन्हें आसानी से कलाकृति पैटर्न या अन्य दृश्य संकेतकों के आधार पर नहीं जाना जा सकता है, और उनमें आवधिक परिवर्तन हो सकते हैं।
अधिकांश परियोजनाएं जो वेब-फाउंड वीडियो का लाभ उठाती हैं, संकुचित नहीं कर रही हैं, और उन्हें उपलब्ध वीडियो की गुणवत्ता के लिए प्लेटफ़ॉर्म द्वारा प्रदान की जाने वाली अनुमति देनी होगी, क्योंकि उन्हें मूल उच्च गुणवत्ता वाले संस्करणों तक पहुंच नहीं है जो उपयोगकर्ताओं ने अपलोड किए हैं।
इसलिए, ऐसे वीडियो को बिना किसी अन्य कंप्यूटर दृष्टि डेटासेट से प्रभावित किए, उनकी गुणवत्ता और रिज़ॉल्यूशन को पुनर्स्थापित करने की क्षमता सीवी परियोजनाओं को वर्तमान में करने के लिए आवश्यक अक्सर काम के चारों ओर और अनुकूलन को रोकने में मदद कर सकती है।
हालांकि प्लेटफ़ॉर्म जैसे यूट्यूब कभी-कभी उपयोगकर्ताओं के वीडियो को संकुचित करने के तरीके में बड़े बदलावों की घोषणा करते हैं (जैसे वीपी9), वे अपनी प्रक्रिया या उपयोग किए गए कोडेक्स और सेटिंग्स को प्रकट नहीं करते हैं।
उपयोगकर्ता-अपलोडेड वीडियो से बेहतर आउटपुट गुणवत्ता प्राप्त करना इसलिए पिछले दस वर्षों में एक प्रकार का ड्रुइडिक कला बन गया है, जिसमें विभिन्न (अधिकांश अनिश्चित) ‘काम के चारों ओर’ फैशन में जा रहे हैं।
विधि
गहरे शिक्षण-आधारित वीडियो पुनर्स्थापना के पिछले दृष्टिकोणों में जेनरिक फीचर एक्सट्रैक्शन शामिल था, या तो एकल-फ्रेम पुनर्स्थापना के दृष्टिकोण के रूप में या एक मल्टी-फ्रेम आर्किटेक्चर में जो ऑप्टिकल फ्लो (यानी, जो पुनर्स्थापना के लिए आसपास के और बाद के फ्रेमों को लेता है) का लाभ उठाता है।
इन सभी दृष्टिकोणों को ‘ब्लैक बॉक्स’ प्रभाव से निपटना पड़ा – यह तथ्य कि वे मूल प्रौद्योगिकियों में संकुचित प्रभावों की जांच नहीं कर सकते हैं, क्योंकि यह निश्चित नहीं है कि मूल प्रौद्योगिकियां क्या हैं या विशिष्ट उपयोगकर्ता-अपलोडेड वीडियो के लिए उन्हें कैसे कॉन्फ़िगर किया गया है।
VOTES, इसके बजाय, मूल और संकुचित वीडियो से सीधे प्रमुख विशेषताओं को निकालता है और रूपांतरण के पैटर्न का निर्धारण करता है जो कई प्लेटफ़ॉर्म के मानकों पर सामान्य होंगे।
VOTES एक विशेष रूप से विकसित डिग्रेडेशन सेंसिंग मॉड्यूल (DSM, ऊपर दिए गए चित्र में देखें) का उपयोग करके संवोल्यूशनल ब्लॉक्स में विशेषताओं को निकालता है। कई फ्रेम फीचर एक्सट्रैक्शन और एलाइनमेंट मॉड्यूल (FEAM) में पारित किए जाते हैं, जो तब डिग्रेडेशन मॉड्यूलेशन मॉड्यूल (DMM) में भेजे जाते हैं। अंत में, पुनर्निर्माण मॉड्यूल पुनर्स्थापित वीडियो का आउटपुट करता है।
डेटा और प्रयोग
नए कार्य में, शोधकर्ताओं ने अपने प्रयासों को वीचैट प्लेटफ़ॉर्म पर अपलोड और पुनः डाउनलोड किए गए वीडियो को पुनर्स्थापित करने पर केंद्रित किया है, लेकिन यह सुनिश्चित करने के लिए चिंतित थे कि परिणामी अल्गोरिदम अन्य प्लेटफ़ॉर्म पर अनुकूलित किया जा सकता है।
यह पता चला कि एक बार जब उन्होंने वीचैट वीडियो के लिए एक प्रभावी पुनर्स्थापना मॉडल प्राप्त किया, तो बिलिबिली, ट्विटर और यूट्यूब जैसे अन्य प्लेटफ़ॉर्म के लिए इसे अनुकूलित करने में केवल 90 सेकंड का समय लगा (एक मशीन पर 4 NVIDIA Tesla P40 GPU के साथ कुल 96GB VRAM)।

वीचैट मॉडल को अन्य वीडियो-साझा करने वाले प्लेटफ़ॉर्म में अनुकूलित करना काफी आसान साबित हुआ। यहां हम VOTES को विभिन्न प्लेटफ़ॉर्म पर लगभग तुरंत समानता के साथ प्रदर्शन करते हुए देख रहे हैं, जो शोधकर्ताओं के अपने UVSSM डेटासेट और REDS डेटासेट (नीचे देखें) का उपयोग कर रहे हैं।
UVSSM डेटासेट को आबाद करने के लिए, शोधकर्ताओं ने 264 वीडियो एकत्र किए, जो 5-30 सेकंड के बीच थे, प्रत्येक में 30fps फ्रेम दर, मोबाइल फोन कैमरों से या इंटरनेट से सोर्स किया गया था। वीडियो 1920 x 1080 या 1280 x 270 रिज़ॉल्यूशन में थे।
सामग्री (पिछले चित्र में देखें) में शहर के दृश्य, परिदृश्य, लोग, और जानवर शामिल थे, साथ ही कई अन्य विषय, और क्रिएटिव कॉमन्स एट्रीब्यूशन लाइसेंस के माध्यम से सार्वजनिक डेटासेट में पुन: उपयोग के लिए उपलब्ध हैं।
शोधकर्ताओं ने 214 वीडियो को पांच अलग-अलग मोबाइल फोन ब्रांडों का उपयोग करके वीचैट पर अपलोड किया, वीचैट के डिफ़ॉल्ट वीडियो रिज़ॉल्यूशन 960×540 (जब तक कि स्रोत वीडियो पहले से ही इन आयामों से छोटा न हो) प्राप्त किया, जो लोकप्रिय प्लेटफ़ॉर्म पर सबसे अधिक ‘दंडात्मक’ रूपांतरणों में से एक है।

ऊपर-बाएं, मूल HQ फ्रेम तीन बढ़े हुए खंडों के साथ; ऊपर-दाएं,同 फ्रेम एक प्लेटफ़ॉर्म-दिग्री संकुचित संस्करण से; नीचे-बाएं, संकुचित फ्रेम की गणना की गई दिग्री; और नीचे-दाएं, VOTES के लिए परिणामी ‘कार्य क्षेत्र’। स्पष्ट रूप से, लो-क्वालिटी छवि का आकार HQ का आधा है, लेकिन यहां तुलना के लिए पुनर्निर्धारित किया गया है।
बाद में अन्य प्लेटफ़ॉर्म के रूपांतरण तरीकों की तुलना के लिए, शोधकर्ताओं ने 50 वीडियो को मूल 214 में शामिल नहीं किया और बिलिबिली, यूट्यूब और ट्विटर पर अपलोड किया। मूल रिज़ॉल्यूशन 1280×270 था, और डाउनलोड किए गए संस्करण 640×360 पर खड़े थे।
यह UVSSM डेटासेट को कुल 364 जोड़े में लाता है – मूल (HQ) और साझा (LQ) वीडियो, जिनमें से 214 वीचैट के लिए और 50 बिलिबिली, यूट्यूब और ट्विटर के लिए हैं।
प्रयोगों के लिए, 10 यादृच्छिक वीडियो को परीक्षण सेट के रूप में चुना गया था, चार को सत्यापन सेट के रूप में और शेष 200 को मुख्य प्रशिक्षण सेट के रूप में। प्रयोग पांच बार के-फोल्ड क्रॉस-वैलिडेशन के साथ किए गए थे, और परिणाम इन उदाहरणों में औसतन थे।
वीडियो पुनर्स्थापना के परीक्षण में, VOTES की तुलना स्पेसियो-टेम्पोरल डिफॉर्मेबल फ्यूजन (STDF) से की गई थी। रिज़ॉल्यूशन उन्नयन के लिए, इसे एन्हांस्ड डिफॉर्मेबल कन्वोल्यूशनल (EDVR), RSDN, वीडियो सुपर-रिज़ॉल्यूशन के साथ टेम्पोरल ग्रुप अटेंशन (VSR_TGA), और BasicVSR के खिलाफ परीक्षण किया गया था। गूगल का एकल-स्टेज तरीका COMISR भी शामिल था, हालांकि यह अन्य पिछले कार्यों के आर्किटेक्चर प्रकार से मेल नहीं खाता है।
विधियों का परीक्षण UVSS और REDS डेटासेट के खिलाफ किया गया था, जिसमें VOTES ने उच्चतम स्कोर हासिल किए थे:
लेखकों का दावा है कि गुणात्मक परिणाम भी VOTES की पिछले सिस्टमों के खिलाफ श्रेष्ठता को दर्शाते हैं:

प्रतिस्पर्धी दृष्टिकोणों द्वारा पुनर्स्थापित REDS वीडियो फ्रेम। केवल संकेतक रिज़ॉल्यूशन – विस्तृत रिज़ॉल्यूशन के लिए कागज़ देखें।
पहले प्रकाशित 19 अगस्त 2022 को。















