Anderson का एंगल

एक वीडियो कोडेक जो एआई विश्लेषण के लिए डिज़ाइन किया गया है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

हालांकि टेक्नो-थ्रिलर द सर्कल (2017) सोशल नेटवर्क्स के नैतिक परिणामों पर टिप्पणी करने के लिए अधिक है, लेकिन कहानी के केंद्र में ‘सीचेंज’ कैमरा वास्तव में फिल्म को ‘विज्ञान-कथा’ श्रेणी में धकेलता है।

टेक्नो-थ्रिलर 'द सर्कल' (2017) से 'सीचेंज' कैमरा/सर्विलांस डिवाइस।

टेक्नो-थ्रिलर ‘द सर्कल’ (2017) से ‘सीचेंज’ कैमरा/सर्विलांस डिवाइस।

एक वायरलेस और फ्री-रोमिंग डिवाइस, जो एक बड़े मोती के आकार का है, यह नहीं है कि यह सौर पैनलों की कमी या अन्य पर्यावरणीय स्रोतों (जैसे रेडियो तरंगें) से शक्ति प्राप्त करने की अकुशलता है, लेकिन यह है कि यह 24/7 वीडियो संपीड़न करने जा रहा है, जो कि यह अपने सीमित चार्ज को बनाए रखने में सक्षम होगा।

सस्ते सेंसर्स को शक्ति प्रदान करना कंप्यूटर विजन (सीवी) और वीडियो विश्लेषण में एक मुख्य अनुसंधान क्षेत्र है, विशेष रूप से गैर-शहरी वातावरण में जहां सेंसर को सीमित शक्ति संसाधनों (बatteries, सौर, आदि) से अधिकतम प्रदर्शन प्राप्त करना होगा।

ऐसे मामलों में जहां इस प्रकार के एक एज आईओटी/सीवी डिवाइस को एक केंद्रीय सर्वर (आमतौर पर पारंपरिक सेल कवरेज नेटवर्क के माध्यम से) को छवि सामग्री भेजनी होती है, विकल्प कठिन होते हैं: या तो डिवाइस को एक प्रकार का हल्का न्यूरल नेटवर्क स्थानीय रूप से चलाना होगा ताकि केवल अनुकूलित डेटा के खंडों को सर्वर-साइड प्रोसेसिंग के लिए भेजा जा सके; या यह ‘मूर्ख’ वीडियो को भेजना होगा जिसे प्लग्ड-इन क्लाउड संसाधनों द्वारा मूल्यांकन किया जा सकता है।

शक्ति पर चिपके रहना

इसके अलावा, यहां तक कि अस्थायी सक्रियण (अर्थात एक भेड़ कभी-कभी दृष्टि में आती है), डिवाइस के पास पर्याप्त शक्ति नहीं है कि यह गिगाबाइट्स के अनकम्प्रेस्ड वीडियो को भेज सके; न ही इसके पास पर्याप्त शक्ति है कि यह लगातार लोकप्रिय वीडियो संपीड़न कोडेक्स जैसे कि एच.264/5 को चला सके, जो कि हार्डवेयर की अपेक्षा करते हैं जो या तो प्लग्ड-इन हैं या अगले चार्जिंग सत्र से बहुत दूर नहीं हैं।

तीन आम कंप्यूटर विजन कार्यों के लिए वीडियो विश्लेषण पाइपलाइनें। वीडियो एन्कोडिंग आर्किटेक्चर को कार्य के लिए प्रशिक्षित किया जाना चाहिए, और आमतौर पर न्यूरल नेटवर्क के लिए जो डेटा प्राप्त करेगा। स्रोत: https://arxiv.org/pdf/2204.12534.pdf

तीन आम कंप्यूटर विजन कार्यों के लिए वीडियो विश्लेषण पाइपलाइनें। वीडियो एन्कोडिंग आर्किटेक्चर को कार्य के लिए प्रशिक्षित किया जाना चाहिए, और आमतौर पर न्यूरल नेटवर्क के लिए जो डेटा प्राप्त करेगा। स्रोत: https://arxiv.org/pdf/2204.12534.pdf

हालांकि व्यापक रूप से प्रसारित एच.264 कोडेक में इसके उत्तराधिकारी एच.265 की तुलना में कम ऊर्जा खपत है, लेकिन इसकी संपीड़न दक्षता खराब है। इसके उत्तराधिकारी, एच.265, में बेहतर संपीड़न दक्षता है, लेकिन उच्च शक्ति खपत है। जबकि गूगल के ओपन-सोर्स वीपी9 कोडेक दोनों क्षेत्रों में उन्हें पार करता है, यह स्थानीय गणना संसाधनों की अधिक आवश्यकता होती है, जो एक सस्ते आईओटी सेंसर में अतिरिक्त समस्याएं प्रस्तुत करता है।

स्थानीय रूप से विश्लेषण करने के लिए: जब आप एक हल्के स्थानीय न्यूरल नेटवर्क चलाते हैं ताकि यह निर्धारित किया जा सके कि कौन से फ्रेम (या एक फ्रेम के क्षेत्र) सर्वर-साइड डीएनएन के लिए भेजने योग्य हैं, तो आप अक्सर उस शक्ति को खर्च कर चुके होते हैं जो आप सिर्फ सभी फ्रेम भेजने से बचा सकते थे।

एक सेंसर के साथ मवेशियों के मास्क्ड प्रतिनिधित्व को निकालना जो ग्रिड-कनेक्टेड नहीं है। क्या यह अपनी सीमित शक्ति क्षमता को स्थानीय सेमांटिक सेगमेंटेशन पर खर्च करता है; सर्वर को सीमित जानकारी भेजने के लिए (लेटेंसी का परिचय देते हुए); या 'मूर्ख' डेटा (बैंडविथ पर ऊर्जा बर्बाद करते हुए) भेजने के लिए?

एक सेंसर के साथ मवेशियों के मास्क्ड प्रतिनिधित्व को निकालना जो ग्रिड-कनेक्टेड नहीं है। क्या यह अपनी सीमित शक्ति क्षमता को स्थानीय सेमांटिक सेगमेंटेशन पर खर्च करता है; सर्वर को सीमित जानकारी भेजने के लिए (लेटेंसी का परिचय देते हुए); या ‘मूर्ख’ डेटा (बैंडविथ पर ऊर्जा बर्बाद करते हुए) भेजने के लिए? स्रोत: https://arxiv.org/pdf/1807.01972.pdf

यह स्पष्ट है कि ‘वाइल्ड’ में कंप्यूटर विजन परियोजनाओं को विशिष्ट न्यूरल नेटवर्क्स की आवश्यकताओं के लिए अनुकूलित वीडियो संपीड़न कोडेक्स की आवश्यकता होती है, जैसे कि सेमांटिक सेगमेंटेशन, कीपॉइंट डिटेक्शन (मानव आंदोलन विश्लेषण) और ऑब्जेक्ट डिटेक्शन, अन्य संभावित अंत उपयोगों के बीच।

AccMPEG

शिकागो विश्वविद्यालय से नए शोध ने ऐसे कोडेक की ओर एक कदम बढ़ाया है, जिसे AccMPEG कहा जाता है – एक नovel वीडियो एन्कोडिंग और स्ट्रीमिंग फ्रेमवर्क जो कम विलंबता, उच्च सटीकता के साथ काम करता है सर्वर-साइड डीप न्यूरल नेटवर्क्स (डीएनएन) के लिए, और जिसमें आश्चर्यजनक रूप से कम स्थानीय गणना आवश्यकताएं हैं।

AccMPEG की आर्किटेक्चर। स्रोत: https://arxiv.org/pdf/2204.12534.pdf

AccMPEG की आर्किटेक्चर। स्रोत: https://arxiv.org/pdf/2204.12534.pdf

सिस्टम पूर्ववर्ती विधियों पर अर्थव्यवस्था करता है क्योंकि यह प्रत्येक 16x16px मैक्रोब्लॉक के प्रभाव का आकलन करता है जो सर्वर-साइड डीएनएन की सटीकता को प्रभावित कर सकता है। पिछली विधियों ने आमतौर पर इस प्रकार की सटीकता का आकलन प्रत्येक पिक्सेल पर या फिर स्थानीय संचालन करने के लिए प्रदर्शन किया है जो छवि के क्षेत्रों का आकलन कर सकते हैं जो सबसे अधिक रुचि के हो सकते हैं।

AccMPEG में, यह सटीकता एक कस्टम मॉड्यूल में अनुमानित है, जिसे AccGrad कहा जाता है, जो मैक्रोब्लॉक की एन्कोडिंग गुणवत्ता के प्रभाव को मापता है जो अंतिम उपयोग के मामले में प्रासंगिक हो सकता है, जैसे कि एक सर्वर-साइड डीएनएन जो लोगों की गिनती करने, मानव आंदोलन पर कंकाल अनुमान लगाने या अन्य सामान्य कंप्यूटर विजन कार्यों का प्रदर्शन करने का प्रयास कर रहा है।

प्रशिक्षण लॉजिस्टिक्स

आदर्श रूप से, एक कंप्यूटर विजन कोडेक को एक प्लग्ड-इन सिस्टम पर एक विशिष्ट न्यूरल नेटवर्क की आवश्यकताओं के लिए पूर्व-प्रशिक्षित किया जाना चाहिए। AccGrad मॉड्यूल, हालांकि, केवल दो फॉरवर्ड प्रोपेगेशन के साथ एक डीएनएन से直接 प्राप्त किया जा सकता है, जो मानक ओवरहेड के दस गुना की बचत है।

AccMPEG AccGrad को केवल 15 एपोक्स के लिए प्रशिक्षित करता है, प्रत्येक में तीन प्रोपेगेशन, और इसे संभावित रूप से ‘लाइव’ प्रशिक्षित किया जा सकता है इसके वर्तमान मॉडल राज्य का उपयोग करके, कम से कम समान रूप से निर्दिष्ट सीवी कार्यों के लिए।

AccModel प्री-ट्रेन्ड मोबाइलनेट-एसएसडी फीचर एक्सट्रैक्टर का उपयोग करता है, जो सस्ते एज डिवाइसों में सामान्य है। 12 जीएफएलओपीएस पर, मॉडल टाइपिकल रेसनेट18 दृष्टिकोणों का केवल एक तिहाई उपयोग करता है। बैच नॉर्मलाइजेशन और एक्टिवेशन के अलावा, आर्किटेक्चर में केवल कन्वोल्यूशनल लेयर्स होती हैं, और इसका गणना ओवरहेड फ्रेम आकार के अनुपात में होता है।

AccGrad अंतिम डीएनएन अनुमान की आवश्यकता को हटा देता है, तैनाती लॉजिस्टिक्स में सुधार करता है।

AccGrad अंतिम डीएनएन अनुमान की आवश्यकता को हटा देता है, तैनाती लॉजिस्टिक्स में सुधार करता है।

फ्रेम दर

आर्किटेक्चर 10fps पर ऑप्टिमल रूप से चलता है, जो कृषि निगरानी, भवन क्षय निगरानी, उच्च दृश्य यातायात विश्लेषण और मानव आंदोलन में कंकाल अनुमान जैसे उद्देश्यों के लिए उपयुक्त होगा; हालांकि, तेजी से चलती परिदृश्य, जैसे कि निम्न-दृश्य यातायात (कारों या लोगों की), और अन्य स्थितियां जहां उच्च फ्रेम दरें लाभदायक होती हैं, इस दृष्टिकोण के लिए उपयुक्त नहीं हैं।

प्रदर्शन सुधार

शोधकर्ताओं ने सिस्टम का परीक्षण एक $60 जेटसन नैनो बोर्ड पर किया, जिसमें एक 128-कोर मैक्सवेल जीपीयू था, और विभिन्न अन्य सस्ते समकक्षों पर। ओपनवीआईएनओ का उपयोग कुछ ऊर्जा आवश्यकताओं को सीपीयू पर ऑफसेट करने के लिए किया गया था जो बहुत पतले स्थानीय डीएनएन थे।

AccModel को मूल रूप से एक सर्वर पर 8 जीफोर्स आरटीएक्स 2080एस जीपीयू के साथ ऑफलाइन प्रशिक्षित किया गया था। हालांकि यह एक प्रारंभिक मॉडल बिल्ड के लिए एक प्रभावशाली कंप्यूटिंग शक्ति है, लेकिन सिस्टम द्वारा संभव किए गए हल्के पुनः-प्रशिक्षण, और एक मॉडल को विभिन्न डीएनएन के लिए विशिष्ट सहनशीलता पैरामीटर तक समायोजित करने का तरीका, इसका मतलब है कि AccMPEG एक ऐसे सिस्टम का हिस्सा बन सकता है जिसे वाइल्ड में न्यूनतम उपस्थिति की आवश्यकता होती है।

पहली बार 1 मई 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]