Anderson का एंगल

हानिकारक वीडियो सामग्री की पहचान करना मूवी ट्रेलर और मशीन लर्निंग के साथ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

स्वीडिश मीडिया काउंसिल के एक शोध पत्र में ‘हानिकारक सामग्री’ की स्वचालित पहचान के लिए एक संभावित नई दृष्टिकोण का वर्णन किया गया है, जिसमें ऑडियो और वीडियो सामग्री को अलग-अलग माना जाता है और मानव-annotated डेटा को संभावित रूप से परेशान करने वाली सामग्री के लिए एक मार्गदर्शक सूचकांक के रूप में उपयोग किया जाता है।

इस पत्र का शीर्षक क्या यह हानिकारक है? वीडियो से हानिकारकता रेटिंग की भविष्यवाणी सीखना है, जो पत्र में दिखाया गया है, जिसमें मशीन लर्निंग प्रणालियों को पूरे दृश्य के संदर्भ में विचार करने और कई तरीकों से निर्दोष सामग्री (जैसे कि हास्य या व्यंग्य सामग्री) को हानिकारक के रूप में गलत व्याख्या करने की आवश्यकता को दर्शाया गया है।

संभावित रूप से हानिकारक वीडियो का डेटासेट

शोधकर्ताओं ने उल्लेख किया है कि इस क्षेत्र में उपयोगी विकास को फिल्मों के कॉपीराइट संरक्षण द्वारा बाधित किया गया है, जो सार्वजनिक डेटासेट के निर्माण को समस्याग्रस्त बनाता है। उन्होंने यह भी देखा है कि पहले के प्रयोगों में पूर्ण लंबाई वाली फिल्मों के लिए लेबल की कमी के कारण समस्या उत्पन्न हुई है, जिसके परिणामस्वरूप पिछले कार्यों में डेटा को सरल बनाने या केवल एक पहलू पर ध्यान केंद्रित करने की आवश्यकता हुई है, जैसे कि प्रमुख रंग या संवाद विश्लेषण।

इस समस्या को हल करने के लिए, शोधकर्ताओं ने 4000 वीडियो क्लिप का एक डेटासेट तैयार किया है, जो लगभग दस सेकंड की लंबाई वाले ट्रेलर को काटकर बनाया गया है, जिन्हें स्वीडन में नए फिल्मों के लिए रेटिंग लागू करने वाले पेशेवर फिल्म वर्गीकरणकर्ताओं द्वारा लेबल किया गया है, जिनमें से कई बाल मनोविज्ञान में पेशेवर योग्यता रखते हैं।

स्वीडिश फिल्म वर्गीकरण प्रणाली के तहत, ‘हानिकारक’ सामग्री को बच्चों में चिंता, भय और अन्य नकारात्मक प्रभाव पैदा करने की संभावित प्रवृत्ति के आधार पर परिभाषित किया जाता है। शोधकर्ताओं ने उल्लेख किया है कि चूंकि यह रेटिंग प्रणाली विज्ञान के साथ-साथ अंतर्ज्ञान और प्रवृत्ति को भी शामिल करती है, ‘हानिकारक सामग्री’ की परिभाषा के मापदंडों को स्वचालित प्रणाली में परिभाषित करना मुश्किल है।

हानि की परिभाषा

पत्र में आगे उल्लेख किया गया है कि पहले की मशीन लर्निंग और एल्गोरिदमिक प्रणालियों ने विशिष्ट पहलू का पता लगाने का मानदंड के रूप में उपयोग किया है, जिसमें रक्त और आग का दृश्य पता लगाना, फटाने की आवाज और शॉट लंबाई की आवृत्ति शामिल है, और एक बहु-डोमेन दृष्टिकोण हानिकारक सामग्री की स्वचालित रेटिंग के लिए एक बेहतर विधि प्रदान करने की संभावना है।

स्वीडिश शोधकर्ताओं ने किनेटिक्स-400 मानव गति बेंचमार्क डेटासेट पर एक 8×8 50-परत वाले न्यूरल नेटवर्क मॉडल को प्रशिक्षित किया और वीडियो और ऑडियो पूर्वानुमान को मिलाने के लिए एक वास्तुकला तैयार की।

वास्तव में, ट्रेलर का उपयोग इस प्रकार के डेटासेट के निर्माण के लिए तीन समस्याओं का समाधान करता है: यह कॉपीराइट मुद्दों को समाप्त करता है; ट्रेलरों में बढ़ी हुई अशांति और उच्च शॉट आवृत्ति (मूल फिल्मों की तुलना में) अनुमति देती है अधिक बार अन्नोटेशन; और यह सुनिश्चित करता है कि पूरी फिल्म में हिंसक या परेशान करने वाली सामग्री की कम घटना डेटासेट को असंतुलित नहीं बनाती है और इसे गलती से बच्चों के लिए उपयुक्त नहीं मानती है।

परिणाम

एक बार मॉडल प्रशिक्षित हो जाने के बाद, स्वीडिश शोधकर्ताओं ने प्रणाली का परीक्षण वीडियो क्लिप के खिलाफ किया।

इस द गहरा (2012) के ट्रेलर में, दो मॉडल (यादृच्छिक रूप से नमूना लेबल बनाम संभाव्य लेबल) ने सफलतापूर्वक फिल्म को 11 वर्ष और उससे अधिक आयु के दर्शकों के लिए उपयुक्त के रूप में वर्गीकृत किया।

एक और उदाहरण में, डिस्कार्नेट (2018) के एक दृश्य में एक दुर्भाग्यपूर्ण प्रतिपक्षी की शुरुआत, दोहरी फ्रेमवर्क ने फिर से सही तरीके से अनुमान लगाया कि लक्ष्य आयु सीमा 11+/15+ है।

हालांकि, ए सेकेंड चांस (2014) के ट्रेलर से एक क्लिप ने अधिक कठिनाई प्रस्तुत की, क्योंकि मॉडल मानव अन्नोटेशन के साथ सहमत नहीं हो सका, जिसने इस दृश्य को ‘बीटी’ (सार्वजनिक रूप से स्वीकार्य) के रूप में वर्गीकृत किया था। वास्तव में, एल्गोरिदम ने संभावित हानि का पता लगाया है जिसे मानव मूल्यांकनकर्ताओं ने इसके लिए नहीं माना है।

शोधकर्ताओं ने स्वीकार किया है कि उच्च सटीकता स्कोर के बावजूद, कुछ विफलताएं हुईं, जैसे कि सिटी स्टेट (2011) का एक क्लिप, जिसमें एक नग्न व्यक्ति को राइफल से धमकी दी जा रही है।

इस मामले में, प्रणाली ने क्लिप को 11+ रेटिंग सौंपी है, जो मानव अन्नोटेशन के विपरीत है।

उद्देश्य और हानिकारकता का विरोधाभास

पत्र में उल्लेख किया गया है कि पेडर्ट (2020) के ट्रेलर से एक क्लिप का मूल्यांकन करते समय, प्रणाली ने दृश्य और भाषाई पहलुओं (हालांकि पात्र आग्नेयास्त्रों पर चर्चा कर रहे हैं, उद्देश्य हास्य है) के आधार पर क्लिप को ‘सार्वजनिक’ रेटिंग सौंपी है, लेकिन व्यंग्य संदर्भ में उपयोग किए जाने वाले खतरनाक संगीत से भ्रमित हो गई है।

इसी तरह, फॉर समा (2019) के फिल्म के ट्रेलर में, खतरनाक शैली की संगीत सामग्री दृश्य सामग्री से मेल नहीं खाती है, और एक बार फिर, प्रणाली को दोनों घटकों को एक समान निर्णय लेने में कठिनाई होती है जो दोनों ऑडियो और वीडियो सामग्री को शामिल करती है।

अंत में, प्रणाली वर्जिन माउंटेन (2015) के ट्रेलर क्लिप में ऑडियो/वीडियो विरोधाभास का सही तरीके से नेविगेशन करती है, जिसमें कुछ खतरनाक दृश्य संकेत (जैसे कि एक टूटी हुई खिड़की) हैं जो संगीत द्वारा कमजोर हो जाते हैं। इसलिए, फ्रेमवर्क सही तरीके से अनुमान लगाता है कि क्लिप ‘सार्वजनिक’ (बीटी) रेटिंग है।

शोधकर्ताओं ने स्वीकार किया है कि इस प्रकार की प्रणाली केवल बच्चों पर केंद्रित है, और परिणाम अन्य प्रकार के दर्शकों के लिए अच्छी तरह से सामान्य नहीं हो सकते हैं। वे यह भी सुझाव देते हैं कि ‘हानिकारक’ सामग्री को इस रूप में परिभाषित करने से एल्गोरिदमिक रेटिंग प्रणालियों को कम अप्रत्याशित बनाने की संभावना है, लेकिन विचार करते हैं कि विचारों की अवांछित दमन की संभावना है।

‘सामग्री को हानिकारक मानना एक नाजुक मुद्दा है। सूचना की स्वतंत्रता और संवेदनशील समूहों की रक्षा के बीच एक महत्वपूर्ण संतुलन है। हम मानते हैं कि यह काम सही दिशा में एक कदम है, जो मूल्यांकन के लिए उपयोग किए जाने वाले मानदंडों के बारे में पारदर्शी होने के लिए। इसके अलावा, हम मानते हैं कि हानिकारकता को उपयुक्तता से अलग करना हानिकारक सामग्री की वर्गीकरण को अधिक वस्तुनिष्ठ बनाने की दिशा में एक महत्वपूर्ण कदम है।’

‘हानिकारक सामग्री का पता लगाना ऑनलाइन प्लेटफ़ॉर्म जैसे यूट्यूब के लिए भी रुचिकर है। ऐसे प्लेटफ़ॉर्म पर, सूचना की स्वतंत्रता और सुरक्षा के बीच संतुलन अधिक महत्वपूर्ण हो जाता है और जिम्मेदार एल्गोरिदम की प्रोप्राइटरी प्रकृति द्वारा और जटिल हो जाता है।’

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai