Anderson का एंगल

ट्विच एमोट्स में सेंटिमेंट एनालिसिस को समझना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

सार्वजनिक रूप से उपयोग करने वाले इमोजी, इमोटिकॉन, एमोट्स, मीम्स, जीआईएफ और अन्य गैर-मौखिक तरीकों से सोशल मीडिया प्लेटफॉर्म पर संवाद करने के लिए, डेटा वैज्ञानिकों को वैश्विक सामाजिक परिदृश्य को समझने के प्रयासों को बढ़ावा दिया है; कम से कम, जितना कि वैश्विक सामाजिक रुझानों को सार्वजनिक वार्ता से समझा जा सकता है।

हालांकि प्राकृतिक भाषा प्रसंस्करण (एनएलपी) पिछले दशक में भावना विश्लेषण में एक शक्तिशाली उपकरण बन गया है, क्षेत्र को न केवल एक निरंतर विकसित होने वाले शब्दकोश के साथ तालमेल बिठाने में कठिनाई होती है स्लैंग और भाषाई छोटे रास्ते कई भाषाओं में, लेकिन यह भी छवि-आधारित पोस्ट के अर्थ को डिकोड करने का प्रयास करने में सोशल मीडिया प्लेटफॉर्म जैसे फेसबुक और ट्विटर पर।

चूंकि सीमित संख्या में अत्यधिक आबादी वाले सोशल मीडिया प्लेटफॉर्म इस तरह के शोध के लिए एकमात्र वास्तव में हाइपरस्केल संसाधन हैं, इसलिए यह आवश्यक है कि एआई क्षेत्र को कम से कम इसके साथ तालमेल बिठाने का प्रयास करे।

जुलाई में, ताइवान से एक पत्र में ‘प्रतिक्रिया जीआईएफ’ को सोशल मीडिया थ्रेड्स में पोस्ट करने वाले उपयोगकर्ता की भावना को वर्गीकृत करने के लिए एक नई विधि की पेशकश की गई, 30,000 ट्वीट्स के डेटाबेस का उपयोग करके एक पोस्ट की प्रतिक्रिया का अनुमान लगाने का तरीका विकसित किया गया। पत्र में पाया गया कि छवि-आधारित प्रतिक्रियाएं कई मामलों में अधिक सटीक होती हैं, क्योंकि वे कम होने की संभावना है व्यंग्य, एक उल्लेखनीय चुनौती भावना विश्लेषण में।

ताइवान के शोधकर्ताओं ने 2021 के एक पत्र में प्रतिक्रिया जीआईएफ के उपयोग का अध्ययन किया

इस साल की शुरुआत में, बोस्टन विश्वविद्यालय के नेतृत्व में एक शोध प्रयास ने मशीन लर्निंग मॉडल को प्रशिक्षित किया जो ट्विटर पर वायरल होने वाली छवि मीम्स का अनुमान लगा सकता है; और अगस्त में, ब्रिटिश शोधकर्ताओं ने सोशल मीडिया पर इमोजी और इमोटिकॉन्स की वृद्धि का अध्ययन किया, एक बड़े पैमाने पर 7-भाषा डेटासेट का संकलन किया जिसमें ट्विटर पर पिक्टोग्राफिक भावना शामिल थी।

ट्विच एमोट्स

अब, अमेरिकी शोधकर्ताओं ने ट्विच नेटवर्क पर एमोट्स की निरंतर विकसित होने वाली पseudo-lexicon को बेहतर ढंग से समझने, वर्गीकृत करने और मापने के लिए एक मशीन लर्निंग विधि विकसित की है।

एमोट्स ट्विच पर भावना, मूड, या इन-जोक्स को व्यक्त करने के लिए उपयोग किए जाने वाले नवाचार हैं। चूंकि वे परिभाषा के अनुसार नए अभिव्यक्तियाँ हैं, मशीन लर्निंग सिस्टम के लिए चुनौती निश्चित रूप से नए एमोट्स (जो केवल एक बार उपयोग किए जा सकते हैं, या तेजी से उपयोग से बाहर हो सकते हैं) को अनंत रूप से कैटलॉग करना नहीं है, लेकिन उन्हें उत्पन्न करने वाले फ्रेमवर्क को बेहतर ढंग से समझना है; और उन प्रणालियों को विकसित करना है जो एक एमोट को एक ‘अस्थायी रूप से वैध’ शब्द या यौगिक वाक्यांश के रूप में पहचान सकती हैं जिसका भावनात्मक/राजनीतिक तापमान पूरी तरह से संदर्भ से निर्धारित किया जा सकता है।

FeelsGoodMan एमोट के पड़ोसी, जिसका अर्थ अस्पष्ट उपसर्ग द्वारा बदला जा सकता है। स्रोत: https://arxiv.org/pdf/2108.08411.pdf

FeelsGoodMan एमोट के पड़ोसी, जिसका अर्थ अस्पष्ट उपसर्ग द्वारा बदला जा सकता है। स्रोत: https://arxiv.org/pdf/2108.08411.pdf

पत्र का शीर्षक FeelsGoodMan: ट्विच नवाचारों के अर्थ का अनुमान है, और सैन फ्रांसिस्को में सोशल मीडिया विश्लेषण कंपनी स्पाइकट्रैप के तीन शोधकर्ताओं से आया है।

बैट और स्विच

ट्विच एमोट्स अक्सर सांस्कृतिक सामग्री (पुराने एमोट्स सहित) को रिसाइकल करते हैं, जो भावना विश्लेषण फ्रेमवर्क को गलत दिशा में मोड़ सकते हैं। एक एमोट के अर्थ में परिवर्तन को ट्रैक करना जब यह विकसित होता है तो इसके मूल भावना या इरादे का पूर्ण उलटा या नकार का खुलासा कर सकता है।

उदाहरण के लिए, शोधकर्ता यह बताते हैं कि मूल अल्ट-राइट दुरुपयोग फील्सगुडमैन पेपे द फ्रॉग मीम ने ट्विच पर इसके उपयोग के संदर्भ में अपने मूल राजनीतिक स्वाद को लगभग पूरी तरह से खो दिया है।

इस वाक्यांश का उपयोग, एक 2005 के कार्टून द्वारा कलाकार मैट फ्यूरी द्वारा, एक दूर-दूर का मीम बन गया 2010 के दशक में। हालांकि वॉक्स लिखा 2017 में कि मीम का दाहिने हाथ का उपयोग फ्यूरी के इस तरह के उपयोग से दूर हो गया था, सैन फ्रांसिस्को के शोधकर्ताओं ने पाया है कि वैसा नहीं है:

‘फ्यूरी का कार्टून फ्रॉग को दूर-दूर के पोस्टरों द्वारा विभिन्न ऑनलाइन मंचों पर 2010 के दशक की शुरुआत में अपनाया गया था। तब से, फ्यूरी ने अपने पात्र के अर्थ को पुनः प्राप्त करने के लिए अभियान चलाया है, और एमोट ने ट्विच पर अधिक मुख्यधारा का उपयोग और सकारात्मक उपयोग देखा है। हमारे ट्विच पर परिणाम सहमत हैं, जो दिखाते हैं कि “फील्सगुडमैन” और इसके समकक्ष “फील्सबैडमैन” मुख्य रूप से साहित्यिक रूप से उपयोग किए जा रहे हैं। ‘

ट्रबल डाउनस्ट्रीम

इस तरह के ‘बैट और स्विच’ का एमोट की सामान्य विशेषताओं के साथ-साथ एनएलपी शोध परियोजनाओं को बाधित कर सकता है जिन्होंने इसे पहले से ही ‘नफरत भरा’, ‘दूर-दूर’ या ‘राष्ट्रवादी [यूएस]’ के रूप में वर्गीकृत किया है, और जिन्होंने उस जानकारी को लंबे समय तक खुले स्रोत भंडार में डाल दिया है। बाद के एनएलपी परियोजनाएं पुराने डेटा की मुद्रा की जांच करने का विकल्प नहीं चुन सकती हैं; उन्हें ऐसा करने के लिए कोई व्यावहारिक तंत्र नहीं हो सकता है; और उन्हें जरूरत के बारे में पता नहीं हो सकता है।

नतीजा यह है कि 2017 ट्विच-आधारित डेटासेट का उपयोग करके एक ‘राजनीतिक वर्गीकरण’ एल्गोरिदम को बनाने से ट्विच पर उल्लेखनीय दूर-दूर गतिविधि का संकेत मिलेगा, फील्सगुडमैन एमोट की आवृत्ति के आधार पर। ट्विच में दूर-दूर प्रभावशाली लोग हो सकते हैं या नहीं, लेकिन शोधकर्ताओं के अनुसार, मेंढ़क से इसका प्रमाण नहीं मिलेगा।

‘पेपे’ मीम का राजनीतिक महत्व ट्विच के 140 मिलियन उपयोगकर्ताओं (जिनमें से 41% 24 से कम उम्र के हैं) द्वारा आकस्मिक रूप से त्याग दिया गया प्रतीत होता है, जिन्होंने मूल चोरों से काम को पुनः चोरी किया है और इसे अपने रंगों में चित्रित किया है, बिना किसी विशेष एजेंडे के।

विधि और डेटा

शोधकर्ताओं ने पाया कि लेबल वाले ट्विच एमोट डेटा ‘आभासी रूप से गैर-मौजूद’ था, एक पिछले अध्ययन के निष्कर्ष के बावजूद कि 8 मिलियन कुल एमोट्स हैं, और 400,000 एक ही सप्ताह में ट्विच आउटपुट में मौजूद थे जिस सप्ताह को उन शोधकर्ताओं ने चुना था।

एक 2017 के अध्ययन ने ट्विच पर शीर्ष 30 ट्विच एमोट्स की भविष्यवाणी करने तक ही सीमित रखा, जिसमें एमोट पूर्वानुमान के लिए 0.39 स्कोर किया गया।

इस कमी को संबोधित करते हुए, सैन फ्रांसिस्को के शोधकर्ताओं ने पुराने डेटा के लिए एक नई दृष्टिकोण अपनाई, इसे 80/20 के बीच प्रशिक्षण और परीक्षण के लिए विभाजित किया, और ‘पारंपरिक’ मशीन लर्निंग विधियों को लागू किया, जिन्हें पहले ट्विच डेटा का अध्ययन करने के लिए उपयोग नहीं किया गया था। इन विधियों में नेइव बेज (एनबी), रैंडम फॉरेस्ट (आरएफ), सपोर्ट वेक्टर मशीन (एसवीएम, रैखिक कERNEL के साथ), और लॉजिस्टिक रिग्रेशन शामिल थे।

इस दृष्टिकोण ने पिछले ट्विच भावना बेसलाइन्स को 63.8% से बेहतर प्रदर्शन किया, और शोधकर्ताओं को बाद में एलओओवीई (लर्निंग आउट ऑफ वोकेबुलरी एमोशंस) फ्रेमवर्क विकसित करने में सक्षम बनाया, जो नियोलॉजिज्म की पहचान करने में सक्षम है और मौजूदा मॉडलों को इन नए परिभाषाओं के साथ समृद्ध बनाने में सक्षम है।

शोधकर्ताओं द्वारा विकसित एलओओवीई (लर्निंग आउट ऑफ वोकेबुलरी एमोशंस) फ्रेमवर्क का आर्किटेक्चर।

शोधकर्ताओं द्वारा विकसित एलओओवीई (लर्निंग आउट ऑफ वोकेबुलरी एमोशंस) फ्रेमवर्क का आर्किटेक्चर।

एलओओवीई शब्द एम्बेडिंग के असुपरवाइज्ड प्रशिक्षण की सुविधा प्रदान करता है, और यह आवर्ती पुनः प्रशिक्षण और फाइन-ट्यूनिंग को भी समायोजित करता है, जो लेबल वाले डेटासेट की आवश्यकता को दूर करता है, जो कार्य के पैमाने और एमोट्स के तेजी से विकास को देखते हुए व्यावहारिक रूप से असंभव होगा।

परियोजना की सेवा में, शोधकर्ताओं ने एक अनलेबल्ड ट्विच डेटासेट पर एक एमोट ‘प्सेव्डो-डिक्शनरी’ को प्रशिक्षित किया, जिसमें 444,714 शब्दों, एमोट्स, इमोजी और इमोटिकॉन्स के एम्बेडिंग का उत्पादन किया गया।

इसके अलावा, उन्होंने एक वाडेर लेक्सिकॉन को एक इमोजी/इमोटिकॉन लेक्सिकॉन के साथ बढ़ाया, और उपरोक्त ईसी डेटासेट के अलावा, तीन अन्य सार्वजनिक रूप से उपलब्ध डेटासेट का भी शोषण किया ट्विटर, रॉटेन टोमेटोज और एक नमूने येल्प डेटासेट से त्रिपक्षीय भावना वर्गीकरण के लिए।

विभिन्न विधियों और डेटासेट के उपयोग को देखते हुए, परिणाम विविध हैं, लेकिन शोधकर्ता यह तर्क देते हैं कि उनका सर्वोत्तम मामले का बेसलाइन निकटतम पिछले मीट्रिक से 7.36 प्रतिशत अंकों से बेहतर प्रदर्शन करता है।

शोधकर्ता इस बात से सहमत हैं कि परियोजना का चलने वाला मूल्य एलओओवी का विकास है, जो 313 मिलियन ट्विच चैट संदेशों पर प्रशिक्षित शब्द-से-वेक्टर (डब्ल्यू2वी) एम्बेडिंग पर आधारित है, जिसमें के-निकटतम पड़ोसी (केएनएन) की मदद ली गई है।

लेखक निष्कर्ष निकालते हैं:

‘फ्रेमवर्क की एक मुख्य विशेषता एक एमोट प्सेव्डो-डिक्शनरी है जिसका उपयोग अज्ञात एमोट्स के लिए भावना को व्युत्पन्न करने के लिए किया जा सकता है। इस एमोट प्सेव्डो-डिक्शनरी का उपयोग करके, हमने 22,507 एमोट्स के लिए एक भावना तालिका बनाई। यह इस पैमाने पर एमोट समझ का पहला मामला है।’

 

* मेरा इनलाइन उद्धरणों को हाइपरलिंक में परिवर्तित करना।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai