Anderson का एंगल
पेशेवर दुर्भावनापूर्ण ऑनलाइन समीक्षाओं का पता लगाना मशीन लर्निंग के साथ

चीन और अमेरिका के बीच एक नए शोध सहयोग में एक ऐसा तरीका प्रस्तुत किया गया है जिससे दुर्भावनापूर्ण ई-कॉमर्स समीक्षाओं का पता लगाया जा सकता है, जो प्रतिस्पर्धियों को कमजोर करने या फिरौती के लिए ऑनलाइन रिटेलर्स से पैसे वसूलने के लिए डिज़ाइन की गई हैं, दुर्भावनापूर्ण समीक्षकों के व्यवहार के हस्ताक्षर का लाभ उठाकर।
इस प्रणाली को दुर्भावनापूर्ण उपयोगकर्ता पता लगाने का मॉडल (एमएमडी) कहा जाता है, जो मेट्रिक लर्निंग का उपयोग करता है, जो एक तकनीक है जो कंप्यूटर विजन और रिकमेंडर सिस्टम में सामान्य रूप से उपयोग की जाती है, साथ ही एक रिकरेंट न्यूरल नेटवर्क (आरएनएन) के साथ, ऐसे समीक्षकों के आउटपुट की पहचान और लेबल करने के लिए, जिसे पेपर पेशेवर दुर्भावनापूर्ण उपयोगकर्ता (पीएमयू) नाम देता है।
महान! 1 स्टार
अधिकांश ऑनलाइन ई-कॉमर्स समीक्षाएं दो प्रकार की उपयोगकर्ता प्रतिक्रिया प्रदान करती हैं: एक स्टार रेटिंग (या 10 में से एक रेटिंग) और एक पाठ-आधारित समीक्षा, और एक典型 मामले में, वे तर्कसंगत रूप से मेल खाते हैं (यानी, एक खराब समीक्षा एक कम रेटिंग के साथ होगी)।
पीएमयू, हालांकि, इस तर्क को अक्सर उलट देते हैं, या तो एक खराब पाठ समीक्षा के साथ एक उच्च रेटिंग छोड़कर, या एक खराब रेटिंग के साथ एक अच्छी समीक्षा के साथ।
यह उपयोगकर्ता की समीक्षा को प्रतिष्ठा को नुकसान पहुंचाने की अनुमति देता है, बिना ई-कॉमर्स साइटों द्वारा तैनात दुर्भावनापूर्ण नकारात्मक समीक्षकों के आउटपुट की पहचान और संबोधन के लिए तैनात अपेक्षाकृत सरल फिल्टर को ट्रिगर किए। यदि एक फिल्टर प्राकृतिक भाषा प्रसंस्करण (एनएलपी) द्वारा समीक्षा के पाठ में निंदा की पहचान करता है, तो यह ‘फ्लैग’ पीएमयू द्वारा सौंपा गया उच्च स्टार (या दशमलव) रेटिंग द्वारा प्रभावी रूप से रद्द कर दिया जाता है, जो दुर्भावनापूर्ण सामग्री को सांख्यिकीय दृष्टिकोण से ‘तटस्थ’ बनाता है।

एक दुर्भावनापूर्ण समीक्षा को एक सहयोगी फिल्टरिंग प्रणाली के दृष्टिकोण से एक वैध समीक्षा के साथ सांख्यिकीय रूप से मिलाने का एक उदाहरण। स्रोत: https://arxiv.org/pdf/2205.09673.pdf
इस नए पेपर में उल्लेख किया गया है कि पीएमयू का अक्सर उद्देश्य ऑनलाइन रिटेलर्स से नकारात्मक समीक्षाओं को संशोधित करने या आगे नकारात्मक समीक्षाएं पोस्ट नहीं करने के लिए पैसे वसूलना होता है। कुछ मामलों में, अभिनेता अद हॉक व्यक्ति होते हैं छूट की मांग करते हैं, हालांकि अक्सर पीएमयू को पीड़ित के प्रतिस्पर्धियों द्वारा कैजुअली नियुक्त किया जाता है।
नकारात्मक समीक्षाओं को छिपाना
वर्तमान पीढ़ी के स्वचालित डिटेक्टर ऐसी समीक्षाओं के लिए संयुक्त फिल्टरिंग या सामग्री-आधारित मॉडल का उपयोग करते हैं, और स्पष्ट और अस्पष्ट ‘आउटलियर’ की तलाश में हैं – समीक्षाएं जो दोनों प्रतिक्रिया तरीकों में एकरूप रूप से नकारात्मक हैं और जो सामान्य रुझान से काफी अलग हैं।
एक और क्लासिक हस्ताक्षर जिस पर ऐसे फिल्टर निर्भर करते हैं वह एक उच्च पोस्टिंग आवृत्ति है, जबकि एक पीएमयू रणनीतिक रूप से और केवल कभी-कभी पोस्ट करेगा (क्योंकि प्रत्येक समीक्षा एक व्यक्तिगत कमीशन का प्रतिनिधित्व कर सकती है या एक लंबी रणनीति का एक चरण हो सकती है जो ‘आवृत्ति’ मीट्रिक को धुंधला करने के लिए डिज़ाइन की गई है)।
इसलिए, नए पेपर के शोधकर्ताओं ने पेशेवर दुर्भावनापूर्ण समीक्षाओं की अजीब ध्रुवता को एक समर्पित प्रणाली में एकीकृत किया है, जिसके परिणामस्वरूप एक एल्गोरिदम है जो लगभग एक मानव समीक्षक की क्षमता के बराबर है जो रेटिंग और समीक्षा पाठ सामग्री के बीच विसंगति को ‘सूंघ’ सकता है।

एमएमडी के लिए अवधारणात्मक वास्तुकला, जिसमें दो केंद्रीय मॉड्यूल शामिल हैं: दुर्भावनापूर्ण उपयोगकर्ता प्रोफाइलिंग (एमयूपी) और ध्यान मेट्रिक लर्निंग (एमएलसी, ग्रे में)।
पिछले दृष्टिकोणों की तुलना
चूंकि एमएमडी पहली प्रणाली है जो अपने विचित्र पोस्टिंग शैली के आधार पर पीएमयू की पहचान करने का प्रयास करती है, इसलिए इसकी तुलना करने के लिए कोई सीधा पूर्व कार्य नहीं है। इसलिए, शोधकर्ताओं ने अपनी प्रणाली को पारंपरिक स्वचालित फिल्टर पर निर्भर कई घटक एल्गोरिदम के खिलाफ पिट किया, जिनमें के-मीन्स++ क्लस्टरिंग; प्रतिष्ठित सांख्यिकी आउटलियर डिटेक्शन (एसओडी); हिसाद; सेमी-सैड; सीएनएन-सैड; और स्लैंडरस यूजर डिटेक्शन रिकमेंडर सिस्टम (एसडीआरएस)।

अमेज़न और येल्प के लेबल वाले डेटासेट के खिलाफ परीक्षण किया गया, एमएमडी उच्चतम सटीकता के साथ पेशेवर ऑनलाइन निंदकों की पहचान करने में सक्षम है, लेखकों का दावा है। बोल्ड एमएमडी का प्रतिनिधित्व करता है, जबकि अस्टरिस्क (*) सर्वश्रेष्ठ प्रदर्शन को इंगित करता है। इस मामले में, एमएमडी को केवल दो कार्यों में एक स्टैंडअलोन प्रौद्योगिकी (एमयूपी) द्वारा हराया गया था, जो पहले से ही इसमें शामिल है, लेकिन जो डिफ़ॉल्ट रूप से कार्य के लिए टूल नहीं किया गया है।

इस मामले में, एमएमडी को ताओबाओ और जिंगडोंग के अनलेबल्ड डेटासेट के खिलाफ पिट किया गया, जो इसे एक असुपरवाइज्ड लर्निंग कार्य बनाता है। फिर से, एमएमडी को केवल अपनी एक संविधान प्रौद्योगिकी द्वारा बेहतर बनाया जा सकता है, जो कार्य के लिए अत्यधिक अनुकूलित है।
शोधकर्ता टिप्पणी करते हैं:
‘चारों डेटासेट पर, हमारे प्रस्तावित मॉडल एमएमडी (एमएलसी+एमयूपी) सभी बेसलाइन्स को एफ-स्कोर के मामले में बेहतर प्रदर्शन करता है। ध्यान दें कि एमएमडी एमएलसी और एमयूपी का संयोजन है, जो इसे सुपरवाइज्ड और असुपरवाइज्ड मॉडल्स पर इसकी श्रेष्ठता सुनिश्चित करता है।’
पेपर यह भी सुझाव देता है कि एमएमडी पारंपरिक स्वचालित फिल्टर प्रणालियों के लिए एक उपयोगी प्री-प्रोसेसिंग विधि के रूप में कार्य कर सकता है, और विभिन्न डेटासेट पर प्रयोगात्मक परिणाम प्रदान करता है, जिनमें उपयोगकर्ता-आधारित सहयोगी फिल्टरिंग (यूबीसीएफ), आइटम-आधारित सहयोगी फिल्टरिंग (आईबीसीएफ), मैट्रिक्स फैक्टराइजेशन (एमएफ-ईएलएस), बेयसियन व्यक्तिगत रैंकिंग (एमएफ-बीपीआर), और न्यूरल सहयोगी फिल्टरिंग (एनसीएफ) शामिल हैं।
डेटा और दृष्टिकोण
पीएमयू का पता लगाना एक बहुस्तरीय चुनौती है, क्योंकि दो गैर-समान मापदंडों (एक संख्यात्मक मूल्य स्टार/दशमलव रेटिंग और एक पाठ-आधारित समीक्षा) पर विचार किया जाना चाहिए। पेपर के लेखकों का दावा है कि कोई पूर्व कार्य इस चुनौती का सामना नहीं करता है।
एमएमडी एक हायरार्किकल डुअल-एटेंशन रिकरेंट न्यूरल नेटवर्क (एचडीएन) का उपयोग करता है ताकि समीक्षा सामग्री को एक भावना स्कोर में समाहित किया जा सके।

एचडीएन के साथ एक समीक्षा को एक भावना स्कोर में परियोजना करना, जो शब्द एम्बेडिंग और वाक्य एम्बेडिंग में योगदान देता है ताकि एक भावना स्कोर प्राप्त किया जा सके।
एचडीएन प्रत्येक शब्द और प्रत्येक वाक्य को वजन सौंपने के लिए ध्यान तंत्र का उपयोग करता है। ऊपर दी गई छवि में, लेखकों का कहना है कि शब्द पॉवर को स्पष्ट रूप से समीक्षा में प्रतिस्पर्धी शब्दों की तुलना में अधिक वजन दिया जाना चाहिए।
परियोजना के लिए, एचडीएन ने चार डेटासेट पर उत्पादों के लिए रेटिंग को मैदान के रूप में लिया। डेटासेट अमेज़न.कॉम; येल्प के लिए रिक्सिस (2013); और दो ‘वास्तविक दुनिया’ (प्रयोगात्मक नहीं) डेटासेट, ताओबाओ और जिंगडोंग से थे।
मानव परीक्षण
परिमाणात्मक परिणामों के अलावा, शोधकर्ताओं ने एक उपयोगकर्ता अध्ययन किया जिसमें 20 छात्रों को केवल सामग्री और स्टार रेटिंग के आधार पर दुर्भावनापूर्ण समीक्षाओं की पहचान करने का कार्य सौंपा गया था। प्रतिभागियों को समीक्षाओं को 0 (सामान्य समीक्षकों के लिए) या 1 (एक पेशेवर दुर्भावनापूर्ण उपयोगकर्ता के लिए) के रूप में रेट करने के लिए कहा गया था।
50/50 विभाजन के बीच सामान्य और दुर्भावनापूर्ण समीक्षाओं में, छात्रों ने औसतन 24 सच्चे सकारात्मक और 24 सच्चे नकारात्मक उपयोगकर्ताओं को लेबल किया। इसकी तुलना में, एमएमडी 23 सच्चे सकारात्मक और 24 सच्चे नकारात्मक उपयोगकर्ताओं को लेबल करने में सक्षम था, जो लगभग मानव-स्तर के विवेक के साथ काम कर रहा था और बेसलाइन्स को पार कर रहा था।
(AMZN )
छात्र बनाम एमएमडी। अस्टरिस्क (*) सर्वश्रेष्ठ परिणामों को इंगित करता है, और बोल्ड एमएमडी के परिणामों को इंगित करता है।
लेखक निष्कर्ष निकालते हैं:
‘सार में, एमएमडी एक सामान्य समाधान है, जो न केवल इस पेपर में अन्वेषित पेशेवर दुर्भावनापूर्ण उपयोगकर्ताओं का पता लगा सकता है, बल्कि दुर्भावनापूर्ण उपयोगकर्ता पता लगाने के लिए एक सामान्य आधार के रूप में भी कार्य कर सकता है। अधिक डेटा के साथ, जैसे कि छवि, वीडियो या ध्वनि, एमएमडी की अवधारणा उनके शीर्षक और सामग्री के बीच भावना अंतर का पता लगाने के लिए निर्देशित करने में मददगार हो सकती है, जो विभिन्न अनुप्रयोगों में विभिन्न मास्किंग रणनीतियों का मुकाबला करने के लिए एक उज्ज्वल भविष्य है।’
20 मई 2022 को पहली बार प्रकाशित।












