Anderson का एंगल

समीक्षाओं का उपयोग करके एक रिकमेंडर सिस्टम बनाना जो काम करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यदि आप कभी ऑनलाइन एक उत्पाद खरीदते हैं और ‘संबंधित आइटम’ की अनुपयुक्तता और अनुपयोगिता से आश्चर्यचकित होते हैं जो खरीद और बिक्री प्रक्रिया के दौरान और बाद में आपका पीछा करते हैं, तो आप पहले से ही समझते हैं कि लोकप्रिय और मुख्यधारा के रिकमेंडर सिस्टम संभावित खरीदारी के बीच संबंधों को समझने में कमजोर होते हैं।

यदि आप एक असामान्य और दुर्लभ आइटम, जैसे कि एक ओवन खरीदते हैं, तो अन्य ओवन की सिफारिशें संभवतः अतिरिक्त होंगी, हालांकि सबसे खराब रिकमेंडर सिस्टम इसे स्वीकार करने में विफल होते हैं। 2000 के दशक में, उदाहरण के लिए, TiVO के रिकमेंडर सिस्टम ने इस क्षेत्र में एक प्रारंभिक विवाद पैदा किया जब उन्होंने एक उपयोगकर्ता की धारणा की यौनता को फिर से सौंप दिया, जिसने बाद में अपने उपयोगकर्ता प्रोफाइल को ‘पुनः-पुरुषीकरण’ करने के लिए युद्ध फिल्में चुनने का प्रयास किया – एक कच्चा एल्गोरिदम संशोधन दृष्टिकोण।

इसके अलावा, आपको वास्तव में कुछ खरीदने की आवश्यकता नहीं है, जैसे कि अमेज़ॅन पर, या किसी प्रमुख स्ट्रीमिंग प्लेटफ़ॉर्म पर एक फिल्म का विवरण देखने के लिए, जिससे जानकारी-स्टार्व्ड रिकमेंडर एल्गोरिदम गलत रास्ते पर जाने लगें; खोज, रहने और क्लिक करने से ‘विवरण’ पृष्ठ पर पर्याप्त है, और यह कम और संभवतः गलत जानकारी भविष्य के ब्राउज़िंग सत्रों में प्लेटफ़ॉर्म पर जारी रहेगी।

रिकमेंडर सिस्टम को भूलने का प्रयास करना

कभी-कभी हस्तक्षेप संभव है: नेटफ्लिक्स में एक ‘अंगूठा ऊपर/नीचे’ प्रणाली है जो सिद्धांत रूप में अपने मशीन लर्निंग एल्गोरिदम को अपनी सिफारिश प्रोफ़ाइल से कुछ निहित अवधारणाओं और शब्दों को हटाने में मदद करनी चाहिए (हालांकि इसकी प्रभावशीलता प्रश्न में है, और यह अभी भी एक व्यक्तिगत रिकमेंडर एल्गोरिदम को शुरू से विकसित करने के लिए बहुत आसान है अवांछित ओंटोलॉजी को हटाने की तुलना में), जबकि अमेज़ॅन आपको शीर्षक को अपने ग्राहक इतिहास से हटाने देता है, जो कि किसी भी अवांछित डोमेन को कम करना चाहिए जो आपकी सिफारिशों में घुसपैठ कर गए हैं।

हुलु में एक समान सुविधा है, जबकि एचबीओ मैक्स ने आंशिक रूप से एल्गोरिदम-ओनली रिकमेंडर सिस्टम से पीछे हट गया है, जो वर्तमान में कमियों का सामना कर रहा है।

इनमें से कोई भी सख्ती से उपभोक्ता-स्तर के अनुभव ‘निष्क्रिय’ विज्ञापन प्लेटफ़ॉर्म रिकमेंडर सिस्टम (जहां नोटेबल परिवर्तन आ रहा है क्योंकि सार्वजनिक गुस्सा है) की व्यापक और बढ़ती आलोचना को छूते नहीं हैं, या सोशल मीडिया एआई सिफारिशों के विषय, जहां साइटें जैसे यूट्यूब, ट्विटर और फ़ेसबुक गैर-प्रासंगिक या यहां तक कि हानिकारक सिफारिशों के लिए आलोचना का सामना करते रहते हैं।

मशीन को लगता है कि वह नहीं जानती कि हम क्या चाहते हैं, जब तक कि हम उस आइटम के ‘अगले’ आइटम की तलाश में न हों जो हमारी खोज में आया था – भले ही वह आइटम मूल आइटम की एक डुप्लिकेट या वैकल्पिक हो, जिसे हमने अभी खरीदा हो, किसी संभावित पूरक या सहायक खरीद के बजाय।

समीक्षा डेटा के साथ सटीक सिफारिशें

चीन और ऑस्ट्रेलिया से एक नए शोध सहयोग में एक उपन्यास विधि प्रस्तुत की गई है जो बाहरी उपयोगकर्ता-समीक्षाओं का उपयोग करके एक खरीदारी सत्र में आइटमों के बीच वास्तविक संबंधों को बेहतर ढंग से समझने के लिए है। परीक्षणों में, वास्तुकला ने सभी वर्तमान राज्य-ऑफ-द-आर्ट विधियों को पार कर लिया, जो रिकमेंडर सिस्टम के लिए आशा की किरण प्रदान करता है जो आइटमों की निर्भरता का एक बेहतर आंतरिक मानचित्र है।

<img class="size-full wp-image-180010" src="https://www.unite.ai/wp-content/uploads/2022/02/recommender-system-results.jpg" alt="RI-GNN प्रमुख प्रतियोगियों की तुलना में आइटमों के बीच संबंधों की सटीकता के मामले में बेहतर प्रदर्शन करता है, पांच से अधिक आइटम वाले सत्रों में सबसे अच्छा प्रदर्शन करता है। सिस्टम का परीक्षण अमेज़ॅन रिव्यू डेटा (2018) से पेट सप्लाईज और मूवीज़ एंड टीवी डेटासेट के खिलाफ किया गया था। स्रोत: https://arxiv.org/pdf/2201.12532.pdf

इसके अलावा, परियोजना एक उल्लेखनीय चुनौती का समाधान करती है जो गैर-लॉगिन सत्रों में सिफारिशें बनाने की है, जहां रिकमेंडर सिस्टम को उपयोगकर्ता-योगदान विवरण, जैसे कि खरीद इतिहास या उपयोगकर्ता की पिछली खरीदारी की अपनी ऑनलाइन समीक्षाओं तक पहुंच नहीं है।

नई पेपर का शीर्षक सेशन-आधारित सिफारिशों में आसन्न निर्भरता को पुनः विचार करना है, और यह चीन के किलु विश्वविद्यालय प्रौद्योगिकी और बीजिंग प्रौद्योगिकी संस्थान के शोधकर्ताओं से, मेलबोर्न में आरएमआईटी विश्वविद्यालय, और सिडनी में ऑस्ट्रेलियाई कृत्रिम बुद्धिमत्ता संस्थान से है।

क्या आगे है?

सत्र-आधारित सिफारिशों (एसबीआर) का मुख्य कार्य वर्तमान आइटम के साथ इसके गणना किए गए संबंध के आधार पर ‘अगले’ आइटम का निर्धारण करना है। व्यावहारिक रूप से, यह एक ई-कॉमर्स वेबसाइट पर एक आइटम पृष्ठ में ‘संबंधित आइटम’ की सूची के रूप में प्रकट हो सकता है।

यदि आप एक पक्षी पिंजरा खरीद रहे हैं, तो आपको और क्या चाहिए? खैर, कम से कम, आपको पिंजरे में रखने के लिए एक पक्षी की आवश्यकता होगी – यह एक वास्तविक निर्भरता है। हालांकि, पक्षी पिंजरा पालतू सामान ओंटोलॉजी में है, जहां पक्षी बेचे नहीं जाते हैं। विकृत रूप से, बिल्ली खाद्य उसी ओंटोलॉजी में है, हालांकि एक पक्षी पिंजरे उत्पाद के लिए एक सिफारिश के रूप में एक बिल्ली खिलाने का कटोरा जोड़ना एक मिथ्या निर्भरता है – एक भ्रमित और गलत संबंध।

पेपर से: कई आइटमों के बीच सच्चे और झूठे संबंध, दाईं ओर एक अंतर-आइटम ग्राफ के रूप में दृश्यीकृत।

पेपर से: कई आइटमों के बीच सच्चे और झूठे संबंध, दाईं ओर एक अंतर-आइटम ग्राफ के रूप में दृश्यीकृत।

जैसा कि मशीन लर्निंग आर्किटेक्चर में अक्सर होता है, यह एक चुनौती है कि रिकमेंडर सिस्टम को यह समझाने के लिए कि एक ‘दूर’ इकाई (पक्षी पालतू उत्पादों में नहीं है) एक आइटम के साथ एक आंतरिक और महत्वपूर्ण संबंध हो सकता है, जबकि समान श्रेणी में और केंद्रीय अवधारणा में बहुत करीबी आइटम (जैसे बिल्ली खिलाने का कटोरा) विरोधाभासी या विपरीत हो सकते हैं खरीद पर विचार किया जा रहा है।

इन ‘गैर-आसन्न’ इकाइयों के बीच मappings बनाने का एकमात्र तरीका है क्राउडसोर्सिंग समस्या है, क्योंकि प्रश्न में संबंध मानव अनुभव का एक पहलू हैं, प्रोग्रामेटिक रूप से अनुमानित नहीं किया जा सकता है, और संभवतः पारंपरिक दृष्टिकोण से परे हैं डेटासेट लेबलिंग, जैसे अमेज़ॅन मैकेनिकल टर्क के रूप में।

इसलिए, शोधकर्ताओं ने एक उत्पाद की समीक्षाओं से प्रासंगिक शब्द निकालने के लिए प्राकृतिक भाषा प्रसंस्करण (एनएलपी) तंत्र का उपयोग किया है, और इन विश्लेषणों से आवृत्तियों का उपयोग करके दूरस्थ आइटम को ‘मिलान’ करने में सक्षम एम्बेडिंग बनाई है।

समीक्षा-रिफ़ाइंड इंटर-आइटम ग्राफ न्यूरल नेटवर्क (RI-GNN) के लिए आर्किटेक्चर।

समीक्षा-रिफ़ाइंड इंटर-आइटम ग्राफ न्यूरल नेटवर्क (RI-GNN) के लिए आर्किटेक्चर।

वास्तुकला और डेटा

जैसा कि नए पेपर में उल्लेख किया गया है, इसी तरह के पिछले कार्यों ने एक लॉगिन उपयोगकर्ता के अपने समीक्षा इतिहास का शोषण किया है ताकि मूल मappings प्रदान की जा सकें। डीपकोन और आरएनएस दोनों ने इस दृष्टिकोण का उपयोग किया है। हालांकि, यह तथ्य को छोड़ देता है कि एक उपयोगकर्ता कोई समीक्षा नहीं लिखी हो सकती है, या किसी विशिष्ट आइटम के लिए प्रासंगिक समीक्षाएं नहीं हो सकती हैं जो उनकी सामान्य खरीदारी आदतों से ‘बाहर’ हैं।

शोधकर्ताओं द्वारा प्रस्तावित विस्तारित ग्राफ न्यूरल नेटवर्क (जीएनएन) एक अधिक ऑरेकल-चालित दृष्टिकोण लेता है, ताकि वास्तविक निर्भरताओं को अप्रिय से प्राप्त किया जा सके, ताकि संभवतः, गुमनाम और लॉग-आउट उपयोगकर्ता न्यूनतम इनपुट के साथ अधिक प्रासंगिक सिफारिशें अनुभव कर सकें।

समीक्षा-संवर्धित प्रणाली का शीर्षक समीक्षा-रिफ़ाइंड इंटर-आइटम ग्राफ न्यूरल नेटवर्क (RI-GNN) है। शोधकर्ताओं ने इसे अमेज़ॅन से दो डेटासेट के खिलाफ परीक्षण किया है, पेट सप्लाईज और मूवीज़ एंड टीवी। हालांकि यह समाधान समीक्षा की उपलब्धता की समस्या को सुंदरता से हल करता है, एक वाइल्ड में कार्यान्वयन को एक उपयुक्त समीक्षा डेटाबेस का पता लगाने और स्क्रैप करने की आवश्यकता होगी। ऐसा डेटासेट स्रोत सिद्धांत रूप से किसी भी चीज़ से हो सकता है, सोशल नेटवर्क पर पोस्ट से लेकर क्वोरा पर उत्तर तक।

इस प्रकार की उच्च-स्तरीय संबंध मappings मशीन लर्निंग अनुप्रयोगों की एक श्रृंखला के लिए मूल्यवान होंगी, इसके अलावा रिकमेंडर सिस्टम के लिए। कई वर्तमान परियोजनाएं सीमित फंड और दायरे के कारण अंतर- और इंट्रा-डोमेन मappings की कमी के कारण बाधित हैं; जबकि एक वास्तविक ज्ञानी और क्राउडसोर्स्ड ई-कॉमर्स रिकमेंडर सिस्टम का व्यावसायिक प्रोत्साहन उस अंतर को भरने में सक्षम हो सकता है।

मेट्रिक्स और परीक्षण

लेखकों ने RI-GNN का परीक्षण दो डेटासेट संस्करणों के खिलाफ किया, प्रत्येक में एक उपयोगकर्ता के खरीद इतिहास और सामान्य समीक्षाओं के साथ। पांच बार से कम दिखाई देने वाले आइटम हटा दिए गए, और उपयोगकर्ता इतिहास को एक सप्ताह की इकाइयों में विभाजित किया गया। पहला डेटासेट संस्करण में एक से अधिक आइटम वाले सभी सत्र शामिल थे, और दूसरा सभी सत्र जिनमें पांच से अधिक आइटम थे।

परियोजना ने P@K (सटीकता) और MRR@K (मीन रिकिप्रोकल रैंक) के लिए मूल्यांकन मेट्रिक्स का उपयोग किया। प्रतिद्वंद्वी वास्तुकला जिन्हें परीक्षण किया गया था: एस-केएनएन; जीआरयू4आरईसी; एस-पीओपी; एसटीएएमपी; बीईआरटी4आरईसी; डीएचसीएन; जीसीई-जीएनएन; एसआर-जीएनएन; और एनएआरएम

फ्रेमवर्क को एडम पर 100 के बैचों में प्रशिक्षित किया गया था, जिसमें सीखने की दर 0.001 थी, और विषयों की संख्या क्रमशः 24 और 20 थी, पेट सप्लाईज और मूवीज़ एंड टीवी के लिए।

 

 

पहली बार 1 फरवरी 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai