Anderson का एंगल

क्यों एआई बेहतर उत्पाद सिफारिशें प्रदान नहीं कर रहा है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यदि आप अजीब चीजों में रुचि रखते हैं, तो आपके द्वारा आइटम और उत्पादों की खोज करने के दो कारण हैं कि आपकी खोज आपके ‘मुख्यधारा’ सहयोगियों की तुलना में आपके हितों से कम संबंधित होने की संभावना है; या तो आप एक मोनेटाइजेशन ‘एज केस’ हैं जिनके हितों को केवल तभी पूरा किया जाएगा जब आप आर्थिक खरीद शक्ति की ऊपरी श्रेणियों में भी हों (उदाहरण के लिए, ‘वेल्थ मैनेजमेंट’ से संबंधित उत्पाद और सेवाएं); या खोज एल्गोरिदम जिनका आप उपयोग कर रहे हैं सहयोगी फिल्टरिंग (सीएफ) का लाभ उठा रहे हैं, जो बहुमत के हितों को प्राथमिकता देता है।

चूंकि सहयोगी फिल्टरिंग अन्य संभावित रूप से अधिक सक्षम एल्गोरिदम और फ्रेमवर्क की तुलना में सस्ता और अधिक स्थापित है, इसलिए यह संभव है कि दोनों मामले लागू हों।

सीएफ-आधारित खोज परिणाम उन आइटमों को प्राथमिकता देंगे जो ‘आप जैसे लोगों’ के बीच लोकप्रिय माने जाते हैं, जितना कि होस्ट फ्रेमवर्क आपको एक उपभोक्ता के रूप में समझ सकता है।

यदि आप होस्ट सिस्टम को डेटा प्रोफाइलिंग जानकारी प्रदान करने से सावधान हैं – उदाहरण के लिए, नेटफ्लिक्स और अन्य वीडियो सामग्री सेवाओं में ‘लाइक’ बटन दबाने के लिए प्रवृत्त नहीं हैं – तो आप अपने शुरुआती इंटरैक्शन में बहुत ही सामान्य रूप से वर्गीकृत किए जाने की संभावना है, और आपको मिली सिफारिशें सबसे लोकप्रिय रुझानों को दर्शाएंगी।

एक स्ट्रीमिंग प्लेटफ़ॉर्म पर, इसका मतलब यह हो सकता है कि आपको जो शो और फिल्में वर्तमान में ‘हॉट’ हैं, जैसे कि रियलिटी टीवी और फोरेंसिक मर्डर डॉक्यूमेंट्री, आपकी रुचि की परवाह किए बिना सिफारिश की जा रही है। इसी तरह, पुस्तक सिफारिश प्लेटफ़ॉर्म के लिए, जो वर्तमान और हाल के बेस्ट-सेलर्स को प्रदान करने की प्रवृत्ति रखते हैं, जो कि स्पष्ट रूप से मनमाने ढंग से प्रतीत हो सकते हैं।

सिद्धांत रूप में, डेटा-संक्षिप्त उपयोगकर्ताओं को भी ऐसे प्रणालियों से बेहतर परिणाम मिलने चाहिए, क्योंकि अधिकांश खोज फ्रेमवर्क उपयोगकर्ताओं को उनके उपयोग इतिहास को संपादित करने की सीमित क्षमता प्रदान करते हैं।

कोई भी रंग जैसा आप चाहते हैं, जब तक यह काला है

हालांकि, ऑस्ट्रिया से एक नए अध्ययन के अनुसार, सामग्री-आधारित फिल्टरिंग (जो उत्पादों के बीच संबंधों को परिभाषित करने का प्रयास करता है, न कि केवल समग्र लोकप्रियता को ध्यान में रखता है) और अन्य वैकल्पिक दृष्टिकोणों पर सहयोगी फिल्टरिंग की प्रधानता, खोज प्रणालियों को लंबे समय तक लोकप्रियता पूर्वाग्रह की ओर ले जाती है, जहां स्पष्ट रूप से लोकप्रिय परिणाम उन अंतिम उपयोगकर्ताओं की ओर धकेले जाते हैं जो उनसे उत्साहित होने की संभावना नहीं है।

पेपर में पाया गया है कि जो उपयोगकर्ता लोकप्रिय आइटम में रुचि नहीं रखते हैं उन्हें ‘काफी खराब’ सिफारिशें मिलती हैं जो मध्यम या उच्च रुचि वाले उपयोगकर्ताओं की तुलना में लोकप्रिय आइटम में होती हैं, और (शायद तautologically) यह कि लोकप्रिय आइटम को अक्सर अलोकप्रिय आइटम की तुलना में अधिक बार सिफारिश की जाती है। शोधकर्ताओं का निष्कर्ष यह भी है कि लोकप्रिय आइटम में कम रुचि रखने वाले उपयोगकर्ताओं के पास बड़े उपयोगकर्ता प्रोफाइल होने की प्रवृत्ति होती है जो सिफारिश प्रणालियों में सुधार कर सकते हैं – यदि केवल प्रणालियां ‘हेर्ड’ मेट्रिक्स की लत को छोड़ सकती हैं।

लोकप्रियता की तुलना उपयोगकर्ता प्रोफाइल की जटिलता से करते हुए दिखाया गया है कि 'मार्जिनल' उपयोगकर्ता जो मुख्यधारा की सामग्री में रुचि नहीं रखते हैं, वास्तव में सिफारिश प्रणालियों के लिए अधिक सामग्री हो सकती है; लेकिन चूंकि ऐसे उपयोगकर्ता रुझानों का पालन नहीं करते हैं, इसलिए यह एक खोया हुआ अवसर प्रतीत होता है। स्रोत: https://arxiv.org/pdf/2203.00376.pdf

लोकप्रियता की तुलना उपयोगकर्ता प्रोफाइल की जटिलता से करते हुए दिखाया गया है कि ‘मार्जिनल’ उपयोगकर्ता जो मुख्यधारा की सामग्री में रुचि नहीं रखते हैं, वास्तव में सिफारिश प्रणालियों के लिए अधिक सामग्री हो सकती है; लेकिन चूंकि ऐसे उपयोगकर्ता रुझानों का पालन नहीं करते हैं, इसलिए यह एक खोया हुआ अवसर प्रतीत होता है। स्रोत: https://arxiv.org/pdf/2203.00376.pdf

इस पेपर का शीर्षक सहयोगी फिल्टरिंग-आधारित मल्टीमीडिया सिफारिश प्रणालियों में लोकप्रियता पूर्वाग्रह है, और यह ग्राज़ में अब-सेंटर जीएमबीएच और ग्राज़ यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं से आता है।

क्षेत्र जो शामिल हैं

पूर्व कार्यों की तुलना में जो व्यक्तिगत क्षेत्रों (जैसे पुस्तक सिफारिशें) का अध्ययन करते हैं, नए पेपर में चार क्षेत्र शामिल हैं: डिजिटल पुस्तकें (बुकक्रॉसिंग डेटासेट के माध्यम से); फिल्में (मूवीलेंस के माध्यम से); संगीत (लास्ट.एफएम के माध्यम से); और एनीमे (मायएनीमेलिस्ट के माध्यम से).

अध्ययन ने चार लोकप्रिय मल्टीमीडिया सिफारिश प्रणाली (एमएमआरएस) सहयोगी फिल्टरिंग एल्गोरिदम को डेटासेट विभाजित में लागू किया, जो तीन उपयोगकर्ता समूहों में विभाजित किया गया था, जो ‘लोकप्रिय’ परिणामों के प्रति उनकी प्रवृत्ति के अनुसार: लो पॉप, मेड पॉप, और हाई पॉप. उपयोगकर्ता समूहों को 1000 समान आकार के समूहों में कम कर दिया गया था, जो कम से कम, औसत और सबसे अधिक ‘लोकप्रिय’ परिणामों को पसंद करने की संभावना के आधार पर थे।

परिणामों पर टिप्पणी करते हुए, लेखकों ने कहा:

‘[हम] पाते हैं कि एक मल्टीमीडिया आइटम की सिफारिश की जाने की संभावना इस आइटम की लोकप्रियता के साथ मजबूती से सहसंबंधित है [और] यह कि उपयोगकर्ता जो लोकप्रिय आइटम में रुचि नहीं रखते हैं उन्हें मध्यम या उच्च रुचि वाले उपयोगकर्ताओं की तुलना में ‘काफी खराब’ मल्टीमीडिया सिफारिशें मिलती हैं…

‘हमारे परिणाम यह दर्शाते हैं कि हालांकि लोकप्रिय आइटम में कम रुचि रखने वाले उपयोगकर्ताओं के पास सबसे बड़े उपयोगकर्ता प्रोफाइल होने की प्रवृत्ति है, उन्हें सिफारिश प्रणालियों में सबसे कम सिफारिश सटीकता मिलती है। इसलिए, भविष्य के शोध की आवश्यकता है ताकि एमएमआरएस में लोकप्रियता पूर्वाग्रह को दोनों स्तरों पर, आइटम और उपयोगकर्ता स्तर पर, कम किया जा सके।’

मूल्यांकन किए गए एल्गोरिदम में दो के-निकटतम पड़ोसी (केएनएन) वेरिएंट शामिल थे, यूज़रकेएनएन और यूज़रकेएनएनएवीजी। पहले में लक्ष्य उपयोगकर्ता और आइटम के लिए एक औसत रेटिंग नहीं है। एक नॉन-नेगेटिव मैट्रिक्स फैक्टराइजेशन वेरिएंट (एनएमएफ) भी परीक्षण किया गया था, साथ ही एक को-क्लस्टरिंग एल्गोरिदम भी।

मूल्यांकन प्रोटोकॉल ने सिफारिश कार्य को एक पूर्वानुमान चुनौती के रूप में माना, जिसे शोधकर्ताओं ने माध्य абсолют त्रुटि (एमएई) के रूप में मापा, एक पांच-गुना क्रॉस-वैलिडेशन प्रोटोकॉल के खिलाफ जो सामान्य 80/20 विभाजन से अधिक है।

परिणाम लोकप्रियता पूर्वाग्रह की लगभग गारंटी दर्शाते हैं। प्रश्न, तर्कसंगत रूप से, यह है कि क्या यह समस्या के रूप में माना जाता है या नहीं जो वर्तमान में अपने खोज एल्गोरिदम में सीएफ को शामिल करने वाली बहु-अरब डॉलर की कंपनियों द्वारा धारण किया जाता है।

चार डेटासेट का अध्ययन करने वाले चार लोकप्रिय सहयोगी फिल्टरिंग सिफारिशों पर, प्रत्येक परिणाम यह दर्शाता है कि लोकप्रिय मीडिया आइटम को अलोकप्रिय पेशकशों की तुलना में अधिक बार सिफारिश की जाती है।

चार डेटासेट का अध्ययन करने वाले चार लोकप्रिय सहयोगी फिल्टरिंग सिफारिशों पर, प्रत्येक परिणाम यह दर्शाता है कि लोकप्रिय मीडिया आइटम को अलोकप्रिय पेशकशों की तुलना में अधिक बार सिफारिश की जाती है।

आसान तरीका

हालांकि सहयोगी फिल्टरिंग एक व्यापक खोज एल्गोरिदम रणनीति के एक हिस्से के रूप में बढ़ती उपयोग किया जा रहा है, यह खोज क्षेत्र में एक मजबूत हिस्सेदारी रखता है, और इसका तर्क और संभावित लाभदायकता आकर्षक रूप से आसान है समझने के लिए।

स्वयं में, सीएफ मूल रूप से सामग्री मूल्य का मूल्यांकन करने का कार्य अंतिम उपयोगकर्ताओं को सौंप देता है, और इसके मूल्य और अन्य ग्राहकों के लिए इसकी संभावित आकर्षण के सूचक के रूप में इसका उपयोग करता है। एक तुलना द्वारा, यह मूल रूप से ‘पानी कूलर बाज़’ का एक मानचित्र है।

सामग्री-आधारित फिल्टरिंग (सीबीएफ) अधिक कठिन है, लेकिन अधिक प्रासंगिक परिणाम प्रदान कर सकती है। कंप्यूटर विजन क्षेत्र में, वर्तमान में वीडियो सामग्री को वर्गीकृत करने और प्रयास करने पर बढ़ती मात्रा में शोध किया जा रहा है डोमेन, विशेषताएं और उच्च स्तरीय अवधारणाएं वीडियो और टीवी आउटपुट में ऑडियो और वीडियो के विश्लेषण के माध्यम से।

पिछले पांच वर्षों में कई शोध परियोजनाओं में से एक जो फिल्मों की सामग्री से सेमांटिक विशेषताएं निकालने का प्रयास करती है, ताकि अधिक बुद्धिमान 'संलग्न' सिफारिशें उत्पन्न की जा सकें। स्रोत: https://arxiv.org/pdf/1701.00199.pdf

पिछले पांच वर्षों में कई शोध परियोजनाओं में से एक जो फिल्मों की सामग्री से सेमांटिक विशेषताएं निकालने का प्रयास करती है, ताकि अधिक बुद्धिमान ‘संलग्न’ सिफारिशें उत्पन्न की जा सकें। स्रोत: https://arxiv.org/pdf/1701.00199.pdf

हालांकि, यह एक अपेक्षाकृत नवजात प्रयास है, और वर्तमान में, अधिक सामान्य संघर्ष में बंधा हुआ है जो उच्च स्तरीय अवधारणाओं और विशेषताओं को डोमेन ज्ञान में मात्रा में अलग करने और शोषण करने के लिए है।

कौन उपयोग करता है सहयोगी फिल्टरिंग?

लेखन के समय, नेटफ्लिक्स का आलोचनात्मक सिफारिश इंजन अभी भी विभिन्न सहयोगी फिल्टरिंग दृष्टिकोणों पर केंद्रित है, जो उपयोगकर्ता-प्रासंगिक सिफारिशें उत्पन्न करने के प्रयास में विभिन्न सहायक प्रौद्योगिकियों को लागू करता है।

अमेज़ॅन का खोज इंजन विकसित हुआ है अपने शुरुआती उपयोगकर्ता-आधारित सहयोगी फिल्टरिंग से एक आइटम-आइटम सहयोगी फिल्टरिंग विधि में, जो ग्राहक के खरीद इतिहास पर अधिक जोर देती है। स्वाभाविक रूप से, यह फिल्टर बुलबुले या दुर्लभ डेटा पर जोर देने जैसी विभिन्न प्रकार की अशुद्धियों को जन्म दे सकता है। बाद के मामले में, यदि एक अस्थायी अमेज़ॅन ग्राहक एक ‘असामान्य’ खरीदारी करता है, जैसे कि एक ओपेरा-प्रेमी मित्र के लिए एक सेट ऑफ ऑपेरास, तो ग्राहक की अपनी पसंद को प्रतिबिंबित करने वाली पर्याप्त वैकल्पिक खरीदारी नहीं हो सकती है ताकि यह खरीदारी उनकी स्वयं की सिफारिशों पर प्रभाव डालने से रोकी जा सके।

सहयोगी फिल्टरिंग का उपयोग फेसबुक द्वारा भी किया जाता है, अन्य दृष्टिकोणों के साथ, और लिंक्डइन, यूट्यूब, और ट्विटर द्वारा भी।

 

पहली बार 2 मार्च 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai