Anderson का एंगल

एक एआई सोलमेट रिकमेंडर सिस्टम जो केवल छवियों पर आधारित है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यूके के शोधकर्ताओं ने न्यूरल नेटवर्क का उपयोग करके एक पूरी तरह से छवि-आधारित रिकमेंडर सिस्टम विकसित किया है, जो ऑनलाइन डेटिंग मैचों के लिए केवल यह देखता है कि क्या दो उपयोगकर्ता एक दूसरे की तस्वीरों को आकर्षक पाते हैं (प्रोफ़ाइल जानकारी जैसे नौकरी, आयु आदि के बजाय), और पाया कि यह कम ‘उपभोक्ता’ प्रणालियों की तुलना में सटीक मैच प्राप्त करने के मामले में बेहतर प्रदर्शन करता है।

परिणामी प्रणाली को टेम्पोरल इमेज-आधारित पारस्परिक रिकमेंडर (टीआईआरआर) कहा जाता है, और यह एक उपयोगकर्ता की ऐतिहासिक प्रवृत्ति को व्याख्या करने के लिए रिकरेंट न्यूरल नेटवर्क (आरएनएन) का उपयोग करता है जो वह चेहरों के प्रति प्रदर्शित करता है जिन्हें वह संभावित मैचों के लिए ब्राउज़ करते समय देखता है।

शोध पत्र का शीर्षक है – शायद निराशाजनक रूप से – ऑनलाइन डेटिंग में पारस्परिक अनुशंसा के लिए फोटो सभी आपको चाहिए, और यह ब्रिस्टल विश्वविद्यालय के दो शोधकर्ताओं से है, जो 2020 में समान प्रणाली (जिसे इमआरईसी कहा जाता है) जारी करने वाली同 टीम द्वारा किया गया है।

परीक्षणों में, प्रणाली ने उपयोगकर्ताओं के बीच पारस्परिक मैचों की भविष्यवाणी में राज्य-कला सटीकता प्राप्त की, न केवल 2020 के काम में सुधार किया, बल्कि अन्य सामग्री-आधारित डेटिंग पारस्परिक अनुशंसा प्रणालियों पर भी सुधार किया जो डेटिंग प्रोफाइल में अधिक विस्तृत, पाठ-आधारित जानकारी को ध्यान में रखते हैं।

वास्तविक दुनिया डेटिंग डेटासेट

टीआईआरआर को एक अज्ञात ‘लोकप्रिय’ ऑनलाइन डेटिंग सेवा द्वारा प्रदान की गई उपयोगकर्ता जानकारी पर प्रशिक्षित किया गया था, जिसमें ‘कई मिलियन पंजीकृत उपयोगकर्ता’ थे, जो केवल तभी उपयोगकर्ताओं को एक दूसरे से संवाद करने की अनुमति देता था जब प्रत्येक ने दूसरे की प्रोफ़ाइल को ‘लाइक’ किया हो। उपयोग किए गए डेटा का उपसेट 200,000 विषयों को शामिल करता था, जो पुरुषों और महिलाओं के बीच समान रूप से विभाजित थे, और सभी डेटिंग प्रोफाइल में लगभग 800,000 उपयोगकर्ता-व्यक्त प्राथमिकताएं थीं।

चूंकि डेटा प्रदान करने वाली अज्ञात डेटिंग सेवा केवल समलैंगिक मैचों का समर्थन करती है, इसलिए शोध में केवल पुरुष/महिला मैच शामिल थे।

टीआईआरआर पिछली पारस्परिक अनुशंसा प्रणालियों (आरआरएस) डिज़ाइनों में सुधार करता है जो सीधे दो प्रोफाइल के बीच मैच की संभावना की गणना करता है, केवल प्रोफ़ाइल छवियों पर आधारित है। पिछली प्रणालियों ने इसके बजाय दो एकदिश प्राथमिकताओं की भविष्यवाणी की और फिर उन्हें एक भविष्यवाणी प्राप्त करने के लिए एकत्रित किया।

शोधकर्ताओं ने उन उपयोगकर्ताओं को बाहर कर दिया जिन्हें डेटिंग सेवा से हटा दिया गया था (किसी भी कारण से, स्वेच्छा से छोड़ने सहित), और उन प्रोफाइलों को बाहर कर दिया जिनमें चेहरा-आधारित फोटो शामिल नहीं थीं।

उपयोगकर्ता इतिहास को एक वर्ष पीछे तक सीमित कर दिया गया था, ताकि समय के साथ डेटिंग साइट द्वारा अपने एल्गोरिदम में किए गए संभावित विचलन से बचा जा सके। उन्हें 15 उपयोगकर्ता प्राथमिकताओं की अधिकतम सीमा तक भी सीमित कर दिया गया था, क्योंकि वे मॉडल डिज़ाइन को साबित करने के लिए पर्याप्त साबित हुए थे, जबकि प्राथमिकताओं का अधिक व्यापक उपयोग प्रदर्शन को कम कर देता था और प्रशिक्षण समय को बढ़ा देता था।

इसके अलावा, कुछ अधिक उत्साही या दीर्घकालिक उपयोगकर्ताओं के पास हज़ारों प्राथमिकताएं थीं, जो प्राप्त सुविधाओं के वजन को जोखिम में डाल सकती थीं और प्रशिक्षण समय को और बढ़ा सकती थीं।

सियामीज़ नेटवर्क

टीआईआरआर को एक सियामीज़ नेटवर्क का उपयोग करके बनाया गया है, जो आमतौर पर ‘वन-शॉट’ सीखने के लिए उपयोग किया जाता है।

एक टेम्पलेट सियामीज़ नेटवर्क, जहां समानांतर कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) वजन साझा करते हैं लेकिन डेटा नहीं। वे प्रत्येक सीएनएन के आउटपुट से व्युत्पन्न एक हानि फ़ंक्शन और एक ग्राउंड ट्रुथ लेबल भी साझा करते हैं। स्रोत: https://arxiv.org/pdf/2108.11714.pdf

एक टेम्पलेट सियामीज़ नेटवर्क, जहां समानांतर कन्वोल्यूशनल न्यूरल नेटवर्क (सीएनएन) वजन साझा करते हैं लेकिन डेटा नहीं। वे प्रत्येक सीएनएन के आउटपुट से व्युत्पन्न एक हानि फ़ंक्शन और एक ग्राउंड ट्रुथ लेबल भी साझा करते हैं। स्रोत: https://arxiv.org/pdf/2108.11714.pdf

नेटवर्क को बाइनरी क्रॉस-एंट्रोपी का उपयोग करके प्रशिक्षित किया गया था, जो न्यूरल नेटवर्क में एक सामान्य हानि फ़ंक्शन है, और जिसे शोधकर्ताओं ने विपरीत हानि की तुलना में बेहतर परिणाम देने वाला पाया। बाद वाला दो चेहरों के बीच समानता का मूल्यांकन करने वाली प्रणालियों में सबसे प्रभावी है, लेकिन चूंकि यह टीआईआरआर का उद्देश्य नहीं है, यह दृष्टिकोण इस संदर्भ में खराब प्रदर्शन करता है।

यह आवश्यक है कि प्रणाली जिस जानकारी को विकसित करती है उसे बनाए रखे और कई बार एक ही डेटा पर प्रशिक्षित होने के दौरान उस पर निर्माण करे, और टीआईआरआर में सियामीज़ नेटवर्क एक लंबी अवधि की छोटी अवधि की स्मृति (एलएसटीएम) नेटवर्क का उपयोग करता है इन निर्णयों को लेने और यह सुनिश्चित करने के लिए कि प्रासंगिक माने जाने वाली विशेषताएं ad हoc के रूप में नहीं छोड़ी जाती हैं क्योंकि फ्रेमवर्क अपनी अंतर्दृष्टि बनाता है।

टीआईआरआर के लिए विशिष्ट सियामीज़ नेटवर्क आर्किटेक्चर।

टीआईआरआर के लिए विशिष्ट सियामीज़ नेटवर्क आर्किटेक्चर।

शोधकर्ताओं ने पाया कि नेटवर्क बहुत धीरे-धीरे प्रशिक्षित हुआ जब सभी डेटा को इनपुट किया गया, और बाद में डेटा को तीन चरणों में विभाजित किया, तीन अलग-अलग डेटा उपसेट का उपयोग किया। इसमें कुछ अतिरिक्त लाभ है, क्योंकि शोधकर्ताओं के 2020 के प्रयोगों ने पहले ही दिखा दिया था कि पुरुष और महिला डेटासेट को अलग-अलग प्रशिक्षित करने से पारस्परिक अनुशंसा प्रणाली के प्रदर्शन में सुधार होता है।

टीआईआरआर के सियामीज़ नेटवर्क के लिए अलग-अलग प्रशिक्षण सत्रों का विभाजन।

टीआईआरआर के सियामीज़ नेटवर्क के लिए अलग-अलग प्रशिक्षण सत्रों का विभाजन।

परीक्षण

टीआईआरआर के प्रदर्शन का मूल्यांकन करने के लिए, शोधकर्ताओं ने प्राप्त डेटा का एक हिस्सा अलग रखा और इसे पूरी तरह से समाहित प्रणाली के माध्यम से चलाया। हालांकि, चूंकि प्रणाली काफी नई है, इसकी तुलना करने के लिए कोई सीधा पूर्ववर्ती प्रणाली नहीं है।

अतः, शोधकर्ताओं ने पहले सियामीज़ नेटवर्क के लिए एक रिसीवर ऑपरेटिंग कर्व (आरओसी) बेसलाइन स्थापित की, trước از यूनिफ़ॉर्म मैनिफ़ोल्ड अनुमान और प्रोजेक्शन के लिए आयाम कम करने (यूएमएपी) का उपयोग करके 128-आयामी वेक्टरों को आसान दृश्यीकरण के लिए पतला किया, ताकि पसंद और नापसंद की एक सुसंगत प्रवाह स्थापित की जा सके।

बाएं, सियामीज़ नेटवर्क का आरओसी बेसलाइन प्रदर्शन संकेतक के रूप में; दाएं, यूएमएपी विज़ुअलाइज़ेशन 'पसंद' को लाल रंग में और 'नापसंद' को काले रंग में दिखाता है।

बाएं, सियामीज़ नेटवर्क का आरओसी बेसलाइन प्रदर्शन संकेतक के रूप में; दाएं, यूएमएपी विज़ुअलाइज़ेशन ‘पसंद’ को लाल रंग में और ‘नापसंद’ को काले रंग में दिखाता है।

टीआईआरआर का परीक्षण समान दायरे वाली सामग्री-आधारित और सहयोगी फिल्टरिंग प्रणालियों के खिलाफ किया गया, जिनमें शोधकर्ताओं का पिछला काम इमआरईसी (ऊपर देखें) शामिल है, और आरईसीओएन, 2010 से एक आरआरएस, साथ ही साथ सहयोगी फिल्टरिंग एल्गोरिदम आरसीएफ (2015 में एक डेटिंग आरआरएस जो पाठ सामग्री पर आधारित है) और एलएफआरआर (2019 से एक समान परियोजना)।

सभी मामलों में, टीआईआरआर ने बेहतर सटीकता प्रदान की, हालांकि एलएफआरआर की तुलना में केवल थोड़ा सा, जो यह सुझाव दे सकता है कि प्रोफ़ाइल पाठ सामग्री और विषयों की प्रोफ़ाइल तस्वीरों की अनुमानित आकर्षण के बीच संबंधित कारक हो सकते हैं।

टीआईआरआर और अधिक पाठ-आधारित एलएफआरआर के बीच लगभग-परितुलना यह सुझाव देती है कि उपयोगकर्ताओं की दृष्टिकोण से दृश्य आकर्षण की धारणा प्रोफ़ाइल पाठ सामग्री से प्रभावित हो सकती है; या यह कि प्रोफ़ाइल पाठ सामग्री को अधिक ध्यान और अनुमोदन प्राप्त होता है जितना कि होता अगर संबंधित तस्वीर को आकर्षक नहीं माना जाता।

स्पष्ट कारणों से, शोध टीम टीआईआरआर के लिए डेटासेट या सोर्स कोड जारी करने में असमर्थ है, लेकिन अन्य टीमों को अपने दृष्टिकोण को दोहराने और पुष्टि करने के लिए प्रोत्साहित करती है।

 

नोट: मुख्य चित्र में उपयोग की जाने वाली छवियां thispersondoesnotexist.com से हैं।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai