Anderson का एंगल

पुराने ‘सच’ को मशीन लर्निंग के साथ हटाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कभी-कभी सच्चाई की एक समाप्ति तिथि होती है। जब एक समय-सीमित दावा (जैसे ‘सार्वजनिक परिवहन पर मास्क अनिवार्य हैं’) खोज इंजन रैंकिंग में प्रकट होता है, तो इसका स्पष्ट ‘प्राधिकृत’ समाधान कई वर्षों तक भी अपना स्वागत कर सकता है, बाद के और अधिक सटीक सामग्री को उसी विषय पर रैंकिंग में पछाड़ सकता है।

यह खोज इंजन एल्गोरिदम के ‘दीर्घकालिक’ निश्चित समाधानों की पहचान करने और बढ़ावा देने के निर्धारण का एक उपोत्पाद है, और उनकी प्रवृत्ति है कि वे अच्छी तरह से जुड़े हुए सामग्री को यातायात को बनाए रखने के लिए समय के साथ प्राथमिकता देते हैं – और बढ़ती सावधानी से नए सामग्री के प्रति दृष्टिकोण में फेक न्यूज के बढ़ते युग में।

वैकल्पिक रूप से, केवल इसलिए कि इसके साथ जुड़े टाइमस्टैम्प एक मनमाने ‘वैधता खिड़की’ से गुजर चुका है, मूल्यवान वेब सामग्री को कम करने से जोखिम है कि एक पीढ़ी वास्तव में उपयोगी सामग्री स्वचालित रूप से कम की जा सकती है बाद के सामग्री के पक्ष में जो कम मानक का हो सकता है।

इस सिंड्रोम को दूर करने के लिए, इटली, बेल्जियम और डेनमार्क के शोधकर्ताओं द्वारा एक नई पेपर ने विभिन्न मशीन लर्निंग तकनीकों का उपयोग करके एक समय-सचेत साक्ष्य रैंकिंग के लिए एक विधि विकसित करने के लिए किया है।

पुराने उत्तरों से परे

इस पेपर के लेखक यूरोपीय आयोग के ज्वाइंट रिसर्च सेंटर (जेआरसी) में इस्प्रा, कैथोलिक यूनिवर्सिटी ल्यूवेन में, और कोपेनहेगन विश्वविद्यालय में शोधकर्ता हैं।

काम में चार समयिक रैंकिंग विधियों को तीन तथ्य-जांच विधियों पर लागू किया जाता है, प्रत्येक में साक्ष्य रैंकिंग के लिए एक अलग दृष्टिकोण है, और साक्ष्य के लिए एक नई विधि प्रदान करता है जो समय के साथ साक्ष्य रैंकिंग में सुधार करता है। अध्ययन से पता चलता है कि समय-सचेत साक्ष्य रैंकिंग परिणामों की सटीकता में सुधार करती है, और समय-संवेदनशील तथ्यों और दावों की सत्यता और प्राधिकरण की भविष्यवाणी में भी सुधार करती है।

शोध एक संभावित पूरक के रूप में पेश किया जाता है जो बाद के या मौजूदा प्रणालियों के लिए हो सकता है, और अनुसंधान में सहायता के लिए डिज़ाइन किया गया है, और नए और विकसित खोज इंजन एल्गोरिदम विकसित करने में एक संभावित अतिरिक्त कारक के रूप में हो सकता है।

काम सामग्री-आधारित तथ्य-जांच के लिए साक्ष्य के समयिक गतिविधियों का मॉडलिंग करता है, और टाइपिकल खोज इंजन रैंकिंग एल्गोरिदम द्वारा अपनाए गए ‘सेमेंटिक समानता’ दृष्टिकोणों से बेहतर प्रदर्शन करता है। शोधकर्ताओं द्वारा प्रशिक्षित मॉडल एक अनुकूलित सीखने-रैंक फ़ंक्शन का उपयोग करता है जिसे आसानी से मौजूदा तथ्य-जांच वास्तुकला में शामिल किया जा सकता है। शोधकर्ता दावा करते हैं कि प्रणाली स्वचालित तथ्य-जांच में एक नई योगदान है।

बहुसंख्यक तथ्य-जांच वास्तुकला में संशोधन

शोधकर्ताओं ने अपने समय-निर्धारित तथ्य-जांच वास्तुकला को तीन मौजूदा तथ्य-जांच वास्तुकला पर लागू किया है। पहला बिडायरेक्शनल लॉन्ग शॉर्ट टर्म मेमोरी (बीआईएलएसटीएम) मॉडल है जो 2019 में जारी मल्टीफसी डेटासेट में प्रस्तावित किया गया था।

दूसरा पहले का एक संशोधन है, जिसमें एक.unidirectional रिकरेंट न्यूरल नेटवर्क (आरएनएन) एलएसटीएम घटक को बदल देता है।

तीसरा मॉडल जिसे शोधकर्ताओं ने उपयोग किया है वह हगिंग फेस लाइब्रेरी से डिस्टिलबेर्ट ट्रांसफॉर्मर है, जो गूगल के बीईआरटी एनएलपी मॉडल का एक डिस्टिल्ड संस्करण है।

तीनों वास्तुकला में, शोधकर्ताओं ने माइक्रोसॉफ्ट द्वारा नेतृत्व वाले शोध से एक लिस्टमएलई नुकसान लागू किया है, जिसने पिछले दो दशकों में नियमित रूप से नए तथ्य-जांच शोध में योगदान दिया है।

दो प्राथमिक तथ्य-जांच मॉडल जिनमें शोध टीम ने एक समयिक घटक जोड़ा है प्राधिकरण और बाद के रैंकिंग मूल्यों के लिए एक फिल्टर के रूप में। स्रोत: https://arxiv.org/pdf/2009.06402.pdf

दो प्राथमिक तथ्य-जांच मॉडल जिनमें शोध टीम ने एक समयिक घटक जोड़ा है प्राधिकरण और बाद के रैंकिंग मूल्यों के लिए एक फिल्टर के रूप में। स्रोत: https://arxiv.org/pdf/2009.06402.pdf

टाइमस्टैम्प मान प्रशिक्षण मेटाडेटा से निकाले गए थे, और प्रत्येक मॉडल में रैंकिंग कारकों के रूप में शामिल किए गए थे।

परीक्षण

प्रणाली के लिए प्रयोगात्मक मूल्यांकन में मल्टीफसी डेटासेट का उपयोग शामिल था, क्योंकि यह वर्तमान में इस विशिष्ट शोध हित के लिए उपलब्ध एकमात्र उच्च-वॉल्यूम ओपन-सोर्स डेटासेट है। मल्टीफसी में 34,924 वास्तविक दुनिया के दावे शामिल हैं जो 26 अलग-अलग तथ्य-जांच डोमेन से प्राप्त हुए हैं, जिनमें स्नोप्स और वाशिंगटन पोस्ट शामिल हैं।

प्रत्येक दावे की सत्यता की भविष्यवाणी गूगल सर्च एपीआई द्वारा प्रदान किए गए दस साक्ष्य स्निपेट द्वारा बढ़ाई जाती है, और विभिन्न तत्वों के संयोजन द्वारा प्राप्त भविष्यवाणियां, जिनमें स्पीकर, टैग और श्रेणियां शामिल हैं।

अक्सर प्रासंगिक टाइमस्टैम्प आवश्यक रूप से वह नहीं होता है जो मेटाडेटा में निहित होता है; एक लेख पिछले समय से घटनाओं का उल्लेख कर सकता है, और इस मामले में शोधकर्ताओं की प्रणाली को सावधानी से उस डेटा को सीधे पाठ से निकालने और परिवर्तित करने की आवश्यकता थी। इस प्रक्रिया के बिना, एक ‘पुनः चलाने’ पुरानी खबर देने के लिए एक नया रूप दे सकता है, विशेष रूप से उच्च प्राधिकरण साइटों के मामले में, पुराने डेटा को प्रसारित करना।

तारीखें एक पाइथन दिनचर्या के साथ निकाली गईं, और आधिकारिक मेटाडेटा तारीखों को प्रारूप की एकरूपता के लिए परीक्षण किया गया (क्योंकि, उदाहरण के लिए, यूएस और यूके तारीख-टिकट प्रारूप अलग हैं)। जब मैनुअल रूप से सत्यापित किया गया, तो समय-टिकट मेटाडेटा में शून्य त्रुटियां पाई गईं।

परिणाम

स्वचालित परिणामों की मैनुअल जांच के खिलाफ, शोधकर्ताओं ने पाया कि समय-सचेत साक्ष्य रैंकिंग ने शुद्ध सेमेंटिक समानता या एसईआरपी रैंकिंग पर आधारित मान्यताओं पर उल्लेखनीय रूप से सुधार किया। वे यह भी निर्धारित करते हैं कि उनकी विधि समय-संवेदनशील दावों (अर्थात परिस्थितियों में जहां एक समाचार स्थिति तेजी से बदल रही है, और जहां यह आवश्यक है कि अद्यतन जानकारी को प्राथमिकता दी जाए बिना केवल हाल के परिणामों को प्राथमिकता देने के लिए) के लिए सत्यता की भविष्यवाणी में सुधार करती है।

शोधकर्ता ध्यान देते हैं कि यह दृष्टिकोण राजनीति और मनोरंजन जैसे अस्थिर विषयों के लिए रैंकिंग मॉडल में सुधार करने में उच्च मूल्य का होगा, जहां जानकारी तेजी से बदलती है, और उच्च रैंकिंग विकास के लिए एक फ्रेमवर्क की आवश्यकता होती है स्वचालित रूप से रैंकिंग में शीर्ष स्थानों से हटाने के लिए जो उन्होंने रिलीज पर हासिल किया हो सकता है।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai