Anderson का एंगल

एक एआई-ड्रIVEN बायस चेकर फॉर न्यूज आर्टिकल, पाइथन में उपलब्ध

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कैनेडा, भारत, चीन और ऑस्ट्रेलिया के शोधकर्ताओं ने मिलकर एक मुफ्त पाइथन पैकेज तैयार किया है जो समाचार प्रतिलिपि में ‘अनुचित भाषा’ को पहचानने और बदलने के लिए प्रभावी ढंग से उपयोग किया जा सकता है।

सिस्टम, जिसे Dbias कहा जाता है, विभिन्न मशीन लर्निंग प्रौद्योगिकियों और डेटाबेस का उपयोग करके एक तीन-चरण वाले चक्रीय कार्यप्रवाह को विकसित करता है जो पक्षपातपूर्ण पाठ को परिष्कृत कर सकता है जब तक कि यह एक गैर-पक्षपातपूर्ण, या कम से कम अधिक तटस्थ संस्करण वापस नहीं कर देता।

लोडेड भाषा एक समाचार स्निपेट में 'पक्षपातपूर्ण' के रूप में पहचाना जाता है जिसे Dbias द्वारा एक कम आग लगाने वाले संस्करण में बदल दिया जाता है। स्रोत: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf

लोडेड भाषा एक समाचार स्निपेट में ‘पक्षपातपूर्ण’ के रूप में पहचाना जाता है जिसे Dbias द्वारा एक कम आग लगाने वाले संस्करण में बदल दिया जाता है। स्रोत: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf

सिस्टम एक पुनर्नवीन और स्व-निहित पाइपलाइन का प्रतिनिधित्व करता है जो पिप के माध्यम से स्थापित किया जा सकता है और मौजूदा परियोजनाओं में एक पूरक चरण, ऐड-ऑन या प्लगइन के रूप में एकीकृत किया जा सकता है।

अप्रैल में, समान कार्यक्षमता जो गूगल डॉक्स में लागू की गई थी, आलोचना के अधीन आई, खासकर इसकी संपादन की कमी के लिए। Dbias, दूसरी ओर, किसी भी समाचार निगम के ऊपर चुनिंदा रूप से प्रशिक्षित किया जा सकता है जो अंतिम उपयोगकर्ता चाहता है, न्यायसंगत दिशानिर्देश विकसित करने की क्षमता को बनाए रखने के लिए।

महत्वपूर्ण अंतर यह है कि Dbias पाइपलाइन का उद्देश्य स्वचालित रूप से ‘लोडेड भाषा’ (जो शब्दों को एक महत्वपूर्ण परत जोड़ते हैं) को तटस्थ या साधारण भाषा में बदलना है, न कि उपयोगकर्ता को निरंतर आधार पर स्कूल करने के लिए। मूल रूप से, अंतिम उपयोगकर्ता नैतिक फिल्टर परिभाषित करेगा और प्रणाली को उसी के अनुसार प्रशिक्षित करेगा; गूगल डॉक्स दृष्टिकोण में, प्रणाली – तर्कसंगत रूप से – उपयोगकर्ता को एकतरफा तरीके से प्रशिक्षित कर रही है।

Dbias कार्यप्रवाह के लिए अवधारणात्मक वास्तुकला।

Dbias कार्यप्रवाह के लिए अवधारणात्मक वास्तुकला।

शोधकर्ताओं के अनुसार, Dbias वास्तव में पहला विन्यास योग्य पक्षपात पता लगाने वाला पैकेज है, जो इस प्राकृतिक भाषा प्रसंस्करण (एनएलपी) के उप-क्षेत्र में अब तक के ऑफ-द-शेल्फ असेंबली परियोजनाओं के विपरीत है।

नया पत्र समाचार लेखों में न्यायसंगतता सुनिश्चित करने के लिए एक दृष्टिकोण शीर्षक से है, और टोरंटो विश्वविद्यालय, टोरंटो मेट्रोपोलिटन विश्वविद्यालय, बैंगलोर में पर्यावरण संसाधन प्रबंधन, चीन में डीपब्लू एकेडमी ऑफ साइंसेज और सिडनी विश्वविद्यालय के योगदानकर्ताओं से आया है।

विधि

Dbias में पहला मॉड्यूल पक्षपात पता लगाना है, जो DistilBERT पैकेज का लाभ उठाता है – गूगल के काफी मशीन-गहन BERT का एक अत्यधिक अनुकूलित संस्करण। परियोजना के लिए, DistilBERT को मीडिया बायस एनोटेशन (एमबीआईसी) डेटासेट पर ठीक किया गया था।

एमबीआईसी विभिन्न मीडिया स्रोतों से समाचार लेखों का एक संग्रह है, जिनमें हफिंगटन पोस्ट, यूएसए टुडे और एमएसएनबीसी शामिल हैं। शोधकर्ताओं ने डेटासेट के विस्तारित संस्करण का उपयोग किया।

हालांकि मूल डेटा को भीड़ से सोर्स किए गए कार्यकर्ताओं (एक विधि जो 2021 के अंत में आलोचना के अधीन आई) द्वारा एनोटेट किया गया था, नए पत्र के शोधकर्ता डेटासेट में पक्षपात के अतिरिक्त अनलेबल्ड उदाहरणों की पहचान करने में सक्षम थे और उन्हें मैनुअल रूप से जोड़ा। पहचाने गए पक्षपात के मामले जाति, शिक्षा, जातीयता, भाषा, धर्म और लिंग से संबंधित थे।

अगला मॉड्यूल, पक्षपात मान्यता, नामित इकाई मान्यता (एनईआर) का उपयोग करके पक्षपातपूर्ण शब्दों को इनपुट पाठ से अलग करता है। पत्र में कहा गया है:

‘उदाहरण के लिए, समाचार “टॉरनेडो और जलवायु परिवर्तन के बारे में छद्म-वैज्ञानिक हाइप” को पहले पक्षपात पता लगाने वाले मॉड्यूल द्वारा पक्षपातपूर्ण के रूप में वर्गीकृत किया गया है, और पक्षपात मान्यता मॉड्यूल “छद्म-वैज्ञानिक हाइप” शब्द को एक पक्षपातपूर्ण शब्द के रूप में पहचान सकता है।’

NER विशेष रूप से इस कार्य के लिए डिज़ाइन नहीं किया गया है, लेकिन पहले पक्षपात पहचान के लिए उपयोग किया गया है, विशेष रूप से 2021 की परियोजना के लिए डरहम विश्वविद्यालय, यूके से।

इस चरण के लिए, शोधकर्ताओं ने RoBERTa का उपयोग किया, जो SpaCy अंग्रेजी ट्रांसफॉर्मर एनईआर पाइपलाइन के साथ जुड़ा हुआ है।

अगला चरण, पक्षपात मास्किंग, पहचाने गए पक्षपातपूर्ण शब्दों के एक नोवेल मल्टीपल-मास्क को शामिल करता है, जो क्रमिक रूप से कई पहचाने गए पक्षपातपूर्ण शब्दों के मामलों में काम करता है।

Dbias के तीसरे चरण में लोडेड भाषा को व्यावहारिक भाषा में बदल दिया जाता है। ध्यान दें कि 'माउथिंग' और 'उपयोग' एक ही क्रिया के बराबर हैं, हालांकि पूर्ववाला अपमानजनक माना जाता है।

Dbias के तीसरे चरण में लोडेड भाषा को व्यावहारिक भाषा में बदल दिया जाता है। ध्यान दें कि ‘माउथिंग’ और ‘उपयोग’ एक ही क्रिया के बराबर हैं, हालांकि पूर्ववाला अपमानजनक माना जाता है।

जैसा कि आवश्यक हो, इस चरण से प्रतिक्रिया पाइपलाइन की शुरुआत में वापस भेजी जाएगी ताकि वैकल्पिक शब्दों या वाक्यांशों के एक सuitable सेट का उत्पादन हो सके। इस चरण में मास्क्ड लैंग्वेज मॉडलिंग (एमएलएम) का उपयोग किया जाता है, जो 2021 के सहयोग द्वारा स्थापित रूपरेखा के साथ जुड़ा हुआ है।

आम तौर पर, एमएलएम कार्य 15% शब्दों को यादृच्छिक रूप से मास्क करता है, लेकिन Dbias कार्यप्रवाह प्रक्रिया को पहचाने गए पक्षपातपूर्ण शब्दों को इनपुट के रूप में लेने के लिए कहता है।

स्थापत्य को गूगल कोलाब प्रो पर एक एनवीडिया पी100 पर 24GB के वीआरएएम के साथ, 16 के बैच आकार पर लागू किया गया था, केवल दो लेबल (पक्षपातपूर्ण और गैर-पक्षपातपूर्ण) का उपयोग किया गया था।

परीक्षण

शोधकर्ताओं ने Dbias का परीक्षण पांच तुलनात्मक दृष्टिकोणों के खिलाफ किया: एलजी-टीएफआईडीएफ के साथ लॉजिस्टिक रिग्रेशन और टीएफआईडीवेक्टराइज़र (टीएफआईडीएफ) शब्द एम्बेडिंग; एलजी-एलएमओ; एमएलपी-एलएमओ (एक फीड-फॉरवर्ड आर्टिफिशियल न्यूरल नेटवर्क जिसमें एलएमओ एम्बेडिंग है); बीईआरटी; और रोबेर्टा।

परीक्षणों के लिए उपयोग किए गए मेट्रिक्स में सटीकता (एसीसी), सटीकता (प्रेस), रिकॉल (रिक) और एफ1 स्कोर शामिल थे। चूंकि शोधकर्ताओं को किसी भी मौजूदा प्रणाली के बारे में कोई ज्ञान नहीं था जो एक ही पाइपलाइन में तीनों कार्य कर सकती है, प्रतिस्पर्धी फ्रेमवर्क के लिए छूट दी गई, Dbias के प्राथमिक कार्यों – पक्षपात पता लगाना और मान्यता – का मूल्यांकन किया गया।

Dbias परीक्षणों के परिणाम।

Dbias परीक्षणों के परिणाम।

Dbias ने प्रतिस्पर्धी फ्रेमवर्क से बेहतर परिणाम हासिल किए, जिनमें भारी प्रसंस्करण फुटप्रिंट वाले भी शामिल हैं।

पत्र में कहा गया है:

‘परिणाम यह भी दिखाता है कि गहरे तंत्रिका नेटवर्क एम्बेडिंग一般 रूप से पक्षपात वर्गीकरण कार्य में पारंपरिक एम्बेडिंग विधियों (जैसे टीएफआईडीएफ) को बेहतर प्रदर्शन कर सकती है। यह एलजी के साथ उपयोग किए जाने पर टीएफआईडीएफ वेक्टरीकरण की तुलना में एलएमओ (जैसे एलएमओ) के बेहतर प्रदर्शन से दिखाया गया है। ‘

‘यह शायद इसलिए है क्योंकि गहरे तंत्रिका एम्बेडिंग विभिन्न संदर्भों में पाठ में शब्दों के संदर्भ को बेहतर ढंग से पकड़ सकती है। गहरे तंत्रिका एम्बेडिंग और गहरे तंत्रिका विधियां (एमएलपी, बीईआरटी, रोबेर्टा) भी पारंपरिक एमएल विधि (एलजी) की तुलना में बेहतर प्रदर्शन करती हैं। ‘

शोधकर्ताओं ने यह भी नोट किया कि ट्रांसफॉर्मर-आधारित विधियां पक्षपात पता लगाने में प्रतिस्पर्धी विधियों को बेहतर प्रदर्शन करती हैं।

एक अतिरिक्त परीक्षण में Dbias और विभिन्न स्पेसी कोर वेब संस्करणों के बीच तुलना की गई, जिनमें कोर-स्म (छोटा), कोर-मीड (मध्यम) और कोर-लार्ज (बड़ा) शामिल थे। Dbias इन परीक्षणों में भी बोर्ड का नेतृत्व करने में सक्षम था:

शोधकर्ताओं ने निष्कर्ष निकाला कि पक्षपात मान्यता कार्य आमतौर पर बड़े और अधिक महंगे मॉडल में बेहतर सटीकता दिखाते हैं, जो – वे अनुमान लगाते हैं – पैरामीटर और डेटा बिंदुओं की बढ़ी हुई संख्या के कारण है। वे यह भी देखते हैं कि इस क्षेत्र में भविष्य के कार्य की प्रभावशीलता उच्च गुणवत्ता वाले डेटासेट को एनोटेट करने के लिए बड़े प्रयासों पर निर्भर करेगी।

वन और पेड़

आशा है कि इस तरह की बारीकी से पक्षपात मान्यता परियोजना को अंततः उन पक्षपात-खोज फ्रेमवर्क में शामिल किया जाएगा जो कम दृष्टिकोण ले सकते हैं और यह ध्यान में रख सकते हैं कि किसी विशेष कहानी को कवर करने का चयन करना स्वयं एक पक्षपातपूर्ण कार्य है जो केवल रिपोर्ट की गई दृश्य सांख्यिकी से अधिक से प्रेरित हो सकता है।

 

पहली बार 14 जुलाई 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai