Anderson का एंगल
अमेज़न मैकेनिकल टर्क की कमियां प्राकृतिक भाषा पीढ़ी प्रणालियों को खतरा पहुंचा सकती हैं

मैसाचुसेट्स अमहर्स्ट विश्वविद्यालय के एक नए अध्ययन ने प्राकृतिक भाषा पीढ़ी (एनएलजी) प्रणालियों के आउटपुट का मूल्यांकन करने में अंग्रेजी शिक्षकों को अमेज़न मैकेनिकल टर्क पर भीड़भाड़ वाले कार्यकर्ताओं के खिलाफ खड़ा किया है, निष्कर्ष निकाला है कि ढीले मानक और एएमटी कार्यकर्ताओं के बीच प्रतिष्ठित कार्यों का “गेमिंग” क्षेत्र के विकास को बाधित कर सकता है।
रिपोर्ट अमेज़न मैकेनिकल टर्क की स्वेट-शॉप प्रकृति और (संभवतः बजट-निर्धारित) अकादमिक परियोजनाओं की आलोचना करती है जो एएमटी को एक वैध और सुसंगत अनुसंधान संसाधन के रूप में उपयोग करके और इसका हवाला देकर अतिरिक्त विश्वसनीयता प्रदान करती हैं। लेखकों का उल्लेख है:
‘जबकि एएमटी एक सुविधाजनक और सस्ता समाधान है, हम देखते हैं कि उच्च विचरण के बीच कार्यकर्ता, खराब कैलिब्रेशन और संज्ञानात्मक रूप से मांग वाले कार्य शोधकर्ताओं को भ्रामक वैज्ञानिक निष्कर्ष निकालने के लिए ले जा सकते हैं (उदाहरण के लिए, मानव-लिखित पाठ “गप्त-2” से बदतर है)।’
रिपोर्ट खिलाड़ियों के बजाय खेल को दोष देती है, शोधकर्ताओं का观察:
‘[भीड़] कार्यकर्ताओं को अक्सर उनकी श्रम के लिए कम भुगतान किया जाता है, जो शोध की गुणवत्ता को नुकसान पहुंचाता है, और अधिक महत्वपूर्ण बात, इन भीड़ कार्यकर्ताओं को एक पर्याप्त जीवन यापन करने की क्षमता को नुकसान पहुंचाता है।’
अध्ययन में पाया गया कि एएमटी कार्यकर्ता मानव द्वारा लिखित पाठ और मशीन द्वारा लिखित पाठ के बीच संदेह नहीं कर सकते हैं, जब तक कि वे दोनों पाठों को एक साथ न देखें, जो वास्तव में एक मूल्यांकन परिदृश्य को समझौता करेगा (जहां पाठक को एकल पाठ के नमूने पर आधारित एक निर्णय लेने में सक्षम होना चाहिए, ‘वास्तविक’ या कृत्रिम रूप से उत्पन्न)।
स्वेट-शॉप श्रम
अध्ययन में पाया गया कि एक आधिकारिक अमेज़न-रिपोर्टेड औसत कार्य समय 360 सेकंड वास्तविक दुनिया के कार्य समय में कम हो गया है केवल 22 सेकंड, और एक मध्य कार्य समय केवल 13 सेकंड – तेज़ अंग्रेजी शिक्षक द्वारा कार्य के समय का एक चौथाई।
परीक्षण कार्य
शोधकर्ताओं ने एएमटी के प्रदर्शन की तुलना कम समय-सीमित, विशेषज्ञ पाठकों के खिलाफ की, जिसमें उन्होंने $144 एएमटी सेवाओं पर खर्च किया, जो वास्तव में तुलना परीक्षणों में उपयोग की जाती थी (हालांकि ‘अनुपयोगी’ परिणामों पर अधिक खर्च किया गया था – नीचे देखें), यादृच्छिक ‘टर्क्स’ को 200 पाठों में से एक का मूल्यांकन करने के लिए आवश्यक था, जो मानव-निर्मित पाठ सामग्री और कृत्रिम रूप से उत्पन्न पाठ के बीच विभाजित था।
पाठ उत्पन्न करना
परीक्षणों के लिए एनएलजी सामग्री प्राप्त करने के लिए, शोधकर्ताओं ने फेसबुक एआई रिसर्च के 2018 हायरार्किकल न्यूरल स्टोरी जेनरेशन डेटासेट का उपयोग किया, जिसमें 303,358 अंग्रेजी भाषा की कहानियां शामिल हैं जो आर/लेखन प्रेरणा सबरेडिट पर उपयोगकर्ताओं द्वारा रची गई थीं।
परिणाम और निष्कर्ष
विस्तृत अध्ययन कई मुद्दों पर कवर करता है, लेकिन मुख्य बिंदु हैं:
छोटा समय
अध्ययन में पाया गया कि एक आधिकारिक अमेज़न-रिपोर्टेड औसत कार्य समय 360 सेकंड वास्तविक दुनिया के कार्य समय में कम हो गया है केवल 22 सेकंड, और एक मध्य कार्य समय केवल 13 सेकंड – तेज़ अंग्रेजी शिक्षक द्वारा कार्य के समय का एक चौथाई।
हाथ से पकड़ना आवश्यक
अध्ययन से पता चलता है कि एएमटी कार्यकर्ता मानव द्वारा लिखित पाठ और मशीन द्वारा लिखित पाठ के बीच संदेह नहीं कर सकते हैं, जब तक कि वे दोनों पाठों को एक साथ न देखें, जो वास्तव में एक मूल्यांकन परिदृश्य को समझौता करेगा (जहां पाठक को एकल पाठ के नमूने पर आधारित एक निर्णय लेने में सक्षम होना चाहिए, ‘वास्तविक’ या कृत्रिम रूप से उत्पन्न)।
कम गुणवत्ता वाला कृत्रिम पाठ
एएमटी कार्यकर्ताओं ने लगातार कम गुणवत्ता वाले जीपीटी-आधारित कृत्रिम पाठ को उच्च गुणवत्ता वाले मानव-लिखित पाठ के बराबर रेट किया, जबकि अंग्रेजी शिक्षक आसानी से गुणवत्ता में अंतर बता सकते थे।
कोई तैयारी समय नहीं, शून्य संदर्भ
प्रामाणिकता का मूल्यांकन करने के लिए सही मानसिकता में प्रवेश करना एक ऐसा कार्य नहीं है जो स्वाभाविक रूप से आता है; अंग्रेजी शिक्षकों को मूल्यांकन वातावरण के लिए अपनी संवेदनशीलता को कैलिब्रेट करने के लिए 20 कार्यों की आवश्यकता थी, जबकि एएमटी कार्यकर्ताओं को आमतौर पर कोई ‘ओरिएंटेशन समय’ नहीं मिलता है, जो उनके इनपुट की गुणवत्ता को कम करता है।
सिस्टम को गेम करना
रिपोर्ट बनाए रखती है कि एएमटी कार्यकर्ताओं द्वारा व्यक्तिगत कार्यों पर बिताए गए कुल समय को उन कार्यकर्ताओं द्वारा बढ़ाया जाता है जो एक ही समय में कई कार्य स्वीकार करते हैं और अपने ब्राउज़रों के विभिन्न टैब में कार्यों को चलाते हैं, बजाय इसके कि वे रिकॉर्ड किए गए कार्य अवधि के लिए एक कार्य पर ध्यान केंद्रित करते हैं।
देश का मूल महत्वपूर्ण है
एएमटी के डिफ़ॉल्ट सेटिंग्स कार्यकर्ताओं को देश के मूल के आधार पर फ़िल्टर नहीं करते हैं, और रिपोर्ट नोट करती है पिछले काम जो दर्शाता है कि एएमटी कार्यकर्ता भू-प्रतिबंधों के आसपास काम करने के लिए वीपीएन का उपयोग करते हैं, जो गैर-मूल अंग्रेजी बोलने वालों को मूल अंग्रेजी बोलने वालों के रूप में प्रस्तुत करने की अनुमति देता है (एक प्रणाली जो शायद थोड़ी निर्दोषता से, एक कार्यकर्ता की मातृभाषा को उनके आईपी-आधारित भौगोलिक स्थान के साथ समान करती है)।
इस प्रकार, शोधकर्ताओं ने एएमटी पर मूल्यांकन परीक्षणों को फिर से चलाया, जिसमें संभावित लेने वालों को गैर-अंग्रेजी बोलने वाले देशों तक सीमित करने वाले फिल्टर शामिल थे, और पाया कि ‘गैर-अंग्रेजी बोलने वाले देशों के कार्यकर्ताओं ने सुसंगतता, प्रासंगिकता और व्याकरण… अंग्रेजी बोलने वाले देशों के समान योग्य कार्यकर्ताओं की तुलना में काफी कम दर्जा दिया’।
रिपोर्ट निष्कर्ष निकालती है:
‘[विशेषज्ञ] रेटर जैसे कि भाषाविद् या भाषा शिक्षकों का उपयोग जब भी संभव हो करना चाहिए, क्योंकि उन्हें पहले से ही लिखित पाठ का मूल्यांकन करने के लिए प्रशिक्षित किया गया है, और यह बहुत अधिक महंगा नहीं है…’
16 सितंबर 2021 को प्रकाशित – 18 दिसंबर 2021 को अपडेट किया गया: टैग जोड़े गए












