एआई मॉडल और प्लेटफ़ॉर्म

अपेन लिमिटेड एनएलपी के लिए विविध डेटा प्रशिक्षण सेट लॉन्च करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अपेन लिमिटेड, एक प्रमुख प्रदाता जो कंपनियों को बड़े पैमाने पर एआई सिस्टम बनाने के लिए उच्च गुणवत्ता वाले प्रशिक्षण डेटा प्रदान करता है, एनएलपी पहलों के लिए नए विविध प्रशिक्षण डेटासेट लॉन्च कर रहा है। ये डेटासेट अंतिम उपयोगकर्ताओं को भाषा की विविधता, बोली, एथनोलेक्ट, उच्चारण, जाति या लिंग की परवाह किए बिना एक ही अनुभव प्राप्त करने में सक्षम बनाएगा।

मार्च 2020 में पीएनएएस द्वारा एक रिपोर्ट के अनुसार, लोकप्रिय स्वचालित भाषण पहचान (एएसआर) प्रणाली, विशेष रूप से वर्चुअल सहायक, बंद कैप्शनिंग और हाथों से मुक्त कंप्यूटिंग के लिए उपयोग की जाने वाली, अक्सर प्रदर्शन में नस्लीय असमानता प्रदर्शित करती हैं। इसका अधिकांश हिस्सा इस तथ्य से संबंधित है कि सिस्टम पूर्वाग्रहित या अपूर्ण डेटा पर आधारित हैं, और यही कारण है कि विविध प्रशिक्षण सेट विकसित करना इतना महत्वपूर्ण है।

नई लॉन्च के साथ, अपेन प्रदर्शन में अंतर को कम करने और भाषण पहचान प्रौद्योगिकी के लिए अधिक समावेशी वातावरण बनाने का लक्ष्य रखता है। भाषा व्याख्या और एनएलपी प्रणालियों में भी समान प्रकार की चुनौतियाँ मौजूद हैं।

मार्क ब्रायन अपेन के सीईओ हैं।

“प्रशिक्षण डेटा की गुणवत्ता और विविधता सीधे एआई मॉडल में प्रदर्शन और पूर्वाग्रह को प्रभावित करती है,” ब्रायन ने कहा। “एक डेटा भागीदार के रूप में, हम विभिन्न उपयोग के मामलों के लिए पूर्ण प्रशिक्षण डेटा प्रदान कर सकते हैं ताकि एआई मॉडल सभी के लिए काम करें। यह महत्वपूर्ण है कि हम विविध समूहों के व्यक्तियों को शामिल करें ताकि डेटा का उत्पादन, लेबलिंग और सत्यापन किया जा सके ताकि यह सुनिश्चित किया जा सके कि प्रशिक्षित मॉडल न केवल न्यायसंगत है, बल्कि जिम्मेदारी से भी बनाया गया है।”

अपेन भाषा परियोजनाएं

अपेन विभिन्न परियोजनाओं और साझेदारियों के माध्यम से विविध एआई वातावरण बनाने का प्रयास करता है, जिनमें शामिल हैं:

  • अनुवादक बिना सीमाओं (टीडब्ल्यूबी) साझेदारी: अपेन ने टीडब्ल्यूबी, अमेज़ॅन, कार्नेगी मेलन विश्वविद्यालय, फ़ेसबुक, गूगल, जॉन्स हॉपकिन्स विश्वविद्यालय, माइक्रोसॉफ्ट और अनुवादित के साथ साझेदारी की है। साझेदारी ने कोविड-19 के लिए अनुवाद पहल (टीआईसीओ-19) में शामिल होकर कोविड-19 जानकारी तक पहुँच बढ़ाने का प्रयास किया है, जिसमें कई भाषाओं में भाषा प्रौद्योगिकी का विकास शामिल है, जिनमें कांगोली स्वाहिली, तिग्रिन्या और नाइजीरियाई फुलफुल्डे जैसे विकासशील देश शामिल हैं।
  • कैनेडियन फ्रेंच अनुवाद परियोजना: अपेन ने माइक्रोसॉफ्ट ट्रांस्लेटर में “कैनेडियन फ्रेंच” को एक भाषा विकल्प के रूप में जोड़ने में मदद की है, जिसमें मूल भाषा परामर्शदाताओं के साथ समन्वय किया गया है।
  • इनुक्टिटुट अनुवाद परियोजना: अपेन ने नुनावुत सरकार के साथ सहयोग किया, जिससे माइक्रोसॉफ्ट ट्रांस्लेटर में इनुक्टिटुट जोड़ने में मदद मिली। यह स्वदेशी भाषा कनाडाई आर्कटिक में बोली जाती है।
  • अफ़्रीकी अमेरिकी वर्नाक्युलर इंग्लिश (एएवीई) ऑफ-द-शेल्फ डेटासेट: एएवीई वक्ताओं के साथ काम करके और विभिन्न विषयों पर बातचीत के लिए एक ओटीएस डेटासेट के लिए डेटा संग्रह करके, अपेन एएवीई का प्रतिनिधित्व करने वाले नए प्रशिक्षण डेटासेट बनाने का प्रयास करता है।

डॉ. जूडिथ बिशप अपेन में एआई विशेषज्ञों की वरिष्ठ निदेशक हैं।

“पूर्वाग्रहित एआई डेटा व्यावसायिक परिणामों को प्राप्त करने में विफल होने और उन व्यक्तियों को नुकसान पहुँचाने वाली परियोजनाओं का कारण बन सकता है जिन्हें वे लाभान्वित करने का इरादा रखते हैं,” डॉ. बिशप ने कहा। “एआई परियोजनाओं का दायरा और जटिलता इसे अधिकांश कंपनियों के लिए असंभव बना देती है कि वे बिना एआई डेटा विशेषज्ञ के साथ साझेदारी किए बिना पूर्वाग्रहित उच्च गुणवत्ता वाले डेटा प्राप्त करें। अपेन का विविध और विशेषज्ञ डेटा अन्नोटेटरों के समूह को विकसित करने का प्रयास एआई परियोजनाओं के निर्माण के लिए एक स्पष्ट रूप से अलग संसाधन प्रदान करता है।”

अपेन 170 से अधिक देशों से प्रशिक्षण डेटा अन्नोटेटरों द्वारा सहायता प्राप्त है, और भाषा प्रतिनिधित्व में 235 अद्वितीय भाषाएं और 395 बोलियाँ शामिल हैं। यह ऑफ-द-शेल्फ (ओटीएस) डेटासेट भी प्रदान करता है, जो व्यवसायों को अपनी एआई परियोजनाओं के लिए उच्च गुणवत्ता वाले प्रशिक्षण डेटा को तेजी से प्राप्त करने में सक्षम बनाता है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।