एआई मॉडल और प्लेटफ़ॉर्म

सीएनटीएक्सटी एआई ने मुन्सित लॉन्च किया: अब तक बनाया गया सबसे सटीक अरबी भाषा पहचान प्रणाली

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अरबी भाषा की कृत्रिम बुद्धिमत्ता के लिए एक निर्णायक क्षण में, सीएनटीएक्सटी एआई ने मुन्सित का अनावरण किया, एक अगली पीढ़ी का अरबी भाषा पहचान मॉडल जो न केवल अरबी के लिए अब तक बनाया गया सबसे सटीक है, बल्कि यह ओपनएआई, मेटा, माइक्रोसॉफ्ट और इलेवनलैब्स जैसे वैश्विक दिग्गजों को मानक बेंचमार्क पर पीछे छोड़ देता है। संयुक्त अरब अमीरात में विकसित और अरबी के लिए जमीन से बनाया गया, मुन्सित सीएनटीएक्सटी द्वारा “संप्रभु एआई” के रूप में जाने जाने वाले तकनीक में एक शक्तिशाली कदम का प्रतिनिधित्व करता है – क्षेत्र में निर्मित प्रौद्योगिकी, क्षेत्र के लिए, लेकिन वैश्विक प्रतिस्पर्धा के साथ।

इस उपलब्धि के वैज्ञानिक आधार टीम के हाल ही में प्रकाशित शोध पत्र में दिए गए हैं, अरबी भाषा पहचान में बड़े पैमाने पर कमजोर पर्यवेक्षित शिक्षा के माध्यम से प्रगति, जो एक मापनीय, डेटा-कुशल प्रशिक्षण विधि की शुरुआत करता है जो अरबी भाषा पहचान के क्षेत्र में लंबे समय से चली आ रही लेबल वाले डेटा की कमी को संबोधित करता है। यह विधि – कमजोर पर्यवेक्षित शिक्षा – टीम को एक प्रणाली का निर्माण करने में सक्षम बनाती है जो आधुनिक मानक अरबी (एमएसए) और 25 से अधिक क्षेत्रीय बोलियों में प्रतिलेखन गुणवत्ता के लिए एक नया मानक निर्धारित करती है।

अरबी एएसआर में डेटा सूखे को पार करना

अरबी, वैश्विक स्तर पर सबसे व्यापक रूप से बोली जाने वाली भाषाओं में से एक और संयुक्त राष्ट्र की आधिकारिक भाषा होने के बावजूद, भाषा पहचान के क्षेत्र में एक कम संसाधन वाली भाषा मानी जाती रही है। इसका कारण इसकी रूपविज्ञान जटिलता और बड़े, विविध, लेबल वाले भाषण डेटासेट की कमी है। अंग्रेजी के विपरीत, जो मैन्युअल रूप से प्रतिलेखित ऑडियो डेटा के अनगिनत घंटों से लाभान्वित होता है, अरबी की बोली जटिलता और डिजिटल उपस्थिति के खंडित होने ने मजबूत स्वचालित भाषा पहचान (एएसआर) प्रणालियों के निर्माण के लिए महत्वपूर्ण चुनौतियां पेश की हैं।

मैन्युअल प्रतिलेखन की धीमी और महंगी प्रक्रिया की प्रतीक्षा करने के बजाय, सीएनटीएक्सटी एआई ने एक क्रांतिकारी रूप से अधिक मापनीय मार्ग का पीछा किया: कमजोर पर्यवेक्षण। उनका दृष्टिकोण एक विशाल निगम से शुरू हुआ। 30,000 घंटे से अधिक का अनलेबल्ड अरबी ऑडियो विभिन्न स्रोतों से एकत्र किया गया था। एक कस्टम-निर्मित डेटा प्रोसेसिंग पाइपलाइन के माध्यम से, इस कच्चे ऑडियो को साफ, खंडित और स्वचालित रूप से लेबल किया गया ताकि एक उच्च-गुणवत्ता वाला 15,000-घंटे का प्रशिक्षण डेटासेट तैयार किया जा सके – अरबी भाषण के लिए एक सबसे बड़ा और सबसे प्रतिनिधि निगम।

इस प्रक्रिया में मानव एनोटेशन पर भरोसा नहीं किया गया था। इसके बजाय, सीएनटीएक्सटी ने एक बहु-चरण प्रणाली विकसित की जो कई एएसआर मॉडल से परिकल्पनाओं को उत्पन्न, मूल्यांकन और फ़िल्टर करने के लिए। इन प्रतिलेखन की तुलना लेवेन्स्टीन दूरी का उपयोग करके की गई थी ताकि सबसे सुसंगत परिकल्पनाओं का चयन किया जा सके, फिर एक भाषा मॉडल के माध्यम से उनकी व्याकरणिक संभावना का मूल्यांकन किया गया। जो खंड गुणवत्ता के निर्धारित सीमा से कम थे, उन्हें त्याग दिया गया, यह सुनिश्चित करते हुए कि मानव सत्यापन के बिना भी, प्रशिक्षण डेटा विश्वसनीय रहा। टीम ने इस पाइपलाइन को कई पुनरावृत्तियों के माध्यम से परिष्कृत किया, प्रत्येक बार लेबल सटीकता में सुधार करते हुए एएसआर प्रणाली को फिर से प्रशिक्षित किया और इसे लेबलिंग प्रक्रिया में वापस खिलाया।

मुन्सित को शक्ति देना: कॉन्फॉर्मर आर्किटेक्चर

मुन्सित के दिल में कॉन्फॉर्मर मॉडल है, एक हाइब्रिड न्यूरल नेटवर्क आर्किटेक्चर जो स्थानीय संवेदनशीलता के लिए कन्वोल्यूशनल लेयर्स की क्षमता को वैश्विक क्रम मॉडलिंग के लिए ट्रांसफॉर्मर की क्षमता के साथ जोड़ती है। यह डिज़ाइन मुन्सित को बोली जाने वाली भाषा की बारीकियों को संभालने में विशेष रूप से कुशल बनाता है, जहां दोनों लंबी दूरी की निर्भरताएं (जैसे वाक्य संरचना) और सूक्ष्म फोनेटिक विवरण महत्वपूर्ण हैं।

सीएनटीएक्सटी एआई ने कॉन्फॉर्मर का एक बड़ा संस्करण लागू किया, जिसे 80-चैनल मेल-स्पेक्ट्रोग्राम का उपयोग करके स्क्रैच से प्रशिक्षित किया गया था। मॉडल में 18 लेयर हैं और इसमें लगभग 121 मिलियन पैरामीटर हैं। प्रशिक्षण एक उच्च-प्रदर्शन क्लस्टर पर आठ एनवीडिया ए100 जीपीयू का उपयोग करके किया गया था, जो बड़े बैच आकार और उच्च-आयामी विशेषता स्थान को कुशलतापूर्वक संभालने की अनुमति देता था। अरबी की रूपविज्ञान रूप से समृद्ध संरचना के टोकनकरण के लिए, टीम ने अपने कस्टम निगम पर विशेष रूप से प्रशिक्षित एक वाक्यांशपीस टोकनाइज़र का उपयोग किया, जिसके परिणामस्वरूप 1,024 उपशब्द इकाइयों का शब्दावली बना।

पारंपरिक पर्यवेक्षित एएसआर प्रशिक्षण के विपरीत, जिसमें आमतौर पर प्रत्येक ऑडियो क्लिप को एक सावधानी से प्रतिलेखित लेबल के साथ जोड़ा जाना चाहिए, सीएनटीएक्सटी की विधि पूरी तरह से कमजोर लेबल पर संचालित होती है। इन लेबल, हालांकि मानव-सत्यापित लोगों की तुलना में अधिक शोर वाले हैं, सहमति, व्याकरणिक संगति और शब्दार्थ संभावना को प्राथमिकता देने वाले एक प्रतिक्रिया लूप के माध्यम से अनुकूलित किए गए थे। मॉडल को कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (सीटीसी) हानि फ़ंक्शन का उपयोग करके प्रशिक्षित किया गया था, जो असंरेखित अनुक्रम मॉडलिंग – भाषण पहचान कार्यों के लिए महत्वपूर्ण है जहां बोले गए शब्दों का समय परिवर्तनशील और अप्रत्याशित होता है।

बेंचमार्क पर हावी होना

परिणाम खुद बोलते हैं। मुन्सित का परीक्षण छह बेंचमार्क अरबी डेटासेट पर किया गया था: सादा, कॉमन वॉइस 18.0, मास्क (साफ और शोर वाला), एमजीबी-2, और कासाब्लांका। ये डेटासेट सामूहिक रूप से सऊदी अरब से मोरक्को तक अरब दुनिया भर में दर्जनों बोलियों और उच्चारणों को कवर करते हैं।

सभी बेंचमार्क पर, मुन्सित-1 ने औसत शब्द त्रुटि दर (WER) 26.68 और औसत अक्षर त्रुटि दर (CER) 10.05 हासिल की। तुलना में, ओपनएआई के व्हिस्पर के सर्वश्रेष्ठ प्रदर्शन करने वाले संस्करण ने औसत WER 36.86 और CER 17.21 दर्ज किया। मेटा का सीमलेसएम4टी, एक और राज्य-оф-द-आर्ट बहुभाषी मॉडल, और भी अधिक था। मुन्सित ने स्वच्छ और शोर वाले दोनों डेटा पर हर अन्य प्रणाली को पीछे छोड़ दिया और शोर वाली स्थितियों में विशेष रूप से मजबूत लचीलापन प्रदर्शित किया, जो कॉल सेंटर और सार्वजनिक सेवाओं जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए एक महत्वपूर्ण कारक है।

प्रोप्राइटरी सिस्टम के खिलाफ अंतर उतना ही चौंकाने वाला था। मुन्सित ने माइक्रोसॉफ्ट एज्योर के अरबी एएसआर मॉडल, इलेवनलैब्स स्क्राइब, और यहां तक कि ओपनएआई की जीपीटी-4ओ ट्रांसक्राइब सुविधा को भी पीछे छोड़ दिया। ये परिणाम हाशिए की जीत नहीं हैं – वे खुले बेंचमार्क के सापेक्ष 23.19% की औसत सापेक्ष सुधार दर्शाते हैं और सीईआर में 24.78%, मुन्सित को अरबी भाषा पहचान में स्पष्ट नेता के रूप में स्थापित करते हैं।

अरबी वॉइस एआई के भविष्य के लिए एक मंच

जबकि मुन्सित-1 पहले से ही अरबी बोलने वाले बाजारों में प्रतिलेखन, उपशीर्षक और ग्राहक सहायता की संभावनाओं को बदल रहा है, सीएनटीएक्सटी एआई इस लॉन्च को केवल शुरुआत के रूप में देखता है। कंपनी अरबी भाषा की पूरी श्रृंखला की कल्पना करती है। वॉइस टेक्नोलॉजी में, जिसमें टेक्स्ट-टू-स्पीच, वॉइस असिस्टेंट और रियल-टाइम अनुवाद प्रणाली शामिल हैं – सभी संप्रभु बुनियादी ढांचे और क्षेत्रीय रूप से प्रासंगिक एआई में निहित हैं।

“मुन्सित केवल भाषा पहचान में एक सफलता से अधिक है,” सीएनटीएक्सटी एआई के सीईओ मोहम्मद अबू शेख ने कहा। “यह एक घोषणा है कि अरबी वैश्विक एआई के अग्रभाग में होना चाहिए। हमने साबित किया है कि विश्व-स्तरीय एआई को आयात करने की जरूरत नहीं है – यह अरबी में अरबी के लिए यहां बनाया जा सकता है।”

मुन्सित जैसे क्षेत्र-विशिष्ट मॉडल के उदय के साथ, एआई उद्योग एक नए युग में प्रवेश कर रहा है – जहां भाषाई और सांस्कृतिक प्रासंगिकता तकनीकी उत्कृष्टता के पीछे नहीं छोड़ी जाती है। वास्तव में, मुन्सित के साथ, सीएनटीएक्सटी एआई ने दिखाया है कि वे एक ही हैं।

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।