एआई मॉडल और प्लेटफ़ॉर्म

स्पीचमैटिक्स ने स्वायत्त भाषण पहचान सॉफ्टवेयर लॉन्च किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

प्रमुख भाषण पहचान प्रौद्योगिकी स्टार्टअपस्पीचमैटिक्स ने अपने ‘स्वायत्त भाषण पहचान’ सॉफ्टवेयर को लॉन्च किया है, जो नवीनतम गहरे शिक्षण तकनीकों और आत्म-पर्यवेक्षित मॉडलों का उपयोग करता है। इस प्रणाली ने अमेज़ॅन, गूगल और माइक्रोसॉफ्ट को पीछे छोड़ने की क्षमता का प्रदर्शन किया है।

स्टैनफोर्ड के डेटासेट

स्पीचमैटिक्स स्टैनफोर्ड के ‘भाषण पहचान में नस्लीय असमानता‘ अध्ययन में पाए गए डेटासेट पर आधारित है, और इसने अफ्रीकी अमेरिकी आवाजों के लिए 82.8% की समग्र सटीकता हासिल की है। गूगल ने केवल 68.7% की सटीकता दर हासिल की, जबकि अमेज़ॅन ने 68.6% हासिल की। (AMZN ) (GOOGL )

सटीकता का स्तर भाषण पहचान में तीन शब्दों के बराबर 45% की कमी के बराबर है, जो एक औसत वाक्य में होता है। न केवल नया स्पीचमैटिक्स सिस्टम इस मामले में सटीक है, बल्कि यह लहजे, आयु, बोली, और विभिन्न अन्य सामाजिक-आर्थिक विशेषताओं में सटीकता में सुधार का प्रदर्शन करता है।

भाषण पहचान में अक्सर गलतफहमी होती है क्योंकि अल्गोरिदम को प्रशिक्षित करने के लिए उपयोग किए जाने वाले लेबल वाले डेटा की मात्रा सीमित होती है। लेबल वाले डेटा को मैन्युअल रूप से वर्गीकृत करने की आवश्यकता होती है, जिसके परिणामस्वरूप कम मात्रा में डेटा उपलब्ध होता है। यह सभी आवाजों के प्रतिनिधित्व को सीमित करता है, जो एक नई समस्या पैदा करता है।

अनलेबल्ड डेटा पर प्रशिक्षण

स्पीचमैटिक्स इस मामले में बड़ी प्रगति कर रहा है क्योंकि इसकी तकनीक इंटरनेट से सीधे सोर्स किए गए विशाल अनलेबल्ड डेटा पर प्रशिक्षित है। डेटा सोशल मीडिया सामग्री और पॉडकास्ट जैसी चीजों से आता है।

स्व-पर्यवेक्षित शिक्षण ने प्रणाली को 1.1 मिलियन घंटे की ऑडियो पर प्रशिक्षित करने में सक्षम बनाया है, जो पहले 30,000 घंटे से बढ़ा है। इससे आवाजों का व्यापक प्रतिनिधित्व होता है और यह भाषण पहचान में एआई पूर्वाग्रह और त्रुटियों को कम करने में मदद करता है।

बच्चों की आवाजों के मामले में, स्पीचमैटिक्स ने भी प्रतिस्पर्धियों को पीछे छोड़ने की क्षमता का प्रदर्शन किया है। बच्चों की आवाजें विरासत भाषण पहचान प्रौद्योगिकी के माध्यम से पहचानना चुनौतीपूर्ण है, लेकिन स्पीचमैटिक्स ने 91.8% की सटीकता दर हासिल की। गूगल ने केवल 83.4% और डीपग्राम 82.3% हासिल की।

केटी विगडाहल स्पीचमैटिक्स के सीईओ हैं।

“हम मशीन लर्निंग क्षमताओं की अगली पीढ़ी को वितरित करने के लिए एक मिशन पर हैं, और इसके माध्यम से अधिक समावेशी और सुलभ भाषण प्रौद्योगिकी प्रदान करने के लिए। यह घोषणा उस मिशन को प्राप्त करने के लिए एक बड़ा कदम है।”

“एआई पूर्वाग्रह से निपटने पर हमारा ध्यान इस भाषण पहचान उद्योग में एक बड़ा कदम आगे बढ़ाने की ओर ले जा रहा है और इसका प्रभाव विभिन्न परिदृश्यों में परिवर्तन ला रहा है। सोचें कि हम सोशल मीडिया पर गलत कैप्शन देखते हैं, अदालती सुनवाई में जहां शब्द गलत लिखे जाते हैं और ईलर्निंग प्लेटफ़ॉर्म जो महामारी के दौरान बच्चों की आवाजों से जूझते रहे हैं। लोगों को अब तक स्वीकार करने के लिए त्रुटियाँ हैं जो उनके दैनिक जीवन पर एक स्पष्ट प्रभाव डाल सकती हैं,” विगडाहल ने जारी रखा।

एलिसन ज़ू कोएनेक स्टैनफोर्ड के भाषण पहचान अध्ययन के प्रमुख लेखक हैं।

“भाषण-से-पाठ प्रणालियों में न्याय और सुधार का अध्ययन करना महत्वपूर्ण है, क्योंकि वे स्वास्थ्य सेवा से लेकर आपराधिक न्याय तक विभिन्न क्षेत्रों में व्यक्तियों को असमान नुकसान पहुँचा सकते हैं।”

एलेक्स Unite.AI की एआई‑संचालित समाचार संचालन का नेतृत्व करते हैं, जिसमें पत्रकारिता, अनुसंधान और स्वचालन को मिलाकर कृत्रिम बुद्धिमत्ता की समयोचित और स्केलेबल कवरेज को समर्थन मिलता है। उनका कार्य उभरती एआई विकासों को कुशलतापूर्वक उजागर करने में मदद करता है, साथ ही प्रकाशन के संपादकीय मानकों को बनाए रखता है।