एआई मॉडल और प्लेटफ़ॉर्म

शोधकर्ता गहरे तंत्रिका नेटवर्क के साथ मानव भाषण पहचान मॉडल विकसित करते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जर्मनी के एक शोधकर्ता समूह एक नए मानव भाषण पहचान मॉडल की खोज कर रहा है जो मशीन लर्निंग और गहरे तंत्रिका नेटवर्क पर आधारित है। यह नया मॉडल मानव भाषण पहचान में बहुत सुधार कर सकता है।

सुनने में मदद करने वाले अल्गोरिदम आमतौर पर मानव भाषण पहचान में सुधार के लिए उपयोग किए जाते हैं, और वे विभिन्न प्रयोगों के माध्यम से मूल्यांकित किए जाते हैं जो यह निर्धारित करते हैं कि किस स्तर के शोर में कितने शब्द पहचाने जा सकते हैं। हालांकि, ये प्रयोग अक्सर समय लेने वाले और महंगे होते हैं।

नया मॉडल द जर्नल ऑफ द अकाउस्टिकल सोसाइटी ऑफ अमेरिका में प्रकाशित शोध में विस्तार से बताया गया है।

श्रवण बाधित श्रोताओं के लिए भविष्यवाणियां

जाना रॉसबाच कार्ल वॉन ओसिएट्ज़की यूनिवर्सिटी से एक लेखक हैं।

“हमारे मॉडल की नई बात यह है कि यह श्रवण बाधित श्रोताओं के लिए अच्छी भविष्यवाणियां प्रदान करता है, जो विभिन्न जटिलता वाले शोर प्रकारों के लिए कम त्रुटियों और मापदंडों के साथ उच्च संबंध दिखाता है,” रॉसबाच ने कहा।

शोधकर्ता टीम ने यह गणना की कि स्वचालित भाषण पहचान (एएसआर) के माध्यम से एक श्रोता प्रति वाक्य कितने शब्द समझ सकता है। एलेक्सा और सिरी जैसे भाषण पहचान उपकरण इस एएसआर पर निर्भर करते हैं, जो व्यापक रूप से उपलब्ध है।

अध्ययन और परिणाम

टीम द्वारा किए गए अध्ययन में आठ सामान्य सुनने वाले और 20 श्रवण बाधित व्यक्तियों को शामिल किया गया था। श्रोताओं को कई जटिल शोर के संपर्क में लाया गया, जो भाषण को छुपाते थे, और श्रवण बाधित श्रोताओं को उनकी आयु संबंधी श्रवण हानि के स्तर के आधार पर तीन समूहों में वर्गीकृत किया गया था।

नये मॉडल के माध्यम से, शोधकर्ता विभिन्न श्रवण हानि के स्तर वाले श्रवण बाधित श्रोताओं के मानव भाषण पहचान प्रदर्शन की भविष्यवाणी कर सके। वे विभिन्न शोर मास्करों के लिए भविष्यवाणियां करने में सक्षम थे, जिनमें समयिक मॉड्यूलेशन और वास्तविक भाषण के समान होने की जटिलता में भिन्नता थी। इससे प्रत्येक व्यक्ति को संभावित श्रवण हानि के संबंध में व्यक्तिगत रूप से देखा और विश्लेषण किया जा सका।

“हम सबसे ज्यादा आश्चर्यचकित थे कि भविष्यवाणियां सभी शोर प्रकारों के लिए अच्छी तरह से काम करती हैं। हमें उम्मीद थी कि मॉडल एक प्रतिस्पर्धी बातचीत का उपयोग करते समय समस्याओं का सामना करेगा। लेकिन ऐसा नहीं था,” रॉसबाच ने कहा।

चूंकि मॉडल एकल कान सुनने पर केंद्रित था, टीम अब दो कानों के सुनने के लिए एक द्वि-कान मॉडल बनाने की ओर देख रही है। वे यह भी कहते हैं कि नया मॉडल सुनने के प्रयास या भाषण गुणवत्ता की भविष्यवाणी करने के लिए भी उपयोग किया जा सकता है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।