एआई मॉडल और प्लेटफ़ॉर्म

शोधकर्ता 2,000 भाषाओं में स्वचालित भाषण मान्यता का विस्तार करने की कोशिश कर रहे हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कार्नेगी मेलन विश्वविद्यालय में शोधकर्ताओं की एक टीम 2,000 भाषाओं में स्वचालित भाषण मान्यता का विस्तार करने की कोशिश कर रही है। वर्तमान में, दुनिया भर में बोली जाने वाली 7,000 से 8,000 भाषाओं में से केवल एक हिस्सा ही आधुनिक भाषा प्रौद्योगिकियों जैसे वॉयस-टू-टेक्स्ट ट्रांसक्रिप्शन या स्वचालित कैप्शनिंग से लाभान्वित हो सकता है।

शिनजियन ली स्कूल ऑफ कंप्यूटर साइंस के लैंग्वेज टेक्नोलॉजीज इंस्टीट्यूट (एलटीआई) में पीएचडी छात्र हैं।

“इस दुनिया में बहुत से लोग विविध भाषाओं में बोलते हैं, लेकिन भाषा प्रौद्योगिकी उपकरण उन सभी के लिए विकसित नहीं किए जा रहे हैं,” उन्होंने कहा। “सभी लोगों के लिए प्रौद्योगिकी और एक अच्छा भाषा मॉडल विकसित करना इस शोध का एक लक्ष्य है।”

ली एक विशेषज्ञों की टीम का हिस्सा हैं जो भाषाओं को एक भाषण मान्यता मॉडल विकसित करने के लिए आवश्यक डेटा आवश्यकताओं को सरल बनाने की कोशिश कर रहे हैं।

टीम में एलटीआई के संकाय सदस्य शिंजी वाटानाबे, फ्लोरियन मेट्ज़े, डेविड मॉर्टेंसेन और एलन ब्लैक भी शामिल हैं।

शोध का शीर्षक “एएसआर2के: 2,000 भाषाओं के लिए ऑडियो के बिना भाषण मान्यता” था और इसे इंटरस्पीच 2022 में दक्षिण कोरिया में प्रस्तुत किया गया था।

मौजूदा अधिकांश भाषण मान्यता मॉडल पाठ और ऑडियो डेटा सेट की आवश्यकता होती है। जबकि हजारों भाषाओं के लिए पाठ डेटा मौजूद है, ऑडियो के लिए यही बात नहीं है। टीम ऑडियो डेटा की आवश्यकता को समाप्त करने के लिए कई भाषाओं में सामान्य भाषाई तत्वों पर ध्यान केंद्रित करके इसे समाप्त करना चाहती है।

भाषण मान्यता प्रौद्योगिकियां आमतौर पर एक भाषा के फोनीम पर ध्यान केंद्रित करती हैं, जो विशिष्ट ध्वनियां हैं जो इसे अन्य भाषाओं से अलग करती हैं। ये प्रत्येक भाषा के लिए अद्वितीय हैं। 同 समय, भाषाओं में फोन होते हैं जो वर्णन करते हैं कि एक शब्द शारीरिक रूप से कैसे लगता है, और एक फोनीम के लिए कई फोन हो सकते हैं। जबकि अलग-अलग भाषाओं में अलग-अलग फोनीम हो सकते हैं, अंतर्निहित फोन समान हो सकते हैं।

टीम एक भाषण मान्यता मॉडल पर काम कर रही है जो फोनीम पर कम और भाषाओं के बीच साझा किए गए फोन के बारे में जानकारी पर अधिक निर्भर करती है। यह प्रत्येक व्यक्तिगत भाषा के लिए अलग-अलग मॉडल बनाने के लिए आवश्यक प्रयास को कम करने में मदद करता है। मॉडल को एक वंशावली पेड़ के साथ जोड़कर, जो भाषाओं के बीच संबंधों का एक आरेख है, यह उच्चारण नियमों में मदद करता है। टीम के मॉडल और पेड़ संरचना ने उन्हें ऑडियो डेटा के बिना हजारों भाषाओं के लिए भाषण मॉडल को अनुमानित करने में सक्षम बनाया है।

“हम इस ऑडियो डेटा आवश्यकता को हटाने की कोशिश कर रहे हैं, जो हमें 100 से 200 भाषाओं से 2,000 तक ले जाने में मदद करता है,” ली ने कहा। “यह इतनी बड़ी संख्या में भाषाओं को लक्षित करने वाला पहला शोध है, और हम इस दायरे में भाषा उपकरणों का विस्तार करने का लक्ष्य रखने वाली पहली टीम हैं।”

शोध, जो अभी भी प्रारंभिक चरण में, मौजूदा भाषा अनुमान उपकरणों में 5% की वृद्धि हुई है।

“प्रत्येक भाषा अपनी संस्कृति में एक बहुत ही महत्वपूर्ण कारक है। प्रत्येक भाषा की अपनी कहानी है, और यदि आप भाषाओं को संरक्षित करने का प्रयास नहीं करते हैं, तो वे कहानियां खो सकती हैं,” ली ने कहा। “इस प्रकार की भाषण मान्यता प्रणाली और इस उपकरण को विकसित करना उन भाषाओं को संरक्षित करने का एक कदम है।”

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।