एआई मॉडल और प्लेटफ़ॉर्म
भाषण मूल्यांकन का भविष्य – विचार नेताओं के साथ
दुनिया भर में, अंग्रेजी भाषा सीखने वालों की संख्या बढ़ रही है। शैक्षिक संस्थानों और नियोक्ताओं को अंग्रेजी भाषा कौशल का मूल्यांकन करने में सक्षम होने की आवश्यकता है – विशेष रूप से, उनकी बोली क्षमता, क्योंकि बोली जाने वाली भाषा सबसे महत्वपूर्ण भाषा कौशल में से एक है। चुनौती, दोनों मूल्यांकन विकासकर्ताओं और अंतिम उपयोगकर्ताओं के लिए, यह करने का एक तरीका खोजना है जो सटीक, तेज़ और वित्तीय रूप से व्यावहारिक हो। इस चुनौती के हिस्से के रूप में, इन मूल्यांकनों को स्कोर करना अपने साथ कई कारकों के साथ आता है, विशेष रूप से जब हम उन विभिन्न क्षेत्रों (भाषण, लेखन, आदि) पर विचार करते हैं जिन पर कोई परीक्षण किया जा रहा है। अंग्रेजी भाषा कौशल की मांग दुनिया भर में केवल बढ़ने की उम्मीद है, तो भाषण स्कोरिंग का भविष्य इन आवश्यकताओं को पूरा करने के लिए कैसा दिखना चाहिए?
इस प्रश्न का उत्तर, अंश में, भाषण स्कोरिंग के विकास में पाया जा सकता है। निर्मित बोले गए प्रतिक्रियाओं को ऐतिहासिक रूप से मानव रेटर्स का उपयोग करके रेट किया गया है। यह प्रक्रिया, हालांकि, अक्सर महंगी और धीमी होती है, और इसमें स्केलेबिलिटी और मानव रेटर्स की विभिन्न कमियों सहित कई चुनौतियाँ शामिल हैं (जैसे कि रेटर विषयवाद या पूर्वाग्रह)। जैसा कि हमारी पुस्तक ऑटोमेटेड स्पीकिंग असेसमेंट: लैंग्वेज टेक्नोलॉजीज का उपयोग करके स्पॉन्टेनियस स्पीच को स्कोर करना में चर्चा की गई है, इन चुनौतियों का समाधान करने के लिए, एक बढ़ती संख्या में मूल्यांकन अब स्कोरिंग के एकमात्र स्रोत के रूप में या मानव रेटर्स के साथ संयोजन में ऑटोमेटेड स्पीच स्कोरिंग प्रौद्योगिकी का उपयोग करते हैं। हालांकि, स्वचालित स्कोरिंग इंजनों को तैनात करने से पहले, उनके प्रदर्शन का सावधानीपूर्वक मूल्यांकन किया जाना चाहिए, विशेष रूप से स्कोर विश्वसनीयता, वैधता (क्या प्रणाली वह मापती है जो यह मापने वाली है?) और न्यायसंगतता (अर्थात, प्रणाली को जनसंख्या उपसमूहों जैसे लिंग या मूल भाषा से संबंधित पूर्वाग्रह को पेश नहीं करना चाहिए) के संबंध में।
2006 से، ईटीएस का अपना भाषण स्कोरिंग इंजन, स्पीचरेटर®, टीओईएफएल® प्रैक्टिस ऑनलाइन (टीपीओ) मूल्यांकन में संचालित किया गया है (जिसका उपयोग संभावित परीक्षार्थी टीओईएफएल आईबीटी® मूल्यांकन के लिए तैयारी करने के लिए करते हैं), और 2019 से, स्पीचरेटर का उपयोग मानव रेटर्स के साथ भी टीओईएफएल आईबीटी® मूल्यांकन के बोले गए खंड के लिए किया जाता है। इंजन एक विस्तृत श्रृंखला का मूल्यांकन करता है बोली की क्षमता के लिए स्वतःस्फूर्त गैर-मूल भाषा, जिसमें उच्चारण और प्रवाह, शब्दावली सीमा और व्याकरण, और उच्च स्तरीय बोली की क्षमता शामिल हैं जो विचारों की संगति और प्रगति से संबंधित हैं। इन विशेषताओं की गणना प्राकृतिक भाषा प्रसंस्करण (एनएलपी) और भाषण प्रसंस्करण एल्गोरिदम का उपयोग करके की जाती है। एक सांख्यिकीय मॉडल को फिर इन विशेषताओं पर लागू किया जाता है ताकि एक परीक्षार्थी की प्रतिक्रिया को एक अंतिम स्कोर दिया जा सके।
जबकि यह मॉडल मानव रेटर्स द्वारा पहले देखे गए डेटा पर प्रशिक्षित होता है, इसे सामग्री विशेषज्ञों द्वारा इसकी वैधता को अधिकतम करने के लिए भी समीक्षा की जाती है। यदि एक प्रतिक्रिया ऑडियो गुणवत्ता या अन्य मुद्दों के कारण अस्कोरेबल पाई जाती है, तो इंजन इसे आगे की समीक्षा के लिए झंडा दिखा सकता है ताकि संभावित रूप से अविश्वसनीय या अमान्य स्कोर को जन्म देने से बचा जा सके। मानव रेटर्स हमेशा उच्च-जोखिम वाले टीओईएफएल आईबीटी बोली मूल्यांकन में बोले गए प्रतिक्रियाओं के मूल्यांकन में शामिल होते हैं।
चूंकि मानव रेटर्स और स्पीचरेटर वर्तमान में उच्च-जोखिम वाले बोली मूल्यांकन में परीक्षार्थियों की प्रतिक्रियाओं को स्कोर करने के लिए एक साथ उपयोग किए जाते हैं, दोनों भाषण स्कोरिंग के भविष्य में एक भूमिका निभाते हैं। मानव रेटर्स एक बोली प्रतिक्रिया की सामग्री और वार्ता संगठन को गहराई से समझने में सक्षम होते हैं। इसके विपरीत, स्वचालित भाषण स्कोरिंग इंजन विशिष्ट विवरणों को अधिक सटीक रूप से माप सकते हैं भाषण, जैसे कि प्रवाह या उच्चारण, समय के साथ पूर्ण स्थिरता प्रदर्शित करें, स्कोरिंग समय और लागत को कम कर सकते हैं, और बड़े परीक्षण आयोजनों का समर्थन करने के लिए अधिक आसानी से स्केल किया जा सकता है। जब मानव रेटर्स और स्वचालित भाषण स्कोरिंग प्रणाली को मिलाया जाता है, तो परिणामी प्रणाली प्रत्येक स्कोरिंग दृष्टिकोण की ताकत से लाभान्वित हो सकती है।
स्वचालित भाषण स्कोरिंग इंजनों को निरंतर विकसित करने के लिए, अनुसंधान और विकास को निम्नलिखित पहलुओं पर ध्यान केंद्रित करने की आवश्यकता है, अन्य बातों के अलावा:
- उच्च सटीकता वाले स्वचालित भाषण मान्यता प्रणाली का निर्माण: चूंकि भाषण स्कोरिंग प्रणाली की अधिकांश विशेषताएं सीधे या परोक्ष रूप से इस प्रणाली के घटक पर निर्भर करती हैं जो परीक्षार्थी की बोली को पाठ प्रतिलिपि में परिवर्तित करती है, इसलिए वैध विशेषताओं को प्राप्त करने के लिए उच्च सटीकता वाली स्वचालित भाषण मान्यता आवश्यक है;
- मानव और स्वचालित स्कोर को जोड़ने के नए तरीकों की खोज: मानव रेटर स्कोर और स्वचालित इंजन स्कोर की संबंधित ताकत का पूरा फायदा उठाने के लिए, इस साक्ष्य को जोड़ने के अधिक तरीकों की खोज की जानी चाहिए;
- प्रतिक्रियाओं में असामान्यताओं के लिए खाता, दोनों तकनीकी और व्यवहार संबंधी: स्वचालित स्कोरिंग से बाहर निकालने के लिए ऐसी प्रतिक्रियाओं को झंडा दिखाने में सक्षम उच्च प्रदर्शन वाले फिल्टर आवश्यक हैं ताकि मूल्यांकन स्कोर की वैधता और विश्वसनीयता सुनिश्चित की जा सके;
- दैनिक जीवन में होने वाली स्वतःस्फूर्त या संवादात्मक भाषण का मूल्यांकन: जबकि इस तरह की इंटरैक्टिव भाषण का स्वचालित स्कोरिंग एक महत्वपूर्ण लक्ष्य है, ये आइटम मूल्यांकन और स्कोरिंग सहित कई स्कोरिंग चुनौतियाँ पेश करते हैं;
- स्वचालित भाषण स्कोरिंग के लिए गहरे शिक्षण प्रौद्योगिकियों का अन्वेषण: यह मशीन लर्निंग के भीतर एक अपेक्षाकृत हालिया परिदृश्य है जिसने हाल के वर्षों में कई कृत्रिम बुद्धिमत्ता (एआई) कार्यों पर महत्वपूर्ण प्रदर्शन वृद्धि उत्पन्न की है (जैसे स्वचालित भाषण मान्यता, छवि मान्यता), और इसलिए यह संभव है कि स्वचालित स्कोरिंग भी इस प्रौद्योगिकी का उपयोग करने से लाभान्वित हो सकता है। हालांकि, चूंकि अधिकांश ऐसी प्रणालियों को “ब्लैक-बॉक्स” दृष्टिकोण माना जा सकता है, परिणामी स्कोर की व्याख्या करने योग्यता को बनाए रखने के लिए ध्यान देना महत्वपूर्ण होगा।
एक बढ़ती और बदलती अंग्रेजी भाषा सीखने वाले आबादी को समायोजित करने के लिए, अगली पीढ़ी के भाषण स्कोरिंग प्रणाली को स्वचालन और उनके द्वारा मापी जाने वाली श्रृंखला का विस्तार करने की आवश्यकता है, स्थिरता और स्केलेबिलिटी को सक्षम करना। इसका मतलब यह नहीं है कि मानव तत्व को हटा दिया जाएगा, विशेष रूप से उच्च-जोखिम वाले मूल्यांकन के लिए। मानव रेटर्स उन बोली की कुछ पहलुओं को पकड़ने के लिए आवश्यक रहेंगे जो स्वचालित स्कोरिंग प्रणालियों द्वारा सटीक रूप से मूल्यांकन करने में कठिन रहेंगे, जिनमें बोले गए सामग्री और वार्ता संगठन के विस्तृत पहलू शामिल हैं। परिणामस्वरूप, उच्च-जोखिम वाले मूल्यांकन के लिए स्वचालित भाषण स्कोरिंग प्रणाली का उपयोग करने से समस्याग्रस्त प्रतिक्रियाओं की पहचान नहीं हो पाने का जोखिम हो सकता है – उदाहरण के लिए, विषय से भटकी हुई प्रतिक्रियाएं या चोरी की गई प्रतिक्रियाएं, और परिणामस्वरूप, वैधता और विश्वसनीयता में कमी आ सकती है। मानव रेटर्स और स्वचालित स्कोरिंग प्रणाली का संयोजन उच्च-जोखिम वाले मूल्यांकन में भाषण को स्कोर करने का सबसे अच्छा तरीका हो सकता है, विशेष रूप से यदि स्वतःस्फूर्त या संवादात्मक भाषण का मूल्यांकन किया जाता है।
लिखा है: कीलन इवानिनी, निदेशक, भाषण अनुसंधान, ईटीएस और क्लाउस ज़ेचनर, वरिष्ठ अनुसंधान वैज्ञानिक, भाषण, ईटीएस
ईटीएस शैक्षिक संस्थानों, व्यवसायों और सरकारों के साथ काम करता है ताकि लोगों और कार्यक्रमों का मूल्यांकन करने के लिए अर्थपूर्ण जानकारी प्रदान करने वाले शोध और मूल्यांकन कार्यक्रमों को विकसित किया जा सके। ईटीएस 50 मिलियन से अधिक परीक्षणों को विकसित, प्रशासित और स्कोर करता है और दुनिया भर में 180 से अधिक देशों में 9,000 से अधिक स्थानों पर प्रति वर्ष। हम अपने मूल्यांकनों को उद्योग के अग्रणी अंतर्दृष्टि, कठोर अनुसंधान और गुणवत्ता के प्रति एक अटूट प्रतिबद्धता के साथ डिज़ाइन करते हैं ताकि हम शैक्षिक और कार्यस्थल समुदायों को सूचित निर्णय लेने में मदद कर सकें। अधिक जानने के लिए ईटीएस पर जाएं।













