Anderson का एंगल
भाषण और इशारों का एकीकरण

जब मैं दक्षिण इटली में कुछ वर्षों के बाद ब्रिटेन लौटा, तो यह बातचीत करते समय इशारों को रोकने में काफी समय लगा। यूके में, बोलते समय बोल्ड हाथ की गतिविधियों के साथ अपनी बात का समर्थन करना आपको अधिक कैफीनयुक्त बना देता है; इटली में, जैसा कि मैं भाषा सीख रहा था, यह वास्तव में मुझे समझने में मदद की। अब भी, जब मैं कम ही मौकों पर इतालवी बोलता हूं, तो ‘जंगली हाथ’ फिर से सेवा में आते हैं। यह लगभग असंभव है कि इतालवी बोलते समय हाथ न हिलाएं।
हाल के वर्षों में, इतालवी और यहूदी संस्कृति में इशारों के साथ संचार मार्टिन स्कोर्सेज़ और वुडी एलेन की फिल्मों के काम से अधिक के रूप में सार्वजनिक ध्यान में आया है। 2013 में, न्यूयॉर्क टाइम्स ने इतालवी हाथ की गतिविधियों का एक छोटा वीडियो इतिहास तैयार किया; अकादमिक जगत इस विषय का अध्ययन करना शुरू कर रहा है, नस्लीय प्रवृत्तियों के रूप में हाथ की गतिविधियों को खारिज करने के बजाय; और यूनिकोड कंसोर्टियम के नए इमोजी इशारों की कमी को पूरा कर रहे हैं जो कि शुद्ध डिजिटल, पाठ-आधारित संचार के साथ आती है।
भाषण और इशारों का एकीकृत दृष्टिकोण
अब, नई अनुसंधान स्वीडन के केथी रॉयल इंस्टीट्यूट ऑफ टेक्नोलॉजी के भाषण, संगीत और श्रवण विभाग से भाषण और इशारों की पहचान को एक एकीकृत, बहुस्तरीय प्रणाली में शामिल करने का प्रयास कर रहा है जो संभावित रूप से भाषण-आधारित संचार की हमारी समझ को बढ़ा सकता है शरीर की भाषा को भाषण के एक एकीकृत पूरक के रूप में उपयोग करके, एक समानांतर अध्ययन क्षेत्र के बजाय।

स्वीडिश भाषण/इशारा परियोजना के परीक्षण पृष्ठ से दृश्य。 स्रोत: https://swatsw.github.io/isg_icmi21/
अनुसंधान एक नए मॉडल का प्रस्ताव करता है जिसे एकीकृत भाषण और इशारा (आईएसजी) संश्लेषण कहा जाता है, और भाषण और इशारा अनुसंधान से कई राज्य-оф-द-आर्ट न्यूरल मॉडलों को एक साथ लाता है।
नई दृष्टि रेखीय पाइपलाइन मॉडल (जहां इशारा जानकारी भाषण से एक द्वितीयक प्रसंस्करण चरण के रूप में अनुक्रमिक रूप से प्राप्त की जाती है) को छोड़ देती है एक अधिक एकीकृत दृष्टिकोण के लिए, जो मौजूदा प्रणालियों के साथ समान रेटिंग करती है, और जो तेजी से संश्लेषण समय और कम पैरामीटर गणना प्राप्त करती है।

रेखीय बनाम एकीकृत दृष्टिकोण。 स्रोत: https://arxiv.org/pdf/2108.11436.pdf
नई बहुस्तरीय प्रणाली में एक स्वतःस्फूर्त पाठ-से-भाषण संश्लेषक और एक ऑडियो-भाषा-चालित इशारा जनरेटर शामिल है, दोनों को मौजूदा ट्रिनिटी भाषण इशारा डेटासेट पर प्रशिक्षित किया जाता है। डेटासेट में 244 मिनट का ऑडियो और शरीर कैप्चर होता है एक व्यक्ति की बातचीत और स्वतंत्र रूप से इशारा करता है।
कार्य ड्यूरियन परियोजना के लिए एक नई और टांगेंटियल समकक्ष है, जो चेहरे के भाव और भाषण का उत्पादन करता है, न कि इशारा और भाषण, और जो अभिव्यक्ति पहचान और संश्लेषण के क्षेत्र में अधिक आता है।
संरचनाएं
परियोजना के भाषण और दृश्य (इशारा) घटक डेटा के संदर्भ में असंतुलित हैं; पाठ दुर्लभ है और इशारा समृद्ध और डेटा-गहन है – एक चुनौती लक्ष्यों और मीट्रिक्स को परिभाषित करने के संदर्भ में। इसलिए शोधकर्ताओं ने प्रणाली का मूल्यांकन मुख्य रूप से मानव प्रतिक्रिया द्वारा किया, न कि अधिक स्पष्ट यांत्रिक दृष्टिकोण जैसे कि माध्य वर्ग त्रुटि (एमएसई) द्वारा।
दो मुख्य आईएसजी मॉडल गूगल के 2017 दूसरे संस्करण के आसपास विकसित किए गए थे टैकोट्रॉन एंड-टू-एंड भाषण संश्लेषण परियोजना, और दक्षिण कोरियाई ग्लो-टीटीएस पहल 2020 में प्रकाशित हुई थी। टैकोट्रॉन एक ऑटोरेग्रेसिव एलएसटीएम आर्किटेक्चर का उपयोग करता है, जबकि ग्लो-टीटीएस समानांतर रूप से संवोलक ऑपरेटरों के माध्यम से कार्य करता है, तेजी से जीपीयू प्रदर्शन के साथ और ऑटोरेग्रेसिव मॉडल के साथ जुड़ने वाली स्थिरता समस्याओं के बिना।
शोधकर्ताओं ने परियोजना के दौरान तीन प्रभावी भाषण/इशारा प्रणालियों का परीक्षण किया; 2021 में एक ही परियोजना के कुछ शोधकर्ताओं द्वारा प्रकाशित एक बहुस्तरीय भाषण-और-इशारा-जनरेशन प्रकाशन का एक संशोधित संस्करण; एक समर्पित और संशोधित आईएसजी संस्करण खुला स्रोत टैकोट्रॉन 2; और एक अत्यधिक परिवर्तित आईएसजी संस्करण ग्लो-टीटीएस।
प्रणालियों का मूल्यांकन करने के लिए, शोधकर्ताओं ने एक वेब-आधारित प्रतिक्रिया वातावरण बनाया जिसमें कल्पित 3डी लोग बोलते हुए और पूर्वनिर्धारित पाठ खंडों (सामान्य दिखने वाले वातावरण को सार्वजनिक परियोजना पृष्ठ पर देखा जा सकता है) के लिए चलते हैं।

परीक्षण वातावरण。
परीक्षण विषयों से प्रणाली के प्रदर्शन का मूल्यांकन करने के लिए कहा गया था, भाषण और इशारे के आधार पर, केवल भाषण के आधार पर, और केवल इशारे के आधार पर। परिणामों से पता चला कि पुराने पाइपलाइन संस्करण की तुलना में नए आईएसजी संस्करण में एक छोटी सी सुधार है, हालांकि नई प्रणाली अधिक तेजी से और कम संसाधनों के साथ काम करती है।

पूछा गया, ‘इशारा कितना मानवीय है?’, पूरी तरह से एकीकृत आईएसजी मॉडल पाइपलाइन मॉडल से थोड़ा आगे निकलता है, टैकोट्रॉन और ग्लो-आधारित मॉडल पीछे रहते हैं।
निहित झुकाव
टैकोट्रॉन2-आईएसजी मॉडल, तीन दृष्टिकोणों में सबसे सफल, कुछ सबसे सामान्य वाक्यांशों के संबंध में ‘अवचेतन’ सीखने का एक स्तर प्रदर्शित करता है, जैसे कि ‘मुझे नहीं पता’ -尽管 इस वाक्यांश के साथ इशारा करने के लिए कोई स्पष्ट डेटा नहीं है, शोधकर्ताओं ने पाया कि जनरेटर वास्तव में झुकता है।
शोधकर्ताओं का उल्लेख है कि इस उपन्यास परियोजना की बहुत विशिष्ट प्रकृति का अर्थ है सामान्य संसाधनों की कमी, जैसे कि समर्पित डेटासेट जो भाषण और इशारा डेटा को एक ऐसे तरीके से शामिल करते हैं जो इस प्रणाली को प्रशिक्षित करने के लिए उपयुक्त हो। फिर भी, और अनुसंधान के अग्रिम प्रकृति के बावजूद, वे इसे भाषण, भाषाविज्ञान और इशारा पहचान में एक वादा और कम अन्वेषित मार्ग के रूप में मानते हैं।












