Anderson का एंगल

भाषण और इशारों का एकीकरण

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जब मैं दक्षिण इटली में कुछ वर्षों के बाद ब्रिटेन लौटा, तो यह बातचीत करते समय इशारों को रोकने में काफी समय लगा। यूके में, बोलते समय बोल्ड हाथ की गतिविधियों के साथ अपनी बात का समर्थन करना आपको अधिक कैफीनयुक्त बना देता है; इटली में, जैसा कि मैं भाषा सीख रहा था, यह वास्तव में मुझे समझने में मदद की। अब भी, जब मैं कम ही मौकों पर इतालवी बोलता हूं, तो ‘जंगली हाथ’ फिर से सेवा में आते हैं। यह लगभग असंभव है कि इतालवी बोलते समय हाथ न हिलाएं।

हाल के वर्षों में, इतालवी और यहूदी संस्कृति में इशारों के साथ संचार मार्टिन स्कोर्सेज़ और वुडी एलेन की फिल्मों के काम से अधिक के रूप में सार्वजनिक ध्यान में आया है। 2013 में, न्यूयॉर्क टाइम्स ने इतालवी हाथ की गतिविधियों का एक छोटा वीडियो इतिहास तैयार किया; अकादमिक जगत इस विषय का अध्ययन करना शुरू कर रहा है, नस्लीय प्रवृत्तियों के रूप में हाथ की गतिविधियों को खारिज करने के बजाय; और यूनिकोड कंसोर्टियम के नए इमोजी इशारों की कमी को पूरा कर रहे हैं जो कि शुद्ध डिजिटल, पाठ-आधारित संचार के साथ आती है।

भाषण और इशारों का एकीकृत दृष्टिकोण

अब, नई अनुसंधान स्वीडन के केथी रॉयल इंस्टीट्यूट ऑफ टेक्नोलॉजी के भाषण, संगीत और श्रवण विभाग से भाषण और इशारों की पहचान को एक एकीकृत, बहुस्तरीय प्रणाली में शामिल करने का प्रयास कर रहा है जो संभावित रूप से भाषण-आधारित संचार की हमारी समझ को बढ़ा सकता है शरीर की भाषा को भाषण के एक एकीकृत पूरक के रूप में उपयोग करके, एक समानांतर अध्ययन क्षेत्र के बजाय।

स्वीडिश भाषण/इशारा परियोजना के परीक्षण पृष्ठ से दृश्य। स्रोत: https://swatsw.github.io/isg_icmi21/

स्वीडिश भाषण/इशारा परियोजना के परीक्षण पृष्ठ से दृश्य。 स्रोत: https://swatsw.github.io/isg_icmi21/

अनुसंधान एक नए मॉडल का प्रस्ताव करता है जिसे एकीकृत भाषण और इशारा (आईएसजी) संश्लेषण कहा जाता है, और भाषण और इशारा अनुसंधान से कई राज्य-оф-द-आर्ट न्यूरल मॉडलों को एक साथ लाता है।

नई दृष्टि रेखीय पाइपलाइन मॉडल (जहां इशारा जानकारी भाषण से एक द्वितीयक प्रसंस्करण चरण के रूप में अनुक्रमिक रूप से प्राप्त की जाती है) को छोड़ देती है एक अधिक एकीकृत दृष्टिकोण के लिए, जो मौजूदा प्रणालियों के साथ समान रेटिंग करती है, और जो तेजी से संश्लेषण समय और कम पैरामीटर गणना प्राप्त करती है।

रेखीय बनाम एकीकृत दृष्टिकोण। स्रोत: https://arxiv.org/pdf/2108.11436.pdf

रेखीय बनाम एकीकृत दृष्टिकोण。 स्रोत: https://arxiv.org/pdf/2108.11436.pdf

नई बहुस्तरीय प्रणाली में एक स्वतःस्फूर्त पाठ-से-भाषण संश्लेषक और एक ऑडियो-भाषा-चालित इशारा जनरेटर शामिल है, दोनों को मौजूदा ट्रिनिटी भाषण इशारा डेटासेट पर प्रशिक्षित किया जाता है। डेटासेट में 244 मिनट का ऑडियो और शरीर कैप्चर होता है एक व्यक्ति की बातचीत और स्वतंत्र रूप से इशारा करता है।

कार्य ड्यूरियन परियोजना के लिए एक नई और टांगेंटियल समकक्ष है, जो चेहरे के भाव और भाषण का उत्पादन करता है, न कि इशारा और भाषण, और जो अभिव्यक्ति पहचान और संश्लेषण के क्षेत्र में अधिक आता है।

संरचनाएं

परियोजना के भाषण और दृश्य (इशारा) घटक डेटा के संदर्भ में असंतुलित हैं; पाठ दुर्लभ है और इशारा समृद्ध और डेटा-गहन है – एक चुनौती लक्ष्यों और मीट्रिक्स को परिभाषित करने के संदर्भ में। इसलिए शोधकर्ताओं ने प्रणाली का मूल्यांकन मुख्य रूप से मानव प्रतिक्रिया द्वारा किया, न कि अधिक स्पष्ट यांत्रिक दृष्टिकोण जैसे कि माध्य वर्ग त्रुटि (एमएसई) द्वारा।

दो मुख्य आईएसजी मॉडल गूगल के 2017 दूसरे संस्करण के आसपास विकसित किए गए थे टैकोट्रॉन एंड-टू-एंड भाषण संश्लेषण परियोजना, और दक्षिण कोरियाई ग्लो-टीटीएस पहल 2020 में प्रकाशित हुई थी। टैकोट्रॉन एक ऑटोरेग्रेसिव एलएसटीएम आर्किटेक्चर का उपयोग करता है, जबकि ग्लो-टीटीएस समानांतर रूप से संवोलक ऑपरेटरों के माध्यम से कार्य करता है, तेजी से जीपीयू प्रदर्शन के साथ और ऑटोरेग्रेसिव मॉडल के साथ जुड़ने वाली स्थिरता समस्याओं के बिना।

शोधकर्ताओं ने परियोजना के दौरान तीन प्रभावी भाषण/इशारा प्रणालियों का परीक्षण किया; 2021 में एक ही परियोजना के कुछ शोधकर्ताओं द्वारा प्रकाशित एक बहुस्तरीय भाषण-और-इशारा-जनरेशन प्रकाशन का एक संशोधित संस्करण; एक समर्पित और संशोधित आईएसजी संस्करण खुला स्रोत टैकोट्रॉन 2; और एक अत्यधिक परिवर्तित आईएसजी संस्करण ग्लो-टीटीएस।

प्रणालियों का मूल्यांकन करने के लिए, शोधकर्ताओं ने एक वेब-आधारित प्रतिक्रिया वातावरण बनाया जिसमें कल्पित 3डी लोग बोलते हुए और पूर्वनिर्धारित पाठ खंडों (सामान्य दिखने वाले वातावरण को सार्वजनिक परियोजना पृष्ठ पर देखा जा सकता है) के लिए चलते हैं।

परीक्षण वातावरण।

परीक्षण वातावरण。

परीक्षण विषयों से प्रणाली के प्रदर्शन का मूल्यांकन करने के लिए कहा गया था, भाषण और इशारे के आधार पर, केवल भाषण के आधार पर, और केवल इशारे के आधार पर। परिणामों से पता चला कि पुराने पाइपलाइन संस्करण की तुलना में नए आईएसजी संस्करण में एक छोटी सी सुधार है, हालांकि नई प्रणाली अधिक तेजी से और कम संसाधनों के साथ काम करती है।

पूछा गया, 'इशारा कितना मानवीय है?', पूरी तरह से एकीकृत आईएसजी मॉडल पाइपलाइन मॉडल से थोड़ा आगे निकलता है, टैकोट्रॉन और ग्लो-आधारित मॉडल पीछे रहते हैं।

पूछा गया, ‘इशारा कितना मानवीय है?’, पूरी तरह से एकीकृत आईएसजी मॉडल पाइपलाइन मॉडल से थोड़ा आगे निकलता है, टैकोट्रॉन और ग्लो-आधारित मॉडल पीछे रहते हैं।

निहित झुकाव

टैकोट्रॉन2-आईएसजी मॉडल, तीन दृष्टिकोणों में सबसे सफल, कुछ सबसे सामान्य वाक्यांशों के संबंध में ‘अवचेतन’ सीखने का एक स्तर प्रदर्शित करता है, जैसे कि ‘मुझे नहीं पता’ -尽管 इस वाक्यांश के साथ इशारा करने के लिए कोई स्पष्ट डेटा नहीं है, शोधकर्ताओं ने पाया कि जनरेटर वास्तव में झुकता है।

शोधकर्ताओं का उल्लेख है कि इस उपन्यास परियोजना की बहुत विशिष्ट प्रकृति का अर्थ है सामान्य संसाधनों की कमी, जैसे कि समर्पित डेटासेट जो भाषण और इशारा डेटा को एक ऐसे तरीके से शामिल करते हैं जो इस प्रणाली को प्रशिक्षित करने के लिए उपयुक्त हो। फिर भी, और अनुसंधान के अग्रिम प्रकृति के बावजूद, वे इसे भाषण, भाषाविज्ञान और इशारा पहचान में एक वादा और कम अन्वेषित मार्ग के रूप में मानते हैं।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai