Anderson का एंगल

एआई नERवस स्पीकर्स को वीडियोकांफ्रेंस के दौरान ‘रूम पढ़ने’ में मदद करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

2013 में, एक पोल ने सार्वजनिक बोलने के डर को सबसे आम फोबिया के रूप में निर्धारित किया, जो अधिकांश उत्तरदाताओं के लिए मृत्यु के डर से भी बदतर था। इस सिंड्रोम को ग्लोसोफोबिया के नाम से जाना जाता है।

कोविड-19 महामारी के कारण ‘व्यक्तिगत’ बैठकों से ऑनलाइन ज़ूम कॉन्फ़्रेंस में स्थानांतरण, जैसे ज़ूम और गूगल स्पेसेस जैसे प्लेटफ़ॉर्म पर, आश्चर्यजनक रूप से स्थिति में सुधार नहीं हुआ है। जब बैठक में कई प्रतिभागी होते हैं, तो हमारी प्राकृतिक खतरे का आकलन करने की क्षमता कम-रिज़ॉल्यूशन प्रतिभागियों की पंक्तियों और आइकनों और सूक्ष्म दृश्य संकेतों को पढ़ने में कठिनाई के कारण बाधित होती है। स्काइप, उदाहरण के लिए, गैर-मौखिक संकेतों को प्रसारित करने के लिए एक खराब प्लेटफ़ॉर्म पाया गया है।

सार्वजनिक बोलने के प्रदर्शन पर धारण की गई रुचि और प्रतिक्रिया के प्रभाव अच्छी तरह से प्रलेखित हैं और अधिकांश लोगों के लिए स्पष्ट रूप से स्पष्ट हैं। अस्पष्ट दर्शक प्रतिक्रिया वक्ता को हिचकिचाहट और फ़िलर भाषण में वापस लौटने का कारण बन सकती है, अनजान है कि उनके तर्क किसी भी तरह से मिल रहे हैं या नहीं, अक्सर वक्ता और उनके श्रोताओं दोनों के लिए एक असहज अनुभव पैदा कर रहे हैं।

कोविड-19 प्रतिबंधों और सावधानियों से प्रेरित ऑनलाइन वीडियोकांफ्रेंस की अप्रत्याशित ओर बढ़ने के दबाव में, समस्या तर्कसंगत रूप से और भी खराब हो रही है, और पिछले दो वर्षों में कंप्यूटर विजन और प्रभाव अनुसंधान समुदायों में कई सुधारात्मक दर्शक प्रतिक्रिया योजनाएं सुझाई गई हैं।

हार्डवेयर-फ़ोकस्ड समाधान

इनमें से अधिकांश, हालांकि, अतिरिक्त उपकरण या जटिल सॉफ़्टवेयर को शामिल करते हैं जो गोपनीयता या लॉजिस्टिक समस्याएं उठा सकते हैं – अपेक्षाकृत उच्च-लागत वाले या अन्य संसाधन-सीमित दृष्टिकोण जो महामारी से पहले ही थे। 2001 में, एमआईटी ने गैल्वैक्टिवेटर का प्रस्ताव दिया, एक हाथ से पहनने वाला उपकरण जो दर्शक प्रतिभागी की भावनात्मक स्थिति का अनुमान लगाता है, जिसे एक दिन-लंबे सिम्पोज़ियम के दौरान परीक्षण किया गया था।

2001 से एमआईटी का गैल्वैक्टिवेटर, जो दर्शक की भावना और जुड़ाव को समझने के प्रयास में त्वचा की चालकता प्रतिक्रिया को मापता है। स्रोत: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf

2001 से एमआईटी का गैल्वैक्टिवेटर, जो दर्शक की भावना और जुड़ाव को समझने के प्रयास में त्वचा की चालकता प्रतिक्रिया को मापता है। स्रोत: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf

शैक्षणिक ऊर्जा का एक बड़ा हिस्सा ‘क्लिकर्स’ के संभावित तैनाती के लिए भी समर्पित किया गया है, जो एक दर्शक प्रतिक्रिया प्रणाली (एआरएस) के रूप में कार्य करता है, जो दर्शकों की सक्रिय भागीदारी को बढ़ाने के लिए एक उपाय है (जो स्वचालित रूप से जुड़ाव बढ़ाता है, क्योंकि यह दर्शक को एक सक्रिय प्रतिक्रिया नोड की भूमिका में मजबूर करता है), लेकिन जिसे वक्ता के प्रोत्साहन के साधन के रूप में भी कल्पना की गई है।

वक्ता और दर्शकों को ‘जोड़ने’ के अन्य प्रयासों में हृदय गति की निगरानी, जटिल शरीर-वorn उपकरण का उपयोग करने के लिए इलेक्ट्रोएन्सेफलोग्राफी का लाभ उठाने, ‘चियर मीटर’, कंप्यूटर-दृष्टि-आधारित भावना पहचान का उपयोग किया जाता है डेस्क-बाउंड कार्यकर्ताओं के लिए, और वक्ता के भाषण के दौरान दर्शकों द्वारा भेजे गए इमोटिकॉन्स का उपयोग किया जाता है।

2017 से एलएमयू म्यूनिख और स्टुटगार्ट विश्वविद्यालय के संयुक्त शोध परियोजना से इंगेजमीटर। स्रोत: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf

2017 से एलएमयू म्यूनिख और स्टुटगार्ट विश्वविद्यालय के संयुक्त शोध परियोजना से इंगेजमीटर। स्रोत: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf

दर्शक प्रतिक्रिया विश्लेषण के एक आकर्षक क्षेत्र के रूप में, निजी क्षेत्र ने विशेष रूप से गेज़ अनुमान और ट्रैकिंग में रुचि ली है – प्रत्येक दर्शक सदस्य (जो बारी-बारी से वक्ता हो सकता है) को ओकुलर ट्रैकिंग के अधीन किया जाता है, जो जुड़ाव और अनुमोदन के सूचक के रूप में कार्य करता है।

इन सभी तरीकों में अपेक्षाकृत उच्च घर्षण है। उनमें से कई में विशेष उपकरण, प्रयोगशाला वातावरण, विशेष और कस्टम-निर्मित सॉफ़्टवेयर फ्रेमवर्क, और महंगे व्यावसायिक एपीआई की सदस्यता की आवश्यकता होती है – या इन प्रतिबंधक कारकों में से कोई भी संयोजन।

इसलिए, वीडियोकांफ्रेंसिंग के लिए सामान्य उपकरणों के अलावा कुछ भी नहीं पर आधारित न्यूनतम सिस्टम का विकास पिछले 18 महीनों में रुचि का विषय बन गया है।

दर्शक अनुमोदन की रिपोर्टिंग विवेकपूर्ण

इस उद्देश्य के लिए, टोक्यो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय के बीच एक नए शोध सहयोग में एक नवीन प्रणाली प्रस्तावित की गई है जो मानक वीडियोकांफ्रेंसिंग टूल (जैसे ज़ूम) पर केवल एक वेब-कैम-सक्षम वेबसाइट का उपयोग करके चल सकती है, जिस पर हल्के गेज़ और मुद्रा अनुमान सॉफ़्टवेयर चल रहा हो। इस तरह से यहां तक कि स्थानीय ब्राउज़र प्लग-इन की आवश्यकता से बचा जा सकता है।

उपयोगकर्ता के सिर हिलाने और अनुमानित नेत्र-ध्यान को प्रतिनिधित्व करने वाले डेटा में अनुवादित किया जाता है, जो वक्ता को वापस दिखाया जाता है, जिससे सामग्री को दर्शकों के साथ जोड़ने का एक ‘लाइव’ लिटमस परीक्षण होता है – और कम से कम एक अस्पष्ट संकेत भी मिलता है कि वार्ता के किसी भी चरण में वक्ता दर्शकों की रुचि खो सकता है।

कैल्मरेस्पॉन्स के साथ, उपयोगकर्ता का ध्यान और सिर हिलाना एक दर्शक प्रतिक्रिया पूल में जोड़ा जाता है और वक्ता के लिए लाभकारी एक दृश्य प्रतिनिधित्व में अनुवादित किया जाता है। लेख के अंत में निहित वीडियो में अधिक विवरण और उदाहरण देखें। स्रोत: https://www.youtube.com/watch?v=J_PhB4FCzk0

कैल्मरेस्पॉन्स के साथ, उपयोगकर्ता का ध्यान और सिर हिलाना एक दर्शक प्रतिक्रिया पूल में जोड़ा जाता है और वक्ता के लिए लाभकारी एक दृश्य प्रतिनिधित्व में अनुवादित किया जाता है। लेख के अंत में निहित वीडियो में अधिक विवरण और उदाहरण देखें। स्रोत: https://www.youtube.com/watch?v=J_PhB4FCzk0

अकादमिक स्थितियों में, जैसे कि ऑनलाइन व्याख्यान, छात्र वक्ता को दिखाई नहीं दे सकते हैं क्योंकि उन्होंने अपने पृष्ठभूमि या वर्तमान रूप के बारे में आत्म-सचेत होने के कारण अपने कैमरे को चालू नहीं किया है। कैल्मरेस्पॉन्स इस तरह की कठिनाई को दूर कर सकता है कि वक्ता को यह जानने की आवश्यकता नहीं है कि दर्शक अपना कैमरा चालू करें या नहीं।

शोध पत्र का शीर्षक कैल्मरेस्पॉन्स: रिमोट संचार में सामूहिक दर्शक प्रतिक्रिया प्रदर्शित करना है, और यह टोक्यो विश्वविद्यालय के दो शोधकर्ताओं और कार्नेगी मेलन विश्वविद्यालय के एक शोधकर्ता के बीच एक संयुक्त कार्य है।

लेखकों ने एक लाइव वेब-आधारित डेमो की पेशकश की है, और गिटहब पर स्रोत कोड जारी किया है।

कैल्मरेस्पॉन्स फ्रेमवर्क

कैल्मरेस्पॉन्स का सिर हिलाने में, इसके बजाय अन्य संभावित विचारों के प्रति रुचि इस शोध पर आधारित है (कुछ डार्विन के युग से) जो यह दर्शाता है कि 80% से अधिक सभी श्रोताओं की सिर की हरकतें हिलाने से बनी होती हैं (यहां तक कि जब वे असहमति व्यक्त कर रहे हों)। उसी समय, नेत्र-गेज आंदोलनों को बार-बार अध्ययनों में रुचि या जुड़ाव का एक विश्वसनीय सूचक दिखाया गया है।

कैल्मरेस्पॉन्स को एचटीएमएल, सीएसएस, और जावास्क्रिप्ट के साथ लागू किया जाता है, और इसमें तीन उप-प्रणालियाँ होती हैं: एक दर्शक क्लाइंट, एक वक्ता क्लाइंट, और एक सर्वर। दर्शक क्लाइंट वेबसॉकेट के माध्यम से उपयोगकर्ता के वेबकैम से नेत्र-गेज या सिर की हरकत के डेटा को क्लाउड एप्लिकेशन प्लेटफ़ॉर्म हरोकु पर भेजता है।

कैल्मरेस्पॉन्स के तहत दर्शकों की सिर की हरकत का दृश्य प्रतिनिधित्व। इस मामले में दर्शकों के लिए भी हरकत का दृश्य प्रतिनिधित्व उपलब्ध है, न कि केवल वक्ता के लिए। स्रोत: https://arxiv.org/pdf/2204.02308.pdf

कैल्मरेस्पॉन्स के तहत दर्शकों की सिर की हरकत का दृश्य प्रतिनिधित्व। इस मामले में दर्शकों के लिए भी हरकत का दृश्य प्रतिनिधित्व उपलब्ध है, न कि केवल वक्ता के लिए। स्रोत: https://arxiv.org/pdf/2204.02308.pdf

परियोजना के नेत्र-ट्रैकिंग अनुभाग के लिए, शोधकर्ताओं ने वेबगेज़र का उपयोग किया, एक हल्के, जावास्क्रिप्ट-आधारित ब्राउज़र-आधारित नेत्र-ट्रैकिंग फ्रेमवर्क जो वेबसाइट से सीधे कम विलंबता के साथ चल सकता है।

चूंकि गेज़ और मुद्रा अनुमान में उच्च सटीकता की आवश्यकता की तुलना में सरल कार्यान्वयन और खुरदरा समग्र प्रतिक्रिया मान्यता की आवश्यकता अधिक है, इसलिए इनपुट मुद्रा डेटा को मान के अनुसार चिकना किया जाता है trước समग्र प्रतिक्रिया मान्यता के लिए विचार किया जाता है।

सिर हिलाने की क्रिया जावास्क्रिप्ट लाइब्रेरी क्ल्मट्रैकर के माध्यम से मूल्यांकन की जाती है, जो छवियों या वीडियो में पता लगाए गए चेहरों पर चेहरे के मॉडल को फिट करता है। अर्थव्यवस्था और कम-विलंबता के उद्देश्य से, केवल नाक के लैंडमार्क को सक्रिय रूप से निगरानी की जाती है, क्योंकि यह सिर हिलाने की क्रिया को ट्रैक करने के लिए पर्याप्त है।

उपयोगकर्ता की नाक की स्थिति की हरकत एक ट्रेल बनाती है जो दर्शक प्रतिक्रिया पूल में योगदान करती है जो सिर हिलाने से संबंधित है, जिसे सभी प्रतिभागियों के लिए एक समग्र तरीके से दृश्य प्रतिनिधित्व किया जाता है।

उपयोगकर्ता की नाक की स्थिति की हरकत एक ट्रेल बनाती है जो दर्शक प्रतिक्रिया पूल में योगदान करती है जो सिर हिलाने से संबंधित है, जिसे सभी प्रतिभागियों के लिए एक समग्र तरीके से दृश्य प्रतिनिधित्व किया जाता है।

हीट मैप

सिर हिलाने की गतिविधि को गतिशील गतिशील बिंदुओं द्वारा प्रस्तुत किया जाता है (ऊपर की छवियों और वीडियो देखें), दृश्य ध्यान को एक हीट मैप के रूप में प्रस्तुत किया जाता है जो वक्ता और दर्शकों को यह दिखाता है कि साझा प्रस्तुति स्क्रीन या वीडियोकांफ्रेंस वातावरण पर सामान्य ध्यान केंद्रित है।

सभी प्रतिभागी यह देख सकते हैं कि सामान्य उपयोगकर्ता ध्यान किस पर केंद्रित है। पत्र में उल्लेख नहीं है कि क्या यह कार्यक्षमता तब उपलब्ध है जब उपयोगकर्ता अन्य प्रतिभागियों की 'गैलरी' देख सकता है, जो विभिन्न कारणों से एक विशिष्ट प्रतिभागी पर झूठा ध्यान प्रकट कर सकता है।

सभी प्रतिभागी यह देख सकते हैं कि सामान्य उपयोगकर्ता ध्यान किस पर केंद्रित है। पत्र में उल्लेख नहीं है कि क्या यह कार्यक्षमता तब उपलब्ध है जब उपयोगकर्ता अन्य प्रतिभागियों की ‘गैलरी’ देख सकता है, जो विभिन्न कारणों से एक विशिष्ट प्रतिभागी पर झूठा ध्यान प्रकट कर सकता है।

परीक्षण

कैल्मरेस्पॉन्स के लिए दो परीक्षण वातावरण तैयार किए गए थे, जो एक सूक्ष्म अभिलेशन अध्ययन के रूप में थे, जिसमें तीन विभिन्न परिस्थितियों का उपयोग किया गया था: ‘स्थिति बी’ (बेसलाइन) में, लेखकों ने एक典型 ऑनलाइन छात्र व्याख्यान को दोहराया, जहां अधिकांश छात्रों ने अपने वेबकैम बंद रखे, और वक्ता को दर्शकों के चेहरे दिखाई नहीं दे रहे थे; ‘स्थिति सीआर-ई’ में, वक्ता को गेज़ प्रतिक्रिया (हीट मैप) दिखाई दे रही थी; ‘स्थिति सीआर-एन’ में, वक्ता को दर्शकों की सिर हिलाने और गेज़ गतिविधि दिखाई दे रही थी।

पहले प्रयोग में स्थिति बी और स्थिति सीआर-ई शामिल थे; दूसरे प्रयोग में स्थिति बी और स्थिति सीआर-एन शामिल थे। वक्ता और दर्शकों दोनों से प्रतिक्रिया प्राप्त की गई।

प्रत्येक प्रयोग में, तीन कारकों का मूल्यांकन किया गया था: प्रस्तुति का विषयगत और वस्तुनिष्ठ मूल्यांकन (वक्ता द्वारा अपनी प्रस्तुति के बारे में महसूस की गई भावनाओं के बारे में एक स्व-रिपोर्ट किए गए प्रश्नावली सहित); ‘फ़िलर’ भाषण की घटनाओं की संख्या, जो क्षणिक असुरक्षा और संदेह की ओर इशारा करती है; और गुणात्मक टिप्पणियाँ। ये मानदंड वक्ता की चिंता और भाषण की गुणवत्ता के सामान्य मूल्यांकक हैं।

परीक्षण पूल में 38 लोग शामिल थे, जिनकी आयु 19-44 वर्ष थी, जिनमें 29 पुरुष और नौ महिलाएं थीं, जिनकी औसत आयु 24.7 वर्ष थी, सभी जापानी या चीनी थे, और सभी जापानी में धाराप्रवाह थे। उन्हें यादृच्छिक रूप से पांच समूहों में विभाजित किया गया था, और कोई भी विषय एक दूसरे को व्यक्तिगत रूप से नहीं जानता था।

परीक्षण ज़ूम पर आयोजित किए गए थे, जिसमें पहले प्रयोग में पांच वक्ता और दूसरे प्रयोग में छह वक्ता शामिल थे।

फ़िलर स्थितियों को नारंगी बक्से के रूप में चिह्नित किया गया है। आम तौर पर, फ़िलर सामग्री प्रणाली से बढ़ी हुई दर्शक प्रतिक्रिया के अनुपात में गिर गई।

फ़िलर स्थितियों को नारंगी बक्से के रूप में चिह्नित किया गया है। आम तौर पर, फ़िलर सामग्री प्रणाली से बढ़ी हुई दर्शक प्रतिक्रिया के अनुपात में गिर गई।

शोधकर्ताओं ने उल्लेख किया कि एक वक्ता के फ़िलर में उल्लेखनीय कमी आई, और ‘स्थिति सीआर-एन’ में, वक्ता ने शायद ही कभी फ़िलर वाक्यांश बोले। पत्र में विस्तृत और विस्तृत परिणाम देखें; हालांकि, सबसे उल्लेखनीय परिणाम वक्ता और दर्शकों दोनों से विषयगत मूल्यांकन में थे।

दर्शकों की टिप्पणियों में शामिल थीं:

‘मुझे लगा कि मैं प्रस्तुतियों में शामिल था’ [एएन2], ‘मुझे यह नहीं पता था कि वक्ताओं के भाषण में सुधार हुआ है या नहीं, लेकिन मैंने दूसरों की सिर की हरकत के दृश्य प्रतिनिधित्व से एकता की भावना महसूस की।’ [एएन6]

‘मुझे यह नहीं पता था कि वक्ताओं के भाषण में सुधार हुआ है या नहीं, लेकिन मैंने दूसरों की सिर की हरकत के दृश्य प्रतिनिधित्व से एकता की भावना महसूस की।’

शोधकर्ताओं ने उल्लेख किया कि प्रणाली वक्ता की प्रस्तुति में एक नई कृत्रिम विराम पेश करती है, क्योंकि वक्ता दर्शक प्रतिक्रिया का मूल्यांकन करने के लिए दृश्य प्रणाली को देखने के लिए प्रवृत्त होता है trước आगे बढ़ने से।

वे यह भी उल्लेख करते हैं कि एक ‘व्हाइट कोट प्रभाव’ है, जो प्रयोगात्मक परिस्थितियों में टालना मुश्किल है, जहां कुछ प्रतिभागियों को यह महसूस हुआ कि वे जैवमेट्रिक डेटा की सुरक्षा निहितार्थ के कारण सीमित महसूस कर रहे थे।

निष्कर्ष

एक ऐसी प्रणाली में एक उल्लेखनीय लाभ यह है कि इसके लिए आवश्यक सभी गैर-मानक अनुपूरक प्रौद्योगिकियां पूरी तरह से गायब हो जाती हैं जब उनका उपयोग समाप्त हो जाता है। कोई अवशेष ब्राउज़र प्लग-इन नहीं हैं जिन्हें अनइंस्टॉल करने की आवश्यकता है, या जो प्रतिभागियों के दिमाग में संदेह पैदा करें कि क्या उन्हें अपनी प्रणाली पर रहना चाहिए; और कोई आवश्यकता नहीं है कि उपयोगकर्ताओं को स्थापना प्रक्रिया से गुजरने के लिए मार्गदर्शन करें (हालांकि वेब-आधारित फ्रेमवर्क को उपयोगकर्ता द्वारा प्रारंभिक कैलिब्रेशन की आवश्यकता होती है), या स्थानीय सॉफ़्टवेयर स्थापित करने की संभावना की संभावना का सामना करने के लिए, जिसमें ब्राउज़र-आधारित ऐड-ऑन और एक्सटेंशन शामिल हैं।

मूल्यांकित चेहरे और नेत्र-गेज आंदोलनों की सटीकता तब नहीं हो सकती है जब स्थानीय मशीन लर्निंग फ्रेमवर्क (जैसे योलो श्रृंखला) का उपयोग किया जा सकता है, लेकिन यह लगभग घर्षण-मुक्त दृष्टिकोण वीडियोकांफ्रेंस की सामान्य स्थितियों में व्यापक भावना और दृष्टिकोण विश्लेषण के लिए पर्याप्त सटीकता प्रदान करता है। सबसे महत्वपूर्ण बात, यह बहुत सस्ता है।

लेख के अंत में निहित परियोजना वीडियो में अधिक विवरण और उदाहरण देखें।

 

पहली बार 11 अप्रैल 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai