Anderson का एंगल

‘ओल्स और लिजार्ड्स’ की तलाश में एक विज्ञापनकर्ता के दर्शकों में

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Images from the paper 'Monitoring Viewer Attention During Online Ads' (https://arxiv.org/pdf/2504.06237)

चूंकि ऑनलाइन विज्ञापन क्षेत्र का अनुमान है कि 2023 में 740.3 अरब अमेरिकी डॉलर का व्यय किया गया है, यह समझना आसान है कि विज्ञापन कंपनियां इस विशेष कंप्यूटर दृष्टि अनुसंधान की शाखा में क्यों महत्वपूर्ण संसाधनों का निवेश करती हैं।

हालांकि यह उद्योग संरक्षित और सुरक्षित है, यह कभी-कभी अध्ययन प्रकाशित करता है जो अधिक उन्नत प्रोप्राइटरी कार्य की ओर इशारा करते हैं – चेहरे और आंखों की दृष्टि की मान्यता में शामिल हैं, जिसमें आयु मान्यता भी शामिल है, जो जनसांख्यिकी विश्लेषण आंकड़ों के लिए केंद्रीय है:

एक विज्ञापन संदर्भ में एक विशिष्ट आयु वर्ग को लक्षित करने वाले विज्ञापनदाताओं के लिए एक विज्ञापन संदर्भ में आयु का अनुमान लगाना दिलचस्प है। इस प्रायोगिक उदाहरण में, बॉब डायलन की आयु को वर्षों में ट्रैक किया जाता है। स्रोत: https://arxiv.org/pdf/1906.03625

एक विज्ञापन संदर्भ में एक विशिष्ट आयु वर्ग को लक्षित करने वाले विज्ञापनदाताओं के लिए एक विज्ञापन संदर्भ में आयु का अनुमान लगाना दिलचस्प है। इस प्रायोगिक उदाहरण में, बॉब डायलन की आयु को वर्षों में ट्रैक किया जाता है। स्रोत: https://arxiv.org/pdf/1906.03625

इन अध्ययनों में, जो शायद ही कभी सार्वजनिक भंडारों में दिखाई देते हैं, वास्तविक रूप से भर्ती किए गए प्रतिभागियों का उपयोग किया जाता है जो एआई-संचालित विश्लेषण के लिए आधार बनते हैं जो यह निर्धारित करने का प्रयास करता है कि दर्शक विज्ञापन के साथ कितना और किस तरह से जुड़ रहा है।

Dlib का हिस्टोग्राम ऑफ ओरिएंटेड ग्रेडिएंट्स (HoG) अक्सर चेहरे के अनुमान में प्रणालियों में उपयोग किया जाता है। स्रोत: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Dlib का हिस्टोग्राम ऑफ ओरिएंटेड ग्रेडिएंट्स (HoG) अक्सर चेहरे के अनुमान में प्रणालियों में उपयोग किया जाता है। स्रोत: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

जानवरों की प्रवृत्ति

इस संबंध में, स्वाभाविक रूप से, विज्ञापन उद्योग यह निर्धारित करने में रुचि रखता है कि झूठे सकारात्मक (उन अवसरों को जब एक विश्लेषणात्मक प्रणाली एक विषय की क्रियाओं को गलत तरीके से व्याख्या करती है) और यह स्थापित करने के लिए स्पष्ट मानदंड कि व्यक्ति जो उनके वाणिज्यिक देख रहा है पूरी तरह से सामग्री के साथ जुड़ नहीं रहा है।

स्क्रीन-आधारित विज्ञापन के संबंध में, अध्ययन दो समस्याओं पर ध्यान केंद्रित करते हैं जो दो वातावरण में होते हैं। वातावरण ‘डेस्कटॉप’ या ‘मोबाइल’ हैं, प्रत्येक की अपनी विशिष्ट विशेषताएं हैं जिनके लिए विशिष्ट ट्रैकिंग समाधानों की आवश्यकता होती है; और समस्याएं – विज्ञापनदाता के दृष्टिकोण से – ओल और लिजार्ड व्यवहार द्वारा प्रतिनिधित्व की जाती हैं – एक दर्शक की प्रवृत्ति जो उनके सामने विज्ञापन पर पूरा ध्यान नहीं देता है।

एक विज्ञापन अनुसंधान परियोजना के विषय में 'ओल' और 'लिजार्ड' व्यवहार के उदाहरण। स्रोत: https://arxiv.org/pdf/1508.04028

एक विज्ञापन अनुसंधान परियोजना के विषय में ‘ओल’ और ‘लिजार्ड’ व्यवहार के उदाहरण। स्रोत: https://arxiv.org/pdf/1508.04028

यदि आप अपने सिर के साथ विज्ञापन से दूर देख रहे हैं, तो यह ‘ओल’ व्यवहार है; यदि आपका सिर की मुद्रा स्थिर है लेकिन आपकी आंखें स्क्रीन से दूर जा रही हैं, तो यह ‘लिजार्ड’ व्यवहार है। विज्ञापनों के परीक्षण के लिए विश्लेषण और नियंत्रित परिस्थितियों में, ये आवश्यक क्रियाएं हैं जिन्हें एक प्रणाली को पकड़ने में सक्षम होना चाहिए।

स्मार्टआई के अफेक्टिवा अधिग्रहण से एक नई पेपर इन मुद्दों को संबोधित करती है, जो मौजूदा फ्रेमवर्क का लाभ उठाने के लिए एक वास्तुकला प्रदान करती है ताकि सभी आवश्यक स्थितियों और संभावित प्रतिक्रियाओं में एक संयुक्त और संक्षिप्त सुविधा सेट प्रदान किया जा सके – और यह निर्धारित करने में सक्षम हो कि क्या एक दर्शक ऊब गया है, जुड़ा हुआ है, या किसी तरह से सामग्री से दूर है जिसे विज्ञापनदाता उन्हें देखना चाहता है।

विभिन्न विचलित संकेतों के लिए डेस्कटॉप और मोबाइल उपकरणों के लिए नए ध्यान प्रणाली द्वारा पता लगाए गए सच्चे और झूठे सकारात्मक उदाहरण। स्रोत: https://arxiv.org/pdf/2504.06237

विभिन्न विचलित संकेतों के लिए डेस्कटॉप और मोबाइल उपकरणों के लिए नए ध्यान प्रणाली द्वारा पता लगाए गए सच्चे और झूठे सकारात्मक उदाहरण। स्रोत: https://arxiv.org/pdf/2504.06237

लेखक कहते हैं*:

सीमित अनुसंधान ने ऑनलाइन विज्ञापनों के दौरान ध्यान की निगरानी में खुद को व्यस्त किया है। जबकि इन अध्ययनों ने झूठी गaze की पहचान करने के लिए सिर की मुद्रा या गaze दिशा का अनुमान लगाने पर ध्यान केंद्रित किया, उन्होंने महत्वपूर्ण मापदंडों जैसे कि डिवाइस प्रकार (डेस्कटॉप या मोबाइल), कैमरा प्लेसमेंट स्क्रीन के सापेक्ष, और स्क्रीन आकार को नजरअंदाज कर दिया। ये कारक ध्यान का पता लगाने को महत्वपूर्ण रूप से प्रभावित करते हैं। ‘

‘इस पत्र में, हम एक ध्यान का पता लगाने के लिए एक वास्तुकला का प्रस्ताव करते हैं जो विभिन्न विचलित करने वालों का पता लगाने को शामिल करता है, जिसमें दोनों ऑफ-स्क्रीन गaze और लिजार्ड व्यवहार शामिल हैं – स्क्रीन से दूर देखने की प्रवृत्ति। ‘

‘पिछले दृष्टिकोणों के विपरीत, हमारी विधि डिवाइस-विशिष्ट विशेषताओं जैसे कि डिवाइस प्रकार, कैमरा प्लेसमेंट, स्क्रीन आकार (डेस्कटॉप के लिए) और कैमरा अभिविन्यास (मोबाइल डिवाइस के लिए) को कच्चे गaze अनुमान के साथ एकीकृत करती है ताकि ध्यान का पता लगाने की सटीकता में सुधार किया जा सके।’

नई काम शीर्षक है ऑनलाइन विज्ञापनों के दौरान दर्शक का ध्यान, और चार शोधकर्ताओं से आता है अफेक्टिवा में।

विधि और डेटा

मुख्य रूप से इस प्रकार की प्रणालियों की गोपनीयता और बंद-स्रोत प्रकृति के कारण, नई पेपर लेखकों के दृष्टिकोण की तुलना प्रतिद्वंद्वियों के साथ सीधे तौर पर नहीं करती है, बल्कि अपने निष्कर्षों को केवल ablation अध्ययन के रूप में प्रस्तुत करती है; न ही पेपर सामान्य कंप्यूटर दृष्टि साहित्य के सामान्य प्रारूप का पालन करता है। इसलिए, हम इस शोध को उस रूप में देखेंगे जैसा यह प्रस्तुत किया गया है।

लेखकों का कहना है कि केवल एक सीमित संख्या में अध्ययनों ने विशेष रूप से ऑनलाइन विज्ञापनों के संदर्भ में ध्यान का पता लगाने को संबोधित किया है। एएफडीएफएक्स एसडीके में, जो वास्तविक समय में बहु-चेहरे पहचान प्रदान करता है, ध्यान केवल सिर की मुद्रा से अनुमानित है, जिसमें प्रतिभागियों को उनके सिर के कोण एक निर्धारित सीमा से अधिक होने पर असावधानी से लेबल किया जाता है।

एक अफेक्टिवा प्रणाली से एक उदाहरण जो सिर की मुद्रा पर ध्यान के संकेतक के रूप में निर्भर करता है। स्रोत: https://www.youtube.com/watch?v=c2CWb5jHmbY

एक अफेक्टिवा प्रणाली से एक उदाहरण जो सिर की मुद्रा पर ध्यान के संकेतक के रूप में निर्भर करता है। स्रोत: https://www.youtube.com/watch?v=c2CWb5jHmbY

2019 के सहयोग वीडियो सामग्री के लिए गहरे शिक्षण का उपयोग करके दृश्य ध्यान का स्वचालित माप में, लगभग 28,000 प्रतिभागियों के एक डेटासेट को विभिन्न असावधानी व्यवहार के लिए एनोटेट किया गया था, जिसमें दूर देखना, आंखें बंद करना, या अन्य गतिविधियों में शामिल होना शामिल था, और एक सीएनएन-एलएसटीएम मॉडल को ध्यान का पता लगाने के लिए चेहरे की उपस्थिति से प्रशिक्षित किया गया था।

2019 के पेपर से, एक उदाहरण जो एक स्क्रीन पर वीडियो सामग्री देखने वाले दर्शक के लिए अनुमानित ध्यान राज्यों को दर्शाता है। स्रोत: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

2019 के पेपर से, एक उदाहरण जो एक स्क्रीन पर वीडियो सामग्री देखने वाले दर्शक के लिए अनुमानित ध्यान राज्यों को दर्शाता है। स्रोत: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

हालांकि, लेखकों का कहना है कि इन पहले के प्रयासों ने डिवाइस-विशिष्ट कारकों के लिए खाता नहीं बनाया, जैसे कि प्रतिभागी डेस्कटॉप या मोबाइल डिवाइस का उपयोग कर रहा था या नहीं; न ही उन्होंने स्क्रीन आकार या कैमरा प्लेसमेंट पर विचार किया। इसके अलावा, एएफडीएफएक्स प्रणाली केवल गaze विचलित करने पर ध्यान केंद्रित करती है, और अन्य विचलित करने वालों को छोड़ देती है, जबकि 2019 का काम एक व्यापक सेट का पता लगाने का प्रयास करता है – लेकिन इसका एकल छोटा सीएनएन का उपयोग इस कार्य के लिए अपर्याप्त हो सकता है।

लेखकों का कहना है कि इस रेखा में सबसे लोकप्रिय अनुसंधान विज्ञापन परीक्षण के लिए अनुकूलित नहीं है, जिसकी तुलना में डोमेन जैसे ड्राइविंग या शिक्षा में अलग-अलग आवश्यकताएं हैं – जहां कैमरा प्लेसमेंट और कैलिब्रेशन आमतौर पर पहले से तय होते हैं, इसके बजाय अनकैलिब्रेटेड सेटअप पर निर्भर करते हैं, और डेस्कटॉप और मोबाइल डिवाइस की सीमित गaze सीमा के भीतर संचालित होते हैं।

इसलिए उन्होंने ऑनलाइन विज्ञापनों के दौरान दर्शक का ध्यान का पता लगाने के लिए एक वास्तुकला तैयार की है, जो दो व्यावसायिक टूलकिट का लाभ उठाती है: एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके

एएफडीएफएक्स 2.0 से चेहरे के विश्लेषण के उदाहरण। स्रोत: https://arxiv.org/pdf/2202.12059

एएफडीएफएक्स 2.0 से चेहरे के विश्लेषण के उदाहरण। स्रोत: https://arxiv.org/pdf/2202.12059

इन पूर्व कार्यों में निम्न-स्तरीय विशेषताएं निकाली जाती हैं, जैसे कि चेहरे के भाव, सिर की मुद्रा, और गaze दिशा – एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके के माध्यम से निकाली जाती हैं। इन विशेषताओं को तब उच्च-स्तरीय संकेतकों में परिवर्तित किया जाता है, जिसमें गaze स्थिति स्क्रीन पर, यawns, और बोलते हुए शामिल हैं।

प्रणाली चार प्रकार के विचलित करने वालों की पहचान करती है: ऑफ-स्क्रीन गaze; उनींदापन; बोलते हुए; और अनदेखी स्क्रीन। यह गaze विश्लेषण को भी समायोजित करता है कि दर्शक डेस्कटॉप या मोबाइल डिवाइस पर है या नहीं।

डेटासेट: गaze

लेखकों ने ध्यान का पता लगाने वाली प्रणाली को शक्तिशाली बनाने और मूल्यांकन करने के लिए चार डेटासेट का उपयोग किया: तीन गaze व्यवहार, बोलते हुए, और यawns पर व्यक्तिगत रूप से ध्यान केंद्रित करते हैं; और एक चौथा वास्तविक दुनिया के विज्ञापन परीक्षण सत्र से निकाला गया, जिसमें विभिन्न प्रकार के विचलित करने वाले शामिल थे।

काम की विशिष्ट आवश्यकताओं के कारण, प्रत्येक श्रेणी के लिए कस्टम डेटासेट बनाए गए थे। सभी डेटासेट एक प्रोप्राइटरी रिपॉजिटरी से संकलित किए गए थे जिसमें लाखों रिकॉर्ड किए गए सत्र थे जिसमें प्रतिभागियों ने घर या कार्यस्थल वातावरण में विज्ञापन देखे थे, एक वेब-आधारित सेटअप के साथ, सूचित सहमति के साथ – और उन सहमति समझौतों की सीमाओं के कारण, लेखकों का कहना है कि नए काम के लिए डेटासेट को सार्वजनिक रूप से उपलब्ध नहीं किया जा सकता है।

गaze डेटासेट का निर्माण करने के लिए, प्रतिभागियों को विभिन्न बिंदुओं पर स्क्रीन के चारों ओर एक चलती बिंदु का पालन करने के लिए कहा गया था, जिसमें इसके किनारे भी शामिल थे, और फिर स्क्रीन से दूर देखने के लिए चार दिशाओं में (ऊपर, नीचे, बाएं और दाएं) क्रम को तीन बार दोहराया जाता था। इस प्रकार, कैप्चर और कवरेज के बीच संबंध स्थापित किया गया था:

डेस्कटॉप (ए) और मोबाइल (बी) डिवाइस पर गaze वीडियो उत्तेजना के स्क्रीनशॉट। पहले और तीसरे फ्रेम में एक चलती बिंदु का पालन करने के निर्देश दिए गए हैं, जबकि दूसरे और चौथे फ्रेम में स्क्रीन से दूर देखने के लिए प्रतिभागियों को प्रॉम्प्ट किया जाता है।

डेस्कटॉप (ए) और मोबाइल (बी) डिवाइस पर गaze वीडियो उत्तेजना के स्क्रीनशॉट। पहले और तीसरे फ्रेम में एक चलती बिंदु का पालन करने के निर्देश दिए गए हैं, जबकि दूसरे और चौथे फ्रेम में स्क्रीन से दूर देखने के लिए प्रतिभागियों को प्रॉम्प्ट किया जाता है।

चलती बिंदु के खंडों को सावधान के रूप में लेबल किया गया था, और ऑफ-स्क्रीन खंडों को असावधान के रूप में लेबल किया गया था, जिससे दोनों सकारात्मक और नकारात्मक उदाहरणों का एक लेबल डेटासेट तैयार हुआ।

प्रत्येक वीडियो लगभग 160 सेकंड तक चला, डेस्कटॉप और मोबाइल प्लेटफ़ॉर्म दोनों के लिए अलग-अलग संस्करणों के साथ, जिनमें क्रमशः 1920×1080 और 608×1080 के रिज़ॉल्यूशन थे।

कुल 609 वीडियो एकत्र किए गए, जिनमें 322 डेस्कटॉप और 287 मोबाइल रिकॉर्डिंग शामिल थीं। लेबल्स को स्वचालित रूप से वीडियो सामग्री के आधार पर लागू किया गया था, और डेटासेट विभाजित 158 प्रशिक्षण नमूनों और 451 परीक्षण के लिए किया गया था।

डेटासेट: बोलते हुए

इस संदर्भ में, असावधानी की परिभाषा करने वाले मानदंडों में से एक यह है कि जब कोई व्यक्ति एक से अधिक सेकंड के लिए बोलता है (जो एक क्षणिक टिप्पणी हो सकती है, या यहां तक कि एक खांसी भी)।

चूंकि नियंत्रित वातावरण ऑडियो को रिकॉर्ड या विश्लेषण नहीं करता है, बोलते हुए का अनुमान आंतरिक चेहरे की भूमिका के अनुमानित आंदोलन को देखकर लगाया जाता है। इसलिए, बिना ऑडियो के बोलते हुए का पता लगाने के लिए, लेखकों ने अपने आंतरिक भंडार से पूरी तरह से दृश्य इनपुट पर आधारित एक डेटासेट बनाया, जिसे दो भागों में विभाजित किया गया था: पहले में लगभग 5,500 वीडियो थे, जिनमें से प्रत्येक को तीन अनnotators द्वारा बोलते हुए या नहीं बोलते हुए के रूप में मैन्युअल रूप से लेबल किया गया था (इनमें से 4,400 का उपयोग प्रशिक्षण और मान्यकरण के लिए किया गया था, और 1,100 का उपयोग परीक्षण के लिए किया गया था)।

दूसरे में 16,000 सत्र थे, जिन्हें सत्र प्रकार के आधार पर स्वचालित रूप से लेबल किया गया था: 10,500 में प्रतिभागियों को शांति से विज्ञापन देखते हुए दिखाया गया था, और 5,500 में प्रतिभागियों को ब्रांडों के बारे में अपने विचार व्यक्त करते हुए दिखाया गया था।

डेटासेट: यawns

हालांकि कुछ ‘यawns’ डेटासेट मौजूद हैं, जिनमें YawDD और ड्राइवर थकान शामिल हैं, लेखकों का कहना है कि विज्ञापन परीक्षण परिदृश्यों के लिए कोई भी उपयुक्त नहीं है – क्योंकि वे या तो सिम्युलेटेड यawns की विशेषता है, या चेहरे की विकृति है जो भय या अन्य, गैर-यawns क्रियाओं के साथ भ्रमित हो सकती है।

इसलिए, लेखकों ने अपने आंतरिक संग्रह से 735 वीडियो का उपयोग किया, जिन सत्रों में जॉ ड्रॉप शामिल था जो एक से अधिक सेकंड तक चला था। प्रत्येक वीडियो को तीन अनnotators द्वारा मैन्युअल रूप से सक्रिय या निष्क्रिय यawns के रूप में लेबल किया गया था। केवल 2.6 प्रतिशत फ्रेम में सक्रिय यawns शामिल थे, जो वर्ग असंतुलन को रेखांकित करता है, और डेटासेट को 670 प्रशिक्षण वीडियो और 65 परीक्षण के लिए विभाजित किया गया था।

डेटासेट: विचलित

विचलित करने वाला डेटासेट भी लेखकों के विज्ञापन परीक्षण रिपॉजिटरी से निकाला गया था, जहां प्रतिभागियों ने वास्तविक विज्ञापन देखे थे जिनके लिए कोई कार्य सौंपा नहीं गया था। कुल 520 सत्र (193 मोबाइल और 327 डेस्कटॉप वातावरण में) को यादृच्छिक रूप से चुना गया और तीन अनnotators द्वारा मैन्युअल रूप से सावधान या असावधान के रूप में लेबल किया गया था।

असावधानी व्यवहार में ऑफ-स्क्रीन गaze, बोलते हुए, उनींदापन, और अनदेखी स्क्रीन शामिल थे। सत्र विश्व भर के विभिन्न क्षेत्रों में फैले हुए थे, डेस्कटॉप रिकॉर्डिंग अधिक सामान्य थी क्योंकि वेबकैम प्लेसमेंट लचीला था।

ध्यान मॉडल

प्रस्तावित ध्यान मॉडल निम्न-स्तरीय दृश्य विशेषताओं को संसाधित करता है, जिनमें चेहरे के भाव, सिर की मुद्रा, और गaze दिशा शामिल हैं – एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके के माध्यम से निकाली जाती हैं।

इन्हें उच्च-स्तरीय संकेतकों में परिवर्तित किया जाता है, जिसमें प्रत्येक विचलित करने वाले को एक अलग द्विआधारी वर्गीकारी द्वारा संभाला जाता है जो अपने डेटासेट पर स्वतंत्र रूप से प्रशिक्षित और मूल्यांकित किया जाता है।

प्रस्तावित निगरानी प्रणाली के लिए योजना।

प्रस्तावित निगरानी प्रणाली के लिए योजना।

गaze मॉडल स्क्रीन पर या दूर देखने का पता लगाने के लिए सामान्यीकृत गaze निर्देशांक का उपयोग करता है, डेस्कटॉप और मोबाइल डिवाइस दोनों के लिए अलग-अलग कैलिब्रेशन के साथ। इस प्रक्रिया में सहायता करने वाला एक रैखिक सपोर्ट वेक्टर मशीन (एसवीएम) है, जो स्थानिक और समयिक विशेषताओं पर प्रशिक्षित है, जो तेज़ गaze शिफ्ट को चिकना करने के लिए एक मेमोरी विंडो को एकीकृत करता है।

बिना ऑडियो के बोलते हुए का पता लगाने के लिए, प्रणाली ने मुंह के क्षेत्रों को फसल दिया और दोनों बातचीत और गैर-बातचीत वीडियो खंडों पर 3डी-सीएनएन को प्रशिक्षित किया। लेबल्स को सत्र प्रकार के आधार पर सौंपा गया था, जिसमें क्षणिक मुंह की गति से झूठे सकारात्मक को कम करने के लिए समयिक चिकनाई शामिल थी।

यawns का पता लगाने के लिए पूरे चेहरे की छवियों का उपयोग किया गया था, जो व्यापक चेहरे की गति को पकड़ने के लिए किया गया था, जिसमें मैन्युअल रूप से लेबल किए गए फ्रेमों पर 3डी-सीएनएन को प्रशिक्षित किया गया था (हालांकि कार्य को यawns की प्राकृतिक दृश्य में कम आवृत्ति और अन्य अभिव्यक्तियों के साथ इसकी समानता के कारण जटिल बना दिया गया था)।

स्क्रीन छोड़ना की पहचान एक फेस या अत्यधिक सिर की मुद्रा की अनुपस्थिति के माध्यम से की गई थी, जिसमें एक निर्णय पेड़ द्वारा भविष्यवाणी की गई थी।

अंतिम ध्यान स्थिति का निर्धारण एक निश्चित नियम का उपयोग करके किया गया था: यदि कोई भी मॉड्यूल असावधानी का पता लगाता है, तो दर्शक को असावधान के रूप में चिह्नित किया जाता है – एक दृष्टिकोण जो संवेदनशीलता को प्राथमिकता देता है, और डेस्कटॉप और मोबाइल संदर्भों के लिए अलग से समायोजित किया जाता है।

परीक्षण

जैसा कि पहले उल्लेख किया गया है, परीक्षण एक ablation विधि का पालन करते हैं, जहां घटकों को हटा दिया जाता है और परिणाम पर प्रभाव को नोट किया जाता है।

अध्ययन में पहचाने गए विभिन्न श्रेणियों के असावधानी का पता लगाना।

अध्ययन में पहचाने गए विभिन्न श्रेणियों के असावधानी का पता लगाना।

गaze मॉडल ने तीन मुख्य चरणों के माध्यम से ऑफ-स्क्रीन व्यवहार की पहचान की: कच्चे गaze अनुमानों को सामान्य करना, आउटपुट को ठीक करना, और डेस्कटॉप डिवाइस के लिए स्क्रीन आकार का अनुमान लगाना।

प्रत्येक घटक के महत्व को समझने के लिए, लेखकों ने उन्हें व्यक्तिगत रूप से हटा दिया और दो डेटासेट से 226 डेस्कटॉप और 225 मोबाइल वीडियो पर प्रदर्शन का मूल्यांकन किया। परिणाम, जी-मीन और एफ 1 स्कोर द्वारा मापा गया, नीचे दिखाया गया है:

व्यक्तिगत प्रसंस्करण चरणों को हटाने के साथ पूरे गaze मॉडल के प्रदर्शन को दर्शाने वाले परिणाम।

व्यक्तिगत प्रसंस्करण चरणों को हटाने के साथ पूरे गaze मॉडल के प्रदर्शन को दर्शाने वाले परिणाम।

प्रत्येक मामले में, प्रदर्शन में गिरावट आई जब एक चरण को छोड़ दिया गया। डेस्कटॉप पर सामान्यीकरण विशेष रूप से मूल्यवान साबित हुआ, जहां कैमरा प्लेसमेंट अधिक भिन्न होता है।

अध्ययन ने यह भी मूल्यांकन किया कि दृश्य विशेषताएं मोबाइल कैमरा अभिविन्यास की भविष्यवाणी कैसे करती हैं: चेहरे का स्थान, सिर की मुद्रा, और गaze स्कोर 0.75, 0.74, और 0.60, जबकि उनके संयोजन 0.91 तक पहुंच गया, जो – लेखकों का कहना है – कई संकेतों को एकीकृत करने के फायदे को उजागर करता है।

बोलते हुए मॉडल, जो लिप की दूरी पर केंद्रित था, मैन्युअल रूप से लेबल किए गए परीक्षण सेट पर 0.97 का आरओसी-एयूसी हासिल किया, और स्वचालित रूप से लेबल वाले बड़े डेटासेट पर 0.96, जो दोनों पर स्थिर प्रदर्शन को इंगित करता है।

यawns मॉडल ने मुंह के पहलू अनुपात का उपयोग करके 96.6 प्रतिशत का आरओसी-एयूसी हासिल किया, जो एएफडीएफएक्स 2.0 से क्रिया इकाई की भविष्यवाणियों के साथ संयुक्त होने पर 97.5 प्रतिशत तक सुधारित हुआ।

अनदेखी स्क्रीन मॉडल ने तब भविष्यवाणी की जब एएफडीएफएक्स 2.0 और स्मार्टआई दोनों एक से अधिक सेकंड के लिए एक चेहरे का पता नहीं लगा सके। इस का मूल्यांकन करने के लिए, लेखकों ने वास्तविक विचलित डेटासेट में सभी ऐसे कोई-चेहरा घटनाओं को मैन्युअल रूप से एनोटेट किया, जिसमें प्रत्येक सक्रियण के अंतर्निहित कारण की पहचान की। अस्पष्ट मामलों (जैसे कैमरा अवरोध या वीडियो विकृति) को विश्लेषण से बाहर रखा गया था।

नीचे दिखाए गए परिणामों के अनुसार, केवल 27 प्रतिशत ‘कोई-चेहरा’ सक्रियण के कारण उपयोगकर्ता शारीरिक रूप से स्क्रीन से दूर चले गए थे।

कुछ मामलों में चेहरा नहीं मिलने के विभिन्न कारण प्राप्त हुए।

कुछ मामलों में चेहरा नहीं मिलने के विभिन्न कारण प्राप्त हुए।

पेपर कहता है:

‘हालांकि अनदेखी स्क्रीन केवल 27% मामलों में ‘कोई-चेहरा’ संकेत को ट्रिगर करती है, यह अन्य कारणों से सक्रिय होती है जो असावधानी की ओर इशारा करती है, जैसे कि प्रतिभागी एक अत्यधिक कोण के साथ स्क्रीन से दूर देखते हैं, अत्यधिक गति करते हैं, या एक वस्तु/हाथ के साथ अपना चेहरा महत्वपूर्ण रूप से अवरुद्ध करते हैं। ‘

अंतिम गुणात्मक परीक्षण दौर में, लेखकों ने मूल्यांकन किया कि विभिन्न विचलित संकेतों को जोड़ने से उनके ध्यान मॉडल के समग्र प्रदर्शन पर क्या प्रभाव पड़ता है – ऑफ-स्क्रीन गaze (गaze और सिर की मुद्रा के माध्यम से), उनींदापन, बोलते हुए, और अनदेखी स्क्रीन।

परीक्षण दो डेटासेट पर किए गए थे: वास्तविक विचलित डेटासेट और गaze डेटासेट का एक परीक्षण उपसेट। जी-मीन और एफ 1 स्कोर का उपयोग प्रदर्शन को मापने के लिए किया गया था (हालांकि उनींदापन और बोलते हुए को गaze डेटासेट विश्लेषण से बाहर रखा गया था, क्योंकि वे इस संदर्भ में सीमित प्रासंगिकता थे)।

जैसा कि नीचे दिखाया गया है, ध्यान का पता लगाने में सुधार हुआ जब अधिक विचलित संकेत जोड़े गए, ऑफ-स्क्रीन गaze सबसे मजबूत बेसलाइन प्रदान करता है।

वास्तुकला में विभिन्न विचलित संकेतों को जोड़ने का प्रभाव।

वास्तुकला में विभिन्न विचलित संकेतों को जोड़ने का प्रभाव।

इन परिणामों के बारे में, पेपर कहता है:

‘हम पहले निष्कर्ष निकाल सकते हैं कि सभी विचलित संकेतों का एकीकरण ध्यान का पता लगाने में योगदान देता है।

‘दूसरा, ध्यान का पता लगाने में सुधार दोनों डेस्कटॉप और मोबाइल डिवाइस पर सुसंगत है। तीसरा, वास्तविक डेटासेट में मोबाइल सत्र में गaze दूर दूर देखने पर महत्वपूर्ण सिर आंदोलन होते हैं, जो मोबाइल डिवाइस के लिए डेस्कटॉप की तुलना में उच्च प्रदर्शन की ओर ले जाते हैं। चौथा, दrowsiness संकेत का जोड़ना अन्य संकेतों की तुलना में अपेक्षाकृत मामूली सुधार प्रदान करता है, क्योंकि यह आमतौर पर दुर्लभ होता है। ‘

‘अंत में, अनदेखी स्क्रीन संकेत मोबाइल डिवाइस पर डेस्कटॉप की तुलना में अपेक्षाकृत बड़ा सुधार प्रदान करता है, क्योंकि मोबाइल डिवाइस को आसानी से अनदेखा किया जा सकता है।’

लेखकों ने अपने मॉडल की तुलना एएफडीएफएक्स 1.0 से की, एक पूर्व प्रणाली जो विज्ञापन परीक्षण में उपयोग की जाती थी – और यहां तक कि वर्तमान मॉडल का सिर-आधारित गaze पता लगाने ने दोनों डिवाइस प्रकारों पर एएफडीएफएक्स 1.0 को पार किया:

‘यह सुधार उनींदापन और सिर की मुद्रा दोनों दिशाओं में आंदोलनों को एकीकृत करने का परिणाम है, साथ ही सिर की मुद्रा को मामूली परिवर्तनों के लिए खाता बनाने के लिए सामान्यीकरण। वास्तविक मोबाइल डेटासेट में प्रमुख सिर आंदोलनों ने हमारे सिर मॉडल को एएफडीएफएक्स 1.0 के समान प्रदर्शन करने का कारण बना।’

लेखकों ने पेपर को एक गुणात्मक परीक्षण दौर के साथ बंद किया, जो नीचे दिखाया गया है।

विभिन्न विचलित करने वालों के लिए सच्चे और झूठे सकारात्मक उदाहरणों को प्रदर्शित करने वाले ध्यान मॉडल के आउटपुट के नमूने।

विभिन्न विचलित करने वालों के लिए सच्चे और झूठे सकारात्मक उदाहरणों को प्रदर्शित करने वाले ध्यान मॉडल के आउटपुट के नमूने।

लेखकों का कहना है:

‘परिणाम यह दर्शाते हैं कि हमारा मॉडल अनियंत्रित सेटिंग्स में विभिन्न विचलित करने वालों का प्रभावी ढंग से पता लगाता है। हालांकि, यह कुछ किनारे के मामलों में झूठे सकारात्मक उत्पन्न कर सकता है, जैसे कि गaze पर बने हुए स्क्रीन पर गंभीर सिर झुकाव, कुछ मुंह अवरोधन, अत्यधिक धुंधली आंखें, या भारी रूप से अंधेरे चेहरे की छवियां। ‘

निष्कर्ष

जबकि परिणाम पिछले कार्यों पर एक संतुलित लेकिन महत्वपूर्ण प्रगति का प्रतिनिधित्व करते हैं, इस अध्ययन का गहरा मूल्य दर्शक की आंतरिक स्थिति तक पहुंचने के लिए लगातार प्रयास में निहित है।

हालांकि डेटा सूचित सहमति के साथ एकत्र किया गया था, विधि भविष्य के ढांचे की ओर इशारा करती है जो संरचित, बाजार अनुसंधान सेटिंग्स से परे फैल सकती है।

यह थोड़ा परानoid निष्कर्ष केवल इस विशेष शोध शाखा की संरक्षित, सीमित और सुरक्षित प्रकृति से और मजबूत होता है।

 

* लेखकों के इनलाइन उद्धरणों को हाइपरलिंक में परिवर्तित करने के लिए मेरा रूपांतरण।

बुधवार, 9 अप्रैल, 2025 को पहली बार प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai