Anderson का एंगल
‘ओल्स और लिजार्ड्स’ की तलाश में एक विज्ञापनकर्ता के दर्शकों में

चूंकि ऑनलाइन विज्ञापन क्षेत्र का अनुमान है कि 2023 में 740.3 अरब अमेरिकी डॉलर का व्यय किया गया है, यह समझना आसान है कि विज्ञापन कंपनियां इस विशेष कंप्यूटर दृष्टि अनुसंधान की शाखा में क्यों महत्वपूर्ण संसाधनों का निवेश करती हैं।
हालांकि यह उद्योग संरक्षित और सुरक्षित है, यह कभी-कभी अध्ययन प्रकाशित करता है जो अधिक उन्नत प्रोप्राइटरी कार्य की ओर इशारा करते हैं – चेहरे और आंखों की दृष्टि की मान्यता में शामिल हैं, जिसमें आयु मान्यता भी शामिल है, जो जनसांख्यिकी विश्लेषण आंकड़ों के लिए केंद्रीय है:

एक विज्ञापन संदर्भ में एक विशिष्ट आयु वर्ग को लक्षित करने वाले विज्ञापनदाताओं के लिए एक विज्ञापन संदर्भ में आयु का अनुमान लगाना दिलचस्प है। इस प्रायोगिक उदाहरण में, बॉब डायलन की आयु को वर्षों में ट्रैक किया जाता है। स्रोत: https://arxiv.org/pdf/1906.03625
इन अध्ययनों में, जो शायद ही कभी सार्वजनिक भंडारों में दिखाई देते हैं, वास्तविक रूप से भर्ती किए गए प्रतिभागियों का उपयोग किया जाता है जो एआई-संचालित विश्लेषण के लिए आधार बनते हैं जो यह निर्धारित करने का प्रयास करता है कि दर्शक विज्ञापन के साथ कितना और किस तरह से जुड़ रहा है।

Dlib का हिस्टोग्राम ऑफ ओरिएंटेड ग्रेडिएंट्स (HoG) अक्सर चेहरे के अनुमान में प्रणालियों में उपयोग किया जाता है। स्रोत: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
जानवरों की प्रवृत्ति
इस संबंध में, स्वाभाविक रूप से, विज्ञापन उद्योग यह निर्धारित करने में रुचि रखता है कि झूठे सकारात्मक (उन अवसरों को जब एक विश्लेषणात्मक प्रणाली एक विषय की क्रियाओं को गलत तरीके से व्याख्या करती है) और यह स्थापित करने के लिए स्पष्ट मानदंड कि व्यक्ति जो उनके वाणिज्यिक देख रहा है पूरी तरह से सामग्री के साथ जुड़ नहीं रहा है।
स्क्रीन-आधारित विज्ञापन के संबंध में, अध्ययन दो समस्याओं पर ध्यान केंद्रित करते हैं जो दो वातावरण में होते हैं। वातावरण ‘डेस्कटॉप’ या ‘मोबाइल’ हैं, प्रत्येक की अपनी विशिष्ट विशेषताएं हैं जिनके लिए विशिष्ट ट्रैकिंग समाधानों की आवश्यकता होती है; और समस्याएं – विज्ञापनदाता के दृष्टिकोण से – ओल और लिजार्ड व्यवहार द्वारा प्रतिनिधित्व की जाती हैं – एक दर्शक की प्रवृत्ति जो उनके सामने विज्ञापन पर पूरा ध्यान नहीं देता है।

एक विज्ञापन अनुसंधान परियोजना के विषय में ‘ओल’ और ‘लिजार्ड’ व्यवहार के उदाहरण। स्रोत: https://arxiv.org/pdf/1508.04028
यदि आप अपने सिर के साथ विज्ञापन से दूर देख रहे हैं, तो यह ‘ओल’ व्यवहार है; यदि आपका सिर की मुद्रा स्थिर है लेकिन आपकी आंखें स्क्रीन से दूर जा रही हैं, तो यह ‘लिजार्ड’ व्यवहार है। विज्ञापनों के परीक्षण के लिए विश्लेषण और नियंत्रित परिस्थितियों में, ये आवश्यक क्रियाएं हैं जिन्हें एक प्रणाली को पकड़ने में सक्षम होना चाहिए।
स्मार्टआई के अफेक्टिवा अधिग्रहण से एक नई पेपर इन मुद्दों को संबोधित करती है, जो मौजूदा फ्रेमवर्क का लाभ उठाने के लिए एक वास्तुकला प्रदान करती है ताकि सभी आवश्यक स्थितियों और संभावित प्रतिक्रियाओं में एक संयुक्त और संक्षिप्त सुविधा सेट प्रदान किया जा सके – और यह निर्धारित करने में सक्षम हो कि क्या एक दर्शक ऊब गया है, जुड़ा हुआ है, या किसी तरह से सामग्री से दूर है जिसे विज्ञापनदाता उन्हें देखना चाहता है।

विभिन्न विचलित संकेतों के लिए डेस्कटॉप और मोबाइल उपकरणों के लिए नए ध्यान प्रणाली द्वारा पता लगाए गए सच्चे और झूठे सकारात्मक उदाहरण। स्रोत: https://arxiv.org/pdf/2504.06237
लेखक कहते हैं*:
‘सीमित अनुसंधान ने ऑनलाइन विज्ञापनों के दौरान ध्यान की निगरानी में खुद को व्यस्त किया है। जबकि इन अध्ययनों ने झूठी गaze की पहचान करने के लिए सिर की मुद्रा या गaze दिशा का अनुमान लगाने पर ध्यान केंद्रित किया, उन्होंने महत्वपूर्ण मापदंडों जैसे कि डिवाइस प्रकार (डेस्कटॉप या मोबाइल), कैमरा प्लेसमेंट स्क्रीन के सापेक्ष, और स्क्रीन आकार को नजरअंदाज कर दिया। ये कारक ध्यान का पता लगाने को महत्वपूर्ण रूप से प्रभावित करते हैं। ‘
‘इस पत्र में, हम एक ध्यान का पता लगाने के लिए एक वास्तुकला का प्रस्ताव करते हैं जो विभिन्न विचलित करने वालों का पता लगाने को शामिल करता है, जिसमें दोनों ऑफ-स्क्रीन गaze और लिजार्ड व्यवहार शामिल हैं – स्क्रीन से दूर देखने की प्रवृत्ति। ‘
‘पिछले दृष्टिकोणों के विपरीत, हमारी विधि डिवाइस-विशिष्ट विशेषताओं जैसे कि डिवाइस प्रकार, कैमरा प्लेसमेंट, स्क्रीन आकार (डेस्कटॉप के लिए) और कैमरा अभिविन्यास (मोबाइल डिवाइस के लिए) को कच्चे गaze अनुमान के साथ एकीकृत करती है ताकि ध्यान का पता लगाने की सटीकता में सुधार किया जा सके।’
नई काम शीर्षक है ऑनलाइन विज्ञापनों के दौरान दर्शक का ध्यान, और चार शोधकर्ताओं से आता है अफेक्टिवा में।
विधि और डेटा
मुख्य रूप से इस प्रकार की प्रणालियों की गोपनीयता और बंद-स्रोत प्रकृति के कारण, नई पेपर लेखकों के दृष्टिकोण की तुलना प्रतिद्वंद्वियों के साथ सीधे तौर पर नहीं करती है, बल्कि अपने निष्कर्षों को केवल ablation अध्ययन के रूप में प्रस्तुत करती है; न ही पेपर सामान्य कंप्यूटर दृष्टि साहित्य के सामान्य प्रारूप का पालन करता है। इसलिए, हम इस शोध को उस रूप में देखेंगे जैसा यह प्रस्तुत किया गया है।
लेखकों का कहना है कि केवल एक सीमित संख्या में अध्ययनों ने विशेष रूप से ऑनलाइन विज्ञापनों के संदर्भ में ध्यान का पता लगाने को संबोधित किया है। एएफडीएफएक्स एसडीके में, जो वास्तविक समय में बहु-चेहरे पहचान प्रदान करता है, ध्यान केवल सिर की मुद्रा से अनुमानित है, जिसमें प्रतिभागियों को उनके सिर के कोण एक निर्धारित सीमा से अधिक होने पर असावधानी से लेबल किया जाता है।

एक अफेक्टिवा प्रणाली से एक उदाहरण जो सिर की मुद्रा पर ध्यान के संकेतक के रूप में निर्भर करता है। स्रोत: https://www.youtube.com/watch?v=c2CWb5jHmbY
2019 के सहयोग वीडियो सामग्री के लिए गहरे शिक्षण का उपयोग करके दृश्य ध्यान का स्वचालित माप में, लगभग 28,000 प्रतिभागियों के एक डेटासेट को विभिन्न असावधानी व्यवहार के लिए एनोटेट किया गया था, जिसमें दूर देखना, आंखें बंद करना, या अन्य गतिविधियों में शामिल होना शामिल था, और एक सीएनएन-एलएसटीएम मॉडल को ध्यान का पता लगाने के लिए चेहरे की उपस्थिति से प्रशिक्षित किया गया था।

2019 के पेपर से, एक उदाहरण जो एक स्क्रीन पर वीडियो सामग्री देखने वाले दर्शक के लिए अनुमानित ध्यान राज्यों को दर्शाता है। स्रोत: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
हालांकि, लेखकों का कहना है कि इन पहले के प्रयासों ने डिवाइस-विशिष्ट कारकों के लिए खाता नहीं बनाया, जैसे कि प्रतिभागी डेस्कटॉप या मोबाइल डिवाइस का उपयोग कर रहा था या नहीं; न ही उन्होंने स्क्रीन आकार या कैमरा प्लेसमेंट पर विचार किया। इसके अलावा, एएफडीएफएक्स प्रणाली केवल गaze विचलित करने पर ध्यान केंद्रित करती है, और अन्य विचलित करने वालों को छोड़ देती है, जबकि 2019 का काम एक व्यापक सेट का पता लगाने का प्रयास करता है – लेकिन इसका एकल छोटा सीएनएन का उपयोग इस कार्य के लिए अपर्याप्त हो सकता है।
लेखकों का कहना है कि इस रेखा में सबसे लोकप्रिय अनुसंधान विज्ञापन परीक्षण के लिए अनुकूलित नहीं है, जिसकी तुलना में डोमेन जैसे ड्राइविंग या शिक्षा में अलग-अलग आवश्यकताएं हैं – जहां कैमरा प्लेसमेंट और कैलिब्रेशन आमतौर पर पहले से तय होते हैं, इसके बजाय अनकैलिब्रेटेड सेटअप पर निर्भर करते हैं, और डेस्कटॉप और मोबाइल डिवाइस की सीमित गaze सीमा के भीतर संचालित होते हैं।
इसलिए उन्होंने ऑनलाइन विज्ञापनों के दौरान दर्शक का ध्यान का पता लगाने के लिए एक वास्तुकला तैयार की है, जो दो व्यावसायिक टूलकिट का लाभ उठाती है: एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके।

एएफडीएफएक्स 2.0 से चेहरे के विश्लेषण के उदाहरण। स्रोत: https://arxiv.org/pdf/2202.12059
इन पूर्व कार्यों में निम्न-स्तरीय विशेषताएं निकाली जाती हैं, जैसे कि चेहरे के भाव, सिर की मुद्रा, और गaze दिशा – एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके के माध्यम से निकाली जाती हैं। इन विशेषताओं को तब उच्च-स्तरीय संकेतकों में परिवर्तित किया जाता है, जिसमें गaze स्थिति स्क्रीन पर, यawns, और बोलते हुए शामिल हैं।
प्रणाली चार प्रकार के विचलित करने वालों की पहचान करती है: ऑफ-स्क्रीन गaze; उनींदापन; बोलते हुए; और अनदेखी स्क्रीन। यह गaze विश्लेषण को भी समायोजित करता है कि दर्शक डेस्कटॉप या मोबाइल डिवाइस पर है या नहीं।
डेटासेट: गaze
लेखकों ने ध्यान का पता लगाने वाली प्रणाली को शक्तिशाली बनाने और मूल्यांकन करने के लिए चार डेटासेट का उपयोग किया: तीन गaze व्यवहार, बोलते हुए, और यawns पर व्यक्तिगत रूप से ध्यान केंद्रित करते हैं; और एक चौथा वास्तविक दुनिया के विज्ञापन परीक्षण सत्र से निकाला गया, जिसमें विभिन्न प्रकार के विचलित करने वाले शामिल थे।
काम की विशिष्ट आवश्यकताओं के कारण, प्रत्येक श्रेणी के लिए कस्टम डेटासेट बनाए गए थे। सभी डेटासेट एक प्रोप्राइटरी रिपॉजिटरी से संकलित किए गए थे जिसमें लाखों रिकॉर्ड किए गए सत्र थे जिसमें प्रतिभागियों ने घर या कार्यस्थल वातावरण में विज्ञापन देखे थे, एक वेब-आधारित सेटअप के साथ, सूचित सहमति के साथ – और उन सहमति समझौतों की सीमाओं के कारण, लेखकों का कहना है कि नए काम के लिए डेटासेट को सार्वजनिक रूप से उपलब्ध नहीं किया जा सकता है।
गaze डेटासेट का निर्माण करने के लिए, प्रतिभागियों को विभिन्न बिंदुओं पर स्क्रीन के चारों ओर एक चलती बिंदु का पालन करने के लिए कहा गया था, जिसमें इसके किनारे भी शामिल थे, और फिर स्क्रीन से दूर देखने के लिए चार दिशाओं में (ऊपर, नीचे, बाएं और दाएं) क्रम को तीन बार दोहराया जाता था। इस प्रकार, कैप्चर और कवरेज के बीच संबंध स्थापित किया गया था:

डेस्कटॉप (ए) और मोबाइल (बी) डिवाइस पर गaze वीडियो उत्तेजना के स्क्रीनशॉट। पहले और तीसरे फ्रेम में एक चलती बिंदु का पालन करने के निर्देश दिए गए हैं, जबकि दूसरे और चौथे फ्रेम में स्क्रीन से दूर देखने के लिए प्रतिभागियों को प्रॉम्प्ट किया जाता है।
चलती बिंदु के खंडों को सावधान के रूप में लेबल किया गया था, और ऑफ-स्क्रीन खंडों को असावधान के रूप में लेबल किया गया था, जिससे दोनों सकारात्मक और नकारात्मक उदाहरणों का एक लेबल डेटासेट तैयार हुआ।
प्रत्येक वीडियो लगभग 160 सेकंड तक चला, डेस्कटॉप और मोबाइल प्लेटफ़ॉर्म दोनों के लिए अलग-अलग संस्करणों के साथ, जिनमें क्रमशः 1920×1080 और 608×1080 के रिज़ॉल्यूशन थे।
कुल 609 वीडियो एकत्र किए गए, जिनमें 322 डेस्कटॉप और 287 मोबाइल रिकॉर्डिंग शामिल थीं। लेबल्स को स्वचालित रूप से वीडियो सामग्री के आधार पर लागू किया गया था, और डेटासेट विभाजित 158 प्रशिक्षण नमूनों और 451 परीक्षण के लिए किया गया था।
डेटासेट: बोलते हुए
इस संदर्भ में, असावधानी की परिभाषा करने वाले मानदंडों में से एक यह है कि जब कोई व्यक्ति एक से अधिक सेकंड के लिए बोलता है (जो एक क्षणिक टिप्पणी हो सकती है, या यहां तक कि एक खांसी भी)।
चूंकि नियंत्रित वातावरण ऑडियो को रिकॉर्ड या विश्लेषण नहीं करता है, बोलते हुए का अनुमान आंतरिक चेहरे की भूमिका के अनुमानित आंदोलन को देखकर लगाया जाता है। इसलिए, बिना ऑडियो के बोलते हुए का पता लगाने के लिए, लेखकों ने अपने आंतरिक भंडार से पूरी तरह से दृश्य इनपुट पर आधारित एक डेटासेट बनाया, जिसे दो भागों में विभाजित किया गया था: पहले में लगभग 5,500 वीडियो थे, जिनमें से प्रत्येक को तीन अनnotators द्वारा बोलते हुए या नहीं बोलते हुए के रूप में मैन्युअल रूप से लेबल किया गया था (इनमें से 4,400 का उपयोग प्रशिक्षण और मान्यकरण के लिए किया गया था, और 1,100 का उपयोग परीक्षण के लिए किया गया था)।
दूसरे में 16,000 सत्र थे, जिन्हें सत्र प्रकार के आधार पर स्वचालित रूप से लेबल किया गया था: 10,500 में प्रतिभागियों को शांति से विज्ञापन देखते हुए दिखाया गया था, और 5,500 में प्रतिभागियों को ब्रांडों के बारे में अपने विचार व्यक्त करते हुए दिखाया गया था।
डेटासेट: यawns
हालांकि कुछ ‘यawns’ डेटासेट मौजूद हैं, जिनमें YawDD और ड्राइवर थकान शामिल हैं, लेखकों का कहना है कि विज्ञापन परीक्षण परिदृश्यों के लिए कोई भी उपयुक्त नहीं है – क्योंकि वे या तो सिम्युलेटेड यawns की विशेषता है, या चेहरे की विकृति है जो भय या अन्य, गैर-यawns क्रियाओं के साथ भ्रमित हो सकती है।
इसलिए, लेखकों ने अपने आंतरिक संग्रह से 735 वीडियो का उपयोग किया, जिन सत्रों में जॉ ड्रॉप शामिल था जो एक से अधिक सेकंड तक चला था। प्रत्येक वीडियो को तीन अनnotators द्वारा मैन्युअल रूप से सक्रिय या निष्क्रिय यawns के रूप में लेबल किया गया था। केवल 2.6 प्रतिशत फ्रेम में सक्रिय यawns शामिल थे, जो वर्ग असंतुलन को रेखांकित करता है, और डेटासेट को 670 प्रशिक्षण वीडियो और 65 परीक्षण के लिए विभाजित किया गया था।
डेटासेट: विचलित
विचलित करने वाला डेटासेट भी लेखकों के विज्ञापन परीक्षण रिपॉजिटरी से निकाला गया था, जहां प्रतिभागियों ने वास्तविक विज्ञापन देखे थे जिनके लिए कोई कार्य सौंपा नहीं गया था। कुल 520 सत्र (193 मोबाइल और 327 डेस्कटॉप वातावरण में) को यादृच्छिक रूप से चुना गया और तीन अनnotators द्वारा मैन्युअल रूप से सावधान या असावधान के रूप में लेबल किया गया था।
असावधानी व्यवहार में ऑफ-स्क्रीन गaze, बोलते हुए, उनींदापन, और अनदेखी स्क्रीन शामिल थे। सत्र विश्व भर के विभिन्न क्षेत्रों में फैले हुए थे, डेस्कटॉप रिकॉर्डिंग अधिक सामान्य थी क्योंकि वेबकैम प्लेसमेंट लचीला था।
ध्यान मॉडल
प्रस्तावित ध्यान मॉडल निम्न-स्तरीय दृश्य विशेषताओं को संसाधित करता है, जिनमें चेहरे के भाव, सिर की मुद्रा, और गaze दिशा शामिल हैं – एएफडीएफएक्स 2.0 और स्मार्टआई एसडीके के माध्यम से निकाली जाती हैं।
इन्हें उच्च-स्तरीय संकेतकों में परिवर्तित किया जाता है, जिसमें प्रत्येक विचलित करने वाले को एक अलग द्विआधारी वर्गीकारी द्वारा संभाला जाता है जो अपने डेटासेट पर स्वतंत्र रूप से प्रशिक्षित और मूल्यांकित किया जाता है।

प्रस्तावित निगरानी प्रणाली के लिए योजना।
गaze मॉडल स्क्रीन पर या दूर देखने का पता लगाने के लिए सामान्यीकृत गaze निर्देशांक का उपयोग करता है, डेस्कटॉप और मोबाइल डिवाइस दोनों के लिए अलग-अलग कैलिब्रेशन के साथ। इस प्रक्रिया में सहायता करने वाला एक रैखिक सपोर्ट वेक्टर मशीन (एसवीएम) है, जो स्थानिक और समयिक विशेषताओं पर प्रशिक्षित है, जो तेज़ गaze शिफ्ट को चिकना करने के लिए एक मेमोरी विंडो को एकीकृत करता है।
बिना ऑडियो के बोलते हुए का पता लगाने के लिए, प्रणाली ने मुंह के क्षेत्रों को फसल दिया और दोनों बातचीत और गैर-बातचीत वीडियो खंडों पर 3डी-सीएनएन को प्रशिक्षित किया। लेबल्स को सत्र प्रकार के आधार पर सौंपा गया था, जिसमें क्षणिक मुंह की गति से झूठे सकारात्मक को कम करने के लिए समयिक चिकनाई शामिल थी।
यawns का पता लगाने के लिए पूरे चेहरे की छवियों का उपयोग किया गया था, जो व्यापक चेहरे की गति को पकड़ने के लिए किया गया था, जिसमें मैन्युअल रूप से लेबल किए गए फ्रेमों पर 3डी-सीएनएन को प्रशिक्षित किया गया था (हालांकि कार्य को यawns की प्राकृतिक दृश्य में कम आवृत्ति और अन्य अभिव्यक्तियों के साथ इसकी समानता के कारण जटिल बना दिया गया था)।
स्क्रीन छोड़ना की पहचान एक फेस या अत्यधिक सिर की मुद्रा की अनुपस्थिति के माध्यम से की गई थी, जिसमें एक निर्णय पेड़ द्वारा भविष्यवाणी की गई थी।
अंतिम ध्यान स्थिति का निर्धारण एक निश्चित नियम का उपयोग करके किया गया था: यदि कोई भी मॉड्यूल असावधानी का पता लगाता है, तो दर्शक को असावधान के रूप में चिह्नित किया जाता है – एक दृष्टिकोण जो संवेदनशीलता को प्राथमिकता देता है, और डेस्कटॉप और मोबाइल संदर्भों के लिए अलग से समायोजित किया जाता है।
परीक्षण
जैसा कि पहले उल्लेख किया गया है, परीक्षण एक ablation विधि का पालन करते हैं, जहां घटकों को हटा दिया जाता है और परिणाम पर प्रभाव को नोट किया जाता है।

अध्ययन में पहचाने गए विभिन्न श्रेणियों के असावधानी का पता लगाना।
गaze मॉडल ने तीन मुख्य चरणों के माध्यम से ऑफ-स्क्रीन व्यवहार की पहचान की: कच्चे गaze अनुमानों को सामान्य करना, आउटपुट को ठीक करना, और डेस्कटॉप डिवाइस के लिए स्क्रीन आकार का अनुमान लगाना।
प्रत्येक घटक के महत्व को समझने के लिए, लेखकों ने उन्हें व्यक्तिगत रूप से हटा दिया और दो डेटासेट से 226 डेस्कटॉप और 225 मोबाइल वीडियो पर प्रदर्शन का मूल्यांकन किया। परिणाम, जी-मीन और एफ 1 स्कोर द्वारा मापा गया, नीचे दिखाया गया है:

व्यक्तिगत प्रसंस्करण चरणों को हटाने के साथ पूरे गaze मॉडल के प्रदर्शन को दर्शाने वाले परिणाम।
प्रत्येक मामले में, प्रदर्शन में गिरावट आई जब एक चरण को छोड़ दिया गया। डेस्कटॉप पर सामान्यीकरण विशेष रूप से मूल्यवान साबित हुआ, जहां कैमरा प्लेसमेंट अधिक भिन्न होता है।
अध्ययन ने यह भी मूल्यांकन किया कि दृश्य विशेषताएं मोबाइल कैमरा अभिविन्यास की भविष्यवाणी कैसे करती हैं: चेहरे का स्थान, सिर की मुद्रा, और गaze स्कोर 0.75, 0.74, और 0.60, जबकि उनके संयोजन 0.91 तक पहुंच गया, जो – लेखकों का कहना है – कई संकेतों को एकीकृत करने के फायदे को उजागर करता है।
बोलते हुए मॉडल, जो लिप की दूरी पर केंद्रित था, मैन्युअल रूप से लेबल किए गए परीक्षण सेट पर 0.97 का आरओसी-एयूसी हासिल किया, और स्वचालित रूप से लेबल वाले बड़े डेटासेट पर 0.96, जो दोनों पर स्थिर प्रदर्शन को इंगित करता है।
यawns मॉडल ने मुंह के पहलू अनुपात का उपयोग करके 96.6 प्रतिशत का आरओसी-एयूसी हासिल किया, जो एएफडीएफएक्स 2.0 से क्रिया इकाई की भविष्यवाणियों के साथ संयुक्त होने पर 97.5 प्रतिशत तक सुधारित हुआ।
अनदेखी स्क्रीन मॉडल ने तब भविष्यवाणी की जब एएफडीएफएक्स 2.0 और स्मार्टआई दोनों एक से अधिक सेकंड के लिए एक चेहरे का पता नहीं लगा सके। इस का मूल्यांकन करने के लिए, लेखकों ने वास्तविक विचलित डेटासेट में सभी ऐसे कोई-चेहरा घटनाओं को मैन्युअल रूप से एनोटेट किया, जिसमें प्रत्येक सक्रियण के अंतर्निहित कारण की पहचान की। अस्पष्ट मामलों (जैसे कैमरा अवरोध या वीडियो विकृति) को विश्लेषण से बाहर रखा गया था।
नीचे दिखाए गए परिणामों के अनुसार, केवल 27 प्रतिशत ‘कोई-चेहरा’ सक्रियण के कारण उपयोगकर्ता शारीरिक रूप से स्क्रीन से दूर चले गए थे।

कुछ मामलों में चेहरा नहीं मिलने के विभिन्न कारण प्राप्त हुए।
पेपर कहता है:
‘हालांकि अनदेखी स्क्रीन केवल 27% मामलों में ‘कोई-चेहरा’ संकेत को ट्रिगर करती है, यह अन्य कारणों से सक्रिय होती है जो असावधानी की ओर इशारा करती है, जैसे कि प्रतिभागी एक अत्यधिक कोण के साथ स्क्रीन से दूर देखते हैं, अत्यधिक गति करते हैं, या एक वस्तु/हाथ के साथ अपना चेहरा महत्वपूर्ण रूप से अवरुद्ध करते हैं। ‘
अंतिम गुणात्मक परीक्षण दौर में, लेखकों ने मूल्यांकन किया कि विभिन्न विचलित संकेतों को जोड़ने से उनके ध्यान मॉडल के समग्र प्रदर्शन पर क्या प्रभाव पड़ता है – ऑफ-स्क्रीन गaze (गaze और सिर की मुद्रा के माध्यम से), उनींदापन, बोलते हुए, और अनदेखी स्क्रीन।
परीक्षण दो डेटासेट पर किए गए थे: वास्तविक विचलित डेटासेट और गaze डेटासेट का एक परीक्षण उपसेट। जी-मीन और एफ 1 स्कोर का उपयोग प्रदर्शन को मापने के लिए किया गया था (हालांकि उनींदापन और बोलते हुए को गaze डेटासेट विश्लेषण से बाहर रखा गया था, क्योंकि वे इस संदर्भ में सीमित प्रासंगिकता थे)।
जैसा कि नीचे दिखाया गया है, ध्यान का पता लगाने में सुधार हुआ जब अधिक विचलित संकेत जोड़े गए, ऑफ-स्क्रीन गaze सबसे मजबूत बेसलाइन प्रदान करता है।

वास्तुकला में विभिन्न विचलित संकेतों को जोड़ने का प्रभाव।
इन परिणामों के बारे में, पेपर कहता है:
‘हम पहले निष्कर्ष निकाल सकते हैं कि सभी विचलित संकेतों का एकीकरण ध्यान का पता लगाने में योगदान देता है।
‘दूसरा, ध्यान का पता लगाने में सुधार दोनों डेस्कटॉप और मोबाइल डिवाइस पर सुसंगत है। तीसरा, वास्तविक डेटासेट में मोबाइल सत्र में गaze दूर दूर देखने पर महत्वपूर्ण सिर आंदोलन होते हैं, जो मोबाइल डिवाइस के लिए डेस्कटॉप की तुलना में उच्च प्रदर्शन की ओर ले जाते हैं। चौथा, दrowsiness संकेत का जोड़ना अन्य संकेतों की तुलना में अपेक्षाकृत मामूली सुधार प्रदान करता है, क्योंकि यह आमतौर पर दुर्लभ होता है। ‘
‘अंत में, अनदेखी स्क्रीन संकेत मोबाइल डिवाइस पर डेस्कटॉप की तुलना में अपेक्षाकृत बड़ा सुधार प्रदान करता है, क्योंकि मोबाइल डिवाइस को आसानी से अनदेखा किया जा सकता है।’
लेखकों ने अपने मॉडल की तुलना एएफडीएफएक्स 1.0 से की, एक पूर्व प्रणाली जो विज्ञापन परीक्षण में उपयोग की जाती थी – और यहां तक कि वर्तमान मॉडल का सिर-आधारित गaze पता लगाने ने दोनों डिवाइस प्रकारों पर एएफडीएफएक्स 1.0 को पार किया:
‘यह सुधार उनींदापन और सिर की मुद्रा दोनों दिशाओं में आंदोलनों को एकीकृत करने का परिणाम है, साथ ही सिर की मुद्रा को मामूली परिवर्तनों के लिए खाता बनाने के लिए सामान्यीकरण। वास्तविक मोबाइल डेटासेट में प्रमुख सिर आंदोलनों ने हमारे सिर मॉडल को एएफडीएफएक्स 1.0 के समान प्रदर्शन करने का कारण बना।’
लेखकों ने पेपर को एक गुणात्मक परीक्षण दौर के साथ बंद किया, जो नीचे दिखाया गया है।

विभिन्न विचलित करने वालों के लिए सच्चे और झूठे सकारात्मक उदाहरणों को प्रदर्शित करने वाले ध्यान मॉडल के आउटपुट के नमूने।
लेखकों का कहना है:
‘परिणाम यह दर्शाते हैं कि हमारा मॉडल अनियंत्रित सेटिंग्स में विभिन्न विचलित करने वालों का प्रभावी ढंग से पता लगाता है। हालांकि, यह कुछ किनारे के मामलों में झूठे सकारात्मक उत्पन्न कर सकता है, जैसे कि गaze पर बने हुए स्क्रीन पर गंभीर सिर झुकाव, कुछ मुंह अवरोधन, अत्यधिक धुंधली आंखें, या भारी रूप से अंधेरे चेहरे की छवियां। ‘
निष्कर्ष
जबकि परिणाम पिछले कार्यों पर एक संतुलित लेकिन महत्वपूर्ण प्रगति का प्रतिनिधित्व करते हैं, इस अध्ययन का गहरा मूल्य दर्शक की आंतरिक स्थिति तक पहुंचने के लिए लगातार प्रयास में निहित है।
हालांकि डेटा सूचित सहमति के साथ एकत्र किया गया था, विधि भविष्य के ढांचे की ओर इशारा करती है जो संरचित, बाजार अनुसंधान सेटिंग्स से परे फैल सकती है।
यह थोड़ा परानoid निष्कर्ष केवल इस विशेष शोध शाखा की संरक्षित, सीमित और सुरक्षित प्रकृति से और मजबूत होता है।
* लेखकों के इनलाइन उद्धरणों को हाइपरलिंक में परिवर्तित करने के लिए मेरा रूपांतरण।
बुधवार, 9 अप्रैल, 2025 को पहली बार प्रकाशित।












