Anderson का एंगल

मशीन लर्निंग के साथ बॉडी पोज़ से आंख से संपर्क का पता लगाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

फ्रांस और स्विट्जरलैंड के शोधकर्ताओं ने एक कंप्यूटर विजन सिस्टम विकसित किया है जो किसी व्यक्ति के सीधे ‘इगो’ कैमरे की ओर देखने का अनुमान लगा सकता है, केवल व्यक्ति के खड़े होने या चलने के तरीके के आधार पर।

नया फ्रेमवर्क इस आकलन के लिए बहुत कम जानकारी का उपयोग करता है, जो चेहरे की तस्वीरों में आंखों की स्थिति का विश्लेषण करने के बजाय सेमांटिक कीपॉइंट्स (नीचे दी गई तस्वीर देखें) के रूप में है। यह परिणामी पता लगाने की विधि को बहुत हल्का और लचीला बनाता है, डेटा-गहन वस्तु पता लगाने वाले वास्तुकला जैसे YOLO की तुलना में।

नया फ्रेमवर्क मूल्यांकन करता है कि सड़क पर एक व्यक्ति कैमरे की ओर देख रहा है या नहीं, केवल उनके शरीर की स्थिति के आधार पर। यहां, हरे रंग में हाइलाइट किए गए लोग कैमरे की ओर देखने की संभावना है, जबकि लाल रंग में हाइलाइट किए गए लोग दूर देखने की संभावना है। स्रोत: https://arxiv.org/pdf/2112.04212.pdf

नया फ्रेमवर्क मूल्यांकन करता है कि सड़क पर एक व्यक्ति कैमरे की ओर देख रहा है या नहीं, केवल उनके शरीर की स्थिति के आधार पर। यहां, हरे रंग में हाइलाइट किए गए लोग कैमरे की ओर देखने की संभावना है, जबकि लाल रंग में हाइलाइट किए गए लोग दूर देखने की संभावना है। स्रोत: https://arxiv.org/pdf/2112.04212.pdf

हालांकि यह काम स्वायत्त वाहनों के लिए बेहतर सुरक्षा प्रणालियों के विकास से प्रेरित है, नए पत्र के लेखक स्वीकार करते हैं कि इसका उपयोग अन्य उद्योगों में भी किया जा सकता है, यह देखते हुए कि ‘यहां तक कि स्मार्ट शहरों में, आंख से संपर्क का पता लगाना पैदल यात्रियों के व्यवहार को बेहतर ढंग से समझने के लिए उपयोगी हो सकता है, उदाहरण के लिए, उनका ध्यान कहां है या वे किस सार्वजनिक संकेत को देख रहे हैं’

इस प्रणाली और इसके बाद की प्रणालियों के विकास को आगे बढ़ाने के लिए, शोधकर्ताओं ने एक नई और व्यापक डेटासेट तैयार की है जिसे LOOK कहा जाता है, जो स्वायत्त वाहन के रोविंग कैमरे से देखी जाने वाली सड़क दृश्यों या रोबोट द्वारा नेविगेट की जाने वाली भीड़ के दृश्यों जैसे मनमाने दृश्यों में आंख से संपर्क का पता लगाने की विशिष्ट चुनौतियों को सीधे संबोधित करता है।

फ्रेमवर्क के परिणाम, जिसमें 'देखने वाले' लोग हरे रंग में चिह्नित हैं।

फ्रेमवर्क के परिणाम, जिसमें ‘देखने वाले’ लोग हरे रंग में चिह्नित हैं।

इस शोध का शीर्षक क्या पैदल यात्री ध्यान देते हैं? जंगल में आंख से संपर्क का पता लगाना है, और स्विट्जरलैंड में विजुअल इंटेलिजेंस फॉर ट्रांसपोर्टेशन (वीआईटीए) शोध पहल के चार शोधकर्ताओं और सोरबोन यूनिवर्सिटी में एक शोधकर्ता से आया है।

वास्तुकला

इस क्षेत्र में अधिकांश पिछला काम ड्राइवर का ध्यान केंद्रित करने पर केंद्रित रहा है, जिसमें ड्राइवर का सामना करने वाले कैमरे के आउटपुट का विश्लेषण करने के लिए मशीन लर्निंग का उपयोग किया जाता है, और एक निरंतर, निश्चित और करीबी दृश्य पर निर्भर करता है – एक विलासिता जो अक्सर कम-रिज़ॉल्यूशन वाले सार्वजनिक टीवी कैमरों में उपलब्ध नहीं होती है, जहां लोग इतने दूर हो सकते हैं कि चेहरे की विश्लेषण प्रणाली उनकी आंखों की स्थिति को हल नहीं कर सकती है, और जहां अन्य अवरोध (जैसे धूप के चश्मे) भी बाधा डालते हैं।

परियोजना के उद्देश्य के लिए अधिक केंद्रीय, स्वायत्त वाहनों में बाहर की ओर देखने वाले कैमरे भी आवश्यक रूप से एक आदर्श परिदृश्य में नहीं होंगे, जो ‘निम्न-स्तर’ कीपॉइंट जानकारी को एक दृष्टि-विश्लेषण फ्रेमवर्क के आधार के रूप में आदर्श बनाता है। स्वायत्त वाहन प्रणालियों को एक उच्च प्रतिक्रिया और तेज़ तरीके से समझने की आवश्यकता है कि क्या एक पैदल यात्री – जो सड़क पर कार के रास्ते में कदम रख सकता है – ने एवी को देखा है। ऐसे परिदृश्य में, विलंबता जीवन और मृत्यु के बीच का अंतर हो सकता है।

शोधकर्ताओं द्वारा विकसित मॉड्यूलर वास्तुकला एक व्यक्ति की एक (आमतौर पर) पूर्ण-शरीर की तस्वीर लेती है, जिससे 2डी जोड़ निकाले जाते हैं और एक आधार, कंकाल रूप में निकाले जाते हैं।

नया फ्रांसीसी-स्विस आंख से संपर्क का पता लगाने वाली प्रणाली की वास्तुकला।

नया फ्रांसीसी-स्विस आंख से संपर्क का पता लगाने वाली प्रणाली की वास्तुकला।

मुद्रा को वाई अक्ष पर जानकारी को हटाने के लिए सामान्यीकृत किया जाता है, जिससे मुद्रा का ‘सपाट’ प्रतिनिधित्व बनता है जो इसे उन हजारों ज्ञात मुद्राओं के साथ समानता में लाता है जिन्हें अल्गोरिदम ने सीखा है (जिन्हें भी ‘सपाट’ किया गया है), और उनके साथ जुड़े बाइनरी फ्लैग/लेबल (अर्थात 0: नहीं देख रहे या 1: देख रहे)।

मुद्रा की तुलना अल्गोरिदम के आंतरिक ज्ञान से की जाती है कि यह मुद्रा कितनी अच्छी तरह से उन अन्य पैदल यात्रियों की तस्वीरों से मेल खाती है जिन्हें ‘कैमरे की ओर देखने’ के रूप में पहचाना गया है – जो एनोटेशन लेखकों द्वारा विकसित किए गए कस्टम ब्राउज़र टूल का उपयोग करके अमेज़न मैकेनिकल टर्क कार्यकर्ताओं द्वारा किए गए हैं जिन्होंने LOOK डेटासेट के विकास में भाग लिया था।

LOOK में प्रत्येक छवि की चार AMT कार्यकर्ताओं द्वारा जांच की गई, और केवल उन छवियों को ही अंतिम संग्रह में शामिल किया गया जहां चार में से तीन कार्यकर्ता परिणाम पर सहमत हुए।

सिर की फसल की जानकारी, जो पिछले अधिकांश कार्यों का मुख्य हिस्सा है, मनमाने शहरी परिदृश्यों में दृष्टि का सबसे कम विश्वसनीय संकेतक है, और जहां कैप्चर की गुणवत्ता और कवरेज पर्याप्त है वहां वास्तुकला में एक वैकल्पिक डेटा प्रवाह के रूप में शामिल किया गया है। बहुत दूर के लोगों के मामले में, यह जानकारी उपयोगी नहीं होगी।

डेटा

शोधकर्ताओं ने LOOK को कई पूर्व डेटासेट से व्युत्पन्न किया है जो डिफ़ॉल्ट रूप से इस कार्य के लिए उपयुक्त नहीं हैं। इस परियोजना के दायरे को साझा करने वाले केवल दो डेटासेट हैं JAAD और PIE, और प्रत्येक में सीमाएं हैं।

JAAD टोरंटो में यॉर्क विश्वविद्यालय से 2017 का एक प्रस्ताव है, जिसमें 390,000 लेबल वाले पैदल यात्री उदाहरण शामिल हैं, जिनमें बाउंडिंग बॉक्स और व्यवहार एनोटेशन शामिल हैं। इनमें से, केवल 17,000 को ड्राइवर की ओर देखने (अर्थात ईगो कैमरा) के रूप में लेबल किया गया है। डेटासेट में 346 30fps क्लिप शामिल हैं जो उत्तरी अमेरिका और यूरोप में रिकॉर्ड की गई ऑन-बोर्ड कैमरा फुटेज के 5-10 सेकंड के हिस्से हैं। JAAD में दोहराव की उच्च घटना है, और अनोखे पैदल यात्रियों की कुल संख्या केवल 686 है।

हाल ही में (2019) PIE, टोरंटो में यॉर्क विश्वविद्यालय से, JAAD के समान है, जिसमें ऑन-बोर्ड 30fps फुटेज शामिल है, यह बारी में डाउनटाउन टोरंटो में छह घंटे की ड्राइविंग से प्राप्त होता है, जो 700,000 एनोटेट पैदल यात्रियों और 1,842 अनोखे पैदल यात्रियों को पैदा करता है, जिनमें से केवल 180 कैमरे की ओर देख रहे हैं।

इसके बजाय, नए पत्र के शोधकर्ताओं ने तीन पूर्व स्वायत्त ड्राइविंग डेटासेट से सबसे उपयुक्त डेटा संकलित किया है: KITTI, JRDB, और NuScenes, क्रमशः जर्मनी में कर्ल्स्रुहे इंस्टीट्यूट ऑफ टेक्नोलॉजी, ऑस्ट्रेलिया में स्टैनफोर्ड और मोनाश विश्वविद्यालय, और एक बार एमआईटी स्पिन-ऑफ न्यूटोमी।

इस संकलन के परिणामस्वरूप चार शहरों – बोस्टन, सिंगापुर, ट्यूबिंगेन और पालो अल्टो से एक व्यापक रूप से विविध सेट कैप्चर हुआ। लगभग 8000 लेबल वाले पैदल यात्री दृष्टिकोण के साथ, लेखकों का तर्क है कि LOOK ‘जंगल में’ आंख से संपर्क का पता लगाने के लिए सबसे विविध डेटासेट है।

प्रशिक्षण और परिणाम

निकासी, प्रशिक्षण और मूल्यांकन सभी एक एकल NVIDIA GeForce GTX 1080ti पर किए गए थे, जिसमें 11gb का VRAM था, जो 3.20GHz पर चलने वाले Intel Core i7-8700 CPU पर संचालित था।

लेखकों ने पाया कि न केवल उनकी विधि SOTA बेसलाइन्स पर कम से कम 5% की सुधार करती है, बल्कि JAAD पर प्रशिक्षित मॉडल भी अज्ञात डेटा पर बहुत अच्छा सामान्यीकरण करते हैं, जिस परिदृश्य का परीक्षण विभिन्न डेटासेट को मिलाने से किया जाता है।

चूंकि परीक्षण जटिल था, और फसल-आधारित मॉडल (जबकि चेहरे का अलगाव और फसलिंग इस नए पहल की वास्तुकला का केंद्र नहीं है) के लिए प्रावधान करना आवश्यक था, इसलिए विस्तृत परिणामों के लिए पत्र देखें।

JAAD डेटासेट पर परीक्षण के लिए औसत सटीकता (AP) के प्रतिशत और पिक्सेल में बाउंडिंग बॉक्स की ऊंचाई के रूप में, लेखकों के परिणाम बोल्ड में।

JAAD डेटासेट पर परीक्षण के लिए औसत सटीकता (AP) के प्रतिशत और पिक्सेल में बाउंडिंग बॉक्स की ऊंचाई के रूप में, लेखकों के परिणाम बोल्ड में।

शोधकर्ताओं ने अपना कोड सार्वजनिक रूप से जारी किया है, डेटासेट यहां उपलब्ध है, और स्रोत कोड गिटहब पर है।

लेखक इस बात पर आशा व्यक्त करते हैं कि उनका काम इसे उन्होंने जिसे ‘महत्वपूर्ण लेकिन उपेक्षित विषय’ के रूप में वर्णित किया है, उसमें आगे के शोध प्रयासों को प्रेरित करेगा।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]