Anderson का एंगल
दृष्टिहीनों के लिए मशीन लर्निंग के साथ मार्ग का नक्शा बनाना

जर्मनी से नए शोध में एक नावेल, जीपीयू-पावर्ड पोर्टेबल सिस्टम का प्रस्ताव दिया गया है जो दृष्टिहीन लोगों को वास्तविक दुनिया में नेविगेट करने में मदद करता है। यह सिस्टम वास्तविक समय कंप्यूटर विजन फ्रेमवर्क में एक मुख्य चुनौती का समाधान करता है – ग्लास और अन्य पारदर्शी बाधाओं की पहचान करना।
कर्लस्रुह इंस्टीट्यूट ऑफ टेक्नोलॉजी से पेपर में एक उपयोगकर्ता-वोर्न सिस्टम, ट्रांस4ट्रांस के निर्माण का विवरण दिया गया है, जिसमें एक जोड़ी स्मार्ट ग्लास शामिल हैं जो एक पोर्टेबल जीपीयू केसिंग से जुड़े हुए हैं, जो एक हल्के लैपटॉप की तरह है, जो आरजीबी और गहराई की छवियों को 640×480 पिक्सल पर लगातार स्ट्रीम में कैप्चर करता है, जिसे फिर एक सेमेंटिक सेगमेंटेशन फ्रेमवर्क के माध्यम से चलाया जाता है।

ट्रांस4ट्रांस रिग में मोबाइल सेंसर। स्रोत: https://arxiv.org/pdf/2107.03172.pdf
सिस्टम की संवेदी फीडबैक क्षमता एक जोड़ी हड्डी-चालित इयरफ़ोन द्वारा बढ़ाई जाती है, जो पर्यावरणीय बाधाओं के प्रतिक्रिया में ध्वनि फीडबैक उत्पन्न करते हैं।
ट्रांस4ट्रांस सिस्टम का परीक्षण माइक्रोसॉफ्ट होलोलेंस 2 ऑगमेंटेड रियलिटी रिग पर भी किया गया है, जिसमें संभावित रूप से खतरनाक बाधाओं जैसे ग्लास दरवाजों की पूर्ण और सुसंगत सेगमेंटेशन (यानी, पहचान) हासिल की गई है।

होलोलेंस 2 पर ट्रांस4ट्रांस चल रहा है।
आर्किटेक्चर
ट्रांस4ट्रांस एक दोहरी दृष्टिकोण का उपयोग करता है, जिसमें एक ट्रांसफॉर्मर-आधारित एनकोडर और एक डिकोडर शामिल है, और एक प्रोप्राइटरी ट्रांसफॉर्मर पेयरिंग मॉड्यूल(टीपीएम) का लाभ उठाता है जो घने भागों के एम्बेडिंग द्वारा उत्पन्न फीचर मैप्स को संग्रहीत करने में सक्षम है, जबकि ट्रांसफॉर्मर-आधारित डिकोडर अपने जोड़े एनकोडर से फीचर मैप्स को लगातार पार्स करने में सक्षम है।
प्रत्येक टीपीएम में एक एकल ट्रांसफॉर्मर-आधारित परत होती है, जो सिस्टम के कम संसाधन नाली और पोर्टेबिलिटी के लिए आवश्यक है। डिकोडर में चार सममित चरण होते हैं जो एनकोडर के लिए होते हैं, जिसमें प्रत्येक को एक टीपीएम मॉड्यूल सौंपा जाता है। सिस्टम कई दृष्टिकोणों के कार्यों को एक सुसंगत प्रणाली में एकीकृत करके संसाधनों की बचत करता है, बजाय इसके कि दो अलग-अलग मॉडलों को एक रेखीय कार्य प्रवाह में तैनात किया जाए।
हार्डवेयर
सिस्टम में उपयोग किए जाने वाले चश्मे में एक रियलसेंस आर200 आरजीबी-डी सेंसर शामिल है, जबकि होस्ट मशीन में एक जेटसन एजएक्स एक्सेवियर एनवीडिया जीपीयू है, जो एम्बेडेड सिस्टम के लिए डिज़ाइन किया गया है, और जिसमें 384 एनवीडिया क्यूडीए कोर और 48 टेंसर कोर हैं।
आर200 में स्पेकल प्रोजेक्टिंग और पैसिव स्टीरियो मैचिंग है, जो इसे इंटीरियर और एक्सटीरियर वातावरण के लिए उपयुक्त बनाता है। स्पेकल सुविधा विशेष रूप से पारदर्शी सतहों का मूल्यांकन करने में लाभकारी है, क्योंकि यह आगमनशील दृश्य डेटा को बढ़ाता और स्पष्ट करता है बिना अत्यधिक प्रकाश स्रोतों से अंधा हुए। सेंसर की अवरक्त क्षमताएं भी परियोजना के उद्देश्यों के संदर्भ में बाधा बचाव के लिए महत्वपूर्ण गहराई मानचित्र प्राप्त करने में मदद करती हैं।
उपयोगकर्ता के लिए संज्ञानात्मक अधिभार को रोकना
सिस्टम को उपयोगकर्ता के लिए पर्याप्त डेटा आवृत्ति और अत्यधिक जानकारी के बीच संतुलन बनाने की आवश्यकता है, क्योंकि उपयोगकर्ता को ध्वनि फीडबैक और कंपन फीडबैक के माध्यम से पर्यावरण को सुसंगत रूप से पहचानने में सक्षम होना चाहिए।
इसलिए, ट्रांस4ट्रांस कृत्रिम रूप से फीडबैक डेटा की मात्रा को सीमित करता है, जिसमें एक मीटर की एकल डिफ़ॉल्ट सीमा निर्धारित की जाती है, बजाय इसके कि उपयोगकर्ता को विभिन्न दूरी की बाधाओं और बाधाओं के साथ मेल खाने वाली विभिन्न कंपन सेटिंग्स सीखने के लिए मजबूर किया जाए।
ट्रांस4ट्रांस का परीक्षण
ट्रांस4ट्रांस सिस्टम का परीक्षण दो डेटासेट पर किया गया है जो पारदर्शी वस्तुओं के सेगमेंटेशन से संबंधित हैं: ट्रांस10के-वी2, हांगकांग विश्वविद्यालय एट अल से, जिसमें 10,428 पारदर्शी वस्तुओं की छवियां हैं जो मान्यकरण, प्रशिक्षण और परीक्षण के लिए हैं; और स्टैनफोर्ड2डी3डी डेटासेट, जिसमें 70,496 मिश्रित पारदर्शिता वस्तुओं की छवियां हैं जो 1080×1080 रिज़ॉल्यूशन पर कब्जा की जाती हैं।

ट्रांस10के डेटासेट से छवियां और संबंधित मास्क। स्रोत: https://arxiv.org/pdf/2101.08461.pdf

स्टैनफोर्ड2डी3डी सिस्टम कार्रवाई में। स्रोत: http://buildingparser.stanford.edu/dataset.html
परीक्षण में, ट्रांस4ट्रांस ने भी उन पारदर्शी वस्तुओं को सेगमेंट किया जो ट्रांस2सेग पहल द्वारा वर्गीकृत किए गए थे, जो 2021 की शुरुआत में उसी शोधकर्ताओं द्वारा जारी किया गया था, जबकि सतहों को खंडित करने और गणना करने के लिए कम जीएफएलओपीएस की आवश्यकता होती है।
ट्रांस2सेक के विपरीत, जो एक सीएनएन-आधारित एनकोडर और ट्रांसफॉर्मर-आधारित डिकोडर का उपयोग करता है, ट्रांस4ट्रांस केवल ट्रांसफॉर्मर-आधारित एनकोडर-डिकोडर आर्किटेक्चर का उपयोग करता है, जो पिछले दृष्टिकोण से बेहतर प्रदर्शन करता है और पीवीटी पर भी काफी सुधार करता है।
アルゴリ즘 ने विशिष्ट संख्या में पारदर्शी वर्गों के लिए राज्य-оф-द-आर्ट परिणाम भी हासिल किए, जिनमें जार, विंडो, दरवाजा, कप, बॉक्स और बोतल शामिल हैं।













