Anderson का एंगल

सिंथेटिक डेटा: ग्रैंड थेफ्ट ऑटो के साथ ओक्लूजन गैप को पुल करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

इलिनोइस विश्वविद्यालय के शोधकर्ताओं ने एक नए कंप्यूटर विजन डेटासेट का निर्माण किया है जो ग्रैंड थेफ्ट ऑटो गेम इंजन द्वारा उत्पन्न सिंथेटिक इमेजरी का उपयोग करता है ताकि सेमेंटिक सेगमेंटेशन में सबसे कठिन बाधाओं में से एक को हल किया जा सके – स्रोत छवियों और वीडियो में आंशिक रूप से दिखाई देने वाले वस्तुओं को पहचानना।

इस उद्देश्य के लिए, जैसा कि पेपर में वर्णित है, शोधकर्ताओं ने GTA-V वीडियो गेम इंजन का उपयोग करके एक सिंथेटिक डेटासेट का निर्माण किया है जो न केवल ओक्लूजन उदाहरणों की रिकॉर्ड तोड़ संख्या की विशेषता है, बल्कि इसमें पूर्ण सेमेंटिक सेगमेंटेशन और लेबलिंग भी है, और यह समय के साथ जानकारी के लिए खाता है जिस तरह से इसे समान ओपन-सोर्स डेटासेट द्वारा संबोधित नहीं किया जाता है।

पूर्ण दृश्य समझ

नीचे दिया गया वीडियो, जो शोध के लिए सहायक सामग्री के रूप में प्रकाशित किया गया है, एक पूर्ण 3D दृश्य की समझ के लाभों को दर्शाता है, जिसमें छिपी हुई वस्तुओं को जाना जाता है और दृश्य में सभी परिस्थितियों में उजागर किया जाता है, जिससे मूल्यांकन प्रणाली आंशिक रूप से ओक्लूडेड दृश्यों को पूरी (लेबल) वस्तु के साथ जोड़ना सीखती है।

[वीडियो चौड़ाई=”1920″ ऊंचाई=”1080″ mp4=”https://www.unite.ai/wp-content/uploads/2021/06/sailvos.mp4″][/वीडियो]

स्रोत: http://sailvos.web.illinois.edu/_site/index.html

परिणामी डेटासेट, जिसे SAIL-VOS 3D कहा जाता है, को लेखकों द्वारा फ्रेम-दर-फ्रेम एनोटेशन, इंस्टेंस-लेवल सेगमेंटेशन, दृश्य दृश्यों के लिए ग्राउंड ट्रुथ गहराई और 2D एनोटेशन के साथ पहला सिंथेटिक वीडियो मेश डेटासेट होने का दावा किया जाता है जो बाउंडिंग बॉक्स द्वारा परिभाषित किया जाता है।

[कैप्शन id=”attachment_176234″ align=”alignnone” width=”700″] स्रोत (क्लिक करने पर बड़ा करें)[/कैप्शन]

SAIL-VOS 3D की एनोटेशन में गहराई, इंस्टेंस-लेवल मॉडल और अमोडल सेगमेंटेशन, सेमेंटिक लेबल और 3D मेश शामिल हैं। डेटा में 484 वीडियो शामिल हैं जो कुल 237,611 फ्रेम हैं 1280×800 रिज़ॉल्यूशन पर, जिसमें शॉट ट्रांज़िशन शामिल हैं।

[कैप्शन id=”attachment_176235″ align=”alignnone” width=”700″]ऊपर, मूल CGI फ्रेम; दूसरी पंक्ति, इंस्टेंस-लेवल सेगमेंटेशन; तीसरी पंक्ति, अमोडल सेगमेंटेशन, जो डेटा में उपलब्ध दृश्य की गहराई और पारदर्शिता को दर्शाता है। स्रोत ऊपर, मूल CGI फ्रेम; दूसरी पंक्ति, इंस्टेंस-लेवल सेगमेंटेशन; तीसरी पंक्ति, अमोडल सेगमेंटेशन, जो डेटा में उपलब्ध दृश्य की गहराई और पारदर्शिता को दर्शाता है। स्रोत (क्लिक करने पर बड़ा करें)[/कैप्शन]

सेट 6,807 क्लिप में टूट जाता है जो प्रति 34.6 फ्रेम के औसत के साथ होता है, और डेटा 3,576 मेश मॉडल से उत्पन्न 3,460,213 वस्तु उदाहरणों के साथ एनोटेट किया जाता है जो GTA-V गेम इंजन में हैं। ये 178 सेमेंटिक श्रेणियों में से एक को सौंपे जाते हैं।

मेश पुनर्निर्माण और स्वचालित लेबलिंग

चूंकि बाद के डेटासेट शोध वास्तविक दुनिया की छवियों पर होने की संभावना है, SAIL-VOS 3D में मेश मशीन लर्निंग फ्रेमवर्क द्वारा उत्पन्न किए जाते हैं, न कि GTA-V इंजन से प्राप्त किए जाते हैं।

[कैप्शन id=”attachment_176241″ align=”alignnone” width=”700″]एक कार्यक्रमmatic और मूल रूप से 'होलोग्राफिक' दृश्य प्रतिनिधित्व की समझ के साथ, SAIL-VOS 3D इमेजरी आमतौर पर ओक्लूजन द्वारा छिपी वस्तुओं के प्रतिनिधित्व को सिंथेसाइज़ कर सकती है, जैसे कि यहां मुड़ने वाले चरित्र का दूर का सामने का हाथ, जिस तरह से वास्तविक दुनिया की फुटेज में कई प्रतिनिधि उदाहरणों पर निर्भर होगा। स्रोत: https://arxiv.org/pdf/2105.08612.pdf एक कार्यक्रमmatic और मूल रूप से ‘होलोग्राफिक’ दृश्य प्रतिनिधित्व की समझ के साथ, SAIL-VOS 3D इमेजरी आमतौर पर ओक्लूजन द्वारा छिपी वस्तुओं के प्रतिनिधित्व को सिंथेसाइज़ कर सकती है, जैसे कि यहां मुड़ने वाले चरित्र का दूर का सामने का हाथ, जिस तरह से वास्तविक दुनिया की फुटेज में कई प्रतिनिधि उदाहरणों पर निर्भर होगा। (क्लिक करने पर बड़ा करें) स्रोत: https://arxiv.org/pdf/2105.08612.pdf[/कैप्शन]

चूंकि GTA-V दुनिया में प्रत्येक वस्तु में एक अद्वितीय आईडी होती है, SAIL-VOS GTA-V स्क्रिप्ट हुक लाइब्रेरी का उपयोग करके रेंडरिंग इंजन से इन्हें पुनर्प्राप्त करता है। यह अस्थायी रूप से दृश्य क्षेत्र से बाहर जाने वाले विषय को पुनः प्राप्त करने की समस्या का समाधान करता है, क्योंकि लेबलिंग स्थायी और विश्वसनीय है। पर्यावरण में 162 वस्तुएं उपलब्ध हैं, जिन्हें शोधकर्ताओं ने एक संबंधित संख्या में वर्गों में मैप किया है।

दृश्यों और वस्तुओं की विविधता

GTA-V इंजन में कई वस्तुएं प्राकृतिक हैं और इसलिए SAIL-VOS इन्वेंट्री में माइक्रोसॉफ्ट के 2014 MS-COCO डेटासेट में मौजूद वर्गों में से 60% शामिल हैं।

[कैप्शन id=”attachment_176238″ align=”alignnone” width=”700″]SAIL-VOS डेटासेट में विभिन्न आंतरिक और बाहरी दृश्य शामिल हैं जो विभिन्न मौसम की स्थितियों में हैं, जिसमें विभिन्न पोशाक पहने हुए पात्र हैं। SAIL-VOS डेटासेट में विभिन्न आंतरिक और बाहरी दृश्य शामिल हैं जो विभिन्न मौसम की स्थितियों में हैं, जिसमें विभिन्न पोशाक पहने हुए पात्र हैं। (क्लिक करने पर बड़ा करें)[/कैप्शन]

प्रयोज्यता

इस क्षेत्र में शोध के सामान्य प्रवाह के साथ संगतता सुनिश्चित करने और यह पुष्टि करने के लिए कि यह सिंथेटिक दृष्टिकोण गैर-सिंथेटिक परियोजनाओं को लाभान्वित कर सकता है, शोधकर्ताओं ने MS-COCO और 2012 PASCAL विज़ुअल ऑब्जेक्ट क्लासेस (VOC) चैलेंज के लिए नियोजित फ्रेम-आधारित डिटेक्शन दृष्टिकोण का उपयोग करके डेटासेट का मूल्यांकन किया, जिसमें औसत सटीकता मीट्रिक के रूप में उपयोग किया गया था।

शोधकर्ताओं ने पाया कि SAIL-VOS डेटासेट पर प्री-ट्रेनिंग इंटरसेक्शन ओवर यूनियन (IoU) के प्रदर्शन में 19% की वृद्धि करती है, जिसमें IoU में सुधार होता है, साथ ही वीडियोमैच प्रदर्शन में सुधार होता है, जो 55% से 74% तक अनदेखे डेटा पर होता है।

हालांकि, अत्यधिक ओक्लूजन के मामलों में, ऐसे अवसर थे जब सभी पुराने तरीके वस्तु या व्यक्ति की पहचान करने में असमर्थ रहे, हालांकि शोधकर्ताओं ने भविष्यवाणी की कि यह भविष्य में अमोडल मास्क के कारण को स्थापित करने के लिए आसपास के फ्रेम की जांच करके ठीक किया जा सकता है।

[कैप्शन id=”attachment_176239″ align=”alignnone” width=”700″]दो दाहिने हाथ की छवियों में, पारंपरिक सेगमेंटेशन अल्गोरिदम महिला आकृति को उसके सिर के दिखाई देने वाले बहुत सीमित हिस्से से पहचानने में विफल रहे हैं। बाद के नवाचारों में ऑप्टिकल फ्लो मूल्यांकन शायद इन परिणामों में सुधार करेगा। दो दाहिने हाथ की छवियों में, पारंपरिक सेगमेंटेशन अल्गोरिदम महिला आकृति को उसके सिर के दिखाई देने वाले बहुत सीमित हिस्से से पहचानने में विफल रहे हैं। बाद के नवाचारों में ऑप्टिकल फ्लो मूल्यांकन शायद इन परिणामों में सुधार करेगा। (क्लिक करने पर बड़ा करें)[/कैप्शन]

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai