एआई मॉडल और प्लेटफ़ॉर्म

शोधकर्ता गहरे शिक्षा का उपयोग करके लैंडमार्क फोटो 4D में बदलने के लिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

कॉर्नेल विश्वविद्यालय के शोधकर्ताओं ने एक नई विधि विकसित की है जो दुनिया के प्रसिद्ध स्थलों की तस्वीरों को 4D में बदलने के लिए गहरे शिक्षा का उपयोग करती है। टीम ने रोम में ट्रेवी फाउंटेन जैसे प्रमुख बिंदुओं की सार्वजनिक रूप से उपलब्ध पर्यटक तस्वीरों पर भरोसा किया, और परिणाम 3D छवियां हैं जो मैन्युअल रूप से घूमाई जा सकती हैं और समय के साथ उनकी उपस्थिति में परिवर्तन दिखा सकती हैं।

नव विकसित विधि दसियों हज़ारों अनटैग्ड और अनडेटेड तस्वीरों को लेती है और उन्हें संश्लेषित करती है, और यह कंप्यूटर दृष्टि के लिए एक बड़ा कदम है।

कार्य का शीर्षक “क्राउडसैंपलिंग द प्लेनोप्टिक फंक्शन” है, और इसे 23-28 अगस्त के बीच आयोजित किए गए वर्चुअल यूरोपीय कंप्यूटर विजन सम्मेलन में प्रस्तुत किया गया था।

नोआह स्नावेली कॉर्नेल टेक में कंप्यूटर विज्ञान के एसोसिएट प्रोफेसर और पेपर के वरिष्ठ लेखक हैं। अन्य योगदानकर्ताओं में कॉर्नेल डॉक्टरेट छात्र झेंगकी ली, पेपर के प्रथम लेखक, साथ ही एबे डेविस, कंप्यूटर विज्ञान के सहायक प्रोफेसर, और कॉर्नेल टेक डॉक्टरेट छात्र वेनकी शियन शामिल हैं।

“यह दृश्य को मॉडलिंग करने का एक नया तरीका है जो न केवल आपको अपना सिर घुमाने और देखने की अनुमति देता है, बल्कि समय को बदलने के लिए नियंत्रण भी प्रदान करता है,” स्नावेली ने कहा।

“यदि आप वास्तव में अपनी छुट्टी पर ट्रेवी फाउंटेन गए थे, तो इसकी उपस्थिति इस बात पर निर्भर करेगी कि आप कब गए थे – रात में यह नीचे से बाढ़ के प्रकाश द्वारा रोशन किया जाएगा, दोपहर में यह सूरज की रोशनी में होगा, जब तक कि आप बादलों वाले दिन न जाएं,” उन्होंने जारी रखा। “हमने इन अनियंत्रित फोटो संग्रह से पूरे दृश्य की उपस्थिति सीखी, जो समय और मौसम पर आधारित है, ताकि आप पूरे दृश्य का अन्वेषण कर सकें और साथ ही दृश्य के चारों ओर घूम सकें।”

पारंपरिक कंप्यूटर दृष्टि सीमाएं

चूंकि कई अलग-अलग बनावट हो सकती हैं जिन्हें पुन: उत्पन्न करने की आवश्यकता है, इसलिए पारंपरिक कंप्यूटर दृष्टि के लिए तस्वीरों के माध्यम से स्थानों का सटीक प्रतिनिधित्व करना मुश्किल है।

“वास्तविक दुनिया अपनी उपस्थिति में इतनी विविध है और इसमें विभिन्न प्रकार के सामग्री हैं – चमकदार चीजें, पानी, पतली संरचनाएं,” स्नावेली ने कहा।

इसके अलावा, पारंपरिक कंप्यूटर दृष्टि भी असंगत डेटा से जूझती है। प्लेनोप्टिक फंक्शन यह है कि कुछ कैसा दिखता है समय और स्थान में हर संभव दृष्टिकोण से, लेकिन इसे पुन: उत्पन्न करने के लिए, hundreds वेबकैम्स की आवश्यकता होती है जो दृश्य में हों। न केवल यह, बल्कि उन्हें पूरे दिन और रात भर रिकॉर्डिंग करनी होगी। यह किया जा सकता है, लेकिन जब दृश्यों की संख्या को देखते हैं जहां इस विधि की आवश्यकता होगी, तो यह एक अत्यधिक संसाधन-गहन कार्य है।

अन्य फोटो से सीखना

इस समस्या को हल करने के लिए, शोधकर्ताओं की टीम ने एक नई विधि विकसित की।

“हो सकता है कि डेटा सेट में इस सटीक दृष्टिकोण से 4 बजे की तस्वीर न ली गई हो। इसलिए हमें 9 बजे एक स्थान से और 4:03 बजे दूसरे स्थान से ली गई तस्वीर से सीखना होगा,” स्नावेली ने कहा। “और हमें यह नहीं पता कि इन तस्वीरों को कब लिया गया था। लेकिन गहरे शिक्षा का उपयोग करके, हम यह अनुमान लगा सकते हैं कि दृश्य किसी भी समय और स्थान पर कैसा दिखता होगा।”

शोधकर्ताओं ने चार आयामों में उपस्थिति को अंतर्पोलेट करने के लिए एक नई दृश्य प्रतिनिधित्व पेश किया, जिसे गहरे मल्टीप्लेन छवियां कहा जाता है।

स्नावेली के अनुसार, “हम 2D एनिमेशन में 3D प्रभाव बनाने के लिए आविष्कार किए गए एक ही विचार का उपयोग करके वास्तविक दुनिया के दृश्यों में 3D प्रभाव बनाने के लिए इस गहरे मल्टीलेयर छवि को बनाने के लिए इन विभिन्न मापदंडों से मेल खाते हैं। यह दिलचस्प है कि यह एक बहुत पुरानी तकनीक से उत्पन्न होता है जो एनिमेशन में उपयोग की जाती है।”

अध्ययन में दिखाया गया है कि प्रशिक्षित मॉडल 50,000 सार्वजनिक रूप से उपलब्ध छवियों के साथ एक दृश्य बना सकता है। टीम का मानना है कि इसका कंप्यूटर दृष्टि अनुसंधान और आभासी पर्यटन सहित कई क्षेत्रों में प्रभाव पड़ सकता है।

“आप वास्तव में वहां होने की भावना प्राप्त कर सकते हैं,” स्नावेली ने कहा। “यह आश्चर्यजनक रूप से अच्छी तरह से काम करता है कई दृश्यों के लिए।”

परियोजना को पूर्व गूगल सीईओ और परोपकारी एरिक श्मिट, साथ ही वेंड्ट श्मिट से समर्थन मिला।

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

एलेक्स Unite.AI की एआई‑संचालित समाचार संचालन का नेतृत्व करते हैं, जिसमें पत्रकारिता, अनुसंधान और स्वचालन को मिलाकर कृत्रिम बुद्धिमत्ता की समयोचित और स्केलेबल कवरेज को समर्थन मिलता है। उनका कार्य उभरती एआई विकासों को कुशलतापूर्वक उजागर करने में मदद करता है, साथ ही प्रकाशन के संपादकीय मानकों को बनाए रखता है।