Anderson का एंगल

एआई को लैंडमार्क का आकार पहचानने में कठिनाई होती है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2 + Photoshop): High-angle view of a man holding a scale model of the Leaning Tower of Pisa on a grassy field, with an inset photograph showing the same model aligned from ground level to resemble the full-sized tower in the background.

विज़न-लैंग्वेज मॉडल स्मारकों को समझते हैं, लेकिन वे अब भी पूरी तस्वीर नहीं देख पाते…

 

जीवन-रक्षा से जुड़ी सबसे शुरुआती क्षमताओं में से एक है छोटी और दूर की वस्तुओं में अंतर करना। हम अंगूठे से चंद्रमा को ढक सकते हैं, फिर भी उसे सिक्के जितना नहीं मानते, क्योंकि सापेक्ष पैमाने की समझ हमारे भीतर बस चुकी है।

कंप्यूटर-विज़न प्रणालियों के लिए यह असाधारण रूप से कठिन काम है, क्योंकि अधिकतर प्रणालियाँ पहले से किए गए एनोटेशन पर निर्भर रहती हैं, जो उन्हें मनुष्यों की तरह पैमाना ‘समझने’ में मदद नहीं करता। इसके अलावा, एक निश्चित और काफ़ी निकट सीमा के बाद दूरी की हर चीज़ इतनी दूर हो जाती है कि स्टीरियो विज़न उसका गहराई-आकलन नहीं कर सकता—पार्किंग के दूसरे छोर की कार, उससे आगे की गगनचुंबी इमारत और उसके ऊपर उगता अर्धचंद्र; अधिकांश विज़न-आधारित मशीन-लर्निंग प्रणालियों के लिए ये सभी ‘2D’ इकाइयाँ हैं।

जब किसी ‘दूर’ लेकिन गलत समझी गई वस्तु का विशेष उदाहरण प्रशिक्षण डेटा में पर्याप्त मात्रा में मौजूद हो, तो वह डेटा देख चुकी प्रणाली को धोखा देना कठिन हो सकता है:

ChatGPT-5.5 इस लोकप्रिय पर्यटक चाल से बिल्कुल प्रभावित नहीं होता।

ChatGPT-5.5 इस लोकप्रिय पर्यटक चाल से बिल्कुल प्रभावित नहीं होता।

किसी मॉडल के प्रशिक्षित लेटेंट स्पेस में ऐसी विशिष्ट और बार-बार दोहराई गई जानकारी जितनी कम होगी, उसे उतना ही अधिक सामान्यीकरण करना और पैमाने की उन अवधारणाओं को आत्मसात करना पड़ेगा जिन्हें हम छोटी उम्र में समझ लेते हैं। इसके बिना प्रसिद्ध उदाहरण भी पैमाने का गलत अनुमान करा सकते हैं:

आज चर्चा की जा रही नई शोध-पत्र से लिया गया यह काल्पनिक उदाहरण कैमरे की पृष्ठभूमि में आर्क द ट्रायम्फ दिखाता है, लेकिन प्रणाली उसका आकार नहीं जानती और गलत अनुमान लगाती है। स्रोत: https://arxiv.org/pdf/2606.02379

आज चर्चा की जा रही नई शोध-पत्र से लिया गया यह काल्पनिक उदाहरण कैमरे की पृष्ठभूमि में आर्क द ट्रायम्फ दिखाता है, लेकिन प्रणाली उसका आकार नहीं जानती और गलत अनुमान लगाती है। स्रोत

एफ़िल टावर जैसी विशिष्ट और आसानी से पहचानी जाने वाली वस्तुओं के साथ खतरा यह है कि प्रणाली आकार के अनुमान के लिए ऐसा शॉर्टकट अपनाए जो मूल स्मारक के लिए सही हो, लेकिन पेरिस के इस स्मारक की अनेक प्रतिकृतियों के लिए नहीं। वे भी स्टीरियो-विज़न की दूरी से बाहर हो सकती हैं, पर आकार में कहीं छोटी हैं।

इसलिए यह महत्वपूर्ण है कि विज़न प्रणालियाँ नए, पहले न देखे गए दृश्यों का सामना तैयार कौशलों के साथ करें, केवल ‘चीट कोड’ के संग्रह के साथ नहीं।

पैमाना बढ़ाना

इसी उद्देश्य से अमेरिका और चीन के एक नए सहयोग ने समस्या को संबोधित करने वाली अनुमान-विधि के साथ सुधारात्मक डेटासेट प्रस्तुत किया है:

नया तरीका बेहतर प्रशिक्षण सामग्री के माध्यम से पहले की प्रणाली को संशोधित करता है—इतना विविध डेटा कि गहराई से जुड़ी समस्याओं की बेहतर समझ बन सके।

नया तरीका बेहतर प्रशिक्षण सामग्री के माध्यम से पहले की प्रणाली को संशोधित करता है—इतना विविध डेटा कि गहराई से जुड़ी समस्याओं की बेहतर समझ बन सके।

सहायक वेबसाइट के साथ शुरू की गई MetricScenes पहल ने डेटा और कोड जारी किए हैं।

शोध-पत्र में कहा गया है*:

“हमने पाया कि मौजूदा अत्याधुनिक विधियाँ दृश्य के सही पैमाने का अनुमान लगाने में बार-बार विफल होती हैं, जिससे वास्तविक दुनिया के अनियंत्रित परिदृश्यों में ‘स्केल कोलैप्स’ की लगातार समस्या पैदा होती है।

“ऊपर की छवि में स्पष्ट अर्थगत संदर्भ—लोग—मौजूद हैं, फिर भी MoGe-2 जैसे मॉडल अलग-अलग दूरियों पर पैमाने में बड़ा विरोधाभास दिखाते हैं। निकट वस्तुओं का अनुमानित मीट्रिक पैमाना उचित है—पर्यटक सामान्य ऊँचाई के दिखते हैं—लेकिन दूर की संरचनाओं का पैमाना बहुत कम आँका गया है। पृष्ठभूमि में आर्क द ट्रायम्फ की अनुमानित चौड़ाई केवल 18.8 मीटर है, जो वास्तविक 44.8 मीटर से दो गुना से भी अधिक छोटी है।

“विपरीत संकेतों के बावजूद MoGe-2 ने स्मारक को लघु रूप में मान लिया।”

तीन की शक्ति

लेखकों ने तीन मौजूदा डेटासेट को मिलाकर नया संग्रह बनाया: MegaScenes, AerialMegaDepth और Stereo4D:

नए संग्रह का हिस्सा MegaScenes से उदाहरण छवियाँ। स्रोत: https://megascenes.github.io/

नए संग्रह का हिस्सा MegaScenes से उदाहरण छवियाँ। स्रोत

अलग-अलग देखने पर MetricScenes में योगदान देने वाले प्रत्येक डेटासेट की समस्या यह है कि वह सीमित क्षेत्र पर लागू होता है, जैसे कार के दृष्टिकोण वाले वीडियो या अंदरूनी दृश्य। समस्या हल करने और विज़न प्रणालियों को पैमाने की मानव-सदृश अवधारणा के निकट लाने के लिए एक संयुक्त क्षेत्र आवश्यक है।

हर छवि के साथ RGB चित्र, स्ट्रक्चर फ्रॉम मोशन (SfM), मल्टी-व्यू स्टीरियो (MVS) या अन्य ज्यामितीय पूर्व-जानकारी से निकली आंशिक गहराई, नई दो-चरणीय पॉइसन कंप्लीशन प्रक्रिया से बनी पूरी डेप्थ मैप और संबंधित कैमरा मेटाडेटा दिया जाता है।

नए डेटासेट पर MoGe-2 ढाँचे की फ़ाइन-ट्यूनिंग लेखकों द्वारा बताए गए स्केल कोलैप्स को “काफ़ी हद तक कम करती है” और कथित रूप से खुले क्षेत्र के दृश्यों में बेहतर परिणाम तथा संबंधित बेंचमार्क पर अत्याधुनिक प्रदर्शन देती है।

नई शोध-पत्र का शीर्षक हनी, मैंने आर्क द ट्रायम्फ को छोटा कर दिया! है और इसे कॉर्नेल विश्वविद्यालय तथा शंघाई जिआओ तोंग विश्वविद्यालय के चार शोधकर्ताओं ने लिखा है।

विधि

MetricScenes कुछ हद तक पहले बताए गए AerialMegaDepth और MegaScenes पर आधारित है—ऐतिहासिक अभिलेखों, पर्यटक चित्रों और पेशेवर फ़ोटोग्राफ़ी से बनी इंटरनेट छवियों के दो संग्रह। MegaScenes बड़े पैमाने की स्ट्रक्चर फ्रॉम मोशन (SfM) पुनर्निर्मिति देता है, लेकिन दृश्यों में स्वाभाविक वास्तविक-विश्व पैमाना नहीं होता। इसे सुधारने के लिए ऑनलाइन मानचित्र सेवाओं की जियोटैग की गई छवियों से पुनर्निर्मित दृश्यों को ज्ञात भौतिक स्थानों और आयामों से संरेखित किया गया।

इसके विपरीत AerialMegaDepth पहले से जियोटैग किए Google Earth दृश्यों को शामिल करता है और स्मारकों की मीट्रिक-पैमाने वाली पुनर्निर्मिति उपलब्ध कराता है।

दिखने में समान लेकिन भौगोलिक रूप से दूर संरचनाओं से होने वाली संभावित पुनर्निर्माण त्रुटियों को MASt3R-SfM और Doppelgangers++ क्लासिफ़ायर से सुधारा गया। मल्टी-व्यू स्टीरियो (MVS) पुनर्निर्माण के बाद अस्थिर गहराई अनुमानों और डेप्थ-ब्लीडिंग कलाकृतियों को स्थिरता परीक्षणों तथा MoGe-2 की भविष्यवाणियों के संयोजन से फ़िल्टर किया गया:

AerialMegaDepth इंटरनेट छवियों को जियोटैग किए Google Earth दृश्यों से मिलाकर वास्तविक पैमाना निकालता है, जबकि MegaScenes को भू-संदर्भित सड़क-स्तरीय छवियों से भौतिक आयामों में संरेखित किया जाता है। MVS पुनर्निर्माण के बाद अस्थिर गहराई और डेप्थ-ब्लीडिंग हटाकर प्रशिक्षण के लिए स्वच्छ मीट्रिक डेप्थ मैप बनाए जाते हैं। पीले बॉक्स हटाई गई अस्थायी वस्तुएँ और लाल बॉक्स सुधारे गए डेप्थ-ब्लीडिंग क्षेत्र दिखाते हैं।

AerialMegaDepth इंटरनेट छवियों को जियोटैग किए Google Earth दृश्यों से मिलाकर वास्तविक पैमाना निकालता है, जबकि MegaScenes को भू-संदर्भित सड़क-स्तरीय छवियों से भौतिक आयामों में संरेखित किया जाता है। MVS पुनर्निर्माण के बाद अस्थिर गहराई और डेप्थ-ब्लीडिंग हटाकर प्रशिक्षण के लिए स्वच्छ मीट्रिक डेप्थ मैप बनाए जाते हैं। पीले बॉक्स हटाई गई अस्थायी वस्तुएँ और लाल बॉक्स सुधारे गए डेप्थ-ब्लीडिंग क्षेत्र दिखाते हैं।

फिर भू-संदर्भित चित्रों के माध्यम से मीट्रिक पैमाना वापस पाया गया। AerialMegaDepth ज्ञात स्थानों से लिए Google Earth रेंडरिंग से पैमाना निकालता है, जबकि MegaScenes को मानचित्र सेवाओं से मिली जियोटैग वाली सड़क-स्तरीय छवियों के आधार पर वास्तविक आयामों में संरेखित किया गया।

इन छवियों को MASt3R से मौजूदा पुनर्निर्मिति से मिलाया गया, Doppelganger क्लासिफ़ायर से सुधारा गया, COLMAP से संरेखित किया गया और RANSAC आधारित अनुमान से अर्थ-सेंटर्ड, अर्थ-फ़िक्स्ड (ECEF) निर्देशांकों में मापा गया। अविश्वसनीय पैमाने या खराब पंजीकरण वाले दृश्य हटा दिए गए।

स्टीरियो में देखना

MetricScenes संग्रह पहले बताए Stereo4D डेटासेट का भी उपयोग करता है, जिसमें VR180 कैमरों से रिकॉर्ड किए गए वास्तविक दुनिया के हजारों स्टीरियोस्कोपिक वीडियो क्रम हैं और इस प्रकार चित्रों में समय का आयाम जुड़ता है:

Stereo4D स्टीरियोस्कोपिक इंटरनेट वीडियो से बना है और कैमरा पोज़, गहराई अनुमान तथा गति-पथ मिलाकर बड़े पैमाने पर गतिशील 3D दृश्य पुनर्निर्मित करता है। इसमें लंबी दूरी के गति-पथ वाली पॉइंट-क्लाउड के रूप में सैकड़ों हजार वीडियो क्लिप हैं, जो विज़न मॉडल प्रशिक्षण के लिए वास्तविक 3D ज्यामिति और गति का बड़ा स्रोत देते हैं। स्रोत: https://arxiv.org/pdf/2412.09621

Stereo4D स्टीरियोस्कोपिक इंटरनेट वीडियो से बना है और कैमरा पोज़, गहराई अनुमान तथा गति-पथ मिलाकर बड़े पैमाने पर गतिशील 3D दृश्य पुनर्निर्मित करता है। इसमें लंबी दूरी के गति-पथ वाली पॉइंट-क्लाउड के रूप में सैकड़ों हजार वीडियो क्लिप हैं, जो विज़न मॉडल प्रशिक्षण के लिए वास्तविक 3D ज्यामिति और गति का बड़ा स्रोत देते हैं। स्रोत

अलग उपकरणों में दोनों कैमरा लेंसों की भौतिक दूरी बदलती है, इसलिए केवल दस्तावेजीकृत कैमरा विन्यास वाले वीडियो उपयोग किए गए, जिससे दृश्य की गहराई सटीक वास्तविक पैमाने पर निकाली जा सकी।

Stereo4D ने मूल रूप से दृश्य-ज्यामिति का अनुमान लगाने के लिए ऑप्टिकल-फ़्लो प्रणाली SEA-RAFT का उपयोग किया। लेकिन लेखकों ने पाया कि अपूर्ण कैमरा कैलिब्रेशन पुनर्निर्मित दृश्यों को विकृत कर सकता है और समानांतर संरचनाओं को अस्वाभाविक रूप से मिलाता दिखा सकता है। इसलिए उन्होंने इसे बहु-दृश्य पुनर्निर्माण पाइपलाइन से बदला, जो कई फ़्रेमों से कैमरा पोज़ और गहराई का संयुक्त अनुमान लगाती है।

π³, DepthAnything V3 और MapAnything की तुलना के बाद π³ को उसकी ज्यामितीय मजबूती और सूक्ष्म विवरण बचाने की क्षमता के कारण चुना गया:

Stereo4D से मीट्रिक गहराई की पुनर्प्राप्ति। अपूर्ण कैलिब्रेशन में सामान्य स्टीरियो मिलान विकृत ज्यामिति दे सकता है, जबकि π³ अधिक सुसंगत दृश्य पुनर्निर्माण और बारीक विवरण देता है। पुनर्प्राप्त ज्यामिति को स्टीरियो कैमरे की ज्ञात भौतिक बेसलाइन से संरेखित कर सटीक मीट्रिक डेप्थ मैप बनाए जाते हैं।

Stereo4D से मीट्रिक गहराई की पुनर्प्राप्ति। अपूर्ण कैलिब्रेशन में सामान्य स्टीरियो मिलान विकृत ज्यामिति दे सकता है, जबकि π³ अधिक सुसंगत दृश्य पुनर्निर्माण और बारीक विवरण देता है। पुनर्प्राप्त ज्यामिति को स्टीरियो कैमरे की ज्ञात भौतिक बेसलाइन से संरेखित कर सटीक मीट्रिक डेप्थ मैप बनाए जाते हैं।

π³ दृश्य को मनमाने पैमाने पर पुनर्निर्मित करता है, इसलिए तैयार डेप्थ मैप को प्रत्येक स्टीरियो कैमरा रिग की ज्ञात भौतिक बेसलाइन से वास्तविक आयामों में संरेखित किया गया। अतिरिक्त फ़िल्टरिंग ने खराब फ़्रेम, गहराई की असंगतियाँ, कैलिब्रेशन त्रुटियाँ और अविश्वसनीय पैमाने हटाए।

दो-चरणीय डेप्थ-कंप्लीशन प्रक्रिया भी इस्तेमाल हुई, जिसमें MoGe-2 के अग्रभूमि अनुमान को मल्टी-व्यू स्टीरियो (MVS) की पृष्ठभूमि ज्यामिति से जोड़ा गया। इससे अधिक सुसंगत पैमाने और स्पष्ट वस्तु-सीमाओं वाला स्वच्छ प्रशिक्षण डेटा मिला:

दो-चरणीय गहराई पूर्णता। केवल पृष्ठभूमि एंकर दृश्य संरचना बचाते हुए कुल पैमाना बिगाड़ सकते हैं, जबकि एक ही चरण में अग्रभूमि और पृष्ठभूमि बाधाएँ जोड़ने से स्केल ड्रिफ्ट और सीमा कलाकृतियाँ आती हैं। दो-चरणीय तरीका निकट और दूर दोनों वस्तुओं में सुसंगत मीट्रिक पैमाना तथा साफ़ सीमाएँ बनाए रखता है।

दो-चरणीय गहराई पूर्णता। केवल पृष्ठभूमि एंकर दृश्य संरचना बचाते हुए कुल पैमाना बिगाड़ सकते हैं, जबकि एक ही चरण में अग्रभूमि और पृष्ठभूमि बाधाएँ जोड़ने से स्केल ड्रिफ्ट और सीमा कलाकृतियाँ आती हैं। दो-चरणीय तरीका निकट और दूर दोनों वस्तुओं में सुसंगत मीट्रिक पैमाना तथा साफ़ सीमाएँ बनाए रखता है।

लेखकों ने देखा कि इंटरनेट फ़ोटो संग्रहों में प्रायः विश्वसनीय अग्रभूमि गहराई नहीं होती, जबकि स्टीरियो चित्र दूर की पृष्ठभूमि छोड़ देते हैं। MoGe-2 पूरे दृश्य में सघन ज्यामिति का अनुमान लगा सकता है, लेकिन उसके अनुमान उसी स्केल-कोलैप्स समस्या की ओर जाते हैं जिसे परियोजना हल करना चाहती है। इसलिए दो-चरणीय पाइपलाइन MoGe-2 और MVS की शक्तियाँ मिलाने के लिए बनाई गई।

MVS से मिले मीट्रिक एंकरों से पृष्ठभूमि ज्यामिति निकालकर विश्वसनीय बड़े पैमाने की संरचना वाला आधार डेप्थ मैप बनाया गया। दूसरे चरण में MoGe-2 के अग्रभूमि अनुमान को किनारों के प्रति सजग पूर्णता प्रक्रिया से दोबारा जोड़ा गया, ताकि वस्तु-सीमाएँ बनी रहें और स्केल ड्रिफ्ट व डेप्थ-ब्लीडिंग न हो।

शोध-पत्र के अनुसार इस तरीके से बने डेप्थ मैप देखने में पूर्ण और वास्तविक पैमाने में अधिक सुसंगत थे:

दो-चरणीय गहराई पूर्णता पाइपलाइन। पहले चरण में MVS एंकर विश्वसनीय मीट्रिक पैमाने पर पृष्ठभूमि ज्यामिति निकालते हैं। दूसरे में MoGe-2 के अग्रभूमि अनुमान किनारों के प्रति सजग संयोजन से जोड़े जाते हैं, जिससे बड़े पैमाने की सटीकता और तीखे स्थानीय विवरण दोनों वाला अंतिम डेप्थ मैप बनता है।

दो-चरणीय गहराई पूर्णता पाइपलाइन। पहले चरण में MVS एंकर विश्वसनीय मीट्रिक पैमाने पर पृष्ठभूमि ज्यामिति निकालते हैं। दूसरे में MoGe-2 के अग्रभूमि अनुमान किनारों के प्रति सजग संयोजन से जोड़े जाते हैं, जिससे बड़े पैमाने की सटीकता और तीखे स्थानीय विवरण दोनों वाला अंतिम डेप्थ मैप बनता है।

डेटा और परीक्षण

अंतिम MetricScenes संग्रह में केवल वास्तविक दुनिया की 47,579 छवियाँ हैं, जो AerialMegaDepth के 134 दृश्यों को कवर करती हैं; MegaScenes के 356 दृश्यों से 29,583 छवियाँ; और Stereo4D के 1,725 वीडियो से लिए 22,549 फ़्रेम हैं।

प्रत्येक स्रोत के दस दृश्य वैलिडेशन के लिए अलग रखे गए। संग्रह में बाहरी और आंतरिक संदर्भ, ज़मीनी और हवाई दृश्य, तथा शहरी और प्राकृतिक परिदृश्य शामिल हैं—एक ऐसा संयुक्त और सुसंगत संदर्भ जो योगदान देने वाले किसी एक संग्रह में उपलब्ध नहीं है।

प्रारंभिक गुणात्मक परीक्षण में लेखकों ने MoGe-2 के ViT-Large-Normal मॉडल को MetricScenes पर 10,000 इटरेशन और 32 के बैच आकार के साथ फ़ाइन-ट्यून किया—लगभग तीन एपोक। क्रॉपिंग और सामान्य डेटा ऑगमेंटेशन मूल MoGe-2 परीक्षणों से लिए गए। प्रशिक्षण में लर्निंग रेट 1×10-6 (बैकबोन) और 1×10-5 (अन्य पैरामीटर) था। गुणात्मक परीक्षण में फ़ाइन-ट्यून किए WildMoGe की तुलना आधार MoGe-2, DepthAnything V3, Metric3Dv2, UniDepth v2 और DepthPro से की गई:

स्मारकों की मीट्रिक-पैमाना पुनर्निर्मिति की तुलना। बाएँ कॉलम में Google Maps के वास्तविक माप हैं। अनदेखे स्मारकों पर WildMoGe ज्ञात आयामों के अधिक निकट अनुमान देता है, जबकि MoGe-2, DepthAnything V3 और Metric3D V2 दूर की संरचनाओं का आकार अक्सर कम आँकते हैं। UniDepth V2 अधिक यथार्थवादी लेकिन असंगत और DepthPro कभी-कभी गंभीर रूप से गलत पैमाने देता है।

स्मारकों की मीट्रिक-पैमाना पुनर्निर्मिति की तुलना। बाएँ कॉलम में Google Maps के वास्तविक माप हैं। अनदेखे स्मारकों पर WildMoGe ज्ञात आयामों के अधिक निकट अनुमान देता है, जबकि MoGe-2, DepthAnything V3 और Metric3D V2 दूर की संरचनाओं का आकार अक्सर कम आँकते हैं। UniDepth V2 अधिक यथार्थवादी लेकिन असंगत और DepthPro कभी-कभी गंभीर रूप से गलत पैमाने देता है।

इस परिणाम पर शोध-पत्र कहता है:

“[WildMoGe] विभिन्न स्मारकों पर लगातार अधिक सटीक पूर्ण पैमाना निकालता है और वास्तविक आयामों के निकट रहता है—जैसे फिलाडेल्फिया म्यूज़ियम ऑफ़ आर्ट के लिए 31.4 मीटर बनाम 32.4 मीटर और Piazza della Signorina के लिए 46.7 बनाम 46.5 मीटर। MoGe-2, DepthAnything v3 और Metric3D v25 स्केल-कोलैप्स दिखाते हुए दूर की संरचनाओं का आकार लगातार कम आँकते हैं।

“UniDepth v2 अधिक यथार्थवादी पैमाने देता है, लेकिन वास्तविक मान से भटकता है। DepthPro अक्सर पूर्ण पैमाना निकालने में विफल होकर वास्तविकता से कई क्रम छोटे परिणाम देता है। ध्यान रहे कि ये दृश्य प्रशिक्षण सेट में नहीं हैं।

“यह प्रदर्शन बताता है कि WildMoGe केवल प्रशिक्षण दृश्य याद करने के बजाय अनदेखी सामग्री पर सामान्यीकरण कर सकता है।”

यह सुनिश्चित करने के लिए कि सुधार केवल स्मारकों और बड़े बाहरी दृश्यों तक सीमित नहीं है, लेखकों ने WildMoGe को सामान्य अंदरूनी और सड़क-स्तरीय छवियों पर भी परखा। वहाँ उसके पैमाने MoGe-2 से व्यापक रूप से मेल खाते थे, जबकि ETH3D आँगन दृश्य पर सटीकता बेहतर थी:

मानक दृश्यों की तुलना। सामान्य अंदरूनी और सड़क-स्तरीय वातावरण में WildMoGe के पैमाने MoGe-2 से व्यापक रूप से मेल खाते हैं, जबकि ETH3D आँगन बेंचमार्क पर वह वास्तविक माप के अधिक निकट वस्तु आयाम देकर बेहतर सटीकता हासिल करता है।

मानक दृश्यों की तुलना। सामान्य अंदरूनी और सड़क-स्तरीय वातावरण में WildMoGe के पैमाने MoGe-2 से व्यापक रूप से मेल खाते हैं, जबकि ETH3D आँगन बेंचमार्क पर वह वास्तविक माप के अधिक निकट वस्तु आयाम देकर बेहतर सटीकता हासिल करता है।

MetricScenes ने मीट्रिक-पैमाना तर्क में सचमुच सुधार किया या नहीं, यह जानने के लिए समर्पित MetricScenes टेस्ट सेट तथा NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring और HAMMER पर मूल्यांकन हुआ।

लेखक बताते हैं कि अनियंत्रित इंटरनेट चित्रों के लिए सघन वास्तविक माप प्राप्त करना कठिन है, इसलिए MetricScenes लेबल पूरी तरह सटीक नहीं हैं। सामान्य ज्यामितीय प्रदर्शन की कीमत पर सुधार न हुआ हो, इसकी पुष्टि के लिए मानक बेंचमार्क शामिल किए गए।

तुलना MoGe-2, UniDepth V2, DepthPro, MASt3R, Depth Anything V2, Depth Anything V3, ZoeDepth और Metric3D V2 से हुई:

सापेक्ष और मीट्रिक ज्यामिति का मात्रात्मक मूल्यांकन। MetricScenes टेस्ट सेट पर WildMoGe हर रिपोर्टेड माप में MoGe-2 से बेहतर रहा और स्थापित बेंचमार्क पर ZoeDepth, Metric3D V2, Depth Anything V2 व V3, MASt3R, UniDepth V2 और DepthPro के व्यापक रूप से प्रतिस्पर्धी रहा। इससे पता चलता है कि सामान्य ज्यामितीय गुणवत्ता घटाए बिना मीट्रिक अनुमान सुधरा।

सापेक्ष और मीट्रिक ज्यामिति का मात्रात्मक मूल्यांकन। MetricScenes टेस्ट सेट पर WildMoGe हर रिपोर्टेड माप में MoGe-2 से बेहतर रहा और स्थापित बेंचमार्क पर ZoeDepth, Metric3D V2, Depth Anything V2 व V3, MASt3R, UniDepth V2 और DepthPro के व्यापक रूप से प्रतिस्पर्धी रहा। इससे पता चलता है कि सामान्य ज्यामितीय गुणवत्ता घटाए बिना मीट्रिक अनुमान सुधरा।

WildMoGe ने MetricScenes पर मीट्रिक-पैमाना अनुमान को काफ़ी सुधारा, हर रिपोर्टेड माप में MoGe-2 को पीछे छोड़ा और MoGe-2, Depth Anything V3, Metric3D V2, UniDepth V2 तथा DepthPro से बेहतर मीट्रिक-ज्यामिति और मीट्रिक-गहराई स्कोर पाया।

NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring और HAMMER पर प्रदर्शन MoGe-2 के लगभग बराबर रहा। लेखक सुधार का श्रेय MetricScenes के मीट्रिक पर्यवेक्षण को देते हैं, जो सामान्य दृश्य-पुनर्निर्माण प्रदर्शन बनाए रखते हुए स्केल कोलैप्स घटाता है।

निष्कर्ष

शोध-पत्र में ‘स्केल कोलैप्स’ का MetricScenes समाधान कुछ हद तक कई डेटासेट को आखिरी प्रयास के रूप में जोड़ने और उनका सार निकालने वाली जटिल, कामचलाऊ मशीन जैसा लगता है; हर डेटासेट अपना मूल्यवान दृष्टिकोण देता है। यह कुछ-कुछ स्पर्श से हाथी का आकार पहचानने जैसा है।

शायद शोध-पत्र की सबसे मूल्यवान सेवा इस समस्या पर अधिक ध्यान खींचना है, जिसके लिए किसी नए या अनुकूलित सार्वभौमिक मानक की आवश्यकता दिखाई देती है। लेकिन ऐसा नवाचार मौजूदा विधियों की पुनरुत्पादकता और संगति में बाधा डालेगा, इसलिए उसे अत्यंत विश्वसनीय होना पड़ेगा।

 

* लेखकों के इनलाइन उद्धरणों को मैंने हाइपरलिंक में बदला है।

पहली बार गुरुवार, 11 जून 2026 को प्रकाशित

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai