Anderson का एंगल
एआई को लैंडमार्क का आकार पहचानने में कठिनाई होती है

विज़न-लैंग्वेज मॉडल स्मारकों को समझते हैं, लेकिन वे अब भी पूरी तस्वीर नहीं देख पाते…
जीवन-रक्षा से जुड़ी सबसे शुरुआती क्षमताओं में से एक है छोटी और दूर की वस्तुओं में अंतर करना। हम अंगूठे से चंद्रमा को ढक सकते हैं, फिर भी उसे सिक्के जितना नहीं मानते, क्योंकि सापेक्ष पैमाने की समझ हमारे भीतर बस चुकी है।
कंप्यूटर-विज़न प्रणालियों के लिए यह असाधारण रूप से कठिन काम है, क्योंकि अधिकतर प्रणालियाँ पहले से किए गए एनोटेशन पर निर्भर रहती हैं, जो उन्हें मनुष्यों की तरह पैमाना ‘समझने’ में मदद नहीं करता। इसके अलावा, एक निश्चित और काफ़ी निकट सीमा के बाद दूरी की हर चीज़ इतनी दूर हो जाती है कि स्टीरियो विज़न उसका गहराई-आकलन नहीं कर सकता—पार्किंग के दूसरे छोर की कार, उससे आगे की गगनचुंबी इमारत और उसके ऊपर उगता अर्धचंद्र; अधिकांश विज़न-आधारित मशीन-लर्निंग प्रणालियों के लिए ये सभी ‘2D’ इकाइयाँ हैं।
जब किसी ‘दूर’ लेकिन गलत समझी गई वस्तु का विशेष उदाहरण प्रशिक्षण डेटा में पर्याप्त मात्रा में मौजूद हो, तो वह डेटा देख चुकी प्रणाली को धोखा देना कठिन हो सकता है:

ChatGPT-5.5 इस लोकप्रिय पर्यटक चाल से बिल्कुल प्रभावित नहीं होता।
किसी मॉडल के प्रशिक्षित लेटेंट स्पेस में ऐसी विशिष्ट और बार-बार दोहराई गई जानकारी जितनी कम होगी, उसे उतना ही अधिक सामान्यीकरण करना और पैमाने की उन अवधारणाओं को आत्मसात करना पड़ेगा जिन्हें हम छोटी उम्र में समझ लेते हैं। इसके बिना प्रसिद्ध उदाहरण भी पैमाने का गलत अनुमान करा सकते हैं:

आज चर्चा की जा रही नई शोध-पत्र से लिया गया यह काल्पनिक उदाहरण कैमरे की पृष्ठभूमि में आर्क द ट्रायम्फ दिखाता है, लेकिन प्रणाली उसका आकार नहीं जानती और गलत अनुमान लगाती है। स्रोत
एफ़िल टावर जैसी विशिष्ट और आसानी से पहचानी जाने वाली वस्तुओं के साथ खतरा यह है कि प्रणाली आकार के अनुमान के लिए ऐसा शॉर्टकट अपनाए जो मूल स्मारक के लिए सही हो, लेकिन पेरिस के इस स्मारक की अनेक प्रतिकृतियों के लिए नहीं। वे भी स्टीरियो-विज़न की दूरी से बाहर हो सकती हैं, पर आकार में कहीं छोटी हैं।
इसलिए यह महत्वपूर्ण है कि विज़न प्रणालियाँ नए, पहले न देखे गए दृश्यों का सामना तैयार कौशलों के साथ करें, केवल ‘चीट कोड’ के संग्रह के साथ नहीं।
पैमाना बढ़ाना
इसी उद्देश्य से अमेरिका और चीन के एक नए सहयोग ने समस्या को संबोधित करने वाली अनुमान-विधि के साथ सुधारात्मक डेटासेट प्रस्तुत किया है:

नया तरीका बेहतर प्रशिक्षण सामग्री के माध्यम से पहले की प्रणाली को संशोधित करता है—इतना विविध डेटा कि गहराई से जुड़ी समस्याओं की बेहतर समझ बन सके।
सहायक वेबसाइट के साथ शुरू की गई MetricScenes पहल ने डेटा और कोड जारी किए हैं।
शोध-पत्र में कहा गया है*:
“हमने पाया कि मौजूदा अत्याधुनिक विधियाँ दृश्य के सही पैमाने का अनुमान लगाने में बार-बार विफल होती हैं, जिससे वास्तविक दुनिया के अनियंत्रित परिदृश्यों में ‘स्केल कोलैप्स’ की लगातार समस्या पैदा होती है।
“ऊपर की छवि में स्पष्ट अर्थगत संदर्भ—लोग—मौजूद हैं, फिर भी MoGe-2 जैसे मॉडल अलग-अलग दूरियों पर पैमाने में बड़ा विरोधाभास दिखाते हैं। निकट वस्तुओं का अनुमानित मीट्रिक पैमाना उचित है—पर्यटक सामान्य ऊँचाई के दिखते हैं—लेकिन दूर की संरचनाओं का पैमाना बहुत कम आँका गया है। पृष्ठभूमि में आर्क द ट्रायम्फ की अनुमानित चौड़ाई केवल 18.8 मीटर है, जो वास्तविक 44.8 मीटर से दो गुना से भी अधिक छोटी है।
“विपरीत संकेतों के बावजूद MoGe-2 ने स्मारक को लघु रूप में मान लिया।”
तीन की शक्ति
लेखकों ने तीन मौजूदा डेटासेट को मिलाकर नया संग्रह बनाया: MegaScenes, AerialMegaDepth और Stereo4D:

नए संग्रह का हिस्सा MegaScenes से उदाहरण छवियाँ। स्रोत
अलग-अलग देखने पर MetricScenes में योगदान देने वाले प्रत्येक डेटासेट की समस्या यह है कि वह सीमित क्षेत्र पर लागू होता है, जैसे कार के दृष्टिकोण वाले वीडियो या अंदरूनी दृश्य। समस्या हल करने और विज़न प्रणालियों को पैमाने की मानव-सदृश अवधारणा के निकट लाने के लिए एक संयुक्त क्षेत्र आवश्यक है।
हर छवि के साथ RGB चित्र, स्ट्रक्चर फ्रॉम मोशन (SfM), मल्टी-व्यू स्टीरियो (MVS) या अन्य ज्यामितीय पूर्व-जानकारी से निकली आंशिक गहराई, नई दो-चरणीय पॉइसन कंप्लीशन प्रक्रिया से बनी पूरी डेप्थ मैप और संबंधित कैमरा मेटाडेटा दिया जाता है।
नए डेटासेट पर MoGe-2 ढाँचे की फ़ाइन-ट्यूनिंग लेखकों द्वारा बताए गए स्केल कोलैप्स को “काफ़ी हद तक कम करती है” और कथित रूप से खुले क्षेत्र के दृश्यों में बेहतर परिणाम तथा संबंधित बेंचमार्क पर अत्याधुनिक प्रदर्शन देती है।
नई शोध-पत्र का शीर्षक हनी, मैंने आर्क द ट्रायम्फ को छोटा कर दिया! है और इसे कॉर्नेल विश्वविद्यालय तथा शंघाई जिआओ तोंग विश्वविद्यालय के चार शोधकर्ताओं ने लिखा है।
विधि
MetricScenes कुछ हद तक पहले बताए गए AerialMegaDepth और MegaScenes पर आधारित है—ऐतिहासिक अभिलेखों, पर्यटक चित्रों और पेशेवर फ़ोटोग्राफ़ी से बनी इंटरनेट छवियों के दो संग्रह। MegaScenes बड़े पैमाने की स्ट्रक्चर फ्रॉम मोशन (SfM) पुनर्निर्मिति देता है, लेकिन दृश्यों में स्वाभाविक वास्तविक-विश्व पैमाना नहीं होता। इसे सुधारने के लिए ऑनलाइन मानचित्र सेवाओं की जियोटैग की गई छवियों से पुनर्निर्मित दृश्यों को ज्ञात भौतिक स्थानों और आयामों से संरेखित किया गया।
इसके विपरीत AerialMegaDepth पहले से जियोटैग किए Google Earth दृश्यों को शामिल करता है और स्मारकों की मीट्रिक-पैमाने वाली पुनर्निर्मिति उपलब्ध कराता है।
दिखने में समान लेकिन भौगोलिक रूप से दूर संरचनाओं से होने वाली संभावित पुनर्निर्माण त्रुटियों को MASt3R-SfM और Doppelgangers++ क्लासिफ़ायर से सुधारा गया। मल्टी-व्यू स्टीरियो (MVS) पुनर्निर्माण के बाद अस्थिर गहराई अनुमानों और डेप्थ-ब्लीडिंग कलाकृतियों को स्थिरता परीक्षणों तथा MoGe-2 की भविष्यवाणियों के संयोजन से फ़िल्टर किया गया:

AerialMegaDepth इंटरनेट छवियों को जियोटैग किए Google Earth दृश्यों से मिलाकर वास्तविक पैमाना निकालता है, जबकि MegaScenes को भू-संदर्भित सड़क-स्तरीय छवियों से भौतिक आयामों में संरेखित किया जाता है। MVS पुनर्निर्माण के बाद अस्थिर गहराई और डेप्थ-ब्लीडिंग हटाकर प्रशिक्षण के लिए स्वच्छ मीट्रिक डेप्थ मैप बनाए जाते हैं। पीले बॉक्स हटाई गई अस्थायी वस्तुएँ और लाल बॉक्स सुधारे गए डेप्थ-ब्लीडिंग क्षेत्र दिखाते हैं।
फिर भू-संदर्भित चित्रों के माध्यम से मीट्रिक पैमाना वापस पाया गया। AerialMegaDepth ज्ञात स्थानों से लिए Google Earth रेंडरिंग से पैमाना निकालता है, जबकि MegaScenes को मानचित्र सेवाओं से मिली जियोटैग वाली सड़क-स्तरीय छवियों के आधार पर वास्तविक आयामों में संरेखित किया गया।
इन छवियों को MASt3R से मौजूदा पुनर्निर्मिति से मिलाया गया, Doppelganger क्लासिफ़ायर से सुधारा गया, COLMAP से संरेखित किया गया और RANSAC आधारित अनुमान से अर्थ-सेंटर्ड, अर्थ-फ़िक्स्ड (ECEF) निर्देशांकों में मापा गया। अविश्वसनीय पैमाने या खराब पंजीकरण वाले दृश्य हटा दिए गए।
स्टीरियो में देखना
MetricScenes संग्रह पहले बताए Stereo4D डेटासेट का भी उपयोग करता है, जिसमें VR180 कैमरों से रिकॉर्ड किए गए वास्तविक दुनिया के हजारों स्टीरियोस्कोपिक वीडियो क्रम हैं और इस प्रकार चित्रों में समय का आयाम जुड़ता है:

Stereo4D स्टीरियोस्कोपिक इंटरनेट वीडियो से बना है और कैमरा पोज़, गहराई अनुमान तथा गति-पथ मिलाकर बड़े पैमाने पर गतिशील 3D दृश्य पुनर्निर्मित करता है। इसमें लंबी दूरी के गति-पथ वाली पॉइंट-क्लाउड के रूप में सैकड़ों हजार वीडियो क्लिप हैं, जो विज़न मॉडल प्रशिक्षण के लिए वास्तविक 3D ज्यामिति और गति का बड़ा स्रोत देते हैं। स्रोत
अलग उपकरणों में दोनों कैमरा लेंसों की भौतिक दूरी बदलती है, इसलिए केवल दस्तावेजीकृत कैमरा विन्यास वाले वीडियो उपयोग किए गए, जिससे दृश्य की गहराई सटीक वास्तविक पैमाने पर निकाली जा सकी।
Stereo4D ने मूल रूप से दृश्य-ज्यामिति का अनुमान लगाने के लिए ऑप्टिकल-फ़्लो प्रणाली SEA-RAFT का उपयोग किया। लेकिन लेखकों ने पाया कि अपूर्ण कैमरा कैलिब्रेशन पुनर्निर्मित दृश्यों को विकृत कर सकता है और समानांतर संरचनाओं को अस्वाभाविक रूप से मिलाता दिखा सकता है। इसलिए उन्होंने इसे बहु-दृश्य पुनर्निर्माण पाइपलाइन से बदला, जो कई फ़्रेमों से कैमरा पोज़ और गहराई का संयुक्त अनुमान लगाती है।
π³, DepthAnything V3 और MapAnything की तुलना के बाद π³ को उसकी ज्यामितीय मजबूती और सूक्ष्म विवरण बचाने की क्षमता के कारण चुना गया:

Stereo4D से मीट्रिक गहराई की पुनर्प्राप्ति। अपूर्ण कैलिब्रेशन में सामान्य स्टीरियो मिलान विकृत ज्यामिति दे सकता है, जबकि π³ अधिक सुसंगत दृश्य पुनर्निर्माण और बारीक विवरण देता है। पुनर्प्राप्त ज्यामिति को स्टीरियो कैमरे की ज्ञात भौतिक बेसलाइन से संरेखित कर सटीक मीट्रिक डेप्थ मैप बनाए जाते हैं।
π³ दृश्य को मनमाने पैमाने पर पुनर्निर्मित करता है, इसलिए तैयार डेप्थ मैप को प्रत्येक स्टीरियो कैमरा रिग की ज्ञात भौतिक बेसलाइन से वास्तविक आयामों में संरेखित किया गया। अतिरिक्त फ़िल्टरिंग ने खराब फ़्रेम, गहराई की असंगतियाँ, कैलिब्रेशन त्रुटियाँ और अविश्वसनीय पैमाने हटाए।
दो-चरणीय डेप्थ-कंप्लीशन प्रक्रिया भी इस्तेमाल हुई, जिसमें MoGe-2 के अग्रभूमि अनुमान को मल्टी-व्यू स्टीरियो (MVS) की पृष्ठभूमि ज्यामिति से जोड़ा गया। इससे अधिक सुसंगत पैमाने और स्पष्ट वस्तु-सीमाओं वाला स्वच्छ प्रशिक्षण डेटा मिला:

दो-चरणीय गहराई पूर्णता। केवल पृष्ठभूमि एंकर दृश्य संरचना बचाते हुए कुल पैमाना बिगाड़ सकते हैं, जबकि एक ही चरण में अग्रभूमि और पृष्ठभूमि बाधाएँ जोड़ने से स्केल ड्रिफ्ट और सीमा कलाकृतियाँ आती हैं। दो-चरणीय तरीका निकट और दूर दोनों वस्तुओं में सुसंगत मीट्रिक पैमाना तथा साफ़ सीमाएँ बनाए रखता है।
लेखकों ने देखा कि इंटरनेट फ़ोटो संग्रहों में प्रायः विश्वसनीय अग्रभूमि गहराई नहीं होती, जबकि स्टीरियो चित्र दूर की पृष्ठभूमि छोड़ देते हैं। MoGe-2 पूरे दृश्य में सघन ज्यामिति का अनुमान लगा सकता है, लेकिन उसके अनुमान उसी स्केल-कोलैप्स समस्या की ओर जाते हैं जिसे परियोजना हल करना चाहती है। इसलिए दो-चरणीय पाइपलाइन MoGe-2 और MVS की शक्तियाँ मिलाने के लिए बनाई गई।
MVS से मिले मीट्रिक एंकरों से पृष्ठभूमि ज्यामिति निकालकर विश्वसनीय बड़े पैमाने की संरचना वाला आधार डेप्थ मैप बनाया गया। दूसरे चरण में MoGe-2 के अग्रभूमि अनुमान को किनारों के प्रति सजग पूर्णता प्रक्रिया से दोबारा जोड़ा गया, ताकि वस्तु-सीमाएँ बनी रहें और स्केल ड्रिफ्ट व डेप्थ-ब्लीडिंग न हो।
शोध-पत्र के अनुसार इस तरीके से बने डेप्थ मैप देखने में पूर्ण और वास्तविक पैमाने में अधिक सुसंगत थे:

दो-चरणीय गहराई पूर्णता पाइपलाइन। पहले चरण में MVS एंकर विश्वसनीय मीट्रिक पैमाने पर पृष्ठभूमि ज्यामिति निकालते हैं। दूसरे में MoGe-2 के अग्रभूमि अनुमान किनारों के प्रति सजग संयोजन से जोड़े जाते हैं, जिससे बड़े पैमाने की सटीकता और तीखे स्थानीय विवरण दोनों वाला अंतिम डेप्थ मैप बनता है।
डेटा और परीक्षण
अंतिम MetricScenes संग्रह में केवल वास्तविक दुनिया की 47,579 छवियाँ हैं, जो AerialMegaDepth के 134 दृश्यों को कवर करती हैं; MegaScenes के 356 दृश्यों से 29,583 छवियाँ; और Stereo4D के 1,725 वीडियो से लिए 22,549 फ़्रेम हैं।
प्रत्येक स्रोत के दस दृश्य वैलिडेशन के लिए अलग रखे गए। संग्रह में बाहरी और आंतरिक संदर्भ, ज़मीनी और हवाई दृश्य, तथा शहरी और प्राकृतिक परिदृश्य शामिल हैं—एक ऐसा संयुक्त और सुसंगत संदर्भ जो योगदान देने वाले किसी एक संग्रह में उपलब्ध नहीं है।
प्रारंभिक गुणात्मक परीक्षण में लेखकों ने MoGe-2 के ViT-Large-Normal मॉडल को MetricScenes पर 10,000 इटरेशन और 32 के बैच आकार के साथ फ़ाइन-ट्यून किया—लगभग तीन एपोक। क्रॉपिंग और सामान्य डेटा ऑगमेंटेशन मूल MoGe-2 परीक्षणों से लिए गए। प्रशिक्षण में लर्निंग रेट 1×10-6 (बैकबोन) और 1×10-5 (अन्य पैरामीटर) था। गुणात्मक परीक्षण में फ़ाइन-ट्यून किए WildMoGe की तुलना आधार MoGe-2, DepthAnything V3, Metric3Dv2, UniDepth v2 और DepthPro से की गई:

स्मारकों की मीट्रिक-पैमाना पुनर्निर्मिति की तुलना। बाएँ कॉलम में Google Maps के वास्तविक माप हैं। अनदेखे स्मारकों पर WildMoGe ज्ञात आयामों के अधिक निकट अनुमान देता है, जबकि MoGe-2, DepthAnything V3 और Metric3D V2 दूर की संरचनाओं का आकार अक्सर कम आँकते हैं। UniDepth V2 अधिक यथार्थवादी लेकिन असंगत और DepthPro कभी-कभी गंभीर रूप से गलत पैमाने देता है।
इस परिणाम पर शोध-पत्र कहता है:
“[WildMoGe] विभिन्न स्मारकों पर लगातार अधिक सटीक पूर्ण पैमाना निकालता है और वास्तविक आयामों के निकट रहता है—जैसे फिलाडेल्फिया म्यूज़ियम ऑफ़ आर्ट के लिए 31.4 मीटर बनाम 32.4 मीटर और Piazza della Signorina के लिए 46.7 बनाम 46.5 मीटर। MoGe-2, DepthAnything v3 और Metric3D v25 स्केल-कोलैप्स दिखाते हुए दूर की संरचनाओं का आकार लगातार कम आँकते हैं।
“UniDepth v2 अधिक यथार्थवादी पैमाने देता है, लेकिन वास्तविक मान से भटकता है। DepthPro अक्सर पूर्ण पैमाना निकालने में विफल होकर वास्तविकता से कई क्रम छोटे परिणाम देता है। ध्यान रहे कि ये दृश्य प्रशिक्षण सेट में नहीं हैं।
“यह प्रदर्शन बताता है कि WildMoGe केवल प्रशिक्षण दृश्य याद करने के बजाय अनदेखी सामग्री पर सामान्यीकरण कर सकता है।”
यह सुनिश्चित करने के लिए कि सुधार केवल स्मारकों और बड़े बाहरी दृश्यों तक सीमित नहीं है, लेखकों ने WildMoGe को सामान्य अंदरूनी और सड़क-स्तरीय छवियों पर भी परखा। वहाँ उसके पैमाने MoGe-2 से व्यापक रूप से मेल खाते थे, जबकि ETH3D आँगन दृश्य पर सटीकता बेहतर थी:

मानक दृश्यों की तुलना। सामान्य अंदरूनी और सड़क-स्तरीय वातावरण में WildMoGe के पैमाने MoGe-2 से व्यापक रूप से मेल खाते हैं, जबकि ETH3D आँगन बेंचमार्क पर वह वास्तविक माप के अधिक निकट वस्तु आयाम देकर बेहतर सटीकता हासिल करता है।
MetricScenes ने मीट्रिक-पैमाना तर्क में सचमुच सुधार किया या नहीं, यह जानने के लिए समर्पित MetricScenes टेस्ट सेट तथा NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring और HAMMER पर मूल्यांकन हुआ।
लेखक बताते हैं कि अनियंत्रित इंटरनेट चित्रों के लिए सघन वास्तविक माप प्राप्त करना कठिन है, इसलिए MetricScenes लेबल पूरी तरह सटीक नहीं हैं। सामान्य ज्यामितीय प्रदर्शन की कीमत पर सुधार न हुआ हो, इसकी पुष्टि के लिए मानक बेंचमार्क शामिल किए गए।
तुलना MoGe-2, UniDepth V2, DepthPro, MASt3R, Depth Anything V2, Depth Anything V3, ZoeDepth और Metric3D V2 से हुई:

सापेक्ष और मीट्रिक ज्यामिति का मात्रात्मक मूल्यांकन। MetricScenes टेस्ट सेट पर WildMoGe हर रिपोर्टेड माप में MoGe-2 से बेहतर रहा और स्थापित बेंचमार्क पर ZoeDepth, Metric3D V2, Depth Anything V2 व V3, MASt3R, UniDepth V2 और DepthPro के व्यापक रूप से प्रतिस्पर्धी रहा। इससे पता चलता है कि सामान्य ज्यामितीय गुणवत्ता घटाए बिना मीट्रिक अनुमान सुधरा।
WildMoGe ने MetricScenes पर मीट्रिक-पैमाना अनुमान को काफ़ी सुधारा, हर रिपोर्टेड माप में MoGe-2 को पीछे छोड़ा और MoGe-2, Depth Anything V3, Metric3D V2, UniDepth V2 तथा DepthPro से बेहतर मीट्रिक-ज्यामिति और मीट्रिक-गहराई स्कोर पाया।
NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring और HAMMER पर प्रदर्शन MoGe-2 के लगभग बराबर रहा। लेखक सुधार का श्रेय MetricScenes के मीट्रिक पर्यवेक्षण को देते हैं, जो सामान्य दृश्य-पुनर्निर्माण प्रदर्शन बनाए रखते हुए स्केल कोलैप्स घटाता है।
निष्कर्ष
शोध-पत्र में ‘स्केल कोलैप्स’ का MetricScenes समाधान कुछ हद तक कई डेटासेट को आखिरी प्रयास के रूप में जोड़ने और उनका सार निकालने वाली जटिल, कामचलाऊ मशीन जैसा लगता है; हर डेटासेट अपना मूल्यवान दृष्टिकोण देता है। यह कुछ-कुछ स्पर्श से हाथी का आकार पहचानने जैसा है।
शायद शोध-पत्र की सबसे मूल्यवान सेवा इस समस्या पर अधिक ध्यान खींचना है, जिसके लिए किसी नए या अनुकूलित सार्वभौमिक मानक की आवश्यकता दिखाई देती है। लेकिन ऐसा नवाचार मौजूदा विधियों की पुनरुत्पादकता और संगति में बाधा डालेगा, इसलिए उसे अत्यंत विश्वसनीय होना पड़ेगा।
* लेखकों के इनलाइन उद्धरणों को मैंने हाइपरलिंक में बदला है।
पहली बार गुरुवार, 11 जून 2026 को प्रकाशित












