زاوية Anderson

الذكاء الاصطناعي يواجه صعوبة في التعرّف على أحجام المعالم

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
AI-generated image (GPT-2 + Photoshop): High-angle view of a man holding a scale model of the Leaning Tower of Pisa on a grassy field, with an inset photograph showing the same model aligned from ground level to resemble the full-sized tower in the background.

تفهم نماذج الرؤية واللغة المعالم الشهيرة، لكنها لا تزال عاجزة عن رؤية الصورة الكاملة…

 

من أولى مهارات البقاء التي نكتسبها القدرة على التمييز بين الأشياء الصغيرة والأشياء البعيدة. يمكننا حجب القمر بإبهامنا من دون أن نظنه بحجم قطعة نقدية، لأننا استوعبنا مفهوم المقياس النسبي.

وهذه مهمة شديدة الصعوبة على نحو غير معتاد لأنظمة الرؤية الحاسوبية، إذ يعتمد معظمها على شروح مسبقة لا تساعدها على «فهم» المقياس بالطريقة التي يفهمه بها البشر. وفوق ذلك، بعد حد قريب نسبياً، يصبح كل ما في المسافة خارج قدرة الرؤية المجسمة على تحديد العمق: السيارة في الطرف البعيد من موقف السيارات، وناطحة السحاب الأبعد منها، والهلال الصاعد فوقها… كلها كيانات «ثنائية الأبعاد» بالنسبة إلى معظم أنظمة التعلم الآلي المعتمدة على الرؤية.

وبالطبع، عندما يكون مثال معين لجسم «بعيد» أسيء تفسيره ممثلاً جيداً في بيانات التدريب، قد يصعب خداع الأنظمة التي شاهدت تلك البيانات:

لا ينخدع ChatGPT-5.5 إطلاقاً بهذه الخدعة السياحية الكلاسيكية.

لا ينخدع ChatGPT-5.5 إطلاقاً بهذه الخدعة السياحية الكلاسيكية.

وكلما احتوى الفضاء الكامن الذي تدرب عليه النموذج قدراً أقل من هذه المعلومات المحددة والمتكررة، ازدادت حاجته إلى القدرة على التعميم واستيعاب مفاهيم المقياس التي ندركها في سن مبكرة. ومن دون ذلك، يمكن حتى للأمثلة الشهيرة أن تؤدي إلى تقديرات خاطئة للمقياس:

في هذا المثال الافتراضي المقتبس من الورقة الجديدة التي نبحثها اليوم، يظهر قوس النصر في خلفية منظور الكاميرا، لكن النظام لا يعرف حجمه ويقدمه بتقدير خاطئ. المصدر: https://arxiv.org/pdf/2606.02379

في هذا المثال الافتراضي المقتبس من الورقة الجديدة التي نبحثها اليوم، يظهر قوس النصر في خلفية منظور الكاميرا، لكن النظام لا يعرف حجمه ويقدمه بتقدير خاطئ. المصدر

ويكمن الخطر، مع الأجسام المحددة وذات السمات المميزة جداً مثل برج إيفل، في أن يلجأ النظام إلى اختصار لتقدير الحجم يكون صحيحاً للنموذج الأصلي، لكنه غير صحيح بالنسبة إلى النسخ الكثيرة المقلدة للمعلم الباريسي، التي تقع هي الأخرى خارج مدى تحديد العمق بالرؤية المجسمة، من دون أن تقترب من حجمه.

لذلك من المهم أن تتعامل أنظمة الرؤية مع المشاهد الجديدة التي لم ترها من قبل وهي مزودة بمجموعة مهارات جاهزة، لا بمجرد حزمة من «شيفرات الغش».

الارتقاء بالمقياس

ولهذا الغرض، يقدم تعاون جديد بين الولايات المتحدة والصين مجموعة بيانات علاجية، إلى جانب طريقة للتقدير، لمعالجة المشكلة:

يعدّل النهج الجديد نظاماً سابقاً من خلال مواد تدريب محسنة؛ أي بيانات متنوعة بما يكفي لتوفير فهم أعمق لمشكلات العمق.

يعدّل النهج الجديد نظاماً سابقاً من خلال مواد تدريب محسنة؛ أي بيانات متنوعة بما يكفي لتوفير فهم أعمق لمشكلات العمق.

أُطلقت مبادرة MetricScenes مع موقع إلكتروني مرافق، وتتيح إصدارات من البيانات والشيفرة.

وتقول الورقة*:

«وجدنا أن أحدث الأساليب الحالية كثيراً ما تفشل في تقدير المقياس الصحيح للمشهد، ما يؤدي إلى ظاهرة مستمرة لانهيار المقياس في سيناريوهات العالم الحقيقي غير المنضبطة.

«تُظهر [الصورة أعلاه] مثالاً تتوافر فيه مراجع دلالية واضحة، وهي الأشخاص، ومع ذلك تعرض نماذج مثل MoGe-2 تناقضاً كبيراً في المقياس عبر نطاق المسافات: يبدو المقياس المتري المتوقع للأجسام القريبة معقولاً، ففي هذه الحالة يظهر السياح بطول معقول، لكن مقياس البنى البعيدة يُقلل بدرجة حادة؛ إذ يتوقع النظام أن عرض قوس النصر في الخلفية لا يتجاوز 18.8 متراً، أي أقل من نصف العرض الحقيقي البالغ 44.8 متراً.

«افترض MoGe-2 معلماً مصغراً رغم الإشارات التي تناقض ذلك».

قوة الثلاثة

جُمعت المجموعة الجديدة التي أنشأها الباحثون عبر دمج ثلاث مجموعات بيانات قائمة: MegaScenes وAerialMegaDepth وStereo4D:

أمثلة لصور من MegaScenes، وهي جزء من المجموعة الجديدة. المصدر: https://megascenes.github.io/

أمثلة لصور من MegaScenes، وهي جزء من المجموعة الجديدة. المصدر

تكمن مشكلة مجموعات البيانات التي تسهم في MetricScenes، عند النظر إلى كل منها منفردة، في أنها تنطبق على مجالات محدودة، مثل لقطات السيارات من منظور السائق أو المشاهد الداخلية، بينما تتطلب معالجة المشكلة مجالاً مشتركاً يقرب أنظمة الرؤية من فهم بشري لمفهوم المقياس.

تأتي كل صورة مصحوبة بصورة RGB، وعمق مرصود جزئياً مشتق من البنية من الحركة (SfM) أو الرؤية المجسمة متعددة المناظر (MVS) أو غيرهما من الأوليات الهندسية، إلى جانب خريطة عمق مكتملة أُنشئت بعملية جديدة من مرحلتين لإكمال بواسون، وبيانات وصفية مرتبطة بالكاميرا.

ويؤدي الضبط الدقيق لإطار MoGe-2 على مجموعة البيانات الجديدة إلى «تخفيف كبير» لانهيار المقياس الذي يشير إليه الباحثون، مع تحقيق نتائج متفوقة، بحسب التقرير، في مشاهد المجال المفتوح وأداء هو الأحدث في المعايير ذات الصلة.

تحمل الورقة الجديدة عنوان عزيزتي، لقد صغّرت قوس النصر!، وأعدها أربعة باحثين من جامعة كورنيل وجامعة شانغهاي جياو تونغ.

المنهجية

تعتمد MetricScenes جزئياً على مجموعتي AerialMegaDepth وMegaScenes المذكورتين آنفاً، وهما مجموعتان من صور الإنترنت تمتدان من الأرشيفات التاريخية إلى صور السياح والتصوير الاحترافي. ورغم أن MegaScenes توفر إعادات بناء واسعة النطاق باستخدام البنية من الحركة (SfM)، فإن تلك المشاهد تفتقر إلى مقياس متأصل في العالم الحقيقي. ولمعالجة ذلك، استُخدمت صور محددة جغرافياً من خدمات الخرائط على الإنترنت لمحاذاة إعادات البناء مع مواقع وأبعاد مادية معروفة.

أما AerialMegaDepth فتتضمن بالفعل مناظر محددة جغرافياً من Google Earth، ما يوفر إعادات بناء للمعالم بمقياس متري.

وعولجت أخطاء إعادة البناء المحتملة، الناجمة عن بنى متشابهة بصرياً لكنها متباعدة جغرافياً، باستخدام MASt3R-SfM ومصنف Doppelgangers++. وبعد إعادة البناء بالرؤية المجسمة متعددة المناظر (MVS)، رُشحت تقديرات العمق غير المستقرة وآثار تسرب العمق بمزيج من اختبارات الاستقرار وتنبؤات MoGe-2:

يستمد AerialMegaDepth مقياس العالم الحقيقي من دمج صور الإنترنت مع مناظر Google Earth المحددة جغرافياً، بينما تُحاذى مشاهد MegaScenes مع الأبعاد المادية باستخدام صور مرجعية جغرافياً على مستوى الشارع. وبعد إعادة البناء بالرؤية المجسمة متعددة المناظر، تُرشح تقديرات العمق غير المستقرة وآثار تسرب العمق لإنتاج خرائط عمق مترية أنظف ملائمة للتدريب. تشير المربعات الصفراء إلى أجسام عابرة أُزيلت أثناء المعالجة، فيما تشير الحمراء إلى مناطق تسرب عمق صُححت.

يستمد AerialMegaDepth مقياس العالم الحقيقي من دمج صور الإنترنت مع مناظر Google Earth المحددة جغرافياً، بينما تُحاذى مشاهد MegaScenes مع الأبعاد المادية باستخدام صور مرجعية جغرافياً على مستوى الشارع. وبعد إعادة البناء بالرؤية المجسمة متعددة المناظر، تُرشح تقديرات العمق غير المستقرة وآثار تسرب العمق لإنتاج خرائط عمق مترية أنظف ملائمة للتدريب. تشير المربعات الصفراء إلى أجسام عابرة أُزيلت أثناء المعالجة، فيما تشير الحمراء إلى مناطق تسرب عمق صُححت.

ثم استُعيد المقياس المتري من خلال الصور ذات المرجع الجغرافي. يستمد AerialMegaDepth المقياس بالفعل من عروض Google Earth الملتقطة من مواقع معروفة، بينما حُوِّلت MegaScenes إلى أبعاد العالم الحقيقي باستخدام صور على مستوى الشارع، محددة جغرافياً ومأخوذة من خدمات الخرائط.

وطوبقت هذه الصور مع إعادات البناء القائمة باستخدام MASt3R، ثم نُقحت بمصنف Doppelganger، وحُوذيت بواسطة COLMAP، وحُدد مقياسها بتقدير قائم على RANSAC باستخدام إحداثيات مركزها مركز الأرض وثابتة بالنسبة إليها (ECEF). واستُبعدت المشاهد ذات تقديرات المقياس غير الموثوقة أو جودة التسجيل الضعيفة.

الرؤية المجسمة

وتعتمد مجموعة MetricScenes أيضاً على مجموعة بيانات Stereo4D المذكورة آنفاً، التي تضم آلاف تسلسلات الفيديو المجسم الواقعية الملتقطة بكاميرات VR180، ما يضيف بعداً زمنياً إلى اللقطات:

أُنشئت مجموعة Stereo4D من مقاطع فيديو مجسمة على الإنترنت، تجمع أوضاع الكاميرا وتقديرات العمق ومسارات الحركة لاستعادة مشاهد ثلاثية الأبعاد ديناميكية على نطاق واسع. وتضم المجموعة الناتجة مئات الآلاف من مقاطع الفيديو الممثلة كسحب نقطية ذات مسارات حركة طويلة المدى، ما يوفر مصدراً كبيراً للهندسة والحركة ثلاثيتي الأبعاد في العالم الحقيقي لتدريب نماذج الرؤية. المصدر: https://arxiv.org/pdf/2412.09621

أُنشئت مجموعة Stereo4D من مقاطع فيديو مجسمة على الإنترنت، تجمع أوضاع الكاميرا وتقديرات العمق ومسارات الحركة لاستعادة مشاهد ثلاثية الأبعاد ديناميكية على نطاق واسع. وتضم المجموعة الناتجة مئات الآلاف من مقاطع الفيديو الممثلة كسحب نقطية ذات مسارات حركة طويلة المدى، ما يوفر مصدراً كبيراً للهندسة والحركة ثلاثيتي الأبعاد في العالم الحقيقي لتدريب نماذج الرؤية. المصدر

ولأن المسافة المادية بين عدستي الكاميرا تختلف من جهاز إلى آخر، لم تُستخدم إلا مقاطع الفيديو ذات إعدادات الكاميرا الموثقة، ما أتاح استعادة عمق المشهد بمقياس دقيق من العالم الحقيقي.

اعتمدت Stereo4D في الأصل على نظام التدفق البصري SEA-RAFT لتقدير هندسة المشهد، لكن الباحثين وجدوا أن المعايرة غير المثالية للكاميرا قد تشوه المشاهد المعاد بناؤها، فتجعل البنى التي يفترض أن تكون متوازية تتقارب على نحو غير طبيعي. ولتحسين الدقة، استبدلوا بهذا النهج خط أنابيب لإعادة البناء متعدد المناظر يقدّر أوضاع الكاميرا والعمق معاً من عدة إطارات.

وبعد مقارنة π³ وDepthAnything V3 وMapAnything، اختير π³ لما يتمتع به من متانة هندسية وقدرة على الحفاظ على التفاصيل الدقيقة:

استعادة العمق المتري من Stereo4D. قد تنتج طرق المطابقة المجسمة القياسية هندسة مشوهة عندما تكون معايرة الكاميرا غير مثالية، بينما ينشئ π³ إعادات بناء أكثر اتساقاً ويحافظ على التفاصيل الدقيقة. ثم تُحاذى الهندسة المستعادة مع خط الأساس المادي المعروف للكاميرا المجسمة، فتنتج خرائط عمق مترية ذات مقياس دقيق.

استعادة العمق المتري من Stereo4D. قد تنتج طرق المطابقة المجسمة القياسية هندسة مشوهة عندما تكون معايرة الكاميرا غير مثالية، بينما ينشئ π³ إعادات بناء أكثر اتساقاً ويحافظ على التفاصيل الدقيقة. ثم تُحاذى الهندسة المستعادة مع خط الأساس المادي المعروف للكاميرا المجسمة، فتنتج خرائط عمق مترية ذات مقياس دقيق.

ولأن π³ يعيد بناء المشاهد بمقياس اعتباطي، حُوذيت خرائط العمق الناتجة مع أبعاد العالم الحقيقي باستخدام خط الأساس المادي المعروف لكل منظومة كاميرا مجسمة. وأزالت عمليات ترشيح إضافية الإطارات منخفضة الجودة، وتناقضات العمق، وأخطاء المعايرة، وتقديرات المقياس غير الموثوقة.

واستُخدمت أيضاً عملية من مرحلتين لإكمال العمق، تجمع تنبؤات المقدمة من MoGe-2 مع هندسة الخلفية المستخرجة بالرؤية المجسمة متعددة المناظر (MVS)، لإنتاج بيانات تدريب مترية أنظف، ذات مقياس أكثر اتساقاً وحدود أجسام أشد وضوحاً:

إكمال العمق على مرحلتين. قد يحافظ استخدام مرتكزات الخلفية وحدها على بنية المشهد مع تشويه المقياس الكلي، بينما يؤدي جمع قيود المقدمة والخلفية في تمريرة واحدة إلى انزياح المقياس وآثار عند الحدود. ويحافظ النهج ثنائي المراحل على مقياس متري متسق للأجسام القريبة والبعيدة مع إبقاء حدود الأجسام نظيفة.

إكمال العمق على مرحلتين. قد يحافظ استخدام مرتكزات الخلفية وحدها على بنية المشهد مع تشويه المقياس الكلي، بينما يؤدي جمع قيود المقدمة والخلفية في تمريرة واحدة إلى انزياح المقياس وآثار عند الحدود. ويحافظ النهج ثنائي المراحل على مقياس متري متسق للأجسام القريبة والبعيدة مع إبقاء حدود الأجسام نظيفة.

لاحظ الباحثون أن مجموعات صور الإنترنت تفتقر غالباً إلى عمق موثوق للمقدمة، بينما تفوّت الصور المجسمة كثيراً مناطق الخلفية البعيدة. ورغم قدرة MoGe-2 على استنتاج هندسة كثيفة عبر مشهد كامل، تميل تقديراته إلى مشكلة انهيار المقياس نفسها التي يسعى المشروع إلى معالجتها. لذلك صُمم خط أنابيب إكمال العمق ثنائي المراحل للجمع بين نقاط قوة MoGe-2 والرؤية المجسمة متعددة المناظر (MVS).

استُعيدت هندسة الخلفية باستخدام مرتكزات مترية مشتقة من MVS، ما أنشأ خريطة عمق أساسية ذات بنية واسعة النطاق موثوقة. وفي المرحلة الثانية، أُعيد إدخال تقديرات المقدمة من MoGe-2 عبر عملية إكمال واعية بالحواف، صُممت للحفاظ على حدود الأجسام مع منع انزياح المقياس وآثار تسرب العمق.

وتؤكد الورقة أن خرائط العمق الناتجة عن هذا النهج كانت مكتملة بصرياً وأكثر اتساقاً في مقياس العالم الحقيقي:

خط أنابيب إكمال العمق ثنائي المراحل. في المرحلة الأولى، تُستخدم مرتكزات الرؤية المجسمة متعددة المناظر لاستعادة هندسة الخلفية بمقياس متري موثوق. وفي المرحلة الثانية، يُعاد إدخال تقديرات المقدمة من MoGe-2 بعملية تركيب واعية بالحواف، لإنتاج خريطة عمق نهائية تحافظ على دقة النطاق الواسع والتفاصيل المحلية الحادة.

خط أنابيب إكمال العمق ثنائي المراحل. في المرحلة الأولى، تُستخدم مرتكزات الرؤية المجسمة متعددة المناظر لاستعادة هندسة الخلفية بمقياس متري موثوق. وفي المرحلة الثانية، يُعاد إدخال تقديرات المقدمة من MoGe-2 بعملية تركيب واعية بالحواف، لإنتاج خريطة عمق نهائية تحافظ على دقة النطاق الواسع والتفاصيل المحلية الحادة.

البيانات والاختبارات

تضم مجموعة MetricScenes النهائية 47,579 صورة حقيقية حصراً، تغطي 134 مشهداً من AerialMegaDepth؛ و29,583 صورة من 356 مشهداً في MegaScenes؛ و22,549 إطاراً مأخوذاً من 1,725 مقطع فيديو في Stereo4D.

وتغطي المجموعة، التي حُجزت منها عشرة مشاهد من كل مصدر لأغراض التحقق، السياقات الخارجية والداخلية، والمناظر الأرضية والجوية، والمناظر الطبيعية والحضرية. وهي بذلك توفر سياقاً مجمعاً ومتماسكاً لا تتضمنه أي من المجموعات المساهمة منفردة.

وفي اختبار نوعي أولي، ضبط الباحثون نموذج MoGe-2 من نوع ViT-Large-Normal ضبطاً دقيقاً على مجموعة MetricScenes الجديدة على مدى 10,000 تكرار، وبـحجم دفعة قدره 32، أي ما يعادل نحو ثلاث حقب تدريب. واستُخدمت أساليب القص وتعزيز البيانات العامة المأخوذة من اختبارات MoGe-2 الأصلية، وجرى التدريب بـمعدل تعلم قدره 1×10-6 للعمود الفقري و1×10-5 لجميع المعلمات الأخرى. وفي الاختبار النوعي، أجرى نموذج WildMoGe المضبوط بدقة إعادات بناء العمق، وقورن بنموذج MoGe-2 الأساسي وDepthAnything V3 وMetric3Dv2 وUniDepth v2 وDepthPro:

مقارنة إعادة بناء المعالم بالمقياس المتري. تظهر قياسات الحقيقة المرجعية من Google Maps في العمود الأيسر. عبر معالم واقعية لم تُشاهد أثناء التدريب، يقدم WildMoGe تقديرات للمقياس أقرب إلى الأبعاد المعروفة، بينما يقلل MoGe-2 وDepthAnything V3 وMetric3D V2 كثيراً من حجم البنى البعيدة. غالباً ما ينتج UniDepth V2 مقاييس أكثر معقولية لكنها غير متسقة، فيما ينتج DepthPro أحياناً أخطاء شديدة في المقياس.

مقارنة إعادة بناء المعالم بالمقياس المتري. تظهر قياسات الحقيقة المرجعية من Google Maps في العمود الأيسر. عبر معالم واقعية لم تُشاهد أثناء التدريب، يقدم WildMoGe تقديرات للمقياس أقرب إلى الأبعاد المعروفة، بينما يقلل MoGe-2 وDepthAnything V3 وMetric3D V2 كثيراً من حجم البنى البعيدة. غالباً ما ينتج UniDepth V2 مقاييس أكثر معقولية لكنها غير متسقة، فيما ينتج DepthPro أحياناً أخطاء شديدة في المقياس.

وتقول الورقة عن هذه النتيجة:

«يستعيد [WildMoGe] باستمرار مقاييس مطلقة أدق عبر معالم متنوعة، مع مطابقة وثيقة للأبعاد المرجعية، مثل 31.4 متراً مقابل 32.4 متراً لمتحف فيلادلفيا للفنون، و46.7 متراً مقابل 46.5 متراً لساحة Piazza della Signorina. ويُظهر MoGe-2 وDepthAnything v3 وMetric3D v25 سلوك انهيار المقياس، إذ يقللون باستمرار من حجم البنى في المجال البعيد.

«ينتج UniDepth v2 مقاييس أكثر واقعية لكنه يظل منحرفاً عن الحقيقة المرجعية، وكثيراً ما يفشل DepthPro في استعادة المقياس المطلق، منتجاً نتائج أصغر من الواقع بمراتب عديدة. لاحظوا أن هذه المشاهد غير موجودة في مجموعة التدريب.

«يثبت هذا الأداء أن WildMoGe يستطيع التعميم على محتوى غير مرئي، بدلاً من مجرد حفظ مشاهد التدريب».

وللتأكد من أن المكاسب لم تقتصر على المعالم والمشاهد الخارجية الكبيرة، قيّم الباحثون WildMoGe أيضاً على صور داخلية عادية وصور على مستوى الشارع. وقد أنتج تقديرات للمقياس متسقة إجمالاً مع MoGe-2، مع تحقيق دقة أفضل في مشهد فناء ETH3D:

مقارنة على مشاهد قياسية. في البيئات الداخلية العادية والبيئات على مستوى الشارع، ينتج WildMoGe تقديرات للمقياس متسقة إجمالاً مع MoGe-2، مع تحقيق دقة أعلى في معيار فناء ETH3D واستعادة أبعاد أجسام أقرب إلى القياسات المرجعية.

مقارنة على مشاهد قياسية. في البيئات الداخلية العادية والبيئات على مستوى الشارع، ينتج WildMoGe تقديرات للمقياس متسقة إجمالاً مع MoGe-2، مع تحقيق دقة أعلى في معيار فناء ETH3D واستعادة أبعاد أجسام أقرب إلى القياسات المرجعية.

ولتقييم ما إذا كانت MetricScenes قد حسنت فعلاً الاستدلال بالمقياس المتري، أُجري التقييم على مجموعة اختبار مخصصة لـMetricScenes وكذلك على NYUv2 وKITTI وETH3D وiBims-1 وGSO وSintel وDDAD وDIODE وSpring وHAMMER.

ويشير الباحثون إلى أن الحصول على قياسات مرجعية كثيفة لصور الإنترنت غير المنضبطة يظل صعباً، ما يعني أن تسميات MetricScenes ليست مثالية. ولذلك أُدرجت معايير قياسية للتحقق من أن المكاسب لم تأت على حساب الأداء الهندسي العام.

وأُجريت المقارنات مع MoGe-2 وUniDepth V2 وDepthPro وMASt3R وDepth Anything V2 وDepth Anything V3 وZoeDepth وMetric3D V2:

تقييم كمي للهندسة النسبية والمترية. تفوق WildMoGe في مجموعة اختبار MetricScenes على MoGe-2 في كل مقياس مبلغ عنه، مع بقائه منافساً إجمالاً لـZoeDepth وMetric3D V2 وDepth Anything V2 وDepth Anything V3 وMASt3R وUniDepth V2 وDepthPro على المعايير الراسخة، ما يشير إلى تحسين تقدير المقياس المتري من دون التضحية بجودة إعادة البناء الهندسي العامة.

تقييم كمي للهندسة النسبية والمترية. تفوق WildMoGe في مجموعة اختبار MetricScenes على MoGe-2 في كل مقياس مبلغ عنه، مع بقائه منافساً إجمالاً لـZoeDepth وMetric3D V2 وDepth Anything V2 وDepth Anything V3 وMASt3R وUniDepth V2 وDepthPro على المعايير الراسخة، ما يشير إلى تحسين تقدير المقياس المتري من دون التضحية بجودة إعادة البناء الهندسي العامة.

حسّن WildMoGe بدرجة كبيرة التنبؤ بالمقياس المتري على MetricScenes، فتفوق على MoGe-2 في كل مقياس مبلغ عنه، وحقق درجات أقوى في الهندسة المترية والعمق المتري من MoGe-2 وDepth Anything V3 وMetric3D V2 وUniDepth V2 وDepthPro.

وظل الأداء على NYUv2 وKITTI وETH3D وiBims-1 وGSO وSintel وDDAD وDIODE وSpring وHAMMER مماثلاً إجمالاً لأداء MoGe-2. ويعزو الباحثون هذه المكاسب إلى الإشراف المتري في MetricScenes، الذي يساعد، على ما يبدو، في تقليل انهيار المقياس مع الحفاظ على أداء إعادة بناء المشهد العام.

الخلاصة

يبدو حل MetricScenes لمشكلة «انهيار المقياس» في الورقة أشبه إلى حد ما بآلة مرتجلة على طريقة هيث روبنسون؛ محاولة أخيرة لدمج عدة مجموعات بيانات وتقطيرها، لكل منها منظور قيّم تسهم به. وهو يشبه قليلاً محاولة معرفة شكل فيل عن طريق اللمس.

ولعل أهم خدمة تقدمها الورقة هي جذب مزيد من الانتباه إلى المشكلة، التي يبدو أنها تتطلب معياراً عالمياً جديداً أو معدلاً. لكن لأن مثل هذا الابتكار سيؤثر في قابلية إعادة إنتاج المنهجيات الحالية واتساقها، فسيتعين أن يكون مقنعاً جداً.

 

* حوّلتُ استشهادات المؤلفين المضمنة في النص إلى روابط تشعبية.

نُشر لأول مرة يوم الخميس 11 يونيو 2026

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai