Anderson’un Açısı
Yapay Zeka, Anıtların Büyüklüğünü Tanımakta Zorlanıyor

Görme Dili Modelleri anıtları anlıyor, ancak vẫn tüm resmi göremiyor…
En erken geliştirdiğimiz hayatta kalma becerilerinden biri, küçük veya uzakta olan şeyler arasında ayrım yapma yeteneğidir. Ayı parmağımızla kapatabiliriz, ancak bunun bir dime büyüklüğünde olduğunu düşünmeyiz, çünkü göreceli ölçek anlayışını içselleştirmişizdir.
Bu, bilgisayar görme sistemleri için alışılmadık derecede zor bir görevdir, çünkü çoğu, ölçek anlayışını aynı şekilde insancıl bir şekilde anlamalarına yardımcı olmayan önceden eklenmiş açıklamaya dayanır. Dahası, belirli ve oldukça yakın bir sınırın ötesinde, uzaklıktaki her şey stereo görme yeteneğinin çözme yeteneğinin ötesindedir – otoparkın uzak ucundaki araba; otoyolun ötesindeki gökdelen ve onun üzerinde yükselen hilal ay… hepsi için “2B” varlıklarıdır. çoğu görme tabanlı makine öğrenimi sistemi.
Elbette, belirli bir “uzak” ancak yanlış yorumlanan bir nesne örneği, eğitim verilerine iyi bir şekilde temsil edildiğinde, bu verileri gören sistemler kandırılması zor olabilir:

ChatGPT-5.5, bu klasik turistik trope’den etkilenmedi.
Modelin eğitilmiş gizli uzayı, bu tür özel ve sıkça tekrarlanan bilgileri içermediğinde, ölçek kavramlarını genç yaşta kavradığımız şekilde genelleştirmek ve içselleştirmek için daha fazla ihtiyaç duyacaktır. Bunun olmaması durumunda, hatta ünlü örnekler bile hala ölçek yanlış hesaplamalarına neden olabilir:

Bu spekülatif örnek, bugün incelediğimiz yeni makaleden uyarlanmıştır, kameranın POV’sunda Arc De Triomphe arka planda yer alıyor – ancak sistem onun ne kadar büyük olduğunu bilmiyor ve yanlış bir tahminde bulunuyor. Kaynak
Özellikle Eiffel Kulesi gibi spesifik ve yüksek karakteristik nesneler için tehlike, sistemin orijinal model için doğru olan ancak Eiffel Kulesi’nin Paris’teki çoklu taklitlerinin, stereo çözünürlük mesafesinin ötesinde ancak çok daha küçük olan aynı uzaklıkta olanların doğru olmayan bir büyüklük tahmini kısaltmasına başvurmasıdır.
Dolayısıyla, görme sistemlerinin yeni (görülmemiş) görüntülere hazır bir beceri setiyle yaklaşması önemlidir ve sadece bir dizi “hile kodu” ile değil.
Ölçeği Artırma
Bu amaçla, ABD ve Çin arasındaki yeni bir işbirliği, bu sorunu ele alan bir veri kümesi ve bir tahmin yöntemi sunar:

Yeni yaklaşım, daha derin bir derinlik anlayışını sağlamak için yeterli varyasyona sahip eğitim materyali ile önceki bir sistemi değiştirir.
Bir eşlik eden web sitesi ile birlikte başlatılan MetricScenes girişimi, veri ve kod yayınlarını içerir.
Makalede denir*:
‘[Mevcut] durumun en iyi yöntemleri, sahne ölçeğini doğru şekilde tahmin etmede sık sık başarısız oluyor, “vahşi” senaryolarda sürekli bir ölçek çökmesi fenomenine yol açıyor.’
‘[Yukarıdaki resim] açık semantik referanslar (insanlar) mevcut olduğunda, ancak MoGe-2 gibi modellerin önemli bir ölçek tutarsızlığı sergilediği bir örnek gösterir: yakın alan nesneleri için öngörülen metrik ölçek makul – bu durumda turistlerin makul bir yüksekliği var – ancak uzak alan yapıları için ölçek dramatik olarak küçümseniyor – burada, arka plandaki Arc de Triomphe yalnızca 18.8 m genişliğinde öngörülüyor. metrik olarak, bu, gerçek genişlikten (44.8 m) 2 kat daha küçüktür.’
‘MoGe-2, karşıt ipuçlarına rağmen bir miniaturize edilmiş anıtı varsaymıştır.’
Üçün Gücü
Yazarların yeni koleksiyonu, üç mevcut veri kümesini birleştirerek oluşturuldu: MegaScenes, AerialMegaDepth ve Stereo4D:

Yeni derlemenin bir parçası olan MegaScenes’ten örnek görüntüler. Kaynak
MetricScenes’e katkıda bulunan veri kümelerindeki sorun, her birinin sınırlı alanlara uygulanmasıdır, örneğin POV araba görüntüleri veya iç mekan sahneleri, birleştirilmiş bir alan gerekli olduğunda ve görme sistemlerini insan benzeri bir ölçek kavramına yaklaştırmak için.
Her görüntü, RGB görüntüsüne, Structure from Motion (SfM), Multi-View Stereo (MVS) veya diğer geometrik önceliklerden elde edilen kısmen gözlemlenen derinlik, bir derinlik haritası ve ilgili kamera meta verileri ile birlikte gelir.
Fine-tuning MoGe-2 çerçevesini yeni veri kümesinde ‘ölçek çökmesini önemli ölçüde azaltır’, açık alan sahnelerinde üstün sonuçlar elde ettiği ve ilgili benchmarklerde en iyi sonuçları elde ettiği iddia edilmektedir.
Yeni makale Honey, I Shrunk the Arc de Triomphe! olarak adlandırılmış ve Cornell Üniversitesi ve Shanghai Jiao Tong Üniversitesi’nden dört araştırmacı tarafından yazılmıştır.
Yöntem
MetricScenes, AerialMegaDepth ve MegaScenes adlı iki İnternet fotoğrafı koleksiyonuna dayanmaktadır. MegaScenes, büyük ölçekli SfM yeniden yapılandırmaları sunar, ancak bu sahneler gerçek dünya ölçeğinde içermeyen bir içeriktedir. Bunu ele almak için, coğrafi olarak etiketlenmiş çevrimiçi haritalama hizmetlerinden elde edilen coğrafi olarak etiketlenmiş görüntüler, yeniden yapılandırmaları bilinen fiziksel konum ve boyutlarla hizalamak için kullanıldı.
AerialMegaDepth, coğrafi olarak etiketlenmiş Google Earth görüntüleri içerdiğinden, zaten metrik ölçekli anıt yeniden yapılandırmaları içerir.
Görsel olarak benzer ancak coğrafi olarak uzak yapılardan kaynaklanan olası yeniden yapılandırma hataları, MASt3R-SfM ve Doppelgangers++ sınıflandırıcı kullanılarak ele alındı. Multi-View Stereo (MVS) yeniden yapılandırmasından sonra, MoGe-2’den öngörülerle birlikte bir dizi istikrar kontrolü ve öngörüsünün bir kombinasyonu kullanılarak kararsız derinlik tahminleri ve derinlik-kanama artifacts filtrelendi:

AerialMegaDepth, İnternet fotoğraflarını coğrafi olarak etiketlenmiş Google Earth görüntüleri ile birleştirerek gerçek dünya ölçeğini türetir, MegaScenes sahneleri ise coğrafi olarak etiketlenmiş sokak seviyesi görüntüleri kullanılarak fiziksel boyutlara hizalanır.
Metrik ölçek, coğrafi olarak etiketlenmiş görüntüler aracılığıyla geri kazanıldı. AerialMegaDepth, zaten coğrafi olarak etiketlenmiş Google Earth görüntülerinden ölçek türetirken, MegaScenes sahneleri coğrafi olarak etiketlenmiş sokak seviyesi görüntüleri kullanılarak fiziksel boyutlara hizalanır.
Bu görüntüler, MASt3R ile eşleştirildi, Doppelganger sınıflandırıcı ile rafine edildi, COLMAP ile hizalandı ve RANSAC-tabanlı tahmin kullanılarak Dünya Merkezli, Dünya Sabit (ECEF) koordinatları ile ölçeklendirildi. Güvenilir ölçek tahminlerine veya zayıf kayıt kalitesine sahip sahneler atıldı.
Stereo ile Görmek
MetricScenes koleksiyonu, ayrıca Stereo4D veri kümesinden yararlanmaktadır. Bu, binlerce gerçek dünya stereoskopik video dizisini içerir ve bu dizileri SEA-RAFT adlı bir optik akış sistemi ile işler.

Stereo4D veri kümesi, stereoskopik İnternet videolarından oluşturuldu, kamera pozları, derinlik tahminleri ve hareket yollarını birleştirerek ölçekte dinamik 3B sahneleri geri kazandı. Kaynak
Çünkü kamera lensleri arasındaki fiziksel mesafe, farklı cihazlar arasında değişir, bu nedenle yalnızca belgelenmiş kamera yapılandırmalarına sahip videolar kullanıldı, böylece sahne derinliği doğru bir gerçek dünya ölçeğinde geri kazanıldı.
Stereo4D, başlangıçta sahne geometrisini tahmin etmek için SEA-RAFT optik akış sistemine dayanıyordu, ancak yazarlar, kusurlu kamera kalibrasyonunun yeniden yapılandırılan sahneleri doğal olarak paralel olan yapıların anormal bir şekilde birleşmesine neden olabileceğini buldular. Dolayısıyla, doğruluğu artırmak için, bu yaklaşımı, kamera pozları ve derinlikten birden fazla karede ortak olarak tahmin eden bir çok görüntülu yeniden yapılandırma pipeline ile değiştirdiler.
π³, DepthAnything V3 ve MapAnything karşılaştırıldıktan sonra, π³, geometrik dayanıklılığı ve ince ayrıntıları koruma yeteneği nedeniyle seçildi:

Stereo4D’den metrik ölçekli derinlik geri kazanımı.
Çünkü π³, sahneyi keyfi bir ölçekte yeniden yapılandırır, sonuçta oluşan derinlik haritaları, her stereo kamera rig’inin bilinen fiziksel baz çizgisine hizalanarak gerçek dünya boyutlarına hizalandı.
Ek olarak, bir iki aşamalı derinlik tamamlama işlemi kullanıldı, MoGe-2’den ön plan tahminleri ile MVS’den arka plan geometrisi birleştirilerek, daha temiz metrik ölçekli eğitim verisi üretilir ve nesne sınırları daha nettir:

İki aşamalı derinlik tamamlama.
Yazarlar, İnternet fotoğraflarının genellikle güvenilir ön plan derinliğine sahip olmadığını, stereoskopik görüntülerin ise genellikle uzak arka plan bölgelerini kaçırdığını gözlemlediler. MoGe-2, tüm sahne boyunca yoğun geometriyi çıkarabilir, ancak tahminleri aynı ölçek çökmesi sorununa eğilimlidir. Bu nedenle, iki aşamalı derinlik tamamlama pipeline, MoGe-2 ve MVS’nin güçlerini birleştirmek için tasarlandı.
Arka plan geometrisi, MVS türetilen metrik ankrajlar kullanılarak geri kazanıldı, güvenilir büyük ölçekli yapıya sahip bir temel derinlik haritası oluşturuldu. İkinci aşamada, MoGe-2’den ön plan tahminleri, kenar bilgisi olan bir tamamlama işlemiyle yeniden tanıtıldı, nesne sınırlarını korurken ölçek kayması ve derinlik-kanama artifacts oluşmasını önlemek için tasarlandı.
Üretilen derinlik haritaları, makaleye göre, hem görsel olarak tam hem de gerçek dünya ölçeğinde daha tutarlıydı:

İki aşamalı derinlik tamamlama pipeline.
Veri ve Testler
Nihai MetricScenes koleksiyonu, AerialMegaDepth’ten 47.579 gerçek dünya görüntüsünü, MegaScenes’ten 29.583 görüntüyü ve Stereo4D’den 1.725 videodan 22.549 kareyi içerir.
Koleksiyon, her bir kaynaktan 10 sahne geri çekildi ve doğrulama olarak kullanıldı, dış ve iç mekanlar, yer seviyesi ve havadan görüntüler ve kentsel ve doğal manzaralar gibi çeşitli bağlamları kapsar – bu, bireysel katkıda bulunan koleksiyonlardan herhangi birinde mevcut olmayan birleştirilmiş ve tutarlı bir bağlam.
İlk nitel test için, yazarlar MoGe-2 ViT-Large-Normal modelini yeni MetricScenes veri kümesinde 10.000 iterasyon için bir toplu işleme boyutu ile fine-tuned etti – bu, yaklaşık olarak üç epoch anlamına gelir. Kesme ve genel veri artırma yaklaşımları, orijinal MoGe-2 testlerinden alındı ve eğitim, bir öğrenme oranı ile gerçekleşti. 1×10-6 (iskelet) ve 1×10-5 (diğer tüm parametreler). Nitel test için, derinlik yeniden yapılandırmaları, fine-tuned WildMoGe modeli tarafından gerçekleştirildi ve temel MoGe-2; DepthAnything V3; Metric3Dv2; UniDepth v2 ; ve DepthPro ile karşılaştırıldı:

Metrik ölçekli anıt yeniden yapılandırması karşılaştırması.
Bu sonuçla ilgili olarak makalede denir:
‘[WildMoGe] çeşitli anıtlar boyunca daha doğru mutlak ölçekleri tutarlı bir şekilde geri kazanır, bilinen boyutlara yakın bir şekilde eşleşir (örneğin, 31,4 m vs. 32,4 m için Philadelphia Sanat Müzesi, 46,7 m vs 46,5 m için Piazza della Signorina). MoGe-2, DepthAnything v3 ve Metric3D v2, ölçek çökmesi davranışı sergiler, uzak yapıların boyutunu tutarlı bir şekilde küçümser.
‘UniDepth v2 daha gerçekçi ölçeklere ulaşır, ancak yine de gerçek değerden sapar ve DepthPro genellikle mutlak ölçek geri kazanamaz, gerçeklikten çok daha küçük sonuçlar üretir. Bu sahneler eğitim kümesinde yoktur.
‘Bu performans, WildMoGe’nin görülmeyen içeriklere genelleme yapabildiğini, sadece eğitim sahnelerini ezberlemediğini gösterir.’
Yazarlar, kazanılan kazançların sadece anıtlar ve büyük açık hava sahneleri ile sınırlı olmadığını kanıtlamak için, WildMoGe’yi ayrıca sıradan iç mekan ve sokak seviyesi görüntülerinde değerlendirdiler, burada MoGe-2 ile ölçek tahminleri genel olarak tutarlıydı ve ETH3D avlu sahnesinde daha yüksek bir doğruluk elde edildi:

Standart sahnelerdeki karşılaştırma.
Yazarlar, MetricScenes’in gerçekten metrik ölçekli akıl yürütme yeteneğini değerlendirmek için, hem özel bir MetricScenes test kümesinde hem de NYUv2; KITTI; ETH3D; iBims-1; GSO; Sintel; DDAD; DIODE; Spring; ve HAMMER üzerinde testler gerçekleştirdiler.
Yazarlar, İnternet görüntülerinin yoğun ground-truth ölçümlerini elde etmenin zor olduğunu not eder, bu nedenle MetricScenes etiketleri mükemmel değildir. Standart benchmark’ler, herhangi bir kazançların genel geometrik performansın pahasına gelmediğini doğrulamak için dahil edilmiştir.
MoGe-2; UniDepth V2; DepthPro; MASt3R; Depth Anything V2; Depth Anything V3; ZoeDepth; ve Metric3D V2 ile karşılaştırmalar yapıldı:

Göreceli ve metrik geometri için nicel değerlendirme.
WildMoGe, MetricScenes test kümesinde metrik ölçekli tahminde önemli bir iyileşme sağladı, her rapor edilen metrikte MoGe-2’yi aştı ve MoGe-2, DepthAnything V3, Metric3D V2, UniDepth V2 ve DepthPro’dan daha güçlü metrik geometri ve metrik derinlik puanları elde etti.
NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring ve HAMMER’de performans, MoGe-2 ile genel olarak benzer kaldı. Yazarlar, bu kazanımları MetricScenes’in metrik denetimine bağlar, bu da ölçek çökmesini azaltırken genel sahne yeniden yapılandırma performansını korur.
Sonuç
MetricScenes’in “ölçek çökmesi” sorununa çözümü, makalede biraz bir Heath-Robinson işi gibi görünüyor – birden fazla veri kümesinin birleştirilmesi ve damıtılması, her biri değerli bir bakış açısı sunuyor. Bu, bir fili tanımlamak için kör adamların fili dokunarak tanımlamaya çalışmasına benziyor.
Belki de makalenin sunduğu en değerli hizmet, bu sorunu daha fazla dikkat çekmektedir, bu da bazı yeni evrensel standartlara ihtiyaç duyulduğunu gösteriyor. Ancak böyle bir yenilik, mevcut metodolojilerin yeniden üretilebilirliği ve tutarlılığını bozacaktır, bu nedenle çok ikna edici olmalıdır.
* Yazarların satır içi alıntılarını hyperlinklere dönüştürmem.
İlk olarak 11 Haziran 2026 Perşembe günü yayınlandı.












