Anderson 视角
AI 在识别地标大小方面的挣扎

视觉语言模型理解纪念碑,但它们仍然无法看到整个图景……
我们发展的最早的生存技能之一是区分事物大小或远近的能力。我们可以用拇指遮住月亮,而不认为它的大小像一毛钱,因为我们已经内化了相对规模的理解。
这对计算机视觉系统来说是一个异常艰难的任务,因为大多数系统依赖于先前的注释,这并不帮助它们像人类一样“理解”规模。况且,超过一定限度,视觉范围以外的所有事物都超出了立体视觉的解析能力——停车场远端的汽车;远处的摩天大楼;以及在其上升起的新月……所有这些对于大多数基于视觉的机器学习系统来说都是“2D”实体。
当然,当一个特定的“遥远”但被误解的物体的例子出现在训练数据中,已经看到过这些数据的系统很难被欺骗:

ChatGPT-5.5 对这个经典的旅游陷阱并不感兴趣。
如果一个模型的训练潜在空间中不包含这样的特定和经常重复的信息,它就需要能够概括和内化我们在年轻时掌握的规模概念。没有这一点,即使是著名的例子也可能导致规模估计错误:

在我们今天研究的新论文中,这个推测性例子显示了摄像机的视角,背景中有凯旋门——但系统不知道它的大小,并做出了错误的猜测。来源 – 来源
像埃菲尔铁塔这样的特定和非常独特的物体的危险在于,系统会使用一个捷径来估计大小,这个捷径对原始模型是正确的,但不适用于埃菲尔铁塔的多个复制品,这些复制品与原版一样超出了立体视觉的距离,但大小远远不及原版。
因此,视觉系统需要以准备好的技能集来处理新颖(未见过)的视图,而不是仅仅依靠“作弊码”。
扩大规模
为此,美国和中国之间的新合作提供了一个补救数据集,以及一个估计方法,来解决这个问题:

新的方法通过改进的训练材料修改了先前的系统——数据足够多样化,以提供对深度问题的更深入的理解。
与伴随网站一起推出的《MetricScenes》计划包括数据和代码发布。
该论文指出*:
‘我们发现当前最先进的方法经常无法估计正确的场景规模,从而导致“野外”场景中持续的规模坍缩现象。
‘上图显示了一个例子,其中清晰的语义参考(人)存在,但模型如MoGe-2在距离范围内表现出显著的规模不一致:近距离物体的预测度量规模是合理的——在这种情况下,游客的高度是合理的——但远距离结构的规模被严重低估——这里,背景中的凯旋门被预测为仅18.8米宽,这比实际宽度(44.8米)小了2倍以上。
‘MoGe-2 提出了一个微型化的地标,尽管有相反的提示。’
三个的力量
作者的新集合是通过组合三个现有的数据集而成:MegaScenes、AerialMegaDepth 和 Stereo4D:

MegaScenes 的示例图像,它是新策略的一部分。来源 – 来源
这些数据集单独使用时存在的问题是,它们每个都适用于有限的领域,例如车载摄像头拍摄的视频或室内场景,而要解决这个问题并使视觉系统更接近人类风格的规模概念理解,需要一个组合的领域。
每张图像都伴有RGB图像、从结构从运动(SfM)、多视图立体视觉(MVS)或其他几何先验中获得的部分观察到的深度,以及通过新的两阶段泊松完成过程生成的完成深度图,以及相关的相机元数据。
微调 MoGe-2 框架在新数据集上“显著缓解”作者所指的规模坍缩,据称在开放域场景中实现了更好的结果,并在相关基准测试中实现了最先进的性能。
该论文题为《亲爱的,我缩小了凯旋门!》,由康奈尔大学和上海交通大学的四位研究人员撰写。
方法
MetricScenes 部分基于前面提到的 AerialMegaDepth 和 MegaScenes —— 互联网照片的两个集合,涵盖历史档案、旅游图片和专业摄影。虽然 MegaScenes 提供了大规模的结构从运动(SfM)重建,但这些场景缺乏任何内在的真实世界规模。为了解决这个问题,使用在线地图服务的地理标记图像来将重建与已知的物理位置和尺寸对齐。
相反,AerialMegaDepth 已经包含了地理标记的谷歌地球视图,提供了具有度量规模的标志性物体重建。
由于视觉上相似但地理位置遥远的结构可能导致的潜在重建错误,使用了 MASt3R-SfM 和 Doppelgangers++ 分类器进行了处理。在多视图立体视觉(MVS)重建之后,使用 MoGe-2 的预测和稳定性检查的组合来过滤掉不稳定的深度估计和深度出血伪影:

AerialMegaDepth 通过将互联网照片与地理标记的谷歌地球视图相结合来推导出真实世界的规模,而 MegaScenes 场景则使用地理参考的街景级图像对齐到物理尺寸。多视图立体视觉(MVS)重建后,使用 MoGe-2 的预测和稳定性检查的组合来过滤掉不稳定的深度估计和深度出血伪影,生成适合训练的更干净的度量规模深度图。黄色框突出显示在处理过程中删除的暂时对象,而红色框表示更正的深度出血区域。
然后通过地理参考图像恢复了度量规模。AerialMegaDepth 已经从捕获自已知位置的谷歌地球渲染中推导出规模,而 MegaScenes 则使用在线地图服务的地理标记街景级图像对齐到真实世界的尺寸。
这些图像与现有重建使用 MASt3R 匹配,使用 Doppelganger 分类器进行了精化,并使用 COLMAP 进行了对齐,并使用 RANSAC 基础估计和 地球中心地球固定(ECEF) 坐标进行了缩放。具有不可靠规模估计或注册质量差的场景被丢弃。
立体视觉
MetricScenes 集合还借鉴了前面提到的 Stereo4D 数据集,该数据集包含成千上万个真实世界的立体视频序列,使用 VR180 相机捕获,提供了捕获的时间维度:

Stereo4D 数据集是从立体互联网视频构建的,通过相机姿势、深度估计和运动轨迹的组合来恢复动态 3D 场景的规模。生成的数据集包含成千上万个以点云形式表示的视频片段,具有长距离运动轨迹,提供了大量的真实世界 3D 几何和运动数据用于训练视觉模型。来源 – 来源
由于不同设备之间的两个摄像头镜头之间的物理距离不同,因此,只有具有记录的摄像头配置的视频被使用,从而可以以准确的真实世界规模恢复场景深度。
Stereo4D 最初依赖于光流系统 SEA-RAFT 来估计场景几何,但作者发现,摄像头校准不完善会使重建的场景失真,导致本应平行的结构变得不自然地收敛。因此,为了提高准确性,他们用一个联合估计相机姿势和深度的多视图重建管道取代了这种方法。
在比较 π³、DepthAnything V3 和 MapAnything 后,选择了 π³,因为它具有几何鲁棒性和保留细节的能力:

Stereo4D 的度量规模深度恢复。标准的立体匹配方法在摄像头校准不完善时会产生失真的几何,而 π³ 生成更一致的场景重建,并保留细节。然后将恢复的几何与立体摄像头的已知物理基线对齐,产生准确缩放的度量深度图。
由于 π³ 以任意规模重建场景,因此使用立体摄像头rig的已知物理基线对齐了结果深度图。额外的过滤移除了低质量帧、深度不一致、校准错误和不可靠的规模估计。
此外,使用了一个两阶段的深度完成过程,结合了 MoGe-2 的前景预测和多视图立体视觉(MVS)的背景几何,生成了更干净的度量规模训练数据,具有更一致的规模和更清晰的对象边界:

两阶段深度完成。仅使用背景锚点可以保留场景结构,同时扭曲整体规模,而在单个通行中同时引入前景和背景约束会引入规模漂移和边界伪影。两阶段方法在近处和远处物体上保持一致的度量规模,同时保留清晰的对象边界。
作者观察到,互联网照片集合通常缺乏可靠的前景深度,而立体图像则经常缺乏远处背景区域。虽然 MoGe-2 可以推断整个场景的密集几何,但其估计往往趋向于该项目试图解决的同一个规模坍缩问题。因此,设计了一个两阶段的深度完成管道,以结合 MoGe-2 和多视图立体视觉(MVS)的优势。
使用 MVS 衍生的度量锚点恢复了背景几何,创建了一个具有可靠大规模结构的基本深度图。在第二阶段,MoGe-2 的前景估计通过一个边缘感知的完成过程重新引入,旨在保留对象边界,同时防止规模漂移和深度出血伪影。
该方法生成的深度图,论文声称,既是视觉上完整的,也更具真实世界的规模一致性:

两阶段深度完成管道。在第一阶段,使用多视图立体视觉(MVS)锚点恢复背景几何,具有可靠的度量规模。在第二阶段,通过一个边缘感知的组合过程重新引入 MoGe-2 的前景估计,生成一个最终的深度图,旨在保留大规模准确性和清晰的局部细节。
数据和测试
最终的 MetricScenes 集合包括 47,579 张来自 AerialMegaDepth 的真实世界图像,涵盖 134 个场景;来自 MegaScenes 的 29,583 张图像,涵盖 356 个场景;以及来自 Stereo4D 的 22,549 个视频帧,来自 1,725 个视频。
该集合中,从每个源中保留了 10 个场景作为 验证,涵盖了室内和室外环境,以及地面和空中视图,以及城市和自然景观——这是任何单个贡献集合中都无法提供的汇总和连贯的上下文。
对于初步的定性测试,作者在新的 MetricScenes 数据集上对 MoGe-2 ViT-Large-Normal 模型进行了 10,000 次迭代的微调,批次大小为 32,相当于大约三个 epoch。使用了与原始 MoGe-2 测试相同的裁剪和一般 数据增强 方法,训练在 1×10-6(骨干网络)和 1×10-5(所有其他参数)的学习率下进行。对于定性测试,深度重建由经过微调的 WildMoGe 模型执行,并与基础 MoGe-2、DepthAnything V3、Metric3Dv2、UniDepth v2 和 DepthPro 进行了比较:

度量规模地标重建比较。左列显示了来自谷歌地图的真实测量值。跨越未见过的真实世界地标,WildMoGe 生成的规模估计更接近已知的尺寸,而 MoGe-2、DepthAnything V3 和 Metric3D V2 经常低估远距离结构的大小。UniDepth V2 通常产生更合理的尺寸,但仍然不一致,而 DepthPro 有时会产生严重的尺度错误。
关于这一结果,论文指出:
‘WildMoGe 一致地在多个地标上恢复了更准确的绝对规模,紧密匹配地面真实尺寸(例如,费城艺术博物馆为 31.4m vs 32.4m,皮亚扎-德拉-西尼奥里娜广场为 46.7m vs 46.5m)。MoGe-2、DepthAnything v3 和 Metric3D v2 展示了规模坍缩行为,持续地低估远距离结构的大小。 ‘
‘UniDepth v2 生成更真实的尺寸,但仍然偏离地面真实值,而 DepthPro 经常无法恢复绝对规模,产生的结果比实际小了几个数量级。请注意,这些场景不在训练集中。 ‘
‘这种性能表明 WildMoGe 可以推广到未见过的内容,而不是简单地记忆训练场景。’
为了确保所发现的收益不仅限于地标和大型室外场景,作者还在普通室内和街景图像上评估了 WildMoGe,在这些图像上,它产生的规模估计与 MoGe-2 大致一致,同时在 ETH3D 庭院场景上实现了更高的准确率:

标准场景比较。跨越普通室内和街景环境,WildMoGe 生成的规模估计与 MoGe-2 大致一致,同时在 ETH3D 庭院基准测试中实现了更高的准确率,恢复的对象尺寸更接近地面真实测量值。
为了评估 MetricScenes 是否真正改进了度量规模推理,评估是在专门的 MetricScenes 测试集和 NYUv2、KITTI、ETH3D、iBims-1、GSO、Sintel、DDAD、DIODE、Spring 和 HAMMER 上进行的。
作者指出,获取无约束互联网图像的密集地面真实测量仍然具有挑战性,这意味着 MetricScenes 标签并不完美。因此,包括标准基准测试以验证任何收益不会以牺牲一般几何性能为代价。
比较了 MoGe-2、UniDepth V2、DepthPro、MASt3R、Depth Anything V2、Depth Anything V3、ZoeDepth 和 Metric3D V2:

相对和度量几何的量化评估。在 MetricScenes 测试集上,WildMoGe 在每个报告的指标上都优于 MoGe-2,同时在已建立的基准测试中与 ZoeDepth、Metric3D V2、Depth Anything V2、Depth Anything V3、MASt3R、UniDepth V2 和 DepthPro 保持一致,表明改进的度量规模估计是没有牺牲一般几何重建质量而实现的。
WildMoGe 在 MetricScenes 上显著改进了度量规模预测,在每个报告的指标上都优于 MoGe-2,并在相关基准测试中实现了更好的度量几何和度量深度分数,超过了 MoGe-2、Depth Anything V3、Metric3D V2、UniDepth V2 和 DepthPro。
在 NYUv2、KITTI、ETH3D、iBims-1、GSO、Sintel、DDAD、DIODE、Spring 和 HAMMER 上的性能仍然与 MoGe-2 大致相同。作者将这些收益归因于 MetricScenes 的度量监督,这似乎有助于减少规模坍缩,同时保留一般场景重建性能。
结论
MetricScenes 解决“规模坍缩”的方法似乎是一种混合和提炼了多个数据集的方法,每个数据集都有其宝贵的视角。它看起来有点像试图通过触摸来确定大象的形状。
也许这篇论文最有价值的服务是引起人们对这个问题的更大关注,这似乎需要某种新颖或改良的通用标准。然而,任何这样的创新都需要非常令人信服,因为它会破坏当前方法的可复制性和一致性。
* 我将作者的内联引用转换为超链接。
首次发表于 2026 年 6 月 11 日星期四












