Ángulo de Anderson

Las luchas de la IA para reconocer el tamaño de los monumentos

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2 + Photoshop): High-angle view of a man holding a scale model of the Leaning Tower of Pisa on a grassy field, with an inset photograph showing the same model aligned from ground level to resemble the full-sized tower in the background.

Los modelos de lenguaje de visión entienden los monumentos, pero todavía no pueden ver la imagen completa…

 

Una de las primeras habilidades de supervivencia que desarrollamos es la capacidad de distinguir entre cosas que son pequeñas o están lejos. Podemos cubrir la luna con nuestro pulgar, sin pensar que es del tamaño de una moneda de diez centavos, porque hemos internalizado una comprensión de la escala relativa.

Esta es una tarea inusualmente difícil para los sistemas de visión por computadora, ya que la mayoría de ellos dependen de la anotación previa, que no les ayuda a “entender” la escala de la misma manera que los humanos. Además, más allá de un cierto límite y bastante cercano, todo en la distancia está más allá de la capacidad de la visión estereoscópica para resolver – el coche al final del estacionamiento; el rascacielos en la distancia más allá de ese; y la luna creciente que se eleva sobre él… todos son entidades “2D” para la mayoría de los sistemas de aprendizaje automático basados en la visión.

Por supuesto, cuando un ejemplo particular de un objeto “lejano” pero mal interpretado termina bien representado en los datos de entrenamiento, los sistemas que han visto estos datos pueden ser difíciles de engañar:

ChatGPT-5.5 no se impresiona en absoluto con este clásico tropo turístico.

ChatGPT-5.5 no se impresiona en absoluto con este clásico tropo turístico.

Cuanto menos contenga el espacio latente entrenado del modelo información específica y repetida, más necesitará poder generalizar y internalizar los conceptos de escala que captamos a una edad temprana. Sin esto, incluso ejemplos famosos pueden causar errores de estimación de escala:

En este ejemplo especulativo, tomado del nuevo documento que examinamos hoy, la cámara muestra el Arco de Triunfo en el fondo – pero el sistema no sabe qué tamaño tiene y hace una suposición incorrecta. Fuente - https://arxiv.org/pdf/2606.02379

En este ejemplo especulativo, adaptado del nuevo documento que examinamos hoy, la cámara muestra el Arco de Triunfo en el fondo – pero el sistema no sabe qué tamaño tiene y hace una suposición incorrecta. Fuente

El peligro, con objetos específicos y muy característicos como la Torre Eiffel, es que el sistema recurrirá a un atajo de estimación de tamaño que es correcto para el modelo original, pero no correcto para las múltiples imitaciones del monumento de París que están igualmente más allá de la distancia de resolución estereoscópica, pero que no son ni remotamente tan grandes.

Por lo tanto, es importante que los sistemas de visión aborden vistas novedosas (no vistas) con un conjunto de habilidades listo, y no solo con un montón de “códigos de trampa”.

Escalando

Con este fin, una nueva colaboración entre Estados Unidos y China ofrece un conjunto de datos de remedio, junto con un método de estimación, que aborda el problema:

El nuevo enfoque modifica un sistema previo a través de material de entrenamiento mejorado – datos lo suficientemente variados como para proporcionar una comprensión más profunda de los problemas de profundidad.

El nuevo enfoque modifica un sistema previo a través de material de entrenamiento mejorado – datos lo suficientemente variados como para proporcionar una comprensión más profunda de los problemas de profundidad.

Lanzado junto con un sitio web acompañante, la iniciativa MetricScenes presenta datos y código de lanzamiento.

El documento establece*:

‘[Encontramos que] los métodos actuales de estado del arte a menudo fallan al estimar la escala de escena correcta, lo que lleva a un fenómeno persistente de colapso de escala en escenarios “en el mundo real”.

‘[La imagen de arriba] muestra un ejemplo donde hay referencias semánticas claras (personas) presentes, pero donde modelos como MoGe-2 exhiben una inconsistencia de escala significativa en todo el rango de distancias: la escala métrica predicha para objetos de campo cercano es plausible – en este caso, los turistas tienen una altura plausible – pero la escala para estructuras de campo lejano es dramáticamente subestimada – aquí, el Arco de Triunfo en el fondo se predice métricamente que tiene solo 18,8 m de ancho, lo que es más de 2× más pequeño que el ancho de la verdad en tierra (44,8 m).

‘MoGe-2 ha planteado un monumento en miniatura, a pesar de las señales en contrario.’

El Poder de Tres

La nueva colección de los autores se reunió combinando tres conjuntos de datos existentes: MegaScenes, AerialMegaDepth y Stereo4D:

Imágenes de ejemplo de MegaScenes, que forman parte de la nueva curación. Fuente - https://megascenes.github.io/

Imágenes de ejemplo de MegaScenes, que forman parte de la nueva curación. Fuente

El problema con los conjuntos de datos que contribuyen a MetricScenes, cuando se toman individualmente, es que cada uno se aplica a dominios limitados, como footage de POV de coches, o escenas interiores, cuando se necesita un dominio combinado para abordar el problema y acercar los sistemas de visión a una comprensión conceptual humana de la escala.

Cada imagen viene acompañada de imágenes RGB, profundidad parcialmente observada derivada de Estructura desde el Movimiento (SfM), Estereoscopía de varias vistas (MVS) u otros priores geométricos, junto con una mapa de profundidad completado generado a través de un nuevo proceso de completado de Poisson de dos etapas, y metadatos de cámara asociados.

Ajustar el marco de MoGe-2 en el nuevo conjunto de datos ‘mitiga significativamente’ el colapso de escala al que se refieren los autores, aparentemente logrando resultados superiores en escenas de dominio abierto y un rendimiento de estado del arte en benchmarks relacionados.

El nuevo documento se titula ¡Cariño, he encogido el Arco de Triunfo!, y proviene de cuatro investigadores de la Universidad de Cornell y la Universidad de Shanghai Jiao Tong.

Método

MetricScenes se basa en parte en los mencionados AerialMegaDepth y MegaScenes – dos colecciones de fotografías de Internet que abarcan archivos históricos, imágenes turísticas y fotografía profesional. Aunque MegaScenes ofrece reconstrucciones de gran escala de Estructura desde el Movimiento (SfM), estas escenas carecen de una escala real del mundo. Para abordar esto, se utilizaron imágenes georreferenciadas de servicios de mapas en línea para alinear las reconstrucciones con ubicaciones y dimensiones físicas conocidas.

Por el contrario, AerialMegaDepth ya incorpora vistas de Google Earth georreferenciadas, que proporcionan reconstrucciones de monumentos a escala métrica.

Los errores de reconstrucción potenciales causados por estructuras visualmente similares pero geográficamente distantes se abordaron utilizando MASt3R-SfM y el clasificador Doppelgangers++. Después de la reconstrucción de Estereoscopía de varias vistas (MVS), se filtraron las estimaciones de profundidad inestables y los artefactos de sangrado de profundidad utilizando una combinación de controles de estabilidad y predicciones de MoGe-2:

AerialMegaDepth deriva la escala del mundo real combinando fotografías de Internet con vistas de Google Earth georreferenciadas, mientras que las escenas de MegaScenes se alinean con dimensiones físicas utilizando imágenes de nivel de calle georreferenciadas obtenidas de servicios de mapas. Después de la reconstrucción de Estereoscopía de varias vistas (MVS), se filtran las estimaciones de profundidad inestables y los artefactos de sangrado de profundidad, produciendo mapas de profundidad de escala métrica más limpios y adecuados para el entrenamiento. Las cajas amarillas resaltan los objetos transitorios eliminados durante el procesamiento, mientras que las cajas rojas indican regiones de sangrado de profundidad corregidas.

AerialMegaDepth deriva la escala del mundo real combinando fotografías de Internet con vistas de Google Earth georreferenciadas, mientras que las escenas de MegaScenes se alinean con dimensiones físicas utilizando imágenes de nivel de calle georreferenciadas obtenidas de servicios de mapas. Después de la reconstrucción de Estereoscopía de varias vistas (MVS), se filtran las estimaciones de profundidad inestables y los artefactos de sangrado de profundidad, produciendo mapas de profundidad de escala métrica más limpios y adecuados para el entrenamiento. Las cajas amarillas resaltan los objetos transitorios eliminados durante el procesamiento, mientras que las cajas rojas indican regiones de sangrado de profundidad corregidas.

La escala métrica se recuperó luego a través de imágenes georreferenciadas. AerialMegaDepth ya deriva la escala de las representaciones de Google Earth capturadas desde ubicaciones conocidas, mientras que MegaScenes se alineó con dimensiones reales del mundo utilizando imágenes de nivel de calle georreferenciadas obtenidas de servicios de mapas.

Estas imágenes se emparejaron con reconstrucciones existentes con MASt3R, se refinaron con el clasificador Doppelganger, se alinearon con COLMAP y se escalonaron a través de una estimación basada en RANSAC utilizando coordenadas Centro de la Tierra, Fijo a la Tierra (ECEF). Las escenas con estimaciones de escala no confiables o mala calidad de registro se descartaron.

Viendo en Estéreo

La colección MetricScenes también se basa en el conjunto de datos Stereo4D mencionado anteriormente, que cuenta con miles de secuencias de video estereoscópicas del mundo real capturadas con cámaras VR180, ofreciendo una dimensión temporal a las capturas:

El conjunto de datos Stereo4D se construyó a partir de videos estereoscópicos de Internet, combinando poses de cámara, estimaciones de profundidad y trayectorias de movimiento para recuperar escenas 3D dinámicas a escala. El conjunto de datos resultante contiene cientos de miles de clips de video representados como nubes de puntos con pistas de movimiento de largo alcance, proporcionando una gran fuente de geometría y movimiento 3D del mundo real para el entrenamiento de modelos de visión. Fuente - https://arxiv.org/pdf/2412.09621

El conjunto de datos Stereo4D se construyó a partir de videos estereoscópicos de Internet, combinando poses de cámara, estimaciones de profundidad y trayectorias de movimiento para recuperar escenas 3D dinámicas a escala. El conjunto de datos resultante contiene cientos de miles de clips de video representados como nubes de puntos con pistas de movimiento de largo alcance, proporcionando una gran fuente de geometría y movimiento 3D del mundo real para el entrenamiento de modelos de visión. Fuente

Debido a que la distancia física entre las dos lentes de la cámara varía en diferentes dispositivos, solo se utilizaron videos con configuraciones de cámara documentadas, lo que permitió recuperar la profundidad de la escena a una escala del mundo real precisa.

Stereo4D originalmente dependía del sistema de flujo óptico SEA-RAFT para estimar la geometría de la escena, pero los autores encontraron que la calibración de cámara imperfecta podría distorsionar las escenas reconstruidas, haciendo que las estructuras que deberían ser paralelas converjan de manera antinatural. Por lo tanto, para mejorar la precisión, reemplazaron este enfoque con una tubería de reconstrucción de varias vistas que estima conjuntamente las poses de cámara y la profundidad a partir de múltiples cuadros.

Después de comparar π³, DepthAnything V3 y MapAnything, se seleccionó π³ por su robustez geométrica y capacidad para preservar detalles finos:

Recuperación de profundidad de escala métrica desde Stereo4D. Los métodos de emparejamiento de estéreo estándar pueden producir geometría distorsionada cuando la calibración de la cámara es imperfecta, mientras que π³ genera reconstrucciones de escena más consistentes y preserva los detalles finos. La geometría recuperada se alinea luego con la base física conocida de la cámara estereoscópica, lo que produce mapas de profundidad de escala métrica precisos.

Recuperación de profundidad de escala métrica desde Stereo4D. Los métodos de emparejamiento de estéreo estándar pueden producir geometría distorsionada cuando la calibración de la cámara es imperfecta, mientras que π³ genera reconstrucciones de escena más consistentes y preserva los detalles finos. La geometría recuperada se alinea luego con la base física conocida de la cámara estereoscópica, lo que produce mapas de profundidad de escala métrica precisos.

Como π³ reconstruye escenas a una escala arbitraria, los mapas de profundidad resultantes se alinearon con dimensiones del mundo real utilizando la base física conocida de cada configuración de cámara estereoscópica. Se eliminaron adicionalmente los marcos de baja calidad, los errores de calibración, los errores de profundidad y las estimaciones de escala no confiables.

Además, se utilizó un proceso de completado de profundidad de dos etapas, que combina las predicciones de primer plano de MoGe-2 con la geometría de fondo de Estereoscopía de varias vistas (MVS), produciendo datos de entrenamiento de escala métrica más limpios con escalas más consistentes y límites de objeto más nítidos:

Completado de profundidad de dos etapas. Utilizar solo anclajes de fondo puede preservar la estructura de la escena mientras distorsiona la escala general, mientras que combinar las restricciones de primer plano y fondo en una sola pasada introduce deriva de escala y artefactos de límite. El enfoque de dos etapas mantiene la escala métrica consistente en objetos cercanos y lejanos mientras preserva límites de objeto limpios.

Completado de profundidad de dos etapas. Utilizar solo anclajes de fondo puede preservar la estructura de la escena mientras distorsiona la escala general, mientras que combinar las restricciones de primer plano y fondo en una sola pasada introduce deriva de escala y artefactos de límite. El enfoque de dos etapas mantiene la escala métrica consistente en objetos cercanos y lejanos mientras preserva límites de objeto limpios.

Los autores observaron que las colecciones de fotografías de Internet a menudo carecen de profundidad de primer plano confiable, mientras que la imagen estereoscópica a menudo falta en regiones de fondo distantes. Aunque MoGe-2 puede inferir geometría densa en toda la escena, sus estimaciones tienden hacia el mismo colapso de escala que el proyecto busca abordar. Por lo tanto, la tubería de completado de profundidad de dos etapas se diseñó para combinar las fortalezas de MoGe-2 y Estereoscopía de varias vistas (MVS).

La geometría de fondo se recuperó utilizando anclajes métricos derivados de MVS, creando un mapa de profundidad base con estructura de gran escala confiable. En una segunda etapa, las estimaciones de primer plano de MoGe-2 se reintrodujeron a través de un proceso de completado de borde consciente diseñado para preservar los límites de objeto mientras evita la deriva de escala y los artefactos de sangrado de profundidad.

Los mapas de profundidad producidos por este enfoque, según el documento, fueron visualmente completos y más consistentes en la escala del mundo real:

Tubería de completado de profundidad de dos etapas. En la primera etapa, los anclajes de MVS se utilizan para recuperar la geometría de fondo a una escala métrica confiable. En la segunda etapa, las estimaciones de primer plano de MoGe-2 se reintroducen a través de un proceso de composición de borde consciente, produciendo un mapa de profundidad final diseñado para preservar tanto la precisión de gran escala como el detalle local nítido.

Tubería de completado de profundidad de dos etapas. En la primera etapa, los anclajes de MVS se utilizan para recuperar la geometría de fondo a una escala métrica confiable. En la segunda etapa, las estimaciones de primer plano de MoGe-2 se reintroducen a través de un proceso de composición de borde consciente, produciendo un mapa de profundidad final diseñado para preservar tanto la precisión de gran escala como el detalle local nítido.

Datos y Pruebas

La colección final MetricScenes comprende 47,579 imágenes del mundo real exclusivamente, que cubren 134 escenas de AerialMegaDepth; 29,583 imágenes de 356 escenas de MegaScenes; y 22,549 cuadros tomados de 1,725 videos de Stereo4D.

La colección, de la cual se mantuvieron 10 escenas por fuente como validación, cubre contextos interiores y exteriores, así como vistas a nivel del suelo y vistas aéreas, y paisajes urbanos y naturales – un contexto recopilado y coherente que no está disponible en ninguna de las colecciones individuales.

Para una prueba cualitativa inicial, los autores ajustaron el modelo MoGe-2 ViT-Large-Normal en el nuevo conjunto de datos MetricScenes durante 10,000 iteraciones con un tamaño de lote de 32 – efectivamente alrededor de tres épocas. Se tomaron enfoques de aumento de datos generales y se recortaron de las pruebas originales de MoGe-2, y el entrenamiento se realizó a una tasa de aprendizaje de 1×10-6 (espina dorsal) y 1×10-5 (todos los demás parámetros). Para la prueba cualitativa, las reconstrucciones de profundidad se realizaron con el modelo WildMoGe ajustado, comparado con el MoGe-2 base; DepthAnything V3; Metric3Dv2; UniDepth v2 ; y DepthPro:

Comparación de la reconstrucción de monumentos a escala métrica. Las mediciones de verdad en tierra de Google Maps se muestran en la columna izquierda. A través de monumentos del mundo real no vistos, WildMoGe produce estimaciones de escala más cercanas a las dimensiones conocidas, mientras que MoGe-2, DepthAnything V3 y Metric3D V2 a menudo subestiman el tamaño de las estructuras distantes. UniDepth V2 a menudo produce escalas más plausibles, pero sigue siendo inconsistente, mientras que DepthPro ocasionalmente produce errores de escala severos.

Comparación de la reconstrucción de monumentos a escala métrica. Las mediciones de verdad en tierra de Google Maps se muestran en la columna izquierda. A través de monumentos del mundo real no vistos, WildMoGe produce estimaciones de escala más cercanas a las dimensiones conocidas, mientras que MoGe-2, DepthAnything V3 y Metric3D V2 a menudo subestiman el tamaño de las estructuras distantes. UniDepth V2 a menudo produce escalas más plausibles, pero sigue siendo inconsistente, mientras que DepthPro ocasionalmente produce errores de escala severos.

Del resultado, el documento establece:

‘[WildMoGe]  consistente recupera escalas absolutas más precisas en diversos monumentos, que coinciden estrechamente con las dimensiones de la verdad en tierra (por ejemplo, 31,4 m vs. 32,4 m para el Museo de Arte de Filadelfia, 46,7 m vs 46,5 m para Piazza della Signorina). MoGe-2, DepthAnything v3 y Metric3D v25 exhiben un comportamiento de colapso de escala, subestimando consistentemente el tamaño de las estructuras de campo lejano.

‘UniDepth v2 produce escalas más realistas pero sigue desviándose de la verdad en tierra, y DepthPro a menudo falla al recuperar la escala absoluta, produciendo resultados que son órdenes de magnitud más pequeños que la realidad. Tenga en cuenta que estas escenas están ausentes del conjunto de entrenamiento.

‘Este rendimiento demuestra que WildMoGe puede generalizarse a contenido no visto, en lugar de simplemente memorizar escenas de entrenamiento.’

Para asegurarse de que las ganancias encontradas no se limitaban a monumentos y escenas al aire libre grandes, los autores también evaluaron WildMoGe en imágenes interiores y de nivel de calle ordinarias, donde produjo estimaciones de escala ampliamente consistentes con MoGe-2, mientras lograba una mayor precisión en una escena de patio de ETH3D:

Comparación en escenas estándar. A través de entornos interiores y de nivel de calle ordinarios, WildMoGe produce estimaciones de escala ampliamente consistentes con MoGe-2, mientras logra una mayor precisión en el benchmark de patio de ETH3D, recuperando dimensiones de objeto que coinciden más estrechamente con las mediciones de la verdad en tierra.

Comparación en escenas estándar. A través de entornos interiores y de nivel de calle ordinarios, WildMoGe produce estimaciones de escala ampliamente consistentes con MoGe-2, mientras logra una mayor precisión en el benchmark de patio de ETH3D, recuperando dimensiones de objeto que coinciden más estrechamente con las mediciones de la verdad en tierra.

Para evaluar si MetricScenes realmente mejoró la inferencia de escala métrica, se realizó una evaluación tanto en un conjunto de prueba dedicado de MetricScenes como en NYUv2; KITTI; ETH3D; iBims-1; GSO; Sintel; DDAD; DIODE; Spring; y HAMMER.

Los autores señalan que obtener mediciones de verdad en tierra densas para imágenes de Internet no restringidas sigue siendo difícil, lo que significa que las etiquetas de MetricScenes no son perfectas. Se incluyeron benchmarks estándar para verificar que cualquier mejora no se produjo a expensas del rendimiento geométrico general.

Se realizaron comparaciones con MoGe-2; UniDepth V2; DepthPro; MASt3R; Depth Anything V2; Depth Anything V3; ZoeDepth; y Metric3D V2:

Evaluación cuantitativa de geometría relativa y métrica. En el conjunto de prueba de MetricScenes, WildMoGe superó a MoGe-2 en todas las métricas informadas, mientras que permaneció ampliamente competitivo con ZoeDepth, Metric3D V2, Depth Anything V2, Depth Anything V3, MASt3R, UniDepth V2 y DepthPro en benchmarks establecidos, lo que indica que se logró una mejor estimación de escala métrica sin sacrificar la calidad de reconstrucción geométrica general.

Evaluación cuantitativa de geometría relativa y métrica. En el conjunto de prueba de MetricScenes, WildMoGe superó a MoGe-2 en todas las métricas informadas, mientras que permaneció ampliamente competitivo con ZoeDepth, Metric3D V2, Depth Anything V2, Depth Anything V3, MASt3R, UniDepth V2 y DepthPro en benchmarks establecidos, lo que indica que se logró una mejor estimación de escala métrica sin sacrificar la calidad de reconstrucción geométrica general.

WildMoGe mejoró sustancialmente la predicción de escala métrica en MetricScenes, superando a MoGe-2 en todas las métricas informadas y logrando mejores puntuaciones de geometría métrica y profundidad métrica que MoGe-2, DepthAnything V3, Metric3D V2, UniDepth V2 y DepthPro.

El rendimiento en NYUv2, KITTI, ETH3D, iBims-1, GSO, Sintel, DDAD, DIODE, Spring y HAMMER permaneció ampliamente comparable al de MoGe-2. Los autores atribuyen estas ganancias a la supervisión métrica de MetricScenes, que aparentemente ayuda a reducir el colapso de escala mientras preserva el rendimiento de reconstrucción de escena general.

Conclusión

La solución de MetricScenes al ‘colapso de escala’ parece ser algo así como un asunto de Heath-Robinson, en el documento – una mezcla y destilación de múltiples conjuntos de datos, cada uno de los cuales tiene algo valioso que contribuir. Parece un poco como tratar de determinar la forma de un elefante por tacto.

Quizás el servicio más valioso que ofrece el documento es llamar la atención sobre el problema, que parece requerir algún tipo de estándar universal novel o adaptado. Sin embargo, como tal innovación interrumpiría la reproducibilidad y la consistencia de las metodologías actuales, tendría que ser muy convincente.

 

* Mi conversión de las citas en línea de los autores a hipervínculos.

Publicado por primera vez el jueves 11 de junio de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai