Ángulo de Anderson
Corregir la limitada comprensión de los modelos de difusión sobre espejos y reflejos

Desde que la inteligencia artificial generativa comenzó a generar interés público, el campo de investigación de visión por computadora ha profundizado su interés en desarrollar modelos de inteligencia artificial capaces de comprender y replicar leyes físicas; sin embargo, el desafío de enseñar a los sistemas de aprendizaje automático a simular fenómenos como la gravedad y la dinámica de fluidos ha sido un enfoque significativo de esfuerzos de investigación durante al menos los últimos cinco años.
Desde que los modelos de difusión latente (LDM) dominaron la escena de la inteligencia artificial generativa en 2022, los investigadores se han enfocado cada vez más en la capacidad limitada de la arquitectura de LDM para comprender y reproducir fenómenos físicos. Ahora, este problema ha ganado prominencia adicional con el desarrollo emblemático del modelo de video generativo de OpenAI Sora, y el (arguablemente) más consecuente lanzamiento reciente de los modelos de video de código abierto Hunyuan Video y Wan 2.1.
Reflejando mal
La mayoría de las investigaciones dirigidas a mejorar la comprensión de la física de los LDM se han centrado en áreas como la simulación de la marcha, la física de partículas y otros aspectos del movimiento newtoniano. Estas áreas han atraído la atención porque las inexactitudes en comportamientos físicos básicos socavarían inmediatamente la autenticidad de los videos generados por la inteligencia artificial.
Sin embargo, una pequeña pero creciente línea de investigación se centra en una de las mayores debilidades de los LDM: su relativa incapacidad para producir reflejos precisos.

Del papel de enero de 2025 ‘Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections’, ejemplos de ‘falla de reflejo’ versus el enfoque de los investigadores. Fuente: https://arxiv.org/pdf/2409.14677
Este problema también fue un desafío durante la era de la CGI y sigue siendo un desafío en el campo de los videojuegos, donde los algoritmos de ray-tracing simulan la trayectoria de la luz a medida que interactúa con superficies. El ray-tracing calcula cómo los rayos de luz virtuales rebotan o pasan a través de objetos para crear reflejos, refracciones y sombras realistas.
Sin embargo, debido a que cada rebote adicional aumenta significativamente el costo computacional, las aplicaciones en tiempo real deben equilibrar la latencia con la precisión limitando el número de rebotes de rayos de luz permitidos.
![Una representación de un haz de luz virtual calculado en un escenario basado en 3D (es decir, CGI), utilizando tecnologías y principios desarrollados por primera vez en la década de 1960 y que llegaron a su punto culminante entre 1982-93 (el período entre Tron [1982] y Jurassic Park [1993]). Fuente: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing](https://www.unite.ai/wp-content/uploads/2025/04/ray-tracing.jpg)
Una representación de un haz de luz virtual calculado en un escenario basado en 3D (es decir, CGI), utilizando tecnologías y principios desarrollados por primera vez en la década de 1960 y que llegaron a su punto culminante entre 1982-93 (el período entre ‘Tron’ [1982] y ‘Jurassic Park’ [1993]). Fuente: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
Por ejemplo, representar una tetera de cromo frente a un espejo podría implicar un proceso de ray-tracing en el que los rayos de luz rebotan repetidamente entre superficies reflectantes, creando un bucle casi infinito con poco beneficio práctico para la imagen final. En la mayoría de los casos, una profundidad de reflejo de dos a tres rebotes ya supera lo que el espectador puede percibir. Un solo rebote resultaría en un espejo negro, ya que la luz debe completar al menos dos viajes para formar un reflejo visible.
Cada rebote adicional aumenta significativamente el costo computacional, a menudo duplicando los tiempos de renderizado, lo que hace que el manejo más rápido de los reflejos sea una de las oportunidades más significativas para mejorar la calidad de renderizado con ray-tracing.
Naturalmente, los reflejos ocurren y son esenciales para la fotorealismo en escenarios mucho menos obvios, como la superficie reflectante de una calle de la ciudad o un campo de batalla después de la lluvia; el reflejo de la calle opuesta en una ventana de una tienda o una puerta de vidrio; o en las gafas de personajes representados, donde los objetos y entornos pueden ser necesarios para aparecer.

Un reflejo gemelo simulado a través de la composición tradicional para una escena icónica en ‘The Matrix’ (1999).
Problemas de imagen
Por esta razón, los marcos que fueron populares antes del advenimiento de los modelos de difusión, como Neural Radiance Fields (NeRF), y algunos desafiantes más recientes como Gaussian Splatting han mantenido sus propias luchas para enactar reflejos de manera natural.
El proyecto REF2-NeRF propuso un método de modelado basado en NeRF para escenas que contienen un caso de vidrio. En este método, la refracción y el reflejo se modelaron utilizando elementos que dependían y no dependían de la perspectiva del espectador. Este enfoque permitió a los investigadores estimar las superficies donde ocurría la refracción, específicamente las superficies de vidrio, y habilitar la separación y el modelado de la luz directa y reflejada.

Ejemplos del papel Ref2Nerf. Fuente: https://arxiv.org/pdf/2311.17116
Otras soluciones de NeRF para reflejos de los últimos 4-5 años han incluido NeRFReN, Reflecting Reality, y el proyecto Planar Reflection-Aware Neural Radiance Fields de Meta de 2024.
Para GSplat, los papeles como Mirror-3DGS, Reflective Gaussian Splatting y RefGaussian han ofrecido soluciones con respecto al problema de reflejo, mientras que el proyecto Nero de 2023 propuso un método personalizado para incorporar cualidades reflectantes en representaciones neuronales.
MirrorVerse
Hacer que un modelo de difusión respete la lógica de reflejo es arguablemente más difícil que con enfoques estructurales explícitos y no semánticos como Gaussian Splatting y NeRF. En los modelos de difusión, una regla de este tipo solo es probable que se incorpore de manera confiable si los datos de entrenamiento contienen muchos ejemplos variados a través de una amplia gama de escenarios, lo que lo hace altamente dependiente de la distribución y calidad del conjunto de datos original.
Tradicionalmente, agregar comportamientos particulares de este tipo es el dominio de un LoRA o el ajuste fino del modelo base; pero estas no son soluciones ideales, ya que un LoRA tiende a sesgar la salida hacia sus propios datos de entrenamiento, incluso sin prompting, mientras que los ajustes finos -además de ser costosos- pueden bifurcar un modelo importante de manera irrevocable lejos del mainstream, y generar una serie de herramientas personalizadas que nunca funcionarán con ninguna otra cepa del modelo, incluyendo el original.
En general, mejorar los modelos de difusión requiere que los datos de entrenamiento presten mayor atención a la física de la reflexión. Sin embargo, muchas otras áreas también necesitan una atención similar. En el contexto de conjuntos de datos de gran escala, donde la curación personalizada es costosa y difícil, abordar cada debilidad de esta manera es impráctico.
No obstante, las soluciones al problema de reflejo de LDM surgen de vez en cuando. Un esfuerzo reciente, de la India, es el proyecto MirrorVerse, que ofrece un conjunto de datos mejorado y un método de entrenamiento capaz de mejorar el estado del arte en este desafío particular en la investigación de difusión.

A la derecha, los resultados de MirrorVerse comparados con dos enfoques anteriores (las dos columnas centrales). Fuente: https://arxiv.org/pdf/2504.15397
Como podemos ver en el ejemplo anterior (la imagen de portada en el PDF del nuevo estudio), MirrorVerse mejora las ofertas recientes que abordan el mismo problema, pero está lejos de ser perfecto.
En la imagen superior derecha, vemos que las jarras de cerámica están ligeramente a la derecha de donde deberían estar, y en la imagen inferior, que técnicamente no debería tener un reflejo de la taza, se ha forzado un reflejo inexacto en el área derecha, en contra de la lógica de los ángulos reflectantes naturales.
Por lo tanto, examinaremos el nuevo método no tanto porque pueda representar el estado actual del arte en la reflexión basada en difusión, sino también para ilustrar la medida en que este puede demostrar ser un problema intratable para los modelos de difusión latente, estáticos y de video, ya que los ejemplos de datos de reflectividad probablemente estén entrelazados con acciones y escenarios particulares.
Por lo tanto, esta función particular de los LDM puede seguir siendo deficiente en comparación con enfoques estructurales específicos como NeRF, GSplat y también CGI tradicional.
El nuevo papel se titula MirrorVerse: Empujando a los modelos de difusión a reflejar el mundo de manera realista, y proviene de tres investigadores de Vision and AI Lab, IISc Bangalore, y el Samsung R&D Institute en Bangalore. El papel tiene una página del proyecto asociada, así como un conjunto de datos en Hugging Face, con código fuente publicado en GitHub.
Método
Los investigadores señalan desde el principio la dificultad que los modelos como Stable Diffusion y Flux tienen para respetar las pautas basadas en reflejos, ilustrando el problema de manera hábil:

Del papel: Los modelos de imagen a texto actuales, SD3.5 y Flux, exhibieron desafíos significativos para producir reflejos consistentes y geométricamente precisos cuando se les pidió que generaran reflejos en la escena.
Los investigadores han desarrollado MirrorFusion 2.0, un modelo generativo basado en difusión destinado a mejorar la fotorealismo y la precisión geométrica de los reflejos de espejo en la imaginería sintética. El entrenamiento del modelo se basó en el conjunto de datos recién curado por los investigadores, titulado MirrorGen2, diseñado para abordar las debilidades de generalización observadas en enfoques anteriores.
MirrorGen2 amplía las metodologías anteriores al introducir posicionamiento de objeto aleatorio, rotaciones aleatorizadas y anclaje de objeto explícito, con el objetivo de garantizar que los reflejos sigan siendo plausibles a través de una amplia gama de poses y colocaciones de objetos en relación con la superficie del espejo.

Esquema para la generación de datos sintéticos en MirrorVerse: la tubería de generación de datos aplicó claves de aumento al posicionar, rotar y anclar objetos dentro de la escena utilizando el 3D-Positioner. Los objetos también se emparejan en combinaciones semánticamente coherentes para simular relaciones espaciales complejas y ocultaciones, lo que permite que el conjunto de datos capture interacciones más realistas en escenas de múltiples objetos.
Para fortalecer aún más la capacidad del modelo para manejar disposiciones espaciales complejas, la tubería MirrorGen2 incorpora escenas de objetos emparejados, lo que permite al sistema representar mejor las ocultaciones y las interacciones entre múltiples elementos en entornos reflectantes.
El papel establece:
‘Las categorías se emparejan manualmente para garantizar la coherencia semántica – por ejemplo, emparejando una silla con una mesa. Durante el renderizado, después de posicionar y rotar el objeto principal, se muestrea un objeto adicional de la categoría emparejada y se organiza para evitar la superposición, garantizando regiones espaciales distintas dentro de la escena.’
En cuanto al anclaje de objeto explícito, aquí los autores garantizaron que los objetos generados estuvieran ‘anclados’ al suelo en los datos sintéticos de salida, en lugar de ‘flotar’ inapropiadamente, lo que puede ocurrir cuando se generan datos sintéticos a gran escala o con métodos altamente automatizados.
Como la innovación en el conjunto de datos es central para la novedad del papel, procederemos antes de lo habitual a esta sección de la cobertura.
Datos y pruebas
SynMirrorV2
El conjunto de datos SynMirrorV2 de los investigadores fue concebido para mejorar la diversidad y el realismo de los datos de entrenamiento de reflejos de espejo, con objetos 3D obtenidos de Objaverse y Amazon Berkeley Objects (ABO), con estas selecciones posteriormente refinadas a través de OBJECT 3DIT, así como del proceso de filtrado de la versión 1 del proyecto MirrorFusion, para eliminar activos de baja calidad. Esto resultó en un grupo refinado de 66,062 objetos.

Ejemplos del conjunto de datos Objaverse, utilizado en la creación del conjunto de datos curado para el nuevo sistema. Fuente: https://arxiv.org/pdf/2212.08051
La construcción de la escena involucró colocar estos objetos sobre suelos texturizados de CC-Textures y fondos HDRI del repositorio CGI de PolyHaven, utilizando espejos de pared completa o rectangulares altos. La iluminación se estandarizó con una luz de área posicionada sobre y detrás de los objetos, a un ángulo de cuarenta y cinco grados. Los objetos se escalonaron para caber dentro de un cubo unitario y se colocaron utilizando una intersección precalculada del espejo y la cámara de visión frustums, garantizando la visibilidad.
Se aplicaron rotaciones aleatorizadas alrededor del eje y, y se utilizó una técnica de anclaje para prevenir ‘artefactos flotantes’.
Para simular escenas más complejas, el conjunto de datos también incorporó múltiples objetos dispuestos según emparejamientos semánticamente coherentes basados en categorías de ABO. Los objetos secundarios se colocaron para evitar la superposición, creando 3,140 escenas de múltiples objetos diseñadas para capturar variadas ocultaciones y relaciones de profundidad.

Ejemplos de vistas renderizadas del conjunto de datos de los autores que contienen múltiples objetos (más de dos), con ilustraciones de segmentación de objetos y visualizaciones de mapas de profundidad vistas debajo.
Proceso de entrenamiento
Reconociendo que el realismo sintético solo no era suficiente para una generalización robusta a datos del mundo real, los investigadores desarrollaron un proceso de aprendizaje de currículum de tres etapas para entrenar a MirrorFusion 2.0.
En la Etapa 1, los autores inicializaron los pesos de ambas ramas de acondicionamiento y generación con el punto de referencia de Stable Diffusion v1.5, y ajustaron finamente el modelo en la división de entrenamiento de objetos únicos del conjunto de datos SynMirrorV2. A diferencia del mencionado proyecto Reflecting Reality, los investigadores no congelaron la rama de generación. Luego, entrenaron el modelo durante 40,000 iteraciones.
En la Etapa 2, el modelo se ajustó finamente durante 10,000 iteraciones adicionales en la división de entrenamiento de objetos múltiples de SynMirrorV2, con el fin de enseñar al sistema a manejar ocultaciones y disposiciones espaciales más complejas encontradas en escenas realistas.
Finalmente, en la Etapa 3, se realizaron 10,000 iteraciones adicionales de ajuste fino utilizando datos del mundo real del conjunto de datos MSD, utilizando mapas de profundidad generados por el estimador de profundidad monocular Matterport3D.

Ejemplos del conjunto de datos MSD, con escenas del mundo real analizadas en mapas de profundidad y segmentación. Fuente: https://arxiv.org/pdf/1908.09101
Durante el entrenamiento, las pautas de texto se omitieron durante el 20 por ciento del tiempo de entrenamiento para alentar al modelo a hacer el mejor uso de la información de profundidad disponible (es decir, un enfoque ‘enmascarado’).
El entrenamiento se llevó a cabo en cuatro GPUs NVIDIA A100 para todas las etapas (la especificación de VRAM no se proporciona, aunque habría sido de 40GB o 80GB por tarjeta). Se utilizó una tasa de aprendizaje de 1e-5 con un tamaño de lote de 4 por GPU, bajo el optimizador AdamW.
Este esquema de entrenamiento aumentó progresivamente la dificultad de las tareas presentadas al modelo, comenzando con escenas sintéticas más simples y avanzando hacia composiciones más desafiantes, con la intención de desarrollar una transferibilidad robusta al mundo real.
Pruebas
Los autores evaluaron a MirrorFusion 2.0 frente al estado del arte anterior, MirrorFusion, que sirvió como la referencia, y realizaron experimentos en el conjunto de datos MirrorBenchV2, cubriendo tanto escenas de objetos únicos como múltiples.
Se realizaron pruebas cualitativas adicionales en muestras del conjunto de datos MSD y el conjunto de datos Google Scanned Objects (GSO).
La evaluación utilizó 2,991 imágenes de objetos únicos de categorías vistas y no vistas, y 300 escenas de dos objetos de ABO. El rendimiento se midió utilizando Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); y Learned Perceptual Image Patch Similarity (LPIPS) puntuaciones, para evaluar la calidad de reflejo en la región del espejo enmascarado. La similitud CLIP se utilizó para evaluar la alineación textual con las pautas de entrada.
En pruebas cuantitativas, los autores generaron imágenes utilizando cuatro semillas para una pauta específica, y seleccionaron la imagen resultante con la mejor puntuación SSIM. Las dos tablas de resultados para las pruebas cuantitativas se muestran a continuación.

Izquierda, resultados cuantitativos para la calidad de generación de reflejos de objetos únicos en la división de objetos únicos de MirrorBenchV2. MirrorFusion 2.0 superó la referencia, con los mejores resultados en negrita. Derecha, resultados cuantitativos para la calidad de generación de reflejos de múltiples objetos en la división de objetos múltiples de MirrorBenchV2. MirrorFusion 2.0 entrenado con múltiples objetos superó la versión entrenada sin ellos, con los mejores resultados en negrita.
Los autores comentan:
‘[Los resultados] muestran que nuestro método supera el método de referencia y que el ajuste fino en múltiples objetos mejora los resultados en escenas complejas.’
La mayoría de los resultados, y aquellos enfatizados por los autores, se refieren a pruebas cualitativas. Debido a las dimensiones de estas ilustraciones, solo podemos reproducir parcialmente los ejemplos del papel.

Comparación en MirrorBenchV2: la referencia falló al mantener reflejos precisos y coherencia espacial, mostrando una orientación incorrecta de la silla y reflejos distorsionados de múltiples objetos, mientras que (según los autores) MirrorFusion 2.0 representa correctamente la silla y los sofás, con posición, orientación y estructura precisas.
De estos resultados subjetivos, los investigadores opinan que el modelo de referencia falló al representar la orientación y las relaciones espaciales de los objetos en los reflejos, a menudo produciendo artefactos como rotaciones incorrectas y objetos flotantes. MirrorFusion 2.0, entrenado en SynMirrorV2, los autores sostienen, preserva la orientación y la posición correctas de los objetos en escenas de objetos únicos y múltiples, lo que resulta en reflejos más realistas y coherentes.
A continuación, vemos resultados cualitativos en el conjunto de datos GSO:

Comparación en el conjunto de datos GSO. La referencia malrepresentó la estructura del objeto y produjo reflejos incompletos y distorsionados, mientras que MirrorFusion 2.0, según los autores, preserva la integridad espacial y genera geometría, color y detalles precisos, incluso en objetos fuera de distribución.
Aquí, los autores comentan:
‘MirrorFusion 2.0 genera reflejos significativamente más precisos y realistas. Por ejemplo, en la Fig. 5 (a – arriba), MirrorFusion 2.0 refleja correctamente las asas de la gaveta (resaltadas en verde), mientras que el modelo de referencia produce un reflejo poco plausible (resaltado en rojo). ‘
‘De manera similar, para la “taza blanca-amarilla” en la Fig. 5 (b), MirrorFusion 2.0 entrega una geometría convincente con mínimos artefactos, a diferencia de la referencia, que falla al capturar con precisión la geometría y el aspecto del objeto.’
La última prueba cualitativa fue contra el conjunto de datos del mundo real MSD (resultados parciales mostrados a continuación):

Resultados de escenas del mundo real que comparan MirrorFusion, MirrorFusion 2.0 y MirrorFusion 2.0, ajustado en el conjunto de datos MSD. MirrorFusion 2.0, según los autores, captura detalles de escena complejos con mayor precisión, incluyendo objetos apilados en una mesa y la presencia de múltiples espejos dentro de un entorno tridimensional. Solo se muestran resultados parciales aquí, debido a las dimensiones de los resultados en el papel original, al que nos referimos al lector para obtener resultados completos y una mejor resolución.
Aquí, los autores observan que aunque MirrorFusion 2.0 se desempeñó bien en los conjuntos de datos MirrorBenchV2 y GSO, inicialmente luchó con escenas del mundo real complejas en el conjunto de datos MSD. Ajustar el modelo en un subconjunto de MSD mejoró su capacidad para manejar entornos abarrotados y múltiples espejos, lo que resultó en reflejos más coherentes y detallados en la división de prueba retenida.
Además, se realizó un estudio de usuario, en el que el 84% de los usuarios informaron que prefirieron las generaciones de MirrorFusion 2.0 sobre el método de referencia.

Resultados del estudio de usuario.
Dado que los detalles del estudio de usuario se han relegado al apéndice del papel, nos referimos al lector a ese para los detalles específicos del estudio.
Conclusión
Aunque varios de los resultados mostrados en el papel son mejoras impresionantes en el estado del arte, el estado del arte para esta búsqueda particular es tan deficiente que incluso una solución agregada poco convincente puede ganar con un mínimo esfuerzo. La arquitectura fundamental de un modelo de difusión es inimical a la aprendizaje y demostración confiables de física consistente, por lo que el problema está mal planteado y aparentemente no está dispuesto hacia una solución elegante.
Además, agregar datos a los modelos existentes ya es el método estándar para remediar las deficiencias en el rendimiento de los LDM, con todas las desventajas mencionadas anteriormente. Es razonable asumir que si los conjuntos de datos de gran escala futuros prestaran más atención a la distribución (y anotación) de puntos de datos relacionados con reflejos, podríamos esperar que los modelos resultantes manejaran mejor este escenario.
Pero lo mismo es cierto para múltiples otros problemas en la salida de LDM – ¿quién puede decir cuál de ellos merece más el esfuerzo y el dinero involucrados en el tipo de solución que los autores del nuevo papel proponen aquí?
Primero publicado el lunes 28 de abril de 2025. Martes 29 de abril: se corrigió la gramática en los párrafos finales.












