Ángulo de Anderson

Introduciendo imágenes generadas por AI con HDR a la luz

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

Las imágenes y videos generados por AI pueden ser impresionantes, pero no están a la altura de los estándares ‘profesionales’ – un problema que un nuevo proyecto de investigación busca abordar.

 

En la comunidad audiovisual profesional, una de las objeciones más frecuentes a la incursión de la IA es la falta actual de estándares profesionales de reproducción de imágenes y video. No menos importante es la capacidad de trabajar con imágenes y video de Alto Rango Dinámico (HDR).

Las imágenes HDR son el equivalente moderno de una práctica fotográfica del siglo XIX y XX llamada bracketing, donde la misma imagen se toma varias veces con cantidades crecientes de luz que llegan al emulsión de la película:

Arriba, una secuencia de imágenes bracketeadas. En el recuadro inferior, el rango dinámico alto que se puede extrapolar de estas fotos en una sola imagen. Fuente – Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

Arriba, una secuencia de imágenes bracketeadas. En el recuadro inferior, el rango dinámico alto que se puede extrapolar de estas fotos en una sola imagen. Fuente

En la fotografía tradicional, esto resultaba en varias imágenes que, con cierta experiencia y esfuerzo, se podían componer en una sola impresión que se beneficiara de todos los niveles de detalle disponibles en el rango de exposiciones. Pero no era un proceso trivial.

En la actualidad, una secuencia de imágenes ‘auto-bracketeadas’ puede producir varias imágenes o combinarse en una sola imagen HDR – efectivamente, una multiplicidad de exposiciones en una imagen, que las aplicaciones de edición de imágenes compatibles con HDR como Photoshop pueden iterar y permitir que el fotógrafo orquestre en una imagen de salida ideal.

Si te preguntas por qué deberías importarte, o cómo este tipo de cosas afecta tu propia fotografía, la ilustración de este artículo pretende demostrarlo de una manera familiar:

Arriba, a la izquierda, vemos un ejemplo típico de una imagen sRGB (es decir, no HDR). Simplemente iluminarla (mostrado a la derecha) no no muestra al monstruo en el armario, porque ese detalle se descartó cuando el fotógrafo y los procesos automatizados de la cámara decidieron qué priorizar en la foto:

A continuación, se muestra una indicación (izquierda) de cómo estaría ‘deslavado’ el primer plano en el momento de la exposición para registrar al monstruo en el armario en una foto no HDR, y (derecha) cómo el monstruo se sumerge en la oscuridad cuando la exposición se hace adecuada para los sujetos del primer plano bien iluminados:

A continuación, vemos el tipo de detalle que se puede ‘rescatar’ de una imagen o secuencia HDR. En este caso, el monstruo estaba ‘escondido’ en los registros visuales más bajos de la secuencia HDR, en un nivel donde el resto del contenido habría sido ‘sobrepasado’ en blanco (arriba, izquierda). Al especificar que se deben expresar una amplia gama de niveles de brillo, selectivamente, en la misma imagen, estos elementos disonantes se pueden componer en una sola imagen racional:

Una imagen no HDR se conoce como imagen referida a la pantalla, y una imagen HDR de alto rango de colores se conoce como imagen referida a la escena.

El video HDR también existe, y este tipo de versatilidad y ductilidad tonal realmente da a los cineastas cierta libertad para rescatar, graduar y interpretar la filmación de manera creativa y coherente; no es de extrañar, entonces, que los creativos se nieguen a trabajar con la salida ‘aplanada’ sRGB típica de la mayoría de los marcos generativos de IA.

HDR en IA

Naturalmente, la escena de investigación está interesada en llevar los marcos generativos de IA a la era HDR. Sin embargo, no es una tarea trivial, tanto por la arquitectura fundamental de los sistemas generativos de difusión como por la escasez de buenos datos HDR, que ocupan mucho espacio en disco y hacen que las colecciones sean engorrosas; en consecuencia, los conjuntos de datos adecuados para la tarea son escasos.

A pesar de esto, una colaboración entre una universidad en Singapur y Adobe Research está ofreciendo un método para producir secuencias de imágenes HDR, en una metodología que puede aplicarse teóricamente a video así como a imágenes fijas:

Desde el sitio del proyecto para el nuevo trabajo, ejemplos de salida de 'bracketing' de texto a imagen. Fuente - https://github.com/ykdai/LinearGen

Desde el sitio del proyecto para el nuevo trabajo, ejemplos de salida de ‘bracketing’ de texto a imagen. Fuente

El nuevo sistema genera varias versiones alineadas de la misma imagen a diferentes niveles de brillo y aprende cuán brillante era la escena en realidad, y luego las combina en un solo resultado que mantiene el detalle en sombras y luces, permitiendo que los ajustes posteriores de exposición o color se comporten más como ajustes a una captura de cámara real que como ajustes frágiles a una imagen completamente procesada.

El sistema aprovecha una diversidad de diferentes modelos para la tarea, incluyendo variantes de Qwen y Flux:

Ejemplos del nuevo documento, que muestran cómo el sistema puede generar múltiples versiones de exposición de la misma escena mientras mantiene la estructura subyacente fija. A partir de un mapa de bordes simple, el modelo produce imágenes consistentes a través de configuraciones muy oscuras a muy brillantes, ya sea que la promoción describa la luz de la luna, la luz del sol, el atardecer o incluso un objeto pequeño como un globo, con el sujeto y la composición manteniéndose estables mientras solo cambia la iluminación. El método puede variar el brillo de una manera controlada y similar a una cámara, en lugar de desviarse o inventar nuevo contenido a medida que cambia la exposición. Fuente - https://arxiv.org/pdf/2604.21008

Ejemplos del nuevo documento, que muestran cómo el sistema puede generar múltiples versiones de exposición de la misma escena mientras mantiene la estructura subyacente fija. A partir de un mapa de bordes simple, el modelo produce imágenes consistentes a través de configuraciones muy oscuras a muy brillantes, ya sea que la promoción describa la luz de la luna, la luz del sol, el atardecer o incluso un objeto pequeño como un globo, con el sujeto y la composición manteniéndose estables mientras solo cambia la iluminación. El método puede variar el brillo de una manera controlada y similar a una cámara, en lugar de desviarse o inventar nuevo contenido a medida que cambia la exposición. Fuente

Los autores afirman:

‘Generar imágenes lineales es desafiante, ya que los VAE preentrenados en los modelos de difusión latente luchan por preservar simultáneamente los destacados y sombras extremos debido al mayor rango dinámico y profundidad de bits.

‘Con este fin, representamos una imagen lineal como una secuencia de brackets de exposición, cada uno capturando una porción específica del rango dinámico, y proponemos una arquitectura de flujo de coincidencia basada en DiT para la generación de brackets de exposición condicionada por texto.

‘Además, demostramos aplicaciones posteriores, incluyendo edición de imágenes lineales guiada por texto y generación condicionada por estructura a través de ControlNet.’

El nuevo trabajo se titula Generación de imágenes lineales mediante síntesis de brackets de exposición, y proviene de cuatro autores en S-Lab en la Universidad Tecnológica de Nanyang, Adobe NextCam y Adobe Research. Además de la página del proyecto y el video de YouTube que acompañan el lanzamiento, también hay un repositorio de GitHub (actualmente escaso) y la promesa de un lanzamiento de conjunto de datos.

Aunque los autores proporcionan muchos ejemplos de salida del sistema en la página del proyecto asociado, los espectadores necesitarán un monitor compatible con HDR para distinguir realmente las características de la salida HDR presentada. Sin embargo, encontrará la visión general de los investigadores en YouTube incrustada al final de este artículo – pero tenga en cuenta que las diferencias entre los ejemplos mostrados pueden no ser claras en un monitor no HDR.

Método y datos

Los autores enfatizan la medida en que la recopilación de datos es un desafío en esta búsqueda particular:

‘Adquirir un gran número de imágenes lineales es extremadamente desafiante en la práctica. Además, la mayoría de los conjuntos de datos HDR públicos son panorámicos (y se centran casi exclusivamente en el contenido de escenas a gran escala) o no proporcionan imágenes lineales verdaderas, lo que los hace inadecuados para nuestros propósitos.

‘Por lo tanto, utilizamos principalmente conjuntos de datos de imágenes RAW como base para el entrenamiento.’

Los investigadores hicieron un uso creativo de las pocas opciones que tenían, aprovechando el conjunto de datos RAISE como datos de entrenamiento reales, y el conjunto de datos MIT-Adobe FiveK como datos de evaluación*.

Para construir datos de entrenamiento HDR utilizables, los investigadores pasaron los archivos de cámara RAW a través de un flujo de trabajo estandarizado para eliminar las rarezas de la cámara, convirtiendo las imágenes en un formato lineal consistente y referido a la escena:

El sistema comienza con ruido que representa cuatro niveles de exposición de la misma escena, junto con una promoción de texto y un token de brillo, y los procesa a través de bloques de transformadores apilados que mantienen las diferentes exposiciones alineadas mientras se ajustan la iluminación. Luego, predice tanto el conjunto de imágenes de exposición como una escala de brillo general, y posteriormente decodifica y combina en una sola imagen referida a la escena, conservando el detalle en sombras y luces.

Esquema para el flujo de trabajo de los autores: el sistema comienza con ruido que representa cuatro niveles de exposición de la misma escena, junto con una promoción de texto y un token de brillo. Esto se procesa a través de bloques de transformadores apilados que mantienen las diferentes exposiciones alineadas, mientras se ajustan la iluminación. El sistema luego predice tanto el conjunto de imágenes de exposición como una escala de brillo general, y posteriormente decodifica y combina en una sola imagen referida a la escena, conservando el detalle en sombras y luces.

Esto implicó reconstruir RGB completo a partir de los datos del sensor, aplicar corrección de color, normalizar el equilibrio de blancos y moverse brevemente a un espacio de color perceptual para desenruidar antes de regresar a una señal de luz lineal limpia. La luz real en la escena se recuperó luego utilizando la configuración de exposición de la cámara, para que cada píxel reflejara la verdadera brillantez en lugar de una aproximación lista para su visualización.

Dado que tales valores pueden variar ampliamente, los datos se estabilizaron luego escalando cada imagen según su propia distribución de brillo, utilizando estadísticas de medio rango y luces para evitar tanto imágenes deslavadas como luces sobrepasadas, obteniendo finalmente una imagen lineal normalizada que preservaba el verdadero rango de luz en la escena, mientras permanecía lo suficientemente estable como para el entrenamiento.

Las etiquetas de texto para las imágenes se crearon con el modelo Qwen2.5-VL 7B, con promociones elaboradas para coincidir con las características del modelo Flux que se utilizarían en el momento de la generación.

Cada imagen se dividió en ‘rebanadas’ de exposición y se pasó a través de un codificador VAE compartido, convirtiendo todas las exposiciones en un espacio latente común diseñado para capturar el rango de brillo completo. Los latentes se refinaron a partir del ruido y se decodificaron nuevamente en imágenes, permitiendo una reconstrucción consistente a través de regiones oscuras y brillantes, sin colapsarlas en una sola exposición ‘aplanada’.

Se utilizó ajuste fino LoRA para adaptar el modelo Flux preentrenado a datos de imágenes lineales con un mínimo de parámetros adicionales, ayudando al modelo Single-Diffusion Transformers (single-DiT) a permanecer estable, incluso a medida que el brillo variaba a través de los brackets de exposición.

Se introdujo la atención de autoexposición (columna central en la ilustración del esquema anterior) para procesar conjuntamente todos los brackets, permitiendo que la luminancia se ajustara por exposición mientras se mantenían la estructura y el detalle fino alineados.

Se utilizó incrustación de posición rotativa 3D (3D-R[o]PE) para codificar tanto la posición espacial como la identidad de exposición, para que el modelo pudiera distinguir a qué bracket pertenecía cada token, mientras preservaba la coherencia espacial, lo que permitió una separación limpia de la variación de brillo del contenido de la escena.

Una visión general del conjunto de datos utilizado en el estudio, que muestra cómo las imágenes se distribuyen a través de tipos de contenido y escenas interiores versus exteriores, junto con la dispersión de valores de brillo en los datos procesados. Los histogramas trazan la luminancia y la escala de radiancia en espacio logarítmico, ilustrando cómo puede variar ampliamente la brillantez del mundo real, con valores de radiancia más altos que corresponden a escenas físicamente más brillantes y resaltando el fuerte rango dinámico que el modelo está entrenado para manejar.

Una visión general del conjunto de datos utilizado en el estudio, que muestra cómo las imágenes se distribuyen a través de tipos de contenido y escenas interiores versus exteriores, junto con la dispersión de valores de brillo en los datos procesados. Los histogramas trazan la luminancia y la escala de radiancia en espacio logarítmico, ilustrando cómo puede variar ampliamente la brillantez del mundo real, con valores de radiancia más altos que corresponden a escenas físicamente más brillantes y resaltando el fuerte rango dinámico que el modelo está entrenado para manejar.

3D-RoPE separó dónde estaba una característica y ‘de qué exposición proviene’ en señalesales separadas, para que la variación de brillo se pudiera ajustar de forma independiente, sin corromper el detalle espacial.

Pruebas

Los investigadores utilizaron Flux-dev como marco generativo, con entrenamiento que ocurre en cuatro GPU NVIDIA A100, cada una con 80GB de VRAM. El tamaño de lote se estableció en 4 (por GPU), durante 10,000 iteraciones.

El ajuste fino LoRA utilizó un rango de 64. El optimizador AdamW se utilizó con una tasa de aprendizaje de 2×102 (para el aspecto de modulación de exposición).

Los autores señalan que, aunque hay dos trabajos anteriores que son similares en alcance, ninguno de ellos es un contendiente obvio para una fase de pruebas. El trabajo de 2022 liderado por Max Planck GlowGAN se limita a generar categorías de imágenes específicas, mientras que Bracket Diffusion de 2025 (también liderado por el Instituto Max Planck) solo puede generar una imagen HDR a 256x256px y tarda varios minutos en hacerlo.

Del papel original de GlowGAN, las imágenes de rango dinámico bajo (LDR) típicas pierden detalles en sombras y luces, mientras que el modelo aprende a producir versiones de rango dinámico alto (HDR) que conservan detalles a través de niveles de brillo y permiten la recuperación de regiones saturadas a través de la cartografía de tonos inversa. Fuente - https://arxiv.org/pdf/2211.12352

Del papel original de GlowGAN, las imágenes de rango dinámico bajo (LDR) típicas pierden detalles en sombras y luces, mientras que el modelo aprende a producir versiones de rango dinámico alto (HDR) que conservan detalles a través de niveles de brillo y permiten la recuperación de regiones saturadas a través de la cartografía de tonos inversa. Fuente

Por lo tanto, en ausencia de líneas de base directas para la generación de imágenes lineales, los autores compararon su método con versiones adaptadas de modelos existentes, en lugar de alternativas diseñadas específicamente.

Un conjunto de experimentos (‘T2I Fine-Tuning’) ajustó el modelo de difusión de texto a imagen Flux utilizando LoRA, entrenándolo para generar imágenes lineales directamente y evaluando cómo un modelo T2I de estado del arte se adaptó a este dominio.

Una segunda comparación (‘T2V fine-tuning’) utilizó el modelo de texto a video Wan 2.1, cuyo VAE comprime múltiples marcos en una representación latente compartida; en este entorno, cuatro brackets de exposición se codificaron en una sola representación latente y luego se decodificaron nuevamente, probando si una canalización de video podría modelar la variación de exposición.

El tercer conjunto de experimentos (‘T2I Model Inflation’) comparó contra CameraCtrl y Generative Photography, que ambos extienden los modelos de difusión de imágenes a través de módulos temporales para producir salidas multi-marco. Estos también se ajustaron finamente en los mismos datos, para una comparación coherente.

Las métricas utilizadas fueron Fréchet Inception Distance (FID); Puntuación estética (AS); Evaluador de calidad de imagen natural (NIQUE); Puntuación de similitud CLIP; y Similitud de luminancia (LS):

Una comparación del método de los autores contra varias líneas de base adaptadas para generar imágenes lineales referidas a la escena. Los modelos de texto a imagen (Flux) y texto a video (Wan 2.1) se ajustan con LoRA para probar cómo manejan los sistemas generativos existentes este entorno, mientras que CameraCtrl y Generative Photography extienden los modelos de difusión con componentes temporales. Algunas puntuaciones faltan porque ciertos modelos no pueden producir consistentemente brackets de exposición, que se requieren para recuperar el rango dinámico completo. A través de las métricas informadas, el nuevo método logra los resultados generales más fuertes, particularmente en las medidas relacionadas con la calidad de la imagen y la reconstrucción de brillo precisa.

Una comparación del método de los autores contra varias líneas de base adaptadas para generar imágenes lineales referidas a la escena. Los modelos de texto a imagen (Flux) y texto a video (Wan 2.1) se ajustan con LoRA para probar cómo manejan los sistemas generativos existentes este entorno, mientras que CameraCtrl y Generative Photography extienden los modelos de difusión con componentes temporales. Algunas puntuaciones faltan porque ciertos modelos no pueden producir consistentemente brackets de exposición, que se requieren para recuperar el rango dinámico completo. A través de las métricas informadas, el nuevo método logra los resultados generales más fuertes, particularmente en las medidas relacionadas con la calidad de la imagen y la reconstrucción de brillo precisa.

En cuanto a estos resultados, los autores afirman:

‘Debido a la amplia distribución de imágenes lineales, ajustar directamente el modelo T2I en datos lineales hace que sea difícil equilibrar los detalles de sombras y luces. Los métodos de inflación del modelo T2I sufren de un rango dinámico limitado y una degradación significativa de la calidad de la imagen incluso después del ajuste fino.

‘Para el ajuste fino T2V, la reducción de muestreo temporal 4x de Wan 2.1 entrelaza los 4 brackets de exposición en una sola representación latente, lo que causa una discrepancia de distribución grave que no se puede resolver solo a través del ajuste fino.

‘Al modelar directamente las propiedades referidas a la escena utilizando brackets de exposición, nuestro método logra una calidad visual y rango dinámico superiores en todas las líneas de base.’

Una comparación con Flux adaptado con LoRA y Wan 2.1, que muestra cómo cada método maneja los cambios de exposición a través de las mismas escenas. Los enfoques competitivos tienden a perder detalles en regiones muy oscuras o muy brillantes, mientras que el método propuesto mantiene una estructura consistente y recupera detalles útiles en todo el rango de exposiciones.

Una comparación con Flux adaptado con LoRA y Wan 2.1, que muestra cómo cada método maneja los cambios de exposición a través de las mismas escenas. Los enfoques competitivos tienden a perder detalles en regiones muy oscuras o muy brillantes, mientras que el método propuesto mantiene una estructura consistente y recupera detalles útiles en todo el rango de exposiciones. Por favor, consulte el documento de la fuente y la sección de materiales suplementarios para ejemplos de resultados de mayor calidad.

Por favor, consulte la sección de experimentos extendidos y materiales suplementarios del documento de la fuente para más pruebas.

Conclusión

Para los profesionales de los medios, como aquellos que trabajan en la producción de cine y televisión, la misma salida que ha capturado la imaginación (y, cada vez más, la ira) del mundo los ha dejado indiferentes, ya que casi todos sus flujos de trabajo dependen de alguna manera de capturas HDR.

Por lo tanto, este es un proyecto oportuno, que representa una característica que uno esperaría que se convirtiera en un estándar opcional en nuevos marcos – aunque es cierto que es probable que duplique los tiempos de renderizado; claramente, también, la latencia tendrá que abordarse en serio si el contenido de IA HDR no ha de ser relegado a la categoría ‘en post’ en lugar de ‘en cámara’.

 

* Normalmente mostraríamos ejemplos, pero como el lector puede no tener un monitor compatible con HDR, los omitimos en este caso.

Publicado por primera vez el domingo 26 de abril de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]