Anderson의 관점

AI 생성 이미지에 HDR 적용하기

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2): 'A mother and daughter take a selfie in a bedroom, with an empty dark closet in one version and a brightly revealed, surprised furry creature inside it in the other.'

AI 이미지와 비디오는 인상적이지만, 전문가 수준의 표준은 아니다. 새로운 연구 프로젝트가 이 문제를 해결하고자 한다.

 

전문 오디오-비주얼 커뮤니티에서 가장 빈번하게 제기되는 AI의 침투에 대한 반론 중 하나는 이미지와 비디오 재生的 전문가 수준의 표준이 부족하다는 것이다. 이러한 표준 중 하나는 High Dynamic Range(HDR) 이미지와 비디오를 처리하는 능력이다.

HDR 이미지는 19세기/20세기 사진 기술인 브래킷팅과 유사하다. 브래킷팅에서는 같은 사진을 여러 번 다른 밝기 수준으로 촬영하여 하나의 이미지로 합성한다.

위에 있는 브래킷팅 시퀀스. 아래에 있는 HDR 이미지는 이러한 사진에서 추출할 수 있다. 출처 - Alex Wise Photography - https://www.alexwisephotography.net/blog/2013/01/12/automatic-exposure-bracketing-aeb-explained/

위에 있는 브래킷팅 시퀀스. 아래에 있는 HDR 이미지는 이러한 사진에서 추출할 수 있다. 출처

전통적인 사진에서는 여러 장의 사진을 하나의 이미지로 합성하기 위해 전문 기술과 노력이 필요했다. 하지만 현대에는 자동 브래킷팅 이미지를 생성하여 하나의 HDR 이미지로 합성할 수 있다.

이미지를 밝게 하거나 어둡게 하는 것은 단순히 노출을 조정하는 것이 아니다. 노출을 조정하면 일부 세부 사항이 손실될 수 있다.

위의 왼쪽 이미지는 일반적인 sRGB 이미지이다. 오른쪽 이미지는 밝기를 높인 이미지이다. 그러나 밝기를 높여도 일부 세부 사항이 손실된다.

아래의 왼쪽 이미지는 전경이 밝게 나타나는 이미지를 위해 노출을 조정한 결과이다. 오른쪽 이미지는 전경이 어둡게 나타나는 이미지를 위해 노출을 조정한 결과이다.

아래의 이미지는 HDR 이미지를 사용하여 세부 사항을 유지한 결과이다.

일반적인 이미지는 디스플레이-참조 이미지로 알려져 있다. HDR 이미지는 장면-참조 이미지로 알려져 있다.

HDR 비디오도 존재하며, 이는 영화 制作자에게 твор적인 자유를 제공한다.

HDR in AI

연구자들은 AI 생성 이미지에 HDR을 적용하는 방법을 찾고 있다. 그러나 이는 쉽지 않은 작업이다. 좋은 HDR 데이터는 디스크 공간을 많이 차지하기 때문에, 이러한 데이터를 얻는 것이 어렵다.

싱가포르의 한 대학과 Adobe Research의 협력으로, HDR 이미지 시퀀스를 생성하는 방법이 제안되었다. 이 방법은 이론적으로 비디오에도 적용될 수 있다.

새로운 연구의 프로젝트 사이트에서 제공하는 텍스트-이미지 출력의 예시. 출처 - https://github.com/ykdai/LinearGen

새로운 연구의 프로젝트 사이트에서 제공하는 텍스트-이미지 출력의 예시. 출처

새로운 시스템은 같은 이미지의 여러 버전을 다른 밝기 수준으로 생성하고, 실제 장면의 밝기를 학습하여, 세부 사항을 유지한 하나의 결과 이미지를 생성한다.

이 시스템은 Qwen과 Flux와 같은 다양한 모델을 사용한다.

새로운 논문에서 제공하는 예시. 같은 장면의 여러 노출 버전을 생성할 수 있다. 출처 - https://arxiv.org/pdf/2604.21008

새로운 논문에서 제공하는 예시. 같은 장면의 여러 노출 버전을 생성할 수 있다. 출처

연구자들은 다음과 같이 말한다.

‘선형 이미지를 생성하는 것은 어려운 작업이다. 미리 학습된 VAE는 잠재적 확산 모델에서 극단적인 하이라이트와 섀도우를 동시에 유지하기 어렵기 때문이다.’

‘이 문제를 해결하기 위해, 우리는 선형 이미지를 노출 브래킷의 시퀀스로 표현하고, 노출 브래킷 생성을 위한 DiT 기반의 플로우 매칭 아키텍처를 제안한다.’

‘우리는 또한 텍스트-이미지 편집과 구조-조건부 생성을 위한 다운스트림 애플리케이션을 демон스트레이션한다.’

새로운 연구는 Linear Image Generation by Synthesizing Exposure Brackets으로 제목이 붙여졌으며, 네 명의 연구자에 의해 수행되었다.

연구자들은 많은 예시를 제공하지만, 이러한 예시는 HDR 모니터에서만 제대로 구분할 수 있다. 따라서 연구자의 유튜브 개요를 이 글의 끝에 첨부했다.

Method and Data

연구자들은 데이터 수집이 이 연구의 주요 도전 중 하나라고 강조한다.

‘선형 이미지를大量으로 수집하는 것은 실제로 매우 어렵다. 대부분의 공개된 HDR 데이터셋은 EITHER 전경에만 초점을 맞추거나 실제 선형 이미지를 제공하지 않기 때문에 우리의 목적에 적합하지 않다.’

‘따라서 우리는 주로 RAW 이미지 데이터셋을 훈련의 기초로 사용한다.’

연구자들은 몇 가지 옵션을 사용하여 데이터를 수집했다. RAISE 데이터셋을 훈련 데이터로 사용했고, MIT-Adobe FiveK 데이터셋을 평가 데이터로 사용했다.

연구자들은 RAW 카메라 파일을 표준화된 파이프라인을 통해 처리하여 카메라 특정한 특성을 제거하고, 일관된 선형 형식으로 변환했다.

시스템의 워크플로우. 시스템은 같은 장면의 여러 노출 버전을 생성하고, 실제 장면의 밝기를 학습하여, 세부 사항을 유지한 하나의 결과 이미지를 생성한다.

시스템의 워크플로우. 시스템은 같은 장면의 여러 노출 버전을 생성하고, 실제 장면의 밝기를 학습하여, 세부 사항을 유지한 하나의 결과 이미지를 생성한다.

이 과정에는 RGB를 재구성하고, 색상 보정을 적용하고, 화이트 밸런스를 정규화하고, 감지 노イズ를 제거하는 단계가 포함되었다.

이미지의 텍스트 레이블은 Qwen2.5-VL 7B 모델을 사용하여 생성되었다.

이미지는 노출 ‘슬라이스’로 분할되어 공유된 VAE 인코더를 통해 처리되어, 모든 노출을 공통의 잠재 공간으로 변환했다.

LoRA fine-tuning을 사용하여 미리 학습된 Flux 백본을 선형 이미지 데이터에 적응시켰다.

Exposure Modulation Self-Attention을 도입하여 모든 브래킷을 공동으로 처리하여, 밝기를 각 노출에 맞게 조정할 수 있었다.

3D Rotary Positional Embedding을 사용하여 공간 위치와 노출 아이디를 인코딩하여, 모델이 각 토큰이 어느 브래킷에 속하는지 구별할 수 있었다.

데이터셋의 개요. 이미지의 분포와 밝기 값을 나타낸다.

데이터셋의 개요. 이미지의 분포와 밝기 값을 나타낸다.

3D-RoPE는 공간 위치와 노출 아이디를 분리하여, 밝기 변화를 독립적으로 조정할 수 있었다.

Tests

연구자들은 Flux-dev를 생성 프레임워크로 사용했고, 훈련은 4개의 NVIDIA A100 GPU에서 수행되었다.

LoRA fine-tuning을 사용하여 Flux를 훈련시켰고, 텍스트-이미지 확산 모델을 평가했다.

두 번째 비교는 텍스트-비디오 모델 Wan 2.1을 사용했다.

세 번째 실험은 CameraCtrl과 Generative Photography를 사용했다.

연구자들은 다음과 같이 말한다.

‘T2I 모델을 직접 선형 데이터에 미세 조정하면, 그림자와 하이라이트의 세부 사항을 균형 있게 유지하기 어렵다. T2I 모델 확장은 동적 범위와 이미지 품질이 제한적이고 훈련 후에도 이미지 품질이恶化한다.’

‘T2V 미세 조정의 경우, Wan 2.1의 4× 시간적 다운샘플링은 4개의 노출 브래킷을 하나의 잠재 표현으로 얽어매서, 미세 조정을 통해 해결할 수 없는 분포 불일치를 유발한다.’

‘노출 브래킷을 사용하여 장면-참조 속성을 직접 모델링함으로써, 우리의 방법은 모든 기준선보다 우수한 시각적 품질과 동적 범위를 달성한다.’

LoRA-적응 Flux와 Wan 2.1과 비교. 우리의 방법은 노출 변경에 대해 일관된 구조와 세부 사항을 유지한다.

LoRA-적응 Flux와 Wan 2.1과 비교. 우리의 방법은 노출 변경에 대해 일관된 구조와 세부 사항을 유지한다.

Conclusion

미디어 전문가들에게, 이러한 출력은 전문가 수준의 파이프라인에서 사용할 수 있는 HDR 캡처를 제공하는 시의적절한 프로젝트이다.

그러나 이는 렌더링 시간을 두 배로 늘릴 수 있으며, 지연 시간을 해결해야 한다.

 

* 일반적으로 예시를 제공하지만, 이 경우에는 HDR 모니터가 필요하기 때문에 생략한다.

최초로 게시된 날짜: 2026년 4월 26일

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]