Anderson의 관점

반사와 거울의 이해를 제한한 확산 모델의 수정

mm
Unite.AI를 Google의 선호 소스에 추가
ChatGPT-4o and Adobe Firefly

제네릭 AI가 대중의 관심을 끌기 시작한 이후, 컴퓨터 비전 연구 분야는 물리 법칙을 이해하고 복제할 수 있는 AI 모델을 개발하는 데 관심을 깊게 가지고 있습니다. 그러나 중력과 액체 역학과 같은 현상을 시뮬레이션하는 데 필요한 기계 학습 시스템을 교육하는 것은 지난 5년 동안 연구 노력의 주요 초점이었습니다.

2022년에 잠재 확산 모델(LDM)이 생성 AI 장면을 지배하기 시작한 이후, 연구자들은 LDM 아키텍처의 물리 현상을 이해하고 재현하는 능력에 대한 제한에 점점 더 관심을 두고 있습니다. 이제 이 문제는 OpenAI의 생성 비디오 모델 Sora와 Hunyuan Video 및 Wan 2.1과 같은 오픈 소스 비디오 모델의 개발로 인해 더욱 두드러지게 되었습니다.

반사에 대한 나쁜 인식

물리학을 개선하기 위한 대부분의 연구는 걸음새 시뮬레이션, 입자 물리학 및 뉴턴 운동과 같은 분야에 초점을 맞추고 있습니다. 이러한 분야는 AI 생성 비디오의 진실성을 즉시 훼손할 수 있는 기본 물리적 행동의 부정확성으로 인해 주목을 받았습니다.

그러나 연구의 작은 nhưng 점점 증가하는 분야는 LDM의 가장 큰 약점 중 하나인 반사의 정확한 생성에 중점을 두고 있습니다.

2025년 1월 논문 'Reflecting Reality: 확산 모델을 통해 신뢰할 수 있는 거울 반사를 생성하는 것'의 예시입니다.

2025년 1월 논문 ‘Reflecting Reality: 확산 모델을 통해 신뢰할 수 있는 거울 반사를 생성하는 것’의 예시입니다.

이 문제는 CGI 시대와 비디오 게임 분야에서도 도전 과제였습니다. 여기서 레이 트레이싱 알고리즘은 가상 광선이 물체와 상호 작용하는 경로를 시뮬레이션하여 현실적인 반사,屈折 및 그림자를 생성합니다.

그러나 각 추가 반사에 대한 계산 비용이 크게 증가하기 때문에 실시간 응용 프로그램은 레이 트레이싱의 정확성과 대기 시간을 절충해야 합니다.

전통적인 3D 기반 시나리오에서 가상으로 계산된 광선의 표현입니다.

전통적인 3D 기반 시나리오에서 가상으로 계산된 광선의 표현입니다.

예를 들어, 거울 앞에 크롬 티팟을描写하는 것은 반복적으로 반사되는 광선의 레이 트레이싱 프로세스를 포함할 수 있습니다. 이는 거의 무한 루프를 생성하며 최종 이미지에 거의 실질적인 이점이 없습니다. 대부분의 경우, 2~3개의 반사 깊이가 이미 관찰 가능한 것을 초과합니다. 단일 반사는 검은 거울을 생성할 것입니다. 왜냐하면 광선이 가시적인 반사를 형성하기 위해 최소 두 번의 여행을 완료해야 하기 때문입니다.

추가 반사가 계산 비용을 크게 증가시킵니다. 이는 렌더링 시간을 두 배로 늘릴 수 있으며, 반사의 처리를 더 빠르게 하는 것이 레이 트레이싱 렌더링 품질을 개선하는 가장 중요한 기회 중 하나입니다.

반사는 사진 현실성에 필수적이며, 도시 거리나 비가 내린 후의 전투와 같은 시나리오에서 발생할 수 있습니다. 또한 상점 창문이나 유리문에 반사된 거리 또는 물체와 환경이 나타날 수 있는 캐릭터의 안경과 같은 시나리오에서도 발생할 수 있습니다.

전통적인 컴포지팅을 통해 생성된 쌍둥이 반사입니다.

전통적인 컴포지팅을 통해 생성된 쌍둥이 반사입니다.

이미지 문제

이러한 이유로 확산 모델이 등장하기 전에 인기 있었던 프레임워크인 NeRF(Neural Radiance Fields)와 최근의 도전자인 Gaussian Splatting은 자연스럽게 반사를 구현하는 데 어려움을 겪었습니다.

REF2-NeRF 프로젝트는 유리 케이스와 같은 장면을 모델링하기 위한 NeRF 기반 방법을 제안했습니다. 이 방법은 관찰자의 관점에 따라 의존적이고 독립적인 요소를 사용하여屈折과 반사를 모델링했습니다. 이 접근 방식은 연구자들이屈折이 발생하는 표면을 추정할 수 있도록 하였으며, 직접 및 반사 光成分을 분리하고 모델링할 수 있도록 하였습니다.

Ref2Nerf 논문의 예시입니다.

Ref2Nerf 논문의 예시입니다.

NeRF를 위한 다른 반사 솔루션에는 NeRFReN, Reflecting Reality 및 Meta의 2024 Planar Reflection-Aware Neural Radiance Fields 프로젝트가 있습니다.

Gaussian Splatting을 위한 솔루션에는 Mirror-3DGS, Reflective Gaussian Splatting 및 RefGaussian이 있습니다. 또한 2023년 Nero 프로젝트는 신경망 표현에 반사 특성을 통합하는 맞춤형 방법을 제안했습니다.

미러버스

확산 모델에 반사 논리를 가하는 것은 Gaussian Splatting 및 NeRF와 같은 명시적 구조적 접근 방식보다 더 어려울 수 있습니다. 확산 모델에서 이러한 종류의 규칙은 훈련 데이터에 다양한 시나리오가 포함된 경우에만 안정적으로 내장될 가능성이 있습니다. 이는 원래 데이터셋의 분포와 품질에 크게 의존합니다.

전통적으로 이러한 종류의 특정 행동을 추가하는 것은 LoRA 또는 기본 모델의 미세 조정을 위한 것입니다. 그러나 이러한 접근 방식은理想적이지 않습니다. LoRA는 출력을 자신의 훈련 데이터로 기울게 할 수 있으며, 미세 조정은 비용이 많이 들고 모델을 주요 모델에서 영구적으로 분기시킬 수 있습니다.

일반적으로 확산 모델을 개선하려면 훈련 데이터가 반사의 물리학에 더 많은 주의를 기울여야 합니다. 그러나 다른 많은 영역도 유사한 특별한 주의가 필요합니다. 초대형 데이터셋의 경우 사용자 정의 큐레이션이 비용이 많이 들고 어려울 수 있으므로 이러한 약점을 모두 이러한 방식으로 해결하는 것은 비실제적입니다.

그러나 확산 연구의 이 반사 문제에 대한 솔루션은 때때로 나타납니다. 최근 인도에서 진행된 노력 중 하나는 MirrorVerse 프로젝트입니다. MirrorVerse는 반사에 대한 상태-of-the-아트를 개선할 수 있는 데이터셋과 훈련 방법을 제공합니다.

MirrorVerse의 결과입니다.

MirrorVerse의 결과입니다.

위의 예에서 우리는 MirrorVerse가 최근의 접근 방식과 비교하여 반사 문제를 개선한다는 것을 알 수 있습니다. 그러나 완벽하지는 않습니다.

우리가 위의 예에서 볼 수 있듯이, MirrorVerse는 도자기를 약간 오른쪽에 배치하고, 아래의 이미지에서는 논리적인 반사각에 따라 컵의 반사를 생성하지 않습니다.

따라서 우리는 새로운 방법을 살펴보는 것이 아니라, 확산 모델이 반사를 처리하는 데 어려움을 겪을 수 있는 정도를 보여주기 위해 새로운 방법을 살펴봅니다. 반사의 예는 특정 동작 및 시나리오와 얽혀 있을 수 있으므로 이러한 예는 확산 모델에 의해 신뢰할 수 있게 내장되기 어렵습니다.

방법

연구자들은 Stable Diffusion 및 Flux와 같은 모델이 반사 기반 프롬프트를尊重하는 데 어려움을 겪고 있음을 처음부터 주목합니다.

현재 상태-of-the-아트 텍스트-이미지 모델 SD3.5 및 Flux는 장면에서 반사를 생성할 때 일관된 반사와 기하학적으로 정확한 반사를 생성하는 데 어려움을 겪었습니다.

현재 상태-of-the-아트 텍스트-이미지 모델 SD3.5 및 Flux는 장면에서 반사를 생성할 때 일관된 반사와 기하학적으로 정확한 반사를 생성하는 데 어려움을 겪었습니다.

연구자들은 MirrorFusion 2.0을 개발했습니다. 이는 반사에 대한 사진 현실성과 기하학적 정확성을 개선하기 위한 확산 기반 생성 모델입니다. 모델의 훈련은 연구자들이 새로 큐레이션한 데이터셋인 MirrorGen2에 기반했습니다. 이는 이전 접근 방식에서 관찰된 일반화 약점을 해결하기 위한 것입니다.

MirrorGen2는 이전 방법론을 확장하여 무작위 객체 배치, 무작위 회전 및 명시적 객체 고정과 같은 새로운 요소를 도입했습니다. 이러한 요소는 반사가 다양한 객체姿勢 및 거울 표면에 대한 배치에서 유지되도록 보장하는 것을 목표로 합니다.

MirrorVerse의 합성 데이터 생성 스키마입니다.

MirrorVerse의 합성 데이터 생성 스키마입니다.

MirrorGen2 파이프라인은 또한 객체를 의미적으로 일관된 조합으로 페어링하여 복잡한 공간적 관계와 중첩을 시뮬레이션합니다.

연구자들은 다음과 같이 말합니다.

‘카테고리는 의미적으로 일관되도록 수동으로 페어링됩니다. 예를 들어, 의자와 테이블을 페어링합니다. 렌더링 중에, 주 객체를 배치하고 회전한 후, 페어링된 카테고리에서 추가 객체를 샘플링하여 중첩을 방지하고, 장면 내에서 구별되는 공간 영역을 보장합니다.’

명시적 객체 고정의 경우, 연구자들은 생성된 객체가 출력된 합성 데이터에서 지面에 “고정”되어 있음을 보장했습니다. 즉, 대규모로 생성된 합성 데이터에서 발생할 수 있는 “부유” 현상을 방지했습니다.

데이터 및 테스트

SynMirrorV2

연구자들은 SynMirrorV2 데이터셋을 개발하여 거울 반사에 대한 훈련 데이터의 다양성과 현실성을 개선했습니다. 데이터셋은 Objaverse 및 Amazon Berkeley Objects(ABO) 데이터셋에서 3D 객체를 사용했습니다. 이러한 선택은 OBJECT 3DIT 및 MirrorFusion 프로젝트의 V1 필터링 프로세스를 통해 정제되었습니다. 이를 통해 66,062개의 객체가 생성되었습니다.

Objaverse 데이터셋의 예시입니다.

Objaverse 데이터셋의 예시입니다.

장면 구축에는 이러한 객체를 CC-Textures의 텍스처화된 바닥과 PolyHaven CGI 저장소의 HDRI 배경에 배치하는 것이 포함되었습니다. 조명은 객체 위와 뒤에 45도 각도로 위치한 영역 조명을 사용하여 표준화되었습니다. 객체는 유닛 큐브 내에 맞게 크기가 조정되었으며, 미러와 카메라의 시야각을 고려하여 미리 계산된 교차점을 사용하여 배치되었습니다.

무작위 회전이 y축 주위를 적용되었으며, 부유하는 아티팩트를 방지하기 위한 고정 기술이 사용되었습니다.

복잡한 장면을 시뮬레이션하기 위해 데이터셋은 또한 ABO 카테고리에 따라 의미적으로 일관된 페어링을 기반으로 객체를 페어링했습니다. 2차 객체는 중첩을 피하기 위해 샘플링되고 배치되었습니다. 이를 통해 3,140개의 다중 객체 장면이 생성되었습니다.

다중 객체를 포함하는 데이터셋의 렌더링된 뷰입니다.

다중 객체를 포함하는 데이터셋의 렌더링된 뷰입니다.

훈련 프로세스

연구자들은 합성 현실성만으로는 실제 데이터에 대한 강력한 일반화를 달성하는 데 충분하지 않다는 것을 인정했습니다. 따라서 연구자들은 MirrorFusion 2.0을 훈련시키기 위한 3단계 커리큘럼 학습 프로세스를 개발했습니다.

첫 번째 단계에서는 연구자들이 조건 및 생성 분기의 가중치를 Stable Diffusion v1.5 체크포인트와 초기화했습니다. 그런 다음 모델을 SynMirrorV2 데이터셋의 단일 객체 훈련 분할에서 미세 조정했습니다. Reflecting Reality 프로젝트와는 달리, 연구자들은 생성 분기를 동결하지 않았습니다. 모델은 40,000 번의 반복으로 훈련되었습니다.

두 번째 단계에서는 모델을 SynMirrorV2의 다중 객체 훈련 분할에서 추가 10,000 번의 반복으로 미세 조정하여 모델이 중첩과 복잡한 공간적 배치를 처리하도록했습니다.

세 번째 단계에서는 모델을 MSD 데이터셋의 실제 데이터에서 추가 10,000 번의 반복으로 미세 조정하여 모델이 실제 데이터에 대한 처리를 향상시킵니다.

MSD 데이터셋의 예시입니다.

MSD 데이터셋의 예시입니다.

훈련 중에 텍스트 프롬프트는 20%의 훈련 시간 동안 생략되어 모델이 사용 가능한 깊이 정보를 최대한 활용하도록했습니다.

훈련은 4개의 NVIDIA A100 GPU에서 수행되었으며, 배치 크기는 각 GPU당 4개, AdamW 최적화기, 학습률 1e-5를 사용했습니다.

이 훈련 方案은 모델에呈现하는 과제의 난이도를 점진적으로 증가시킵니다. 모델은 더 복잡한 구성으로 진행되기 전에 더 간단한 시나리오에서 시작합니다.

테스트

연구자들은 MirrorFusion 2.0을 이전 상태-of-the-아트인 MirrorFusion과 비교하여 평가했습니다. 또한 MirrorBenchV2 데이터셋에서 실험을 수행했습니다.

추가적인 질적 테스트는 MSD 데이터셋과 Google Scanned Objects(GSO) 데이터셋에서 수행되었습니다.

평가는 2,991개의 단일 객체 이미지와 300개의 2개 객체 장면을 사용하여 수행되었습니다. 성능은 피크 신호 대 노이즈 비율(PSNR), 구조적 유사성 지수(SSIM) 및 학습된 지각적 이미지 패치 유사성(LPIPS) 점수를 사용하여 평가되었습니다.

연구자들은 다음과 같이 말합니다.

‘결과는 우리의 방법이 기준선 방법을 능가한다는 것을 보여줍니다. 또한 다중 객체에 대한 미세 조정이 복잡한 장면에서 결과를 개선한다는 것을 보여줍니다.’

MirrorBenchV2 데이터셋에서 단일 객체 및 다중 객체 반사 생성 품질에 대한 정량적 결과입니다.

MirrorBenchV2 데이터셋에서 단일 객체 및 다중 객체 반사 생성 品질에 대한 정량적 결과입니다.

연구자들은 또한 GSO 데이터셋에서 질적 테스트를 수행했습니다.

MirrorBenchV2에서 기준선과 MirrorFusion 2.0의 비교입니다.

MirrorBenchV2에서 기준선과 MirrorFusion 2.0의 비교입니다.

연구자들은 다음과 같이 말합니다.

‘MirrorFusion 2.0은 기준선 모델보다 더 정확한 반사와 공간적 일관성을 생성합니다.’

GSO 데이터셋에서 기준선과 MirrorFusion 2.0의 비교입니다.

GSO 데이터셋에서 기준선과 MirrorFusion 2.0의 비교입니다.

연구자들은 다음과 같이 말합니다.

‘MirrorFusion 2.0은 기준선 모델보다 더 정확하고 현실적인 반사를 생성합니다. 예를 들어, 그림 5(a)에서, MirrorFusion 2.0은 드로어 핸들을 정확하게 반사합니다. 그러나 기준선 모델은 비현실적인 반사를 생성합니다.’

결론

MirrorFusion 2.0은 반사 생성 품질을 개선하는 데 기여합니다. 그러나 확산 모델의 기본 아키텍처는 일관된 물리 법칙의 학습과 시연에 적합하지 않습니다. 따라서 이 문제는 잘 정의되지 않았으며, 우아한 해결책이 나올 가능성은 낮습니다.

추가로, 기존 모델에 데이터를 추가하는 것은 LDM 성능의 결함을 해결하는 표준 방법입니다. 그러나 이러한 접근 방식에는 앞서 언급한 모든 단점이 있습니다.

그리고 다른 많은 LDM 출력의 결함도 마찬가지입니다. 누가 이러한 결함 중 어느 하나가 가장 노력과 비용을 투자할 가치가 있는지 말할 수 있을까요?

MirrorFusion 2.0은 반사 생성 품질을 개선하는 데 기여합니다. 그러나 확산 모델의 기본 아키텍처는 일관된 물리 법칙의 학습과 시연에 적합하지 않습니다. 따라서 이 문제는 잘 정의되지 않았으며, 우아한 해결책이 나올 가능성은 낮습니다.

추가로, 기존 모델에 데이터를 추가하는 것은 LDM 성능의 결함을 해결하는 표준 방법입니다. 그러나 이러한 접근 방식에는 앞서 언급한 모든 단점이 있습니다.

그리고 다른 많은 LDM 출력의 결함도 마찬가지입니다. 누가 이러한 결함 중 어느 하나가 가장 노력과 비용을 투자할 가치가 있는지 말할 수 있을까요?

첫 번째로 게시됨: 2025년 4월 28일. 2025년 4월 29일: 최종 단락의 문법을 수정했습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai