Anderson의 관점
신경 복사 필드의 任意 환경 맵과 재조명

맥스 플랑크 연구소와 MIT의 새로운 논문은 신경 복사 필드(NeRF) 콘텐츠와 데이터 수집 시점의 조명을 완전히 분리하는 기술을 제안했습니다. 이 기술을 통해 사용자는 임의의 환경 맵을 사용하여 NeRF 장면의 조명을 완전히 교체할 수 있습니다.

새로운 기술을 실제 데이터에 적용한 결과. 이 방법은 데이터가 수집될 때 새로운 파이프라인을 고려하지 않은 아카이브 데이터에서도 작동하는 것이 주목할 만합니다. 이러한 제한에도 불구하고, 현실적이고 사용자 지정 조명 제어가 가능합니다.
새로운 접근 방식은 인기 있는 오픈 소스 3D 애니메이션 프로그램인 Blender를 사용하여 ‘가상 조명 스테이지’를 생성합니다. 여기서 다양한 조명 시나리오의 여러 반복이 렌더링되어 결국 NeRF 모델의 특수 레이어에서 사용자가 사용하려는 환경 맵을 수용할 수 있습니다.

파이프라인의 일부가 Blender를 사용하여 추출된 기하학에 대한 가상 조명 스테이지 뷰를 생성하는 것을 보여주는 그림. 이전 방법은 이 데이터를 제공하기 위해 실제 조명 스테이지를 사용했지만, 이 방법은離散 객체의 경우 번거로운 요구 사항이고, 외부 환경 뷰의 경우 불가능한 요구 사항입니다. 오른쪽 두 개의 그림의 왼쪽 상단에서 환경 맵을 볼 수 있습니다. 이러한 맵은 사용자가 임의로 생성할 수 있으며, NeRF를 현대적인 CGI 접근 방식의 유연성에 한 단계 더 가까이 가져옵니다.
이 접근 방식은 Mitsuba2 역산 렌더링 프레임워크와 이전 연구 PhySG, RNR, Neural-PIL 및 NeRFactor와 비교하여 테스트되었으며, 직접 조명 모델만을 사용하여 최고의 점수를 얻었습니다.

새로운 기술의 결과를 다양한 손실 함수에서 비교한 결과. 연구자들은 자신의 접근 방식이 최고의 품질을 제공한다고 주장하며, 결과는 피크 신호 대 잡음 비(Peak Signal-to-noise Ratio, PSNR), 구조적 유사성 지수(Structural Similarity Index Measure, SSIM) 및 학습된 지각 이미지 패치 유사성(Learned Perceptual Image Patch Similarity, LPIPS)을 통해 평가되었습니다.
논문은 다음과 같이 말합니다:
‘우리의 정성적 및 정량적 결과는 이전의 최고 수준과 비교하여 장면 매개변수 회복 및 새로운 시점 및 조명 조건에서의 합성 품질에서 명확한 발전을 보여줍니다.’
연구자들은 프로젝트의 코드를 공개할 계획입니다.
NeRF 편집 가능性的 필요성
이러한 분離은 NeRF 연구자들에게 주목할 만한 도전이 되었습니다. NeRF는 본질적으로 사진測量 기법으로, 수천 개의 가능한 경로에서 픽셀 값을 계산하고, RGBD 값을 할당하고, 이러한 값을 볼륨 렌더링으로 조합합니다. NeRF의 핵심은 조명에 의해 정의됩니다.
사실, NeRF는 인상적인 시각적 효과와 풍부한 채택에도 불구하고, CGI 용어로 ‘rigid’하거나 ‘baked’입니다. 따라서 연구 커뮤니티는 지난 12~18개월 동안 이 측면에서 NeRF의 유연성과 다루기 쉽게 만드는 것을 중점으로 했습니다.
이러한 里程碑의 중요성은 높으며, 시각적 효과 산업을 메시 생성, 모션 동역학 및 텍스처링을 중심으로 하는 창의적이고 협력적인 모델에서 역산 렌더링을 중심으로 하는 모델로 변환하는 가능성이 포함됩니다. 여기서 VFX 파이프라인은 실제 사물의 실제 사진이나 합성 모델을 사용하여 구동됩니다.
현재, 시각적 효과 커뮤니티에서는 NeRF에서 아직까진 상대적으로 적은 영향을 받고 있습니다. NeRF는 아직 Rigging, Nesting, 깊이 제어, 조립 및 조명과 관련하여 초기 단계에 있습니다. 연구자들은 동반하는 비디오를 통해 NeRF 기하학에 대한 기본적인 변형을 제공하는 또 다른 새로운 논문을 발표했습니다. 이는 현재의 최고 수준과 신경 렌더링 기술의 선구적인 노력 사이의 거대한 간격을 보여줍니다.
요소의 분류
그러나, 시작하기 위해, 새로운 논문의 연구자들은 CGI를 중간 제어 및 생산 메커니즘으로 채택했습니다. 이는 GAN과 NeRF의剛性 잠재 공간을 다루는 일반적인 접근 방식입니다.
중심적인 도전은 전역 조명(global illumination, GI)을 전역 조명과 동일한 Precomputed Radiance Transfer(PRT) 계산으로 변환하는 것입니다. GI는 표면에서 표면으로 빛이 반사되는 방식을 모델링하는 CGI 렌더링 기술로, 반사된 빛의 영역을 포함하여 렌더링에 현실감을 더합니다.
PRT는 새로운 접근 방식에서 중간 조명 함수로 사용되며, 이는 분리 가능성을 달성합니다. 새로운 방법은 NeRF 객체의 재질을 학습된 PRT로 모델링합니다.
원래 데이터의 실제 장면 조명은 환경 맵으로 회복되며, 장면 기하학 자체는 Signed Distance Field(SDF)로 추출되어 결국 Blender에서 가상 조명 스테이지에서 작동할 수 있는 전통적인 메시를 제공합니다.
프로세스의 첫 번째 단계는 여러 뷰 이미지에서 장면 기하학을 추출하는 것입니다. 이는 2021년 NeuS 연구 협력에서 사용된 암시적 표면 재구성 기술을 통해 수행됩니다.
조명 데이터를 수용할 수 있는 신경 복사 전송 필드(Neural Radiance Transfer Field, NRTF)를 개발하기 위해, 연구자들은 Mitsuba 2 차별 가능한 경로 추적기를 사용했습니다.
이것은 양방향 산란 분포 함수(Bidirectional Scattering Distribution Function, BSDF)와 초기 환경 맵의 생성을 공동으로 최적화합니다. BSDF가 생성되면 경로 추적기를 사용하여 Blender에서 가상적인 한 번에 하나의 조명(OLAT) 장면 렌더링을 생성할 수 있습니다.
NRTF는 사진적 재료 효과와 합성 데이터 사이의 결합된 손실 함수를 사용하여 훈련됩니다. 이 두 가지 데이터는 서로 얽히지 않습니다.
조명으로의 길
이 기술의 훈련 요구 사항은 원래 NeRF 훈련 시간보다 현저히 적지만, 여전히 중요하지 않습니다. 48GB의 VRAM을 갖춘 NVIDIA (NVDA ) Quadro RTX 8000에서, 초기 조명 및 텍스처 추정의 예비 훈련은 30분이 걸리며, OLAT 훈련(즉, 가상 조명 스테이지 캡처의 훈련)은 8시간이 걸립니다. 그리고 최종 공동 최적화는 16시간이 걸려서 최적의 품질에 도달합니다.
さらに, 결과적인 신경 표현은 실시간으로 실행할 수 없으며, 연구자에 따르면 ‘한 프레임당 몇 초’가 걸립니다.
연구자들은 다음과 같이 결론을 내립니다:
‘우리의 결과는 현재 최고 수준과 비교하여 명확한 개선을 보여주며, 향후에는 실행 시간을さらに 개선하고 기하학, 재료 및 장면 조명을 공동으로 推論하는 작업을 포함할 수 있습니다.’
最初에 2022년 7월 28일에 게시되었습니다.














