Anderson의 관점
NeRF, CGI를 대체하는 또 하나의 발자국

MIT와 Google의 연구자들은 CGI를 대체할 수 있는 새로운 AI 기반 기술인 NeRF(신경 복사 필드)의 가장 기본적인 장애물 중 하나를 해결하는 큰 걸음을 내디뎠습니다. 즉, NeRF 이미지를 구성 요소 시각 요소로 분리하여 텍스처와 조명을 다시 적용할 수 있습니다.
새로운 접근 방식은 NeRFactor라고 불리며, 효과적으로 캡처된 이미지를 개별 객체의 노멀(onto which textures can be assigned), 라이트 가시성, 알베도(the proportion of incidental light that’s reflected away from a surface), 및 양방향 반사 분포 함수(BRDFs)로 분리합니다.
이러한 요소가 분리되면 개별 객체 또는 객체 그룹에 대한 텍스처를 교체할 뿐만 아니라 새로운 조명 소스와 그림자 구현을 추가할 수 있으며, NeRF 이미지를 생성하는 다중 카메라 배열에 의해 캡처된 것을 제외하고는 모든 것을 할인할 수 있습니다.

노멀, 가시성, 알베도 및 BRDF를 NeRFactor에서 분리합니다. 출처: https://www.youtube.com/watch?v=UUVSPJlwhPg
모델은 임의의 사용자 정의 조명 소스에서 소프트 또는 하드 그림자를 지원하며, 이전 계산의 BRDF 데이터와 기본적인 간단한 평滑화 규제화를 사용하여 재구성 손실을 통해 프로그램적으로 네 가지 측면을 분리합니다.


NeRFactor의 워크플로우, 다중 카메라 배열에서 파생된 이미지의 개별적으로 작동 가능한 측면을 추출합니다. 출처: https://arxiv.org/pdf/2106.01970.pdf
NeRFactor는 1998년에 도입된 잘 정립된 접근 방식인 HDR 라이트 프로브를 사용하여 광선의 가능한 경로를 평가합니다. 이는 임의의 조명을 가능하게 합니다. 그러나 이것은 매개변수의 수를 제어할 수 없게 만듭니다. 따라서 라이트 프로브는 완전한 조명 볼륨 맵을 계산하려고 시도하지 않고 기하학을 프로브에 매핑하는 다층 퍼셉트론(MLP)을 통해 필터링됩니다.
반성의 이유
신규 연구는 특히 캡처된 이미지의 반사를 제어하는 계층을 분리하는 데 가장 중요한 의미를 가지고 있습니다. 이것은 신경 복사 필드 이미지의 가장 큰 도전 중 하나입니다. 진정으로 새로운 및 유연한 NeRF 시스템은 텍스처를 대체할 수 있을 뿐만 아니라 일반적으로 CGI 워크플로에서 계산되는 이동 객체(고정 환경 이외의)를 반영하는 방법을 찾아야 합니다.

이 문제는 최근 Intel의 인상적인 새로운 연구에서 언급되었습니다. 이는 신경망을 통해 비디오 게임 화면을 사진 현실적인 비디오로 변환하는 연구입니다. 이러한 워크플로에서 소스 자료의 많은 ‘베이크된’ 측면은 이산적이고 교환 가능한 것으로 변환되어야 하며, 이는 조명(기하학을 렌더링하는 NeRF의 함수)보다 반사(모델의 범위 외부에 있는 ‘오프스크린’ 기하학을 사용)보다 더 쉽게 해결될 수 있습니다.
따라서 NeRF 비디오에서 반사를 용이하게 하는 계층을 분리하면 NeRF가 반사 도전 과제를 해결하는 데 한 걸음 더 가까이 다가갑니다.
HDR 환경을 사용하면 이미 세계 환경 반사를 생성하는 문제(즉, 하늘, 풍경 및 기타 ‘고정’ 환경 요인)를 해결할 수 있습니다. 그러나 동적 반사를 도입하려면 새로운 접근 방식이 필요합니다.
NeRF와 함께하는 사진測量學
NeRF 이미지는 기계 학습 분석을 통해 장면 또는 객체를 여러 각도에서 캡처하여 완전한 볼륨 공간을 개발합니다.

최근 1년 동안出现한 다양한 NeRF 기반 方案은 기여하는 카메라 장치의 수에 따라 다릅니다. 일부는 16개 이상의 카메라를 사용하는 반면 다른 일부는 1~2개의 카메라만 사용합니다. 모든 경우에 중간 관점은 ‘infilled'(즉, 해석됨)되어 장면 또는 객체를 유연하게 탐색할 수 있습니다.
결과물은 완전한 볼륨 공간으로, 3D 파싱된 입력 이미지의 합으로부터 전통적인 CG 메시를 생성하는 것을 포함하여 다양한 방식으로 활용될 수 있는 내재된 3D 이해를 가지고 있습니다.
‘새로운 CGI’의 맥락에서 NeRF
NeRF 이미지는 실제 세계의 이미지, 포함된 이동 이미지, 사람, 객체 및 장면에서 직접 가져옵니다. 반면에 CGI 방법론은 세계를 ‘연구’하고 해석하며 실제 세계 이미지(즉, 얼굴 및 환경 캡처)를 사용하여 메시, 리그 및 텍스처를 만드는 데 숙련된 작업자가 필요합니다. 이는 본질적으로 해석적이고 수공예적인 접근 방식으로 비용이 많이 들고 노동 집약적입니다.
또한 CGI는 인간의 유사성을 재현하는 데 ‘uncanny valley’ 효과와 관련된 지속적인 문제를 가지고 있습니다. 이는 NeRF 기반 접근 방식에서는 제한이 없습니다. 이는 실제 사람과 이미지를 캡처하고 조작하기만 하면 됩니다.
さらに, NeRF는 필요한 경우 사진에서 전통적인 CGI 스타일의 메시 기하학을 직접 생성하여 컴퓨터 생성 이미지에서 수동으로 수행해야 하는 많은 절차를 대체할 수 있습니다.
NeRF의 도전
MIT와 Google의 최신 연구는 NeRF에 대한 다양한 도전을 제기하는 많은 논문 중 하나입니다. 최근 1년 동안 많은创新들이 NeRF의 초기 2020년 논문의 도전을 해결하기 위한 솔루션을 제공했습니다.
4월에 중국 연구 컨소시엄의 혁신은 NeRF 장면의 개별 타임라인을 분리하는 방법을 제공했습니다. 이는 사람을 포함한 모든 요소를 포함합니다.

캡처된 요소를 복사, 붙여넣기 및 크기 조정하여 원본 비디오의 선형 타임라인에서 분리합니다. 출처: https://www.youtube.com/watch?v=Wp4HfOwFGP4
이 접근 방식은 단순히 비디오 캡처에서 나타나는 단일 뷰를 재현하는 것뿐만 아니라 여러 각도에서 장면을 재구성할 수 있으며 다양한 컴포지팅도 가능합니다. 또한 원본 소스 비디오의 개별 타임라인에서 요소를 분리하여 개별 시간 프레임에서 실행하거나 필요에 따라 역방향으로 실행할 수 있습니다.

同じ 비디오의 두 개의 별개 NeRF 요소가 다른 속도로 실행됩니다. 출처: https://www.youtube.com/watch?v=Wp4HfOwFGP4
NeRF의 가장 큰 도전 중 하나는 장면을 훈련시키기 위해 필요한 상당한 자원을 낮추는 것입니다. 이는 최근 여러 논문에서 해결되었습니다. 예를 들어, Max Planck Institute for Intelligent Systems는 KiloNeRF를 도입했습니다. 이는 렌더링 시간을 1000배 빠르게 하며 NeRF를 상호 작용으로 작동할 수 있게 합니다.

GTX 1080ti에서 50fps로 실행되는 KiloNeRF의 상호 작용 환경. 출처: https://github.com/creiser/kilonerf
그러나 NeRF의 속도 혁신은真正로 연구자와 대중의 상상력을 사로잡은 2021년의 것이었습니다. 즉, UC Berkeley가 주도한 PlenOctrees 협력입니다. 이는 실시간으로 NeRF를 렌더링합니다.
PlenOctrees의 상호 작용 기능은 라이브 웹 기반 인터페이스에서 재현되었습니다.

파이어폭스에서 PlenOctrees 객체의 라이브 상호 작용 이동. 출처: http://alexyu.net/plenoctrees/demo/
또한 Tsinghua University의 2021년 5월 논문에서 발표된 Recursive-NeRF는 요청에 따라 높은 품질의 재귀적 렌더링을 제공합니다. 전체 장면을 렌더링할 필요가 없으며, 사용자가 보지 않는 부분은 렌더링하지 않습니다. 대신, 필요한 추가 이미지를 처리하기 위해 이산적인 하위 NeRF를 생성하여 계산 자원을 크게 절약할 수 있습니다.
다른 접근 방식으로는 FastNeRF가 있습니다. 이는 200fps에서 높은忠實도 신경 렌더링을 달성한다고 주장합니다.
NeRF의 최적화 기술은 장면을 ‘베이크’하는 것을 포함하는 경우가 많습니다. 즉, 렌더링할 요소를 커밋하고 다른 요소를 폐기하여 상호 작용을 크게 가속화합니다. 그러나 이 접근 방식의 단점은 스트레스가 GPU에서 저장소로 이동한다는 것입니다. 베이크된 장면은 디스크 공간을大量으로 차지합니다. 이를 완화하기 위해 베이크된 데이터를 다운 샘플링할 수 있지만, 이는 탐색이나 상호 작용의 경로를 닫는 것을 의미합니다.
모션 캡처 및 리깅에 대한 새로운 접근 방식은 Zheijang과 Cornell 대학에서 제시되었습니다. 이는 입력 비디오에서 해석된 블렌드 가중치 필드와 스켈레톤 구조를 사용하여 애니메이션 가능한 인간을 재현하는 방법입니다.

애니메이션 가능한 NeRF에서 파생된 스켈레톤 구조. 출처: https://www.youtube.com/watch?v=eWOSWbmfJo4

NeRF의 ‘ジュラ기 공원’ 순간은 언제일까?
NeRF를 통해 이미지 합성을 하는 경우, NeRF가 배포될 수 있는 정도에 대한 ‘열역학 법칙’이 확립되는 때입니다. CGI의 역사와 비교했을 때, NeRF는 현재 1973년, 즉 Westworld에서 CGI를 처음 사용한 직후의 시점에 있습니다.
그러나 NeRF가 Wrath Of Khan 마일스톤을 달성하기 위해 9년을 기다릴 필요는 없습니다. 또는 James Cameron의 열렬한 후원 아래 The Abyss 또는 Terminator 2에서 CGI가 달성한 돌파구와 같은 것을 달성하기 위해 수십 년을 기다릴 필요도 없습니다. 그리고 나서 기술의真正로 혁신적인 돌파구는 1993년의 Jurassic Park에서 일어났습니다.

이미지 장면은 영화 및 텔레비전 제작에서 사진 화학적 시각 효과의 오랜停滯期 이후 크게 변했습니다. PC 혁명과 Moore의 법칙의 가속은 CGI 혁명을 가능하게 했습니다. 이는 1960년대에 일어날 수도 있었지만, 그렇지 않았습니다.
NeRF의 진행을 이렇게 오랫동안 막을 수 있는 장벽이 있는지 여부는 아직 불분명합니다. 그리고 컴퓨터 비전의 이후 혁신이 NeRF를 이미지 합성의 핵심 후보자로 대체할 수 있는지 여부도 불분명합니다.
지금까지 NeRF는 학술 연구 외의 어떤 상황에서도 사용되지 않았습니다. 그러나 Google Research와 가장 유명한 컴퓨터 비전 연구소 등 주요 플레이어가 최신 NeRF 혁신을 경쟁하고 있습니다.
NeRF의 가장 큰 장애물 중 많은 것이 올해 직접 해결되었습니다. ‘반사 문제’에 대한 해결책이 제공되고, NeRF 최적화 연구의 다양한 스트림이 기술의 상당한 처리 및/또는 저장 요구에 대한 결정적인 해결책으로 결합되면, NeRF는 실제로 다음 5년 내에 ‘새로운 CGI’가 될 수 있습니다.














