Anderson의 관점

ST-NeRF: 비디오 합성 위한 컴포지팅 및 편집

mm
Unite.AI를 Google의 선호 소스에 추가
ST-NeRF

중국 연구 컨소시엄은 개발된 기술을 통해 지난 1년 동안 가장 뜨거운 이미지 합성 연구 분야 중 하나인 Neural Radiance Fields (NeRF)에 편집 및 컴포지팅 기능을 제공합니다. 이 시스템은 ST-NeRF (Spatio-Temporal Coherent Neural Radiance Field)라고 불립니다.

아래 이미지에서 물리적인 카메라 패닝으로 보이는 것은 실제로 사용자가 4D 공간에 존재하는 비디오 콘텐츠의 관점을 ‘스크롤’하는 것입니다. 시점은 사람들의 수행에 대한 성과와 관련이 없으며, 180도 반경의 모든 부분에서 그들의 동작을 볼 수 있습니다.

ST-NeRF

비디오의 각 요소는 별도로 캡처된 요소이며, 동적으로 탐색할 수 있는 일관된 장면으로 컴포지트됩니다.

요소는 장면 내에서 자유롭게 복제되거나 크기를 조정할 수 있습니다:

ST-NeRF

또한, 각 요소의 시간적 행동을 쉽게 변경할 수 있습니다. 느리게 재생하거나, 역방향으로 재생하거나, 다양한 방법으로 조작할 수 있습니다. 이는 필터 아키텍처와 매우 높은 해석 가능성을 제공합니다.

두 개의 별도 NeRF 요소가 동일한 장면에서 다른 속도로 실행됩니다. 출처: https://www.youtube.com/watch?v=Wp4HfOwFGP4

두 개의 별도 NeRF 요소가 동일한 장면에서 다른 속도로 실행됩니다. 출처: https://www.youtube.com/watch?v=Wp4HfOwFGP4

수행자나 환경을 로토스코핑하거나, 수행자가 의도된 장면의 contexto 없이 무작위로 움직임을 수행할 필요가 없습니다. 대신, 16개의 비디오 카메라를 통해 180도 범위의 자연스러운 영상을 캡처합니다:

16개의 카메라 ST-NeRF

위에 표시된 세 가지 요소, 두 명의 사람과 환경,는 별도로 구분되며, 설명을 위해만 표시됩니다. 각 요소를 교체하거나, 각 요소를 개별 캡처 타임라인의 이전 또는 이후 시점에 삽입할 수 있습니다.

위에 표시된 세 가지 요소, 두 명의 사람과 환경,는 별도로 구분되며, 설명을 위해만 표시됩니다. 각 요소를 교체하거나, 각 요소를 개별 캡처 타임라인의 이전 또는 이후 시점에 삽입할 수 있습니다.

ST-NeRF는 Neural Radiance Fields (NeRF)에 대한 연구의 혁신입니다. NeRF는 다중 관점 캡처를 네이블 네트워크에 의해 추정되고 렌더링되는 일관된 3D 공간으로 합성하는 머신 러닝 프레임워크입니다.

Neural Radiance Fields는 다중 관점 캡처를 일관된 3D 공간으로 합성합니다. 출처: https://www.matthewtancik.com/nerf

Neural Radiance Fields는 다중 관점 캡처를 일관된 3D 공간으로 합성합니다. 출처: https://www.matthewtancik.com/nerf

NeRF에 대한 관심은 지난 9개월 동안 매우 뜨거워졌으며, Reddit에서 관리하는 리스트에 따르면 현재 60개의 프로젝트가 있습니다.

 

NeRF의 몇 가지 분기입니다. 출처: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

NeRF의 몇 가지 분기입니다. 출처: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

경제적인 훈련

이 논문은 상하이 테크 대학교와 DGene Digital Technology의 연구자들 간의 협력입니다. 이 논문은 Open Review에서 받아들여졌습니다.

ST-NeRF는 이전의 ML 기반 네비게이션 비디오 공간에 대한 몇 가지 혁신을 제공합니다. 먼저, 16개의 카메라만으로도 높은 수준의 사실성을 달성합니다. 페이스북의 DyNeRF는 2개의 카메라 더 사용하지만, 네비게이션 아크가 훨씬 제한적입니다.

페이스북의 DyNeRF 환경입니다. 이동 범위가 제한적이며, 장면을 재구성하기 위해 더 많은 카메라가 필요합니다. 출처: https://neural-3d-video.github.io

페이스북의 DyNeRF 환경입니다. 출처: https://neural-3d-video.github.io

DyNeRF는 또한 편집 및 컴포지팅 기능이 없으며, 계산 리소스 측면에서 매우 비용이 많이 듭니다. 반면에, 중국의 연구자들은 자신의 데이터의 훈련 비용이 900달러에서 3,000달러 사이이며, 이는 DVDGAN과 같은 최첨단 비디오 생성 모델의 30,000달러와 비교할 수 있습니다.

검토자들은 또한 ST-NeRF가 모션 학습 과정을 이미지 합성 과정에서 분리하는 주요 혁신을 제공한다고 지적했습니다. 이 분리는 편집 및 컴포지팅을 가능하게 하며, 이전 접근 방식은 제한적이고 선형적입니다.

16개의 카메라는 이러한 전체 반원형 보기의 배열로 매우 제한적이지만, 연구자들은 이후 연구를 통해 프록시 프리스캔 정적 배경과 더 많은 데이터 기반 장면 모델링 접근 방식을 사용하여 이 숫자를 더 줄이기를 희망합니다. 또한, 재조명 기능을 통합하기를 희망합니다. 이는 NeRF 연구에서 최근의 혁신입니다.

ST-NeRF의 제한 사항 해결

학술적 CS 논문에서 새로운 시스템의 실제 사용 가능성을 폐기하는 마지막 단락에서 일반적으로 버리는 제한 사항과 달리, 연구자들이 인정하는 ST-NeRF의 제한 사항은 다릅니다.

그들은 현재 시스템이 장면 내의 개별 객체를 식별하고 별도로 렌더링할 수 없다는 것을 관찰합니다. 이는 사람을 인식하는 시스템을 통해 사람들을 개별 实체로 분할하기 때문입니다. 이는 YOLO와 같은 프레임워크를 사용하여 쉽게 해결할 수 있는 문제입니다.

연구자들은 현재 느린 동작을 생성할 수 없다는 것을 주목하지만, 기존의 프레임 보간법 인 DAIN과 RIFE를 사용하여 이를 구현하는 데는 거의 제한이 없습니다.

모든 NeRF 구현과 컴퓨터 비전 연구의 많은 분야에서와 마찬가지로, ST-NeRF는 주체가 다른 사람이나 객체에 의해 일시적으로 가려질 때 실패할 수 있습니다. 이는 주체를 연속적으로 추적하거나 재획득하기 어렵게 만들 수 있습니다. 이러한 어려움은 상류 솔루션을 기다려야 할 수 있습니다. 한편, 연구자들은 이러한 가려진 프레임에서 수동 개입이 필요하다고 인정합니다.

마지막으로, 연구자들은 인간 분할 절차가 현재 색상 차이를 기반으로 하기 때문에, 두 사람을 하나의 분할 블록으로 잘못 결합할 수 있다는 것을 관찰합니다. 이는 ST-NeRF에만 국한된 문제가 아니며, 사용되는 라이브러리에 내재된 문제입니다. 이는 광학 흐름 분석과 다른 새로운 기술을 통해 해결될 수 있습니다.

2021년 5월 7일 처음 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai