Anderson의 관점
RigNeRF: 새로운 딥페이크 방법 – 뉴럴 레이디언스 필드를 사용한다

Adobe에서 개발된 새로운 연구는 뉴럴 레이디언스 필드(NeRF)를 기반으로 하는 첫 번째 실용적이고 효과적인 딥페이크 방법을 제공한다. 이는 2017년 딥페이크가 등장한 이후 5년 만에 아키텍처 또는 접근 방식에서 첫 번째 실제 혁신이다.
이 방법은 RigNeRF라고 불리며, 3D 모핑 가능한 얼굴 모델(3DMM)을 사용하여 원하는 입력(즉, NeRF 렌더링에 임포즈할身份)과 신경 공간 사이의 중간 계층으로 작동한다. 이 방법은 최근 몇 년 동안 생성적 적대적 네트워크(GAN) 얼굴 합성 접근 방식에서 널리 채택되었다. 그러나 이러한 접근 방식은 아직 기능적이고 유용한 얼굴 교체 프레임워크를 위한 비디오를 생성하지 못했다.

전통적인 딥페이크 비디오와는 달리, 여기서 움직이는 콘텐츠는 ‘실제’가 아니라, 3D 모핑 가능한 얼굴 모델(3DMM)이 인터페이스로 작동하여 뉴럴 레이디언스 필드 시각화를 생성하는 예시이다. 오른쪽에 있는 3D 모핑 가능한 얼굴 모델(3DMM)은 원하는 조작(‘미소’, ‘왼쪽으로 보기’, ‘위로 보기’ 등)을 인터페이스로 사용하여 뉴럴 레이디언스 필드 시각화를 생성한다. 이 클립의 고해상도 버전과 다른 예시는 프로젝트 페이지 또는 이 기사의 끝에 있는 임베디드 비디오에서 볼 수 있다. 출처: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMM은 효과적으로 CGI 모델의 얼굴이다. 이 모델의 매개변수는 더 추상적인 이미지 합성 시스템, 즉 NeRF와 GAN에 적응할 수 있다. 이러한 시스템은 일반적으로 제어하기 어렵다.
위의 이미지(중간 이미지, 파란 셔츠를 입은 남자)와 아래의 이미지(왼쪽 이미지, 파란 셔츠를 입은 남자)에서 볼 수 있는 것은 ‘실제’ 비디오에 작은 패치의 ‘가짜’ 얼굴을 합성한 것이 아니라, 완전히 합성된 장면이다. 이 장면은 부피적인 뉴럴 렌더링으로 존재한다.

위의 예시에서, 실제 비디오(빨간 드레스를 입은 여자)는 RigNeRF를 사용하여 왼쪽에 있는 포착된 身份(파란 셔츠를 입은 남자)를 ‘인형’처럼 조작한다. 연구자들은 RigNeRF가 처음으로 NeRF 기반 시스템에서 姿勢와 表情을 분리하고 새로운 뷰를 합성할 수 있다고 주장한다.
위의 이미지에서 왼쪽에 있는 남자는 70초의 스마트폰 비디오에서 포착되었다. 입력 데이터(整个 장면 정보 포함)는 4개의 V100 GPU에서 훈련되어 장면을 얻었다.
3DMM 스타일의 매개변수 리그는 전체 몸의 매개변수 프록시로도 사용할 수 있다. 따라서 RigNeRF는 전체 몸의 딥페이크를 가능하게 할 수 있다. 실제的人의 움직임, 텍스처, 表情을 CGI 기반의 매개변수 계층으로 전달하여 렌더링된 NeRF 환경과 비디오를 생성할 수 있다.
RigNeRF는 현재의 딥페이크 방법으로 간주될 수 있는가? 아니면 DeepFaceLab와 다른 2017년식 오토인코더 딥페이크 시스템과 같은 반쪽짜리 시스템인가?
연구자들은 이 점에 대해 명확하다.
‘RigNeRF는 얼굴을 재アニメ화할 수 있는 방법이므로, 악의적인 행위자에 의해 딥페이크를 생성하는 데 악용될 수 있다.’
새로운 논문은 RigNeRF: Fully Controllable Neural 3D Portraits라고 제목이 붙여져 있으며, ShahRukh Atha와 Adobe Research의 4명의 공동 저자에 의해 작성되었다.
오토인코더 기반 딥페이크를 넘어서
최근 몇 년 동안 헤드라인을 장식한 대부분의 바이럴 딥페이크는 오토인코더 기반 시스템에 의해 생성되었다. 이러한 시스템은 2017년.promptly-banned r/deepfakes subreddit에서 공개된 코드에서 파생되었다. 그러나 이 코드는 GitHub에 복사되어 현재 1,000번 이상 포크되었다. 특히, 인기 있는 DeepFaceLab과 FaceSwap 프로젝트에도 사용되었다.
오토인코더 프레임워크는 3DMM을 얼굴 합성 프레임워크를 개선하는 데 사용하기도 했다. 2021년 7월의 HifiFace 프로젝트가 이러한 접근 방식의 예이다. 그러나 이 접근 방식에서 개발된 유용한 시스템은 아직 없다.
RigNeRF의 데이터는 짧은 스마트폰 비디오를 캡처하여 얻는다. 연구자들은 모든 실험에서 iPhone XR 또는 iPhone 12를 사용했다. 캡처의 첫 번째 절반에서는 주제가 다양한 얼굴 표현과 말을 하면서 머리를 움직이지 않도록 요청한다. 카메라는 주제를 중심으로 움직인다.
캡처의 두 번째 절반에서는 카메라는 고정된 위치를 유지하고 주제는 다양한 표현을 하면서 머리를 움직인다. 결과적으로 40-70초의 영사(약 1200-2100프레임)는 모델을 훈련하는 데 사용할 전체 데이터셋을 나타낸다.
데이터 수집을 줄이기
반면에, DeepFaceLab와 같은 오토인코더 시스템은 수천 개의 다양한 사진을 수집하고 큐레이션해야 한다. 이러한 사진은 종종 유튜브 비디오와 다른 소셜 미디어 채널에서 가져온다. 또한, 유명인 딥페이크의 경우에는 영화에서 가져온다.
결과적으로 훈련된 오토인코더 모델은 다양한 상황에서 사용될 수 있다. 그러나, 가장 근면한 ‘유명인’ 딥페이커는 단일 비디오를 위해 전체 모델을 처음부터 훈련한다. 훈련에는 일주일 이상이 걸릴 수 있다.
연구자들의 경고에도 불구하고, AI 포르노와 인기 있는 유튜브/틱톡 ‘딥페이크 리캐스팅’을 구동하는 패치워크와 광범위하게 조립된 데이터셋은 RigNeRF와 같은 딥페이크 시스템에서 수용할 만한 일관된 결과를 생성할 가능성이 낮다. 데이터 캡처에 대한 제한으로 인해, 이는 악의적인 딥페이커에 의한 身份의 사전적인 불법 사용을 방지하는 추가적인 안전 장치가 될 수 있다.
NeRF를 딥페이크 비디오에 적용하기
NeRF는 소스 사진을 여러 관점에서 촬영하여 3D 뉴럴 공간으로 조립하는 사진 측량 기반 방법이다. 이 접근 방식은 NVIDIA가 Instant NeRF 시스템을 공개했을 때 주목을 받았다. Instant NeRF는 NeRF의 훈련 시간을 몇 분 또는 몇 초로 줄일 수 있다.

Instant NeRF. 출처: https://www.youtube.com/watch?v=DJ2hcC1orc4
결과적으로 생성된 뉴럴 레이디언스 필드 장면은 본질적으로 정적인 환경이다. 이 환경은 탐색할 수 있지만 편집하기 어렵다. 연구자들은 두 가지 이전의 NeRF 기반 접근 방식, 즉 HyperNeRF + E/P와 NerFACE가 얼굴 비디오 합성을 시도했다고 언급한다. 그러나 이러한 접근 방식은 아직 기능적인 얼굴 교체 프레임워크를 생성하지 못했다.


RigNeRF, HyperNeRF, 및 NerFACE의 질적 비교. 연결된 소스 비디오와 PDF를 통해 더 높은 품질의 버전을 참조하십시오. 정적 이미지 출처: https://arxiv.org/pdf/2012.03065.pdf
그러나 이 경우 결과는 RigNeRF를 선호한다. 두 가지 이유로 결과는 상당히 비정상적이다. 첫째, 저자들은 ‘사과와 사과를 비교하는 비교는 없다’고 관찰했다. 둘째, 이는 RigNeRF의 기능을 이전 시스템의 더 제한적인 기능과 부분적으로 일치시키는 것을 필요로 했다.
결과가 이전 연구의 점진적인 개선이 아니라, NeRF 편집 가능성과 유용성의 ‘돌파구’를 나타내므로, 우리는 테스트 라운드를 제외하고 RigNeRF가 이전 시스템과 어떻게 다르게 작동하는지 살펴보겠다.
결합된 강점
NerFACE의 주요 제한은 정적인 카메라로 소스 영상을 캡처한다는 가정이다. 이는 새로운 뷰를 생성할 수 없다는 것을 의미한다. 따라서 ‘움직이는 초상화’를 생성할 수 있지만, 딥페이크 스타일의 비디오에는 적합하지 않다.
HyperNeRF는 새로운 뷰를 생성할 수 있지만, 머리 姿勢나 얼굴 表情을 변경할 수 있는 수단이 없다. 따라서 오토인코더 기반의 딥페이크와 경쟁할 수 없다.
RigNeRF는 이러한 두 가지 분리된 기능을 결합하여 ‘표준 공간’을 생성한다. 이 표준 공간은 3DMM 모듈의 입력에서 비롯된 변형과 변위를 수행할 수 있는 기본선이다.

표준 공간( 姿勢나 表情이 없음)을 생성하여, 3DMM에서 생성된 변형(즉, 姿勢와 表情)을 수행할 수 있다.
3DMM 시스템이 캡처된 주제와 정확하게 일치하지 않을 수 있으므로, 이 과정에서 이를 보상하는 것이 중요하다. RigNeRF는 소스 영상을 파생한 다층 퍼셉트론(MLP)에서 계산된 변형 필드 이전을 사용하여 이를 수행한다.

변형을 계산하는 데 필요한 카메라 매개변수는 COLMAP을 통해 얻는다. 각 프레임의 表情과 모양 매개변수는 DECA에서 얻는다.
위치는 랜드마크 피팅과 COLMAP의 카메라 매개변수를 통해 추가로 최적화된다. 그러나 컴퓨팅 자원 제한으로 인해 비디오 출력은 훈련을 위해 256×256 해상도로 다운샘플링된다. 이는 오토인코더 딥페이크에도 존재하는 하드웨어 제한된 축소 과정이다.
이후에 변형 네트워크는 4개의 V100에서 훈련된다. 이는 캐주얼 엔ту지어스트에게는 도달할 수 없는 형식적인 하드웨어이다. 그러나, 머신 러닝 훈련에서는 일반적으로 힘을 시간으로 교환할 수 있다. 모델 훈련은 며칠 또는 몇 주가 걸릴 수 있다.
결론으로, 연구자들은 다음과 같이 말한다.
‘다른 방법과 달리, RigNeRF는 3DMM 유도 변형 모듈을 사용하여 머리 姿勢, 얼굴 表情, 및 전체 3D 초상화 장면을 높은 신뢰도로 모델링할 수 있다. 이는 더 나은 재구성과 선명한 세부를 제공한다.’
자세한 내용과 결과 영상을 보려면 아래의 임베디드 비디오를 참조하십시오.
最初에 게시된 2022년 6월 15일.












