Anderson의 관점

GAN을 통한 전통적인 CGI 얼굴 렌더링

mm
Unite.AI를 Google의 선호 소스에 추가

의견 생성적 적대적 네트워크(GANs)가 처음으로 현실적인 3D 얼굴을 재현하는 능력을 보여주었을 때, GAN을 사용하여 시간적으로 일관된 비디오 피처링 인간 얼굴을 생성하는 잠재적인 가능성에 대한 금 러시가 발생했습니다.

어딘가에서 GAN의 잠재 공간에는 반드시 숨겨진 질서와 합리성이 있어야 했는데, 그것은 잠재 코드에 埋め込まれた 나선형 의미 논리, 즉 동일한 얼굴의 일관된 여러 뷰와 여러 해석(예: 표정 변경)을 생성할 수 있는 스키마였습니다. 그리고 그 후에 시간적으로 убедительный 디프페이크 비디오 방법을 제공할 수 있었는데, 그것은 오토인코더를 물리칠 수 있는 방법이었습니다.

고해상도 출력은 비교적 저해상도 환경에 비해 간단했을 것입니다. 깊은 얼굴 랩과 얼굴 스왑은 GPU 제약으로 인해 운영해야 했던 슬럼 같은 저해상도 환경과 비교하면 간단했습니다. 그리고 ‘스왑 존’은 오토인코더 워크플로우에서 얼굴의 ‘창조 존’이 되었습니다. 그것은 몇 개의 입력 이미지 또는 단일 이미지에 의해 정보를 제공 받았습니다.

그런데 그것은 결코 쉽지 않았습니다. 궁극적으로, 분리(disentanglement)가 중심 문제로 판명되었으며, 여전히 주요 도전입니다. 어떻게 하면 구별되는 얼굴 정체성을 유지하고, 포즈 또는 표정을 변경할 수 있을까요? 그리고 어떻게 하면 수천 개의 참조 이미지를 모으지 않고, 신경망이 이러한 변경이 수행될 때 발생하는 것을 가르칠 수 있을까요? 오토인코더 시스템이那样으로 노력적으로 하는 것처럼?

그 후의 생각은 GAN 얼굴 연기 및 합성 연구에서 입력 정체성이 템플릿화된 일반적인 전환에 의해 영향을 받을 수 있다는 것이었습니다. 예를 들어, GAN이 알고 있는 해당 사람의 이미지에 존재하지 않는 표현을 GAN 얼굴에 적용하는 것입니다.

그것은 명백했습니다. ‘원 사이즈 피츠 올’ 접근 방식은 개인의 고유한 얼굴 표정의 다양성을 다루지 못할 것입니다. 우리는 잭 니콜슨이나 빌렘 데포의 唯一한 미소가 이러한 ‘평균 표현’ 잠재 코드의 영향하에 충실하게 해석될 수 있는지 궁금해할 수 있습니다.

GAN 얼굴 편집기에 대한 관심이 가장 많았던 것은 아마도 인터페이스 GAN일 것입니다. 그것은 잠재 공간에서 라틴 코드를 수행할 수 있으며, 포즈(카메라/얼굴 각도), 표정, 연령, 인종, 성별 및 기타 필수적인 특성을 관련시키는 잠재 코드를 포함합니다.

인터페이스 GAN 및 유사한 프레임워크의 1980년대 스타일 ‘모핑’ 기능은 이미지의 경로를 설명하는 방법으로 잠재 코드를 다시 투영하는 것입니다. 그러나 그것은 시간적으로 일관된 비디오 화면을 생성하는 데에는 여전히 부족했습니다.

또한, 시간적으로 일관된 머리카락을 생성하는 어려움과, 잠재 코드 탐색/조작 기술이 시간적 지침을 갖고 있지 않다는 사실(그리고 그것을 프레임워크에 주입하는 것이 어렵다는 사실), 그리고 그것이 원래 이미지 생성을 위한 것이지 비디오 출력을 위한 것이 아니라는 사실이 있습니다.

따라서, 후속 노력은 분리와 관련된 점진적인 개선을 가져왔습니다. 그리고 다른 사람들은 컴퓨터 비전의 다른 규칙을 ‘가이드 레이어’로 결합했습니다. 예를 들어, 2021년 말에 발표된 논문 세マン틱 스타일 GAN: 제어 가능한 이미지 합성 및 편집을 위한 구성적 생성적 사전에서 의미론적 분할을 제어 메커니즘으로 사용했습니다.

GAN 얼굴 합성 연구 커뮤니티는 점점 더 ‘전통적인’ 파라메트릭 CGI 얼굴을 사용하여 GAN의 잠재 공간에 숨겨진 질서와 합리성을 제공하는 방법으로 이동하고 있습니다.

파라메트릭 얼굴 원시 형태는 컴퓨터 비전 연구에서 20년 이상의 기간 동안 존재해 왔습니다. 그러나 최근에, 스킨드 멀티 퍼슨 리니어 모델(SMPL) CGI 원시 형태의 사용이 증가했습니다. 그것은 맥스 플랑크 연구소와 ILM이 개척한 접근 방식이며, 스파스 트레이닝 아티큘레이티드 휴먼 바디 리그레서(STAR) 프레임워크로 개선되었습니다.

디즈니의 2019년 렌더링 위드 스타일 이니셔티브는 전통적인 텍스처 맵과 GAN 생성 이미지의 사용을 결합하여 개선된, ‘딥페이크 스타일’ 애니메이션 출력을 생성하려고 시도했습니다.

렌더링 위드 스타일은 GAN 생성 얼굴을 렌더링하는 데에 성공했습니다. 그러나 결과는 여전히 일관된 헤어 텍스처와 기본적인 특징 위치를 유지하지 못했습니다.

2020년 스타일 리그: 3D 컨트롤을 위한 스타일 GAN 리깅 논문은 3D 모핑 가능 얼굴 모델(3DMM)을 사용하여 스타일 GAN 환경에서 특성을 변경하는 새로운 방법을 제시했습니다.

스타일 리그는 GAN 얼굴 편집기에 대한 점진적인 개선입니다. 그러나 결과는 여전히 제한적이며, 시간적으로 일관된 헤어를 생성하는 데에 여전히 어려움이 있습니다.

최신 연구인 원 샷 페이스 리액트먼트 온 메가픽셀도 3DMM 파라메트릭 헤드를 사용하여 스타일 GAN을 위한 친절한 인터페이스를 제공합니다.

원 샷 페이스 리액트먼트 온 메가픽셀은 단일 이미지에서 근사 원래 포즈를 추론할 수 있으며, 또한 ‘프론탈라이제이션’을 수행할 수 있습니다. 즉, 오프 센터 포즈된 이미지를 머그샷으로 번역하는 것입니다.

그러나, 이러한 접근 방식은 여전히 시간적으로 일관된 헤어를 생성하는 데에 어려움을 겪고 있습니다.

GAN은 얼굴 비디오 합성에 적합한가?

단일 소스 이미지에서 동적 표현과 분포된 포즈를 얻는 것은 현재 GAN 얼굴 합성 연구에서 중요한課題입니다. 왜냐하면 GAN은 상대적으로 높은 해상도와 높은 신뢰도의 신경망 얼굴을 출력할 수 있는 唯一한 방법이기 때문입니다.

오토인코더 딥페이크 프레임워크는 다수의 실제 포즈와 표정을 훈련할 수 있지만, VRAM 제한된 입력/출력 해상도에서 작동해야 하며, ‘호스트’가 필요합니다. 그리고 NeRF는 유사하게 제한적이며, 현재에는 얼굴 표정을 변경하는 방법론이 없으며, 편집 가능성이 제한적입니다.

따라서, 정확한 CGI/GAN 얼굴 합성 시스템을 위한 唯一한 방법은 새로운 이니셔티브가 잠재 공간에서 다중 사진 정체성 实體를 조립하는 방법을 찾는 것입니다. 즉, 잠재 코드가 관련된 실제 이미지에 대한 참조를 갖지 않아도 됩니다.

그런 경우에도, 결측 의미 논리는 여전히 세マン틱 분할 또는 파라메트릭 3DMM 얼굴과 같은 보조 기술에 의해 제공되어야 할 것입니다. 그러나 이러한 시나리오에서는 적어도 더 많은 자료를 작업할 수 있을 것입니다.

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]