Anderson의 관점
디즈니, CGI와 신경 렌더링을 결합하여 ‘불쑥 골짜기’를 해결하기 위해

디즈니의 AI 연구 부문은 영화 품질의 얼굴 시뮬레이션을 위한 하이브리드 방법을 개발했으며, 이는 얼굴 신경 렌더링의 강점과 CGI 기반 접근 방식의 일관성을 결합합니다.
제출된 논문은 스타일로 렌더링: 높은 품질의 얼굴 렌더링을 위한 전통적 및 신경 접근 방식의 결합이라는 제목으로, 디즈니 연구 유튜브 채널에서 새로운 10분짜리 비디오에서 미리 볼 수 있습니다(이 기사의 끝에 첨부됨*).

신경 렌더링된 얼굴과 결합된 메시. 이 기사의 끝에 첨부된 비디오에서 더 나은 세부 사항과 품질을 확인하십시오. 출처: https://www.youtube.com/watch?v=k-RKSGbWLng (이후 https://www.youtube.com/watch?v=TwpLqTmvqVk로 대체됨)
비디오에서는 얼굴의 신경 렌더링(딥페이크 포함)가 CGI보다 더 현실적인 눈과 입안을 생성할 수 있지만, CGI 기반의 얼굴 텍스처는 더 일관적이고 시네마 수준의 VFX 출력에 적합하다고 설명합니다.
따라서 디즈니는 NVIDIA의 StyleGan2 신경 생성기를 사용하여 얼굴의 주변 특징과眼睛, 입안과 같은 ‘생명에 중요한’ 요소를 처리하도록 실험하고 있으며, 일관된 CGI 얼굴 피부와 관련 요소를 출력에 겹쳐서 표시합니다.

이 기사의 끝에 첨부된 비디오에서, 디즈니의 하이브리드 접근 방식의 아키텍처 개념을 보여주는 그림입니다. 여기서 전통적인 CGI 메시(2016년 로그 원에서 캐리 피셔와 피터 커싱을 재현하는 데 사용된 것과 같은 유형)가 신경 렌더링된 얼굴 환경에 통합됩니다.
비디오에서는 자주 비판받는 로그 원(2016)에서 피터 커싱의 CGI 재현의 불쑥 골짜기 효과와 불쑥 골짜기 효과에 대한 암시적인 언급을 합니다.
‘사람들이 쉽게 캡처하고 렌더링할 수 있는 것과 최종 사진 실사 디지털 더블 사이에 여전히巨大한 간격이 있습니다. 이 간격을 메우려면 숙련된 아티스트들의 많은 수동 작업이 필요합니다.’
사실, 가장 최신의 얼굴 캡처 시스템은 눈, 입안, 머리카락을 재현하려고 시도하지 않습니다. 눈은 이러한 기술에서 인증 문제를 가지고 있고, 머리카락은 시간적 일관성 문제를 가지고 있습니다.

비디오에서 보여주는 일반적인 현대적인 얼굴 캡처 세션의 결과입니다. 눈, 머리카락, 수염, 입안은 모두 생산 파이프라인에서 별도의 팀에 의해 처리되어야 합니다.
조명 제어
하이브리드 접근 방식은 또한 조명 재설정에서 이점을 제공합니다. 이는 얼굴의 신경 렌더링에서 주목할만한 도전입니다. CGI 피부를 겹쳐서 표시하면 더 쉽게 조명 재설정을 할 수 있습니다.

CGI/신경 접근 방식의 애니메이션 버전입니다.
더 도전적인 환경에서는, 예를 들어 외부 촬영에서, 연구자들은 사람을 둘러싼某种 비무장 지대 주변에 대한 inpainting 방법을 개발했습니다.

검은 여백이 생성되어 외곽 부분의 아이덴티티를 inpainting하고 CGI 피부를 결합된 CGI/신경 출력에 통합하는 ‘캔버스’를 제공합니다.
비디오에서는 다음을 언급합니다:
‘신경 렌더링은 배경 제약 조건을 완벽하게 일치시키지 않습니다. 그것은 현실적인 인간 구성 요소인 머리카락, 눈, 이와 같은 것을 최적화하는 것이 주 목표이기 때문입니다. 더 도전적인 것은 일관된 아이덴티티를 유지하면서 환경 조명을 변경하는 것입니다.’
신경 렌더링에서 CGI 메시 생성
연구 팀은 또한 대규모 3D 얼굴 이미지 데이터베이스에서 훈련된 변분 오토인코더를 개발했으며, 이는 ‘임의이지만 합리적인’ 3D 얼굴 메시를 생성할 수 있다고 주장합니다.
이 연구에는 아직 극복해야 할 한계가 있습니다. 예를 들어, 신경 렌더링에서 머리카락을 시간적으로 일관되게 유지하는 것이 어렵습니다. 비디오(아래 참조)에서는 CGI/신경 얼굴을 중심으로 회전하는 동안 빠르게 변하는 머리카락의 여러 예를 보여줍니다.
신경 비디오 렌더링의 시간적 일관성은 디즈니의 문제를 훨씬 넘어선 더广泛한 문제입니다. 후속 시스템에서는 머리카락을 ‘포스트 프로덕션’에서 추가하거나 머리카락 생성에 대한 다른 접근 방식을 사용할 가능성이 있습니다.
데이터셋 생성을 위한 사용
이 방법은 또한 합성 데이터를 생성하고 얼굴 이미지 세트 풍경을 풍부하게 하는 잠재적인 방법으로 제안됩니다. 이는 최근 몇 년 동안 너무 단조롭게 되었습니다.

디즈니는 새로운 기술이 얼굴 이미지 데이터셋을 채우는 것을 상상합니다.
‘우리가 생성한 모든 사진 실사 결과에는 기하학적 정보와 외관 맵이 있으며, 알려진 조명과 알려지지 않은 카메라 시점에서 렌더링됩니다. 이러한 ‘기본 사실’ 정보는 3D 얼굴 재구성, 얼굴 인식, 장면 이해와 같은 다운스트림 애플리케이션을 훈련하는 데 중요합니다. 따라서 각 결과 렌더링은 데이터 샘플로 간주할 수 있으며, 우리는 많은 다양한 개인의 많은 변형을 생성할 수 있습니다. ‘
‘さらに, 단일 사람을 단일 표정과 단일 시점 및 조명으로 렌더링할 때도, 최적화 중에 랜덤화 시드를 변경하여 사진 실사 렌더링의 임의 변형을 생성할 수 있습니다.’
연구자들은 이 구성 가능한 출력의 다양성이 얼굴 인식 애플리케이션을 훈련하는 데 유용할 수 있다고 주장하며, 다음과 같이 결론을 내립니다:
‘우리의 방법은 얼굴 피부 캡처, 모델링 및 렌더링을 위한 현재 기술을 활용하여 일치하는 아이덴티티, 표정 및 장면 구성을 가진 완전한 사진 실사 얼굴 렌더링을 자동으로 생성할 수 있습니다. 이 접근 방식은 영화 및 엔터테인먼트를 위한 얼굴 렌더링에 적용될 수 있으며, 수동 아티스트의 노동을 절약할 수 있습니다. 또한 딥러닝의 다양한 분야에서 데이터 생성에 사용될 수 있습니다.’
새로운 접근 방식에 대한 더 깊은 이해를 얻으려면, 오늘 발표된 10분짜리 비디오를 확인하십시오:
* 원래 비디오 링크는 기사 게시 8시간 후에 다른 것으로 대체되었습니다. 관련 링크를 모두 변경했습니다. 원래 비디오는 더 이상 존재하지 않습니다.
8:24 GMT+2 – 비디오를 대체했습니다. 디즈니 연구 유튜브 채널에서 이유 없이 비디오를 교체했습니다.












