Anderson의 관점

‘나쁨 머리 날’을 인간 이미지 합성에서 해결하기

mm
Unite.AI를 Google의 선호 소스에 추가

로마 조각의 황금 시대 이후로 인간의 머리카락을 묘사하는 것은 어려운 도전이었습니다. 평균적인 인간의 머리카락은 100,000개의 가닥으로 구성되어 있으며, 색상에 따라 반사율이 다르며, 일정 길이 이상으로 자라면 복잡한 물리 모델로만 시뮬레이션할 수 있는 방식으로 움직이고 재구성됩니다. 이러한 모델은 현재 전통적인 CGI 방법론을 통해만 적용할 수 있습니다.

2017년 디즈니 연구에서, 물리 기반 모델이 CGI 워크플로우에서 유동적인 헤어 스타일에 현실적인 움직임을 적용하려고 시도합니다. 출처: https://www.youtube.com/watch?v=-6iF3mufDW0

2017년 디즈니 연구에서, 물리 기반 모델이 CGI 워크플로우에서 유동적인 헤어 스타일에 현실적인 움직임을 적용하려고 시도합니다. 출처: https://www.youtube.com/watch?v=-6iF3mufDW0

현대적인 인기 있는 딥페이크 방법은 이 문제를 잘 해결하지 못합니다. 몇 년 동안, 리딩 패키지인 DeepFaceLab은 ‘전체 머리’ 모델을 가지고 있었는데, 이는剛性 구현의 짧은(通常은 남성의) 머리 스타일만을 캡처할 수 있었습니다. 최근에 DFL의 안정적인 동료인 FaceSwap(두 패키지 모두 2017년의 논란이 된 DeepFakes 소스 코드에서 파생됨)은 BiseNet 시맨틱 세그먼테이션 모델의 구현을 제공했는데, 이는 사용자가 딥페이크 출력에 귀와 머리카락을 포함할 수 있게 해줍니다.

그러나 매우 짧은 머리 스타일을 묘사할 때도 결과는 품질이 매우 제한적이며, 전체 머리는 영상에 통합되지 않고 대신 영상 위에 겹쳐진 것처럼 보입니다.

GAN 머리

인간 시뮬레이션의 두 가지 주요 경쟁 접근법은 Neural Radiance Fields(NeRF)와 생성적 적대 신경망(GAN)입니다. NeRF는 여러 관점에서 장면을 캡처하고 이러한 관점의 3D 표현을 탐색 가능한 신경망에 캡슐화할 수 있습니다. GAN은 인간 이미지 합성에서 더 발전되어 있으며, 특히 NeRF는 2020년에 등장했기 때문에 더 발전되어 있습니다.

NeRF의 3D 기하학에 대한 추론된 이해는 장면을 높은 충실도와 일관성으로 복제할 수 있게 해줍니다. 그러나 물리 모델의 적용이나 데이터의 변환에 대한 제한된 범위만을 제공합니다. 현재 NeRF는 인간의 머리카락 움직임을 재현하는 능력이 매우 제한적입니다.

GAN 기반의 NeRF와 같은 것은 처음부터 거의 치명적인 불이익을 갖습니다. NeRF와는 달리, GAN의 잠재 공간은 3D 정보에 대한 이해를 내재적으로 포함하지 않습니다. 따라서 3D 인식 facial 이미지 합성은 최근 몇 년 동안 이미지 생성 연구에서 뜨거운 추구 대상이 되었습니다. 2019年的 InterFaceGAN은 이러한 분야에서 주요한 돌파구 중 하나입니다.

그러나 InterFaceGAN의 결과는 신경 머리카락 일관성이 시간적 일관성 측면에서 여전히 어려운 도전임을 보여줍니다.

InterFaceGAN의 포즈 변환에서 '스핑크스'하는 머리카락.

InterFaceGAN의 포즈 변환에서 ‘스핑크스’하는 머리카락. 출처: https://www.youtube.com/watch?v=uoftpl3Bj6w

잠재 공간만을 조작하여 일관된 뷰를 생성하는 것은 아직 알케미와 같은 추구입니다. 점점 더 많은 논문이 CGI 기반의 3D 정보를 GAN 워크플로우에 통합하여 안정화 및 정규화 제약을 제공하는 방법을 제시하고 있습니다.

CGI 요소는 중간 3D 프리미티브인 Skinned Multi-Person Linear Model(SMPL) 또는 NeRF와 유사한 3D 추론 기술을 사용하여 소스 이미지 또는 비디오에서 기하학을 평가함으로써 나타날 수 있습니다.

한 새로운 연구는 ReLER, AAII, University of Technology Sydney, Alibaba Group의 DAMO Academy, Zhejiang University의 협력으로 발표되었습니다. 이 연구는 Multi-View Consistent Generative Adversarial Networks for 3D-aware Image Synthesis(MVCGAN)입니다.

MVCGAN이 CELEBA-HQ 데이터셋에서 유도한 새로운 얼굴 포즈.

MVCGAN이 CELEBA-HQ 데이터셋에서 유도한 새로운 얼굴 포즈. 출처: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN은 생성적 방사선 필드 네트워크(GRAF)를 포함하여 GAN에 기하학적 제약을 제공할 수 있습니다. 이는 GAN 기반 접근법 중에서 가장 진정한 포즈 생성 능력을 제공하는 것으로 주장됩니다.

MVCGAN과 이전 방법 GRAF, GIRAFFE, pi-GAN의 비교.

MVCGAN과 이전 방법 GRAF, GIRAFFE, pi-GAN의 비교.

그러나 MVCGAN의 보충 자료는 외부적으로 부과된 3D 기하학에 기반한 제약만으로는 머리카락의 일관성을 얻는 것이 쉽지 않은 문제임을 보여줍니다.

MVCGAN의 얼굴 포즈 합성은 현재 상태의 기술에 비해 큰 발전입니다. 그러나 시간적 머리카락 일관성은 여전히 문제입니다.

MVCGAN의 얼굴 포즈 합성은 현재 상태의 기술에 비해 큰 발전입니다. 그러나 시간적 머리카락 일관성은 여전히 문제입니다.

직접적인 CGI 워크플로우에서도 시간적 머리카락 재구성이 어려운 도전인 만큼, 이러한 접근법이 머리카락 합성을 일관성 있게 가져올 가능성은 낮습니다.

컨볼루션 신경망을 사용한 머리카락 안정화

스웨덴의 Chalmers Institute of Technology의 세 명의 연구자들이 발표한 即将公開되는 논문은 신경 머리카락 시뮬레이션에서 추가적인 발전을 제공할 수 있습니다.

왼쪽: CNN 안정화된 머리카락 표현, 오른쪽: 실제 값. 자세한 예제와 더 높은 해상도를 위해 이 기사의 끝에 있는 비디오를 참조하십시오.

왼쪽: CNN 안정화된 머리카락 표현, 오른쪽: 실제 값. 출처: https://www.youtube.com/watch?v=AvnJkwCmsT4

이 논문은 Real-Time Hair Filtering with Convolutional Neural Networks라는 제목으로, i3D 심포지엄에서 발표될 예정입니다.

이 시스템은 오토인코더 기반 네트워크로 구성되어 있으며, 이는 머리카락 해상도, 셀프 섀도잉, 그리고 머리카락 두께를 고려하여 실시간으로 평가할 수 있습니다. 이 접근법은 OpenGL 기하학에서 한정된 수의 스토캐스틱 샘플을 렌더링하고, 이후 U-Net을 사용하여 원래 이미지를 재구성합니다.

MVCGAN에서, CNN은 스토캐스틱하게 샘플링된 색상 요인, 하이라이트, тангент, 깊이 및 알파를 필터링하여 합성된 결과를 컴포지트 이미지로 조합합니다.

MVCGAN에서, CNN은 스토캐스틱하게 샘플링된 색상 요인, 하이라이트, тангент, 깊이 및 알파를 필터링하여 합성된 결과를 컴포지트 이미지로 조합합니다.

네트워크는 PyTorch에서 훈련되며, 6~12시간 동안 수렴합니다. 훈련 데이터는 다양한 거리, 포즈, 그리고 조명 조건에서 렌더링된 수백 개의 이미지로 생성됩니다.

다양한 훈련 입력 예제.

다양한 훈련 입력 예제.

머리카락 투명도는 스토캐스틱 투명도와 함께 렌더링된 이미지에서 평균화됩니다. 원래의 높은 해상도 데이터는 네트워크와 하드웨어 제한을 위해 다운샘플링되며, 이후 업샘플링됩니다.

실시간 추론 애플리케이션은 NVIDIA CUDA와 cuDNN, OpenGL을 사용합니다. 초기 입력 특징은 OpenGL 멀티샘플링된 색상 버퍼에 덤프되고, 결과는 cuDNN 텐서로 처리된 후 최종 이미지에 통합됩니다.

시스템은 NVIDIA RTX 2080에서 1024×1024 픽셀의 해상도로 작동합니다.

머리카락 색상 값은 네트워크에서 얻은 최종 값에서 완전히 분리되므로, 머리카락 색상을 변경하는 것은 간단한 작업입니다. 그러나 그라디언트와 스트립스 같은 효과는 아직 미래의 도전입니다.

저자들은 이 논문의 평가에서 사용된 코드를 GitLab에서 공개했습니다. MVCGAN에 대한 보충 비디오를 아래에서 확인하십시오.

결론

오utoencoder 또는 GAN의 잠재 공간을 탐색하는 것은 아직 항해와 같은 것이며, 정밀한 운전과는 거리가 멉니다. 최근에 우리는 NeRF, GAN, 및 2017년 이전의 오토인코더 프레임워크와 같은 접근법에서 얼굴과 같은 ‘단순한’ 기하학의 포즈 생성에 대한 신뢰할 수 있는 결과를 볼 수 있게 되었습니다.

인간의 머리카락은 복잡한 구조를 가지고 있으며, 물리 모델과 다른 특성을 포함해야 하는데, 이는 현재의 이미지 합성 접근법이 제공하지 못합니다. 이는 머리카락 합성이 일반적인 얼굴 합성의 통합된 구성 요소로 남아 있지 않을 것이며, 복잡한 얼굴 합성 프레임워크에 결국 통합될 수 있는 별도의 네트워크가 필요할 것입니다.

 

최초로 2022년 4월 15일에 게시되었습니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai