Anderson의 관점
새로운 Deepfake 방법: ‘Face Host’ 문제 해결

수년간의 미디어에서 Deepfake 이미지의 잠재력에 대한 과장에도 불구하고, 현재 인기 있는 모든 방법은 기본적으로 ‘Face Host’를 찾는 것에 의존합니다. 즉, 대상 얼굴과 비슷한 모양의 얼굴을 찾는 것입니다.
원래 영상을 넓은 얼굴로 촬영했지만 대상 주체는 좁은 얼굴을 가지고 있는 경우, 결과는 항상 문제가 있었습니다. 왜냐하면 이러한 전송에는 원래 얼굴의 일부를 자르고 노출된 배경을 재구성하는 것이 포함되기 때문입니다. 현재 패키지인 DeepFaceLab과 FaceSwap은 구성이 반대인 경우(좁은 얼굴에서 넓은 얼굴로) 제한된 결과를 생산할 수 있지만, 이러한 시나리오를 신뢰성 있게 해결할 수 있는 기능이 없습니다.
현재, 텐센트와 중국의 샤먼 대학이 협력하여 새로운 접근 방식을 개발했습니다. 이것은 HifiFace라고 불리며, 이러한 부족을 해결하기 위해 설계되었습니다.

두 개의 HifiFace Deepfake 이미지, 첫 번째는 앤 해서웨이의 이미지로, 호스트 얼굴 모양과 호환되지 않에도 불구하고 좋은 유사성을 얻었습니다. HifiFace는 또한 안경을 쓴 대상에 대해 잘 작동합니다. 출처: https://arxiv.org/pdf/2106.09965.pdf
Deepfake 얼굴 재구성
이전 접근 방식은 2019年的 주제 불변 얼굴 교환 및 재구성(FSGAN)과 같이 3DMM 피팅(3D Morphable Models) 또는 얼굴 랜드마크 인식 또는 변환을 기반으로 하는 다른 방법론에 의존했습니다. 여기서 얼굴의 선적 특징은 교환의 범위를 결정합니다.

3DMM 얼굴 랜드마크 감지. 출처: https://github.com/Yinghao-Li/3DMM-fitting
경쟁 방법은 얼굴 인식 네트워크에서 파생된 기능을 사용했지만, 이는 주로 질감을 재구성하는 데 목적이 있었으며, 호스트 얼굴이 완전히 호환되지 않는 경우에도 마스크와 같은 효과를 생산했습니다.
이러한 문제를 해결하기 위해, 중국의 연구자들은 대학의 인공 지능학과 미디어 분석 및 컴퓨팅 연구소에서 3D 재구성 모델을 사용하여 대상과 원본 얼굴의 계수를 회귀하는 종단 간 네트워크를 개발했습니다. 이것은 형태 정보로 재결합되며, 얼굴 인식 네트워크에서 파생된 아이디 벡터 정보와 함께 연결됩니다.
이 기하학적 데이터는 구조 정보로 인코더-디코더 모델에 공급되며, 대상 얼굴의 표현과 태도와 함께 혼합되어 정확한 전송을 위한 보조 소스로 사용됩니다.
세マン틱 얼굴 융합
또한, HifiFace에는 세マン틱 얼굴 융합(SFF) 컴포넌트가 포함되어 있습니다. 이것은 인코더의 저수준 특징을 사용하여 공간 및 텍스처 정보를 보존하며, 대상 이미지의 아이디를 희생하지 않습니다. 인코더와 디코더의 특징은 학습된 적응형 마스크로 통합되며, 배경 정보는 학습된 얼굴 마스크를 통해 출력으로 혼합됩니다.

HifiFace 동작. 출처: https://johann.wang/HifiFace/
이 방식으로, HifiFace는 원래 물질의 얼굴 경계를 경계로 사용하는 것을 중단하고, 확장된 얼굴 세マン틱 분할을 사용하여 얼굴 경계의 적응적 융합을 수행할 수 있습니다.
이전 방법들과의 비교에서, HifiFace는 얼굴 모양의 우수한 재구성을 보여줍니다. 왜냐하면 그것은 ‘고스트’ 요소를 근사하지 않고, 얼굴의 한계를 명확하게 재구성하기 때문입니다.
테스트
연구자들은 VGGFace2와 DeepGlint Asian-Celeb 데이터셋을 사용하여 시스템을 구현했습니다. 얼굴은 5개의 외부 랜드마크를 통해 정렬되었으며, 256×256 픽셀 크기로 재자르기했습니다. 또한, 512×512 픽셀 버전을 생성하기 위해 초상화 강화 네트워크를 사용했습니다. 모델은 Adam을 사용하여 훈련되었습니다.
FaceShifter는 아이디를 잘 보존하지만, HifiFace와 같은 표현, 색상 및 가려짐과 같은 문제를 효과적으로 해결하지 못합니다. 또한, FaceShifter의 네트워크 구조가 더 복잡합니다. FSGAN은 원본에서 대상으로의 조명 전송에 문제가 있습니다.
연구자들은 FaceForensics++를 사용하여 정량적 비교를 수행했습니다. 변환된 비디오의 10개 프레임을 샘플링하여 경쟁 방법을 비교했으며, HifiFace가 우수한 아이디 검색 점수를 달성했다는 것을 발견했습니다. 다른 요인들을 테스트한 결과, 연구자들은 자신의 방법이 다른 방법론을凌駕한다는 것을 발견했습니다.
이 연구는 원본 자료를 추상화하여, 정확한 아이디를 전송할 수 있는 粗한 템플릿으로 만드는 또 하나의 단계입니다. 현재의 FOSS 패키지 중 일부, DeepFaceLab을 포함하여, 전체 머리 교체에 대한 초기 기능을 가지고 있지만, HifiFace와 마찬가지로,它们는 머리카락을 고려하지 않으며, 얼굴을 ‘건설’하는 것보다 원하는 대상 원본과 일치하도록 얼굴을 ‘조각’하는 데 더 효과적입니다.


















