Anderson의 관점
새로운 심플한 딥페이크 방법: 이전 접근 방식의 성능을 초과

중국 AI 연구 그룹과 미국 기반 연구진의 협력을 통해 4년 전 등장한 이후 첫 번째 실제 혁신인 심플한 딥페이크 방법이 개발되었습니다.
새로운 방법은 기존 프레임워크보다 표준 인식 테스트에서 더 나은 성능을 발휘할 수 있으며, 대규모 데이터셋을 수집하고 큐레이션하고 단일 身份에 대해 최대 1주일 동안 훈련할 필요가 없습니다. 새로운 논문에서 제시된 예제에서는 두 개의 인기 있는 유명인 데이터셋의 전체를 3일 동안 NVIDIA Tesla P40 GPU에서 훈련했습니다.

본 문서의 끝에 전체 비디오가 포함되어 있습니다. 본 비디오 샘플에서 스칼렛 요한슨의 얼굴이 소스 비디오로 전송됩니다. CihaNet은 소스와 타겟 身份 간의 더 깊은 관계를 형성하고 수행함으로써 에지 마스킹 문제를 제거하여 전통적인 심플한 딥페이크 접근 방식에서 발생하는 ‘명확한 경계’와 기타 수퍼 임포지션 글리치 등이 발생하지 않습니다. 출처: https://mitchellx.github.io/#video
새로운 접근 방식은 타겟 비디오에 身份를 粗く ‘붙여 넣는’ 필요를 제거하며, 이는 종종 가짜 얼굴이 끝나고 실제 기본 얼굴이 시작되는 곳에 나타나는 특징적인 아티팩트를 생성합니다. 대신, ‘hallucination maps’를 사용하여 시각적 요소의 더 깊은 혼합을 수행합니다. 시스템은 현재 방법보다 더 효과적으로 身份와 컨텍스트를 분리하므로 타겟 身份를 더 깊은 수준에서 혼합할 수 있습니다.

논문에서. CihaNet 변환은 환상 지도(하단 행)를 통해 수행됩니다. 시스템은 이미지에서 컨텍스트 정보(즉, 얼굴 방향, 머리, 안경 및 기타 가리기 등)를 완전히 사용하고, 身份 정보는 완전히 삽입할 사람에서 가져옵니다. 얼굴과 컨텍스트를 분리하는 이러한 능력은 시스템의 성공에 중요합니다. 출처: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
효과적으로 새로운 환상 지도는 스왑에 더 완전한 컨텍스트를 제공합니다. 이는 하드 마스크가 종종 광범위한 큐레이션(그리고 DeepFaceLab의 경우 별도의 훈련)을 필요로 하며, 실제로 두 身份의 통합을 제한하는 유연성을 제공합니다.

보충 자료에서 제공된 샘플에서, FFHQ와 Celeb-A HQ 데이터셋을 사용하여 VGGFace와 Forensics++에서 스왑 결과를 보여줍니다. 첫 두 열은 랜덤으로 선택된 실제 이미지입니다. 다음 네 열은 현재 사용 가능한 네 가지 가장 효과적인 방법의 결과를 보여주며, 마지막 열은 CihaNet의 결과입니다. FaceSwap 저장소는 더 인기 있는 DeepFaceLab 대신 사용되었습니다. 두 프로젝트는 모두 2017년 깃허브의 원본 Deepfakes 코드에서 포크되었으며, 이후 모델, 기술, 다양한 UI 및 보조 도구를 추가했습니다. 그러나 심플한 딥페이크를 가능하게 하는 기본 코드는 변경되지 않았으며, 두 프로젝트에서 공통입니다. 출처: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
‘正면’ 대칭이 필요 없습니다
가장 인기 있는 현재 심플한 딥페이크 소프트웨어인 DeepFaceLab와 경쟁하는 포크인 FaceSwap은 모두 스왑을 위해 고통스럽고 종종 수동으로 큐레이션된 워크플로우를 수행합니다. 이는 얼굴이 카메라를 직접 향하고 있는지, 가로막는 장애물이 있는지, 조명 등 다른 많은 불편한 장애물이 있는지 확인하기 위해 필요합니다.
반면에, CihaNet은 두 이미지가 카메라를 직접 향하고 있는지 여부에 관계없이 단일 이미지에서 유용한 身份 정보를 추출하고 활용할 수 있습니다.

이 예제에서 심플한 딥페이크 소프트웨어 경쟁자는 두 이미지가 동일한 방향을 향하지 않는 경우 스왑을 수행하는 작업에 도전됩니다. 깃허브의 원본 심플한 딥페이크 저장소에서 파생된 소프트웨어(예: 인기 있는 DeepFaceLab와 FaceSwap)는 두 이미지를 스왑하는 각도 차이를 처리할 수 없습니다(세 번째 열 참조). 반면에 CihaNet은 身份를 올바르게 추출할 수 있습니다. 이는 얼굴의 ‘포즈’가 본질적으로 身份 정보의 일부가 아니기 때문입니다.
아키텍처
CihaNet 프로젝트는 2019년 마이크로소프트 연구소와 베이징 대학의 협력인 FaceShifter에서 영감을 받았습니다. 그러나 핵심 아키텍처에 몇 가지 주목할 만한 변경을 추가했습니다.
FaceShifter는 身份 정보를 처리하기 위해 두 개의 Adaptive Instance Normalization(AdaIN) 네트워크를 사용합니다. 이는 현재 인기 있는 심플한 딥페이크 소프트웨어와 유사한 방식으로 마스크를 통해 타겟 이미지로 전송됩니다(그리고 모든 관련된 제한 사항이 있습니다). 추가적인 HEAR-Net(별도의 서브넷이 포함되어 있으며, 가리기 장애물에 대한 별도의 훈련을 받았습니다)도 사용됩니다.
반면에, 새로운 아키텍처는 직접적으로 변환 프로세스 자체를 위한 ‘컨텍스트적’ 정보를 사용합니다. 이는 두 단계의 단일 Cascading Adaptive Instance Normalization(C-AdaIN) 연산을 통해 제공되며, ID 관련 영역의 컨텍스트 일관성을 제공합니다.
시스템에 필수적인 두 번째 서브넷은 Swapping Block(SwapBlk)입니다. 이는 참조 이미지의 컨텍스트와 소스 이미지의 임베디드 ‘身份’ 정보에서 통합된 기능을 생성하며, 이를 통해 기존 방식으로 수행하는 여러 단계를 우회할 수 있습니다.
컨텍스트와 身份를 구분하기 위해 각 레벨에 대해 ‘환상 지도’가 생성됩니다. 이는 소프트 세그멘테이션 마스크를 대신하며, 심플한 딥페이크 프로세스의 이 중요한 부분에서 더 넓은 범위의 기능에 작용합니다.

환상 지도의 값이 증가함에 따라 身份 사이의 더 명확한 경로가 나타납니다.
이러한 방식으로, 전체 스왑 프로세스는 단일 단계에서 수행되며, 사후 처리가 필요하지 않습니다.
데이터 및 테스트
시스템을 테스트하기 위해, 연구진은 두 개의 인기 있는 오픈 이미지 데이터셋인 CelebA-HQ와 NVIDIA의 Flickr-Faces-HQ Dataset(FFHQ)에 대한 네 개의 모델을 훈련했습니다. 각 데이터셋에는 30,000개와 70,000개의 이미지로 구성되어 있습니다.
기본 데이터셋에 대한 가지치기 또는 필터링은 수행되지 않았습니다. 각 경우에 대해, 연구진은 단일 Tesla GPU에서 3일 동안 전체 데이터셋을 훈련했습니다. Adam 최적화에서 0.0002의 학습률을 사용했습니다.
그런 다음, 데이터셋에 포함된 수천 개의 개인성 중에서 임의의 스왑을 수행하여 결과를 네 가지 주요 심플한 딥페이크 프레임워크의 출력과 비교했습니다: FaceSwap(더 인기 있는 DeepFaceLab을 대신 사용하며, 원본 2017년 깃허브 저장소와 공통의 루트 코드베이스를 공유함); 앞서 언급한 FaceShifter; FSGAN; 및 SimSwap.
비교는 VGG-Face, FFHQ, CelebA-HQ 및 FaceForensics++를 통해 수행되었습니다. 저자는 자신의 새로운 모델이 모든 이전 모델을 능가한다는 것을 발견했습니다. 이는 아래 표에 표시된 대로입니다.

결과를 평가하기 위해 사용된 세 가지 지표는 Structural Similarity(SSIM), 포즈 추정 오차 및 ID 검색 정확도입니다. 이는 성공적으로 검색된 쌍의 백분율로 계산됩니다.
연구진은 CihaNet이 질적 결과에서 우수한 접근 방식을 나타내며, 심플한 딥페이크 기술의 현재 상태에서 주목할 만한 발전을 이루었다고 주장합니다. 이는 광범위한 마스킹 아키텍처와 방법론의 부담을 제거하고 身份와 컨텍스트를 더 유용하고 실행 가능한 방식으로 분리함으로써 달성됩니다.
아래에서 새로운 기술의 추가 비디오 예제를 확인하십시오. 전체 비디오는 여기에서 찾을 수 있습니다.
새로운 논문에서 제공된 보충 자료에서 CihaNet은 다양한 身份에서 얼굴 스왑을 수행합니다. 출처: https://mitchellx.github.io/#video














