Anderson의 관점
깊은 가짜 감정의 새벽

연구자들은 기존의 깊은 가짜 기술을 이용하여 비디오에서 얼굴의 감정을 임의로 변경하는 새로운 기계 학습 기술을 개발했습니다. 이 기술은 최근에 외국어 더빙에 맞추기 위해 입의 움직임을 변경하는 솔루션으로 등장했습니다.
이 연구는 보스턴의 노스이스트 대학교와 MIT의 미디어 랩 간의 공동 연구이며, 인버터블 프라운즈: 비디오-비디오 얼굴 감정 번역이라는 제목으로 발표되었습니다. 연구자들은 초기 결과의 품질이 추가 연구를 통해 개발되어야 한다고 인정하지만, 이 기술은 최초의 신경망 기술을 이용하여 전체 비디오의 표현을 변경하는 최초의 기술이라고 주장합니다.
기반 코드는 깃허브에 공개되었으며, 모델 체크포인트는 이후에 오픈 소스 저장소에 추가될 예정입니다.

왼쪽: 원본 비디오의 ‘슬픈’ 프레임. 오른쪽: ‘행복한’ 프레임. 중앙: 두 가지 감정 합성 접근법 – 상단 행: 전체 얼굴을 대체한 마스크; 하단 행: 전통적인 Wav2Lip 방법, 얼굴의 하단 부분만 대체합니다. 출처: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
단일 비디오를 소스 데이터로 사용
이론적으로, 이러한 조작은 전통적인 깊은 가짜 저장소인 DeepFaceLab 또는 FaceSwap을 사용하여 전체적으로 훈련함으로써 가능합니다. 그러나 표준 워크플로는 대체 아이디를 사용하여 타겟 아이디의 표현을 전환하는 것이 포함됩니다.
さらに, 이러한 인기 있는 프레임워크에서 단일 소스 비디오의 표현을 변경하는 것은 현재 이러한 아키텍처에서 제공하지 않는 방식으로 얼굴 정렬 벡터를 변경하는 것을 포함합니다.

Wav2Lip-Emotion은 원본 비디오 오디오 대화의 입의 동기화를 유지하면서 연관된 표현을 변환합니다.
대신, Wav2Lip-Emotion은 비디오의 한 부분에서 감정 관련 표현을 ‘복사 및 붙여넣기’하여 다른 부분에 대체하는 것을 시도합니다.
오프라인 모델은 이후 개발될 수 있으며, 이는 연사자의 대체 비디오에 훈련되어 비디오를 조작하기 위해 하나의 비디오가 포함된 ‘팔레트’의 표현 상태를 필요로 하지 않습니다.
潜在的な目的
저자들은 표현 수정에 대한 몇 가지 적용을 제안합니다. 이는 PTSD와 얼굴 마비 환자에게 보상하기 위한 라이브 비디오 필터를 포함합니다. 논문은 다음과 같이 관찰합니다.
‘제한된 얼굴 표현을 가진 개인이나 그렇지 않은 개인은 사회적 상황에 맞게 자신의 표현을 조정하는 데로부터 이익을 얻을 수 있습니다. 비디오에서 표현을 변경하고 싶을 수 있습니다. 화상 회의 중에 연사자들이 서로 소리를 지르면서도 불쾌한 표현 없이 내용을 수집하고 싶을 수 있습니다. 또는 영화 감독은 배우의 표현을 강화 또는 약화하고 싶을 수 있습니다.’
顔의 表情은 의도를 나타내는 핵심적인 지표입니다. 따라서 表情을 변경하는 능력은 의사소통을 받는 방식을 변경하는 능력을 제공합니다.
이전 연구
기계 학습 표현 변경에 대한 관심은 최소한 2012년으로 거슬러 올라갑니다. 당시 Adobe, Facebook, 및 Rutger 대학교 간의 협력은 텐서 기반 3D 기하학 재구성을 사용하여 표현을 변경하는 방법을 제안했습니다.

2012년 Adobe/Facebook 연구는 전통적인 CGI 주도 변경을 비디오에 가하여 표현을 조작했습니다. 표현을 강화 또는 억제할 수 있습니다. 출처: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
결과는 유망했지만, 이 기술은 부담적이었고, 필요한 자원은 상당했습니다. 당시 CGI는 컴퓨터 비전 기반 접근 방식보다 훨씬 앞섰습니다.
새로운 논문과 더密接하게 관련된 것은 MEAD입니다. 이는 2020년에 발표된 데이터셋 및 표현 생성 모델로, ‘Talking-head’ 비디오를 생성할 수 있습니다.

SenseTime Research, Carnegie Mellon, 및 3개의 중국 대학 간의 협력인 2020년 MEAD의 표현 생성. 출처: https://wywu.github.io/projects/MEAD/MEAD.html
2018년 다른 논문인 GANimation: Anatomically-aware Facial Animation from a Single Image은 미국/스페인 학술 연구 협력으로서, 정적 이미지에서만 표현을 변경하거나 강화하기 위한 생성적 적대 신경망을 사용했습니다.

GANimation을 사용한 정적 이미지의 표현 변경. 출처: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
새로운 프로젝트는 Wav2Lip을 기반으로 하며, 이는 2020년에 잠재적인 방법으로 새로운 음성 또는 노래 입력에 입의 동기화를 제공했습니다.
원래 Wav2Lip 아키텍처는 BBC 아카이브의 말한 문장 корпус에 훈련되었습니다. 표현 변경 작업에 대한 Wav2Lip을 적응시키기 위해, 연구자들은 위에서 언급한 MEAD 데이터셋에 아키텍처를 미세 조정했습니다.
MEAD는 40시간의 비디오로 구성되며, 60명의 배우가 같은 문장을 읽으면서 다양한 얼굴 표현을 수행합니다. 배우들은 15개국 출신이며, 이 프로젝트와 파생 프로젝트가 적용 가능하고 일반화된 표현 합성을 생성하도록 도와주는 국제적 특성을 제공합니다.
연구 당시 MEAD는 첫 번째 부분만 공개되었습니다. 이는 47명의 개인이 ‘화남’, ‘혐오’, ‘공포’, ‘경멸’, ‘행복’, ‘슬픔’, ‘놀람’ 등의 표현을 수행하는 것을 특징으로 합니다. 이 새로운 접근법의 초기 버전에서, 연구자들은 범위를 ‘행복’과 ‘슬픔’의 감정으로 제한했습니다. 이는 가장 쉽게 인식되는 감정입니다.
방법 및 결과
원래 Wav2Lip 아키텍처는 얼굴의 하단 부분만 대체합니다. 반면에 Wav2Lip-Emotion은 전체 얼굴 대체 마스크와 표현 합성을 실험합니다. 따라서 연구자들은 내장된 평가 방법을 수정해야 했습니다. 이는 전체 얼굴 구성에 대해 설계되지 않았기 때문입니다.
저자들은 원래 코드를 개선하여 원본 오디오 입력을 유지하고, 입의 동기화를 유지합니다.
생성기 요소에는 동일한 이전 작업에 따라 아이덴티티 인코더, 음성 인코더, 및 얼굴 디코더가 있습니다. 음성 요소는 연관된 프레임에 연결된 2D 컨볼루션으로 인코딩됩니다.
생성기 요소 외에도, 수정된 아키텍처는 입의 동기화 품질, 감정 목적 요소, 및 적대적으로 훈련된 시각적 품질 목적을 대상으로 하는 세 가지 주요 판별기 구성 요소를 특징으로 합니다.
전체 얼굴 재구성을 위해, 원래 Wav2Lip 작업에는 전례가 없었습니다. 따라서 모델은 처음부터 훈련되었습니다. 하단 얼굴 훈련(하프 마스크)의 경우, 연구자들은 원래 Wav2Lip 코드에 포함된 체크포인트에서 출발했습니다.
자동 평가 외에도, 연구자들은 반자동 서비스 플랫폼에서 제공되는 크라우드소스 의견을 사용했습니다. 작업자들은 일반적으로 출력을 높이 평가했으며, 감정의 인식에서 높은 평가를 받았습니다. 그러나 이미지 품질에서는 중간 정도의 평가를 받았습니다.
저자들은 생성된 비디오 품질을 향상시키기 위한 추가적인 세부 사항을 제안합니다. 또한, 이 연구는 추후에 더 넓은 범위의 감정 및 자동으로 추론된 소스 데이터 및 데이터셋에 적용될 수 있으며, 이는 사용자가 원하는 대로 감정을 조절하거나 원본 비디오의 감정과 대조되는 감정으로 대체할 수 있는 인증 시스템을 제공할 것입니다.












