Anderson의 관점
비디오 속 감정 변경하기: AI를 이용한 새로운 접근법

그리스와 영국의 연구자들은 비디오 속에서 사람들의 표정과 감정을 변경하는 새로운 딥러닝 접근법을 개발했습니다. 이 접근법은 이전의 시도에서 달성하지 못했던 원본 오디오의 唇 운동의 신뢰성을 유지하는 방식으로 감정을 변경합니다.

이 기사의 끝에 첨부된 비디오에서, NED를 이용하여 알 파치노의 표정이 미묘하게 변경된 클립입니다. 개별 표정과 관련된 감정을 정의하는 고급 의미적 개념을 기반으로 합니다. ‘참조 기반’ 방법은 오른쪽에서 원본 비디오의 감정을 해석하고 전체 비디오 시퀸스에 적용합니다. 출처: https://www.youtube.com/watch?v=Li6W8pRDMJQ
이 분야는 점점 성장하고 있는 ‘딥페이크 감정’ 분야에 속합니다. 여기서 원본 화자의 정체는 유지되지만 표정과 마이크로 표정은 변경됩니다. 이 기술이 성숙함에 따라 영화와 TV 제작에서 배우들의 표정을 미묘하게 변경하는 가능성이 열립니다. 그러나 이것은 또한 ‘감정 변경’ 비디오 딥페이크의 새로운 범주를 열어줍니다.
얼굴 변경
공개된 인물들의 표정은 철저하게 관리됩니다. 2016년 힐러리 클린턴의 표정은 그녀의 선거 전망에 부정적인 영향을 미칠 수 있다는 이유로 집중적인 미디어 검증을 받았습니다. 표정은 또한 FBI의 관심사입니다. 그리고 면접에서 중요한 지표입니다. 이는 직면 면접에서 표정을 제어하는 필터를 개발하는 것이 바람직합니다.
2005年的 연구에서는 얼굴 외모가 투표 결정에 영향을 미친다고 주장했습니다. 2019년 워싱턴 포스트의 기사에서는 ‘ 맥락 없이 공유된 비디오 클립’의 사용을 조사했습니다. 이는 현재 가짜 뉴스 주장자들이 실제로 공인들의 행동, 반응, 또는 감정을 변경할 수 있는 가장 가까운 것입니다.
신경 감정 조작으로
현재 감정 조작의 상태는 아직 초보적입니다. 이는 고급 개념(예: 슬픔, 분노, 행복, 미소)의 분리와 실제 비디오 콘텐츠의 분리입니다. 전통적인 딥페이크 아키텍처는 이 분리를 잘 수행하지만, 두 개의 훈련 얼굴 세트에 대한 일치하는 표정을 필요로 합니다.

딥페이크를 훈련하는데 사용되는 얼굴 이미지의典型적인 예입니다. 현재로서는 ID별로 특정한 표현에서 표현으로의 경로를 생성하여 사람의 얼굴 표정을 변경할 수 있습니다. 2017년의 딥페이크 소프트웨어에는 ‘미소’에 대한 내재적인, 의미적인 이해가 없습니다. 단지 두 주체 간의 얼굴 기하학의 인식된 변화를 매핑하고 일치시킵니다.
바람직한 것은 주체 B(예를 들어)의 미소를 인식하고, 단순히 ‘미소’ 스위치를 아키텍처에 생성하는 것입니다. 주체 A의 미소를 일치시키지 않고도 이를 달성하는 것입니다.
새로운 논문은 신경 감정 디렉터: “야생” 비디오에서 음성 보존 의미적 제어를 위한 얼굴 표정라고 제목이 붙여졌으며, 그리스 아테네 국립 기술 대학의 전기 및 컴퓨터 공학부, 그리스 테살로니키의 연구 및 기술 재단(FORTH)의 컴퓨터 과학 연구소, 영국 엑서터 대학의 공학, 수학 및 물리 과학 대학의 연구자들로부터 나왔습니다.
팀은 3D 기반 감정 번역 네트워크를 포함하는 신경 감정 디렉터(NED)라는 프레임워크를 개발했습니다.
NED는 수신된 표현 매개변수 시퀀스를 대상 도메인으로 번역합니다. 이는 각 ID에 해당하는 얼굴 표정이 있는 데이터셋에서 훈련할 필요가 없습니다.

이 기사의 끝에 첨부된 비디오에서, NED가 유튜브 데이터셋의 비디오에 明显한 감정을 부여하는 시리즈의 테스트를 실행합니다.
저자들은 NED가 임의적이고 예측할 수 없는 상황에서 배우들을 ‘지시’하는 최초의 비디오 기반 방법이라고 주장하며, NED의 프로젝트 페이지에서 코드를 공개했습니다.
방법과 아키텍처
시스템은 감정 레이블이 달린 두 개의 큰 비디오 데이터셋에서 훈련됩니다.
출력은 전통적인 얼굴 이미지 합성 기술을 사용하여 원하는 감정을 비디오로 렌더링하는 비디오 얼굴 렌더러에 의해 활성화됩니다. 여기에는 얼굴 분할, 얼굴 랜드마크 정렬 및 블렌딩이 포함되며, 여기서 얼굴 영역만 합성되고 원본 비디오에 적용됩니다.
초기에는 시스템이 입력 프레임에서 3D 얼굴 복구를 수행하고 얼굴 랜드마크 정렬을 적용하여 표현을 식별합니다. 이후 이러한 복구된 표현 매개변수는 3D 기반 감정 조작기에 전달되고, 의미적 레이블(예: ‘행복’) 또는 참조 파일에 의해 계산된 스타일 벡터를 생성합니다.
참조 파일은 특정 인식된 표현/감정을 나타내는 비디오입니다. 이는 이후 전체 대상 비디오에 적용되어 원본 표현을 교체합니다.
최종 생성된 3D 얼굴 형태는 정규화된 평균 얼굴 좌표(NMFC)와 눈 이미지(위의 이미지에서 빨간 점)와 연결되어 신경 렌더러에 전달되어 최종 조작을 수행합니다.
결과
연구자들은 사용자 연구와 절단 연구를 포함한 광범위한 연구를 수행하여 이전 연구와의 비교를 통해 방법의 효과를 평가했습니다. 대부분의 범주에서 NED는 현재의 최고 성능을 달성했습니다.

저자들은 이 연구의 후속 구현과 유사한 도구가 주로 TV와 영화 산업에서 유용할 것이라고 예상하며 다음을 언급합니다:
‘우리의 방법은 영화 후반작업, 비디오 게임, 사진 실감적인 감정 아바타 등 신경 렌더링 기술의 유용한 응용 프로그램을 위한 새로운 가능성의 여지를 열어줍니다.’
이것은 초기 연구이지만, 비디오를 사용하여 얼굴 재연을 시도한 최초의 연구 중 하나입니다. 비디오는 본질적으로 매우 빠르게 연속되는 여러 정지 이미지이기 때문에, 이전의 감정 전송 응용 프로그램보다 덜 효과적인 일시적 고려가 있습니다. 동반된 비디오와 논문의 예시에서 저자들은 NED의 출력과 최근의 다른 방법을 비교합니다.
보다 자세한 비교와 NED의 더 많은 예시는 아래의 전체 비디오에서 찾을 수 있습니다:
2021년 12월 3일, 18:30 GMT+2 – 논문의 저자 중 한 명의 요청에 따라 ‘참조 파일’에 대한 수정이 이루어졌습니다. 이는 실제로 비디오 클립입니다. 또한 연구 및 기술 재단의 컴퓨터 과학 연구소 이름에 대한 수정이 이루어졌습니다.
2021년 12월 3일, 20:50 GMT+2 – 논문의 저자 중 한 명의 요청에 따라 위의 기관 이름에 대한 추가 수정이 이루어졌습니다.















