Anderson의 관점

딥페이크는 현재 감정의 미묘함을 전달할 수 없다

mm
Unite.AI를 Google의 선호 소스에 추가
The Book of Boba Fett - Disney

어제 에피소드 6의 스타 워즈 스핀 오프 보바 펫의 책이 공개되면서 팬들의 의견이 분분해졌다. 일반적으로 호평을 받았지만, 소셜 네트워크에는 Industrial Light and Magic이 아마추어 딥페이크 실무자 Shamook를 고용했기 때문에 마크 해밀의 젊은 시절을 재현한 것이 크게 개선되었다는 가정이 퍼져 있다. 또한 이 재현은 딥페이크 기술과 CGI의 조합일 수 있다.

현재 이러한 가정이 사실인지에 대한 확증은 제한적이지만, Shamook은 ILM의 계약서에 서명한 이후로 거의 아무 말도 하지 않았다. 그럼에도 불구하고, 이 작품은 2020년의 CGI보다 훨씬 개선되었으며, 일부에서는 딥페이크 모델에서 볼 수 있는 광沢함을 나타내고 있으며, 현재 딥페이크의 시각적 표준에 부합한다.

다른 팬들은 새로운 ‘젊은 루크’가 이전 버전과는 다른 결점이 있다고 주장한다. 아마도 가장 중요한 것은, 새로운 스카이워커 재현을 특징으로 하는 매우 긴 시퀀스에서 표현력과 미묘한 감정이 부족한 것이 딥페이크보다 CGI에 더典型적이라는 것이다. The Verge는 보바 펫 시뮬레이션을 마크 해밀의 1983년얼굴의 ‘uncanny, blank visage’라고 묘사했다.

새로운 ILM 재현의背後에 있는 기술과 상관없이, 딥페이크 변환에는 감정의 미묘함을 다루는 데 어려움이 있다. 이는 아키텍처의 변경이나 소스 훈련 자료의 개선을 통해 해결하기 어렵다. 또한 이는 바이럴 딥페이커들이 대상 비디오를 선택할 때 주의 깊게 선택하는 것에 의해 회피된다.

면부 정렬 제한

딥페이크 FOSS 저장소 중 가장 일반적으로 사용되는 두 가지 저장소는 DeepFaceLab(DFL)과 FaceSwap이다. 두 저장소 모두 2017년의 익명이고 논란의 소스 코드에서 파생되었으며, DFL은 VFX 산업에서 압도적인 리드를 보이고 있다.

이 패키지들은 초기에 소스 자료에서 식별된 얼굴에서 얼굴 랜드마크를 추출하는 역할을 담당한다(즉, 비디오 프레임과/또는 정지 이미지).

Adrian Bulat의 Facial Alignment Network(FAN) 동작, 공식 저장소에서. 출처: https://github.com/1adrianb/face-alignment

Adrian Bulat의 Facial Alignment Network(FAN) 동작, 공식 저장소에서. 출처: https://github.com/1adrianb/face-alignment

DFL과 FaceSwap 모두 Facial Alignment Network(FAN) 라이브러리를 사용한다. FAN은 추출된 얼굴에 대해 2D와 3D 랜드마크를 생성할 수 있다. 3D 랜드마크는 얼굴의 방향을 고려하여 극단적인 프로파일과 상대적으로 급한 각도까지 계산할 수 있다.

그러나 이것이 픽셀을 유도하고 평가하기 위한 매우 기초적인 지침임은 명백하다.

FaceSwap 포럼에서 제공하는 얼굴 선상의 랜드마크에 대한 대략적인 지시자. 출처: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

FaceSwap 포럼에서 제공하는 얼굴 선상의 랜드마크에 대한 대략적인 지시자. 출처: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

가장 기본적인 얼굴의 선상은 허용된다. 눈은 열리고 닫을 수 있으며, 아래턱도 마찬가지이다. 기본적인 입의 구성(예: 미소, 찡그림 등)은 추적되고 적응될 수 있다. 얼굴은 카메라의 시점에서 약 200도까지 모든 방향으로 회전할 수 있다.

그 이상으로는 이러한 경계 내에서 픽셀이 행동하는 방식에 대한 粗略한 규칙이다. 딥페이크 과정에서 이것이 유일하게 수학적으로 정확한 얼굴 지침이다.

DeepFaceLab에서 훈련. 출처: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

DeepFaceLab에서 훈련. 출처: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

얼굴의 하위 부분의 토폴로지(볼의 볼록성과 오목함, 노화의 세부 사항, 점 등)에 대한 규정은 없으므로, 이러한 ‘미묘한’ 하위 특징을 소스와 대상 身分之间에서 일치시키려는 시도조차 불가능하다.

제한된 데이터로 대처하기

딥페이크를 위한 두 身分之间의 匹配 데이터를 얻는 것은 쉽지 않다. 필요로 하는 각도가 더 이상하면, 실제로 身分 A와 B 사이에서 동일한 表情을 갖는 匹配을 찾기가 더 어려워질 수 있다.

가까우지만 정확한 匹配은 아님.

가까우지만 정확한 匹配은 아님.

위의 예에서, 두 身分은 대체로 비슷하지만, 이것은 이 데이터셋이 정확한 匹配에 도달할 수 있는 가장 가까운 점이다.

명백한 차이점이 남아 있다. 각도와 렌즈가 정확히 匹配하지 않으며, 조명도 다르다. 주제 A는 눈을 완전히 닫지 않았으며, 주제 B는 그렇다. 이미지 품질과 압축은 주제 A에서 더 나쁨이다. 또한 주제 B는 주제 A보다 더 ‘행복해’ 보인다.

그러나 우리에게는 이것이 전부이므로, 이것으로 훈련해야 한다.

이 AB 匹配에는 많은 특이한 요소가 있으므로, 이 데이터셋에는 이러한 짝이 거의 없을 것이라고 확신할 수 있다. 따라서 훈련은 이 匹配을 과소적합하거나 과대적합할 것이다.

감정의 제한된 범위?

당신의 딥페이크 배우가 장면을 먹어치우도록 하려면, 비usual한 얼굴 表情의 폭이 넓은 소스 자료가 필요하다. 사용 가능한 유일한 시대적 자료에는 이러한 表情이 많이 포함되어 있지 않을 수 있다.

예를 들어, 제다이의 귀환의 이야기 아크가 돌아올 때, 해밀의 캐릭터는 이미 그의 감정을 대체로 극복했다. 이것은 원래 프랜차이즈 신화에 централь적인 발전이다. 따라서 제다이 데이터에서 해밀의 딥페이크 모델을 만든다면, 그 당시 그의 역할에서 요구되는 것보다 더 제한된 감정 범위와 비usual한 얼굴 姿勢로 작업해야 할 것이다.

即使 제다이에 스카이워커 캐릭터가 스트레스를 받는 순간이 있어 더 넓은 表情의 범위를 제공할 수 있다고 하더라도, 이러한 장면의 얼굴 자료는行動과 빠른 편집으로 인해 불안정하고, 데이터는 매우 불균형하다.

일반화: 감정의 융합

보바 펫의 스카이워커 재현이 실제로 딥페이크라면, 일부에서 제기된 표현력의 부족은 단순히 제한된 소스 자료로 인한 것이 아니다. 딥페이크의 인코더-디코더 훈련 과정은 성공적으로 중추적인 특징을 추출하여ousands개의 이미지에서 일반화된 모델을 찾고 있으며, 적어도 시도할 수 있는 모델을 만들 수 있다. 데이터셋에 없는 각도를 딥페이크할 수 있다.

그러나 이 유연성의 고통스러운 대가는 표현의 신뢰성이 과정의 희생양이 될 가능성이 있다. 또한 미묘한 表情이 항상 올바른 것이 아닐 수 있다. 우리는 모두 우리의 얼굴을 100개의 오케스트라처럼 연주하며, 이를 수행할 수 있다. 그러나 딥페이크 소프트웨어는 아마도 문자열 섹션을欠如하고 있다.

表情의 불일치

얼굴의 움직임과 그것이 우리에게 미치는 영향은 모든 얼굴에 걸쳐서 균일한 언어가 아니다. 로저 무어의 눈썹을 올린 것이 무심한 것처럼 보이지만, 세스 로건에게는 그렇지 않을 수 있다. 마릴린 먼로의 유혹적인 매력은 ‘화난’ 또는 ‘불만’이라는 가장 많이 사용되는 역할(예: 오브리 플라자의 파크스 앤 레크리에이션의 캐릭터)을 가진 사람에게 딥페이크하면 더 부정적인 감정으로 번역될 수 있다.

따라서 A/B 얼굴 세트 간의 픽셀 대 픽셀 등가성은 이 점에서 도움이 되지 않는다. 그러나 이것은 현재의 딥페이크 FOSS 소프트웨어에서 제공되는 모든 것이다.

아마도 필요한 것은 표현과 감정을 인식하고, 높은 수준의 개념을 구체화할 수 있는 딥페이크 프레임워크이다. 예를 들어, 화난, 유혹적인, 지루한, 피곤한 등과 같은 감정과 관련된 表情을 인식하고, 두 얼굴 세트 身分에서 이러한 감정과 관련된 表情을 분류할 수 있다. 즉, 입이나 눈썹의 배치만을 조사하고 복제하는 것이 아니라, 높은 수준의 개념을 이해하고 구체화할 수 있다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai