Anderson의 관점

딥페이크의 다음 혁신은 디센터글먼트이다

mm
Unite.AI를 Google의 선호 소스에 추가

CGI 데이터 증강은 새로운 프로젝트에서 더 나은 딥페이크 이미지 제어를 위해 사용되고 있다. 아직 CGI 헤드를 사용하여 딥페이크 얼굴 데이터셋의 누락된 부분을 효과적으로 채우지 못하지만, 동일성과 컨텍스트를 분리하는 새로운 연구는 곧 이를 가능하게 할 것이다.

최근 몇 년 동안 성공적인 바이럴 딥페이크 비디오를 제작한 창작자들은 소스 비디오를 매우 신중하게 선택하며, 지속적인 프로파일 샷(즉, 경찰 구금 절차에서 인기 있는 측면 사진)을 피하고, 급한 각도와 이상하거나 과장된 표정을 피한다. 점점 더 많은 바이럴 딥페이커들이 제작하는 데모 비디오는 편집된 컴파일레이션이며, 딥페이크에 가장 쉬운 각도와 표정을 선택한다.

사실, 딥페이크에 삽입할 수 있는 원본 비디오는 원본 사람이 카메라를 향해 직면하고, 최소한의 표정 범위를 갖는 경우가 가장 많다.

최근 몇 년 동안의 대부분의 인기 있는 딥페이크는 주제가 카메라를 향해 직면하고, 미소와 같은 인기 있는 표정만을 보이거나(레드 카펫 파파라치 출력에서 쉽게 추출할 수 있음), 또는 2019년 실베스터 스탤론의 터미네이터와 같은 이상한 표정 없이 이상적인 경우에 이상적인 표정을 보인다.

최근 몇 년 동안의 대부분의 인기 있는 딥페이크는 주제가 카메라를 향해 직면하고, 미소와 같은 인기 있는 표정만을 보이거나(레드 카펫 파파라치 출력에서 쉽게 추출할 수 있음), 또는 2019년 실베스터 스탤론의 터미네이터와 같은 이상한 표정 없이 이상적인 경우에 이상적인 표정을 보인다.

딥페이크 기술인 DeepFaceLab과 FaceSwap은 이러한 단순한 스왑을 잘 수행하므로, 우리는 그들이 성취하는 것에 충분히 매료되어서 그들이 할 수 없는 것을 알아차리지 못하며, 종종 시도하지도 않는다.

아놀드 슈워제네거를 실베스터 스탤론으로 변환하는 유명한 딥페이크 비디오의抓. 각도가 너무 까다롭지 않는 한 프로파일은 현재 딥페이크 접근 방식의 지속적인 문제이다. 이는 오픈 소스 소프트웨어가 사이드 뷰에 최적화되지 않았기 때문이지만, 필요한 데이터셋 중 하나 또는 둘 다에 적합한 소스 자료가 부족하기 때문이다. 출처: https://www.youtube.com/watch?v=AQvCmQFScMA

아놀드 슈워제네거를 실베스터 스탤론으로 변환하는 유명한 딥페이크 비디오의抓. 각도가 너무 까다롭지 않는 한 프로파일은 현재 딥페이크 접근 방식의 지속적인 문제이다. 이는 오픈 소스 소프트웨어가 사이드 뷰에 최적화되지 않았기 때문이지만, 필요한 데이터셋 중 하나 또는 둘 다에 적합한 소스 자료가 부족하기 때문이다. 출처: https://www.youtube.com/watch?v=AQvCmQFScMA

새로운 연구는 합성 데이터를 사용하여 딥페이크를 2020년대로 끌어들이는 새로운 방법을 제안하며, 이는 얼굴 동일성을 실제 특성(‘톰 크루즈’의 본질적인 얼굴 특징)에서 컨텍스트(예: ‘위로 보는 것’, ‘사이드 뷰에서 보는 것’, ‘구부리는 것’, ‘어둠 속에서 구부리는 것’ 등)와 분리한다.

새로운 시스템은 포즈와 컨텍스트(예: 눈을 깜빡이는 것)를 개인의 동일성 인코딩에서 분리하며, 관련이 없는 합성 얼굴 데이터를 사용한다(왼쪽에 그림이 있음). 위쪽 행에서는 ' 눈을 깜빡이는 것'을 바락 오바마의 동일성에 전송하며, GAN의 잠재 공간의 비선형 경로에 의해 학습된다. 아래 행에서는 입꼬리를 늘린 것을 전송한다. 아래쪽 오른쪽에서는 두 특징을 동시에 적용한다. 출처: https://arxiv.org/pdf/2111.08419.pdf

새로운 시스템은 포즈와 컨텍스트(예: 눈을 깜빡이는 것)를 개인의 동일성 인코딩에서 분리하며, 관련이 없는 합성 얼굴 데이터를 사용한다(왼쪽에 그림이 있음). 위쪽 행에서는 ‘ 눈을 깜빡이는 것’을 바락 오바마의 동일성에 전송하며, GAN의 잠재 공간의 비선형 경로에 의해 학습된다. 아래 행에서는 입꼬리를 늘린 것을 전송한다. 아래쪽 오른쪽에서는 두 특징을 동시에 적용한다. 출처: https://arxiv.org/pdf/2111.08419.pdf

이것은 단순한 딥페이크 헤드 퍼펫트가 아니다. 이는 아바타와 부분 얼굴 립싱크에 더 적합하며, 전체 딥페이크 비디오 변환에는 제한된 잠재력이 있다.

그것은 도구성(예: ‘머리 각도를 변경하다’, ‘구부리다’)와 동일성을 분리하는 방법을 나타낸다. 이는 이미지 합성 기반의 딥페이크 프레임워크보다 더 높은 수준의 프레임워크를 제공한다.

새로운 논문은 Delta-GAN-Encoder: Encoding Semantic Changes for Explicit Image Editing, using Few Synthetic Samples라는 제목을 가지고 있으며, 이스라엘 기술원(Technion – Israel Institute of Technology)의 연구자들에 의해 작성되었다.

현재 딥페이크 기술이 부족한 이유는 무엇인가?

딥페이크는 현재 두 개의 얼굴 이미지 폴더를 사용하여 encoder/decoder 머신 러닝 모델을 훈련함으로써 생성된다. 한 사람은 ‘그림을 덮어쓰는’ 사람이고, 다른 사람은 비디오에 삽입할 사람이다.

두 개의 얼굴 세트에 대한 다양한 포즈와 조명 조건의 예. 3행의 A 열에 있는 특징적인 표정은 다른 데이터셋에서 가까운 등가가 없을 가능성이 있다.

두 개의 얼굴 세트에 대한 다양한 포즈와 조명 조건의 예. 3행의 A 열에 있는 특징적인 표정은 다른 데이터셋에서 가까운 등가가 없을 가능성이 있다.

encoder/decoder 시스템은 각 폴더의 모든 이미지를 다른 이미지와 비교하며, 이를 수백 번 반복하여 두 동일성의 본질적인 특징을 충분히 이해할 때까지 반복한다.

딥페이크에서 두 사람을 교환하는 과정에서, 각 사람에 대한 동일성에 대한 지식은 컨텍스트와 얽혀 있다. 포즈에 대한 일반적인 원칙을 학습하고 적용할 수 없으며, 두 얼굴 세트 모두에서 각 동일성에 대한 많은 예가 필요하다.

현재 딥페이크 프레임워크에서 효과적인 딥페이크 모델을 훈련시키기 위해 두 얼굴 데이터셋에서 표현, 머리 포즈 및(덜 중요하게) 조명에 대한 광범위한 대칭이 필요하다. 특정 구성(예: '사이드 뷰/미소/햇빛 아래에서')이 두 얼굴 세트에서 특징적으로 나타나지 않는 경우, 딥페이크 비디오에서 그 렌더링이 정확하지 않을 수 있다.

현재 딥페이크 프레임워크에서 효과적인 딥페이크 모델을 훈련시키기 위해 두 얼굴 데이터셋에서 표현, 머리 포즈 및(덜 중요하게) 조명에 대한 광범위한 대칭이 필요하다. 특정 구성(예: ‘사이드 뷰/미소/햇빛 아래에서’)이 두 얼굴 세트에서 특징적으로 나타나지 않는 경우, 딥페이크 비디오에서 그 렌더링이 정확하지 않을 수 있다.

만약 세트 A에 특이한 포즈가 있지만 세트 B에는 없다면, 운이 좋지 않다. 모델을 훈련시키는 데 얼마나 오래 걸리든 간에, 특이한 포즈를 잘 재현할 수 없다. 왜냐하면 훈련 중에 필요한 정보의 절반만 있었기 때문이다.

데이터가 부족한 이유는 무엇인가?

사이드 프로파일 샷이 많지 않은 경우가 대부분이다. 그런 사진이 있다면 대부분 버렸을 것이다. 사진 기관도 마찬가지로 사이드 프로파일 샷을 많이 보유하지 않는다.

딥페이커들은 종종 한 사람의 동일성에 대한 제한된 사이드 뷰 데이터를 복사하여 훈련 중에 그 포즈에 조금이라도 주목을 받을 수 있도록 한다.

그러나 사이드 뷰 얼굴 사진의 가능한 유형은 실제로 사용할 수 있는 것보다 많다. 예를 들어, 미소, 구부리는 것, 비명, 울기, 어둡게 освещ된 것, 경멸하는 것, 지루한 것, 유쾌한 것, 플래시로 освещ된 것, 위를 보는 것, 아래를 보는 것, 눈이 열린 것, 눈이 닫힌 것 등이다. 이러한 포즈 중 하나 또는 여러 개의 조합이 대상 딥페이크 비디오에 필요할 수 있다.

그리고 그것은 프로파일만이 아니다. 위를 보는 자신을 얼마나 많은 사진을 가지고 있는가? 특정 각도에서 특정 표정을 지으면서 위를 보는 자신을 나타내는 10,000개의 가능한 표정 중 몇 개를 광범위하게 대표할 수 있는 사진을 가지고 있는가? 또한 1백만 개의 가능한 조명 환경 중 몇 개를 대표할 수 있는가?

그럴 가능성이 낮다. 위를 보는 자신을 한 번도 사진을 찍은 적이 없을 수 있다. 그리고 그것은 필요한 모든 각도 중 두 개에 불과하다.

합성 대체

딥페이크의黎明부터 딥페이커들은 CGI 스타일의 이미지, 3D 애플리케이션에서 만든 헤드를 사용하여 ‘누락된’ 포즈를 생성하려고 시도해 왔다.

AI가 필요하지 않다. 여배우가 전통적인 CGI 프로그램인 Cinema 4D에서 메시와 비트맵 텍스처를 사용하여 재창조된다. 이 기술은 1960년대부터 시작되었지만 1990년대부터 널리 사용되기 시작했다. 이 얼굴 모델은 이상한 포즈, 조명 스타일 및 얼굴 표정에 대한 딥페이크 소스 데이터를 생성하는 데 사용될 수 있다. 그러나 실제로 딥페이크에서 사용할 때는 합성 렌더링의 '가식성'이 스왑 비디오에 번질 수 있기 때문에 제한적이거나 전혀 쓸모가 없다. 출처: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

AI가 필요하지 않다. 여배우가 전통적인 CGI 프로그램인 Cinema 4D에서 메시와 비트맵 텍스처를 사용하여 재창조된다. 이 기술은 1960년대부터 시작되었지만 1990년대부터 널리 사용되기 시작했다. 이 얼굴 모델은 이상한 포즈, 조명 스타일 및 얼굴 표정에 대한 딥페이크 소스 데이터를 생성하는 데 사용될 수 있다. 그러나 실제로 딥페이크에서 사용할 때는 합성 렌더링의 ‘가식성’이 스왑 비디오에 번질 수 있기 때문에 제한적이거나 전혀 쓸모가 없다. 출처: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

이 방법은 일반적으로 새로운 딥페이크 실천자에 의해 초기에 버려진다. 왜냐하면 포즈와 표정을 제공할 수는 있지만, CGI 얼굴의 합성 외관이 스왑에 번질 수 있기 때문이다. 이는 동일성과 컨텍스트/의미 정보가 얽혀 있기 때문이다.

이것은 딥페이크 비디오에서突然 ‘uncanny valley’ 얼굴이 나타날 수 있다. 알고리즘이 특이한 포즈 또는 표정을 위해 唯一한 데이터를 사용하기 시작할 때, 명백하게 가짜 얼굴이 나타날 수 있다.

CGI 얼굴을 분리된, 개념적 지침으로 사용

대신, 이스라엘 연구자들의 새로운 Delta-GAN Encoder(DGE) 방법은 더 효과적이다. 왜냐하면 CGI 이미지에서 포즈와 컨텍스트 정보가 완전히 동일성 정보에서 분리되기 때문이다.

다음 이미지에서 이 원리를 볼 수 있다. 다양한 머리 방향이 CGI 이미지로 가이드를 사용하여 얻어졌다. 동일성 특징은 컨텍스트 특징과 관련이 없으므로, 가짜로 보이는 CGI 얼굴의 외관이나 그 안에 묘사된 동일성이 번질 수 없다.

새로운 방법으로, 여러 각도에서 딥페이크를 수행하기 위해 세 개의 별도 실제 소스 사진을 찾을 필요가 없다. CGI 헤드를 회전할 수 있다. 높은 수준의 추상적인 특징은 동일성에 임포즈되며, 동일성 정보를 누출하지 않는다.

새로운 방법으로, 여러 각도에서 딥페이크를 수행하기 위해 세 개의 별도 실제 소스 사진을 찾을 필요가 없다. CGI 헤드를 회전할 수 있다. 높은 수준의 추상적인 특징은 동일성에 임포즈되며, 동일성 정보를 누출하지 않는다.

Delta-GAN-Encoder. 위쪽 왼쪽 그룹: 소스 이미지의 각도를 변경하여 새로운 소스 이미지를 렌더링할 수 있다. 이는 출력에 반영된다. 위쪽 오른쪽 그룹: 조명도 동일성에서 분리되어 조명 스타일을 중첩할 수 있다. 아래쪽 왼쪽 그룹: 여러 얼굴 세부 사항을 변경하여 '슬픈' 표정을 생성한다. 아래쪽 오른쪽 그룹: 한 개의 얼굴 세부 사항을 변경하여 눈을 깜빡이게 한다.

Delta-GAN-Encoder. 위쪽 왼쪽 그룹: 소스 이미지의 각도를 변경하여 새로운 소스 이미지를 렌더링할 수 있다. 이는 출력에 반영된다. 위쪽 오른쪽 그룹: 조명도 동일성에서 분리되어 조명 스타일을 중첩할 수 있다. 아래쪽 왼쪽 그룹: 여러 얼굴 세부 사항을 변경하여 ‘슬픈’ 표정을 생성한다. 아래쪽 오른쪽 그룹: 한 개의 얼굴 세부 사항을 변경하여 눈을 깜빡이게 한다.

이 동일성과 컨텍스트의 분리는 훈련 단계에서 이루어진다. 새로운 딥페이크 아키텍처의 파이프라인은 변환할 이미지와 일치하는 pre-trained Generative Adversarial Network(GAN)의 잠재 벡터를 찾는다. 이는 Sim2Real 방법론에 기반하며, 2018년 IBM의 AI 연구 섹션에서 시작된 프로젝트에 기반한다.

연구자들은 다음과 같이 관찰한다.

‘몇 개의 샘플만으로, 특정 속성으로 다르면, pre-trained entangled generative model의 분리된 행동을 학습할 수 있다. 그 목표를 달성하기 위해 실제 샘플이 필요하지 않다. 그것은 항상 가능하지 않을 수 있다.

‘비현실적인 데이터 샘플을 사용하여 같은 목표를 달성할 수 있다. 그것은 인코딩된 잠재 벡터의 의미를 활용한다. 기존 데이터 샘플에 원하는 변경 사항을 적용할 수 있다. 이를 위해 명시적인 잠재 공간 행동 탐색이 필요하지 않다.’

연구자들은 이 프로젝트에서 탐구된 분리 원칙이 다른 도메인으로 전환될 수 있다고 예상한다. 예를 들어, 인테리어 아키텍처 시뮬레이션과, Sim2Real 방법이 궁극적으로 스케치만으로 딥페이크 도구성을 가능하게 할 수 있다.

새로운 이스라엘 시스템이 합성할 수 있는 딥페이크 비디오의 정도는 중요하지 않다. 왜냐하면 이 연구는 컨텍스트에서 동일성을 분리하는 데 더 많은 제어를 얻었다는 점이 더 중요하기 때문이다.

분리 adalah 이미지 합성에서 활발하게 연구되는 분야이다. 2021년 1월에 아마존이 주도한 연구 논문은 유사한 포즈 제어와 분리를 보여주었다. 2018년에 중국 과학 아카데미의 深圳 先進 기술 연구소에서 발표한 논문은 GAN에서 임의의 관점을 생성하는 데 진전을 보였다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai