Anderson의 관점

구글의 LipSync3D, 개선된 ‘딥페이크’ 입 운동 동기화 제공

mm
Unite.AI를 Google의 선호 소스에 추가

구글 AI 연구자와 인도 공과 대학 카라그푸르의 협력은 오디오 콘텐츠에서 대화하는 헤드의 합성에 대한 새로운 프레임워크를 제공합니다. 이 프로젝트는 오디오에서 ‘대화하는 헤드’ 비디오 콘텐츠를 생성하기 위한 최적화되고 합리적인 자원을 생산하는 것을 목표로 합니다. 이를 통해 입 운동을 더빙 또는 기계 번역 오디오와 동기화하고, 아바타, 상호작용 응용 프로그램 및 기타 실시간 환경에서 사용할 수 있습니다.

출처: https://www.youtube.com/watch?v=L1StbX9OznY

출처: https://www.youtube.com/watch?v=L1StbX9OznY

이 과정에서 훈련된 머신 러닝 모델 – LipSync3D라고 함 – 는 대상 얼굴 정체성을 입력 데이터로 사용하기 위해 단일 비디오만 필요로 합니다. 데이터 준비 파이프라인은 입력 비디오의 광학幾何학적 추출과 평가를 분리하여 더 경제적이고 집중적인 훈련을 허용합니다.

LipSync3D의 2단계 워크플로. 위쪽에서 '대상' 오디오에서 동적으로 텍스처링된 3D 얼굴을 생성하고, 아래쪽에서 생성된 메시를 대상 비디오에 삽입합니다.

LipSync3D의 2단계 워크플로. 위쪽에서 ‘대상’ 오디오에서 동적으로 텍스처링된 3D 얼굴을 생성하고, 아래쪽에서 생성된 메시를 대상 비디오에 삽입합니다.

사실, LipSync3D의 가장 주목할 만한 기여는 이 영역의 연구 노력에 대한 조명 정규화 알고리즘일 수 있습니다. 이는 훈련과 추론 조명을 분리합니다.

조명 데이터를 일반적인 기하학에서 분리하면 LipSync3D가 도전적인 조건에서 더 실제적인 입 운동 출력을 생성할 수 있습니다. 최근 몇 년 동안 다른 접근 방식은 '고정' 조명 조건으로 제한되었습니다.

조명 데이터를 일반적인 기하학에서 분리하면 LipSync3D가 도전적인 조건에서 더 실제적인 입 운동 출력을 생성할 수 있습니다. 최근 몇 년 동안 다른 접근 방식은 ‘고정’ 조명 조건으로 제한되었습니다.

입력 데이터 프레임의 사전 처리 중에 시스템은 광학幾何학적 점을 식별하고 제거해야 합니다. 이러한 점은 비디오가 촬영된 조명 조건에 특정되며, 그렇지 않으면 재조명 과정에 간섭할 것입니다.

LipSync3D, 이름에서 알 수 있듯이, 평가하는 얼굴의 단순한 픽셀 분석을 수행하지 않습니다. 오히려 활성화된 CGI 스타일의 메시와 함께 식별된 얼굴 랜드마크를 사용하여 동적인 텍스처를 생성합니다.

LipSync3D의 포즈 정규화. 왼쪽에는 입력 프레임과 감지된 특징이 있으며, 중간에는 생성된 메시의 정규화된 정점이 있으며, 오른쪽에는 텍스처 아틀라스가 있습니다.

LipSync3D의 포즈 정규화. 왼쪽에는 입력 프레임과 감지된 특징이 있으며, 중간에는 생성된 메시의 정규화된 정점이 있으며, 오른쪽에는 텍스처 아틀라스가 있습니다. 출처: https://arxiv.org/pdf/2106.04185.pdf

연구자들은 또한 LipSync3D가 이전 연구에 대한 세 가지 주요 혁신을 제공한다고 주장합니다. 첫째, 기하학, 조명, 포즈 및 텍스처를 정규화된 공간의 별도 데이터 스트림으로 분리합니다. 둘째, 시간적으로 일관된 비디오 합성을 생성하는 쉽게 훈련할 수 있는 자기 회귀적 텍스처 예측 모델입니다. 셋째, 인간 평점과 객관적 지표에 의해 평가된 실제성의 증가입니다.

비디오 얼굴 이미지의 다양한 측면을 분리하면 비디오 합성에서 더 큰 제어가 가능합니다.

비디오 얼굴 이미지의 다양한 측면을 분리하면 비디오 합성에서 더 큰 제어가 가능합니다.

LipSync3D는 오디오에서 음소와 다른 언어의 측면을 분석하여 입 운동을 직접 생성할 수 있습니다.

이 과정은 추론된 기하학과 텍스처가 전용 인코더를 갖는 자동 인코더 세트업에서 공유하는 오디오 인코더를 사용하는 조인트 예측 파이프라인을 사용합니다.

LipSync3D의 가변 운동 합성은 또한 스타일라이즈된 CGI 아바타를 구동하는 것을 목표로 합니다. 이는 실제 세계 이미지와 같은 메시 및 텍스처 정보입니다.

스타일라이즈된 3D 아바타의 입 운동은 소스 스피커 비디오에 의해 실시간으로 구동됩니다. 이러한 시나리오에서는 개인화된 사전 훈련으로 최상의 결과를 얻을 수 있습니다.

스타일라이즈된 3D 아바타의 입 운동은 소스 스피커 비디오에 의해 실시간으로 구동됩니다. 이러한 시나리오에서는 개인화된 사전 훈련으로 최상의 결과를 얻을 수 있습니다.

연구자들은 또한 약간 더 실제적인 느낌의 아바타를 사용할 수 있다고 예상합니다.

비디오의 샘플 훈련 시간은 2-5분 비디오에 대해 3-5시간으로, TensorFlow, Python 및 C++를 사용하는 파이프라인에서 GeForce GTX 1080에서 사용됩니다. 훈련 세션은 128개의 프레임으로 500-1000 에포크를 사용했으며, 각 에포크는 비디오의 완전한 평가를 나타냅니다.

입 운동의 동적 재동기화로

새로운 오디오 트랙에 맞게 입을 재동기화하는 분야는 최근 몇 년 동안 컴퓨터 비전 연구에서 많은 주목을 받았습니다(아래 참조). 이는 논란의 여지가 있는 딥페이크 기술의 부산물입니다.

2017년 워싱턴 대학교는 연구를 발표했습니다. 이는 오디오에서 립 싱크를 학습하여 당시 대통령 오바마의 입 운동을 변경하는 데 사용되었습니다. 2018년; 마克斯 플랑크 정보학 연구소가 주도한 또 다른 연구는 립 싱크가 프로세스의 부산물인 아이덴티티에서 아이덴티티 비디오 전송을 가능하게 하는 것을 목표로 했습니다. 2021년 5월, AI 스타트업 FlawlessAI는 자사 특허 립 싱크 기술인 TrueSync를 공개했습니다. 이는 주요 영화 릴리스를 위한 더 나은 더빙 기술을 제공하는 것으로 널리 받아들여졌습니다.

또한 딥페이크 오픈 소스 저장소의 지속적인 개발은 얼굴 이미지 합성의 이 영역에서 또 다른 활발한 사용자 기여 연구 지분을 제공합니다.

nc 기술 TrueSync, 주요 영화 릴리스를 위한 더 나은 더빙 기술을 제공하는 것으로 널리 받아들여졌습니다. 또한 딥페이크 오픈 소스 저장소의 지속적인 개발은 얼굴 이미지 합성의 이 영역에서 또 다른 활발한 사용자 기여 연구 지분을 제공합니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai