Anderson의 관점

비디오에서 머신 러닝을 사용한 얼굴 재구성

mm
Unite.AI를 Google의 선호 소스에 추가

중국과 영국의 연구 협력으로 비디오에서 얼굴을 재구성하는 새로운 방법이 개발되었습니다. 이 기술은 얼굴 구조의 확장과 축소를 가능하게 하며, 일관성과 아티팩트가 없습니다.

유튜브 비디오에서 사용된 소스 자료로 연구자들이 사용한 여배우 제니퍼 로렌스(Jennifer Lawrence)의 얼굴을 더 가늘게 만든 모습입니다. 아래에 첨부된 비디오를 참고하시면 더 많은 예시를 볼 수 있습니다.

유튜브 비디오에서 사용된 소스 자료로 연구자들이 사용한 여배우 제니퍼 로렌스(Jennifer Lawrence)의 얼굴을 더 가늘게 만든 모습입니다. Source: https://www.youtube.com/watch?v=tA2BxvrKvjE

이러한 종류의 변형은 일반적으로 전통적인 CGI 방법을 통해 가능합니다. 그러나 이 방법은 자세한 모션 캡처, 리깅 및 텍스처링 절차를 통해 얼굴을 완전히 재구성해야 합니다.

대신, 이 기술은 신경망 파이프라인에 3D 파라메트릭 얼굴 정보를 통합하여 머신 러닝 워크플로우의 기초로 사용합니다.

전통적인 파라메트릭 얼굴은 점점 더 변형 프로세스에서 가이드라인으로 사용되고 있습니다. Source: https://arxiv.org/pdf/2205.02538.pdf

전통적인 파라메트릭 얼굴은 점점 더 변형 프로세스에서 가이드라인으로 사용되고 있습니다. Source: https://arxiv.org/pdf/2205.02538.pdf

연구자들은 다음과 같이 말합니다:

‘우리의 목표는 자연界에서 얼굴 변형을 편집하여 고품질의 초상화 비디오를 생성하는 것입니다. 이것은 미화 또는 비주얼 이펙트를 위한 얼굴 과장과 같은 응용 프로그램에 사용할 수 있습니다.’

2D 얼굴 워핑과 왜곡은 포토샵의 등장 이후로 소비자에게 가능해졌습니다. 그러나 비디오에서 CGI를 사용하지 않고 이러한 기술을 적용하는 것은 어려운 일입니다.

마크 저커버그의 치수 확장 및 축소

마크 저커버그의 치수 확장 및 축소

현재 컴퓨터 비전 분야에서 몸체 재구성은 관심을 끌고 있는 분야입니다. 이는 패션 이커머스에서 잠재력이 있기 때문입니다. 그러나 누군가를 더 키우거나 더 마른 몸으로 나타내는 것은 현재 어려운 과제입니다.

이전 연구에서는 비디오 출력에서 일관성과 아티팩트가 없는 얼굴 변형을 달성하기 위해 많은 노력을 기울였습니다. 그러나 이러한 구현은 아티팩트와 다른 제한으로 인해 어려움을 겪었습니다. 새로운 시스템은 이러한 이전 연구의 능력을 정적에서 비디오 출력으로 확장합니다.

새로운 시스템은 데스크톱 PC에서 훈련되었으며, AMD Ryzen 9 3950X와 32GB의 메모리를 사용합니다. 또한 옵티컬 플로우 알고리즘과 구조 플로우 프레임워크를 사용하여 모션 맵을 생성합니다. 또한 얼굴 정렬 네트워크(FAN) 구성 요소를 사용하여 랜드마크를 추정합니다.

새로운 시스템에서 얼굴 확장의 극단적인 예

새로운 시스템에서 얼굴 확장의 극단적인 예

연구 논문은 Parametric Reshaping of Portraits in Videos라는 제목으로, 浙江大学의 세 명의 연구자와 바스大学의 한 명의 연구자가 참여했습니다.

얼굴에 관하여

새로운 시스템에서 비디오는 이미지 시퀀스로 추출되며, 각 얼굴에 대해剛性 포즈가 먼저 추정됩니다. 그런 다음 일련의 프레임이 공동으로 추정되어 전체 이미지의 일관된 아이덴티티 매개변수를 구성합니다.

얼굴 워핑 시스템의 아키텍처 플로우

얼굴 워핑 시스템의 아키텍처 플로우

그런 다음 표현이 평가되어 재구성 매개변수가 생성됩니다. 다음으로 새로운 서명된 거리 함수(SDF) 접근 방식이 얼굴의 선명한 2D 매핑을 생성합니다.

마지막으로 출력 비디오에서 콘텐츠 인식 워핑 최적화를 수행합니다.

파라메트릭 얼굴

이 프로세스는 3D 모르펠러블 페이스 모델(3DMM)을 사용합니다. 이는 점점 더 인기를 얻고 있는 신경망 및 GAN 기반 얼굴 합성 시스템의 보조입니다. 또한 딥페이크 감지 시스템에서도 적용할 수 있습니다.

3D 모르펠러블 페이스 모델(3DMM) - 새로운 프로젝트에서 사용된 파라메트릭 프로토타입 얼굴

3D 모르펠러블 페이스 모델(3DMM) – 새로운 프로젝트에서 사용된 파라메트릭 프로토타입 얼굴 Source: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

새로운 시스템은 경우에 따라 가려짐(occlusion)을 고려해야 합니다. 예를 들어, 주제가 다른 방향을看着 있을 때입니다. 이는 딥페이크 소프트웨어에서 가장 큰 도전 중 하나입니다. FAN 랜드마크는 이러한 경우를 고려할 수 있는 능력이 부족하며, 얼굴이 다른 방향을看着거나 가려질 때 품질이 저하됩니다.

새로운 시스템은 3D 얼굴(3DMM)과 2D 얼굴(FAN 랜드마크) 사이의 경계를 일치시키는 컨투어 에너지를 정의함으로써 이러한 문제를 피할 수 있습니다.

최적화

이 시스템의 유용한 배포는 실시간 변형을 구현하는 것입니다. 예를 들어, 비디오 채팅 필터에서 사용할 수 있습니다. 현재 프레임워크는 이를 허용하지 않으며, 필요한 컴퓨팅 리소스는 실시간 변형을 어려운 과제로 만들 것입니다.

논문에 따르면, 24fps 비디오를 대상으로 가정할 때, 파이프라인의 프레임당 작업은 16.344초의 대기 시간을 나타냅니다. 또한 일회성 작업으로 아이덴티티 추정과 3D 얼굴 변형(321ms 및 160ms)에 대한 추가적인 비용이 있습니다.

따라서 최적화는 대기 시간을 줄이는 데 중요합니다. 모든 프레임에 대한 공동 최적화는 과도한 오버헤드를 추가할 수 있으며, 초기 최적화(첫 번째 프레임의 일관된 이후 아이덴티티를 가정)는 비정상성을 유발할 수 있습니다. 따라서 연구자들은 실제 간격에서 샘플링된 프레임의 하위 집합에서 계수를 계산하는 희소 스키마를 채택했습니다.

그런 다음 이 하위 집합의 프레임에서 공동 최적화를 수행하여 더 가벼운 재구성 프로세스를 수행합니다.

얼굴 워핑

이 프로젝트에서 사용된 워핑 기술은 연구자들의 2020년 연구 Deep Shapely Portraits의 적응입니다.

Deep Shapely Portraits, 2020 ACM 멀티미디어 제출

Deep Shapely Portraits, 2020 ACM 멀티미디어 제출 Source: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

연구자들은 다음과 같이 말합니다:

‘우리는 이 방법을 하나의 단일 이미지에서 전체 이미지 시퀀스로 확장합니다.’

테스트

이 논문은 이전에 비교할 수 있는 자료가 없다고 말합니다. 따라서 연구자들은 정적 이미지에서 워핑된 비디오 출력을 비교했습니다.

새로운 시스템을 정적 이미지와 비교

새로운 시스템을 정적 이미지와 비교

연구자들은 다음과 같이 말합니다:

‘결과는 우리의 접근 방식이 강건하게 일관된 초상화 비디오를 생성할 수 있음을 보여주며, 이미지 기반 방법은 쉽게 눈에 띄는 아티팩트를 유발할 수 있습니다.’

추가 예시는 아래 비디오에서 확인하실 수 있습니다:

 

最初에 게시됨: 2022년 5월 9일. 수정됨: EET 18:00, SDF에서 ‘필드’를 ‘함수’로 교체함.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai