Anderson의 관점

틱톡 개발자, 증강 현실 애플리케이션을 위한 얼굴 지우기

mm
Unite.AI를 Google의 선호 소스에 추가

중국 다국적 인터넷 회사 바이트댄스(Bytedance)는 틱톡(TikTok)의 뒤를 잇는 회사로, 영상에서 얼굴을 지워서 पहच别 왜곡이나 다른 이상한 효과를 사람들에게 증강 현실 애플리케이션에서 부여할 수 있는 새로운 방법을 개발했습니다. 이 회사는 이 기술이 이미 상업용 모바일 제품에 통합되었다고 주장하지만, 어떤 제품인지 밝히지 않았습니다.

영상에서 얼굴을 ‘제로’하면, 충격적인 왜곡과 다른 身分을 겹쳐놓을 수 있는 충분한 ‘얼굴 캔버스’가 있습니다. 바이트댄스 연구자들이 제공한 새로운 논문에 포함된 예제는 이러한 가능성을 보여주며, 다양한 코믹하고(그리고 일부 괴상한) 구성으로 ‘지워진’ 특징을 복원하는 것을 포함합니다:

바이트댄스 논문에 포함된 얼굴 재구성의 몇 가지 가능성. 출처: https://arxiv.org/pdf/2109.10760.pdf

바이트댄스 논문에 포함된 얼굴 재구성의 몇 가지 가능성. 출처: https://arxiv.org/pdf/2109.10760.pdf

8월 말, 틱톡은 자체 증강 현실 개발 플랫폼인 틱톡 이펙트 스튜디오(TikTok Effect Studio)를 출시했으며, 현재 클로즈드 베타 테스트 중입니다. 이 플랫폼을 통해 개발자들은 틱톡 콘텐츠 스트림을 위한 증강 현실 효과를 만들 수 있습니다.

실제로, 이 회사는 페이스북의 AR 스튜디오와 스냅의 AR 플랫폼과 유사한 개발자 커뮤니티를 따라가고 있으며, 애플의 유명한 AR 연구 개발 커뮤니티도 곧 새로운 하드웨어로 가동될 예정입니다.

빈 얼굴

논문은 FaceEraser: 증강 현실을 위한 얼굴 부분 제거라는 제목으로, 기존의 인페인팅/인필 알고리즘은 영상의 일부가 잘린 경우나 부분적으로 가려진 경우에 대한 완성을 위해 더 적합하다고 설명합니다. 또한 이러한 ‘블랭킹’ 절차를 수행하기 위한 기존 데이터셋이 매우 부족하다고 언급합니다.

연구자들은 기존의 뉴럴 인페인팅 모델에superimposed 될 수 있는 새로운 네트워크 아키텍처인 픽셀 클론을 만들었습니다. 이 아키텍처는 텍스처와 색상 일관성과 관련된 문제를 해결하며, 이전 방법들(예: StructureFlow, EdgeConnect)에서 나타나는 문제를 개선합니다.

새로운 파이프라인의 픽셀 클론의 일반적인 워크플로

새로운 파이프라인의 픽셀 클론의 일반적인 워크플로

모델을 ‘빈’ 얼굴로 훈련시키기 위해, 연구자들은 안경이나 머리카락이 이마를 가리는 이미지들을 제외했습니다. 일반적으로 이마와 눈썹 사이의 영역은 얼굴의 중앙 특징을 위해 ‘붙여넣기’할 수 있는 가장 큰 픽셀 그룹입니다.

훈련 이미지 준비. 이마 영역을 잘라내고, 얼굴 정렬 인식의 주요 점에 따라 수직으로 뒤집고, 이어붙입니다.

훈련 이미지 준비. 이마 영역을 잘라내고, 얼굴 정렬 인식의 주요 점에 따라 수직으로 뒤집고, 이어붙입니다.

256×256 픽셀 이미지로, 뉴럴 네트워크의 잠재 공간에 충분히 큰 배치로 입력할 수 있는 작은 크기입니다. 이후 알고리즘 업스케일링으로 증강 현실 공간에서 작업에 필요한 해상도를 복원할 수 있습니다.

아키텍처

네트워크는 내부에 세 개의 네트워크로 구성되어 있습니다. 에지 완성, 픽셀 클론, 그리고 정련 네트워크입니다. 에지 완성 네트워크는 에지 커넥트(위 참조)와 두 개의 가장 인기 있는 딥페이크 애플리케이션에서 사용된 인코더-디코더 아키텍처를 사용합니다. 인코더는 이미지 내용을 두 번 다운샘플링하고, 디코더는 원래 이미지 차원을 복원합니다.

픽셀 클론은 수정된 인코더-디코더 방법론을 사용하며, 정련 레이어는 U-Net 아키텍처를 사용합니다. 이는 원래 생물 의학 이미징을 위해 개발된 기술로, 이미지 합성 연구 프로젝트에서 자주 사용됩니다.

훈련 워크플로에서, 변형의 정확성을 평가하고, 필요에 따라 반복적으로 시도하여 수렴할 때까지 반복해야 합니다. 이를 위해 패치GAN을 기반으로 하는 두 개의 판별기가 사용되며, 각 판별기는 70×70 픽셀 패치의 현실성을 평가하고, 전체 이미지의 현실성 값을 할인합니다.

훈련 및 데이터

에지 완성 네트워크는 처음에 독립적으로 훈련되며, 다른 두 개의 네트워크는 에지 완성 훈련에서 얻어진 가중치를 기반으로 함께 훈련됩니다. 이 가중치는 이 절차 동안 고정되고 동결됩니다.

논문은 명시적으로 최종 특징 왜곡의 예제가 모델의 주요 목적이 아니라고 말하지만, 시스템의 내구성을 테스트하기 위해 다양한 코믹 효과를 구현합니다. 이는 눈썹 제거, 입 크기 증가, 하위 얼굴 축소, ‘툰화’ 효과(위의 이전 이미지 참조)를 포함합니다.

논문은 ‘지워진 얼굴이 사용자 지정 요소를 배치해야 하는 다양한 증강 현실 애플리케이션을 가능하게 합니다’라고 주장하며, 사용자 지정 요소를脸에 맞춤형으로 사용할 수 있는 가능성을 나타냅니다.

모델은 NVIDIA가 만든 FFHQ 데이터셋의 마스크로 훈련되며, 이는 다양한 연령, 민족, 조명, 그리고 얼굴 姿勢와 스타일을 포함하여 유용한 일반화를 달성할 수 있습니다. 데이터셋에는 35,000개의 이미지와 10,000개의 훈련 마스크가 포함되어 있으며, 4,000개의 이미지와 1,000개의 마스크는 검증 목적으로 사용됩니다.

훈련 데이터 샘플

훈련 데이터 샘플

훈련된 모델은 2017年的 CelebA-HQ와 VoxCeleb의 데이터에서 추론을 수행할 수 있으며, FFHQ의 보이지 않는 얼굴과 다른 보이지 않는 얼굴에서도 작동합니다. 256×256 픽셀 이미지들은 8개의 배치로 아담 옵티마이저를 사용하여 파이토치에서 훈련되었으며, 테슬라 V100 GPU에서 ‘2000,000 에포크’ 동안 실행되었습니다.

(TSLA )
실제 얼굴에서 얻은 추론 결과

실제 얼굴에서 얻은 추론 결과

증강 현실 기반 이미지 합성 연구에서 흔히 볼 수 있는 것처럼, 시스템은 머리카락, 주변 기기, 안경, 그리고 얼굴毛과 같은 장애물이나 가리개로 인해 발생하는 간헐적인 실패와 맞서야 합니다.

보고서는 다음과 같이 결론을 내립니다.

‘우리의 접근 방식은 상업화되었으며, 제한 없는 사용자 입력을 위한 제품에서 잘 작동합니다.’

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai