Anderson의 관점

어도비 리서치, 디센트글드 GAN 페이스 에디팅 확장

mm
Unite.AI를 Google의 선호 소스에 추가

이미지 합성에서 엔트윈먼트(entanglement)가 문제라는 것을 이해하기는 어렵지 않다. 예를 들어, 카레에서 커리粉을 제거하는 것은 버거에서 피클을 제거하는 것보다 훨씬 어렵고, 커피를 데스윈팅하는 것은 거의 불가능하다. 어떤 것들은 그냥 함께 묶여 있다.

同様하게, 엔트윈먼트는 이상적으로 다양한 특징과 개념을 분리하여 기계 학습을 사용하여 얼굴(또는 개, 보트 등)을 생성하거나 편집하는 이미지 합성 아키텍처에 대한 장애물이다.

만약 나이, 성별, 머리 색상, 피부 톤, 감정 등과 같은 다양한 특성을 분리할 수 있다면, 진정한 기구성과 유연성을 가진 프레임워크를 시작할 수 있을 것이다. 이는 얼굴 이미지의真正한粒度에서 생성하고 편집할 수 있게 해주며, 원치 않는 ‘승객들’을 이러한 변환에 끌어들이지 않는다.

최대 엔트윈먼트(위쪽 왼쪽)에서는 학습된 GAN 네트워크의 이미지만 다른 사람의 이미지로 변경할 수 있다.

이는 효과적으로 최신 AI 컴퓨터 비전 기술을 사용하여 30년 전 다른 수단으로 해결된 것을 달성하는 것이다.

일정 정도의 분리(‘중간 분리’ 위의 이전 이미지)가 가능하면, 헤어 색상, 표현, 화장, 제한된 헤드 회전 등과 같은 스타일 기반의 변경을 수행할 수 있다.

FEAT: Face Editing with Attention, Feb 2022, https://arxiv.org/pdf/2202.02713.pdf

출처: FEAT: Face Editing with Attention, 2022년 2월, https://arxiv.org/pdf/2202.02713.pdf

최근 2년 동안 상호작용 얼굴 편집 환경을 생성하여 사용자가 슬라이더와 전통적인 UI 상호작용을 사용하여 얼굴 특성을 변경할 수 있도록 하는 시도가 여러 번 있었다. 그러나 이것은 GAN의 잠재 공간에서 특징/스타일 엔트윈먼트로 인해 도전이 되었다.

예를 들어, ‘안경’ 특성은 종종 ‘나이’ 특성과 얽혀 있다. 즉, 안경을 추가하면 얼굴을 ‘나이’를 들 수 있고, 얼굴을 나이를 들게 하면 안경을 추가할 수 있다. 이는 적용된 분리의 정도에 따라 다르다(아래 ‘테스트’ 참조).

가장 주목할 만한 것은 머리 색상과 다른 머리 요소를 변경하는 것이 거의 불가능했다. 이는 머리 스트랜드와 배치가 재계산되어 ‘시즈닝’ 효과를 줄 수 있다.

InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

출처: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

잠재 공간에서 잠재 공간으로의 GAN 트래버설

새로운 어도비 주도 논문은 WACV 2022에 제출되어 이러한 기본 문제에 대한 새로운 접근 방식을 제공한다. 이 논문은 StyleGAN 생성 이미지에서 여러 얼굴 속성을 편집하기 위한 학습된 매퍼를 제시한다.

기반 특성은 무시되고 변경되지 않는다. 자세한 내용과 더 높은 해상도의 예제는 아래의 비디오를 참조하십시오. 출처: https://www.youtube.com/watch?v=rf_61llRH0Q

기반 특성은 무시되고 변경되지 않는다. 자세한 내용과 더 높은 해상도의 예제는 아래의 비디오를 참조하십시오. 출처: https://www.youtube.com/watch?v=rf_61llRH0Q

이 논문은 어도비의 Applied Scientist Siavash Khodadadeh와 다른 4명의 어도비 연구원, 그리고 플로리다 중부 대학의 컴퓨터 과학부 연구원에 의해 수행되었다.

이 논문은 어도비가 이미 이 분야에서 오랜 시간 동안 연구를 해왔기 때문에 흥미롭다. 또한 이 프로젝트를 위한 아키텍처는 GAN 얼굴 편집기에서 시각적 무결성을 유지하는 데 다른 접근 방식을 사용한다.

저자들은 다음과 같이 말한다:

‘우리는 잠재 공간에서 잠재 공간으로의 변환을 수행하는 신경망을 훈련시킵니다. 이 기술은 일회성이며, 속성의渐进적인 변화를 위한 선형 또는 비선형 트라젝토리를 필요로 하지 않습니다.

‘전체 생성 파이프라인을 통해 네트워크를 끝까지 훈련함으로써, 시스템은 오프-더-쉘프 제너레이터 아키텍처의 잠재 공간에 적응할 수 있습니다. 동일성과 같은 보존 속성은 훈련 손실의 형태로 인코딩될 수 있습니다.

‘한 번 훈련된 잠재 공간에서 잠재 공간으로의 네트워크는 재훈련 없이 임의의 이미지에 재사용할 수 있습니다.’

이 마지막 부분은 제안된 아키텍처가 최종 사용자에게 완성된 상태로 도착한다는 것을 의미한다. 여전히 로컬 리소스에서 신경망을 실행해야 하지만, 새로운 이미지는 거의 즉시 변경할 준비가 될 수 있다. 이는 프레임워크가 충분히 분리되어 이미지별 추가 훈련을 필요로 하지 않기 때문이다.

성별과 수염이 변경된다. 자세한 내용과 더 높은 해상도의 예제는 아래의 비디오를 참조하십시오.

성별과 수염이 변경된다. 자세한 내용과 더 높은 해상도의 예제는 아래의 비디오를 참조하십시오.

이 연구의 주요 성과 중 하나는 네트워크가 잠재 공간에서 동일성을 ‘동결’할 수 있는 능력이다. 이는 대상 벡터에서 속성만 변경하고, 변환되는 동일성을 보존하는 ‘수정 용어’를 제공한다.

본질적으로, 제안된 네트워크는 처리된 요소를 모두 오케스트레이팅하는 더广い 아키텍처에 내장되어 있다. 이는 프리트레인된 구성 요소와 동결된 가중치를 통과하며, 변환에서 원치 않는 측면 효과를 생성하지 않는다.

훈련 과정은 트리플렛을 사용하며, 이는 시드 이미지(GAN 반전을 통해) 또는 기존 초기 잠재 인코딩에 의해 생성될 수 있다. 따라서 전체 훈련 과정은 무감독이며, 이러한 시스템에서 사용되는 범위의 라벨링 및 큐레이션 시스템의 묵시적 동작이 아키텍처에 효과적으로 내장되어 있다. 실제로, 새로운 시스템은 오프-더-쉘프 속성 회귀를 사용한다:

‘우리의 네트워크가 독립적으로 제어할 수 있는 속성의 수는 인식기(들)의 능력에만 제한된다. 인식기가 있는 경우, 우리는 임의의 얼굴에 속성을 추가할 수 있다. 우리의 실험에서, 우리는 35개의 다른 얼굴 속성을 조정할 수 있는 잠재 공간에서 잠재 공간으로의 네트워크를 훈련시켰다. 이는 이전 접근 방식보다 더 많다.’

시스템에는 원치 않는 ‘부작용’ 변환에 대한 추가적인 안전 장치가 있다. 속성 변경을 요청하지 않는 경우, 잠재 공간에서 잠재 공간으로의 네트워크는 잠재 벡터를 자신에게 매핑하여 대상 동일성의 안정적인 지속성을さらに 증가시킨다.

얼굴 인식

최근 몇 년 동안 GAN 및 인코더/디코더 기반 얼굴 편집기에 대한 반복되는 문제 중 하나는 적용된 변형이 닮은 정도를 저하시킨다는 것이다. 이를 극복하기 위해 어도비 프로젝트는 FaceNet이라는 임베디드 얼굴 인식 네트워크를 사용한다.

프로젝트 아키텍처, FaceNet 포함

프로젝트 아키텍처, FaceNet 포함

(개인적인 관점에서, 이는 표준 얼굴 식별 및 표현 인식 시스템을 생성 네트워크에 통합하는 방향으로 나아가는 것을 권장한다. 이는 현재 глуб페이크 아키텍처에서 표현 신실도와 다른 중요한 영역을 희생하여 지배하는 블라인드 픽셀-픽셀 매핑을 극복하는 최선의 방법이다.)

잠재 공간에서 모든 영역에 접근

이 프레임워크의 또 다른 인상적인 기능은 사용자가 임의로 잠재 공간의 변환 사이를 여행할 수 있는 능력이다. 이전 시스템은 사용자가 선형 또는 규정된 경험을 제공하는 고정된 특징 변환 타임라인 사이를 ‘스크럽’하는 것만 허용했다.

잠재 공간 탐색

잠재 공간 탐색

사용자는 또한 변환 과정 중에 보존하고 싶은 요소를 수동으로 ‘동결’할 수 있다. 이를 통해 사용자는 배경이 이동하지 않거나 눈이 열려 있거나 닫혀 있는 것을 보장할 수 있다.

데이터

속성 회귀 네트워크는 세 가지 네트워크에서 훈련되었다: FFHQ, CelebAMask-HQ, StyleGAN-V2의 Z 공간에서 샘플링된 400,000개의 벡터로 얻은 로컬 GAN 생성 네트워크.

OOD 이미지는 필터링되었으며, Microsoft의 Face API를 사용하여 속성이 추출되었으며, 결과 이미지 세트는 90/10으로 분할되어 721,218개의 훈련 이미지와 72,172개의 테스트 이미지로 비교되었다.

테스트

실험 네트워크는 초기에 35개의 잠재적인 변환을 수용하도록 구성되었지만, 비교 가능한 프레임워크인 InterFaceGAN, GANSpace, StyleFlow와의 테스트를 수행하기 위해 8개로 줄었다.

8개의 선택된 속성은 나이, 대머리, 수염, 표현, 성별, 안경, 피치, 요였다. 일부 속성(예: InterFaceGAN에 대머리와 수염 추가)은 원래 배포에서 제공되지 않았으므로 경쟁 프레임워크를 다시 구성해야 했다.

예상대로, 라이벌 아키텍처에서 더 높은 수준의 엔트윈먼트가 발생했다. 예를 들어, 한 테스트에서 InterFaceGAN과 StyleFlow는 나이를 적용했을 때 주제의 성별을 변경했다.

두 개의 경쟁 프레임워크는 나이 변환에 성별 변경을 롤아웃했다.

두 개의 경쟁 프레임워크는 나이 변환에 성별 변경을 롤아웃했다.

또한, 두 개의 라이벌은 안경과 나이가 분리할 수 없는 특성이라고 판단했다.

안경과 헤어 색상 변경

안경과 헤어 색상 변경

연구는 완벽하게 승리하지 못했다. 아래의 비디오를 참조하십시오. 프레임워크는 다양한 각도(요)를 외삽할 때 가장 효과가 없으며, GANSpace는 나이와 안경을 부과하는 것에서 더 나은 결과를 보인다. 잠재 공간에서 잠재 공간으로의 프레임워크는 피치(머리 각도) 추가에서 GANSpace와 StyleFlow와 동률을 이룬다.

MTCNN 얼굴 감지기를 사용하여 계산된 결과. 낮을수록 더 좋다.

MTCNN 얼굴 감지기를 사용하여 계산된 결과. 낮을수록 더 좋다.

자세한 내용과 더 높은 해상도의 예제는 아래의 비디오를 참조하십시오.

 

最初에 게시됨: 2022년 2월 16일.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai