Anderson의 관점

AI로 ‘더 나은’ 몸매 만들기

mm
Unite.AI를 Google의 선호 소스에 추가

Alibaba DAMO 아카데미의 새로운 연구는 신체 이미지 재구성을 자동화하는 AI 기반 워크플로를 제공한다 – 현재 얼굴 기반 조작(딥페이크 및 GAN 기반 얼굴 편집)에 주력하고 있는 컴퓨터 비전 분야에서 드문 시도이다.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

‘result’ 열에 삽입된, 수정할 영역을 정의하는 생성된 주의 맵. 출처: https://arxiv.org/pdf/2203.04670.pdf

연구진의 아키텍처는 스켈레톤 포즈 추정을 사용하여 이미지 합성 및 편집 시스템이 기존 신체 이미지를 개념화하고 매개변수화하는 데 직면하는 높은 복잡성을 해결한다. 이는 실제로 의미 있는 선택적 편집을 가능하게 하는 충분한 세분화 수준을 제공한다.

추정된 스켈레톤 맵은 신체 중 재수정이 필요할 가능성이 높은 부위, 예를 들어 상완 부위에 주의를 집중하고 구분하는 데 도움을 준다.

이 시스템은 궁극적으로 사용자가 전체 신체 또는 반신 사진에서 체중, 근육량, 혹은 체중 분포의 외관을 변경하는 매개변수를 설정할 수 있게 하며, 옷을 입은 부위든 벗은 부위든 임의의 변형을 생성할 수 있다.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

왼쪽: 입력 이미지; 가운데: 파생된 주의 영역의 히트맵; 오른쪽: 변환된 이미지.

이 작업의 동기는 패션부터 잡지 스타일 출력 및 홍보 자료에 이르기까지 다양한 미디어 분야에서 사진작가와 그래픽 아티스트가 수행하던 고된 디지털 조작을 대체할 수 있는 자동화된 워크플로를 개발하는 것이다.

일반적으로 저자들은 이러한 변형이 포토샵 및 기타 전통적인 비트맵 편집기에서 ‘워프’ 기법으로 적용되며, 거의 전적으로 여성 이미지에만 사용된다고 인정한다. 따라서 새로운 프로세스를 지원하기 위해 개발된 맞춤형 데이터셋은 주로 여성 피사체의 사진으로 구성된다:

‘신체 리터칭은 주로 여성에게서 요구되므로, 우리 컬렉션의 대부분은 연령, 인종(아프리카:아시아:코카시안 = 0.33:0.35:0.32), 포즈, 의복의 다양성을 고려한 여성 사진이다.’

논문은 Structure-Aware Flow Generation for Human Body Reshaping이라는 제목이며, Alibaba 글로벌 DAMO 아카데미와 관련된 다섯 명의 저자에 의해 작성되었다.

데이터셋 개발

이미지 합성 및 편집 시스템에서 흔히 그렇듯, 프로젝트의 아키텍처는 맞춤형 훈련 데이터셋을 필요로 했다. 저자들은 스톡 사진 사이트 Unsplash에서 적절한 이미지를 선택해 표준 포토샵 조작을 수행하도록 세 명의 사진작가에게 의뢰했으며, 그 결과 BR-5K*라는 이름의 2K 해상도 5,000장의 고품질 이미지 데이터셋이 만들어졌다.

연구진은 이 데이터셋을 사용한 훈련 목표가 매력도나 이상적인 외모와 같은 일반화된 지표를 생성하는 것이 아니라, 신체 이미지에 대한 전문적인 조작과 연관된 핵심 특징 매핑을 추출하는 것임을 강조한다.

하지만 그들은 이러한 조작이 궁극적으로 ‘실제’에서 사전에 정의된 ‘이상’ 개념으로의 변화를 매핑하는 변형 과정을 반영한다는 점을 인정한다:

‘우리는 세 명의 전문 아티스트에게 포토샵을 사용해 독립적으로 신체를 리터칭하도록 초청했으며, 대중적인 미학에 부합하는 날씬한 몸매를 목표로 하고, 그 중 최상의 결과물을 실제값(ground-truth)으로 선택한다.’

이 프레임워크는 얼굴을 전혀 다루지 않기 때문에, 데이터셋에 포함되기 전에 얼굴 부분을 흐리게 처리했다.

아키텍처 및 핵심 개념

시스템 워크플로는 고해상도 인물 사진을 입력으로 받아 사용 가능한 컴퓨팅 자원에 맞게 낮은 해상도로 다운샘플링하고, 추정된 스켈레톤 맵 포즈(아래 이미지에서 왼쪽에서 두 번째 그림)와 Part Affinity Fields(PAFs)를 추출하는 과정을 포함한다. PAF는 2016년 카네기 멜론 대학 로보틱스 연구소에서 혁신되었다(아래 직접 삽입된 동영상 참조).

Part Affinity Fields는 사지의 방향성을 정의하고 전체 스켈레톤 구조와의 일반적인 연관성을 파악하는 데 도움을 주어, 새로운 프로젝트에 추가적인 주의/위치 지정 도구를 제공한다.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

2016년 Part Affinity Fields 논문에서 예측된 PAF는 사지의 일반적인 위치를 포함하는 2D 벡터의 일부로 사지 방향성을 인코딩한다. 출처: https://arxiv.org/pdf/1611.08050.pdf

무게 외관과는 직접적인 연관성이 없어 보이지만, 스켈레톤 맵은 상완, 엉덩이, 허벅지와 같이 수정이 필요한 신체 부위에 최종 변형 과정을 안내하는 데 유용하다.

이후 결과는 프로세스의 중앙 병목인 Structure Affinity Self-Attention(SASA) 모듈에 전달된다(아래 이미지 참고).

SASA는 프로세스를 구동하는 흐름 생성기의 일관성을 조절하며, 그 결과는 이미지 위에서 오른쪽에서 두 번째에 위치한 워핑 모듈에 전달된다. 워핑 모듈은 데이터셋에 포함된 수동 수정으로 학습된 변형을 적용한다.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Structure Affinity Self-Attention(SASA) 모듈은 관련 신체 부위에 주의를 할당하여 불필요하거나 관련 없는 변형을 방지한다.

출력 이미지는 이후 원래 2K 해상도로 업샘플링되며, 이는 DeepFaceLab 등에서 파생된 2017년식 표준 딥페이크 아키텍처와 유사한 과정을 사용한다; 업샘플링 과정은 GAN 편집 프레임워크에서도 일반적이다.

스키마에 대한 주의 네트워크는 Compositional De-Attention Networks(CODA)를 모델로 하며, 이는 2019년 미국/싱가포르 학술 협력으로 Amazon (AMZN ) AI와 Microsoft가 참여했다.

테스트

이 흐름 기반 프레임워크는 기존 흐름 기반 방법인 FAL 및 Animating Through Warping(ATW)과 이미지 변환 아키텍처인 Pix2PixHD와 GFLA에 대해 SSIM, PSNR 및 LPIPS를 평가 지표로 사용하여 테스트되었다.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

초기 테스트 결과(헤더의 화살표 방향은 낮은 수치가 좋은지 높은 수치가 좋은지를 나타냄).

채택된 지표에 따르면, 저자들의 시스템이 기존 아키텍처보다 우수한 성능을 보인다.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

선택된 결과. 더 높은 해상도의 비교를 위해 이 기사에 링크된 원본 PDF를 참고하십시오.

자동화된 지표 외에도, 연구진은 사용자 연구를 수행했으며(앞서 그림된 결과 표의 최종 열), 40명의 참가자에게 다양한 방법으로 생성된 이미지와 관련된 100문제 풀 중 무작위로 선택된 30문제를 제시했다. 응답자의 70%가 새로운 기법을 더 ‘시각적으로 매력적’이라고 평가했다.

도전 과제

이 새로운 논문은 AI 기반 신체 조작이라는 드문 분야에 대한 탐구를 나타낸다. 현재 이미지 합성 분야는 편집 가능한 신체를 생성하는 Neural Radiance Fields(NeRF)와 같은 방법에 더 관심이 있거나, GAN의 잠재 공간 및 얼굴 조작을 위한 오토인코더 가능성 탐구에 집중하고 있다.

저자들의 시도는 현재 인식된 체중 변화 생성에 국한되어 있으며, 인물 사진을 슬림하게 만들 때 필연적으로 드러나는 배경을 복원하는 인페인팅 기술은 구현되지 않았다.

하지만 그들은 텍스처 추론을 통한 인물 매팅 및 배경 블렌딩이 인간의 ‘불완전성’으로 인해 이미지에서 가려졌던 배경을 복원하는 문제를 간단히 해결할 수 있다고 제안한다.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

AI 기반 지방 감소로 드러난 배경을 복원하기 위한 제안된 솔루션.

 

* 사전 인쇄본은 데이터셋에 대한 자세한 내용과 프로젝트의 추가 예시를 제공하는 보조 자료를 언급하지만, 해당 자료의 위치는 논문에 제공되지 않았으며, 교신 저자는 아직 접근 요청에 응답하지 않았다.

2022년 3월 10일 최초 게시.

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai