Anderson의 관점
인공지능으로 인간 신체 유형 재구성

중국에서 새로운 연구 협력이 인간 신체를 이미지로 재구성하는 새로운 방법을 제공합니다. 이 방법은 조정된 쌍둥이 신경 인코더 네트워크를 사용하여 사용자가 상호작용 GUI에서 체중, 키, 신체 비율을 조절할 수 있습니다.

파라미터화된 신체 형태 조절, 3개의 기능을 조절하는 슬라이더. 출처: https://arxiv.org/pdf/2203.10496.pdf
이 연구는 알리바바의 최근 유사 프로젝트보다 몇 가지 개선점을 제공합니다. 예를 들어, 체중과 신체 비율뿐만 아니라 키도 조절할 수 있으며, ‘슬림’한 신체 이미지가 나타날 때 배경을 채우는 데 사용되는 전용 신경 네트워크가 있습니다. 또한 2010년에 제안된 이전 파라미터 방법보다 인간의 개입이 적습니다.
신경 리셰퍼(NeuralReshaper)라는 새로운 아키텍처는 파라미터 3D 인간 템플릿을 소스 이미지에 맞추고 템플릿의 왜곡을 사용하여 원본 이미지를 새로운 파라미터에 적응시킵니다.
이 시스템은 의류를 착용한 사람이나 반의류를 착용한 사람의 신체 변형을 모두 처리할 수 있습니다.
이러한 종류의 변형은 현재 패션 AI 연구 분야에서 관심을 끌고 있습니다. StyleGAN/CycleGAN 기반의 플랫폼과 일반 신경 네트워크를 사용하여 가상 시도를 통해 사용자 이미지의 신체 유형과 형태에 맞는 의류를 제공할 수 있습니다.
연구 논문은 Single-image Human-body Reshaping with Deep Neural Networks로 제목이 붙여졌으며, 浙江大学와 홍콩 시티 대학교의 연구자들이 참여했습니다.
SMPL 피팅
신경 리셰퍼는 스킨드 멀티 퍼슨 리니어 모델(SMPL)을 사용합니다. 이 모델은 2015年に 막스 플랑크 지능 시스템 연구소와 Industrial Light & Magic에서 개발되었습니다.

SMPL 파라미터화된 인간 형태, 2015년 플랑크/ILM 협력. 출처: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
프로세스의 첫 번째 단계에서는 소스 이미지에서 SMPL 모델을 생성합니다. 이 모델은 Human Mesh Recovery(HMR) 방법을 사용하여 이미지에 적응시킵니다.
신체의 3개 파라미터(체중, 키, 신체 비율)를 계산하고 카메라 파라미터를 고려합니다. 2D 키포인트와 생성된 실루엣 정렬을 사용하여 변형의 경계를 정의합니다.
3D 변형을 이미지 공간으로 투영하여 밀도 왜곡 필드를 생성합니다. 이 프로세스는 약 30초 정도 소요됩니다.
신경 리셰퍼 아키텍처
신경 리셰퍼는 두 개의 신경 네트워크를 사용합니다. 하나는 전경 인코더로 신체 형태를 변형하고, 다른 하나는 배경 인코더로 배경을 채웁니다.
U-넷 스타일 프레임워크는 두 개의 인코더의 특징을 통합하여 새로운 이미지를 생성합니다. 아키텍처는 통합을 가능하게 하는 새로운 워프 가이드 메커니즘을 특징으로 합니다.
트레이닝 및 실험
신경 리셰퍼는 PyTorch에서 구현되었습니다. 네트워크는 100 에포크 동안 Adam 옵티마이저를 사용하여 훈련되었습니다. 제너레이터의 목표 손실은 0.0001, 디스크리미네이터의 목표 손실은 0.0004로 설정되었습니다. 훈련은 8개의 배치 크기로 진행되었으며, COCO, MPII, LSP 데이터셋을 사용했습니다.
아래는 DeepFashion 데이터셋에서 훈련된 신경 리셰퍼의 일부 예시입니다. 원본 이미지는 항상 왼쪽에 있습니다.
세 가지 속성(체중, 키, 신체 비율)은 분리되어 있으며, 개별적으로 적용할 수 있습니다.
파생된 야외 데이터셋의 변형은 더 어려울 수 있습니다. 배경을 채우고 신체 유형을 변형하는 것이 더 복잡하기 때문입니다.
파라미터 필요성
이 논문은 같은 이미지의 변형이 이미지 합성에서 불완전한 문제를 나타낸다고 지적합니다. 많은 변형 GAN 및 인코더 프레임워크는 페어드 이미지(예: 스케치>사진 및 사진>스케치 변형)를 사용할 수 있습니다.
그러나 이 경우에는 동일한 사람의 다른 물리적 구성의 이미지 페어가 필요합니다(예: 다이어트 또는 성형외과 광고의 ‘전후’ 이미지). 이러한 데이터는 얻거나 생성하기 어렵습니다.
또한 변형 GAN 네트워크는 더 다양한 데이터를 훈련시킬 수 있으며, 원본 이미지의 잠재적 방향과 원하는 클래스(예: ‘fat’, ‘thin’, ‘tall’ 등)를 찾는 것을 통해 변형을 적용할 수 있습니다. 그러나 이 접근 방식은 현재 미세한 신체 재구성을 위해 너무 제한적입니다.
신경 복사 필드(NeRF) 접근 방식은 대부분의 GAN 기반 시스템보다 전체 신체 시뮬레이션에서 더 발전되어 있습니다. 그러나 현재는 신체 유형을 세부적으로 편집하는 능력이 제한적이며, 신경 리셰퍼와 이전 프로젝트가 해결하려고 하는 문제를 해결하기 위해 자원 집중적입니다.
GAN의 잠재적 공간은 어려울 수 있습니다. VAE는 아직 전체 신체 재생산의 복잡성을 다루지 못합니다. NeRF의 신체 유형을 일관되게 재구성하는 능력은 아직 초기 단계에 있습니다. 따라서 ‘전통적인’ CGI 방법론(SMPL 등)의 통합은 인간 이미지 합성 연구 분야에서 계속해서 필요할 것입니다.
이 방법은 특징, 클래스 및 잠재적 코드를 구획하고 집계하는 데 사용되며, 이러한 기술의 매개변수와 활용 가능성은 아직 완전히 이해되지 않았습니다.
최초로 게시된 날짜: 2022년 3월 31일.





















