Anderson의 관점
전체 몸 深度 가짜를 여러 개의 NeRF를 결합하여 생성

이미지 합성 연구 분야는 새로운 시스템을 제안하여 젊은 사람들, 주로 젊은 여성들을 다양한 의류에서 전체 몸 비디오와 사진을 생성할 수 있는NewProposals로 가득 차 있습니다. 대부분 생성된 이미지들은 정적입니다. 가끔씩, 표현은 움직이지만, 일반적으로 잘 작동하지 않습니다.
이 연구 분야의 진행 속도는 관련 분야인 잠재 확산 모델과 같은 현재의 황당한 진행 속도와 비교하여 느립니다. 그러나 대부분이 아시아에 있는 연구 그룹은 끊임없이 문제를 해결하기 위해 노력하고 있습니다.

過去 10-15 년 동안 제안되거나 부분적으로 출시된 ‘가상 시도’ 시스템 중 하나입니다. 여기서 몸은 기계 학습 기반 객체 인식으로 평가되고 제안된 의류 항목에 적응됩니다. 출처: https://www.youtube.com/watch?v=2ZXrgGyhbak
목표는 패션 및 의류 시장에서 ‘가상 시도’를 가능하게 하는 새로운 시스템을 생성하는 것입니다. 이러한 시스템은 현재 사용 가능한 제품 또는 곧 출시될 제품과 고객에게 적응할 수 있어야 합니다. 또한 실시간 _superimposition of clothing의 클럽이나 고객에게 약간의 NSFW 사진을 보내기를 위한 ML 기반 렌더링 파이프라인의 필요성 없이 작동해야 합니다.
… (중략)
EVA3D
그러나 최근에 제안된 접근 방식은 관심을 끌었습니다. 싱가포르 난양 기술 대학의 EVA3D는 오랜 시간 동안 오지 않았던 접근 방식을 처음으로 제시했습니다. 즉, 여러 개의 신경 복사 필드 네트워크를 사용하여 각 네트워크가 몸의 별도 부분을 담당하도록 합니다.

EVA3D를 위한 여러 개의 NeRF 네트워크에서 구성된 이동하는 젊은 여성입니다. 출처: https://hongfz16.github.io/projects/EVA3D.html
결과는… 괜찮습니다. EVA3D의 시각화는 불쾌한 계곡 밖으로 나가지 못하지만, 적어도 계곡의 출구를 볼 수 있습니다.

EVA3D가 두드러지는 이유는 이 분야에서 거의 유일하게 연구자들이 단일 네트워크(GAN, NeRF 또는 기타)는 편집 가능한 유연한 전체 몸 생성을 처리할 수 없다는 것을 깨달았기 때문입니다. 이는 연구의 속도와 하드웨어 및 기타 로지스틱한 제한으로 인한 것입니다.
따라서 난양 팀은 16개의 네트워크와 여러 기술을 사용하여 작업을 분할했습니다. 이는 이미 도시 환경의 신경 렌더링을 위한 Block-NeRF와 CityNeRF에서 채택된 접근 방식입니다. 이는 향후 5년 동안 전체 몸 深度 가짜를 달성하기 위한 유용한 절충안이 될 수 있습니다.
… (중략)
Method
EVA3D에서 사용되는 SMPL 모델은 사람의 ‘이전’에 맞춰져 있으며, 본질적으로 EVA3D에 의해 자발적으로 深度 가짜 처리되는 사람입니다. SMPL의 스키닝 가중치는 표준 공간(즉, SMPL 모델의 ‘휴식’ 또는 ‘중립’ 姿勢)과 최종 외모가 렌더링되는 방식 사이의 차이를 협상합니다.
위의 일러스트레이션에서 볼 수 있듯이, SMPL의 경계 상자는 16개의 네트워크가 몸체를 구성하기 위한 경계 정의로 사용됩니다. SMPL의 역 Linear Blend Skinning(LBS) 알고리즘은 가시적으로 샘플링된 레이들을 표준 공간(수동 姿勢)으로 전송하는 데 사용됩니다. 그런 다음 16개의 하위 네트워크는 이러한 구성에 따라 쿼리되고 궁극적으로 최종 렌더링으로 구성됩니다.
전체 NeRF 컴포지트는 3D 인간 GAN 프레임워크를 구성하는 데 사용됩니다.
Data, Training, and Tests
EVA3D는 패션 기반 데이터셋에서 사용 가능한 姿勢가 제한적이고 템플릿화되어 있기 때문에 비정상적인 데이터 문제에 직면합니다. 이러한 데이터셋은 대체 또는 새로운 뷰가 부족하며, 의류에 대한 주목을 끌기 위해 의도적으로 반복적입니다.
이 姿勢 분포 불균형으로 인해 EVA3D는 SMPL 템플릿 기하학에서 기반한 사람의 이전을 사용하고, 표적 姿勢가 아닌 이 姿勢의 Signed Distance Field(SDF) 오프셋을 예측합니다.
지원 실험을 위해 연구자들은 네 가지 데이터셋을 사용했습니다: DeepFashion; SHHQ; UBCFashion; 및 AIST Dance Video Database(AIST Dance DB).
후자의 두 데이터셋은 첫 번째 두 데이터셋보다 더 다양한 姿勢를 포함하지만, 동일한 개인을 반복적으로 나타내므로 이 다양성은 취소됩니다. 즉, 데이터는 과제가 주어졌을 때 매우 도전적입니다.

SSHQ의 예입니다. 출처: https://arxiv.org/pdf/2204.11823.pdf
기반선은 ENARF-GAN, 2D 이미지 데이터셋에서 NeRF 시각화를 렌더링하는 첫 번째 프로젝트; 스탠퍼드와 NVIDIA (NVDA ) 의 EG3D; 및 StyleSDF, 워싱턴 대학교, Adobe (ADBE ) Research 및 스탠퍼드 대학교의 협력; 모두 고해상도에 확대하기 위해 슈퍼 해상도 라이브러리가 필요한 방법입니다.
採用된 지표는 논란의 Frechet Inception Distance(FID)와 Kernel Inception Distance(KID)였으며, Percentage of Correct Keypoints(PCKh@0.5)도 포함되었습니다.
수량적 평가에서 EVA3D는 네 가지 데이터셋에서 모든 지표에서最高의 성과를 보였습니다.

수량적 결과입니다.
연구자들은 EVA3D가 기하학 렌더링에서 최저 오류율을 달성한다는 것을 관찰했습니다. 이는 이러한 프로젝트에서 중요한 요소입니다. 또한 시스템이 생성된 姿勢를 제어하고 EG3D와 비교하여 더 높은 PCKh@0.5 점수를 달성할 수 있다고 주장합니다.
EVA3D는 기본적으로 512x512px 해상도에서 작동하지만, Google이 최근에 발표한 1024 해상도 텍스트-비디오 오퍼링 Imagen Video와 같이 업스케일 레이어를 쌓음으로써 쉽게 HD 해상도로 업스케일할 수 있습니다.
이 방법에는 제한이 있습니다. 논문은 SIREN 활성화가 원형 아티팩트를 유발할 수 있으며, 이는 EG3D와 같은 대체 기본 표현과 2D 디코더의 조합을 사용하여 향후 버전에서 해결될 수 있다고 지적합니다. 또한, SMPL을 패션 데이터 소스에 정확하게 맞추는 것이 어렵습니다.
마지막으로, 시스템은 쉽게 더 큰 유체 항목, 예를 들어 큰 드레스와 같은 의류를 수용할 수 없습니다. 이러한 유형의 의류는 신경망 렌더링된 머리카락을 생성하는 것과 같은 유체 역학을 나타내므로, 적절한 해결책이 이러한 문제를 해결하는 데 도움이 될 것입니다.
最初에 2022년 10월 12일에 게시되었습니다.














