Anderson의 관점
AI를 통해 체형을 바꾸는 장점

새로운 AI 시스템은 사진에서 사람들의 몸을 현실적으로 바꿀 수 있습니다. 즉, 사람들을 더 뚱뚱하게, 더 말랑말랑하게, 또는 더 근육질하게 만들 수 있습니다. 그리고 얼굴, 옷, 배경은 바뀌지 않습니다. 이 시스템은 완전히 합성된 데이터셋에서 학습되며, 각 身分을 여러 가지 몸 유형으로 표시합니다.
AI를 사용하여 소셜 네트워크에서 체형을 정교하게 하는 것뿐만 아니라 VFX 목적으로 체형을 변경하는 데 사용할 수 있습니다. 또한 기계 학습을 사용하여 개인의 외모를 변경하는 것은 더 중요한 기능을 수행할 수 있습니다. 즉, 식사 장애가 있는 개인이 자신의 외모에 대한 왜곡된 인식을 이해하는 데 도움이 되며, 일반적인 스포츠 및 피트니스 목적으로 동기를 부여하는 데 사용할 수 있습니다.

논문 ‘Body size estimation in women with anorexia nervosa and healthy controls using 3D avatars’에서 제공하는 체형 변경을 시각화하는 GUI. 체형 왜곡증이 있는 개인은 자신의 체형과 유사한 이미지를 연관시키는 데 어려움을 겪을 수 있으며, 이는 임상가에게 체형 왜곡 반응에 대한 지표를 제공합니다. 출처: https://www.nature.com/articles/s41598-017-15339-z.pdf
또한 컴퓨터 비전 연구에서 패션 시연을 위한 하위 분야도 다양한 체형에서 정확한 시각화를 제공하는 데 관심이 있습니다. 한편, 일본 쓰쿠바 대학의 2024년 DiffBody와 같은 프레임워크는 이 분야에서 일부 놀라운 기능을 제공했습니다.

이전의 DiffBody 기술을 사용하여 가능한 일부 변형. 출처: https://arxiv.org/pdf/2401.02804
기존 AI 모델은 일반적으로 매력적이거나 일반적인 체형에 최적화되어 있기 때문에, 비정상적인 크기인 ‘비만’과 같은 체형은 표준 모델에서 거의 사용할 수 없거나 편향된 결과를 나타낼 수 있습니다.
페어 필수사항
체형을 변경하는 AI 시스템을 만들 때 가장 큰 도전은 ‘페어 트레이닝’입니다. 여기서 AI 시스템은 효과적으로 ‘전’과 ‘후’ 이미지를 학습하여 모델이 수행하도록 의도하는 변환을 정의합니다.
이러한 종류의 트레이닝은 Black Forest Labs의 Kontext 시리즈 이미지 편집 모델의 성공으로 인해 최근 여름에 다시 주목을 받았습니다. 여기서 이러한 종류의 페어 데이터를 사용하여 모델에 다양한 변환을 가했습니다.

Flux Kontext 사이트에서 제공하는 일부 변형의 예. 출처: https://bfl.ai/models/flux-kontext
체형을 크게 변경하는 모델을 개발하는 경우, 실제 세계에서 완전히 불가능한 것인 ‘전’과 ‘후’ 이미지를 몇 초 만에 촬영해야 합니다.
이 문제를 해결하는 유일한 방법은 ‘합성 데이터’를 사용하는 것입니다. 일부 프로젝트는 수동으로 생성된 대조 페어를 사용했지만, 이는 대규모로 비현실적입니다. 자동 또는 반자동 AI 기반 프로세스를 사용하여 페어를 생성하는 것이 더 선호됩니다.
GAN 기반 접근 방식과 대부분의 SMPL/X 기반 접근 방식의 문제는 배경과 身分이 변환 과정에서 손상될 수 있다는 것입니다.

SMPL 및 SMPL-X와 같은 매개 변수 기반 CGI 모델은 정의된 3D 좌표를 제공하여 컴퓨터 비전 프레임워크에서 해석 및 통합할 수 있습니다. 출처: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
체형을 변경하는 시스템은 완벽한 해결책에 도달하지 못했습니다.
그러나 인도에서 최근 발표된 논문은 Flux 확산 모델 프레임워크를 사용하여 상태-of-the-아트를 향상시키는 주요 진보를 제안합니다.

새 프로젝트의 데이터셋 예시. 출처: https://arxiv.org/pdf/2508.13065
이 프로젝트는 새로운 대규모 페어 데이터셋, Odo라고 하는 이 데이터에서 학습된 확산 모델, 및 체형 편집 성능을 정량적으로 평가하기 위한 맞춤형 벤치마크를 포함합니다.
테스트에서 저자들은 이 모델이 유사한 모델에 비해 현저한 개선을 보였다고 주장합니다.
이 새로운 논문은 Odo: Depth-Guided Diffusion for Identity-Preserving Body Reshaping라는 제목으로, 인도의 Fast Code AI Pvt. Ltd의 세 명의 연구자에 의해 발표되었습니다.
데이터 및 방법
연구자들이 생성한 데이터셋은 각 대상 체형(뚱뚱한, 마른, 근육질한)당 7,615개의 고해상도 이미지(960x1280px)를 특징으로 합니다.
초기에는 FLUX.1-dev 12억 매개 변수 확산 모델을 사용하여 1,523개의 인간 얼굴을 생성했습니다. 이는 Pexels 및 Unsplash에서 라이선스 없는 참조 얼굴을 사용하여 다양성을 증가시키기 위해 수행되었습니다.
이러한 얼굴을 포함하는 전체 이미지의 경우, ByteDance의 2024년 PuLID를 사용하여 생성했습니다. PuLID는 Flux의 체크포인트를 미세 조정하여 얼굴 身分을 보존하는 데 도움이 되는 대조적 身分 손실을 특징으로 합니다.

PuLID 프로젝트의 예시. 출처: https://arxiv.org/pdf/2404.16022
모델은 얼굴 이미지와 표준화된 프롬프트(성별, 의류, 姿勢, 장면 및 체형)를 받았습니다.
세 가지 체형 이미지(마른, 뚱뚱한, 근육질한)는 때때로 배경 정렬 및 주체 크기에서 약간의 차이를 나타냅니다. 이는 확산 모델의 확률적 행동으로 인해 발생하며, 각 생성은 새로운 노이즈 시드에서 시작됩니다.
이러한 변동을 수정하기 위해 4단계 자동 후처리 파이프라인을 적용했습니다. 여기서 마른 이미지를 각 트리플릿의 참조로 선택했습니다.
사람 감지는 RT-DETRv2를 사용하여 수행되었으며, SAM 2.1을 사용하여 모든 세 가지 체형의 주체 마스크를 추출했습니다.
마른 참조 이미지는 FLUX.1 Kontext Pro(새로운 이미지 편집 시스템)를 사용하여 배경 inpainting을 위해 전달되었으며, 주체를 제거한 깨끗한 장면을 생성했습니다.
뚱뚱하고 근육질한 변형은 마른 참조 마스크의 높이와 일치하도록 균일한 크기 조정을 사용하여 조정되었으며, 동일한 하단 정렬에서 깨끗한 배경에 구성되었습니다.
저자들은 다음과 같이 말합니다:
‘결과적인 변환 트리플릿(마른, 뚱뚱한, 근육질한)은 동일한 배경과 균일한 주체 크기를 갖습니다. 이는 후속 트레이닝 또는 평가에 부정적인 영향을 미칠 수 있는 불필요한 변동을 제거합니다.’
각 트리플릿은 6개의 가능한 변환 페어를 허용하여 7,615개의 身分에 대해 45,690개의 이론적 조합을 생성했습니다.
변형된 의류, 비자연스러운 姿勢, 왜곡된 四肢, 身分漂移 또는 최소한의 체형 변경과 같은 예제를 필터링한 후, 18,573개의 고품질 페어가 유지되었습니다. 일부 작은 姿勢 차이가 남아 있었지만, 모델은 이러한 변동에 강력했습니다.
트레이닝 및 테스트
결과 이미지로 Odo 모델을 트레이닝했습니다. 이는 확산 기반 접근 방식을 사용하여 인간을 재구성하며, Skinned Multi-Person Linear Model(SMPL, 즉 중간 CGI) 맵을 사용합니다.
2024년 Neural Localizer의 방법에 따라 데이터를 SMPL 피규어에 맞춘 후, 최적화된 매개 변수를 사용하여 변경된 이미지를 파생시킬 수 있는 깊이 맵을 생성했습니다.

트레이닝 파이프라인의 스키마. 왼쪽은 트레이닝 설정을 보여주며, 여기서 대상 이미지의 SMPL 깊이 맵이 ControlNet을 통해 ReshapeNet을 안내합니다. ReferenceNet은 소스 이미지에서 기능을 추출하고 공간적 자기 주의를 사용하여 ReshapeNet에 병합합니다. 오른쪽은 추론을 보여주며, 여기서 SMPL 매개 변수가 입력 이미지에서 추정되고, 의미적 속성으로 수정되어, ReshapeNet을 조건으로 하여 최종 변환된 이미지를 생성합니다.
모델은 ReshapeNet 모듈을 포함하며, ReferenceNet, IP-Adapter 모듈, 및 깊이 기반 ControlNet 모듈을 지원합니다.
ReferenceNet은 입력 이미지에서 세부적인 기능을 추출하고, 이를 ReshapeNet에 전달합니다. IP-Adapter는 높은 수준의 기능 가이드를 제공하며, Depth ControlNet은 SMPL 기반 조건을 적용하여 체형 변환을 안내합니다.
ReshapeNet은 SDXL UNet을 기반으로 하며, 트레이닝 중에 대상 이미지를 잠재 공간으로 인코딩하고, 노이즈를 적용한 후, ReshapeNet을 사용하여 ControlNet 및 ReferenceNet의 기능을 사용하여 디노이즈합니다.
카테고리별 텍스트 프롬프트를 추가하여 변환을 안내했습니다. 깊이 맵은 거친 체형을 캡처했으며, 프롬프트는 근육 정의와 같은 변경에 필요한 의미적 세부 정보를 제공했습니다.
트레이닝 구현
Odo는 프로젝트의 합성 데이터셋과 DeepFashion-MultiModal 데이터셋의 하위 집합을 결합하여 총 20,000개의 이미지 페어에서 트레이닝되었습니다.
DeepFashion-MultiModal 데이터는 의류 및 얼굴 특징에서 다양성을 제공했으며, 트레이닝 중에 자기 자신에 대한 페어로 사용되었습니다.
SMPL 깊이 맵은 효율성을 위해事先 계산되었으며, 트레이닝은 60 에포크 동안 단일 NVIDIA A100 GPU에서 80GB의 VRAM을 사용하여 수행되었습니다.
입력 이미지는 768×1024로 조정되었으며, Adam 최적화 알고리즘을 사용하여 1×10⁻⁵의 학습률을 적용했습니다.
ReshapeNet은 SDXL UNet의 가중치를 초기화하고, IP-Adapter와 함께 미세 조정했습니다. ReferenceNet은 SDXL의 가중치를 초기화하고, 동결했습니다. Depth ControlNet은 미리 학습된 가중치를 사용하고, 동결했습니다.
최종 모델은 약 23GB의 GPU 메모리가 필요했으며, 단일 이미지 추론에 18초가 걸렸습니다.
새로운 지표
이 프로젝트에 필요한 데이터셋의 부족으로 인해 기존 지표는 실제로 이 도전에 대처하지 못했습니다. 따라서 저자들은 새로운 벤치마크를 설계했습니다. 이는 3,600개의 이미지 페어로 구성되며, 실제 얼굴 이미지 및 배경 설명과 함께 다양한 체형 변형을 특징으로 합니다.
다른 지표로는 구조적 유사성 지수(SSIM), 피크 신호 대 노이즈 비율(PSNR), 학습된 지각적 이미지 패치 유사성(LPIPS), 및 중립 姿勢에서 스케일 교정된 퍼버텍스 유클리디언 오차(PVE-T-SC)가 있습니다.
저자들은 먼저 실제 세계 이미지(트레이닝 중에 모델에 보이지 않은 이미지)에 대해 질적으로 자신의 방법을 테스트했습니다.

질적 테스트. 예제는 원래 이미지에서 더 얇은, 더 비만한, 더 근육질한 체형으로의 변환을 보여주며, 이는 다양한 姿勢, 앉은 자세 및 서 있는 자세를 포함합니다. 원본 논문에서 더 나은 정의 및 세부 정보를 참조하십시오.
이 결과에 대해 논문은 다음과 같이 말합니다:
‘제안된 방법은 다양한 姿勢, 배경 및 의류를 효과적으로 처리하면서 개인 身分을 유지합니다.
‘SMPL 대상 형태 외에도 ‘사람을 더 비만하게 하십시오’, ‘사람을 더 말랑말랑하게 하십시오’, 또는 ‘사람을 더 근육질하게 하십시오’와 같은 텍스트 프롬프트를 제공하여 원하는 변환을 명시적으로 안내합니다…’
…'(아래 이미지는) 모델의 다양한 형태 변환 능력을 추가로 보여줍니다. 모델은 SMPL 깊이 맵을 따라 여러 가지 얇은 및 비만한 버전을 참조 이미지에서 정확하게 생성합니다.’

다양한 대상 체형을 다루는 추가적인 질적 테스트. 원본 논문에서 더 나은 정의 및 세부 정보를 참조하십시오.
저자들은 다음과 같이 말합니다:
‘결과는 대상 체중에 따라 더 현실적인 변환을 보여주며, 모델은 전체 체형, 四肢 비율, 의류를 동시에 조정하여 해부학적으로 일관된 및 시각적으로 убед적인 수정을 생성합니다.’
량적 테스트를 위해 저자들은 자신의 시스템을 Flux Kontext [dev] 모델, FLUX.1, 및 2022년 Structure-Aware Flow Generation for Human Body Reshaping과 비교했습니다.
FLUX.1 Kontext [dev]의 경우, 프롬프트는 ‘사람을 더 비만하게 하십시오’, ‘사람을 더 말랑말랑하게 하십시오’, 또는 ‘사람을 더 근육질하게 하십시오’와 같은 지시를 포함했으며, 대상 체중을 지정했습니다. 그러나 미세한 제어의 부족으로 인해 성능이 제한되었습니다.
![테스트 세트에서 Odo, Structure-Aware Flow Generation for Human Body Reshaping, 및 FLUX.1 Kontext [dev]의 비교. 또한 모델을 ReshapeNet의 프롬프트 조건 없이, ReferenceNet 없이(오직 IP-Adapter를 사용하여), 및 BR-5K 데이터셋으로만 트레이닝한 결과에 대한 절단 연구 결과가 포함되어 있습니다.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
테스트 세트에서 Odo, Structure-Aware Flow Generation for Human Body Reshaping, 및 FLUX.1 Kontext [dev]의 비교. 또한 모델을 ReshapeNet의 프롬프트 조건 없이, ReferenceNet 없이(오직 IP-Adapter를 사용하여), 및 BR-5K 데이터셋으로만 트레이닝한 결과에 대한 절단 연구 결과가 포함되어 있습니다.
결론
이번 해 Flux Kontext의 등장과 최근에 unquantized 가중치를 가진 Qwen Image Edit의 출시로, 페어 데이터는 다시 주목을 받게 되었습니다. 이러한 모델은 더 높은忠実度를 가진 입력 소스 이미지에 최적화되어 있으며, 이는 전문가 및 취미 커뮤니티에서 관심을 끌고 있습니다.
체형 변경 시스템의 유용성은 심리학, 의학, 패션 분야에서 나타날 수 있습니다. 그러나 이러한 시스템이 더 높은 수준의 普及성을 đạt하고, 더 캐주얼하고, 잠재적으로 우려되는 사용을 달성할 가능성이 있습니다.
2025년 8월 25일 처음 게시됨












