Anderson의 관점

가상 시연을 위한 새로운 의류

mm
Unite.AI를 Google의 선호 소스에 추가
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

인공지능 모델은 이제 단일 사진과 의류 이미지로 새로운 의류를 착용한 사람의 동영상으로 변환할 수 있으며, 이전의 2단계 시스템에서 흔히 발생하는 글리치를 피할 수 있습니다.

 

컴퓨터 비전 연구에서 ‘가상 시연(VTON)’ 카테고리는 가장 많이 자금을 지원받고 가장 활발하게 연구되는 분야 중 하나입니다. 이는 매년 발표되는 산업과 학계의 공동 연구에서 볼 수 있듯이, 패션 산업에서 이 목표에 대한 자금 지원이 상당하다는 것을 알 수 있습니다.

논문 'Image-Based Virtual Try-On: A Survey'에서 사람 표현 유형의 예시와 가상 시연을 위해 기본 이미지에서 필터링 및 정제 단계

논문 ‘Image-Based Virtual Try-On: A Survey’에서 사람 표현 유형의 예시와 가상 시연을 위해 기본 이미지에서 필터링 및 정제 단계 원본

이 목표에는 다양한 변형이 있습니다. 예를 들어, 사람 이미지에서 의류를 추출하는 것과, 필요한 경우 더 풍만한 몸매를 수용하는 것입니다. 일부 이미지 기반 시스템은 이미 상업적으로 구현되어 있으며, veesual.ai, wanna.fashion, fashn.ai와 같은 플랫폼에서 사용할 수 있습니다.

비디오의 경우, Google Labs의 실험적인 Doppl 앱이 이 기능을 실험했으며, 작년 여름에 출시되었습니다.

재생이 자동으로 되지 않는 경우 클릭하여 재생하세요. 중단된 Google Doppl 가상 시연 프로젝트의 일부입니다. 원본

그러나 Doppl은 2026년 4월에 미온적인 반응을 보인 후 종료되었습니다. 이제 사용자는 회사에서 제공하는 이미지 전용 시연 서비스로 안내됩니다.

Google의 이미지 전용 시연 프로그램, 중단된 Doppl 플랫폼에서 사용자에게 안내됩니다.

Google의 이미지 전용 시연 프로그램, 중단된 Doppl 플랫폼에서 사용자에게 안내됩니다. 원본

비디오를 지원하는 가상 시연을 제공하는 플랫폼은 몇 가지뿐이며, 실제 매장과 관련이 없습니다. 또한 이러한 제품은 대부분 토큰 기반의邊緣적인 제품입니다.

연구 분야에서 흥미로운 시도들이 있지만, 이러한 아키텍처는 일반적으로 복잡하여 낮은 대기 시간과 높은 품질로 구현하기 어렵습니다.

재생이 자동으로 되지 않는 경우 클릭하여 재생하세요. 2024년 Fashion-VDM 프로젝트에서 ‘헤드리스’ 의류 전송의 예입니다. 원본

의류를 실제 사람에게 맞추는 것은, 의류나 사람을歪曲하지 않으면서 유용한 시연 동작을 유지하는 것은, 현재 기술 수준에서 매우 어려운課題입니다.

Vanast

이課題에 도전하는 새로운 논문이 한국에서 나왔습니다. 이 논문에서는 의류, 사람, 동작을 하나의 통합된 솔루션으로 파싱하여 가상 시연을 구현합니다.

재생이 자동으로 되지 않는 경우 클릭하여 재생하세요. Vanast 프로젝트의 보조 자료 사이트에서 제공하는 예시입니다. 원본

새로운 시스템인 Vanast는 의류, 사람, 동작을 모두 포함하는 커스텀 데이터셋을 사용합니다. 이 데이터셋은 가상 시연을 구현하는 데 필요한 세 가지 요소를 모두 포함합니다.

클릭하여 재생하세요.Vanast 프로젝트 사이트에서 제공하는 더 많은 예시입니다.

시스템은 Flux, Qwen, ChatGPT와 같은 다양한 프레임워크를 사용하여 ‘트리플릿’ 데이터셋을 생성하여 엔드투엔드 아키텍처를 교육합니다.

새로운 논문에서 제공하는 데이터셋 데이터 포인트의 예시입니다.

새로운 논문에서 제공하는 데이터셋 데이터 포인트의 예시입니다. 원본

새로운 논문은 Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision이라고 제목이 붙여져 있으며, 서울대학교의 4명의 연구자에 의해 작성되었습니다. 또한 프로젝트 사이트도 있습니다.

Method

저자의 목표는 세 가지 요소를 하나의 단계로 통합하는 것입니다. 이는 단순히 분리된 프로세스가 아니며, 다양한 요소가 훈련 과정에서 상호 작용할 수 있도록 합니다.

Vanast는 단일 사람 사진, 별도의 의류 이미지, 모션 참조를 사용하여 새로운 의류를 착용한 사람의 동영상으로 변환합니다. 포즈 가이드는 일관된 동작을 유지하며, 각 프레임에서 身分과 의류 세부 사항이 유지됩니다.

Vanast는 단일 사람 사진, 별도의 의류 이미지, 모션 참조를 사용하여 새로운 의류를 착용한 사람의 동영상으로 변환합니다. 포즈 가이드는 일관된 동작을 유지하며, 각 프레임에서 身分과 의류 세부 사항이 유지됩니다.

이를 위해 시스템은 의류 이미지, 사람 사진, 모션 참조 동영상, 텍스트 프롬프트를 입력으로 받습니다. 그리고 새로운 의류를 착용한 사람의 동영상으로 변환합니다.

이전의 연구와 달리, Vanast는 의류, 身分, 동작을 하나의 프로세스로 처리합니다. 이는 이러한 요소가 생성 과정에서 상호 작용할 수 있도록 합니다.

Dataset

프로젝트의 훈련은 사람 이미지, 의류 이미지, 동작을 포함하는 페어된 예시로 구성된 데이터셋을 사용합니다. 모션은 이전 아키텍처를 사용하여 추출됩니다.

공개적으로 उपलब있는 데이터셋이 없기 때문에, 데이터는 온라인 쇼핑 플랫폼에서 수집되었습니다. 그러나 같은 사람을 여러 가지 의류를 착용한 채로 촬영한 동영상은 드물기 때문에, 합성 데이터를 생성해야 했습니다.

이 과정은 세 단계로 구성됩니다. 첫 번째 단계에서는 적합한 후보 프레임을 선택하고, Qwen을 사용하여 적합성을 평가합니다. 두 번째 단계에서는 인페인팅 마스크를 생성하여 의류를 분리합니다. 세 번째 단계에서는 Qwen을 사용하여 이미지에 대한 성별을 분류하고, Flux를 사용하여 의류를 변경합니다.

Vanast 파이프라인 개요, 사람 이미지, 의류 이미지, 모션 가이드 동영상이 통합 비디오 확산 모델에서 처리됩니다.

Vanast 파이프라인 개요, 사람 이미지, 의류 이미지, 모션 가이드 동영상이 통합 비디오 확산 모델에서 처리됩니다.

의류 이미지와 동작을 포함하는 트리플릿을 생성하기 위해 HumanVid 데이터셋을 사용했습니다. 동일한 프로세스를 사용하여 身分을 유지하는 사람 이미지를 생성했습니다.

의류 이미지는 동영상에서 직접 합성되었습니다. 프레임을 샘플링하고, Qwen을 사용하여 전면 가시성을 평가했습니다. 그리고 가장 적합한 후보를 선택했습니다.

의류 영역은 SegFormer를 사용하여 추출하고, 배경을 제거하여 의류를 분리했습니다.

위치 편향을 피하기 위해 의류 영역을 임의로 이동하고, Qwen을 사용하여 신뢰할 수 없는 분할을 필터링했습니다. 이 프로세스는 합성 데이터셋을 생성하여 실제 환경에서 강건성을 향상시킵니다.

Architecture

이중 모듈 아키텍처를 도입하여 이전 방법에서 나타난 느린 수렴과 약한 제어 균형을 해결했습니다. 이 접근법은 Wan의 텍스트-비디오 확산 트랜스포머와 VACE 프로젝트를 사용합니다.

모델은 사람 애니메이션 모듈(HAM)과 의류 전송 모듈(GTM)로 구성됩니다. 두 모듈은 백본을 공유하며, 특징을 분산된 방식으로 통합하여 조건을 개선합니다.

훈련은 백본을 고정하고 HAM 및 GTM 매개변수만 최적화하여 수행됩니다. 합성 트리플릿 데이터셋의 입력은 WAN의 변분 오토인코더(VAE)를 사용하여 잠재 표현으로 변환됩니다.

모션 인식 컨텍스트는 사람과 동작 정보를 시간에 따라 결합하여 구성하고, 의류 특징은 별도로 처리하여 토큰 임베딩으로 투영합니다.

모델은 또한 의류 보간을 지원합니다. 여기서 두 개의 의류 표현을 결합하여 부드러운 전환을 생성합니다.

Data and Tests

모델은 9,135개의 동영상으로 훈련되었습니다. 이 동영상은 3초에서 10초까지의 길이를 가지며, 쇼핑몰 사이트, 저자의 자체 생성 데이터셋, HumanVid 데이터셋에서 수집되었습니다.

이러한 데이터셋으로 두 개의 평가 데이터셋을 생성했습니다. 하나는 인터넷 데이터셋으로, 동영상과 제품 이미지를 포함하며, 다른 하나는 Alibaba의 ViViD 데이터셋의 공식 테스트 세트입니다.

ViViD 데이터셋은 얼굴이 없는 것으로, 이전에 언급한 비디오에서 볼 수 있듯이, 가상 시연 문헌에서 매우 일반적인 현상입니다. 따라서 Flux 아웃페인팅을 사용하여 얼굴을 추가했습니다.

사용된 평가지표는 L1 손실, 피크 신호 대 노이즈 비율(PSNR), 구조적 유사성 지수(SSIM), 학습된 지각적 이미지 패치 유사성(LPIPS), 프레체 인셉션 거리(FID), 프레체 비디오 거리(FVD)입니다.

의류 전송을 위한 테스트 시스템은 OOTDiffusion, CatVTON, OmniTry, Any2AnyTryon이었습니다. 주제-이미지 생성 모델은 VisualCloze, MOSAIC, UNO였습니다.

두 번째 테스트 카테고리에서는 이미지 가상 시연과 애니메이션 모델의 조합을 테스트했습니다. 새로운 작업은 여기서도 최고의 점수를 달성했습니다.

저자는 다음과 같이 말합니다.

‘우리의 모델은 모든 평가지표에서 최고의 성능을 보입니다. 질적 결과는 우리의 접근법이 가장 정확한 포즈 따라가기와 의류 전송을 제공하며, 身分을 가장 잘 보존한다는 것을 보여줍니다.’

인터넷과 ViViD 데이터셋에서 주제-이미지 및 애니메이션 기준선과 비교한 질적 비교

인터넷과 ViViD 데이터셋에서 주제-이미지 및 애니메이션 기준선과 비교한 질적 비교

두 번째 테스트 카테고리에서 이미지 가상 시연과 애니메이션 모델의 조합을 테스트했습니다. 새로운 작업은 여기서도 최고의 성능을 보였습니다.

인터넷과 ViViD 데이터셋에서 이미지 가상 시연 및 애니메이션 모델의 조합과 비교한 양적 비교

인터넷과 ViViD 데이터셋에서 이미지 가상 시연 및 애니메이션 모델의 조합과 비교한 양적 비교

저자는 다음과 같이 말합니다.

‘질적 비교는 우리의 결과가 가장 실제와 유사하다는 것을 보여줍니다.’

이미지 가상 시연 및 애니메이션 모델의 조합을 사용한 질적 테스트

이미지 가상 시연 및 애니메이션 모델의 조합을 사용한 질적 테스트

Conclusion

Vanast 프로젝트는 가상 시연을 위한 이중 단계 솔루션을 제공합니다. 그러나 훈련 및 추론 자원 요구 사항에 대한 세부 정보가 부족하여, 이 솔루션이 가장 민첩하거나 가벼운 솔루션이 아닐 수 있습니다. 실제로, 가상 시연은 현재 기술 수준에서 매우 어려운課題입니다.

가상 시연은 현재 상태에서 어려운課題 중 하나입니다. 이는 현재의 기술 수준에서 해결하기 어렵습니다.

 

미국에서만 사용 가능하며, 다른 지역에서는 지리적 제한이 있을 수 있습니다.

†† 저자는 ‘VFID’를 언급하지만, ViViD 논문으로 연결되며, 이는 참조를 정당화하지 않습니다. 저자는 Fréchet Video Distance(FVD)를 의미했을 것으로 추측합니다. 자세한 내용은 저자에게 문의하십시오.

최초로 게시된 날은 2026년 4월 8일입니다.

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai