Anderson’un Açısı

Sanal Giyinme: Yeni Giysileri AI ile Deneme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Examples of virtual try-on from the Vanast project – source: https://arxiv.org/pdf/2604.04934

AI modeli, tek bir fotoğraf ve giysi resimlerini, giysi değiştirirken kişinin hareketlerini gösteren bir videoya dönüştürebiliyor ve eski, iki aşamalı sistemlerdeki hataları önleyebiliyor.

 

Bilgisayarlı görme araştırmalarında “sanal giyinme” (VTON) kategorisi, en çok finanse edilen ve en çok yayın yapılan alanlardan biri – çünkü endüstri ve akademik işbirlikleri her yıl yayınlanmakta ve bu hedefe moda endüstrisi tarafından önemli fonlar ayrılmaktadır:

Makaleden, 'Görüntü Tabanlı Sanal Giyinme: Bir Araştırma' adlı çalışmadan, kişi temsil türleri ve sanal giyinme için temel resimlerin geçmesi gereken bazı filtreleme ve rafine etme aşamaları örnekleri. Kaynak - https://arxiv.org/pdf/2311.04811v3

Makaleden, ‘Görüntü Tabanlı Sanal Giyinme: Bir Araştırma’ adlı çalışmadan, kişi temsil türleri ve sanal giyinme için temel resimlerin geçmesi gereken bazı filtreleme ve rafine etme aşamaları örnekleri. Kaynak – https://arxiv.org/pdf/2311.04811v3

Amacın birçok varyasyonu vardır, örneğin insan resimlerinden giysi çıkarmak ve daha büyük bedenleri gerekli olduğunda dikkate almak. Bazı görüntü tabanlı sistemler ticari olarak uygulanmıştır, örneğin ve veesual.ai, wanna.fashion ve fashn.ai gibi platformlarda.

Video için, Google Labs’in deneysel Doppl uygulaması bu işlevi denedi ve geçen yaz piyasaya sürüldü:

Video otomatik olarak oynatılıyorsa, lütfen oynatmak için tıklayınız. Terk edilen Google Doppl video deneme projesinden alıntılar. Kaynak

Ancak Doppl, Nisan 2026’da soğuk bir karşılama aldıktan sonra kapatıldı ve kullanıcılar artık şirketin yalnızca görüntü tabanlı deneme hizmetine yönlendiriliyor:

Google'ın yalnızca görüntü tabanlı deneme programı, şirketin terk edilen Doppl platformundan yönlendirilen kullanıcılar için.

Google’ın yalnızca görüntü tabanlı deneme programı, şirketin terk edilen Doppl platformundan yönlendirilen kullanıcılar için. Kaynak

Sanal giyinme sunan platformlar var, ancak bunların hiçbiri gerçek bir mağazayla ilişkili görünmüyor ve hepsi “kenar teknoloji” ürünlerinden oluşuyor.

Araştırmadan birçok ilginç girişimler var, ancak bunlar genellikle karmaşık mimariler ve düşük gecikme ve yüksek kaliteli uygulamalar için uygulanması zor:

Video otomatik olarak oynatılıyorsa, lütfen oynatmak için tıklayınız. 2024 Fashion-VDM projesinden, ‘kafasız’ giysi aktarımının bir örneği. Kaynak

Gerçek bir kişiye giysi uydururken, giysiyi veya kişiyi bozmadan ve faydalı bir demonstratif hareketi korurken, bu görev, mevcut teknoloji için büyük bir zorluktur.

Vanast

Bu zorluğu, Kore’den yeni bir makale, giysi + kişi + hareketin tümünü birleştiren yeni ve tamamen entegre bir çözüm kullanarak aşmaya çalışıyor:

Video otomatik olarak oynatılıyorsa, lütfen oynatmak için tıklayınız. Vanast projesinin ek materyaller sitesinden örnekler. Kaynak

Yeni sistem, Vanast adlı bir veri setini kullanıyor. Bu veri seti, görevi gerçekleştirmek için gerekli olan üç faktörün birleştirilmesini ve koordinasyonunu içerir: giysi, kişi ve hareket.

Çalma için tıklayınız. Vanast projesinin sitesinden daha fazla örnek.

Sistem, Flux, Qwen ve ChatGPT gibi çeşitli çerçeveleri kullanarak, giysi, kişi ve hareketin birleştirilmesini sağlayan bir “üçlü” veri seti oluşturuyor.

Makaleden, oluşturma ve eğitim için kullanılan veri seti örnekleri. Kaynak - https://arxiv.org/pdf/2604.04934

Makaleden, oluşturma ve eğitim için kullanılan veri seti örnekleri. Kaynak – https://arxiv.org/pdf/2604.04934

Makale, Vanast: İnsan Görüntüsü Animasyonu ile Sanal Giyinme olarak adlandırılmış ve Seoul Ulusal Üniversitesi’nden dört araştırmacı tarafından yazılmıştır. Ayrıca videoyla dolu bir proje sitesi de bulunmaktadır.

Yöntem

Araştırmacıların bu çalışmadaki amacı, giysi, kişi ve hareketin tümünü tek bir aşamada birleştirmektir. Bu, yalnızca sürecin ayrıntılı olmasını sağlamakla kalmaz, aynı zamanda eğitim sırasında bu faktörlerin birbirleriyle daha fazla etkileşime girmesine de olanak tanır.

Vanast, bir insan fotoğrafı, ayrı giysi resimleri ve bir hareket referans videosunu birleştiren ve kişinin yeni bir giysi giyiyor gibi göründüğü bir video dizisi oluşturur. Pozisyon rehberliği, tutarlı hareketi sağlar ve kimlik ve giysi ayrıntıları çerçeveler arasında korunur.

Vanast, bir insan fotoğrafı, ayrı giysi resimleri ve bir hareket referans videosunu birleştiren ve kişinin yeni bir giysi giyiyor gibi göründüğü bir video dizisi oluşturur. Pozisyon rehberliği, tutarlı hareketi sağlar ve kimlik ve giysi ayrıntıları çerçeveler arasında korunur.

Bu amaca ulaşmak için, sistem giysi resimlerini, kişinin farklı giysiler giydiği bir fotoğrafını, kişinin hareketinin tanımlanması için bir video referansını ve eylemi ve ortamı tanımlayan bir metin istemini alır ve kişinin yeni bir giysi giyiyor gibi görünen bir video dizisi oluşturur.

Giysi ve animasyonu ayrı aşamalarda ele alan önceki çalışmalardan farklı olarak, Vanast giysi, kimlik ve hareketi birlikte tek bir işlemde ele alır. Bu, bu öğelerin eğitim sırasında birbirleriyle daha fazla etkileşime girmesine olanak tanır ve önceki yöntemlerde görülen uyumsuzlukları ve istikrarsızlıkları azaltır.

Veri Seti

Eğitim için kullanılan veri seti, bir insan resmi, ilgili giysi resimleri ve giysileri giyen kişinin hareketinin videosundan oluşan çift örneklerden oluşur. Hareket, önceki bir mimari kullanılarak çıkarılır ve eğitim için stable bir poz rehberliği sağlar.

Mevcut veri setlerinin proje gereksinimlerini karşılamadığından, veri sentetik veri oluşturmak için çevrimiçi alışveriş platformlarından toplanmıştır. Ancak, aynı kişinin farklı giysiler giydiği videolar nadir bulunduğundan, sentetik veri oluşturmak için bir işlem gerçekleştirilmiştir.

Üç aşamalı bir işlem, Qwen2.5-VL Vision-Language Model (VLM) kullanarak uygun aday çerçeveleri seçme, inpainting maskeleri oluşturma ve PERSE çalışmasından esinlenen SDXL difüzyon modelini kullanarak giysileri izole etme işlemlerini içerir.

Vanast pipeline'ının概要ı, insan resmi, hedef giysi resimleri ve hareket rehberi videosunun birleştirildiği ve bir video difüzyon modelinde işlendiği yer.

Vanast pipeline’ının概要ı, insan resmi, hedef giysi resimleri ve hareket rehberi videosunun birleştirildiği ve bir video difüzyon modelinde işlendiği yer.

Üçüncü aşamada, Qwen, resimleri cinsiyete göre sınıflandırmak için kullanılır ve Flux görüntü difüzyon çerçevesi, resimdeki giysileri değiştirmek için kullanılır. Inpainting metin istemleri, ChatGPT tarafından oluşturulur.

Poz ve arka plan çeşitliliği artırmak için, eğitim üçlüsünü inşaa etmek için bir işlem tanıtıldı.

Giysi resimlerinin sentetik olarak oluşturulması, Qwen tarafından ön plan görünürlüğü için puanlanan ve seçilen çerçeveler kullanılarak gerçekleştirilir.

Giysi bölgesini çıkarmak için SegFormer kullanılır ve arka plan kaldırılır.

Mimari

Vanast, slow convergence ve zayıf kontrol dengesi sorunlarını çözmek için çift modüllü bir mimari kullanır. Bu mimari, Wan ve VACE projesinden esinlenmiştir.

Model, İnsan Animasyon Modülü (HAM) ve Giysi Aktarım Modülü (GTM) olmak üzere iki modülden oluşur. HAM, insan ve poz girişlerinden hareket ve kimliği işlerken, GTM giysi resimlerinden giysileri işler. Her iki modül de backbone’a erişimi paylaşır ve özellikler dağıtılmış, kademeli bir şekilde entegre edilir.

Eğitim, backbone dondurularak ve yalnızca HAM ve GTM parametrelerinin optimize edilmesi yoluyla gerçekleştirilir. WAN’ın varyasyonel oto-encoder (VAE) kullanılarak girdi üçlüleri laten gösterimlere dönüştürülür.

Hareket bilgisi, insan ve poz bilgilerinin zaman içinde birleştirilmesiyle oluşturulurken, giysi özellikleri ayrı olarak işlenir ve token gömme yoluyla hizalanır.

Model, giysi interpolasyonuna da destek verir. Burada, iki giysinin temsilcileri birleştirilerek, giysiler arasında pürüzsüz geçişler oluşturulur.

Veri ve Testler

Model, 9,135 videodan oluşan bir veri setiyle eğitilmiştir. Videolar, üç ila on saniye arasında değişen uzunluklara sahiptir ve “alışveriş merkezi sitelerinden” toplanmıştır.

İki değerlendirme veri seti oluşturulmuştur: “İnternet veri seti” ve Alibaba’nın ViViD veri setinin resmi test bölümü.

ViViD veri setindeki yüzlerin eksik olması nedeniyle (yukarıdaki videoya bakınız), Flux outpainting kullanılarak yüzler eklenmiştir.

Kullanılan metrikler, L1 kaybı, Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), Learned Perceptual Image Patch Similarity (LPIPS), Fréchet Inception Distance (FID) ve Fréchet Video Distance (FVD)’dir.

Test edilen giysi transfer sistemleri, OOTDiffusion, CatVTON, OmniTry ve Any2AnyTryon’dur. Konu-görsel oluşturma modelleri olarak VisualCloze, MOSAIC ve ByteDance’in UNO’su denenmiştir.

İkinci aşama insan resmi animasyonu için, StableAnimator ve DisPose çerçeveleri kullanılmıştır.

VACE de, eksik fonctionelliği dengelemek için bazı çabalara rağmen, sınırlı bir bağlamda test edilmiştir:

İnternet ve ViViD veri setlerinde, konu-görsel oluşturma ve animasyon modellerinin kombinasyonlarına karşı nicel kıyaslama, önerilen yöntemin tüm raporlanan metriklere karşı en iyi performansı gösterdiği yer.

İnternet ve ViViD veri setlerinde, konu-görsel oluşturma ve animasyon modellerinin kombinasyonlarına karşı nicel kıyaslama, önerilen yöntemin tüm raporlanan metriklere karşı en iyi performansı gösterdiği yer.

Yazarlar, başlangıçtaki sonuçlarla ilgili olarak şunları belirtirler:

‘Modelimiz, konu-görsel oluşturma modelleri ve animasyon modellerinin kombinasyonlarıyla karşılaştırıldığında tüm metriklere karşı en iyi performansı gösterir.’

‘Nitel sonuçlar ayrıca, yaklaşımımızın en doğru poz takibini ve giysi transferini sağladığını ve tüm konu-görsel tabanlı referanslara göre kimliği daha sadık bir şekilde koruduğunu onaylar.’

İnternet ve ViViD veri setlerinde, konu-görsel oluşturma ve animasyon referanslarına karşı nitel kıyaslama, önerilen yöntemin daha doğru poz hizalaması ve giysi transferini sağladığını ve kimliği daha tutarlı bir şekilde koruduğunu gösteren yer.

İnternet ve ViViD veri setlerinde, konu-görsel oluşturma ve animasyon referanslarına karşı nitel kıyaslama, önerilen yöntemin daha doğru poz hizalaması ve giysi transferini sağladığını ve kimliği daha tutarlı bir şekilde koruduğunu gösteren yer.

İkinci kategorideki testlerde, görüntü tabanlı sanal giyinme ve animasyon modellerinin kombinasyonları test edilmiştir ve yeni çalışma yine en yüksek puanı elde etmiştir:

İnternet ve ViViD veri setlerinde, görüntü tabanlı sanal giyinme ve animasyon modellerinin kombinasyonlarına karşı nicel kıyaslama, önerilen yöntemin tüm metriklere karşı en iyi performansı gösterdiği yer.

İnternet ve ViViD veri setlerinde, görüntü tabanlı sanal giyinme ve animasyon modellerinin kombinasyonlarına karşı nicel kıyaslama, önerilen yöntemin tüm metriklere karşı en iyi performansı gösterdiği yer.

Yazarlar şunları ekler:

‘Nitel kıyaslama, sonuçlarımızın ground truth’a en çok benzeyenlerini gösterir.’

Görüntü tabanlı sanal giyinme ve animasyon modellerinin kombinasyonları ile gerçekleştirilen nitel testler.

Görüntü tabanlı sanal giyinme ve animasyon modellerinin kombinasyonları ile gerçekleştirilen nitel testler.

Sonuç

Vanast projesi, ayrıntılı bir son-aşama çözümü sunar, ancak makalenin eğitim ve çıkarım kaynağı gereksinimlerine ilişkin ayrıntıların eksik olması, bu çözümün en esnek veya en çevik çözüm olmayabileceğini gösterir. Aslında, bu zorlu görevi gerçekleştirmek, düşük gecikme ve yüksek kaliteli bir ticari dağıtımda gerçekleştirmek çok zordur.

Sanal giyinme, “ay yıldızlı” AI hedeflerinden biridir ve mevcut durum, çeşitli başlıklarda ve seçilen sonuçlarda sunulan durum, görevin gerçek zorluğunu gizler. Bu zorluk, muhtemelen daha sonraki ve daha hafif teknolojilerle çözülecektir.

 

Amerika Birleşik Devletleri’nde mevcut, ancak birçok diğer bölgede coğrafi olarak kısıtlanmıştır.

†† Yazarlar ‘VFID’ diye bahseder, ancak yalnızca ViViD makalesine bağlantı verir, ki bu, bana göre, referansı haklı çıkarmaz. Onların aslında Fréchet Video Distance (FVD) kastettiğini ve zamanın kısıtlı olması nedeniyle takip edemediğini varsayıyorum. Gerekli düzeltmeler için lütfen bana ulaşın.

İlk yayınlanma tarihi: Çarşamba, 8 Nisan 2026

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai