Anderson’un Açısı
Yapay Zeka ile Şişmanlama Avantajları

Yeni bir yapay zeka sistemi, insanların fotoğraflarını gerçekçi bir şekilde değiştirebiliyor, onları daha şişman, daha zayıf veya daha kaslı hale getirebiliyor, yüz, kıyafet veya arka planı değiştirmeden.
Yapay zekanın sosyal ağlarda vücut şeklini iyileştirme amacıyla artan kullanımı veya (potansiyel olarak) VFX amaçları için vücut tiplerini değiştirme dışında, bireylerin görünümünü değiştirmek için makine öğreniminin kullanılması daha önemli bir işleve hizmet edebilir: yeme bozukluğu olan bireylerin kendilerinin vücutlarının distorfik interpretasyonunu anlamalarına yardımcı olmak ve daha genel spor ve fitness amaçları için potansiyel bir motivasyon aracı olarak hizmet etmek:

Vücut büyüklüğü estimasyonundan ‘Kadınlar ve anoreksiya nervoza ve sağlıklı kontroller menggunakan 3D avatarlar’ adlı makaleden, vücut şekli değişikliklerini görselleştirmek için bir GUI. Vücut dismorfisi olan kişiler, benzer bir görüntüye gerçekçi bir yorum bağlayamayabilir, böylece klinisyenlere dismorfik tepkiler için bir ölçek sağlıyor. Kaynak: https://www.nature.com/articles/s41598-017-15339-z.pdf
Ayrıca, moda deneme alt dalı olan bilgisayar görüşünde de çeşitli vücut şekilleri boyunca doğru görselleştirmeler sağlamakla ilgilenen moda deneme alt dalı da vardır. Bu alanda, Japonya’nın Tsukuba Üniversitesi’nden 2024 DiffBody teklifi gibi çerçeveler, bu alanda bazı göz alıcı işlevler oluşturdu:

Önceki DiffBody tekniği ile mümkün olan bazı dönüşümler. Kaynak: https://arxiv.org/pdf/2401.02804
Standart modellerde genellikle ‘obez’ gibi olağan dışı boyutlar minimum düzeyde mevcuttur veya cezai önyargılar ile gelir.
Çift Zorunluluklar
İnsanların fotoğraflarına gerçekçi bir şekilde yağ veya kas ekleyebilen veya çıkarabilen AI sistemleri oluşturmanın en büyük zorluklarından biri, bu işlemin çift eğitimi gerektirmesidir, burada AI sistemi temel olarak ‘önce’ ve ‘sonra’ görüntülerini öğrenir ve dönüşümün ne olduğunu tanımlar.
Bu tür bir eğitimin yeniden popülerlik kazanması, Black Forest Labs’in Kontext adlı görüntü düzenleme modelleri serisinin başarısına dayanmaktadır ve bu tür çift veri, modellere çeşitli dönüşümler öğretmek için kullanılmıştır:

Flux Kontext sitesinden, modelin görüntü bütünlüğünü korurken büyük değişiklikler yapması için gereken türden bir dönüşüm örneği. Kaynak: https://bfl.ai/models/flux-kontext
Elbette, bir kişinin görünümünü önemli ölçüde değiştirebilen bir model geliştirmek için, gerçek dünyada tamamen imkansız olan şeylere ihtiyacınız vardır: birkaç saniye içinde çekilen radikal ‘önce’ ve ‘sonra’ fotoğrafları.
Bunun tek çaresi sentetik veridir. Bu tür projelerin bazıları, manuel olarak Photoshop’ta oluşturulan bireysel, yüksek çaba gerektiren karşıtlık çiftleri kullandı; ancak bu, ölçekte gerçekçi değildir ve çiftleri oluşturmak için otomatik veya yarı otomatik, AI destekli bir işlem artık tercih edilmektedir.
GAN tabanlı ve çoğu SMPL/X tabanlı yaklaşımların (sanal bir CGI figürü, gerçek görüntüler ve istenilen dönüşümler arasındaki bir tür değişim mekanizması olarak kullanılır) ve görüntü bükmeyi kullanan yaklaşımların sorunu, arka plan ve kimliğin genellikle bu süreçte acı çekmesidir.

SMPL ve SMPL-X gibi parametrik, vektör tabanlı CGI modelleri (diğerleri arasında), bilgisayar görüşü çerçevelerine dahil edilebilecek tanımlı geleneksel fiziksel 3B koordinatlar sağlar. Kaynak: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
AI’nin yalnızca istenilen yönleri değiştirmesini sağlamak yerine, arka planları bükmeyi ve diğer istenmeyen hataları tekrarlamayı öğrenmemesi önemlidir. Bu nedenle, vücut değiştirme sistemi henüz mükemmel bir çözüm bulamadı.
Hintli bir araştırma ekibinin yakın zamanda yayınladığı bir makale, daha iyi ve daha tutarlı bir çift veri seti oluşturmak için Flux difüzyon modeli çerçevesini artıran bir ilerleme önerdi:

Yeni projenin veri seti örnekleri. Kaynak: https://arxiv.org/pdf/2508.13065
Proje, yeni ve kapsamlı bir çift veri seti içerir; Odo, bu verilerde eğitilmiş bir difüzyon modeli ve vücut şekli düzenleme performansını nicel olarak değerlendirmek için tasarlanmış özel bir referans içerir. Testlerde, yazarlar, benzer modellere göre önemli bir ilerleme iddia etmektedir.
Yeni makale, Odo: Derinlik Kılavuzlu Difüzyon için Kimlik Koruyucu Vücut Yeniden Şekillendirme başlığını taşır ve Bangalore’daki Fast Code AI Pvt. Ltd.’de çalışan üç araştırmacı tarafından gelir.
Veri ve Yöntem
Araştırmacılar tarafından oluşturulan veri seti, her hedef vücut tipi için (şişman, zayıf ve kaslı) 7.615 yüksek çözünürlüklü (960x1280px) görüntü içerir.
İlk olarak, 1.523 insan yüzü, 12 milyar parametreli FLUX.1-dev difüzyon modeli kullanılarak oluşturuldu, ancak Pexels ve Unsplash’tan lisanssız referans yüzleri kullanarak çeşitliliği artırmak için.
Bu yüzleri tam vücut görüntülerine dahil etmek için, araştırmacılar ByteDance’in 2024 PuLID teklifini kullandı, bu, temel Flux üzerinde ince ayarlı bir kontrol noktasıydı ve yüz kimliğini koruyarak dönüşüm süreçlerinde yardımcı olmak için tasarlanmış bir karşıt ID kaybı içeriyordu:

PuLID projesinden örnekler. Kaynak: https://arxiv.org/pdf/2404.16022
Model, bir yüz görüntüsü ve cinsiyet, giyim, poz, sahn ve şişman, zayıf veya kaslı gibi vücut tipi için standartlaştırılmış bir istem aldı.
Her bir kimlik için üç vücut tipi görüntüsü bazen arka plan hizalaması ve algılanan konu boyutunda küçük kaymalar sergileyebilirdi, difüzyon modellerinin stokastik davranışından kaynaklanıyordu, burada her oluşturma yeni bir gürültü tohumu ile başlar. Ayrıca, istemdeki küçük değişiklikler, vücut tipi tanımını değiştirmek gibi, modelin örtük uzaydaki yolunu etkileyebilir ve görsel kaymaya neden olabilir.
Bu varyasyonu düzeltmek için, dört aşamalı bir otomatik post-işleme.pipeline uygulandı, her tripletin ince görüntüsü referans olarak seçildi, çünkü daha küçük silüeti daha fazla arka planı ortaya çıkardı.
Kişi algılama, RT-DETRv2 kullanılarak gerçekleştirildi, ardından SAM 2.1 ile tüm vücut tipleri için konu maskeleri çıkarıldı. İnce referans görüntüsü, arka planı temiz bir versiyon üretmek için FLUX.1 Kontext Pro’ya (yeni görüntü düzenleme sistemi) geçirildi.
Şişman ve kaslı varyantları, ince referans maskesinin yüksekliğine uniform ölçeklendirme kullanarak yeniden boyutlandırıldı ve aynı alt hizalamada temiz arka plana kompozit edildi, böylece tüm görüntüler boyunca tutarlı bir çerçeveleme sağlandı.
Araştırmacılar şunları belirtir:
‘Sonuç olarak, dönüşüm üçlüleri (ince, şişman ve kaslı) aynı arka plana ve uniform konu ölçeğine sahiptir. Bu, sonraki eğitimi veya değerlendirmeyi olumsuz etkileyebilecek istenmeyen varyasyonları ortadan kaldırır.’
Her bir kimlik için üç görüntü, altı olası dönüşüm çifti oluşturdu, bu da 7.615 kimlik boyunca teorik olarak 45.690 kombinasyon sağladı.
Örtüşen kıyafetler, doğal olmayan pozlar, bozulmuş uzuvlar, kimlik kayması veya minimal şekil değişikliği olan örnekleri çıkardıktan sonra, 18.573 yüksek kaliteli çift kaldı. Bazı küçük poz farklılıkları kaldı, ancak model bu varyasyonlara karşı dayanıklı olduğunu kanıtladı.
Eğitim ve Testler
Elde edilen görüntüler, Odo modelini eğitmek için kullanıldı – bir difüzyon tabanlı yaklaşım, insanların yeniden şekillendirilmesinde, Skinned Multi-Person Linear Model (SMPL, yani ara CGI) haritalarının kullanılmasıyla.
2024 Nöral Yerelleştiricilerin yöntemlerinden esinlenen veriler, her bir birey için SMPL figürüne uyacak şekilde optimize edildi ve elde edilen parametreler, değiştirilen görüntülerden türetilen derinlik haritaları oluşturmak için kullanıldı:

Eğitim pipeline şeması. Sol taraf, SMPL derinlik haritalarının hedef görüntüsünü, ReshapeNet’i ControlNet aracılığıyla vücut dönüşümünü gerçekleştirmek için yönlendirdiği eğitim kurulumunu gösterir. Kaynak görüntüsünden ReferenceNet tarafından çıkarılan özellikler, ReshapeNet’e spatial self-attention kullanılarak birleştirilir. Sağ taraf, çıkarım gösterir, burada SMPL parametreleri girişteki görüntüden tahmin edilir, anlamsal öznitelikler tarafından değiştirilir ve ReshapeNet’i koşullandırmak için bir hedef derinlik haritasına dönüştürülür.
Model (yukarıdaki şemaya bakınız), ReshapeNet modülünden oluşur ve üç yardımcı modülle desteklenir: ReferenceNet; bir IP-Adapter modülü ve bir derinlik tabanlı ControlNet modülü.
ReferenceNet, girdi görüntüsünden arka plan, kıyafet ve kimlik gibi ayrıntılı özellikleri çıkarır ve bunları ReshapeNet’e iletir. IP-Adapter, yüksek seviyeli özellik rehberliği sağlar, mentre Depth ControlNet, SMPL tabanlı koşullandırma uygular ve vücut dönüşümünü yönlendirir. Önceki çalışmalarda gösterildiği gibi, bir SDXL tabanlı dondurulmuş UNet ara özellikleri çıkarmak için kullanıldı.
IP-Adapter modülü, girdi görüntüsünü CLIP aracılığıyla kodlar, ortaya çıkan gömmeler, ReshapeNet’e çapraz dikkat kullanılarak entegre edilir.
Depth ControlNet modülü, ReshapeNet’in orta ve kodlayıcı katmanlarını kalıntı bağlantıları kullanarak yönlendirir. Ardından, hedef SMPL parametrelerinden oluşturulan bir derinlik haritasını alır ve bunu hedef görüntüsüyle hizalar.
ReshapeNet, SDXL UNet’e dayanır ve Odo’nun temel ağıdır. Eğitim sırasında, hedef görüntüleri, bir variational oto-encoder ile latent uzaya kodlanır, zaman içinde gürültülendirilir ve sonra ReshapeNet tarafından ControlNet ve ReferenceNet’ten alınan özellikler kullanılarak gürültüsüzleştirilir.
Kategoriye özgü metin istemleri, örneğin “Kişiyi daha şişman yapın”, “Kişiyi daha zayıf yapın” veya “Kişiyi daha kaslı yapın”, dönüşümleri yönlendirmek için eklendi. Derinlik haritaları, kaba vücut şekillerini yakalarken, istemler, kas tanımları gibi değişiklikler için gerekli anlamsal ayrıntıları sağladı ve modelin daha gerçekçi ve doğru değişiklikler üretmesini sağladı.
Eğitim Uygulaması
Odo, projenin sentetik veri setiyle birleştirilen DeepFashion-MultiModal veri setinin bir alt kümesiyle eğitildi, bu da toplam 20.000 görüntü çifti sağladı.
DeepFashion-MultiModal verileri, kıyafet ve yüz özellileri açısından çeşitlilik sağladı, görüntüler eğitim sırasında kendileri ile eşleştirildi. Tüm SMPL derinlik haritaları önceden hesaplandığı için, eğitim bir tek NVIDIA A100 GPU’da 80GB VRAM ile 60 epoch için çalıştırıldı.
Giriş görüntüleri 768×1024’e yeniden boyutlandırıldı, Adam optimizatörü 1×10⁻⁵’lik bir öğrenme hızında kullanıldı. ReshapeNet, SDXL UNet ağırlıklarıyla başlatıldı ve IP-Adapter’dan checkpoint’inden birlikte fine-tune edildi.
ReferenceNet, SDXL ağırlıklarıyla başlatıldı ve donduruldu, mentre Depth ControlNet, önceden eğitilmiş ağırlıkları kullandı ve aynı şekilde donduruldu.
Son model yaklaşık 23GB GPU belleği gerektiriyordu ve tek görüntü çıkarımı 18 saniye sürüyordu.
Yeni Bir Metrik
Bu tür bir projenin gerektirdiği veri setlerinin eksikliği, mevcut metriklerin gerçekten bu zorluğu ele almadığı anlamına geliyordu. Bu nedenle, yazarlar, 3.600 görüntü çiftini içeren yeni bir referans oluşturdular, gerçek yüz görüntüleri ve arka plan açıklamaları, çeşitli vücut şekli değişiklikleri ile birlikte.
Diğer kullanılan metrikler, Yapısal Benzerlik Endeksi (SSIM); Peak Sinyal-Gürültü Oranı (PSNR); Öğrenilmiş Algısal Görüntü Yama Benzerliği (LPIPS); ve Ölçek Düzeltmeli Her Vertebral Euclidean Hatası (nötr T-pozisyonunda) (PVE-T-SC).
Öncelikle, yazarlar, eğitim sırasında modelin görmediği gerçek dünya görüntüleri ile yöntemlerini nitel olarak test ettiler:

Nitel testler. Örnekler, orijinal görüntüden daha ince, şişman ve kaslı vücut tiplerine dönüşümleri gösterir, çeşitli pozlar dahil, oturma ve ayakta durma. Kaynak makalede daha iyi tanımlama ve ayrıntı için başvurunuz.
Bu sonuçlarla ilgili olarak, makale şunları belirtir:
‘Yöntemimiz, çeşitli pozlar, arka planlar ve kıyafetler boyunca kişilik kimliğini korurken etkili bir şekilde çalışır.
‘Ek olarak, SMPL hedef şekillerine ek olarak, ‘Kişiyi daha şişman yapın’, ‘Kişiyi daha zayıf yapın’ veya ‘Kişiyi daha kaslı yapın’ gibi metin istemleri sağlamak, istenen dönüşümleri açıkça yönlendirmek için kullanılır…
… ‘[Aşağıdaki görüntü] ayrıca modelimizin çeşitli şekil dönüşümlerini gerçekleştirebileceğini gösterir. Model, SMPL derinlik haritalarını doğru bir şekilde takip ederek orijinal görüntüden daha ince ve daha şişman sürümler üretir.’

Hedef vücut tipleri aralığını kapsayan daha fazla nitel test. Kaynak makalede daha iyi tanımlama ve ayrıntı için başvurunuz.
Araştırmacılar ayrıca şunları belirtir:
‘Sonuçlarımız, hedef ağırlığa göre daha gerçekçi dönüşümler gösterir, modelimiz aynı zamanda genel vücut şeklini, uzuv oranlarını ve kıyafetleri değiştirir, böylece anatomi olarak tutarlı ve görsel olarak ikna edici değişiklikler sağlar.’
Nicel testler için, yazarlar, sistemlerini açık kaynaklı Flux Kontext [dev] modeli ve FLUX.1 ile karşılaştırdı, ayrıca 2022 çalışması Yapıya Duyarlı Akış Oluşturma için İnsan Vücut Yeniden Şekillendirme.
FLUX.1 Kontext [dev] için, istemler, ‘Kişiyi daha şişman yapın’, ‘Kişiyi daha zayıf yapın’ veya ‘Kişiyi daha kaslı yapın’ gibi, hedef ağırlıkları belirtmek için tasarlandı, ancak ince ayar kontrollerinin eksikliği performansı sınırladı:
![Test setinde Odo ile Yapıya Duyarlı Akış Oluşturma için İnsan Vücut Yeniden Şekillendirme ve FLUX.1 Kontext [dev] arasındaki karşılaştırma, ayrıca ReshapeNet'te istem koşullandırması olmadan, yalnızca IP-Adapter kullanarak veya yalnızca BR-5K veri setine bağlı eğitim ile eğitilen modeller için soykütük sonuçları. Bu makalede bu soykütük çalışmaları ele alınmıyor.](https://www.unite.ai/wp-content/uploads/2025/08/table-2-1.jpg)
Test setinde Odo ile Yapıya Duyarlı Akış Oluşturma için İnsan Vücut Yeniden Şekillendirme ve FLUX.1 Kontext [dev] arasındaki karşılaştırma, ayrıca ReshapeNet’te istem koşullandırması olmadan, yalnızca IP-Adapter kullanarak veya yalnızca BR-5K veri setine bağlı eğitim ile eğitilen modeller için soykütük sonuçları. Bu makalede bu soykütük çalışmaları ele alınmıyor.
Sonuç
Bu yıl Flux Kontext’in ortaya çıkması ve daha da yakın zamanda Qwen Image Edit için nicelleştirilmemiş ağırlıkların yayınlanması, çift görüntü verilerini hobi ve profesyonel toplulukların ön planına geri getirdi. Artan eleştiriler ve generatif AI’nin doğruluğuna ilişkin sabırsızlık ortamında, bu tür modeller, girişteki kaynak görüntülerine çok daha yüksek bir doğrulukla tasarlanmıştır (ancak daha küçük ölçekli modeller bazen çok özel eğitim hedefleri tarafından engellenir).
Bu durumda, bir vücut şekillendirme sisteminin faydası, psikolojik, tıbbi ve moda tabanlı alanlarda gibi görünmektedir. Bununla birlikte, bu tür sistemlerin daha yüksek bir düzeyde tanınma elde etmesi ve belki de daha casual ve potansiyel olarak endişe verici bir dizi kullanım alanı elde etmesi mümkündür.
İlk olarak 25 Ağustos 2025 Pazartesi günü yayınlandı












