Anderson’un Açısı

İnsan Vücut Tiplerini AI ile Yeniden Şekillendirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çin’den yeni bir araştırma işbirliği, koordine edilmiş bir ikiz nöral kodlayıcı ağı kullanarak, parametrik bir model tarafından yönlendirilen ve bir son kullanıcıya ağırlık, yükseklik ve vücut oranını etkileşimli bir GUI’de değiştirme izni veren insan vücudunu görüntülerde yeniden şekillendirme için yeni bir yöntem sunuyor.

Parametrik vücut şekli modülasyonu, üç kullanılabilir özelliği değiştiren kaydırma çubukları ile. Kaynak: https://arxiv.org/pdf/2203.10496.pdf

Parametrik vücut şekli modülasyonu, üç kullanılabilir özelliği değiştiren kaydırma çubukları ile. Kaynak: https://arxiv.org/pdf/2203.10496.pdf

Çalışma, Alibaba’dan son benzer bir projeye göre birkaç gelişme sunuyor, çünkü hem yükseklik hem de vücut oranını değiştirebiliyor ve ‘slimmer’ vücut görüntülerinde ortaya çıkan (yok olan) arka planı ‘inpainting’ için ayrı bir nöral ağa sahip. Ayrıca, daha önceki bir parametrik yöntemden daha iyi bir performans gösteriyor ve dönüşümün formülasyonunda insan müdahalesine gerek kalmıyor.

Yeni mimari, NeuralReshaper olarak adlandırıldı ve bir parametrik 3D insan şablonunu kaynak görüntüsüne uydurup ardından orijinal görüntüyü yeni parametrelerle uyumlu hale getiriyor.

Sistem, giyinik ve yarı giyinik (yani plaj giysileri) figürlerde vücut dönüşümlerini işleyebiliyor.

Bu tür dönüşümler, moda AI araştırma sektörünün ilgi odağı, StyleGAN/CycleGAN tabanlı ve genel nöral ağ platformları için sanal deneme olanakları sunuyor ve kullanıcıya ait bir görüntüye göre giyim eşyalarını uyarlayabiliyor veya görsel uyumu sağlıyor.

Makale, Single-image Human-body Reshaping with Deep Neural Networks olarak adlandırıldı ve Zhejiang Üniversitesi ve Hong Kong City Üniversitesi’nden araştırmacılar tarafından hazırlandı.

SMPL Uyumlaştırma

NeuralReshaper, Max Planck Enstitüsü için Akıllı Sistemler ve endüstriyel ışık ve magic (Industrial Light and Magic) tarafından 2015 yılında geliştirilen Skinned Multi-Person Linear Model (SMPL) kullanıyor.

SMPL Parametrik insanlar, 2015 Planck/ILM işbirliğinden. Kaynak: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametrik insanlar, 2015 Planck/ILM işbirliğinden. Kaynak: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Sürecin ilk aşamasında, vücut dönüşümlerinin yapılacağı kaynak görüntüsünden bir SMPL modeli oluşturuluyor. SMPL modelinin görüntüye uyarlama işlemi, Almanya ve ABD’deki üniversiteler tarafından 2018 yılında önerilen İnsan Mesh Kurtarma (HMR) yönteminin metodolojisini takip ediyor.

Deformasyon için üç parametre (ağırlık, yükseklik, vücut oranı) bu aşamada hesaplanıyor ve kamera parametreleri gibi faktörler de dikkate alınıyor. 2D anahtar noktaları ve oluşturulan silüet hizalama, deformasyon için 2D silüet şeklinde bir sınır oluşturuyor ve arka planın gerçekçi bir şekilde boyanmasını sağlıyor.

SMPL uyarlama aşamaları: soldan sağa, kaynak görüntü; ikinci soldan, 2016 araştırmasıyla elde edilen optimize sonuç; üçüncü soldan, önceden eğitilmiş modelin doğrudan çıkarımı; ikinci sağdan, 2D anahtar noktalarının optimize edilmesi sonucu; ve sağdan, silüet optimize edilerek tamamlanan uyarlama.

SMPL uyarlama aşamaları: soldan sağa, kaynak görüntü; ikinci soldan, 2016 araştırmasıyla elde edilen optimize sonuç; üçüncü soldan, önceden eğitilmiş modelin doğrudan çıkarımı; ikinci sağdan, 2D anahtar noktalarının optimize edilmesi sonucu; ve sağdan, silüet optimize edilerek tamamlanan uyarlama.

3D deformasyon daha sonra mimarinin görüntü alanına projekte ediliyor ve yoğun bir deformasyon alanı oluşturuluyor. Bu işlem yaklaşık 30 saniye sürüyor.

NeuralReshaper Mimarisi

NeuralReshaper, iki nöral ağ kullanıyor: ön plan kodlayıcı, vücut şeklini değiştiriyor ve arka plan kodlayıcı, ‘de-occluded’ arka plan bölgelerini dolduruyor.

U-net tarzı çerçeve, iki kodlayıcının özelliklerini birleştirerek birleştirilmiş bir çıktı üretiyor. Mimaride, birleştirme için yeni bir warp yönlendirmeli mekanizma bulunuyor.

Eğitim ve Deneyler

NeuralReshaper, PyTorch kullanarak tek bir NVIDIA 1080ti GPU’da 11gb VRAM ile uygulanıyor. Ağ, 100 epoch için Adam optimizatörü ile eğitiliyor ve jeneratör için hedef kaybı 0.0001, ayrımcı için hedef kaybı 0.0004 olarak ayarlanıyor. Eğitim, özel bir açık hava veri seti için 8’lik bir toplu işleme boyutunda ve DeepFashion veri seti için 2’lik bir toplu işleme boyutunda gerçekleşiyor.

Soldan sağa, orijinal görüntüler ve NeuralReshaper'ın yeniden şekillendirdiği görüntüler.

Soldan sağa, orijinal görüntüler ve NeuralReshaper’ın yeniden şekillendirdiği görüntüler.

Aşağıda, yalnızca DeepFashion veri setinden NeuralReshaper için eğitilmiş örnekler bulunuyor, orijinal görüntüler her zaman solda yer alıyor.

Üç kontrol edilebilir öznitelik, ayrı ayrı uygulanabiliyor.

Dış mekan veri setindeki dönüşümler daha zorlu, çünkü genellikle karmaşık arka planların doldurulması ve transformed vücut tiplerinin net bir şekilde belirlenmesi gerekiyor:

Parametrik Gereklik

Makaleye göre, aynı görüntüdeki bu tür dönüşümler, görüntü sentezinde çözülmesi zor bir problemi temsil ediyor. Birçok dönüşüm GAN ve kodlayıcı çerçevesi, çift görüntüler (örneğin, ‘önce ve sonra’ görüntüleri) kullanabiliyor.

Ancak, bu durumda, aynı insanların farklı fiziksel konfigürasyonlarda görüntülerini içeren görüntü çiftlerine ihtiyaç duyuluyor – diyet veya plastik cerrahi reklamlarındaki ‘önce ve sonra’ görüntüleri gibi veri, elde edilmesi veya üretilmesi zor.

Alternatif olarak, dönüşüm GAN ağları, daha çeşitli veri üzerinde eğitim alabilir ve dönüşümleri, kaynak görüntü latent kodunu ve istenen sınıfı (bu durumda ‘şişman’, ‘zayıf’, ‘uzun’ vb.) birleştiren latent yönü arayarak gerçekleştirebilir. Ancak, bu yaklaşım, ince vücut şekli yeniden şekillendirmesi için şu anda çok sınırlı.

Nöral Işın Alanları (NeRF) yaklaşımı, tam vücut simülasyonu açısından çoğu GAN tabanlı sistemden daha ileridedir, ancak sahne özgüdür ve kaynak yoğundur ve şu anda vücut tiplerini granül bir şekilde düzenleme yeteneği sınırlıdır (örneğin, tüm vücudu çevrelerine göre küçültme dışında).

GAN’ların latent alanı yönetilmesi zordur; VAE’ler alone, tam vücut yeniden üretiminin karmaşıklıklarını henüz ele alamıyor ve NeRF’in insan vücudunu tutarlı ve gerçekçi bir şekilde yeniden şekillendirebilme yeteneği henüz yeni ortaya çıkıyor. Bu nedenle, SMPL gibi ‘geleneksel’ CGI metodolojilerinin insan görüntü sentezi araştırma sektöründe devam etmesi muhtemel, çünkü henüz tam olarak anlaşılmayan özellikler, sınıflar ve latent kodların parametrelerini ve kullanışlılıklarını bir araya getirmek için bir yöntem olarak görülüyor.

 

İlk olarak 31 Mart 2022’de yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]