Anderson’un Açısı
İnsan Görüntü Sentezinde ‘Kötü Saç Günleri’ne Çözüm Bulmak

Roma heykeltraşlığı altın çağından bu yana, insan saçını betimlemek zor bir challenge olmuştur. Ortalama bir insan başı 100.000 saç teli içerir, rengine göre değişen refraktif indekslere sahiptir ve belirli bir uzunluğun ötesinde, yalnızca karmaşık fizik modelleri ile simüle edilebilecek şekilde hareket eder ve yeniden şekillenir – şimdiye kadar yalnızca geleneksel CGI metodolojileri ile uygulanabilir.

2017 yılında Disney tarafından yapılan bir araştırmadan, fizik tabanlı bir modelin bir CGI iş akışında gerçekçi hareketi bir sıvı saç stiline uygulamaya çalışması. Kaynak: https://www.youtube.com/watch?v=-6iF3mufDW0
Sorun, modern popüler deepfakes yöntemleri tarafından kötü bir şekilde ele alınmaktadır. Birkaç yıldır, önde gelen paket olan DeepFaceLab, yalnızca kısa (genellikle erkek) saç stillerini yakalayabilen bir ‘tam baş’ modeline sahiptir ve yakın zamanda DFL’nin stablemate olan FaceSwap, BiseNet semantic segmentation modelinin bir uygulamasını sunmuştur, böylece bir kullanıcı deepfake çıktısına kulaklar ve saç ekleyebilir.
Çok kısa saç stillerini betimlemeye çalışırken bile, sonuçlar genellikle kalite açısından çok sınırlı olur, tam başlar görüntüye yerleştirilmiş gibi görünürler.
GAN Saç
İnsan simülasyonu için iki büyük rakip yaklaşım vardır: Nöral Işın Alanları (NeRF) ve Generatif Karşıt Ağlar (GAN’lar). NeRF, bir sahneyi birden fazla görüş açisinden yakalayabilir ve bu görüş açılarını bir keşfedilebilir nöral ağ içinde 3B temsil olarak kapsülleyebilir. GAN’lar ise özellikle insan görüntü sentezinde daha gelişmiştir.
NeRF’in 3B geometri anlayışını taklit etmesi, bir sahneyi büyük bir Sadakat ve tutarlılıkla yeniden oluşturmasına olanak tanır, ancak şimdiye kadar fizik modellerinin uygulanması için çok az olanak sağlar. NeRF, insan saç hareketini yeniden üretme açısından çok sınırlı olanaklara sahiptir.
GAN tabanlı NeRF eşdeğerleri, NeRF’in aksine, GAN’ın gizli uzayı 3B bilgiyi yerli olarak içermeyen bir handikapla başlar. Bu nedenle, 3B bilgisi olan GAN tabanlı yüz görüntü sentezi, son yıllarda görüntü oluşturma araştırmalarında sıcak bir konu haline gelmiştir. 2019’da InterFaceGAN, bu alanda önemli bir atılımdır.
InterFaceGAN’ın gösterilen ve seçilen sonuçları, nöral saç tutarlılığının, potansiyel VFX iş akışları açısından zaman tutarlılığı açısından zor bir challenge olduğunu göstermektedir.

InterFaceGAN’dan bir poz değişikliğinde ‘sizzling’ saç. Kaynak: https://www.youtube.com/watch?v=uoftpl3Bj6w
Latent uzay alone aracılığıyla tutarlı görünüm oluşturmanın bir alşimya gibi bir pursuit olduğu giderek daha açık hale gelmektedir. Artık, giderek daha fazla sayıda makale, GAN iş akışına 3B bilgi olarak CGI tabanlı 3B bilgiyi dahil etmektedir.
CGI öğesi, ara 3B primitifleri olarak temsil edilebilir veya NeRF’e benzer bir şekilde, geometri kaynak görüntülerden veya videodan değerlendirilir.
Bu alanda yeni bir çalışma, Multi-View Consistent Generative Adversarial Networks for 3D-aware Image Synthesis (MVCGAN), ReLER, AAII, University of Technology Sydney, Alibaba Group’un DAMO Academy ve Zhejiang Üniversitesi arasında bir işbirliğidir.

MVCGAN tarafından CELEBA-HQ veri setinden türetilen görüntülerden oluşturulan inandırıcı ve güçlü yeni yüz pozları. Kaynak: https://arxiv.org/pdf/2204.06307.pdf
MVCGAN, bir GAN’da geometrik kısıtlamalar sağlamak için bir Generative Radiance Field Network (GRAF) içerir ve bu, GAN tabanlı yaklaşımların en otantik poz oluşturma yeteneklerinden bazılarını elde etmesini sağlar.
Ancak, MVCGAN için ek materyaller, saç hacmi, yerleştirme, davranış tutarlılığının, dışarıdan dayatılan 3B geometri tabanlı kısıtlamalarla kolayca çözülemeyen bir problem olduğunu ortaya koymaktadır.

Yayımlanma zamanında halka açık olmayan ek materyallerden, MVCGAN’ın yüz poz sentezinin mevcut durumun ötesinde bir ilerleme olduğunu, ancak zaman tutarlılığının hala bir problem olduğunu göstermektedir.
‘Sade’ CGI iş akışları hala zamanlı saç tái oluşturmayı bir challenge olarak görüyor, bu nedenle geleneksel geometri tabanlı yaklaşımların, latent uzaya tutarlı saç sentezini getireceğine inanmak için bir neden yoktur.
Convolutional Neural Networks ile Saç İstikrarı
İsveç’teki Chalmers Teknoloji Enstitüsü’nden üç araştırmacı tarafından yapılacak bir makale, nöral saç simülasyonu alanında ek bir ilerleme vaat ediyor.

Sol taraf, CNN ile stabilize edilmiş saç temsili, sağ taraf, gerçek değer. Makale sonundaki gömülü videoyu daha yüksek çözünürlük ve ek örnekler için görün. Kaynak: https://www.youtube.com/watch?v=AvnJkwCmsT4
Makale, Gerçek Zamanlı Saç Filtreleme ile Convolutional Neural Networks olarak adlandırılmaktadır ve Mayıs ayında i3D simpozyumunda yayımlanacaktır.
Sistem, saç çözünürlüğü değerlendirebilen, kendiliğinden gölgelendirmeyi ve saç kalınlığını dikkate alan bir oto-encoder tabanlı ağ içerir ve bu, gerçek zamanlı olarak OpenGL geometrisi tarafından üretilen sınırlı sayıda stokastik örnekleme ile gerçekleştirilir.
Yaklaşım, sınırlı sayıda örnek ile stokastik şeffaflıkla işler ve ardından orijinal görüntüyü yeniden oluşturmak için bir U-net eğitir.

MVCGAN altında, bir CNN, stokastik örneklenen renk faktörlerini, vurguları, teğetleri, derinlikleri ve alfa değerlerini filtreler ve sentezlenen sonuçları bir bileşik görüntüye monte eder.
Ağ, PyTorch’da eğitilir ve altı ila on iki saat arasında, ağ hacmine ve girdi özelliklerinin sayısına bağlı olarak coverger. Eğitilen parametreler (ağırlıklar) daha sonra sistemin gerçek zamanlı uygulamasında kullanılır.
Eğitim verisi, çeşitli mesafeler ve pozlar ile birlikte dümdüz ve dalgalı saç stilleri için birkaç hundred görüntü oluşturularak üretilir.

Çeşitli eğitim girişleri.
Örneklerin saç saydamlığı, stokastik şeffaflıkla yüksek çözünürlükte işlenen görüntülerden hesaplanır. Orijinal yüksek çözünürlük veri seti, ağ ve donanım limitlerini karşılayabilmek için aşağı örneklenir ve daha sonra yeniden örneklenir.
Gerçek zamanlı çıkarım uygulaması (eğitilen modelden türetilen algoritmayı kullanan ‘canlı’ yazılım), NVIDIA CUDA ile cuDNN ve OpenGL kullanır. İlk girdi özellikleri, OpenGL çok örneklenen renk tamponlarına dökülür ve sonuç, cuDNN tensörlerine işlenmek üzere aktarılır. Bu tensörler daha sonra ‘canlı’ OpenGL dokusuna kopyalanır ve nihai görüntüye yerleştirilir.
Gerçek zamanlı sistem, 1024×1024 piksel çözünürlüğe ulaşan bir NVIDIA RTX 2080’da çalışır.
Saç renk değerleri, ağ tarafından elde edilen nihai değerlerde tamamen ayrılmıştır, bu nedenle saç rengini değiştirmek zor değildir, ancak efektler gibi gradyanlar ve çizgiler hala bir challenge olarak kalır.

Yazarlar, makaledeki değerlendirmeler için kullanılan kodu GitLab’da yayımlamışlardır. Aşağıdaki MVCGAN için ek videoyu görün.
Sonuç
Bir oto-encoder veya GAN’ın latent uzayını gezinmek, hala bir gemi kullanmaktan daha çok bir yelkenli gemi kullanmaya benzer. Sadece çok yakın bir zamanda, NeRF, GAN’lar ve non-deepfake (2017) oto-encoder çerçeveleri gibi yaklaşımlarda ‘daha basit’ geometri olan yüzlerin poz oluşturma için inandırıcı sonuçlar görmeye başlıyoruz.
İnsan saçının önemli mimari karmaşıklığı, fizik modellerini ve diğer özelliklerini dahil etme ihtiyacıyla birleştiğinde, saç sentezinin genel yüz sentezinin bir parçası olarak kalması unlikely görünmektedir. Saç sentezi, daha sofistike ve ayrı ağlara ihtiyaç duyacaktır – ancak bu ağlar daha geniş ve daha karmaşık yüz sentez çerçevelerine dahil olabilir.
İlk olarak 15 Nisan 2022’de yayımlanmıştır.













