Anderson’un Açısı
Tam Vücut Derin Sahtecilik için Birden Çok NeRF’i Birleştiren EVA3D

Görüntü sentezleme araştırması sektörü, çeşitli giysiler içindeki genç insanların tam vücut video ve resimlerini oluşturabilen sistemler için yeni önerilerle dolu. Çoğunlukla üretilen görüntüler durağandır; bazen temsil edilenler hareket eder, ancak genellikle çok iyi değildir.
Bu özel araştırma alanındaki ilerleme hızı, ilgili alanlardaki gibi latent difüzyon modelleri gibi alanlardaki şaşırtıcı ilerleme seviyesine kıyasla çok yavaştır; ancak araştırma grupları, çoğunlukla Asya’da, bu problemi çözmeye kararlı bir şekilde çalışmaya devam etmektedir.

Sanal deneme sistemlerinden biri, makineler öğrenme tabanlı nesne tanıma yoluyla vücutlar değerlendirilir ve proposed kıyafetlere uyarlanır. Kaynak: https://www.youtube.com/watch?v=2ZXrgGyhbak
Hedef, moda ve giyim pazarı için ‘sanal deneme’ sistemlerini oluşturmaktır – müşteriye ve mevcut veya piyasaya sürülecek olan ürünün türüne göre uyarlanabilen sistemler, gerçek zamanlı üzerine bindirme kıyafet veya müşterilerin kendi resimlerini göndermeleri için makine öğrenimi tabanlı işleme hatlarına ihtiyaç duymadan.
Popüler sentez mimarileri, bu görevi kolayca uyarlanabilir görünmüyor: Generatif Karşıt Ağlar (GAN’lar)ın latent alanı, inandırıcı temporal hareket üretmeye uygun değildir (veya genel olarak düzenleme için); Nöral Işın Alanları (NeRF) gerçekçi insan hareketleri üretebilmelerine rağmen, genellikle düzenlemeye karşı doğal olarak dirençlidir; otokodlayıcılara, kişi ve kıyafete özgü eğitim gerekirdi ve latent difüzyon modelleri, GAN’lar gibi, video oluşturma için yerli temporal mekanizmalara sahip değildir.
EVA3D
Buna rağmen, makaleler ve öneriler devam etmektedir. En sonuncusu, diğerlerinin arasında, ilginç bir yaklaşımın ilk işareti olarak dikkat çekmektedir – birden fazla Nöral Işın Alanı ağı kullanmak, her biri vücuttan ayrı bir parçaya adanmış ve daha sonra birleştirilmiş ve tutarlı bir görselleştirme oluşturmak için birleştirilmiştir.
EVA3D, Singapur’un Nanyang Teknoloji Üniversitesi’nden, bu yaklaşımın ilk işareti olarak dikkat çekmektedir – birden fazla Nöral Işın Alanı ağı kullanmak, her biri vücuttan ayrı bir parçaya adanmış ve daha sonra birleştirilmiş ve tutarlı bir görselleştirme oluşturmak için birleştirilmiştir.

EVA3D için birden fazla NeRF ağından oluşan mobil bir genç kadın. Kaynak: https://hongfz16.github.io/projects/EVA3D.html
Sonuçlar, hareket açısından… iyi. EVA3D’nin görselleştirmeleri, tuhaf vadiden çıkmış olmasa da, en azından çıkış noktasını görebiliyor.

EVA3D’yi dikkat çekici kılan şey, bu sektördeki diğer araştırmacılardan neredeyse benzersiz bir şekilde, tam vücut görüntüsü sentezleme için tek bir ağın (GAN, NeRF veya başka bir şey) yeterli olmayacağını anlamış olması – kısmen araştırma hızından ve kısmen de donanım ve diğer lojistik sınırlamalardan dolayı.
Bu nedenle, Nanyang ekibi görevi 16 ağ ve çoklu teknolojiye bölmüşlerdir – Block-NeRF ve CityNeRF‘de already kullanılan bir yaklaşım ve gelecekte tam vücut derin sahteciliği elde etmek için potansiyel olarak verimli bir yol olarak görünen bir yaklaşım.
Tüm bu ‘sanal deneme’ oluşturma zorluklarının hepsi teknik veya lojistik değildir ve makale, özellikle denetimsiz öğrenme ile ilgili bazı veri sorunlarına dikkat çekmektedir:
‘[Moda] veri setleri genellikle çok sınırlı insan duruşlarına sahiptir (çoğu benzer ayakta duruşlardır) ve dengesiz görüş açısına sahiptir (çoğu ön görünümdür). Bu dengesiz 2B veri dağılımı, 3B GAN’ların denetimsiz öğrenimini engelleyebilir ve yeni görünüm / duruş sentezinde zorluklara neden olabilir. Bu nedenle, bu sorunu hafifletmek için uygun bir eğitim stratejisi gerekli.’
EVA3D iş akışı, insan vücudunu 16 ayrı parçaya ayırır, her biri kendi NeRF ağıyla oluşturulur. Açıkçası, bu, figürü hareket yakalama veya diğer hareket verisi türleri aracılığıyla canlandırabilmek için yeterli ‘dondurulmamış’ bölümler oluşturur. Bunun yanı sıra, sistem ayrıca genel izlenimi ‘satmak’ için vücut parçalarına maksimum kaynağı atayabilir.
Örneğin, insan ayakları çok sınırlı bir eklem hareketine sahiptir, mientras ki yüz ve başın otantikliği, ayrıca tüm vücut hareketinin kalitesi, genel olarak oluşturmanın otantiklik tokeni olacaktır.

EVA3D ve önceki yöntemler arasındaki nitel bir karşılaştırma. Yazarlar, bu konuda SOTA sonuçları iddia ediyorlar.
Yaklaşım, NeRF merkezli projeye, 2021’den A-NeRF‘e, University of British Columbia ve Reality Labs Research’ten, radikal olarak farklıdır – bir ‘tek parça’ NeRF temsilinin içine, VFX endüstrisinin uzun süredir CGI karakterleri canlandırmak için kullandığı aynı esnek ve eklemlenmiş merkezi iskeleti eklemeye çalışmıştır, bu da vücut parçalarına ihtiyaç duyulan temelde işlem kaynaklarını atamayı daha zor hale getirmiştir.

Önceki hareketler – A-NeRF, ‘pişirilmiş’ bir NeRF’e, VFX endüstrisinin uzun süredir kullandığı aynı esnek ve eklemlenmiş merkezi iskeleti ekler. Kaynak: https://lemonatsu.github.io/anerf/
Diğer benzer insan merkezli projelerde olduğu gibi, EVA3D, sentez yöntemlerinin soyut genellemesine enstrümantalite eklemek için ‘geleneksel’ CGI tabanlı bir yöntem olan SMPL (Skinned Multi-Person Linear Model) kullanır. Bu yılın başlarında, Zhejiang Üniversitesi ve Hong Kong City Üniversitesi’nden bir başka makale, nöral vücut yeniden şekillendirme için bu yöntemleri kullanmıştır.
Yöntem
EVA3D’de kullanılan SMPL modeli, insan ‘önceli’ – yani EVA3D tarafından derin sahtecilik yapılan kişi – için ayarlanmıştır ve skinning ağırlıkları, kanonik uzay (yani SMPL modelinin ‘dinlenme’ veya ‘nötr’ pozisi) ile nihai görünüm arasındaki farkları müzakere eder.
Yukarıdaki illüstrasyonda görüldüğü gibi, SMPL’nin sınırlayıcı kutuları, sonunda vücut oluşturacak 16 ağın sınır tanımları olarak kullanılır. SMPL’nin ters Linear Blend Skinning (LBS) algoritması, görünen örneklenen ışınları pasif poza (kanonik uzay) aktarır. Sonra, 16 alt-ağ, bu konfigürasyonlara göre sorgulanır ve nihayetinde bir nihai görselleştirme oluşturmak için birleştirilir.
Tam NeRF bileşimi, daha sonra 3B insan GAN çerçevesini oluşturmak için kullanılır.

İkinci aşama GAN çerçevesinin görselleştirmeleri, sonunda insanlara ve moda ile ilgili gerçek 2B resim koleksiyonlarına karşı eğitilecektir.
Her bir alt-ağ, vücuttan bir parçayı temsil eder ve yığınlanmış Çok Katmanlı Perseptörler (MLP’ler) ile SIREN (Sinüsoidal Temsil Ağları) aktivasyonu içerir. SIREN, bu tür bir iş akışında ve benzer projelerde birçok sorunu çözer, ancak genelleştirmek yerine aşırı uyarlama eğilimindedir ve araştırmacılar, gelecekte alternatif kütüphanelerin kullanılabileceğini önermektedir (makalenin sonuna bakınız).
Veri, Eğitim ve Testler
EVA3D, moda tabanlı veri setlerinin sınırlı ve şablonlu stillerinden kaynaklanan alışılmadık veri sorunlarıyla karşı karşıyadır – bu veri setleri, alternatif veya yeni görüntülere sahip değildir ve muhtemelen kasten tekrarlayıcıdır, böylece dikkat, kıyafetlere değil, onları giyen insana odaklanır.
Bu dengesiz duruş dağılımı nedeniyle, EVA3D, SMPL şablon geometrisine dayanan insan öncellerini kullanır ve sonra bu duruşun bir İmza Mesafesi Alanı (SDF) ofsetini öngörür, değil direkt hedef duruşu.
Destekleyici deneyler için araştırmacılar, dört veri setini kullandı: DeepFashion; SHHQ; UBCFashion; ve AIST Dans Videosu Veri Tabanı (AIST Dans DB).
Son iki veri seti, ilk iki veri setine göre daha çeşitli duruşlara sahiptir, ancak aynı bireyleri tekrarlayarak sunar, bu da bu çeşitliliği iptal eder; kısacası, görev verilen veri setleri zorludur.

SSHQ’dan örnekler. Kaynak: https://arxiv.org/pdf/2204.11823.pdf
Kullanılan referanslar, 2B resim veri setlerinden NeRF görsellerini oluşturan ilk proje olan ENARF-GAN; Stanford ve NVIDIA’ (NVDA ) nın EG3D; ve StyleSDF, Washington Üniversitesi, Adobe (ADBE ) Research ve Stanford Üniversitesi arasındaki bir işbirliği – tümü, yüksek çözünürlüğe ölçeklenebilmeleri için süper çözünürlük kütüphanelerini gerektiren yöntemlerdir.
Kullanılan metrikler, tartışmalı Frechet Inception Distance (FID) ve Çekirdek Inception Distance (KID) ile birlikte, Doğru Nokta Yüzdesi (PCKh@0.5) idi.
Niteliksel değerlendirmelerde, EVA3D dört veri setinde tüm metriklerde liderlik etti:

Niteliksel sonuçlar.
Araştırmacılar, EVA3D’nin geometri oluşturma için en düşük hata oranını elde ettiğini, bu tür bir projede kritik bir faktör olduğunu belirtiyorlar. Ayrıca, sistemlerinin oluşturulan duruşu kontrol edebildiğini ve EG3D’den daha yüksek PCKh@0.5 puanları elde ettiğini gözlemlediler, bu, yalnızca bir kategoride daha yüksek puan alan tek rakip yöntemdir.
EVA3D, 512x512px çözünürlükte yerli olarak çalışır, ancak kolayca ve etkili bir şekilde HD çözünürlüğe, Google’ın最近 yaptığı gibi Imagen Video gibi 1024 çözünürlükte metin-videoya dönüştürme teklifine benzer şekilde, ölçeklenebilir.
Yöntem sınırsız değildir. Makale, SIREN aktivasyonunun dairesel sanat eserleri oluşturabileceğini belirtir, bu, alternatif bir temel temsilin, örneğin EG3D’nin, 2B bir декодер ile birleştirilmesiyle gelecekteki sürümlerde giderilebilir. Ayrıca, SMPL’yi moda veri kaynaklarına doğru bir şekilde uydurmak zordur.
Son olarak, sistem büyük ve daha akışkan kıyafet parçalarını, örneğin büyük elbise gibi, kolayca barındıramaz; bu tür giysiler, nöral olarak oluşturulan saçların oluşturulmasında olduğu gibi aynı tür sıvı dinamiklerini gösterir. Muhtemelen, uygun bir çözüm her iki sorunu da ele alabilir.
İlk olarak 12 Ekim 2022’de yayımlanmıştır.















