Sudut Anderson

Mengatasi ‘Hari Rambut Buruk’ dalam Sintesis Gambar Manusia

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Sejak zaman keemasan patung Romawi, menggambarkan rambut manusia telah menjadi tantangan yang sulit. Rata-rata kepala manusia mengandung 100.000 helai, memiliki indeks refraksi yang bervariasi sesuai dengan warnanya, dan, di luar panjang tertentu, akan bergerak dan berubah bentuk dengan cara yang hanya dapat disimulasikan oleh model fisika yang kompleks – sampai saat ini, hanya dapat diterapkan melalui metodologi CGI ‘tradisional’.

Dari penelitian 2017 oleh Disney, model berbasis fisika mencoba menerapkan gerakan rambut yang realistis dalam alur kerja CGI. Sumber: https://www.youtube.com/watch?v=-6iF3mufDW0

Dari penelitian 2017 oleh Disney, model berbasis fisika mencoba menerapkan gerakan rambut yang realistis dalam alur kerja CGI. Sumber: https://www.youtube.com/watch?v=-6iF3mufDW0

Masalah ini tidak terpecahkan dengan baik oleh metode deepfakes modern yang populer. Selama beberapa tahun, paket terkemuka DeepFaceLab telah memiliki model ‘kepala penuh’ yang hanya dapat menangkap bentuk kaku dari gaya rambut pendek (biasanya pria); dan baru-baru ini DFL stablemate FaceSwap (kedua paket ini berasal dari kode sumber DeepFakes kontroversial 2017) telah menawarkan implementasi dari BiseNet model segmentasi semantik, yang memungkinkan pengguna untuk menyertakan telinga dan rambut dalam output deepfake.

Even ketika menggambarkan gaya rambut yang sangat pendek, hasilnya cenderung sangat terbatas dalam kualitas, dengan kepala penuh yang muncul sebagai lapisan pada footage, bukan terintegrasi ke dalamnya.

Rambut GAN

Dua pendekatan utama yang bersaing dalam simulasi manusia adalah Neural Radiance Fields (NeRF), yang dapat menangkap adegan dari beberapa sudut pandang dan mengenkapsulasi representasi 3D dari sudut pandang ini dalam jaringan neural yang dapat dijelajahi; dan Generative Adversarial Networks (GANs), yang secara signifikan lebih maju dalam hal sintesis gambar manusia (tidak hanya karena NeRF hanya muncul pada 2020).

NeRF’s pemahaman yang diinferensi tentang geometri 3D memungkinkan untuk mereplikasi adegan dengan kesetiaan dan konsistensi yang besar, bahkan jika saat ini memiliki sedikit atau tidak ada ruang untuk penerapan model fisika – dan, pada kenyataannya, relatif terbatas dalam hal transformasi pada data yang dikumpulkan yang tidak terkait dengan perubahan sudut pandang kamera. Saat ini, NeRF memiliki kemampuan yang sangat terbatas dalam hal mereproduksi gerakan rambut manusia.

GAN-based setara dengan NeRF memulai dengan kerugian yang hampir fatal, karena, tidak seperti NeRF, ruang laten dari GAN tidak secara native mengintegrasikan pemahaman tentang informasi 3D. Oleh karena itu, sintesis gambar wajah 3D-aware berbasis GAN telah menjadi pengejaran panas dalam penelitian generasi gambar dalam beberapa tahun terakhir, dengan InterFaceGAN 2019 sebagai salah satu terobosan utama.

Namun, bahkan hasil yang ditunjukkan dan dipilih dari InterFaceGAN menunjukkan bahwa konsistensi rambut neural tetap menjadi tantangan yang sulit dalam hal konsistensi temporal, untuk alur kerja VFX potensial:

Rambut 'menggelegak' dalam transformasi pose dari InterFaceGAN. Sumber: https://www.youtube.com/watch?v=uoftpl3Bj6w

Rambut ‘menggelegak’ dalam transformasi pose dari InterFaceGAN. Sumber: https://www.youtube.com/watch?v=uoftpl3Bj6w

Seiring dengan semakin jelas bahwa generasi tampilan yang konsisten melalui manipulasi ruang laten saja mungkin merupakan pengejaran yang seperti alkimia, semakin banyak makalah yang muncul yang mengintegrasikan informasi 3D berbasis CGI ke dalam alur kerja GAN sebagai konstrain yang stabilisasi dan normalisasi.

Elemen CGI mungkin direpresentasikan oleh primitif 3D intermediate seperti Skinned Multi-Person Linear Model (SMPL), atau dengan mengadopsi teknik inferensi 3D dengan cara yang mirip dengan NeRF, di mana geometri dievaluasi dari gambar atau video sumber.

Salah satu karya baru sepanjang ini, diterbitkan minggu ini, adalah Multi-View Consistent Generative Adversarial Networks for 3D-aware Image Synthesis (MVCGAN), sebuah kolaborasi antara ReLER, AAII, University of Technology Sydney, DAMO Academy di Alibaba Group, dan Zhejiang University.

Pose wajah yang masuk akal dan kuat yang dihasilkan oleh MVCGAN pada gambar yang dihasilkan dari dataset CELEBA-HQ. Sumber: https://arxiv.org/pdf/2204.06307.pdf

Pose wajah yang masuk akal dan kuat yang dihasilkan oleh MVCGAN pada gambar yang dihasilkan dari dataset CELEBA-HQ. Sumber: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN mengintegrasikan jaringan radiasi generatif (GRAF) yang dapat memberikan konstrain geometris dalam Jaringan Adversarial Generatif, yang secara signifikan mencapai beberapa kemampuan posing yang paling autentik dari pendekatan GAN-based serupa.

Perbandingan antara MVCGAN dan metode sebelumnya GRAF, GIRAFFE, dan pi-GAN.

Perbandingan antara MVCGAN dan metode sebelumnya GRAF, GIRAFFE, dan pi-GAN.

Namun, materi tambahan untuk MVCGAN mengungkapkan bahwa mendapatkan konsistensi volume, disposisi, penempatan, dan perilaku rambut adalah masalah yang tidak mudah diatasi melalui konstrain yang berbasis pada geometri 3D eksternal.

Dari materi tambahan yang tidak dirilis secara publik pada saat penulisan, kita melihat bahwa meskipun sintesis pose wajah dari MVCGAN mewakili kemajuan yang signifikan pada keadaan seni saat ini, konsistensi rambut temporal tetap menjadi masalah.

Dari materi tambahan yang tidak dirilis secara publik pada saat penulisan, kita melihat bahwa meskipun sintesis pose wajah dari MVCGAN mewakili kemajuan yang signifikan pada keadaan seni saat ini, konsistensi rambut temporal tetap menjadi masalah.

Karena alur kerja CGI ‘langsung’ masih menemukan rekonstruksi rambut temporal sebagai tantangan, tidak ada alasan untuk percaya bahwa pendekatan geometris konvensional dari jenis ini akan membawa sintesis rambut yang konsisten ke ruang laten dalam waktu dekat.

Stabilisasi Rambut dengan Jaringan Saraf Konvolusi

Namun, sebuah makalah yang akan datang dari tiga peneliti di Chalmers Institute of Technology di Swedia mungkin menawarkan kemajuan tambahan dalam simulasi rambut neural.

Di sebelah kiri, representasi rambut yang distabilkan oleh CNN, di sebelah kanan, kebenaran tanah. Lihat video yang disematkan di akhir artikel untuk resolusi yang lebih baik dan contoh tambahan. Sumber: https://www.youtube.com/watch?v=AvnJkwCmsT4

Di sebelah kiri, representasi rambut yang distabilkan oleh CNN, di sebelah kanan, kebenaran tanah. Lihat video yang disematkan di akhir artikel untuk resolusi yang lebih baik dan contoh tambahan. Sumber: https://www.youtube.com/watch?v=AvnJkwCmsT4

Bertajuk Real-Time Hair Filtering with Convolutional Neural Networks, makalah ini akan diterbitkan untuk simposium i3D pada awal Mei.

Sistem ini terdiri dari jaringan berbasis autoencoder yang dapat mengevaluasi resolusi rambut, termasuk self-bayangan dan mempertimbangkan ketebalan rambut, dalam waktu nyata, berdasarkan jumlah sampel stokastik yang terbatas yang diinisialisasi oleh geometri OpenGL.

Pendekatan ini merender sejumlah sampel terbatas dengan transparansi stokastik dan kemudian melatih U-net untuk merekonstruksi gambar asli.

Di bawah MVCGAN, CNN menyaring faktor warna stokastik, sorotan, tangen, kedalaman, dan alfa, mengumpulkan hasil sintesis menjadi gambar komposit.

Di bawah MVCGAN, CNN menyaring faktor warna stokastik, sorotan, tangen, kedalaman, dan alfa, mengumpulkan hasil sintesis menjadi gambar komposit.

Jaringan ini dilatih pada PyTorch, yang konvergen selama enam hingga dua belas jam, tergantung pada volume jaringan dan jumlah fitur input. Parameter yang dilatih (berat) kemudian digunakan dalam implementasi waktu nyata dari sistem.

Data pelatihan dihasilkan dengan merender beberapa ratus gambar untuk gaya rambut lurus dan bergelombang, menggunakan jarak acak dan pose, serta kondisi pencahayaan yang beragam.

Contoh-contoh input pelatihan yang beragam.

Contoh-contoh input pelatihan yang beragam.

Translusi rambut di seluruh sampel dirata-rata dari gambar yang dirender dengan transparansi stokastik pada resolusi supersampling. Data resolusi tinggi asli di-downsample untuk mengakomodasi keterbatasan jaringan dan perangkat keras, dan kemudian di-upsample, dalam alur kerja autoencoder yang khas.

Aplikasi inferensi waktu nyata (perangkat lunak ‘langsung’ yang menggunakan algoritma yang dihasilkan dari model yang dilatih) menggunakan campuran NVIDIA CUDA dengan cuDNN dan OpenGL. Fitur input awal dimasukkan ke dalam buffer warna multisampled OpenGL, dan hasilnya diarahkan ke tensor cuDNN sebelum diproses dalam CNN. Tensor tersebut kemudian disalin kembali ke tekstur OpenGL ‘langsung’ untuk diimposkan ke gambar akhir.

Sistem waktu nyata beroperasi pada NVIDIA RTX 2080, menghasilkan resolusi 1024×1024 piksel.

Karena nilai warna rambut sepenuhnya dipisahkan dalam nilai yang diperoleh oleh jaringan, mengubah warna rambut adalah tugas yang sepele, meskipun efek seperti gradien dan coretan masih merupakan tantangan di masa depan.

Penulis telah merilis kode yang digunakan dalam evaluasi makalah di GitLab. Periksa video tambahan untuk MVCGAN di bawah.

Kesimpulan

Mengarungi ruang laten dari autoencoder atau GAN masih lebih seperti berlayar daripada mengemudi dengan presisi. Hanya dalam periode sangat baru ini kita mulai melihat hasil yang kredibel untuk generasi pose ‘geometri yang lebih sederhana’ seperti wajah, dalam pendekatan seperti NeRF, GAN, dan kerangka autoencoder non-deepfake (2017).

Kompleksitas arsitektur rambut manusia yang signifikan, dikombinasikan dengan kebutuhan untuk mengintegrasikan model fisika dan sifat lainnya untuk yang pendekatan sintesis gambar saat ini tidak memiliki penyediaan, menunjukkan bahwa sintesis rambut tidak mungkin tetap menjadi komponen terintegrasi dalam sintesis wajah umum, tetapi akan memerlukan jaringan yang didedikasikan dan terpisah dengan beberapa kemajuan – bahkan jika jaringan tersebut mungkin akhirnya menjadi terintegrasi ke dalam kerangka sintesis wajah yang lebih luas dan kompleks.

 

Pertama kali diterbitkan 15 April 2022.

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai