Anderson’un Açısı

GAN’ın ‘Geleneksel’ CGI için Yüz Oluşturucu Olarak Kullanımı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Görüş Generatif Karşıt Ağlar (GAN’lar) ilk olarak gerçekçi 3D yüzleri yeniden üretme yeteneklerini gösterdiğinde, GAN’ların potansiyelinin keşfedilmesi için bir altın rush başladı. Bu, insan yüzleri içeren zamanla tutarlı video oluşturmak için GAN’ların kullanılmasıyla ilgiliydi.

GAN’ın gizli uzayında, orada saklı bir düzen ve rasyonellik olması gerektiği düşünülüyordu – bir schema, yüzün aynı görüntüsünü (örneğin, ifade değişiklikleri) üretebilecek ve sonra da zamanla ikna edici bir deepfake video yöntemi sunabilecek bir yüz için çoklu görünümler ve yorumlar üretebilecek bir yüz için saklı olan bir nascent semantic mantık.

Yüksek çözünürlüklü çıktı, DeepFaceLab ve FaceSwap’in işletildiği düşük çözünürlüklü ortamlara kıyasla basit olacaktı. Ayrıca, yüzün ‘değiştirme’ bölgesi, autoencoder iş akışlarında ‘yaratma’ bölgesi haline gelecekti.

Yüzün tümü, saç, çene hatları ve yüz hatlarının dış uçları dahil, sıfırdan oluşturulacağından, ‘değiştirme’ ve ‘ana’ yüzler arasında hiçbir uyumsuzluk olmayacaktı.

GAN Yüz Video Kış

Ancak,事情 öyle olmadı. Sonunda, ayrıştırma merkezi sorun olarak ortaya çıktı ve hala primary challenge olarak kalıyor. Nasıl bir yüzün ayrı bir kimliğini koruyabilir ve pozunu veya ifadesini değiştirebilirsiniz, binlerce referans görüntüsünden oluşan bir corpus toplamak zorunda kalmadan, bir sinir ağı nasıl öğretilebilir?

Sonraki düşünce, GAN yüz enactment ve sentez araştırmaları, bir girişin teleolojik, generic, şablonlu dönüşümlere tabi tutulabileceği yönündeydi. Bir örnek, bir GAN yüzüne, o kişinin hakkında bildiği hiçbir görüntüde bulunmayan bir ifade uygulamaktır.

2022 paper Tensor-based Emotion Editing in the StyleGAN Latent Space'den, şablonlu ifadeler FFHQ veri kümesinden bir girişe uygulanıyor. Kaynak: https://arxiv.org/pdf/2205.06102.pdf

2022 paper Tensor-based Emotion Editing in the StyleGAN Latent Space’den, şablonlu ifadeler FFHQ veri kümesinden bir girişe uygulanıyor. Kaynak: https://arxiv.org/pdf/2205.06102.pdf

Herhangi bir bireyin benzersiz yüz ifadelerine kapsayıcı bir ‘tek boyut tümü kapsar’ yaklaşımının yeterli olmayacağı açık. Jack Nicholson veya Willem Dafoe gibi benzersiz bir gülüşün, böyle ‘ortalama ifade’ gizli kodlarının etkisi altında sadık bir şekilde yorumlanıp yorumlanamayacağını merak etmek zorundayız.

Geçen üç yıl içinde en çok ilgi gören ve alıntı yapılan GAN yüz düzenleyici, InterFaceGAN olabilir. Bu, latent uzayda pose (kamera/ yüz açısı), ifade, yaş, ırk, cinsiyet ve diğer temel niteliklerle ilgili latent kodlarda latent uzay geçişleri gerçekleştirebilir.

InterFaceGAN ve benzer çerçevelerin 1980’ler tarzı ‘morflama’ yetenekleri, esas olarak bir görüntüyü uygun bir latent koda (örneğin ‘yaş’) geri projelendirirken dönüşümün yolunu göstermek için kullanılır. Ancak, zamanla sürekli video üretimi söz konusu olduğunda, bu şemalar şimdiye kadar ‘etkili felaketler’ olarak nitelendirilebilir.

Bununla birlikte, zamanla tutarlı saç oluşturmanın zorluğu ve latent kod keşfi/Manipülasyon tekniğinin zamanla rehberlik içermemesi (ve bu tür bir çerçevenin video çıkışı için yerli bir sağlama bulunmaması) nedeniyle, GAN’ın yüz video sentezi için yeterli olmayabileceği sonucuna varılabilir.

Sonraki çabalar, artımlı iyileştirmeler sağlarken, diğerleri bilgisayar vizyonunda diğer konvansiyonları bir ‘rehberlik katmanı’ olarak ekledi, Örneğin, 2021’in sonlarında makale SemanticStyleGAN: Kontrollü Görüntü Sentezi ve Düzenleme için Bileşenli Oluşturucu Öncelikler Öğrenme gibi.

SemanticStyleGAN'de latent uzay enstrümantalitesi olarak anlamsal segmentasyon. Kaynak: https://semanticstylegan.github.io/

SemanticStyleGAN’de latent uzay enstrümantalitesi olarak anlamsal segmentasyon. Kaynak: https://semanticstylegan.github.io/

Parametrik Rehberlik

GAN yüz sentezi araştırmaları topluluğu, GAN’ların latent uzayındaki etkileyici ancak disiplinsiz latent kodlara düzen ve rehberlik getirmek için ‘geleneksel’ parametrik CGI yüzlerini kullanmaya doğru yöneliyor.

Parametrik yüz ilkelikleri, bilgisayar vizyonu araştırmalarında yirmi yılı aşkın bir süredir var, ancak bu yaklaşıma ilgi son zamanlarda arttı. Skinned Multi-Person Linear Model (SMPL) CGI ilkelikleri, Max Planck Enstitüsü ve ILM tarafından öncülük edilen ve daha sonra Sparse Trained Articulated Human Body Regressor (STAR) çerçevesi ile geliştirilen bir yaklaşımdır.

SMPL (bu durumda SMPL-X varyantı), bir görüntüdeki tüm insan vücudunun tahmini pozuna (gerekirse ifadeleri de dahil) uygun bir CGI parametrik mesh uygulayabilir ve bu mesh, yeni operasyonların gerçekleştirilmesi için bir hacimsel veya algısal rehber olarak kullanılabilir. Kaynak: https://arxiv.org/pdf/1904.05866.pdf

SMPL (bu durumda SMPL-X varyantı), bir görüntüdeki tüm insan vücudunun tahmini pozuna (gerekirse ifadeleri de dahil) uygun bir CGI parametrik mesh uygulayabilir ve bu mesh, yeni operasyonların gerçekleştirilmesi için bir hacimsel veya algısal rehber olarak kullanılabilir. Kaynak: https://arxiv.org/pdf/1904.05866.pdf

Disney’in 2019 Rendering with Style girişimi, geleneksel texture-haritaların GAN tarafından üretilen görüntülerle birleştirilmesini içeriyordu. Bu, geliştirilmiş, ‘derin sahte’ animasyon çıkışını oluşturmak için yapılmıştı.

Eski ve yeni, Disney'in melez yaklaşımında GAN tarafından üretilen derin sahte yüzler. Kaynak: https://www.youtube.com/watch?v=TwpLqTmvqVk

Eski ve yeni, Disney’in melez yaklaşımında GAN tarafından üretilen derin sahte yüzler. Kaynak: https://www.youtube.com/watch?v=TwpLqTmvqVk

Disney yaklaşımı, StyleGAN2 ağına ‘boyama’ için geleneksel olarak oluşturulmuş CGI yüzleri sokar ve bu, zamanla tutarlılık sorunlarının yaşandığı ‘problemli’ alanlarda, örneğin deri dokusu gibi, insan yüzlerini ‘doldurmak’ için kullanılır.

Rendering with Style iş akışı.

Rendering with Style iş akışı.

Süreci yönlendiren parametrik CGI başı değiştirilebildiğinden, GAN tarafından üretilen yüz bu değişiklikleri yansıtabilir, baş pozunu ve ifadesini değiştirebilir.

Ancak, sonuçlar hala saç dokusunun ve temel özelliklerin konumunun tutarlı olmadığını gösteriyor:

Rendering with Style'dan yeni bir tür uncanny valley ortaya çıkıyor, ancak ilke hala potansiyel taşıyor.

Rendering with Style’dan yeni bir tür uncanny valley ortaya çıkıyor, ancak ilke hala potansiyel taşıyor.

2020 makale StyleRig: 3D Kontrol için StyleGAN’ın Rigging’i, üç boyutlu morflanabilir yüz modellerinin (3DMM) bir StyleGAN ortamında özelliklerin değiştirilmesi için vekil olarak kullanılmasını içerir.

StyleRig'de latent uzay yorumları için 3DMM'ler vekil olarak kullanılır. Kaynak: https://arxiv.org/pdf/2004.00121.pdf

StyleRig’de latent uzay yorumları için 3DMM’ler vekil olarak kullanılır. Kaynak: https://arxiv.org/pdf/2004.00121.pdf

Benzer sonuçlar, Mitsubishi Araştırma’nın MOST-GAN adlı 2021 makalesinde de bulunabilir. Bu, doğrusal olmayan 3DMM’leri bir ayrıştırma mimarisi olarak kullanır, ancak dynamik ve tutarlı hareket elde etmekte zorluk çekiyor.

Son araştırmalardan biri, Megapiksel Üzerinde Tek Şanslı Yüz Yeniden Canlandırma, yine 3DMM parametrik başlarını StyleGAN için bir arayüz olarak kullanıyor.

MegaFR iş akışında, ağ bir gerçek dünya görüntüsünü tersine çevirir ve bir 3DMM modelinden alınan parametrelerle birleştirir. Kaynak: https://arxiv.org/pdf/2205.13368.pdf

MegaFR iş akışında, ağ bir gerçek dünya görüntüsünü tersine çevirir ve bir 3DMM modelinden alınan parametrelerle birleştirir. Kaynak: https://arxiv.org/pdf/2205.13368.pdf

OSFR, bir görüntü üzerinde dönüşümler uygulayabileceğiniz Photoshop/After Effects tarzı lineer düzenleme iş akışlarını geliştirmeyi amaçlayan, GAN yüz düzenleyicileri arasında yer alan bir sınıftır.

Parametrik ifadeler, yine de kişisel olmayan bir ifade enjeksiyon yöntemini temsil ediyor ve bu, ‘uncanny’ hissi uyandıran manipülasyonlara yol açabiliyor.

OSFR'de enjekte edilen ifadeler.

OSFR’de enjekte edilen ifadeler.

Önceki çalışmalar gibi, OSFR tek bir görüntüden orijinal pozları çıkarabilir ve ‘ön yüzleştirme’ işlemini gerçekleştirebilir, yani off-center pozlanan bir görüntüyü bir mugshot’a dönüştürebilir:

OSFR'de orijinal (üstte) ve çıkarılan mugshot görüntüleri.

OSFR’de orijinal (üstte) ve çıkarılan mugshot görüntüleri.

Bu tür bir çıkarım, bazı fotogrametri ilkelerine benzer, ancak burada geometri tek bir fotoğrafla tanımlanmalıdır, Neural Radiance Fields (NeRF) gibi 3-4 görüş açısına gerek duyulmaz.

(Ancak NeRF de GAN’lar gibi yüz video sentezi için kendi seti engellerine sahiptir.)

GAN Yüz Video Sentezinde Yer Alıyor mu?

Tek bir kaynak görüntüsünden dinamik ifadeler ve dağılma pozları elde etme, GAN yüz sentezi araştırmalarında şu anda bir tür simya gibi bir takıntı gibi görünüyor. Bunun nedeni, GAN’ların oldukça yüksek çözünürlüklü ve yüksek doğrulukta nöral yüzler üretebilen tek yöntem olmasıdır.

Doğru bir CGI/GAN yüz sentezi sistemi için ileriye doğru tek yol, bir çok fotoğrafik kimlik varlığını latent uzayda bir araya getirmek için bir girişimi bulmaktır. Burada, bir yüzün kimliği için latent bir kod, ilgili (gerçek dünya) görüntülerine başvurmak için latent uzayının tamamına seyahat etmek zorunda kalmadan, poz parametrelerine başvurabilir.

Bununla birlikte, böyle bir durumda bile, veya hatta tüm bir StyleGAN ağı tek bir kimlik yüz kümesine (oto-encoderlerin kullandığı eğitim setlerine benzer) eğitilse bile, eksik olan semantik mantık muhtemelen anlamsal segmentasyon veya parametrik 3DMM yüzleri gibi yardımcı teknolojiler tarafından sağlanacaktır.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]