Anderson’un Açısı
Adobe Araştırması Soyutlaşmış GAN Yüz Düzenlemesini Genişletiyor

İmaj sentezinde iç içe geçmenin neden bir sorun olduğunu anlamak zor değil, çünkü bu, yaşamın diğer alanlarında da sıkça karşılaşılan bir sorundur. Örneğin, bir curry’den zerdeçalı çıkarmak, bir burger’den turşuyu çıkarmaktan çok daha zordur ve bir fincan kahvenin şekerini çıkarmak几乎 imkansızdır. Bazı şeyler paketlenmiş olarak gelir.
Benzer şekilde, yüzleri (veya köpekleri, botları veya diğer herhangi bir alanı) oluşturmak veya düzenlemek için makine öğrenimi kullanan görüntü sentez mimarileri, farklı özellikler ve kavramları ayırmak istediklerinde iç içe geçme, bir engel oluşturur.
Eğer yaş, cinsiyet, saç rengi, cilt tonu, duygu ve benzeri gibi özellikleri ayırmak mümkün olsaydı, gerçekten enstrümantal ve esnek bir çerçeve oluşturmak mümkün olurdu. Bu, yüz resimlerini gerçekten granüler bir düzeyde oluşturmak ve düzenlemek için, istenmeyen “yan efektleri” olmadan mümkündür.
En yüksek iç içe geçme durumunda (yukarıda solda), yalnızca öğrenilmiş bir GAN ağı resmini başka bir kişinin resmine değiştirebilirsiniz.
Bu, aslında en son AI bilgisayar vizyon teknolojisini kullanarak, 30 yıl önce diğer yöntemlerle çözülen bir şeyi başarmak anlamına gelir.
Belirli bir ayrımla (daha önceki resimde ‘Orta Ayrım’ olarak gösterilen), stil tabanlı değişiklikler yapmak mümkün olur, Örneğin, saç rengi, ifade, makyaj uygulaması ve sınırlı baş dönmesi gibi.

Kaynak: FEAT: Yüz Düzenleme ile Dikkat, Şubat 2022, https://arxiv.org/pdf/2202.02713.pdf
Son iki yıl içinde, yüz özelliklerini değiştirmek için etkileşimli yüz düzenleme ortamları oluşturmak için birçok girişim oldu. Ancak, bu, GAN’ın soyut uzayındaki özellik/stil iç içe geçmesi nedeniyle bir zorluk oluşturdu.
Örneğin, “gözlük” özelliği genellikle “yaşlı” özelliği ile iç içe geçer, bu nedenle gözlük eklemek, yüzü yaşlandırabilir, ve yüzü yaşlandırarak gözlük eklemek, iç içe geçmenin derecesine bağlı olarak, gözlük eklenip eklenmeyeceğine bağlıdır (aşağıdaki ‘Test’ bölümünde örnekler için bakınız).
En dikkat çekici olan, saç rengini ve diğer saç özelliklerini değiştirmenin neredeyse imkansız olması, saçın yeniden hesaplanması nedeniyle “kaynar” bir efekt oluşturur.

Kaynak: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w
Soyut-Soyut GAN Gezintisi
Adobe liderliğindeki yeni bir makale, WACV 2022 için sunuldu ve bu temel sorunlara yeni bir yaklaşım sunuyor. Makale, Soyut-Soyut: Kimlik Koruyucu Düzenleme için Öğrenilmiş Bir Haritalayıcı adlı bir makalede sunuldu.

Makaleden ek materyal. Burada, öğrenilen yüzün temel özellikleri, ilgili olmayan değişikliklere sürüklenmez. Makalenin sonundaki video için daha iyi ayrıntı ve çözünürlük için bakınız. Kaynak: https://www.youtube.com/watch?v=rf_61llRH0Q
Makale, Adobe Uygulamalı Bilim İnsanı Siavash Khodadadeh tarafından liderlik ediliyor ve dört diğer Adobe araştırmacısı ve Central Florida Üniversitesi Bilgisayar Bilimi Bölümü’nden bir araştırmacı tarafından destekleniyor.
Makale, özellikle Adobe’nin bu alanda uzun süredir faaliyet göstermesi ve bu işlevin birkaç yıl içinde Creative Suite projesine girebileceği nedeniyle ilgi çekicidir.
The authors declare:
‘[Biz] bir sinir ağı eğitiyoruz, bu, değiştirilen özniteliğe karşılık gelen soyut kodlamayı bulmak için soyut-soyut dönüşümü gerçekleştirir. Bu teknik, özniteliklerin渐渐 değişiminin lineer veya lineer olmayan bir yolu üzerinde bağlı değildir.’
‘Tüm üretim pipeline’ini kapsayan bir şekilde ağın eğitimini sağlıyoruz, böylece sistem, hazır generator mimarilerinin soyut uzaylarına adapte olabilir. Kimlik gibi koruma özellikleri, eğitim kayıpları olarak kodlanabilir.’
‘Soyut-soyut ağı eğitildikten sonra, rastgele görüntüler için yeniden eğitilmeden kullanılabilir.’
Bu son kısım, önerilen mimarinin, son kullanıcıya hazır bir şekilde geldiğini ve yerel kaynaklarda bir sinir ağını çalıştırması gerektiği anlamına gelir, ancak yeni görüntüler hemen değiştirilmeye hazır olabilir, çünkü çerçeve, daha fazla görüntüye özgü eğitim gerektirmeyecek kadar ayrılmıştır.

Cinsiyet ve yüz saçları, soyut uzayda rastgele ve keyfi yollar izler, yalnızca son noktalar arasında ‘silme’ yapmaz. Makalenin sonundaki video için daha iyi ayrıntı ve çözünürlük için bakınız.
Çalışmanın ana başarılarından biri, ağın, yalnızca özniteliği değiştirerek, kimlikleri soyut uzayda “dondurmak” ve dönüşümleri sırasında kimliklerin korunmasına yardımcı olan “düzeltilme terimleri” sağlamasının能力idir.
Esasen, önerilen ağ, işlenen tüm unsurları düzenleyen daha geniş bir mimari içinde gömülüdür ve bu unsurlar, istenmeyen yan etkileri üretmeyecek şekilde dondurulmuş ağırlıklara sahip önceden eğitilmiş bileşenlerden geçer.
Eğitim süreci, üçlü kullanır ve bu, bir tohuma görüntü (GAN tersine dönüşümü altında) veya mevcut bir başlangıç soyut kodlaması ile oluşturulabilir, böylece tüm eğitim süreci denetimsizdir ve etiketleme ve kürasyon sistemlerinin alışılagelmiş eylemleri, mimariye dahil edilmiştir. Aslında, yeni sistem, hazır öznitelik regresörleri kullanır:
‘[Ağımızın] bağımsız olarak kontrol edebileceği öznitelik sayısı, yalnızca tanıyıcıların (eğer bir özniteliği tanıyıcı varsa) yetenekleri ile sınırlıdır – bir özniteliği tanıyıcı varsa, bunu rastgele yüzlere ekleyebiliriz. Deneylerimizde, 35 farklı yüz özniteliğinin ayarlanmasını sağlamak için soyut-soyut ağını eğittik, bu, önceki tüm yaklaşımlardan daha fazladır.’
Sistem, istenmeyen “yan efekt” dönüşümlerine karşı ek bir koruma sağlar: bir özniteliğin değiştirilmesi istenmediğinde, soyut-soyut ağ, soyut vektörü kendisine haritalar, böylece hedef kimliğinin stabil kalmasını sağlar.
Yüz Tanıma
Son birkaç yılın GAN ve kodlayıcı/çözücü tabanlı yüz düzenleyicilerinde, uygulanan dönüşümler genellikle benzerliği bozar. Bunu önlemek için, Adobe projesi, FaceNet adlı bir yüz tanıma ağını bir ayırıcı olarak kullanır.

Proje mimarisi, FaceNet’in dahil edildiği alt orta sol bölümü görün. Kaynak: Soyut-Soyut: Kimlik Koruyucu Düzenleme için Öğrenilmiş Bir Haritalayıcı, OpenAccess.
(Kişisel bir not olarak, bu, standart yüz tanıma ve hatta ifade tanıma sistemlerinin, üretken ağlara entegrasyonu için umut verici bir adımdır, bu, deepfake mimarilerinin, yüz oluşturma sektöründeki ifade sadakati ve diğer önemli alanlarda blind pixel>pixel eşlemesinin yerini alabilecek en iyi yol olabilir.)
Soyut Uzayda Tüm Alanlara Erişim
Çerçevenin başka bir etkileyici özelliği, soyut uzayda, kullanıcı keyfinin istediği dönüşümler arasında keyfi bir şekilde seyahat edebilmesidir. Önceki beberapa sistem, kullanıcıya, önceden eğitilmiş konumlar arasında gezinme arayüzleri sunmuştur, ancak bu genellikle lineer veya prosedürel bir deneyimdir.

GAN Dengesini İyileştirme: Mekansal Farkındalığı Artırma’dan: Burada, kullanıcı, iki soyut uzay konumu arasındaki olası geçiş noktaları arasında gezinir, ancak önceden eğitilmiş konumlar içinde kalır. Aynı materyale dayalı diğer tür dönüşümleri uygulamak için, yeniden yapılandırma ve/veya yeniden eğitim gerekir. Kaynak: https://genforce.github.io/eqgan/
Kullanıcı, tamamen yeni kullanıcı görüntülerine karşı duyarlıdır ve kullanıcı, dönüşüm sürecinde korunmasını istediği öğeleri manuel olarak “dondurabilir”. Bu şekilde, kullanıcı, arka planın değişmemesini veya gözlerin açık ya da kapalı kalmasını sağlayabilir.
Veri
Öznitelik regresyon ağı, üç ağ üzerinde eğitildi: FFHQ, CelebAMask-HQ ve StyleGAN-V2’nin Z uzayından örneklenen 400.000 vektörden oluşan yerel, GAN üretilen bir ağ.
Dağılım dışı (OOD) görüntüler filtrelenmiştir ve öznitelikler, Microsoft’un Yüz API’si kullanılarak çıkarılmış ve oluşan görüntü kümesi 90/10 olarak bölünmüştür, 721.218 eğitim görüntüsü ve 72.172 test görüntüsü bırakmıştır.
Test
Deneysel ağ, ilk olarak 35 olası dönüşümü desteklemek üzere yapılandırılmış, ancak karşılaştırılabilir çerçevelerle analojik testler yapmak için sekize indirilmiştir. Seçilen sekiz öznitelik, Yaş, Kellik, Sakal, İfade, Cinsiyet, Gözlük, Pitch ve Yaw idi. Rakip çerçevelerin bazıları, orijinal dağıtımda bulunmayan belirli öznitelikler için yeniden düzenlenmiştir, örneğin InterFaceGAN’e kellik ve sakal eklenmiştir.
Uygun olarak, rakip mimarilerde daha yüksek bir iç içe geçme düzeyi görüldü. Örneğin, bir testte, InterFaceGAN ve StyleFlow, yaş uygularken konu’nun cinsiyetini değiştirdi:

İki rakip çerçeve, ‘yaş’ dönüşümüne cinsiyet değişikliği ekledi, ayrıca kullanıcıdan doğrudan talimat almadan saç rengini değiştirdi.
Ayrıca, iki rakip, gözlüklerin ve yaşın ayrılmaz özellikler olduğunu buldu:
Araştırma, tüm yönlerden bir zafer değildir: Makalenin sonundaki videoya gömülü olarak bulunan gibi, çerçeve, çeşitli açılarda (yaw) genişletme konusunda en az etkili olanıdır, mentre GANSpace, yaş ve gözlük uygulamasında daha iyi bir genel sonuç verir ve başın açısını (pitch) eklemeye ilişkin StyleFlow ve Latent-to-Latent ile bağlanır.

MTCNN yüz dedektörünün kalibrasyonu temelinde hesaplanan sonuçlar. Daha düşük sonuçlar daha iyidir.
Örneklerin daha iyi bir çözünürlüğü ve ayrıntısı için, makalenin eşlik eden videosunu aşağıdaki bağlantıdan izleyebilirsiniz.
İlk olarak 16 Şubat 2022’de yayınlandı.














