Anderson’un Açısı

SofGAN: Bir GAN Yüz Oluşturucu Kişiye Özel Kontrol Sunar

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Şangay ve ABD’deki araştırmacılar, kullanıcıların saç, göz, gözlük, dokular ve renk gibi bireysel yönler üzerinde daha önce hiç olmadığı kadar kontrol sağlayan bir GAN tabanlı portre oluşturma sistemi geliştirdiler.

Sistemin çok yönlülüğünü göstermek için yaratıcılar, bir kullanıcı tarafından doğrudan çizilen anlamsal segmentasyon öğelerini gerçekçi görsellere dönüştürebilen ve hatta mevcut fotoğrafların üzerine çizilerek elde edilebilen bir Photoshop tarzı arayüz sağladı.

Aşağıdaki örnekte, aktör Daniel Radcliffe’in resmi bir izleme şablonu olarak kullanılır (ve amacın onu taklit etmek değil, genel olarak fotoğrafik bir görüntü oluşturmaktır). Kullanıcı çeşitli öğeleri, gözlük gibi ayrı ayrı yönleri doldurdukça, bunlar tanımlanır ve çıktı çizim görüntüsünde yorumlanır:

Bir SofGAN tarafından oluşturulan portreyi izleme materyali olarak kullanma. Kaynak: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Bir SofGAN tarafından oluşturulan portreyi izleme materyali olarak kullanma. Kaynak: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Makale makale adı SofGAN: Dinamik Stil ile Bir Portre Görüntü Oluşturucu ve ŞanghayTek Üniversitesi’nden Anpei Chen ve Ruiyang Liu ile birlikte iki diğer araştırmacı ve Kaliforniya Üniversitesi’nden bir araştırmacı tarafından yönetiliyor.

Özellikleri Ayırma

Çalışmanın birincil katkısı, kullanıcı dostu bir UX sağlamak değil, öğrenilen yüz özelliklerinin özelliklerini, seperti poz ve doku, “ayırma” yeteneğidir. Bu, SofGAN’ın kamera görüş açısına dolaylı açılardan yüzler oluşturmasına da olanak tanır.

Görülme açısından SofGAN, Generative Adversarial Networks tabanlı diğer yüz oluşturuculardan farklı olarak görüş açısını istendiği gibi değiştirebiliyor, eğitim verisi中的 açılara bağlı olarak.

Görülme açısından SofGAN, Generative Adversarial Networks tabanlı diğer yüz oluşturuculardan farklı olarak görüş açısını istendiği gibi değiştirebiliyor, eğitim verisi中的 açılara bağlı olarak. Kaynak: https://arxiv.org/pdf/2007.03780.pdf

Şimdi dokular geometriden ayrıldığı için, yüz şekli ve dokusu ayrı varlıklar olarak manipüle edilebilir. Aslında bu, bir kaynak yüzün ırk değiştirilmesine olanak tanır, skandal bir uygulama şimdi makine öğrenimi veri setlerinde ırksal dengeli oluşturmak için potansiyel olarak yararlı bir uygulama buldu.

SofGAN ayrıca yapay yaşlanma ve细节 seviyesinde görülmeyen, NVIDIA’nın GauGAN ve Intel’in oyun tabanlı nöral rendering sistemi gibi benzer segmentasyon>görüntü sistemlerinde görülenden daha granüler bir seviyede stil ayarlamasını destekliyor.

SofGAN, yaşlanmayı yinelemeli bir stil olarak uygulayabiliyor.

SofGAN, yaşlanmayı yinelemeli bir stil olarak uygulayabiliyor.

SofGAN’ın metodolojisinin bir başka đột phá özelliği, eğitim için çiftlenmiş segmentasyon/gerçek görüntülere gerek olmaması, ancak doğrudan gerçek dünya görüntülerine eğitim verilebilmesidir.

Araştırmacılar, SofGAN’ın “ayırma” mimarisinin geleneksel görüntü oluşturma sistemlerinden esinlendiğini belirtiyorlar, bu sistemler bir görüntünün bireysel yönlerini ayrıştırır. Görsel efekt iş akışlarında, bir bileşimin öğeleri genellikle en küçük bileşenlere kadar ayrıştırılır ve her bileşen için uzmanlar görevlendirilir.

Anlamsal Doluluk Alanı (SOF)

Bu özelliği bir makine öğrenimi görüntü sentez çerçevesinde gerçekleştirmek için, araştırmacılar anlamsal doluluk alanı (SOF) geliştirdiler, bu geleneksel doluluk alanının bir uzantısıdır ve yüz portrelerinin bileşen öğelerini bireyselleştirir. SOF, kalibre edilmiş çoklu görüş anlamsal segmentasyon haritalarına eğitim verildi, ancak herhangi bir zemin truth denetimi olmadan.

Tek bir segmentasyon haritasından (alt solda) çoklu yinelemeler.

Tek bir segmentasyon haritasından (alt solda) çoklu yinelemeler.

Ek olarak, 2B segmentasyon haritaları SOF’nın çıkışından ışın izleme yoluyla elde edilir, ardından bir GAN jeneratörü tarafından metinlenir. “Sentetik” anlamsal segmentasyon haritaları ayrıca, görüş açısı değiştiğinde çıkışın sürekliliğini sağlamak için üç katmanlı bir kodlayıcı aracılığıyla düşük boyutlu bir uzayda kodlanır.

Eğitim şeması, her bir anlamsal bölge için iki rastgele stili karıştırır:

SofGAN mimarisi.

SofGAN mimarisi.

Araştırmacılar, SofGAN’ın mevcut alternatif devlet-sanat (SOTA) yaklaşımlarına kıyasla daha düşük bir Frechet Inception Distance (FID) ve daha yüksek bir Öğrenilmiş Algısal Görüntü Yama Benzerliği (LPIPS) ölçütü elde ettiğini iddia ediyorlar.

Önceki StyleGAN yaklaşımları sık sık özellik karıştırma ile engellenmiştir, burada bir görüntüyü oluşturan öğeler birbirleriyle geri dönülmez bir şekilde bağlantılıdır, bu da istenmeyen öğelerin arzulanan bir öğe ile birlikte görünmesine neden olur (örneğin, bir kulak şekli bir kulaklık ile birlikte görünebilir).

Işın izleme, anlamsal segmentasyon haritalarının hacmini hesaplamak için kullanılır, böylece çoklu görüş açıları elde edilir.

Işın izleme, anlamsal segmentasyon haritalarının hacmini hesaplamak için kullanılır, böylece çoklu görüş açıları elde edilir.

Veri Setleri ve Eğitim

SofGAN’ın çeşitli uygulamalarında üç veri seti kullanıldı: CelebAMask-HQ, 30.000 yüksek çözünürlüklü görüntüyü içeren bir depo; NVIDIA’nın Flickr-Faces-HQ (FFHQ), 70.000 görüntüden oluşan bir veri seti, araştırmacılar tarafından önceden eğitilmiş bir yüz parser ile etiketlendi; ve 122 portre taramasından oluşan, manuel olarak etiketlenmiş anlamsal bölgelerle oluşturulan bir grup.

SOF, üç eğitimli alt modülden oluşur – hiper-ağ, bir ışın izleyici (yukarıdaki resim) ve bir sınıflandırıcı. Projenin Semantic Instance Wised (SIW) StyleGAN jeneratörü, belirli yönlerden StyleGAN2’ye benzer şekilde yapılandırılmıştır. Veri artırma, rastgele ölçeklendirme ve kırpma yoluyla uygulanır ve eğitim, her dört adımda bir yol düzenliyor. Tüm eğitim prosedürü, dört RTX 2080 Ti GPU’su üzerinde 22 gün sürdü ve 800.000 iterasyona ulaştı.

Makale, 2080 kartlarının yapılandırmasını belirtmiyor, bu kartlar 11gb-22gb VRAM arasında barındırabiliyor, bu da SofGAN’ı eğitmek için kullanılan toplam VRAM’in 44Gb ile 88Gb arasında olduğunu gösteriyor.

Araştırmacılar, genel, yüksek seviyeli sonuçların eğitimIN erken aşamalarında, 1500 iterasyon, üç gün sonra ortaya çıktığını gözlemlediler. EğitimIN geri kalanı, saç ve göz gibi ince detayların elde edilmesi için yavaş ve öngörülebilir bir ilerleme ile geçti.

SofGAN, NVIDIA’nın SPADE ve Pix2PixHD gibi rakip yöntemlerden daha gerçekçi sonuçlar elde eder ve SEAN gibi yöntemlerden daha iyi sonuçlar elde eder.

Araştırmacılar tarafından yayınlanan video aşağıdadır. Daha fazla self-hosting video, proje sayfasında mevcuttur.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai