Anderson’un Açısı

GAN’ın Gizil Alanını ‘Parçacıklar’ ile Düzenleme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

UC Berkeley ve Adobe’ (ADBE ) den yeni bir araştırma, genellikle kontrol edilemeyen, canlandırılamayan veya Photoshop kullanıcıları ve CGI uygulayıcılarına aşina olduğumuz şekilde serbestçe manipüle edilemeyen bir Generative Adversarial Network (GAN) tarafından oluşturulabilen hipergerçek içeriği doğrudan düzenleme yöntemini sunuyor.

Adı BlobGAN olan yöntem, GAN’ın gizil alanındaki içerilere doğrudan karşılık gelen matematiksel yapılar olan ‘parçacıklar’ grid oluşturmayı içerir.

Parçacıkları hareket ettirerek, sahne temsilindeki ‘nesneleri’ CGI ve CAD yöntemlerine daha yakın bir şekilde ve sezgisel bir şekilde hareket ettirebilirsiniz:

Sahne manipülasyonu ile BlobGAN: kullanıcı tarafından 'parçacıklar' hareket ettirildiğinde, GAN'daki gizil nesneler ve stiller karşılık gelen şekilde değiştirilir. Daha fazla örnek için, bu makalenin sonundaki eşlik eden videoyu veya https://www.youtube.com/watch?v=KpUv82VsU5k adresini ziyaret edin

Sahne manipülasyonu ile BlobGAN: kullanıcı tarafından ‘parçacıklar’ hareket ettirildiğinde, GAN’daki gizil nesneler ve stiller karşılık gelen şekilde değiştirilir. Daha fazla örnek için, bu makalenin sonundaki eşlik eden videoyu veya https://www.youtube.com/watch?v=KpUv82VsU5k adresini ziyaret edin

GAN’ın gizil alanındaki ‘nesneler’ olarak tanımlanan parçacıklar, tüm nesnelerin a priori ayrıştırılmasını sağlar, bu da onları bireysel olarak değiştirmeyi mümkün kılar:

Nesneler boyutlandırılabilir, küçültülebilir, klonlanabilir ve kaldırılabilir, diğer işlemler arasında

Nesneler boyutlandırılabilir, küçültülebilir, klonlanabilir ve kaldırılabilir, diğer işlemler arasında

Görsel düzenleme (veya metin düzenleme) yazılımlarındaki herhangi bir nesne gibi, bir parçacık da kopyalanabilir ve daha sonra manipüle edilebilir:

Parçacıklar arayüzde kopyalanabilir ve karşılık gelen gizil temsilciler de 'kopyalanır ve yapıştırılır'. Kaynak: https://dave.ml/blobgan/#results

Parçacıklar arayüzde kopyalanabilir ve karşılık gelen gizil temsilciler de ‘kopyalanır ve yapıştırılır’. Kaynak: https://dave.ml/blobgan/#results

BlobGAN, yeni ve kullanıcı tarafından seçilen görüntüleri de gizil alanına parse edebilir:

BlobGAN ile, düzenlemek istediğiniz görüntüleri doğrudan eğitim verilerine dahil etmek ve sonra gizil kodlarını aramak zorunda kalmazsınız, ancak seçilen görüntüleri istediğiniz zaman girebilir ve manipüle edebilirsiniz. Değiştirilen fotoğraflar, sonradan kullanıcı girişidir. Kaynak: https://dave.ml/blobgan/#results

BlobGAN ile, düzenlemek istediğiniz görüntüleri doğrudan eğitim verilerine dahil etmek ve sonra gizil kodlarını aramak zorunda kalmazsınız, ancak seçilen görüntüleri istediğiniz zaman girebilir ve manipüle edebilirsiniz. Kaynak: https://dave.ml/blobgan/#results

Daha fazla sonuç https://dave.ml/blobgan/#results adresinde ve bu makalenin sonundaki eşlik eden YouTube videosunda görülebilir. Ayrıca, etkileşimli bir Colab demo* ve bir GitHub deposu** mevcuttur.

Bu tür bir araç ve kapsam, Photoshop sonrası dönemde naif görünse de, Generative Adversarial Network’un gizil alanının tuhaflıklarını ve karmaşıklığını, gizil kodlara karşılık gelen proxy varlıkların kullanımı ile kontrol altına alma konusunda umut verici bir yaklaşımı temsil ediyor.

Yazarlar iddia ediyor:

‘Zorlu çok kategorili bir iç mekanlar verisetinde, BlobGAN, FID ile ölçülen görüntü kalitesi açısından Style-GAN2’yi geride bırakıyor.’

Makale BlobGAN: Mekansal Olarak Ayrıştırılmış Sahne Temsilleri olarak adlandırılmış ve iki UC Berkeley araştırmacısı ile birlikte üç Adobe Research araştırmacısı tarafından yazılmıştır.

Aracı

BlobGAN, GAN görüntü sentezine yeni bir paradigm getiriyor. Yeni makale, önceki yaklaşımaların GAN’ın gizil alanındaki ayrı nesneleri ele alma konusunda ya ‘üstden’ ya da ‘alttan’ olduğunu belirtiyor.

Üstden bir yaklaşım, GAN veya görüntü sınıflandırıcıda sahnelerin sınıflar olarak ele alınmasını içerir, Örneğin ‘yatak odası’, ‘kilise’, ‘yüz’ gibi. Bu tür metin/görüntü eşleştirmesi, yeni bir nesil çok modlu görüntü sentez çerçevelerini güçlendiriyor, Örneğin OpenAI’nin recent DALL-E 2’si gibi.

Alttan yaklaşım ise, bir görüntüdeki her pikseli bir sınıfa, etikete veya kategoriye eşler. Bu tür yaklaşımlar çeşitli teknikler kullanır, ancak anlamsal segmentasyon güncel bir araştırma alanıdır.

Yazarlar yorumluyor:

‘Her iki yol da tatmin edici görünmüyor, çünkü hiçbirisi sahnenin parçalarını varlıklar olarak düşünmeyi kolay bir şekilde sağlamıyor. Sahne parçaları ya tek bir iç içe geçmiş gizil vektöre bağlı (üstden), ya da bireysel piksel etiketlerinden gruplandırılmak zorunda (alttan)’

Bunun yerine, BlobGAN gözetimsiz orta düzey temsil veya generatif modeller için bir proxy çerçevesi sunuyor.

Düzenleme ağı, yerel (ve kontrollü) 'parçacık' varlıklarını gizil kodlara eşler. Orta kısmındaki renklendirilmiş daireler bir 'parçacık haritası' oluşturur. Kaynak: https://arxiv.org/pdf/2205.02837.pdf

Düzenleme ağı, yerel (ve kontrollü) ‘parçacık’ varlıklarını gizil kodlara eşler. Kaynak: https://arxiv.org/pdf/2205.02837.pdf

Gaussian (yani gürültü tabanlı) parçacıklar derinlik sıralıdır ve mimarinin her varlık için bir eşleme atanmasını sağlayan bir darboğaz temsil eder, bu da GAN içeriği manipülasyonunun en büyük engelini çözer: ayrıştırma (ayrıca otoencoder tabanlı mimariler için bir sorun). Sonuçlanan ‘parçacık haritası’, BlobGAN’ın kod çözücüsünü manipüle etmek için kullanılır.

Yazarlar şaşkınlıkla belirtiyorlar ki, sistem, açık etiketler kullanmayan bir ayrımcı aracılığıyla sahneleri düzenlere ve varlıklara ayırmayı öğrenir.

Mimari ve Veri

Parçacık haritasındaki varlıklar, değiştirilmiş bir StyleGAN2 türetilmiş aracılığıyla görüntülere dönüştürülür, bu da NVIDIA’ (NVDA ) nin önceki araştırmalarından esinlenen bir yaklaşımı içerir.

NVIDIA Araştırma'dan değiştirilmiş bir StyleGAN 2 türetilmesi. Bu çalışmadaki bazı ilkeler BlobGAN için benimsendi veya uyarlandı. Kaynak: https://arxiv.org/pdf/1912.04958.pdf

NVIDIA Araştırma’dan değiştirilmiş bir StyleGAN 2 türetilmesi. Kaynak: https://arxiv.org/pdf/1912.04958.pdf

StyleGAN 2, BlobGAN’da tek bir global vektör yerine parçacık haritasından girdi kabul edecek şekilde değiştirilir.

BlobGAN tarafından mümkün kılınan bir dizi manipülasyon, bir yatak odası sahnesinin 'otomatik tamamlanması' ve odadaki elemanların boyutlandırılması ve yeniden konumlandırılması dahildir. Aşağıdaki satırda, bu işlemleri mümkün kılan kullanıcı erişimi bulunan araçları görüyoruz - parçacık haritası.

BlobGAN tarafından mümkün kılınan bir dizi manipülasyon, bir yatak odası sahnesinin ‘otomatik tamamlanması’ ve odadaki elemanların boyutlandırılması ve yeniden konumlandırılması dahildir.

Benzerlik yoluyla, devasa ve karmaşık bir yapıyı (gizil alanı) bir kerede var etmek ve sonra onun sonsuz yollarını keşfetmek yerine, BlobGAN başlangıçta bileşen blokları gönderir ve her zaman nerede olduklarını bilir. İçerik ve konumun bu ayrıştırılması, çalışmanın ana yeniliği.

 

* Yazıldığı sırada fonksiyonel değildi
** Kod yazıldığı sırada yayınlanmamıştı

 

İlk olarak 8 Mayıs 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai