Anderson’un Açısı

TikTok Geliştiricileri Artırılmış Gerçeklik Uygulamaları için Yüzleri Silmektedir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çinli çok uluslu internet şirketi ByteDance, TikTok’un arkasındaki şirket, video中的 yüzleri silmek için yeni bir yöntem geliştirdi. Bu teknik, kimlik bozulması ve diğer garip efektleri insanların yüzlerine uygulamak için kullanılabiliyor. Şirket, bu tekniğin zaten ticari mobil ürünlerine entegre edildiğini iddia ediyor, ancak hangi ürünler olduğunu belirtmiyor.

Video中的 yüzler ‘sıfırlandıktan’ sonra, göz alan etkileyici bozulmalar ve diğer kimlik değişiklikleri yapılabilir. ByteDance araştırmacılarının yeni bir makalesinde verilen örnekler, bu olasılıkları gösteriyor:

ByteDance makalesinde verilen yüz yeniden yapılandırma olanakları. Kaynak: https://arxiv.org/pdf/2109.10760.pdf

ByteDance makalesinde verilen yüz yeniden yapılandırma olanakları. Kaynak: https://arxiv.org/pdf/2109.10760.pdf

Ağustos ayının sonlarında, TikTok’un kendi AR geliştirme platformu olan TikTok Effect Studio’yu (şu anda kapalı beta aşamasında) lanç ettiği ortaya çıktı. Bu platform, TikTok içerik akışları için AR efektleri oluşturmak üzere AR geliştiricilere olanak tanıyor.

Aslında, şirket Facebook’un AR Studio ve Snap AR’deki benzer geliştirici topluluklarına yetişmeye çalışıyor. Apple’ın saygın AR ve D nghiênme topluluğu da yeni donanım ile birlikte yakın zamanda canlanacak.

Boş Yüzler

Makale, FaceEraser: Augmented Reality için Yüz Parçalarını Kaldırma başlığını taşıyor ve mevcut in-painting/infill algoritmalarının, örneğin NVIDIA’ nın SPADE’nin, kesilmiş veya yarı gizli resimleri tamamlamaya yönelik olduğunu, bu ‘boşaltma’ işleminin yapılmadığını belirtiyor. Ayrıca mevcut veri setlerinin bu amaç için uygun olmadığını belirtiyor.

Araştırmacılar, older yöntemler tarafından sergilenen texture ve renk tutarsızlıklarını çözebilen yeni bir ağ mimarisi olan pixel-clone adlı bir ağ geliştirdiler. Bu, mevcut nöral inpainting modellerine entegre edilebilir.

Yeni pipeline中的 pixel-clone genel yapısı.

Yeni pipeline中的 pixel-clone genel yapısı.

Modeli ‘boş’ yüzlerle eğitmek için, araştırmacılar gözlükler veya saçın alnı gizlediği resimleri dışladılar, çünkü saç çizgisi ile kaşlar arasındaki alan genellikle yüzün merkezi özelliklerini ‘yapıştırmak’ için en büyük tek pixel grubudur.

Eğitim resimlerinin hazırlanması. Alnın yüz hizalama tanıma ana noktalarına dayalı olarak kırpıldı, dikey olarak.flip edildi ve dikildi.

Eğitim resimlerinin hazırlanması.

256×256 piksel bir görüntü elde edildi, bu da nöral ağın gizli alanına büyük enough batch’lerle beslenebilecek kadar küçük bir boyuttur. Sonraki algoritmik upscaling, AR alanında çalışmak için gerekli çözünürlüğü geri yükleyecektir.

Mimari

Ağ, üç iç ağdan oluşuyor: Edge Completion, Pixel-Clone ve bir iyileştirme ağı. Edge completion ağı, EdgeConnect’te (yukarıda) kullanılan aynı tür encoder-decoder mimarisini kullanıyor.

Pixel-Clone, değiştirilmiş bir encoder-decoder metodolojisi kullanırken, iyileştirme katmanı U-Net mimarisini kullanıyor. Bu teknik, orijinal olarak tıbbi görüntüleme için geliştirildi ve souvent görüntü sentezleme araştırma projelerinde yer alıyor.

Eğitim iş akışı sırasında, dönüşümlerin doğruluğunu değerlendirmek ve gerektiğinde tekrarları yinelemeli olarak convergence‘a kadar yapmak gerekiyor. Bu amaçla, her biri 70×70 piksel yamaların yerel gerçekçiliğini değerlendiren iki ayrımcı PatchGAN kullanılıyor.

Eğitim ve Veri

Kenar tamamlama ağı bağımsız olarak ilk önce eğitilir, diğer iki ağ ise kenar tamamlama eğitiminin ağırlıklarına dayalı olarak birlikte eğitilir.

Makale, son yüz bozulma örneklerinin modelin merkezi amacı olmadığını belirtmese de, sistemi test etmek için çeşitli komik efektler uyguluyor, Bunlar arasında kaş kaldırma, büyütülmüş ağızlar, küçültülmüş alt yüzler ve ‘toonized’ efektler (yukarıdaki resimde gösterilen) yer alıyor.

Makale, ‘silinebilir yüzlerin, kullanıcı tarafından özelleştirilmiş öğelerin yerleştirilmesini gerektiren çeşitli artırılmış gerçeklik uygulamalarını mümkün kıldığını’ belirtiyor. Bu, yüzleri üçüncü taraf, kullanıcı tarafından sağlanan öğelerle özelleştirmenin mümkün olabileceğini gösteriyor.

Model, NVIDIA tarafından oluşturulan FFHQ veri seti上的 maske ile eğitiliyor. Bu veri seti, yaş, etnik köken, aydınlatma ve yüz pozları ve stillerindeki çeşitlilik nedeniyle faydalı bir genelleme elde etmek için yeterli bir çeşitlilik sunuyor. Veri seti 35.000 görüntü ve 10.000 eğitim maskesi içeriyor ve 4000 görüntü ve 1000 maske doğrulama amacıyla ayrılıyor.

Eğitim veri örnekleri.

Eğitim veri örnekleri.

Eğitilen model, 2017’nin CelebA-HQ ve VoxCeleb veri setlerindeki görüntüler üzerinde çıkarım yapabilir ve FFHQ’dan görüntüler ile diğer herhangi bir kısıtlamasız, görülmemiş yüzleri işleyebilir. 256×256 piksel görüntüler, PyTorch’ta çalışan ve Tesla (TSLA ) V100 GPU’da ‘2000,000 epoch’ için Adam optimizatörü ile büyük batch’lerde ağa beslendi.

Gerçek bir yüz上的 çıkarım sonuçları.

Gerçek bir yüz上的 çıkarım sonuçları.

Yüz tabanlı görüntü sentezleme araştırmalarında ortak olan şekilde, sistem saç, aksesuarlar, gözlükler ve yüz saçları gibi engeller veya örtmeler nedeniyle zaman zaman başarısızlık ile karşılaşıyor.

Rapor şu şekilde sonuçlanıyor:

‘Yaklaşımımız ticarileştirildi ve kısıtlamasız kullanıcı girişleri için ürünlerde iyi çalışıyor.’

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai