Anderson’un Açısı

Videolarda Yüzleri Makine Öğrenimi ile Yeniden Yapılandırma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Çin ve İngiltere arasındaki bir araştırma işbirliği, videolarda yüzleri yeniden şekillendirmek için yeni bir yöntem geliştirdi. Bu teknik, yüz yapısının genişletilmesi ve daraltılmasını yüksek tutarlılık ve artifactsız bir şekilde sağlar.

Araştırmacılar tarafından kullanılan bir YouTube videosundan, Jennifer Lawrence daha ince bir kişilik olarak görünüyor (sağda). Makale sonunda bulunan videoyu izleyerek daha fazla örnek görebilirsiniz. Kaynak: https://www.youtube.com/watch?v=tA2BxvrKvjE

Araştırmacılar tarafından kullanılan bir YouTube videosundan, Jennifer Lawrence daha ince bir kişilik olarak görünüyor (sağda). Makale sonunda bulunan videoyu izleyerek daha fazla örnek görebilirsiniz. Kaynak: https://www.youtube.com/watch?v=tA2BxvrKvjE

Bu tür bir dönüşüm genellikle geleneksel CGI yöntemleri ile mümkün olur, ancak bu yöntemler yüzü yeniden yaratmak için ayrıntılı ve pahalı motion-capping, rigging ve texturing prosedürleri gerektirir.

Bunun yerine, bu teknikte CGI, parametric 3D yüz bilgisi olarak bir nöral işlem hattına entegre edilir ve daha sonra bir makine öğrenimi iş akışının temelini oluşturur.

Geleneksel parametric yüzler, AI yerine CGI kullanan dönüşüm süreçleri için giderek daha fazla rehberlik olarak kullanılıyor. Kaynak: https://arxiv.org/pdf/2205.02538.pdf

Geleneksel parametric yüzler, AI yerine CGI kullanan dönüşüm süreçleri için giderek daha fazla rehberlik olarak kullanılıyor. Kaynak: https://arxiv.org/pdf/2205.02538.pdf

Araştırmacılar şöyle diyor:

‘Amacımız, doğal yüz deformasyonu temelinde portre yüzlerinin genel şeklini düzenleyerek yüksek kaliteli portre video şekillendirmesi elde etmek. Bu, güzelleştirme için şekilli yüz oluşturma ve görsel efektler için yüz abartma gibi uygulamalar için kullanılabilir.’

2B yüz bükmeye ve bozulmasına rağmen, bu, Photoshop’un ortaya çıkmasından bu yana tüketiciler için mevcut olan bir şeydir (ve yüz deformasyonu ve vücut dismorfisi etrafında garip ve genellikle kabul edilemez alt kültürlere yol açmıştır), videoyu CGI kullanmadan değiştirmek zor bir işlemdir.

Mark Zuckerberg'in boyutları Çin-İngiliz tekniği ile genişletildi ve daraltıldı.

Mark Zuckerberg’in yüz boyutları Çin-İngiliz tekniği ile genişletildi ve daraltıldı.

Vücut yeniden şekillendirme, bilgisayar vizyonu sektöründe, özellikle moda e-ticaret potansiyeli nedeniyle, yoğun ilgi gören bir alandır, ancak jemandi daha uzun veya iskeletsel olarak çeşitli göstermek hala önemli bir zorluktur.

Benzer şekilde, video kayıtlarında bir başlığın şeklini tutarlı ve ikna edici bir şekilde değiştirmek, araştırmacıların önceki çalışmasının konusuydu, ancak bu uygulama artifacts ve diğer sınırlamalardan mustaripti. Yeni teklif, bu önceki araştırmanın yeteneklerini statikten video çıkışına genişletir.

Yeni sistem, 32GB belleğe sahip bir AMD Ryzen 9 3950X masaüstü bilgisayarda eğitildi ve motion haritaları için OpenCV’den bir optik akış algoritması ve StructureFlow çerçevesi tarafından düzeltilen bir optical flow algoritması kullanır; yüz hizalama ağı (FAN) bileşeni için landmark tahmini, deepfake paketlerinde de kullanılan bir bileşen; ve Ceres Solver, optimizasyon zorluklarını çözmek için kullanılır.

Yeni sistemle yüz genişletmenin aşırı bir örneği.

Yeni sistemle yüz genişletmenin aşırı bir örneği.

Makale Parametric Reshaping of Portraits in Videos başlıklı ve Zhejiang Üniversitesi’nden üç araştırmacı ve Bath Üniversitesi’nden bir araştırmacı tarafından yazılmıştır.

Yüz Hakkında

Yeni sistem altında, video, bir resim dizisine çıkarılır ve her yüz için bir rigid pose ilk olarak tahmin edilir. Ardından, tutarlı kimlik parametrelerini tüm resim dizisi boyunca oluşturmak için bir dizi sonraki çerçeve birlikte tahmin edilir (yani video çerçeveleri).

Yüz bükmeye mimari akışı.

Yüz bükmeye mimari akışı.

Bundan sonra, ifade değerlendirilir ve bir yeniden şekillendirme parametresi üretilir, bu da lineer regresyon ile uygulanır. Ardından, bir novel signed distance function (SDF) yaklaşımı, yüzün lineamentlarını yeniden şekillendirmeden önce ve sonra dense bir 2B haritalama oluşturur.

Son olarak, çıktı videosunda bir içerik-farkında bükmeye optimizasyonu yapılır.

Parametrik Yüzler

Süreç, nöral ve GAN tabanlı yüz sentez sistemlerinin yanı sıra deepfake algılama sistemleri için de uygulanabilir olan bir 3B Морфабель Yüz Modeli (3DMM) kullanır.

Yeni makalede kullanılan bir 3B Морфабель Yüz Modeli (3DMM) örneği değil, ancak bir parametric prototype yüz. Sol üst, 3B Морфабель yüz上的 landmark uygulaması. Sağ üst, bir izo-haritanın 3B mesh vertices. Sol alt, landmark hizalama; sol-orta, çıkarılan yüz dokusunun bir izo-haritası; ve sağ alt, bir sonuç hizalama ve şekil. Kaynak: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Yeni makalede kullanılan bir 3B Морфабель Yüz Modeli (3DMM) örneği değil, ancak bir parametric prototype yüz. Sol üst, 3B Морфабель yüz上的 landmark uygulaması. Sağ üst, bir izo-haritanın 3B mesh vertices. Sol alt, landmark hizalama; sol-orta, çıkarılan yüz dokusunun bir izo-haritası; ve sağ alt, bir sonuç hizalama ve şekil. Kaynak: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Sistem, örneğin konu başını çevirdiğinde oluşan örtülme durumlarını dikkate almalıdır. Bu, deepfake yazılımlarının en büyük zorluklarından biridir, çünkü FAN landmarkları bu durumları hesaba katmak için little kapasiteye sahiptir ve yüz çevirdikçe veya örtüldükçe kaliteyi bozar.

Yeni sistem, 3B yüz (3DMM) ve 2B yüz (FAN landmarkları tarafından tanımlanan) arasındaki sınırı eşleştirebilen bir kontur enerjisi tanımlayarak bu tuzağı önler.

Optimizasyon

Bu sistemin faydalı bir uygulaması, video-sohbet filtrelerinde gerçek zamanlı deformasyonu gerçekleştirmektir. Mevcut çerçeve bu özelliği sunmaz ve gerekli hesaplama kaynakları, ‘canlı’ deformasyonu önemli bir zorluk haline getirir.

Makaleye göre ve 24fps video hedefi varsayarak, işlem hattındaki çerçeveler başına operasyonlar, her saniye video için 16.344 saniye gecikme temsil eder, ayrıca kimlik tahmini ve 3B yüz deformasyonu için bir defaya mahsus ek darbeler (321ms ve 160ms, sırasıyla).

Bu nedenle, ilerleme kaydetmek için optimizasyon anahtardır. Tüm çerçeveler boyunca ortak optimizasyon, işlemin üzerine ağır bir yük ekler ve ilk çerçeveden sonraki tüm çerçevelerin tutarlı kimliğini varsayan init-stil optimizasyonu, anormalliklere yol açabilir, bu nedenle araştırmacılar, katsayıları hesaplamak için pratik aralıklarla örneklenen çerçeveler alt kümesi kullanmıştır.

Bu alt küme üzerindeki çerçeveler için ortak optimizasyon daha sonra gerçekleştirilir, daha ince bir yeniden yapılandırma işlemine yol açar.

Yüz Bükmeye

Proje中的 yüz bükmeye tekniği, yazarların 2020 yılındaki Derin Şekilli Portreler (DSP) adlı çalışmalarının bir uyarlamasıdır.

Derin Şekilli Portreler, 2020 yılında ACM Multimedya'ya sunulan bir makale. Makale, ZJU-Tencent Oyun ve Akıllı Grafik İnovasyon Teknoloji Ortak Laboratuvarı'ndan araştırmacılar tarafından yönetiliyor. Kaynak: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Derin Şekilli Portreler, 2020 yılında ACM Multimedya’ya sunulan bir makale. Makale, ZJU-Tencent Oyun ve Akıllı Grafik İnovasyon Teknoloji Ortak Laboratuvarı’ndan araştırmacılar tarafından yönetiliyor. Kaynak: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Araştırmacılar şöyle diyor ‘Bu yöntemi, tek bir monocular görüntüyü yeniden şekillendirmekten, tüm görüntü dizisini yeniden şekillendirmeye genişletiyoruz.’

Testler

Makale, yeni yöntemi değerlendirmek için karşılaştırılabilir önceki materyallerin bulunmadığını belirtir. Bu nedenle, araştırmacılar, bükmüş video çıkışının çerçevelerini statik DSP çıkışıyla karşılaştırdı.

Yeni sistemi Derin Şekilli Portreler statik görüntüleri ile karşılaştırma.

Yeni sistemi Derin Şekilli Portreler statik görüntüleri ile karşılaştırma.

Araştırmacılar, DSP yönteminin, seyrek eşlemenin bir sonucu olarak artifacts ürettiğini ve yeni çerçevenin dense eşleme ile bu sorunu çözdüğünü belirtir. Ayrıca, DSP tarafından üretilen video, makaleye göre, görsel tutarlılık ve pürüzsüzlükten yoksundur.

Araştırmacılar şöyle diyor:

‘Sonuçlar, bizim yaklaşımımızın tutarlı ve şekillendirilmiş portre videoları üretebileceğini, ancak görüntü tabanlı yöntem kolayca dikkat çekici flickering artifacts üretmeye eğilimlidir.’

Daha fazla örnek için aşağıdaki videoyu izleyebilirsiniz:

 

İlk olarak 9 Mayıs 2022’de yayımlandı. 18:00 EET’de değiştirildi, SDF için ‘alan’ yerine ‘fonksiyon’ kullanıldı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai