Anderson’un Açısı

Neden Derin Sahtecilikler Şu Anda Duygu inceliğini İfade Edemez

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
The Book of Boba Fett - Disney

Dün yayınlanan Star Wars spin-off The Book of Boba Fett dizisinin 6. bölümünün debutu, hayranların görüşünü böldüğü görünüyor. Genel olarak beğeni ile karşılanan, sosyal ağlar boyunca, gençleştirilmiş Mark Hamill’in çok daha iyi bir şekilde yeniden yaratılması, Industrial Light and Magic’in amatör derin sahtecilik uygulayıcısı Shamook’u işe almasıyla doğrudan ilgili olduğu şeklinde bir genel varsayım var (ki önceki görünümü 2020’de The Mandalorian dizisinin 2. sezon finalinde); ve karakterin renderingsinin derin sahtecilik teknolojisinin bir kombinasyonu olabileceği ve belki de CGI ile temizlendiği düşünülüyor.

Bununla ilgili olarak şu anda sınırlı bir onay var, ancak Shamook, ILM sözleşmesiyle ilgili NDA’dan bu yana dünyaya çok az şey söyledi. Buna rağmen, çalışma, 2020 CGI’sine göre olağanüstü bir iyileşme gösteriyor; arşivlerden elde edilen derin sahtecilik modelleriyle ilişkili olan bazı “parlaklık” özelliklerini sergiliyor ve genel olarak derin sahtecilikler için mevcut en iyi görsel standarda uygun.

Hayranların diğer bir görüşü, yeni “Genç Luke” girişiminin önceki girişimden farklı bir hata setine sahip olduğu. Belki de en çok dikkat çeken şey, yeni Skywalker yeniden yaratımını içeren çok uzun dizilerdeki ifade eksikliği ve derin sahteciliklere göre daha tipik olan ince, uygun duygulardır; The Verge, Boba Fett simülasyonunu Mark Hamill’in 1983 dondurulmuş yüzünün uncanny, blank visage olarak tanımladı.

Bağımsız olarak yeni ILM yeniden yaratımının arkasındaki teknolojiler, derin sahtecilik dönüşümlerinin, mimiklerin inceliğini ifade etme konusunda temel bir problemi vardır ve bu, mimari değişikliklerle veya kaynak eğitim materyalini iyileştirerek çözülmesi zor bir problemdir ve genellikle viral derin sahtecilik yapanların hedef videoyu seçerken yaptığı dikkatli seçimler tarafından kaçınılmazdır.

Yüz Hizalama Sınırlamaları

En çok kullanılan iki derin sahtecilik açık kaynaklı depo DeepFaceLab (DFL) ve FaceSwap olup, her ikisi de 2017’nin anonim ve tartışmalı kaynak kodundan türetilmiştir ve DFL, sınırlı araçlarına rağmen VFX endüstrisinde büyük bir önde bulunmakta.

Her bir paket, ilk olarak, kaynak materyalden (yani video kareleri ve/veya durağan görüntüler) tanımlayabildiği yüzlerden yüz özelliklerini çıkarmakla görevlendirilir.

Adrian Bulat'ın Yüz Hizalama Ağı (FAN) resmi depodan çalışır durumda.

Yüz Hizalama Ağı (FAN) resmi depodan çalışır durumda. Kaynak: https://github.com/1adrianb/face-alignment

DFL ve FaceSwap, Yüz Hizalama Ağı (FAN) kütüphanesini kullanır. FAN, çıkarılan yüzler için 2B ve 3B (yukarıdaki resme bakınız) özellikler oluşturabilir. 3B özellikler, yüzün algılanan yönüne kadar aşırı profillere ve nispeten keskin açılara kadar geniş bir şekilde hesap edilebilir.

Ancak, bunlar yüzleri ve pikselleri yönlendirmek ve değerlendirmek için çok ilkel rehberler olduğu açık.

FaceSwap forumundan, yüz çizgileri için mevcut özelliklerin kaba bir göstergesi.

FaceSwap forumundan, yüz çizgileri için mevcut özelliklerin kaba bir göstergesi. Kaynak: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

Yüzün en temel çizgileri için izin verilir: gözler genişleyebilir ve kapanabilir, çene de öyle; ağızın temel konfigürasyonları (gülme, surat asma vb.) izlenebilir ve uyarlanabilir. Yüz, kameranın bakış açısına göre yaklaşık 200 dereceye kadar her yöne dönebilir.

Bunun ötesinde, bu sınırlar içindeki piksellerin davranışları için oldukça kaba çitler bunlar ve tüm derin sahtecilik sürecinde真正 olarak matematiksel ve kesin yüz rehberliklerinin tek temsilcileridir. Eğitim süreci kendisi, bu sınırlar içinde veya yakınında piksellerin nasıl dağıldığını sadece karşılaştırır.

DeepFaceLab'de eğitim.

DeepFaceLab’de eğitim. Kaynak: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Yüzün alt parçalarının topolojisi (yanakların konveksliği ve konkavitesi, yaşlanma detayları, çukurlar vb.) için bir hüküm bulunmadığından, bu ‘ince’ alt özelliklerini bir kaynak (‘yazmak istediğiniz yüz’) ve bir hedef (‘yapıştırmak istediğiniz yüz’) kimlik arasında eşleştirmeye bile denemek mümkün değildir.

Sınırlı Verilerle Yapmak

Derin sahtecilikler için iki kimlik arasında eğitim amacıyla eşleşen veriler almak kolay değil. İhtiyacınız olan açı ne kadar alışılmadık olursa, o açıdaki eşleştirmenin her iki kimlik arasında gerçekten aynı ifadeyi içerdiğinden daha fazla fedakarlık yapmak zorunda kalırsınız.

Yakın, ancak tam olarak bir eşleşme değil.

Yakın, ancak tam olarak bir eşleşme değil.

Yukarıdaki örnekte, iki kimlik birbirine oldukça benzer, ancak bu, bu veri setinin bir açıyı tam olarak eşleştirmeye yaklaştığı kadar yakın olabileceği.

Açık farklılıklar kalır: açı ve lens tam olarak eşleşmez ve aydınlatma da öyle; konu A, konu B’nin gözlerini tamamen kapattığı gibi kapatmaz; görüntü kalitesi ve sıkıştırma konusu A’da daha kötüdür ve irgendwie konu B daha mutlu görünür gibi.

Ama, bilirsiniz, bu elimizdeki her şey, bu nedenle buna rağmen eğitim vermeye çalışacağız.

Çünkü bu A><B eşleşmesi bu kadar çok farklı öğe içeriyor, bu sette benzer pairings’in çok az veya hiç olmadığından emin olabilirsiniz. Bu nedenle, eğitim ya alt öğrenme ya da aşırı öğrenme yapacak.

Alt Öğrenme: Bu eşleşme bir azınlık ise (yani, ana veri seti oldukça büyük ve bu özelliklere nadiren sahip), eğitim zamanı açısından daha ‘popüler’ (yani, kolay/nötr) pairings’e göre çok fazla eğitim zamanı almayacaktır. Dolayısıyla, bu açı/ifade, eğitilen modelde iyi temsil edilmeyecektir.

Aşırı Öğrenme: Bu tür nadir A><B pairings için veri eşleştirmeleri az olduğunda, derin sahtecilikçiler bazen bu pairingle birçok kez veri setine kopyalar, böylece final modelde bir özellik olarak daha iyi bir şans elde edebilir. Bu, aşırı öğrenmeye yol açacaktır, burada eğitilen modelle yapılan derin sahtecilik videoları, iki fotoğraf arasındaki farklılıkları, gözlerin ne kadar kapalı olduğu gibi, pedantik bir şekilde tekrarlayacaktır.

Aşağıdaki resimde, Vladimir Putin’in DeepFaceLab’de Kevin Spacey’ye dönüştürülmüş hali görülüyor. Burada, eğitim 160.000 iterasyonda oldukça ilerlemiş.

Kaynak: https://i.imgur.com/OdXHLhU.jpg (aslen buradan:)

Kaynak: https://i.imgur.com/OdXHLhU.jpg

İlgisiz bir gözlemci, Putin’in bu test-swap’lerde Spacey’den biraz daha uzaysal göründüğünü iddia edebilir; bir online duygu tanıma programı, ifadelerdeki bu uyumsuzluğu ne diyeceğini görelim:

Kaynak: https://www.noldus.com/facereader/measure-your-emotions

Kaynak: https://www.noldus.com/facereader/measure-your-emotions

Bu particular oracle’a göre, ki bu, DFL ve Faceswap’dan çok daha ayrıntılı bir yüz topografyasını analiz ediyor, Spacey, bu Putin derin sahteciliğinde oluşan sonuçtan daha az kızgın, iğrenmiş ve hafif bir nefret içeriyor.

Uyumsuz ifadeler, bir paket olarak gelirler, çünkü popüler derin sahtecilik uygulamaları, ifadeleri veya duyguları tanıma veya eşleştirme yeteneğine sahip değildir, sadece ham bir piksel>piksel eşleştirmesi olarak.

Bunlar bizim için çok büyüktür. Yüz ifadelerini temel bir hayatta kalma tekniği olarak en küçük yaşlarımızdan itibaren öğrenir ve yetişkinlikte sosyal entegrasyon, çiftleşme ve sürekli bir tehdit değerlendirmesi çerçevesi için bu beceriye güvenmeye devam ederiz. Derin sahtecilik teknolojileri, sonunda bu konuda hesaba katmak zorunda kalacaktır.

Karşıt

Derin sahtecilik devrimi, ‘klasik’ film yıldızlarını modern filmlere ve TV’lere yerleştirmenin vaadini getirdi, ancak AI, bu klasik eserlerin daha uyumlu bir çözünürlükte ve kalitede çekilmesini sağlamak için zaman içinde geriye gidemez.

Eğer Boba Fett Hamill yeniden yaratımı büyük ölçüde eğitilen bir derin sahtecilik modelinin eseriyse, modelin veri seti, gösterinin zaman çizelgesi yakınındaki döneme ait Hamill’in (yaklaşık Jedi’nin Dönüşü üretim zamanı, 1981-83) görüntülerini kullanmak zorunda kalacaktı.

Film çekildi Eastman Color Negative 250T 5293/7293 stok filmiyle, bu, o zamanlar orta ila ince taneli olarak kabul edilen 250ASA emülsiyondur, ancak 1980’lerin sonuna kadar netlik, renk aralığı ve doğruluk açısından даже 1980’lerin sonuna kadar aşılmıştır. Bu, kendi zamanının bir film stoku ve Jedi operasının kapsamı, önde gelen aktörlerine bile çok az yakın plan çekimi sunmuştur, bu da grain sorunlarını daha da kritik hale getirmiştir, çünkü kaynak yüzler sadece karelerin bir kısmını işgal etmektedir.

<img class="wp-image-180040 size-full" src="https://www.unite.ai/wp-content/uploads/2022/02/hamill-rotj.jpg" alt="Hamill'in Jedi’nin Dönüşü (1983) filmindeki çeşitli sahneleri.” width=”637″ height=”628″ /> Hamill’in Jedi’nin Dönüşü (1983) filmindeki çeşitli sahneleri.

Ek olarak, Hamill’i içeren birçok VFX’li sahne, film grainini artıran optik bir yazıcıdan geçmiştir. Ancak, Lucasfilm arşivlerine erişim – ki master negatiflerin iyi bir şekilde korunmuş olabileceği ve saatlerce ek kullanılmamış ham görüntüler sunabileceği varsayılır – bu sorunu aşabilir.

Bazen, bir aktörün çıktısının birkaç yılını kapsamak ve derin sahtecilik veri setini artırmak ve çeşitlendirmek mümkündür. Hamill’in durumunda, derin sahtecilikçiler, 1977’de bir araba kazası sonucu oluşan görünüm değişikliği ve Jedi之后 hemen ödüllü bir seslendirme sanatçısı olarak ikinci kariyerine başlamasıyla engellenirler, bu da kaynak materyalinin oldukça az olmasını sağlar.

Sınırlı Duygu Aralığı?

Derin sahtecilik yapan aktörünüzün sahneyi yedirmesi gerekiyorsa, kaynak görüntülerinde çok geniş bir yüz ifadesi yelpazesi içeren görüntülere ihtiyacınız olacak. Olası olan tek yaşa uygun görüntüler, bu ifadelerin çoğunu içermeyebilir.

Mesela, Jedi’nin Dönüşü hikayesinin zaman çizelgesi geldiğinde, Hamill’in karakteri büyük ölçüde duygularını kontrol etmiş, bu da orijinal franchise mitolojisinin merkezi bir gelişmesiydi. Bu nedenle, Jedi verilerini kullanarak bir Hamill derin sahtecilik modeli oluşturursanız, o zaman bu zamanda Hamill’in rolünün talep ettiği daha sınırlı duygu aralığı ve alışılmadık yüz kompozisyonu ile çalışmak zorunda kalacaksınız, franchise’deki önceki girişlerine kıyasla.

Hatta Jedi filminde Skywalker karakterinin stres altında olduğu anlar olduğunu ve daha geniş bir ifade aralığına malzeme sağlayabileceğini düşünsek bile, bu sahnelerdeki yüz materyali yine de hareketli bulanıklaşma ve aksiyon sahnelerindeki tipik hızlı kurgu nedeniyle geçici ve dengesizdir; bu nedenle veriler oldukça dengesiz.

Genelleme: Duyguların Birleşmesi

Eğer Boba Fett Skywalker yeniden yaratımı gerçekten bir derin sahtecilikse, bazıları tarafından kendisine yöneltilen ifade aralığının eksikliği, tamamen sınırlı kaynak materyali nedeniyle değildir. Derin sahteciliklerin kodlayıcı-dekoder eğitim süreci, binlerce görüntüden merkezi özellikleri başarılı bir şekilde özümseyen genelleştirilmiş bir model aramaktadır ve en azından denemek için veri setinde eksik veya nadir olan bir açıyı denemek için çalışır.

Bu esneklik olmasaydı, bir derin sahtecilik mimarisi, sadece temel morfları çerçevesi başına kopyalayarak ve yapıştıran, zamansal uyarlamayı veya bağlamı dikkate almayan bir şekilde çalışırdı.

Ancak, bu esnekliğin acılı bedeli, ifade sadakatinin bu sürecin kurbanı olmasıdır ve eğer varsa, ‘ince’ ifadeler doğru olanlar olmayabilir. Hepimiz yüzlerimizi 100 parçalık orkestralar gibi oynarız ve bunu yapmak için iyi donanımlıyız, oysa derin sahtecilik yazılımları argüman olarak en azından yaylı çalgıları eksik.

İfadelerin Etki Açığında Ayrılık

Yüz hareketleri ve bizim üzerimizdeki etkileri, tüm yüzler için uniform bir dil değildir; Roger Moore’un üzerinde kayıtsız görünen kaldırılmış kaş, Seth Rogen’de daha az sofistike görünebilir, Marilyn Monroe’nun çekici cazibesi, ‘kızgın’ veya ‘etkisiz’ (örneğin, Aubrey Plaza’nın Parks and Recreation dizisindeki karakteri gibi) en çok veri mevcut olan bir role derin sahtecilik yapılırsa daha negatif bir duyguya çevirebilir.

Bu nedenle, A/B yüz setleri arasında piksel>piksel eşdeğerliği bu konuda faydalı değildir; ancak bu, mevcut derin sahtecilik FOSS yazılımlarında sunulan tek şeydir.

Aslında needed olan, sadece ifadeleri tanıyabilen ve duyguları çıkarabilen, ancak kızgın, çekici, sıkılmış, yorgun gibi yüksek seviyeli kavramları vücüt edebilen ve her iki yüz seti kimliği için bu duyguları ve ilgili ifadelerini sınıflandırabilen bir derin sahtecilik çerçevesidir, ağız veya göz kapağının konumunu incelemekten veya çoğaltmaktan ziyade.

 

 

İlk olarak 3 Şubat 2022’de yayınlandı. 19:47 EET’de güncellendi, yanlış ad ataması.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai