Anderson’un Açısı
Derin Sahte Emotionların Şafağı

Araştırmacılar, yüzlerde yeni duyguları keyfi olarak uygulamak için yeni bir makine öğrenimi tekniği geliştirdiler. Bu, son zamanlarda ortaya çıkan ve dudak hareketlerini yabancı dil dublajına uydurmak için kullanılan mevcut teknolojileri uyarlar.
Araştırma, Boston’daki Northeastern Üniversitesi ve MIT Medya Laboratuvarı arasında eşit bir işbirliğidir ve İnvertable Frowns: Video-to-Video Facial Emotion Translation olarak adlandırılmıştır. Araştırmacılar, ilk sonuçların kalitesinin daha fazla araştırma ile geliştirilmesi gerektiğini kabul etseler de, Wav2Lip-Emotion olarak adlandırılan tekniğin, sinir ağı teknikleri ile tam video ifade değişikliğini doğrudan ele alan ilk tür olduğunu iddia ediyorlar.
Kodun temel kısmı GitHub‘da yayınlandı, ancak model kontrol noktaları daha sonra açık kaynak depoya eklenecek.

Solda, kaynak videonun ‘üzgün’ bir karesi. Sağda, ‘mutlu’ bir kare. Ortada, alternatif duyguları sentezlemek için iki yeni yaklaşım – üst satır: yüz ifadesi yüzeyinin tamamının değiştirildiği tam maskeli bir yüz; alt satır: yalnızca yüzün alt kısmını değiştiren daha geleneksel bir Wav2Lip yöntemi. Kaynak: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf
Tek Video Kaynak Verisi
Teoride, bu tür manipülasyonlar, DeepFaceLab veya FaceSwap gibi geleneksel deepfake depolarında tam vücut eğitimi ile elde edilebilir. Ancak standart iş akışı, ‘hedef’ kimliğe ait bir aktörün kendi ifadelerini başka bir bireye aktarılmasını ve performansın geri kalanıyla birlikte aktarılmasını içerir. Ayrıca, deepfake ses klonlama teknikleri genellikle illüzyonu tamamlamak için gerekli olur.
Daha fazla, bu popüler çerçeveler altında tek bir kaynak videodaki hedef1>hedef1 ifadesini gerçekten değiştirmek, yüz hizalama vektörlerini bu mimarilerin şu anda kolaylaştırmadığı bir şekilde değiştirmeyi içerir.

Wav2Lip-Emotion, orijinal video ses diyalogunu korurken ifadeleri dönüştürür.
Bunun yerine, Wav2Lip-Emotion, bir videonun bir bölümünden duygu ile ilgili ifadeleri ‘kopyalayıp yapıştırmaya’ ve bunları diğer noktalara aktarmaya çalışır. Bu, nihayetinde ifade manipülasyonu için daha az çaba gerektiren bir yöntem sunmayı amaçlar.
Offline modeller, daha sonra konuşmacının alternatif videolarında eğitilebilir ve bu da tek bir videonun ‘ifade paleti’ne ihtiyaç duymayı ortadan kaldırabilir.
Potansiyel Amaçlar
Araştırmacılar, ifade değişikliği için çeşitli uygulamalar önerirler. Bunlar arasında, PTSD ve yüz felci hastaları için canlı video filtreleri bulunur. Makalede şunlar yer alır:
‘Kısıtlı veya inhibe edilmiş yüz ifadeleri olan bireyler, sosyal durumlarına better uydurmak için kendi ifadelerini ayarlamadan yararlanabilirler. Birisi, onlara gösterilen videolardaki ifadeleri değiştirmek isteyebilir. Video konferans sırasında konuşmacılar birbirlerine bağırabilir, ancak hoş olmayan ifadeler olmadan konuşmanın içeriğini toplamak isteyebilirler. Ya da bir film yönetmeni, bir aktörün ifadelerini artırmak veya azaltmak isteyebilir.’
Yüz ifadesi, sözlerin söylendiği şekilde karşıt olabilecek bir ana ve temel niyet göstergesi olduğundan, ifadeyi değiştirme yeteneği, iletişimin nasıl algılandığını da değiştirme yeteneği sunar.
Önceki Çalışmalar
Makine öğrenimi ifade değişikliği ilgisi en az 2012’ye kadar uzanır. O zamanlar, Adobe, Facebook ve Rutgers Üniversitesi arasında bir işbirliği, bir Tensor tabanlı 3D geometri yeniden yapılandırma yaklaşımını önerdi. Bu, hedef videonun her bir karesine CGI mesh uygulayarak ifade değişikliğini gerçekleştirdi.

2012 Adobe/Facebook araştırması, geleneksel CGI tabanlı değişiklikleri video kayıtlarına uyguladı. İfadeler artırılabilir veya bastırılabilir. Kaynak: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf
Bu teknik vaat edildiği halde, uygulanması zor ve kaynakları önemliydi. O zamanlar, CGI, doğrudan özellik alanı ve piksel manipülasyonu için bilgisayar vizyonu tabanlı yaklaşımların çok öncesindeydi.
Yeni makaleye daha yakın bir çalışma, 2020’de yayınlanan MEAD veri seti ve ifade oluşturma modelidir. Bu, ‘konuşan baş’ videoları oluşturabilir, ancak doğrudan kaynak videoda ifade değişikliği做me potansiyeline sahip değildir.

2020’de SenseTime Research, Carnegie Mellon ve üç Çin üniversitesi arasındaki işbirliği ile ortaya çıkan MEAD ile ifade oluşturma. Kaynak: https://wywu.github.io/projects/MEAD/MEAD.html
2018’de, GANimation olarak adlandırılan bir başka makale, US/İspanyol akademik bir işbirliği olarak ortaya çıktı ve stillerden facial animasyon oluşturmak için Generative Adversarial Networks kullandı.

GANimation ile stillerden ifade değişikliği. Kaynak: https://arxiv.org/pdf/1807.09251.pdf
Wav2Lip-Emotion
Yeni proje, Wav2Lip’e dayanır. Wav2Lip, 2020’de, orijinal videoda hiç yer almayan yeni konuşma veya şarkı girişine uygun dudak senkronizasyonu için bir yöntem sunarak dikkat çekmişti.
Wav2Lip mimarisi, BBC arşivlerinden alınan cümlelerden oluşan bir korpus üzerinde eğitildi. Wav2Lip’i ifade değişikliği görevine uyarlamak için, araştırmacılar mimariyi yukarıda belirtilen MEAD veri seti üzerinde ‘ince ayarladılar’.
MEAD, 60 aktörün aynı cümleyi okuyarak çeşitli yüz ifadeleri yaptığı 40 saatlik video içerir. Aktörler 15 farklı ülkeden gelir ve projenin (ve türetilen projelerin) uygulanabilir ve iyi genellemiş ifade sentezi üretmesine yardımcı olmak amacıyla uluslararası özellikler sunar.
Araştırmalar sırasında, MEAD sadece veri setinin ilk bölümünü yayınlamıştı. Bu, 47 kişinin ‘kızgın’, ‘iğrenme’, ‘korku’, ‘hafifme’, ‘mutlu’, ‘üzgün’ ve ‘şaşkınlık’ gibi ifadeler yapan kişiler içeriyordu. Araştırmacılar, bu yeni yaklaşımın ilk denemesinde, kapsamını ‘mutlu’ ve ‘üzgün’ duyguların üzerine koyarak sınırlı tuttular, çünkü bunlar en kolay tanınanlardır.
Yöntem ve Sonuçlar
Orijinal Wav2Lip mimarisi sadece yüzün alt kısmını değiştirirken, Wav2Lip-Emotion ayrıca tam yüz maskesi ve ifade sentezi ile deneysel çalışır. Bu nedenle, araştırmacıların dahili değerlendirme yöntemlerini de değiştirmeleri gerekliydi, çünkü bunlar tam yüz yapılandırması için tasarlanmamıştı.
Araştırmacılar, orijinal kodu, orijinal ses girişini korurken ve dudak hareketi tutarlılığını sağlayarak geliştirdiler.
Üretici bileşen, kimlik kodlayıcısı, konuşma kodlayıcısı ve yüz dekoderi içerir. Konuşma bileşeni, ayrıca frame’lerle birleştirilen yığınlanmış 2B convolutions olarak kodlanır.
Üretici bileşenin yanı sıra, değiştirilmiş mimari, dudak senkronizasyonunun kalitesine, duygu hedefine ve karşıt olarak eğitilen görsel kalite hedefine yönelik üç ana ayrımcı içerir.
Tam yüz yeniden yapılandırması için, orijinal Wav2Lip çalışmasında bir先 vardı ve bu nedenle model sıfırdan eğitildi. Alt-yüz eğitimi (yarı-maskeli) için, araştırmacılar orijinal Wav2Lip kodunda bulunan kontrol noktalarından başladılar.
Otomatik değerlendirme yanı sıra, araştırmacılar yarı-otomatik bir hizmet platformundan sağlanan halkın görüşünü kullandılar. Çalışanlar, süperimpoze edilen duyguları tanımada çıktı için genellikle yüksek puanlar verirken, sadece ‘orta’ değerlendirmeler için görüntü kalitesi raporladılar.
Araştırmacılar, üretilen video kalitesini daha da iyileştirmenin yanı sıra, gelecekteki işlerin daha geniş bir duygu yelpazesini kapsayabileceğini ve bu çalışmanın eşit olarak etiketlenmiş veya otomatik olarak çıkarılan kaynak verilerine ve veri setlerine uygulanabileceğini, sonunda kullanıcının keyfine göre duyguları artırıp azaltabileceği veya orijinal kaynak videodaki duygularla karşıt duygularla değiştirebileceği bir sistem oluşturabileceğini öne sürdüler.












