Anderson’un Açısı
Derin Sahtekarlığın Sonraki Devrimi: Ayrıştırma

CGI veri artırımı, derin sahtekarlık görüntülerini kontrol etmek için yeni bir projede kullanılıyor. Hala CGI başlarını derin sahtekarlık yüz veritabanındaki eksiklikleri doldurmak için etkili bir şekilde kullanamazsınız, ancak kimlik ve bağlamı ayırmaya yönelik yeni bir araştırma dalgası sayesinde, yakında buna ihtiyacınız olmayabilir.
Geçtiğimiz birkaç yılın en başarılı viral derin sahtekarlık videolarının yaratıcıları, kaynak videolarını çok dikkatli bir şekilde seçerler, profil çekimleri (yani polis tutuklama prosedürleri tarafından popüler hale getirilen yan yana mugshot’lar), keskin açılardan ve alışılmadık veya abartılı ifadelerden kaçınırlar. Artık, viral derin sahtekarların ürettiği demonstrasyon videoları, “en kolay” açılara ve ifadelerine seçilen düzenlenmiş derlemelerdir.
Aslında, bir derin sahtekarlık videosuna bir ünlü deepfake eklemek için en uygun hedef video, orijinal kişinin (kimliği deepfake tarafından silinecek) doğrudan kameraya baktığı ve minimal bir ifade aralığına sahip bir videodur.

Son yıllarda popüler olan çoğu deepfake, subjelerin doğrudan kameraya baktığını ve ya sadece popüler ifadeleri (örneğin gülümsemeyi) taşıdığını, ya da (2019’da Sylvester Stallone’un Terminatör olarak yaptığı deepfake’de olduğu gibi) ideal olarak hiç ifade taşımadığını gösteriyor, çünkü nötr ifadeler çok yaygın olduğundan deepfake modellerine kolayca entegre edilebilir.
Deepfake teknolojileri gibi DeepFaceLab ve FaceSwap, bu basit değişiklikleri çok iyi yapar, ancak ne yapamadıklarını fark etmez ve genellikle denemezler.

Arnold Schwarzenegger’in Sylvester Stallone’a dönüştüğü bir deepfake videosundan alınan kareler – ancak açılardan çok trickli olduğunda. Profiller, current deepfake yaklaşımlarının süregelen bir sorunu olmayı sürdürüyor, kısmen deepfake çerçevelerinde yüz pozlarını tanımlamak için kullanılan açık kaynaklı yazılımların yan görünümler için optimize edilmemiş olmasından, ancak principalmente gerekli veritabanlarının her ikisinde de uygun kaynak materyalin eksikliğinden dolayı. Source: https://www.youtube.com/watch?v=AQvCmQFScMA
İsrail’den yeni bir araştırma, sentetik verileri, yani CGI başlarını, derin sahtekarlığı 2020’lerin içine taşıyarak, yüz kimliklerini (örneğin, “Tom Cruise”ın temel yüz özelliklerini) bağlamından (örneğin, “yukarı bakmak”, “yan yana bakmak”, “kaş çekmek” vb.) gerçekten ayırmak için yeni bir yöntem öneriyor.

Yeni sistem, poz ve bağlamı (örneğin, bir göz kırpma) bireysel kimlik kodlamasından ayırıyor, ilgili sentetik yüz verilerini kullanarak (solda resmedilen). İlk satırda, bir “göz kırpma”nın Barack Obama’nın kimliğine aktarılmasını görüyoruz, bir GAN’ın latent uzayının öğrenilmiş非lineer yolunu temsil eden soldaki CGI görüntüsüne dayanarak. Aşağıdaki satırda, former başkanın yüzüne aktarılan uzatilmiş ağız köşesifacetini görüyoruz. Sağ altta, her iki özelliğin aynı anda uygulanmasını görüyoruz. Source: https://arxiv.org/pdf/2111.08419.pdf
Bu, basit bir deepfake kukla oyunu değil, daha çok avatarlar ve kısmi yüz senkronizasyonu için uygun bir tekniktir ve tam teşekküllü deepfake video dönüşümleri için sınırlı potansiyele sahiptir.
Aslında, bu, enstrümantalite (örneğin, “başın açısını değiştir”, “bir kaş çek”) ile kimlik arasındaki temel bir ayrımı temsil ediyor ve yüksek düzeyde, türetilmiş değil, görüntü sentezine dayalı bir deepfake çerçevesine giden bir yol sunuyor.
Yeni makale, Delta-GAN-Encoder: Explicit Image Editing için Semantic Değişiklikleri Kodlama, Az Sentetik Örnekler Kullanarak adlı bir makale ve İsrail Teknoloji Enstitüsü’nden araştırmacılardan geliyor.
Deepfake’lerin şu anda nasıl üretildiği anlamak için, deepfake porn sitelerinden Industrial Light and Magic’e (DeepFaceLab açık kaynaklı deposu hem amatör hem de profesyonel deepfaking’de hakim) kadar her yerde neler olduğu hakkında bir göz atalım.
Şu Anda Deepfake Teknolojisinin Geri Kalan Noktası Nedir?
Deepfake’ler şu anda, iki yüz görüntü klasörüne (örneğin, “Arnie”yi “boyamak” istediğiniz kişi ve “Sly”yi videoya yerleştirmek istediğiniz kişi) eğitim veren bir kodlayıcı/çözücü makine öğrenimi modeli tarafından oluşturuluyor.

İki farklı yüz kümesindeki çeşitli poz ve aydınlatma koşulları. A sütunundaki üçüncü satırın sonundakiDistinct ifade, diğer veritabanında benzeri olmayan bir ifade.
Kodlayıcı/çözücü sistemi, her iki klasördeki her bir görüntüyü birbirleriyle karşılaştırır, bunu yüz binlerce iterasyon boyunca (sık sık bir hafta boyunca) sürdürür, geliştirir ve tekrarlar, böylece her iki kimliğin temel özelliklerini yeterince iyi anlar ve bunları dilediğince değiştirebilir.
Her iki kişinin de değiştirildiği süreçte, deepfake mimarisi tarafından öğrenilen kimlik, bağlamla iç içe geçmiştir. Bir generic poz için “her zaman” ilkeleri öğrenip uygulayamaz, ancak her kimlik için birden fazla örnek gerektirir.
Dolayısıyla, sadece gülümseme veya doğrudan kameraya bakmaktan daha farklı bir şey yapan iki kimliği değiştirmek istiyorsanız, o özel poz/kimlik için birden fazla örnek gerekecektir.

Yüz kimliği ve poz özellikleri şu anda iç içe geçmiş durumda, bu nedenle DeepFaceLab gibi sistemlerde etkili bir deepfake modeli eğitiminde iki yüz veritabanı arasında geniş bir ifade, baş pozı ve (daha az ölçüde) aydınlatma uyumu gereklidir. Bir yapılandırma (örneğin, “yan görünüm/gülümseme/güneşli”) ne kadar az iki yüz kümesinde yer alırsa, deepfake videosunda o kadar az doğru bir şekilde render edilir.
Eğer set A’da o poz varsa, ancak set B’de yoksa, şanssızsınız; ne kadar uzun süre eğitim verirseniz verin, o pozu iyi bir şekilde yeniden üretmeyecek, çünkü sadece gerekli bilginin yarısına sahip olacaksınız.
Eğer eşleşen görüntüleriniz varsa, bu yeterli olmayabilir: eğer set A’da o pozu varsa, ancak set B’deki eşdeğer pozu sert yan aydınlatma ile karşılaştırırsanız, swap kalitesi o kadar iyi olmayacaktır.
Veri Neden Az?
Profilsel yüz fotoğrafları bulmak zordur, çünkü çoğu insan kendine çok fazla profil fotoğrafı çekmez ve bu tür fotoğrafları atar. Resim ajansları da benzer şekilde davranır.
Deepfakers, sınırlı yan görünüm veri kümesine sahip oldukları için, bu pozu biraz dikkat ve zaman ayırmak için, eğitim sırasında bu poza dikkat çekmek amacıyla, yüz kümesinde birden fazla kopyasını ekler.

Yan yüz resimlerinin birçok farklı türü vardır, ancak bunlar bir veritabanına dahil edilmeyecek kadar azdır – gülümseme, kaş çekme, bağırma, ağlama, karanlık aydınlatma, küçümseme, sıkılma, neşe, flaş aydınlatma, yukarı bakma, aşağı bakma, gözler açık, gözler kapalı… ve benzeri.
Ve bu sadece profiller. Kendinizi yukarıya bakan kaç fotoğraf çekmişsinizdir? Bu pozu ve kameranın açısını kapsayan 10.000 olası ifadeyi temsil edecek kadar fotoğrafınız var mı?
Eğer bu mümkün olsaydı, yüzün tüm açılardan ve aydınlatma koşullarından tam kapsamı, yüz binlerce resimden oluşan bir veritabanı oluştururdu ve bu, şu anda kullanılan deepfake çerçevelerinin eğitim süreci için çok büyük olurdu.
Sentetik Yerleştirme
Deepfakers, derin sahtekarlık için “eksik” pozları elde etmek amacıyla, CGI benzeri görüntüleri, 3D uygulamalarında oluşturulan başları denedi.

Hiçbir AI gerektirmez; bir aktris, geleneksel bir CGI programı olan Cinema 4D’de, mesh’ler ve bitmap tekstürler kullanılarak yeniden oluşturulur – bu teknoloji 1960’lara dayanır, ancak 1990’lardan itibaren yaygın kullanım alanı bulmuştur. Bu yüz modeli, derin sahtekarlık kaynağı verileri için farklı pozlar, aydınlatma stilleri ve yüz ifadeleri üretmek için kullanılabilecekti. Gerçekte, deepfaking’de sınırlı veya hiç kullanılmamıştır, çünkü CGI yüzlerin “sahteliği” değiştirilen videolarda sızabilir. Source: https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Bu yöntem, yeni deepfake uygulayıcıları tarafından genellikle erken bir aşamada terk edilir, çünkü虽然 CGI yüzleri eksik pozları ve ifadeleri sağlayabilir, ancak sentetik görünüm genellikle değiştirilen videolarda sızabilir.
Bu, deepfake videosunda “uncanny valley” yüzlerinin aniden belirmesine neden olabilir, çünkü algoritma, o poz veya ifade için sahip olduğu tek veri olan manifestly sahte yüzleri kullanmaya başlar.

DeepFaceLive’in varsayılan kurulumunda, bir web kamerası oturumu gibi canlı akışta deepfake gerçekleştirebilen DeepFaceLab’ın bir sürümü olan bir 3D deepfake algoritması, Avustralyalı aktris Margot Robbie için dahil edilmiştir. Bir CGI versiyonu, deepfake veri kümelerinde eksik “eksik” açılara ulaşmak için kullanılabilecekti. Source: https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace
CGI Yüzler Bağlamdan Ayrılmış, Kavramsal Rehberler Olarak
İsrail’li araştırmacaların Delta-GAN Encoder (DGE) yöntemi daha etkili, çünkü CGI görüntülerinden alınan poz ve bağlamsal bilgiler, hedefin “kimlik” bilgilerinden tamamen ayrılmıştır.
Bu ilkeyi aşağıdaki resimde görebiliriz, çeşitli baş orientasyonları, CGI görüntülerini bir rehber olarak kullanarak elde edilmiştir. Kimlik özellikleri, bağlamsal özelliklerle ilgili olmadığı için, sahte görünüm veya kimlik sızıntısı yoktur.

Yeni yöntemle, birden fazla açıdan deepfake gerçekleştirmek için üç ayrı gerçek yaşam kaynağı resmine ihtiyacınız yok, sadece CGI başını döndürebilirsiniz, yüksek seviyeli soyut özellikleri kimliğe aktarılarak hiçbir kimlik bilgisi sızdırmaz.

Delta-GAN-Encoder. Üst sol grup: Kaynak görüntüsünün açısı bir saniyede değiştirilebilir ve çıktı olarak yansıtılan yeni bir kaynak görüntü oluşturulur; üst sağ grup: aydınlatma da kimlikten ayrılmıştır, böylece aydınlatma stillerinin üst üste bindirilmesi mümkündür; alt sol grup: birden fazla yüz detayı değiştirilerek bir “üzgün” ifade oluşturulur; alt sağ grup: tek bir yüz ifadesi detayı değiştirilir, böylece gözler kırpılır.
Bu kimlik ve bağlam ayrımı, eğitim aşamasında gerçekleştirilir. Yeni deepfake mimarisi için pipeline, dönüştürülecek görüntüye karşılık gelen önceden eğitilmiş bir GAN’ın latent vektörünü arar – bir Sim2Real metodolojisi, 2018’de IBM’nin AI araştırma bölümünden bir projeye dayanır.
Araştırmacılar gözlemliyor:
‘Sadece birkaç örnek, spesifik bir öznitelik tarafından farklılaştırılmış, önceden eğitilmiş iç içe geçmiş bir üretken modelin ayrıştırılmış davranışını öğrenmek mümkündür. Bu amacı gerçekleştirmek için gerçek dünya örneklerine ihtiyacınız yoktur, bu her zaman mümkün olmayabilir. ‘
‘Gerçekçi olmayan veri örneklerini kullanarak, kodlanmış latent vektörlerin semantiklerini kullanarak aynı amacı gerçekleştirebilirsiniz. Mevcut veri örnekleri üzerinde istenen değişiklikleri uygulamak, açıkça latent uzay davranışını keşfetmeden yapılabilir.’
Araştırmacılar, projede keşfedilen ayrıştırma ilkelerinin diğer alanlara, örneğin iç mimari simülasyonlarına aktarılmasının möglich olduğunu ve Delta-GAN-Encoder için benimsenen Sim2Real metodunun, deepfake enstrümantalitesini CGI girişinden ziyade sadece çizimlere dayandırmayı mümkün kılmasının beklendiğini öngörüyorlar.
Yeni İsrail sisteminin sentezleyebileceği deepfake videoların kapsamı, araştırma tarafından kimlik ve bağlamın ayrılması yoluyla latent uzay üzerinde daha fazla kontrol kazanılması açısından daha önemli olabilir.
Ayrıştırma, görüntü sentezinde aktif bir araştırma alanıdır; Ocak 2021’de Amazon liderliğindeki bir araştırma makalesi benzer bir poz kontrolü ve ayrıştırma gösterdi ve 2018’de Çin Bilimler Akademisi’nden bir makale, bir GAN’da keyfi görünümlerin oluşturulmasında ilerleme kaydetti.













