Anderson’un Açısı
Derin Sahte Videolarda Bağlılık ve Gerçekçilik

Derin sahte uygulamalarının tümü aynı amacı paylaşmaz: Görüntü sentezleme araştırmaları sektörünün – Adobe, NVIDIA ve Facebook gibi etkili destekçiler tarafından desteklenen – amacı, makine öğrenimi tekniklerinin sonunda yüksek çözünürlükte ve zorlu koşullarda insan faaliyetlerini yeniden yaratması veya sentezlemesidir (bağlılık).
Derin sahte teknolojilerini yanlış bilgi yaymak için kullanmak isteyenlerin amacı ise, yalnızca derin sahte yüzlerin doğruluğuyla değil, bağlam ve inandırıcılık gibi diğer faktörlerle de gerçek insanların simülasyonlarını yaratmaktır. Bu senaryoda, videoyu simüle etme potansiyeliyle yüzlerin gerçekçiliği लगभग eşittir.
Bu ‘görsel hile’ yaklaşımı, derin sahte videonun nihai görüntü kalitesinin bozulmasına kadar uzanır, böylece tüm video (ve yalnızca derin sahte yüzü temsil eden aldatıcı kısım değil) beklendiği gibi tutarlı bir ‘görünüm’e sahiptir.
‘Tutarlı’ iyi anlamına gelmez – yeterli olan, kalitenin orijinal ve eklenmiş, değiştirilmiş içerik boyunca tutarlı olması ve beklentilere uyumasıdır. VOIP akışı çıkışında, Skype ve Zoom gibi platformlarda, bar düşük olabilir, titreme, kesintili video ve bir dizi potansiyel sıkıştırma sanat eserleri ile birlikte ‘pürüzsüzleştirme’ algoritmaları, canlı akışın kısıtlamaları ve tuhaflıklarının bir sonucu olarak ortaya çıkar.

DeepFaceLive eylemde: premier derin sahte yazılımları DeepFaceLab’ın bu akış versiyonu, sınırlı video kalitesi bağlamında sahteleri sunarak bağlamsal gerçekçilik sağlayabilir, oynatma sorunları ve diğer tekrar eden bağlantı sanat eserileri ile birlikte. Kaynak: https://www.youtube.com/watch?v=IL517EgYH8U
Yerleşik Bozulma
Aslında, iki en popüler derin sahte paketi (her ikisi de 2017 kaynak kodundan türetilmiştir) derin sahte yüzü ‘tarihsel’ veya daha düşük kaliteli video bağlamına entegre etmek amacıyla oluşturulan yüzü bozmak için tasarlanmış bileşenler içerir. DeepFaceLab’de, bicubic_degrade_power parametresi bunu gerçekleştirir ve FaceSwap’de, Ffmpeg yapılandırmasındaki ‘tahıl’ ayarı da sahte yüzün entegrasyonuna yardımcı olur ve kodlama sırasında tahılı korur*.

FaceSwap’deki ‘tahıl’ ayarı, düşük kaliteli video içeriği ve film tahıl efektleri içeren miras içeriğine gerçekçi entegrasyonu sağlar.
Bazen, derin sahte videonun tam ve entegre bir sürümünün yerine, derin sahte yüzü gösteren yalnızca bir dizi PNG dosyası alpha kanallarıyla birlikte çıkarılır, böylece görüntü akışı daha gelişmiş ‘bozma’ efektleri yeteneklerine sahip platformlarda videoya dönüştürülebilir, örneğin Adobe After Effects, sahte ve gerçek öğeler birleştirilmeden önce.
Bu kasıtlı bozulmaların yanı sıra, derin sahte çalışmasının içeriği genellikle yeniden sıkıştırılır, ya sosyal medya platformlarında algoritmik olarak (kullanıcı yüklemelerinin daha hafif sürümlerini üretmek için bant genişliğini kaydetmek amacıyla) veya orijinal çalışmanın animasyonlu GIF’ler, ayrıntı bölümleri veya diğer çeşitli motive edilmiş iş akışlarına yeniden işlenmesiyle, bu da ek sıkıştırma ve diğer sanat eserilerini tanıtır.
Gerçekçi Derin Sahte Algılama Bağlamları
Bunu dikkate alarak, İsviçre’den yeni bir makale, derin sahte algılama yaklaşımlarının arkasındaki metodolojinin yenilenmesini önerdi, algılama sistemlerinin derin sahte içeriğinin kasıtlı olarak bozulmuş bağlamlarında özelliklerini öğrenmesini sağlayarak.

Yeni makalede kullanılan veri setlerinden birine uygulanan stokastik veri artırımı, Gauss gürültüsü, gamma düzeltmesi ve Gauss bulanıklığı ile birlikte JPEG sıkıştırma sanat eserlerini içerir. Kaynak: https://arxiv.org/pdf/2203.11807.pdf
Yeni makalede, araştırmacılar, öncü derin sahte algılama paketlerinin gerçekçi olmayan benchmark koşullarına dayandığını ve ‘bozulmuş’ derin sahte çıktısının algılama için minimum kalite eşiğinin altına düşebileceğini, ancak ‘gerçekçi’ içeriğinin doğru bir bağlam dikkat çekmesinden dolayı izleyicileri aldatma olasılığı daha yüksek olduğunu savunuyorlar.
Araştırmacılar, doğal görüntü bozulma sürecine dayanan yeni bir ‘gerçek dünya’ veri bozulma süreci kurdu ve bu, önde gelen derin sahte dedektörlerinin genelleme yeteneğini yalnızca orijinal ‘temiz’ verilerde algılama oranlarında marjinal bir kaybın karşılığında önemli ölçüde geliştirdi. Ayrıca, gerçek dünya koşullarında derin sahte dedektörlerinin dayanıklılığını değerlendirebilen yeni bir değerlendirme çerçevesi sunuyorlar.
Makale Gerçekçi Koşullarda Öğrenme Tabanlı Derin Sahte Algılama İyileştirmesi için Yeni Bir Yaklaşım başlığını taşıyor ve Lausanne’deki İsviçre Federal Teknoloji Enstitüsü (EPFL) ve Lausanne’deki Çoklu Ortam İşleme Grubu’ndan (MMSPG) araştırmacılardan geliyor.
Yararlı Karmaşa
Derin sahte algılama yaklaşımlarına bozulmuş çıktı entegrasyonu için önceki çabalar arasında, 2018’de MIT ve FAIR’dan Mixup sinir ağı ve 2020’de DeepMind ve Google’dan AugMix yer alıyor; bu, veri artırımı yöntemleri, eğitim materyallerini ‘bulanıklaştırmaya’ çalışır ve genellemeye yardımcı olur.
Araştırmacılar, türetilen bir özelliğin gürültüye gömüldüğü ilişkinin sınırlarını belirlemek için Gaussian gürültüsü ve sıkıştırma sanat eserlerini eğitim verilerine uygulayan önceki çalışmaları ve çalışmaları da not eder.
Yeni çalışma, bir görüntüleme iş akışının tehlikeye atıldığı ve dağıtım işleminde daha fazla bozulmaya neden olan bir dizi algoritmanın yanı sıra görüntüleme edinme sürecinin tehlikeye atıldığı bir boru hattı sunar. Bu gerçek dünya iş akışını bir değerlendirme çerçevesine entegre ederek, sanat eserilere karşı daha dayanıklı derin sahte dedektörleri için eğitim verisi üretmek mümkündür.

Yeni yaklaşımın kavramsal mantığı ve iş akışı.
Bozulma işlemi, derin sahte algılama için kullanılan iki popüler ve başarılı veri setine uygulanmıştır: FaceForensics++ ve Celeb-DFv2. Ayrıca, önde gelen derin sahte dedektörü çerçeveleri Capsule-Forensics ve XceptionNet de iki veri setinin değiştirilmiş sürümlerine eğitim verildi.
Dedektörler, 25 ve 10 epoch için sırasıyla Adam optimizatörü ile eğitildi. Veri seti dönüşümü için her eğitim videosundan 100 çerçeve rastgele örneklendi ve 32 çerçeve test için çıkarıldı, bozma işlemlerinin eklenmesinden önce.
İş akışında dikkate alınan bozulmalar gürültü idi, burada sıfır ortalama Gaussian gürültüsü altı farklı seviyede uygulandı; yeniden boyutlandırma, tipik açık hava görüntülerinin azaltılmış çözünürlüğünü simüle etmek için, bu da dedektörleri etkileyebilir; sıkıştırma, burada çeşitli JPEG sıkıştırma seviyeleri veri boyunca uygulandı; pürüzsüzleştirme, burada ‘gürültü giderme’ için kullanılan üç tipik pürüzsüzleştirme filtresi çerçeve için değerlendirildi; işleme, burada kontrast ve parlaklık ayarlandı; ve birleşimler, burada yukarıda belirtilen yöntemlerin herhangi bir karışımı tek bir görüntüye aynı anda uygulandı.
Test ve Sonuçlar
Verileri test ederken, araştırmacılar üç metriği benimsedi: Doğruluk (ACC); Alıcı İşlem Özetini Algılama Eğrisi Altında Alan (AUC); ve F1-puanı.
Araştırmacılar, iki derin sahte dedektörünün standarda bağlı sürümlerini değiştirilmiş veri setlerine karşı test etti ve onları yetersiz buldu:
‘Genel olarak, çoğu gerçekçi bozulma ve işlem, normal olarak eğitilen öğrenme tabanlı derin sahte dedektörlerine son derece zararlıdır. Örneğin, Capsule-Forensics yöntemi, her iki FFpp ve Celeb-DFv2 test setinde eğitimden sonra yüksek AUC puanları gösterir, ancak sonra değiştirilmiş verilerimize dayanan değerlendirme çerçevemizde radikal bir performans düşüşü yaşar. Benzer eğilimler XceptionNet dedektörüyle de gözlemlenmiştir.’
Karşılaştırıldığında, dedektörlerin performansı, değiştirilmiş verilere eğitim verilerek önemli ölçüde iyileştirildi ve her dedektör artık görülmeyen aldatıcı medyayı daha iyi tespit edebiliyor.
‘Veri artırımı şeması, iki dedektörün dayanıklılığını önemli ölçüde geliştirir ve aynı zamanda orijinal değiştirilmemiş verilerde yüksek performansını korur.’

Çalışmada değerlendirilen iki derin sahte dedektörü için ham ve artırılmış veri setlerinin performansı karşılaştırması.
Makale şöyle sona eriyor:
‘Mevcut algılama yöntemleri, belirli benchmark’lerde mümkün olan en yüksek performansı elde etmeye tasarlanmıştır. Bu, gerçekçi senaryolara genellemeye能力inden vazgeçilmesi ile sonuçlanır. Bu çalışmada, doğal görüntü bozulma sürecine dayanan bir veri artırımı şeması öneriyoruz. ‘
‘Kapsamlı deneyler, bu basit ancak etkili tekniğin modelin çeşitli gerçekçi bozulma ve işleme işlemlerine karşı dayanıklılığını önemli ölçüde geliştirdiğini gösteriyor. Tipik görüntüleme iş akışlarında.’
* Oluşturulan yüzdeki tahıl, dönüştürme işlemi sırasında stil aktarımı işlevidir.
İlk olarak 29 Mart 2022’de yayımlanmıştır. 8:33 pm EST’de Ffmpeg’de tahıl kullanımını açıklamak için güncellenmiştir.












