Anderson’un Açısı

Derin Sahte Video Görüşmelerini Monitör Aydınlatmasıyla Tespit Etme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

ABD Ulusal Güvenlik Ajansı’ndan (NSA) bir araştırmacı ve Kaliforniya Üniversitesi, Berkeley’den bir işbirliği, canlı video bağlamında derin sahte içeriği tespit etmek için yeni bir yöntem sunuyor – diğer ucundaki kişinin görünümündeki monitör aydınlatmasının etkisini gözlemleyerek.

Popüler DeepFaceLive kullanıcısı Druuzil Tech & Games, takipçileriyle canlı bir oturumda kendi Christian Bale DeepFaceLab modelini deniyor, aydınlatma kaynakları değişirken. Kaynak: https://www.youtube.com/watch?v=XPQLDnogLKA

Popüler DeepFaceLive kullanıcısı Druuzil Tech & Games, takipçileriyle canlı bir oturumda kendi Christian Bale DeepFaceLab modelini deniyor, aydınlatma kaynakları değişirken. Kaynak: https://www.youtube.com/watch?v=XPQLDnogLKA

Sistem, kullanıcının ekranında renk değişimine neden olan bir grafik öğesi yerleştirerek çalışır. Bu, tipik bir derin sahte sistemi, hatta gerçek zamanlı derin sahte akışı uygulaması DeepFaceLive gibi, canlı renk aktarımını sürdürme ve ambiente aydınlatmayı hesaba katma yeteneğine sahip olsa bile, renk değişimine tepki veremeyeceği şekilde tasarlanmıştır.

Kullanıcının ekranında görünen uniform renk görüntüsü, web kamerasının otomatik beyaz dengesi ve diğer ad hoc aydınlatma telafi sistemlerini etkinleştirmeyecek şekilde tasarlanmış, sınırlı bir renk değişimi döngüsüne sahiptir.

Makaleden, kullanıcının ekranındaki değişen aydınlatma koşullarının bir illüstrasyonu, efektif bir şekilde difüz 'alan ışığı' olarak çalışır. Kaynak: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

Makaleden, kullanıcının ekranındaki değişen aydınlatma koşullarının bir illüstrasyonu, efektif bir şekilde difüz ‘alan ışığı’ olarak çalışır. Kaynak: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

Yaklaşımın arkasındaki teori, canlı derin sahte sistemlerinin ekran grafiğindeki renk değişimlerine zamanında tepki veremeyeceği, belirli renk spektrumunun bazı kısımlarında ‘gecikme’ yaratmasıdır.

Monitör ışığını doğru bir şekilde ölçmek için, sistem genel çevresel aydınlatmanın etkisini hesaba katmalı ve sonra da bu etkiyi göz ardı etmelidir. Bu, aktif aydınlatma tonu ile kullanıcının yüz rengi arasındaki ölçümlerdeki eksiklikleri temsil eden temporal bir kayma olarak, her biri arasındaki 1-4 karelik farkı ayırt etmesini sağlar.

Ekran 'dedektör' grafikteki renk varyasyonlarını sınırlayarak ve kullanıcının web kamerasının aşırı monitör aydınlatması nedeniyle otomatik ayarlamalara geçmesini engelleyerek, araştırmacılar derin sahte sisteminin aydınlatma değişikliklerine tepkisindeki belirgin bir gecikmeyi belirleyebilmişlerdir.

Ekran ‘dedektör’ grafikteki renk varyasyonlarını sınırlayarak ve kullanıcının web kamerasının aşırı monitör aydınlatması nedeniyle otomatik ayarlamalara geçmesini engelleyerek, araştırmacılar derin sahte sisteminin aydınlatma değişikliklerine tepkisindeki belirgin bir gecikmeyi belirleyebilmişlerdir.

Makale şöyle diyor:

‘Canlı video görüşmelerine karşı duyduğumuz makul güven ve video görüşmelerinin kişisel ve profesyonel hayatlarımızdaki artan yaygınlığı nedeniyle, video (ve ses) görüşmelerini kimlik doğrulama tekniklerinin önem kazanıp gelişeceğini öneriyoruz.’

Bu çalışma, Gerçek Zamanlı Derin Sahte Videoları Aktif Aydınlatma Kullanarak Tespit Etme başlığını taşıyor ve ABD Savunma Bakanlığı’nda uygulamalı bir araştırma matematikçisi olan Candice R. Gerstner ile Berkeley’den Profesör Hany Farid tarafından gerçekleştiriliyor.

Güvenin Erozyonu

Derin sahte karşıtı araştırma sahnesi, son altı ay içinde önemli ölçüde değişti. Genel derin sahte tespitinden (yani önceden kaydedilmiş videolara ve pornografik içeriğe yönelik) ‘canlılık’ tespitine doğru bir kayma yaşandı. Bu, video konferans görüşmelerinde derin sahtelerin artan kullanımı ve FBI’nin uzaktan çalışma başvurularında bu teknolojilerin kullanımına ilişkin yakın zamanda yayınladığı uyarıya bir yanıt olarak gerçekleşti.

Video görüşmesi gerçekten derin sahte olmasa bile, AI tarafından yönlendirilen video taklitçilerinin artan fırsatları paranoyaya neden olmaya başladı.

Yeni makale şöyle diyor:

‘Gerçek zamanlı derin sahteler, canlı video veya telefon görüşmelerine ilişkin genel güven duygusu nedeniyle benzersiz tehditler oluşturur ve çağrı devam ederken derin sahteleri tespit etmenin zorluğu.’

Araştırma topluluğu, derin sahte içeriğinin kolayca telafi edilemeyeceği kesin işaretlerini bulma hedefini uzun süredir belirlemişti. Basın, bu durumu genellikle güvenlik araştırmacıları ile derin sahte geliştiricileri arasında bir teknoloji savaşı olarak tanımladı. Ancak ilk yaklaşımaların çoğu (göz kırpma analizi, baş pozisyonunun belirlenmesi ve davranış analizi gibi) negatif sonuçlara ulaştı çünkü geliştiriciler ve kullanıcılar genel olarak daha gerçekçi derin sahteler oluşturmaya çalışıyordu, güvenlik topluluğunun son ‘ipucunu’ özel olarak ele almaya çalışmıyordu.

Canlı Derin Sahte Video’ya Işık Tutmak

Canlı video ortamlarında derin sahteleri tespit etmek, kötü video bağlantıları hesaba katma yükünü taşır, bu da video konferans senaryolarında çok yaygındır. Derin sahte katmanının araya girmemesine rağmen, video içeriği NASA tarzı gecikme, rendering hataları ve ses ve video için diğer türdeki bozulmalara maruz kalabilir. Bu, canlı derin sahte mimarisinin kaba kenarlarını hem video hem de ses deepfake’leri açısından gizlemeye yardımcı olabilir.

Yazarların yeni sistemi, Philadelphia’daki Temple Üniversitesi’ndeki Ağ Bilgisayar Merkezi’nden 2020’de yayınlanan bir çalışmanın sonuçlarını ve yöntemlerini geliştiriyor.

2020 makalesinden, kullanıcının ekran içeriği değişirken yüzünün aydınlatmasındaki değişimi gözlemleyebiliriz. Kaynak: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

2020 makalesinden, kullanıcının ekran içeriği değişirken yüzünün aydınlatmasındaki değişimi gözlemleyebiliriz. Kaynak: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

Yeni çalışmadaki fark, web kameralarının aydınlatma değişikliklerine tepkisini hesaba katmasıdır. Yazarlar şöyle diyor:

‘Tüm modern web kameralar otomatik pozlama yapar, bu nedenle önceki çalışmadaki yüksek yoğunluklu aktif aydınlatma, kameranın otomatik pozlamasını tetikleyecek ve kaydedilen yüz görünümünü karıştıracaktır. Bunu önlemek için, renk değişiminde bir aktif aydınlatma kullanıyoruz.

‘Bu, kameranın otomatik pozlamasını önler, ancak kameranın beyaz dengesini tetikleyebilir. Bunu önlemek için, beyaz dengesini tetiklemeyecek bir renk aralığında çalışıyoruz.’

Bu girişimle birlikte, yazarlar benzer önceki girişimlere de baktı, örneğin LiveScreen, bu, derin sahte içeriğini ortaya çıkarmak için kullanıcının monitörüne gözle görülür olmayan bir aydınlatma deseni zorlar.
Bu sistem %94,8’lik bir doğruluk oranına ulaştı, ancak araştırmacılar, ışık desenlerinin nüansının, parlak ortamlarda böyle bir gizli yaklaşımın uygulanmasını zorlaştırabileceğini ve bunun yerine kendi sistemlerini veya benzerlerini popüler video konferans yazılımlarına kamu tarafından ve varsayılan olarak entegre edilebileceğini öne sürdü:

‘Önerdiğimiz müdahale, bir çağrı katılımcısı tarafından gerçekleştirilebilir, bu, ekranını paylaşır ve zamanla değişen deseni görüntüler veya ideal olarak video çağrı istemcisine doğrudan entegre edilebilir.’

Testler

Yazarlar, sentetik ve gerçek dünya konularının bir karışımını kullanarak Dlib tabanlı derin sahte dedektörlerini test etti. Sentetik senaryo için, İsviçre Federal Teknoloji Enstitüsü’nden Mitsuba adlı bir ileri ve ters renderleyici kullandılar.

Simüle edilmiş veri kümesinden örnekler, değişen cilt tonu, ışık kaynağı boyutu, ambiente aydınlatma yoğunluğu ve kamera yakınlığı özellikleri gösterir.

Simüle edilmiş çevre testlerinden örnekler, değişen cilt tonu, ışık kaynağı boyutu, ambiente aydınlatma yoğunluğu ve kamera yakınlığı özellikleri gösterir.

Sahnede, bir sanal kamerayla 90° görüş açısıyla yakalanan parametrik bir CGI başı bulunur. Başlar Lambertian yansıma ve nötr cilt tonlarına sahiptir ve sanal kameradan 2 feet uzaklıktadır.

Farklı cilt tonları ve kurulumlar boyunca çerçeveyi test etmek için, araştırmacılar çeşitli testleri ardışık olarak gerçekleştirdiler. Değiştirilen yönler arasında cilt tonu, yakınlık ve aydınlatma ışığı boyutu yer alıyordu.

Yazarlar şöyle diyor:

‘Simülasyonda, çeşitli varsayımlarımızla, önerdiğimiz teknik geniş bir görüntüleme konfigürasyonuna karşı oldukça robust.’

Gerçek dünya senaryosu için, araştırmacılar çeşitli ortamlarda ve cilt tonlarına sahip 15 gönüllü kullandı. Her biri, 30Hz ekran yenileme hızının web kamerasıyla senkronize edildiği ve aktif aydınlatmanın yalnızca bir saniye süreceği koşullarda, sınırlı renk varyasyonunun iki döngüsüne tabi tutuldu. Sonuçlar, sentetik testlerle genel olarak benzerdi, ancak daha yüksek aydınlatma değerleriyle birlikte korelasyonlar önemli ölçüde arttı.

Gelecek Yönelimler

Araştırmacılar, sistemin tipik yüz örtüleri gibi saç, gözlük veya sakal gibi faktörleri hesaba katmadığını kabul ediyor. Ancak, bu tür bir maskeleme daha sonraki sistemlere eklenebilir (etiketleme ve ardından anlamsal segmentasyon yoluyla), bu da hedef konunun yalnızca algılanan cilt alanlarından değerleri almasını sağlayabilir.

Yazarlar, benzer bir paradigmanın derin sahte sesli çağrıları tespit etmek için de kullanılabileceğini ve bu amaçla gereken sesin normal insan işitme aralığının dışında bir frekansta çalınabileceğini öne sürüyorlar.

Belki de en ilginç olanı, araştırmacıların yüzün ötesinde bir değerlendirme alanını daha zengin bir yakalama çerçevesinde genişletmenin derin sahte tespitinin olasılığını önemli ölçüde artırabileceğini önermeleridir:

‘Daha gelişmiş bir 3-B aydınlatma tahmini, daha zengin bir görünüm modeli sunacaktır ve bunu bir sahtekârın atlatması daha zor olacaktır. Sadece yüzle ilgilenirken, bilgisayar ekranı boynu, üst gövdeyi ve çevre arka planı da aydınlatır ve benzer ölçümler buradan da yapılabilir.

‘Bu ek ölçümler, sahtekârın yalnızca yüzü değil, tüm 3-B sahneyi dikkate almasını gerektirecektir.’

 

* Yazarların satır içi alıntılarını hyperlinklere çevirdim.

İlk olarak 6 Temmuz 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai