Anderson’un Açısı
Video-Konferans Deepfake’lerini Akıllı Telefonun ‘Titreşim’ Fonksiyonu ile Algılama

Singapurlu yeni bir araştırmada, akıllı telefon video konferans araçlarını kullanan birinin DeepFaceLive gibi yöntemleri kullanarak başkalarını taklit edip etmediğini tespit etmek için yeni bir yöntem önerildi.
Adı SFake olan bu yeni yaklaşım, çoğu sistemin kullandığı pasif yöntemleri terk ediyor ve kullanıcının telefonunun titreşmesine (akıllı telefonlarda ortak olan aynı ‘titreşim’ mekanizmalarını kullanarak) ve yüzünü slightly bulanıklaştırmasına neden oluyor.
Canlı deepfake sistemleri çeşitli hareket bulanıklığını taklit edebiliyor, ancak bu, eğitim verilerinin veya en azından ön eğitim verilerinin bir parçası olarak bulanık görüntülerin dahil edilmesi durumunda mümkün oluyor. Ancak bu tür beklenmedik bulanıklığa karşı yeterli hızlı yanıt veremiyorlar ve yüzün bulanık olmayan kısımlarını çıktılamaya devam ediyor, deepfake konferans çağrısının varlığını ortaya koyuyor.

DeepFaceLive, kamera titreşimlerine neden olan bulanıklığı simüle edecek kadar hızlı yanıt veremiyor. Kaynak: https://arxiv.org/pdf/2409.10889v1
Araştırmacıların kendi derledikleri veri kümesindeki test sonuçları, SFake’in competing video-based deepfake detection yöntemlerini, hatta zorlu koşullar altında bile, geride bıraktığını gösterdi. Örneğin, diğer kişinin video konferans sırasında kamerayı eliyle tutması yerine statik bir telefon montajı kullanması gibi doğal el hareketleri.
Video Tabanlı Deepfake Algılama İhtiyacının Artması
Video tabanlı deepfake algılama araştırmaları son yıllarda arttı. Ses tabanlı deepfake soygunlarının başarılı olduğu birkaç yılın ardından, bu yıl bir finans çalışanı, deepfake video konferans çağrısında bir CFO’yu taklit eden bir sahtekâra 25 milyon dolarlık bir transfer yaptı.
Bu tür bir sistem, yüksek düzeyde donanım erişimi gerektiriyor, ancak birçok akıllı telefon kullanıcısı zaten finansal ve diğer türdeki doğrulama hizmetlerinin yüz özelliklerini kaydetmemizi istemesine alışkın. Bu, aslında LinkedIn’in doğrulama sürecinin bir parçasıdır.
Bu nedenle, bu tür yöntemlerin video konferans sistemlerinde giderek daha fazla uygulanacağı görünüyor, bu tür suçlar devam ettikçe.
Gerçek zamanlı video konferans deepfaking’i ele alan çoğu çözüm, iletişimin sabit bir senaryoda gerçekleştiğini varsayar, yani iletişimde bulunan kişi bir istasyonel web kamerası kullanıyor ve hareket veya aşırı çevresel veya aydınlatma değişiklikleri beklenmiyor. Akıllı telefon görüşmesi böyle bir ‘sabit’ durumu sunmuyor.
İstead, SFake, eldeki akıllı telefon tabanlı video konferansın yüksek görsel varyantlarını telafi etmek için birden fazla algılama yöntemi kullanıyor ve standart titreşim ekipmanını kullanan ilk araştırma projesi gibi görünüyor.
Araştırmacıların makalesi, Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes olarak adlandırıldı ve Singapur’daki Nanyang Teknoloji Üniversitesi’nden iki araştırmacı tarafından geldi.
Yöntem
SFake, yerel bir uygulama tarafından gönderilen verileri bir uzaktaki API hizmetine işleme gönderen ve sonuçların geri gönderildiği bir bulut tabanlı hizmet olarak tasarlandı.
Ancak, yalnızca 450mb’lik ayak izi ve optimize edilmiş metodolojisi, deepfake algılama işleminin, ağ bağlantısı gönderilen görüntüleri aşırı şekilde sıkıştırarak teşhis sürecini etkileyebileceği durumlarda, cihazda tamamen işlenebileceği anlamına geliyor.
Bu şekilde ‘tüm yerel’ olarak çalışmak, sistemin kullanıcıların kamera akışına doğrudan erişimine olanak tanır, video konferans ile thường ilişkili kodlama müdahalesi olmadan.
Ortalama analiz süresi, kullanıcıya dört saniyelik bir video örneği gerektirir, bu sırada kullanıcıya masih kalması ve SFake’in DeepFaceLive gibi sistemlerin zamanında yanıt veremeyeceği seçili rasgele aralıklarla ‘sondajlar’ göndermesi istenir.
(Herhangi bir saldırganın, eğitim veri kümesinde bulanık içerik dahil etmediyse, bu tür bir modeli üretme olasılığı düşük olduğu vurgulanmalıdır, ve DeepFaceLive’in bu işlevi, önceden eğitimli bir veri kümesinden entrenirilmiş bir modelde ‘ekleyemeyeceği’ belirtilmelidir)
Sistem, yüzün potansiyel deepfake içeriği olan belirli alanlarını seçer, gözleri ve kaşları hariç tutar (çünkü bu alanlardaki göz kırpma ve diğer yüz hareketleri, bulanık algılama kapsamı dışında ve ideal bir gösterge değildir).

SFake için kavramsal şema.
Gördüğümüz gibi yukarıdaki kavramsal şemada, uygun ve öngörülemez titreşim desenlerini seçtikten, en iyi odak uzunluğunu belirledikten ve yüz tanıma (68 yüz özelliği tahmini için Dlib bileşeni ile) sonra, SFake, girdi yüzünden gradientleri türetir ve seçilen bu gradientlerin belirli alanlarına odaklanır.
Varyans dizisi, çalışılan kısa klipteki her bir kareyi sırayla analiz ederek elde edilir, ardından ortalama veya ‘ideal’ diziye ulaşılır ve geri kalanı göz ardı edilir.
Bu, eğitimli veritabanına dayalı deepfake içeriği olasılığını ölçmek için kullanılabilen çıkarılan özellikleri sağlar (bununla ilgili daha fazla bilgi anında).
Sistem, 1920×1080 piksel görüntü çözünürlüğü ve lens için en az 2x zum gerektirir. Makale, bu çözünürlüklerin (ve hatta daha yüksek çözünürlüklerin) Microsoft Teams, Skype, Zoom ve Tencent Meeting’de desteklendiğini belirtir.
Çoğu akıllı telefonun hem ön hem de arka kameraya sahip olduğu ve genellikle yalnızca birinin zum yeteneğine sahip olduğu dikkate alınarak, uygulama, iletişimcinin SFake tarafından gerekli olan gereksinimleri karşılayan kamerayı kullanmasını gerektirecektir.
Buradaki amaç, sistemin analiz edeceği video akışına kullanıcı yüzünün doğru oranını elde etmektir. Makale, kadınların mobil cihazları ortalama 34.7cm, erkeklerin ise 38.2cm uzaklıkta kullandığını (Journal of Optometry’de raporlandığı gibi) ve SFake’in bu mesafelerde çok iyi çalıştığını gözlemledi.
Elde tutulan video ile ilgili olarak stabilizasyon bir sorun teşkil ediyor ve kamera hareketinden kaynaklanan bulanıklık, SFake’in işleyişini engelliyor. Araştırmacılar, bunu telafi etmek için birkaç yöntem denedi. En başarılı olanı, tahmin edilen yüz özelliklerinin merkezi noktasını hesaplayarak ve bunu bir ‘anchor’ olarak kullanarak, yani efektif bir algoritmik stabilizasyon tekniği uygulayarak oldu. Bu yöntemle %92’lik bir doğruluk elde edildi.
Veri ve Testler
Uygun veri kümeleri olmadığından, araştırmacılar kendi veri kümesini oluşturdu:
‘8 farklı marka akıllı telefon kullanarak, 15 farklı yaş ve cinsiyette katılımcıları kaydederek kendi veri kümemizi oluşturduk. Akıllı telefonu katılımcıdan 20 cm uzaklıkta tutarak ve yüzünü iki kez yakınlaştırarak tüm yüz özelliklerini kapsıyoruz ve farklı desenlerde titreşim uyguluyoruz.’
‘Ön kameranın zum yapamadığı telefonlar için arka kamerayı alternatif olarak kullanıyoruz. 20 saniye süreli 150 uzun video kaydediyoruz. Varsayılan olarak, algılama süresinin 4 saniye sürdüğünü varsayıyoruz. Bir uzun videodan 4 saniye süreli 10 klip, başlangıç zamanını rastgeleleştirerek alıyoruz. Böylece, her biri 4 saniye süreli 1500 gerçek klip elde ediyoruz.’
DeepFaceLive, bu çalışmanın merkezi hedefi olarak, şu anda en yaygın açık kaynaklı canlı deepfake sistemi olduğundan, araştırmacılar temel algılama modelini eğitmek için dört başka yöntemi de dahil etti: Hififace; FS-GANV2; RemakerAI; ve MobileFaceSwap – sonuncusu, hedef ortam dikkate alındığında özellikle uygun bir seçim.
1500 sahte video, gerçek ve değişmemiş videolarla birlikte eğitim için kullanıldı.
SFake, SBI; FaceAF; CnnDetect; LRNet; DefakeHop varyantları; ve ücretsiz online deepfake algılama hizmeti Deepaware ile karşılaştırıldı. Her bir deepfake yöntemi için 1500 sahte ve 1500 gerçek video eğitim için kullanıldı.
Temel test sınıflandırıcı olarak, basit iki katmanlı sinir ağı ve ReLU aktivasyon fonksiyonu kullanıldı. 1000 gerçek ve 1000 sahte video rastgele seçildi (ancak sahte videolar yalnızca DeepFaceLive örnekleriydi).
Alıcı Operasyon Karakteristiği Eğrisi Altında Alan (AUC/AUROC) ve Doğruluk (ACC) metrikleri kullanıldı.
Eğitim ve çıkarım için bir NVIDIA RTX 3060 kullanıldı ve testler Ubuntu altında çalıştırıldı. Test videoları, Xiaomi Redmi 10x, Xiaomi Redmi K50, OPPO Find x6, Huawei Nova9, Xiaomi 14 Ultra, Honor 20, Google Pixel 6a ve Huawei P60 ile kaydedildi.
Mevcut algılama yöntemleriyle uyumlu olmak için testler PyTorch’ta uygulandı. Birinci test sonuçları aşağıdaki tabloda gösteriliyor:

SFake’in diğer yöntemlerle karşılaştırılması.
Yazarlar burada yorum yapıyor:
‘Tüm durumlarda, SFake’in algılama doğruluğu %95’in üzerindeydi. Beş deepfake algoritmasından, Hififace hariç, SFake diğer deepfake algoritmalarına karşı diğer altı algılama yönteminden daha iyi performans gösterdi. Sınıflandırıcı, DeepFaceLive tarafından üretilen sahte görüntülerle eğitildiğinden, DeepFaceLive’i tespit etme konusunda %98.8’lik en yüksek doğruluk oranına ulaştı.’
‘RemakerAI tarafından üretilen sahte yüzlerle karşılaştığımızda, diğer algılama yöntemleri zayıf performans gösterdi. İnternette indirme sırasında videoların otomatik sıkıştırılması nedeniyle görüntü detaylarının kaybına yol açabileceği ve algılama doğruluğunu azaltabileceği için bunu neden olarak düşünüyoruz. Ancak bu, SFake’in RemakerAI’yi %96.8’lik bir doğrulukla tespit etmesini engellemedi.’
Yazarlar ayrıca, SFake’in 2x zum uygulandığında en iyi performansı gösteren sistem olduğunu, çünkü bu hareketi abartıyor ve çok zor bir durum sunuyor, belirtiyorlar. Ancak bu durumda bile, SFake %84 ve %83’lük tanıma doğruluğuna ulaştı.
SONUÇ
Canlı deepfake sisteminin zayıflıklarını kendisine karşı kullanan bir proje, deepfake algılama alanında bu yıl, daha çok sıklıkla frekans analizi etrafında dönen yaklaşımların karıştığı bir yılda taze bir öneri sunuyor.
2022 yılı sonunda, bir başka sistem monitör parlaklık değişimi olarak bir dedektör kancası olarak kullanıldı ve aynı yıl, kendi demonstrasyonum DeepFaceLive’in zor 90 derecelik profil görüntülerini işleyememesini gösterdi ve bazı topluluk ilgisi gördü.
DeepFaceLive, bu tür bir projenin hedefi olarak doğru seçim, çünkü video konferans sahteciliği ile ilgili suçta muhtemelen en çok ilgi gören açık kaynaklı canlı deepfake sistemi.
Fakat son zamanlarda, VFX topluluğunda çok popüler olan LivePortrait sisteminin, DeepFaceLive’den daha iyi profil görüntülerini işleyebildiğine dair bazı anlatımsal kanıtlar gördüm; bu çalışmaya dahil edilmesi ilginç olurdu.
İlk olarak 24 Eylül 2024 Salı günü yayımlandı.

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









