Anderson’un Açısı

Deepfake Algılama Doğruluğu, AI Video İlerlemesinin Bir Yılında %49 Azaldı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Montage of frame-grabs from AI-generated videos created for the new DF26 dataset. Source - https://huggingface.co/datasets/DF26/DF26/tree/main/fake

İlgiyle not ediyorum ki, Ukrayna liderliğindeki yeni makale, eski nesil deepfake video dedektörlerinin mevcut en son teknoloji genAI videolarında çok kötü performans gösterdiğini gösteriyor; bu jeneratörler açık kaynak, Alibaba’nın Wan 2.2 veya Hunyuan Video gibi yerel AI kurulumları olsun ya da Grok Imagine veya Kling gibi yalnızca API üzerinden çalışan kapalı kaynak modeller olsun.

Oynatmak için tıklayın (SES İÇERİĞİ). DF26 veri setindeki ‘Doğrudan kameraya rahat’ kategorisinden üç örnek. Kaynak 

2024’te, başka bir makale insanın AI videosunu algılama yeteneğinin şansın çok üzerinde değil olduğunu, %57 olduğunu zaten ortaya koymuştu. Yeni çalışma (başlığı DF26: Artık Sahteyi Gerçekten Ayırt Edemiyoruz) ise, otomatik deepfake dedektörlerinin o zamandan beri etkinliğinin – en yeni genAI video çıktısıyla karşılaştıklarında – %94’ten %48’e dramatik bir düşüş gösterdiğine dair ampirik kanıt ekliyor.

Çalışma için oluşturulan yeni veri setinden, aşağıda gerçek videoların sol tarafında karşılaştırılan görüntüden videoya ve metinden videoya oluşturulan örnekler. Korpus, şu anda en endişe verici genAI alanlarından biri olan 'ikna edici' ve güvenilir baş ve omuz kurulumlarına odaklanıyor. Kaynak -  https://arxiv.org/pdf/2609.07369

Çalışma için oluşturulan yeni veri setinden, aşağıda gerçek videoların sol tarafında karşılaştırılan görüntüden videoya ve metinden videoya oluşturulan örnekler. Korpus, şu anda en endişe verici genAI alanlarından biri olan ‘ikna edici’ ve güvenilir baş ve omuz kurulumlarına odaklanıyor. Kaynak

Çalışma kapsamında yürütülen testlerdeki en keskin düşüş %49’luk bir azalmayı temsil ediyor. Daha önceki kıyaslama 2025’ten geldiği ve yeni çalışma, en yeni 2026 nesil video modellerinin bir aralığını test ettiği için, bu oran AI-video algılama etkinliğinde neredeyse bir yıllık bir bozulmayı gösteriyor.

Dedektörlerin test edildiği videoları üreten modellerin ayrıntıları.

Detektörlerin test edildiği videoları oluşturmak için kullanılan modellerin detayları.

Bu dedektörleri alt eden çıktıyı üretmek için kullanılan kapalı kaynak, ticari modeller Grok 1.0; Kling 3.0; Veo 3.1; ve Wan 2.6 idi. Bunlar için yalnızca metinden videoya örnekler üretildi, çünkü görüntüden videoya (I2V) üretimlerini denemek genellikle ‘deepfake üretimi’yle ilgili filtreleri tetikliyor ya da platformun hizmet koşullarını ihlal edebilirdi.

Gözlerime Bak

Bu tetiklemeler muhtemelen, araştırmacıların video tabanlı iknanın en potansiyel olarak güçlü ve tartışmalı biçimi – ‘baş ve omuz’ ve ‘konuşan baş’ videolarının çeşitli varyasyonları – üzerine odaklanmaları nedeniyle ortaya çıktı; bu videolarda konular, YouTube ve TikTok influencer videolarında olduğu gibi kameraya konuşur ya da haber raporlama senaryosunda (uydu bağlantılı röportajlar vb.) bulunur.

Yazarlar, bu senaryoların deepfake etkinliği için birincil hedefler olduğunu, özellikle de bunların ‘influencer’ ve çeşitli ‘bilgi’ bağlamlarını temsil etmesi nedeniyle savunuyorlar – bu bağlamlarda önceden var olan bir güven ilişkisi varsayımı bulunur ve bu ilişki kötüye kullanım için büyük bir potansiyele sahiptir (doğal olarak bu en azından deepfake video aramaları için de aynı derecede geçerlidir, ancak araştırmacılar bu konuyu ele almamaktadır).

Otoenkoder deepfake çağının zirvesinden, gerçek Richard Nixon görüntülerinin manipülasyonu, 1969’da Apollo 9 astronotlarının ölümünü duyurması gibi gerçekleşmemiş bir olayı simüle edebildi – gerçek dünyadaki senaryo, deepfake bir ses ve dudak hareketi eklemek için kullanıldı.

Bu influencer senaryosuna odaklanmanın yanı sıra, yeni kıyaslama – ve bunun için oluşturulan videolar – tarihsel deepfake tespit stratejilerine kıyasla videonun tüm çerçevesini değerlendirmeye yoğunlaşmaktadır.

Bu eski stratejiler yüz ifadelerini ya da ifade manipülasyonu, ya da gerçek videolarda yüz (veya en iyi ihtimalle tam kafa) değişimini uyguluyordu – bu, son 18‑24 ayda difüzyon tabanlı modeller yeterince etkili hale gelene kadar tek mantıklı yaklaşımdı.

Yüzü Çevir

Artık böyle yapılmıyor; eski otoenkoder tabanlı yöntem 2017’nin sonlarında deepfake’lerin ilk ortaya çıkışına dayanıyor; ve bu teknik, yalnızca yüzün dış hatları içinde bölgeyi değiştirdiği için 2022’de tamamen tükenmiş.

Deepfake etkinliği için en önemli alan, 2017-2023 – ancak yeni nesil genAI video platformları için, dikkati yoğunlaştıracak böyle bir sınır yok. Kaynak - https://arxiv.org/pdf/2203.01318.pdf

Deepfake etkinliği için en önemli alan, 2017-2023 – ancak yeni nesil genAI video platformları için, dikkati yoğunlaştıracak böyle bir sınır yok. Kaynak

Bununla birlikte, bilimsel araştırma sektörü uzun vadeli bir sabiti sever – hedefin sabit olduğu ve yıllar/decadelar boyunca değişen bir dizi yaklaşımın ona uygulanabildiği – ‘inner-face substitution/amendment’ temelli deepfake tespit yöntemleri literatürde ve ticari tespit ürünlerinde, hedef alınan temel teknolojinin geçerliliğinin çok ötesinde varlığını sürdürmüştür.

Yeni çalışmada test edilen üç kapalı kaynak modelin yanı sıra, üç çok yetenekli tüketici kullanılabilir açık kaynak model de denendi: Wan 2.2 A14B; HunyuanVideo 1.5; ve LTX 2.3, ki son zamanlarda FOSS genAI topluluğunu büyüleyici etkilemiştir. LTX serisi ayrıca ses üretme yeteneğine de sahiptir:

Oynatmak için tıklayın: r/stablediffusion üzerindeki LTX serisi deneyleri, topluluğun yalnızca FOSS modelleriyle ilgilendiği. Kaynak 

Veri Tasarımı

Yazarlar, yeni veri setleri DF26’yı, görülmemiş materyalin değerlendirilmesi için bir ‘hold-out’ seti olarak tasarlamaktadır. Koleksiyon, üç halka açık konuşma senaryosunda 2,691 videodan oluşmaktadır: doğrudan kameraya ya da samimi hitaplar; resmi açıklamalar; ve stüdyo röportajları.

Tüm AI tarafından oluşturulan video klipler, OpenVid; TalkingCelebs; ve MAVOS-DD kaynaklarından seçilen 271 gerçek dünyadan klip üzerine temellendirilmiştir.

OpenVid koleksiyonundan örnek, bu koleksiyondaki AI tarafından oluşturulan videolar için temel malzeme olarak 271 gerçek dünyadan video temin edilmiştir. DF26'nın bu sahte olmayan bileşenine iki başka veri seti de katkıda bulunmuştur. Kaynak - https://arxiv.org/pdf/2407.02371

OpenVid koleksiyonundan örnek, bu koleksiyondaki AI tarafından oluşturulan videolar için temel malzeme olarak 271 gerçek dünyadan video temin edilmiştir. DF26’nın bu sahte olmayan bileşenine iki başka veri seti de katkıda bulunmuştur. Kaynak

271 gerçek video, çerçevelerinden eşleşen sahne istemleri türetilerek, ardından bu istemler – ve destekleniyorsa ilk çerçeve – yedi video-üretim modeline beslenerek AI videolarını oluşturmak için kullanıldı ve toplam 2,420 sentetik klip üretildi.

Yazarlar, gerçek dünyadan çerçevelerde metin bindirmeleri (örneğin konuşanın kim olduğu gibi duyurular) bulunmamasına özen gösterdi, çünkü bunlar kısa yollar ve varsayımları teşvik edebilirdi. Aday klipler Gemini 2.5 tarafından değerlendirildi.

Ayrıca, birden fazla yüz içeren bölümler reddedildi, böylece ‘tek konuşmacı’ ayarı uygulanmış oldu.

Oynatmak için tıklayın [NO SOUND]. Makale ile ilişkili veri setinden, hem açık hem de kapalı kaynak olan, en yeni ve en yetenekli yedi üretken modeldeki son teknoloji video üretim örnekleri. Veri seti için kullanılan modeller, ses üretme yeteneğine sahip olanları da içerir (bu makaledeki önceki örneklere bakınız). Kaynak

Araştırmacılar, popüler ticari Higgsfield AI platformunu kullandı; bu platform, çeşitli kapalı ve açık kaynak modelleri, farklı denetim seviyeleri ve koruma önlemleri sunmaktadır.

İç araştırma kümesi için temel GPU modeli olarak NVIDIA H200 (141 GB VRAM) kullanıldığında, koleksiyon için 1,626 video üretmek yaklaşık 440 GPU saatine mal oldu.

Çıktıda hiçbir metin görünmediğinden emin olmanın yanı sıra, AI filigranı gösterimini gizlemek ya da genel olarak önlemek de gerekliydi; çünkü bu da değerlendirici veya değerlendirme sistemine potansiyel bir ‘kısa yol’ oluşturabilirdi.

Testler

Kapanış test turunda kullanılan birincil ölçüt, Alıcı İşletim Karakteristik Eğrisi Altındaki Alan (AUC / AUROC) idi; eşit hata oranı (EER) ise tamamlayıcı bir ölçüm olarak kullanıldı.

Kare tabanlı dedektörler (tek tek kareleri bağımsız olarak değerlendirir) her videodan 32 eşit aralıklı kare üzerinde test edildi ve puanlar tek bir sonuçta ortalandı. Zaman tabanlı dedektörler (ardışık karelerden bilgi kullanabilir) ise video dizisini doğrudan analiz etti.

Zaman tabanlı dedektörler DFD-FCG ve PwTF-DVD için sonuçlar aşağıda, ayrıca ForAda; Effort; FSFM; GenD-CLIP ve GenD-DINO; ve DFD-HR sonuçlarıyla birlikte gösterilmektedir. Hepsi saygın FaceForensics++ veri seti üzerinde eğitilmiştir.

CelebDF++ ve DF26 üzerindeki deepfake dedektörlerini karşılaştıran test sonuçları. Tüm dedektörler FaceForensics++ üzerinde eğitildi; daha yüksek AUROC ve daha düşük EER daha iyi performansı gösterir.

CelebDF++ ve DF26 üzerindeki deepfake dedektörlerini karşılaştıran test sonuçları. Tüm dedektörler FaceForensics++ üzerinde eğitildi; daha yüksek AUROC ve daha düşük EER daha iyi performansı gösterir.

Yazarlar, çoğu dedektörün Celeb-DF++ (CDFv3) üzerinde iyi performans gösterdiğini, ancak daha zorlu yeni DF26 koleksiyonunda keskin bir düşüş yaşadığını belirtiyor.

‘[Multiple] son teknoloji dedektörler, CelebDF++ [16] (CDFv3) benchmark’inde güçlü performans sergiliyor, zaman tabanlı yöntemler ise AUROC değerine 94,3 ve 92,3 ulaşıyor.

‘Ancak, performansları DF26’da önemli ölçüde düşüyor, sırasıyla 48.2 ve 61.6 AUROC, respectively.

‘Çoğu yöntem önemli ölçüde bozuluyor, şans seviyesine yakın kalıyor; en yüksek 69.7 AUROC değeri GenD-PE tarafından elde ediliyor.

‘Bu, DF26’nın son teknoloji dedektörler için daha zorlu bir ölçüt olduğunu gösteriyor.’

Görüntüden videoya, gözlemledikleri gibi, hem insanlar hem de otomatik dedektörler için metin‑den‑videoya göre tespit edilmesi daha zor oldu; PwTF-DVD I2V materyalde en iyi performansı gösterirken, GenD-PE T2V’de öne çıktı.

Performans, sahte videoyu üreten jeneratöre bağlı olarak dramatik şekilde değişti; bu, dedektörlerin genellikle sentetik videonun genel bir imzası yerine jeneratöre özgü izleri öğrendiğini gösteriyor. Örneğin, PwTF-DVD, Wan 2.2’den gelen metin‑den‑video çıktısında 92.9 AUROC elde ederken, HunyuanVideo 1.5’te neredeyse şans seviyesine düştü – her iki model de aynı modern nesil ortamına ait olmasına rağmen:

Ticari ve açık kaynak video jeneratörleri arasındaki dedektör performansı. Sütunlar arasındaki geniş varyasyon, tespit güvenilirliğinin videoyu üreten modele bağlı olarak güçlü bir şekilde değiştiğini gösteriyor; GenD-PE en yüksek ortalama AUROC değerine sahip.

Detektör performansı ticari ve açık kaynak video jeneratörleri arasında. Sütunlar arasındaki geniş varyasyon, tespit güvenilirliğinin videoyu üreten modele bağlı olarak güçlü bir şekilde değiştiğini gösteriyor; GenD-PE en yüksek ortalama AUROC değerine sahip.

Aşağıda, GenD-PE’yi yeni DF26 materyali üzerinde yeniden eğitmenin, eğitim sırasında görmediği jeneratörlerden gelen videoları tespit etme yeteneğini önemli ölçüde artırdığını görüyoruz:

GenD-PE'nin görülmemiş video jeneratörleri üzerindeki yeniden eğitim sonuçları. Yeni DF26 materyali üzerinde eğitim, orijinal FaceForensics++ eğitimine kıyasla jeneratörler arası performansı genellikle iyileştirdi.

GenD-PE’nin görülmemiş video jeneratörleri üzerindeki yeniden eğitim sonuçları. Yeni DF26 materyali üzerinde eğitim, orijinal FaceForensics++ eğitimine kıyasla jeneratörler arası performansı genellikle iyileştirdi.

HunyuanVideo 1.5 üzerinde eğitim, Grok Imagine 1.0, Veo 3.1 ve Wan 2.6’da AUROC değerini en az %93.1’e yükseltti; bu, yalnızca FaceForensics++ gibi eski veri setleriyle eğitilen dedektörlerin güncel üretken video ile uyumsuz olduğunu savunan makalenin argümanını destekliyor.

Tahmin edilebilir bir şekilde, iki zaman‑temelli dedektör açık kaynak videoda çok daha iyi performans gösterdi; DFD-FCG açık kaynak materyalde 57.4 AUROC iken kapalı kaynak videoda 34.5’e düştü; PwTF-DVD ise 70.5’ten 48.3’e geriledi:

İki zaman‑temelli dedektörün jeneratör kaynağı ve konuşma senaryosu üzerindeki karşılaştırmalı sonuçları. Her ikisi de kapalı kaynak videoda belirgin şekilde daha kötü performans gösterirken, sahne tipleri arasındaki farklar daha küçüktü.

İki zaman‑temelli dedektörün jeneratör kaynağı ve konuşma senaryosu üzerindeki karşılaştırmalı sonuçları. Her ikisi de kapalı kaynak videoda belirgin şekilde daha kötü performans gösterirken, sahne tipleri arasındaki farklar daha küçüktü.

Ancak, makale ticari modellerin sadece daha zor tespit edildiğini iddia etmeyi bırakıyor; model ailesi, son‑işleme ve görsel kalite gibi faktörler de etkili olabilir.

Sahne türü çok daha az önemliydi: DFD-FCG doğrudan kameraya çekilen kliplerde, resmi açıklamalarda ve stüdyo röportajlarında şans seviyesine yakın kaldı, PwTF-DVD ise resmi açıklamalarda en iyi performansı gösterdi. Makaleye göre, jeneratörün kendisi sunum tarzından daha fazla etkili görünüyor.

İnsanlar üzerinde bir çalışma da yürütülerek, insanların DF26 ile otomatik dedektörler gibi aynı zorlukları yaşayıp yaşamadığı incelendi. 232 etiketleme oturumu boyunca katılımcılar, DF26, CelebDF++ ve DeepSpeak v2’den kısa klipleri gerçek ya da sahte olarak değerlendirdi; her sınıftan kaç örnek görecekleri kendilerine söylenmedi.

DF26, CelebDF++ ve DeepSpeak v2 üzerindeki insan doğruluğu. Katılımcılar üç veri setinde de gerçek videoları benzer oranlarda tanımlarken, sahte DF26 videolarındaki doğruluk şans seviyesine yaklaştı.

DF26, CelebDF++ ve DeepSpeak v2 üzerindeki insan doğruluğu. Katılımcılar üç veri setinde de gerçek videoları benzer oranlarda tanımlarken, sahte DF26 videolarındaki doğruluk şans seviyesine yaklaştı.

Gerçek videolardaki performans üç veri setinde de benzerdi: DF26 için %76.0, CelebDF++ için %75.5 ve DeepSpeak v2 için %72.8. Fark, sahte videolarda ortaya çıktı; DF26’da doğruluk %52.6’ya düşerken, iki eski veri setinde sırasıyla %74.5 ve %69.8 idi.

Bu nedenle, makaleye göre katılımcılar DF26’ya genel olarak kafası karışmasa da, belirli görünür kanıtları bulmakta zorlandılar; yani sentetik videolarının sahte olduğunu gösteren ipuçlarını tespit edemediler.

Sonuç

Son iki yılda rapor edilen 16 kat artış olmasına rağmen, kötü niyetli deepfake’lerin gerçekliği ortak deneyimimizde büyük ölçüde eksik; ancak hedefimiz kendimiz olmadıkça bu durumla karşılaşmayız.

Cinsel deepfake mağdurları söz konusu olduğunda bu tamamen anlaşılabilir – ancak deepfake’lerin artık dolandırıcılık suçuna artan bir etki yarattığı göz önüne alındığında, bu materyalin daha fazla kamuoyuyla paylaşılması faydalı olabilir, böylece bağlamımız otomatik kodlayıcı deepfake’lerin ‘altın çağı’ndan difüzyon tabanlı deepfake’lerin çok daha keskin ve aldatıcı dönemine güncellenir.

Elbette, yeni çalışmadaki modellerin çıktılarıyla ilgili çoğu materyal ve diğer modeller, sosyal medya platformlarında yeterli bağlam olmadan ortaya çıkıyor; bu platformların denetleyicileri ya AI’yi gerçekten ayırt edemiyor ya da sadece umursamıyorlar.

Şüphe duyabileceğimiz videolara uygulayabileceğimiz bir ek ölçüt makul güven – ancak bu yetenek bireyler arasında o kadar değişken ki güvenilmez. Bu nedenle, bu teknolojinin etkisine ve giderek artan yeteneklerine alışırken geçiş döneminde, sadece kararı ertelememiz gerekebilir.

 

İlk yayınlanma Pazartesi, 14 Eylül 2026

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai