Anderson’un Açısı

Derin Sahte Tespit Edilmesi İçin Orijinal İnsan Biyometrik Özelliklerine Dayalı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Images produced by deepfakers at the DeepFaceLab Discord Channel

İtalya ve Almanya’dan araştırmacıların yeni bir makalesi, yüz ve ses biyometrik davranışına dayanarak derin sahte videoları tespit etme yöntemi öneriyor. Bu yöntem, yüz sentez sistemleri tarafından oluşturulan sanat eserlerinden ziyade, pahalı watermarking çözümleri veya diğer daha hantal yaklaşımlardan ziyade, yüz ve ses biyometrik davranışına dayanmaktadır.

Çerçeve, konu hakkında 10 veya daha fazla çeşitli, sahte olmayan video girişini gerektirir. Ancak, her bir vakaya özgü videolarda özel olarak eğitilmesi, yeniden eğitilmesi veya güçlendirilmesi gerekmez, çünkü dahil edilen model zaten gerçek ve sahte videolar arasındaki muhtemel vektör mesafelerini geniş bir şekilde soyutlamıştır.

Karşıt öğrenme, POI-Forensics yaklaşımının temelini oluşturur. Kaynak materyalden türetilen vektörler, her bir vakaya özgü olarak, potansiyel olarak sahte bir video中的 aynı vektörlerle karşılaştırılır ve video ve ses bileşenlerinden hem de potansiyel olarak sahte görüntüden alınan özellikler ve özellikler çıkarılır. Kaynak: https://arxiv.org/pdf/2204.03083.pdf

Karşıt öğrenme, POI-Forensics yaklaşımının temelini oluşturur. Kaynak materyalden türetilen vektörler, her bir vakaya özgü olarak, potansiyel olarak sahte bir video中的 aynı vektörlerle karşılaştırılır ve video ve ses bileşenlerinden hem de potansiyel olarak sahte görüntüden alınan özellikler ve özellikler çıkarılır. Kaynak: https://arxiv.org/pdf/2204.03083.pdf

POI-Forensics olarak adlandırılan bu yaklaşım, gerçek bireyin hareket ve ses ipuçlarına dayanmaktadır.

Böyle bir sistem, ünlüler, politikacılar, YouTube etkileyicileri ve çok sayıda video materyali sẵn bulunan diğer kişiler için tamamen otomatikleştirilmiş, “ön renderlenmiş” kimlik doğrulama çerçevelerine izin verebilir. Ancak, derin sahte teknolojilerine karşı ordinaryüs kurbanların da sahte saldırıların gerçekdışılığını kanıtlamak için bir platforma sahip olabilecekleri bir çerçeve olarak da uyarlanabilir.

POI-Forensics'te gerçek ve sahte videolardan çıkarılan özelliklerin görselleştirmesi, dört konu üzerinden t-SNE çerçevesi aracılığıyla.

POI-Forensics’te gerçek ve sahte videolardan çıkarılan özelliklerin görselleştirmesi, dört konu üzerinden t-SNE çerçevesi aracılığıyla.

Yazarlar, POI-Forensics’in derin sahte tespit alanında yeni bir durum yaratığını iddia ediyorlar. Bu alanda yaygın olarak kullanılan çeşitli veri setleri üzerinde, POI-Forensics, yüksek kaliteli, düşük kaliteli ve “saldırıya uğramış” videolarda sırasıyla %3, %10 ve %7’lik bir AUC puanı iyileşmesi sağlıyor. Araştırmacılar, kodu kısa süre içinde yayınlamayı vaat ediyor.

POI-Forensics'in, pDFDC, DeepFakeTIMIT, FakeAVCelebV2 ve KoDF gibi diğer SOTA çerçevelerine kıyasla performansı.

POI-Forensics’in, pDFDC, DeepFakeTIMIT, FakeAVCelebV2 ve KoDF gibi diğer SOTA çerçevelerine kıyasla performansı.

The authors state:

‘Eğitim, yalnızca gerçek konuşma yüz videoları üzerinde yapılır, böylece dedektör, herhangi bir özel manipülasyon yöntemine bağlı değildir ve en yüksek genelleme yeteneğini sağlar. Ayrıca, bizim yöntemimiz hem tek modlu (sadece ses veya sadece video) hem de çok modlu (ses-görüntü) saldırıları tespit edebilir ve yalnızca yüksek düzeyli anlamsal özelliklere dayanarak düşük kaliteli veya bozulmuş videolara karşı dayanıklıdır.’

Yeni makale, bazı yazarların 2021 yılında gerçekleştirdiği ID-Reveal projesinin bazı unsurlarını içermektedir ve Ses-Görüntü Kişi İlgi Derin Sahte Tespiti olarak adlandırılmaktadır. Bu, Napoli’deki Federico II Üniversitesi ve Münih Teknik Üniversitesi arasındaki bir işbirliğidir.

Derin Sahte Silah Yarışı

Bu tür bir tespit sistemini yenmek için, derin sahte ve insan sentez sistemlerinin, hedefin görsel ve ses biyometrik ipuçlarını simüle etme yeteneğine sahip olmaları gerekir – bu teknoloji, yıllar öncesinden VFX şirketleri tarafından geliştirilen pahalı ve özel kapalı sistemlerin alanındadır ve hedeflerin (veya ölen kişilerin mülkiyetinin) işbirliği ve katılımıyla geliştirilecektir.

Yazarların önceki yaklaşımı, ID-Reveal, tamamen görsel bilgiye odaklanıyordu. Kaynak: https://arxiv.org/pdf/2012.02512.pdf

Yazarların önceki yaklaşımı, ID-Reveal, tamamen görsel bilgiye odaklanıyordu. Kaynak: https://arxiv.org/pdf/2012.02512.pdf

Popüler derin sahte yöntemleri olan FaceSwap ve DeepFaceLab/Live, böyle granüler biyometrik yaklaşık değerler oluşturma yeteneğine sahip değildir. En iyi durumda, yetenekli taklitçiler üzerine dayanırlar ve çok daha sık olarak, “benzer” insanların vahşi doğada çekilen görüntülerine dayanır. Ayrıca, 2017’de oluşturulan temel kodun yapısı, bu tür işlevselliğin eklenmesini mümkün kılmaz.

İki baskın derin sahte paketi, oto-encoder‘lardan oluşur. Alternatif insan sentez yöntemleri, insan kimliğini yeniden yaratmak için Karşıt Örnek Ağı (GAN) veya Nöral Işın Alanı (NeRF) yaklaşımını kullanabilir; ancak bu araştırma hatları, tam olarak foto-gerçekçi insan videosu üretmek için yıllarca çalışmaya ihtiyaç duyacaktır.

İstisna, ses (sahte sesler) olmak üzere, biyometrik simülasyon, insan görüntü sentezinin karşılaştığı zorlukların çok aşağısındadır. Her durumda, insan sesinin timbre ve diğer özelliklerini yeniden üretmek, sesin tuhaflıklarını ve “ipuçlarını” veya gerçek konunun anlamsal yapıyı kullanma şeklini yeniden üretmez. Dolayısıyla, AI tarafından oluşturulan ses simülasyonunun mükemmelleştirilmesi, biyometrik kimlik doğrulama potansiyel ateşleyicisini çözmez.

Arxiv’de alone, her hafta birkaç derin sahte tespit stratejisi ve yenilikler yayımlanmaktadır. Son yaklaşım, Ses-Yüz Homojenliği, Yerel İkili Düzen Histogramı (FF-LBPH), insan algılamasının ses derin sahtelerine, yüz sınırlarının analizi, video bozulmasının hesaba alınması ve ‘Adli Balistik’ – ve diğer birçokları.

Histogram analizi, derin sahte tespitini iyileştirmek için önerilen son tekniklerden biridir. Kaynak: https://arxiv.org/pdf/2203.09928.pdf

Segmented histogram analizi, derin sahte tespitini iyileştirmek için önerilen son tekniklerden biridir. Kaynak: https://arxiv.org/pdf/2203.09928.pdf

Yaklaşım, Veri ve Mimarisi

POI-Forensics, kimlik doğrulama için çok modlu bir yaklaşım benimser ve görsel ve ses ipuçlarına dayanan yumuşak biyometriklere dayanır. Çerçeve, sonunda karşılaştırılabilir karakteristik vektör verilerini türetebilen ayrı ses ve video ağlarına sahiptir.

POI-Forensics'in mimarisi.

POI-Forensics’in kavramsal mimarisi.

Hem ayrı (ses veya video) hem de füzyon analizi, hedef kliber üzerinde gerçekleştirilebilir ve sonunda bir POI benzerlik endeksine ulaşılır. Kullanılan karşıt kayıp fonksiyonu, 2021’de Google Research, Boston Üniversitesi, Snap Inc. (SNAP ) ve MIT arasında akademik bir işbirliği temelinde oluşturulmuştur.

Temel veri kümesi, her bir kimlik için bölündü. 4608 kimlik eğitim için kullanıldı, 512’si doğrulama için ayrıldı. FakeAVCelebV2’de (aşağıda belirtilen bir test adayında) kullanılan 500 kimlik, sonuçların kutuplaşmasını önlemek amacıyla hariç tutuldu.

İki ağ, 12 epoch için eğitildi ve her bir epoch için 2304 batch boyutunda, her bir batch 8×8 video segmentinden oluşuyordu – 8 segment, 8 farklı kimlik için. Adam optimizer, bağımsız ağırlık çürümesi ile 10−4 öğrenme hızında ve 0.01 ağırlık çürümesi ile kullanıldı.

Test ve Sonuçlar

Proje için test edilen derin sahte veri kümeleri, önizleme Derin Sahte Tespit Çelişkisi veri kümesini içeriyordu; bu, 68 konu arasında yüz değişimlerini içeren bir veri kümesiydi, bunlardan 44’ü dokuzdan fazla ilgili videoya sahip olarak seçildi, toplam 920 gerçek video ve 2925 sahte video. Ayrıca DeepFake-TIMIT, bir GAN tabanlı veri kümesi, 32 konu için 320 video, toplam 290 gerçek video ve en az dört saniye süren 580 sahte video; FakeAVCelebV2, Voxceleb2‘den 500 gerçek video ve çeşitli veri kümelerinden yaklaşık 20.000 sahte video, SV2TTS ile uyumluluk için sahte klonlanmış ses eklenerek oluşturuldu; ve KoDF, FaceSwap, DeepFaceLab ve FSGAN ile sahtelenen 403 kimlikten oluşan bir Koreli derin sahte veri kümesi.

Sonuncusu ayrıca, ATFHP ile ses tarafından yönlendirilen yüz sentezi ve Wav2Lip çıkışını da içeriyordu. Araştırmacılar, 276 gerçek video ve 544 sahte video içeren türetilmiş bir veri kümesini kullandılar.

Kullanılan metrikler, alıcı işletim karakteristiği eğrisinin altındaki alan (AUC) ve yaklaşık %10 ‘yanlış alarm oranı’nu içeriyordu; bu, sahte verileri içeren ve eğitilen çerçevelerde sorunlu olabilirdi, ancak POI-Forensics yalnızca gerçek video görüntülerini girdi olarak aldığı için bu sorun ortadan kalkar.

Yöntemler, Seferbekov derin sahte dedektörü ile test edildi; bu, Kaggle Derin Sahte Tespit Çelişkisini ilk sırada tamamladı; FTCN (Tamamen Zamansal Konvolüsyon Ağı), Çin’in Xiamen Üniversitesi ve Microsoft (MSFT ) Research Asia arasındaki bir işbirliği; LipForensics, 2021’de Imperial College London ve Facebook arasında ortak bir çalışma; ve ID-Reveal, bu yeni makalenin bazı yazarlarının önceki projesi, ses yönünü atlar ve 3D Morfolojik Modelleri bir karşıt oyun senaryosu ile birleştirerek sahte çıktıyı tespit eder.

Sonuçlarda (yukarıdaki tabloya bakınız), POI-Forensics, referans lideri Seferbekov’u AUC’de %2,5 ve doğrulukta %1,5 oranında geride bıraktı. Performans, diğer veri kümeleri üzerinde daha rekabetçi oldu.

Yeni yaklaşım, özellikle düşük kaliteli videolarda, casual izleyicileri kandırmaya en muhtemel senaryo olan durumlarda, tüm karşılaştırılan referans yöntemlerine karşı önemli bir üstünlük gösterdi.

The authors assert:

‘Gerçekten, bu zorlu senaryoda, yalnızca kimlik tabanlı yaklaşımlar iyi bir performans sağlamaya devam etmektedir, çünkü bunlar, görsel bozulmalara karşı oldukça dayanıklı olan yüksek düzeyli anlamsal özelliklere dayanmaktadır.’

POI-Forensics’in yalnızca gerçek video materyallerini girdi olarak kullandığını dikkate alındığında, bu başarı daha da önemli hale gelmektedir ve potansiyel derin sahte kurbanlarının yerli biyometrik özelliklerini kullanmanın, “sanat eserleri soğuk savaşından” kaçınmak için değerli bir yol olduğu fikrini desteklemektedir.

Son bir testte, araştırmacılar girdiye karşıt gürültü ekledi; bu, sınıflandırıcıları güvenilir bir şekilde aldatmak için kullanılan bir yöntemdir. Eski hızlı gradient işaret yöntemi hala özellikle etkili olduğunu kanıtladı.

Karşıt saldırı stratejileri, tüm yöntemler ve veri kümeleri boyunca başarı oranını düşürdü, AUC %10 ila %38 arasında düşüş gösterdi. Ancak, yalnızca POI-Forensics ve yazarların önceki yöntemi ID-Reveal, bu saldırı senaryosunda makul bir performans sergileyebildi, bu da yumuşak biyometri ile ilişkili yüksek düzeyli özelliklerin, derin sahte tespit kaçınma karşısında olağanüstü bir şekilde dayanıklı olduğunu gösteriyor.

The authors conclude:

‘Genel olarak, bizim yöntemimizin bir ilk adım olduğuna inanıyoruz; özellikle, daha yüksek düzeyli anlamsal özelliklerin kullanılması, gelecekteki araştırmalar için umut verici bir yoludur. Ayrıca, çok modlu analiz, diğer alanlardan, chẳng hạn metin verileri gibi daha fazla bilgi eklenerek daha da zenginleştirilebilir.’

 

8 Nisan 2022’de ilk kez yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai