Sudut Anderson

Deteksi Deepfake Berdasarkan Sifat Biometrik Manusia Asli

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

Sebuah makalah baru dari peneliti di Italia dan Jerman mengusulkan metode untuk mendeteksi video deepfake berdasarkan perilaku biometrik wajah dan suara, bukan artefak yang dibuat oleh sistem sintesis wajah, solusi watermarking yang mahal, atau pendekatan lain yang lebih tidak praktis.

Kerangka kerja ini memerlukan input 10 atau lebih video yang beragam dan tidak palsu dari subjek. Namun, tidak memerlukan pelatihan khusus, pelatihan ulang, atau pelatihan tambahan pada video per kasus, karena model yang dimasukkannya telah mengabstraksi jarak vektor antara video asli dan palsu dengan cara yang lebih luas.

Pembelajaran kontras mendukung pendekatan POI-Forensics. Vektor yang dihasilkan dari materi sumber pada dasar per kasus dibandingkan dengan vektor yang sama dalam video palsu potensial, dengan fasad dan sifat yang diambil dari komponen video dan audio dari footage palsu yang potensial.

Pembelajaran kontras mendukung pendekatan POI-Forensics. Vektor yang dihasilkan dari materi sumber pada dasar per kasus dibandingkan dengan vektor yang sama dalam video palsu potensial, dengan fasad dan sifat yang diambil dari komponen video dan audio dari footage palsu yang potensial. Source: https://arxiv.org/pdf/2204.03083.pdf

Bernama POI-Forensics, pendekatan ini bergantung pada gerakan dan petunjuk audio unik dari individu asli yang sedang di-deepfake.

Walaupun sistem seperti ini dapat memungkinkan kerangka kerja otentikasi yang sepenuhnya otomatis dan ‘prerender’ untuk selebriti, politisi, influencer YouTube, dan orang lain yang memiliki banyak materi video yang tersedia, juga dapat disesuaikan menjadi kerangka kerja di mana korban deepfake biasa dapat memiliki platform untuk membuktikan ketidakaslian serangan terhadap mereka.

Visualisasi fitur yang diekstrak dari video asli dan palsu di seluruh empat subjek dalam POI-Forensics, melalui kerangka t-SNE.

Visualisasi fitur yang diekstrak dari video asli dan palsu di seluruh empat subjek dalam POI-Forensics, melalui kerangka t-SNE.

Penulis mengklaim bahwa POI-Forensics mencapai negara seni yang baru dalam deteksi deepfake. Di seluruh berbagai dataset umum dalam bidang ini, kerangka kerja dilaporkan mencapai perbaikan skor AUC sebesar 3%, 10%, dan 7% untuk video berkualitas tinggi, rendah, dan ‘diserang’, masing-masing. Peneliti berjanji untuk merilis kode segera.

Kinerja POI-Forensics melawan kerangka kerja SOTA rival pDFDC, DeepFakeTIMIT, FakeAVCelebV2, dan KoDF. Pelatihan dalam setiap kasus dilakukan pada FaceForensics++, ID-Reveal, dan metode penulis pada VoxCeleb2. Hasilnya termasuk video berkualitas tinggi dan rendah.

Kinerja POI-Forensics melawan kerangka kerja SOTA rival pDFDC, DeepFakeTIMIT, FakeAVCelebV2, dan KoDF. Pelatihan dalam setiap kasus dilakukan pada FaceForensics++ dan metode penulis ID-Reveal pada VoxCeleb2. Hasilnya termasuk video berkualitas tinggi dan rendah.

Penulis menyatakan:

‘Pelatihan dilakukan secara eksklusif pada video wajah yang berbicara, sehingga detektor tidak bergantung pada metode manipulasi tertentu dan menghasilkan kemampuan generalisasi tertinggi. Selain itu, metode kami dapat mendeteksi serangan single-modality (audio-only, video-only) dan multi-modality (audio-video), dan tahan terhadap video berkualitas rendah atau rusak dengan membangun hanya fitur semantik tingkat tinggi.’

Makalah baru ini, yang menggabungkan elemen dari beberapa proyek penulis sebelumnya, berjudul Deteksi Deepfake Audio-Visual Person-of-Interest, dan merupakan kerja sama antara Universitas Federico II di Naples dan Technical University of Munich.

Perlombaan Senjata Deepfake

Untuk mengalahkan sistem deteksi seperti ini, sistem deepfake dan sintesis manusia akan memerlukan kemampuan untuk setidaknya mensimulasikan petunjuk biometrik visual dan audio dari target sintesis yang diinginkan – teknologi yang masih jauh dan kemungkinan akan tetap berada dalam cakupan sistem tertutup yang mahal dan berkembang yang dikembangkan oleh perusahaan VFX, yang akan memiliki keuntungan dari kerja sama dan partisipasi target yang diinginkan (atau warisan mereka, dalam kasus simulasi orang yang telah meninggal).

Pendekatan sebelumnya penulis, ID-Reveal, terkonsentrasi sepenuhnya pada informasi visual. Source: https://arxiv.org/pdf/2012.02512.pdf

Pendekatan sebelumnya penulis, ID-Reveal, terkonsentrasi sepenuhnya pada informasi visual. Source: https://arxiv.org/pdf/2012.02512.pdf

Metode deepfake yang sukses dan populer seperti FaceSwap dan DeepFaceLab/Live saat ini tidak memiliki kemampuan untuk menciptakan aproksimasi biometrik yang sangat halus, bergantung pada impersonator berbakat impersonator yang diimposkan pada identitas palsu, dan lebih umum bergantung pada footage liar dari orang yang ‘serupa’. Nor struktur kode inti 2017, yang memiliki sedikit modularitas dan yang tetap menjadi sumber upstream untuk DFL dan FaceSwap, membuat menambahkan fungsionalitas seperti ini tidak memungkinkan.

Dua paket deepfake dominan ini berbasis pada autoencoder. Metode sintesis manusia alternatif dapat menggunakan pendekatan Jaringan Adversarial Generatif (GAN) atau Neural Radiance Field (NeRF) untuk merekayasa identitas manusia; tetapi kedua jalur penelitian ini memiliki tahun-tahun pekerjaan di depan bahkan untuk menghasilkan video manusia yang sepenuhnya fotorealistik.

Dengan pengecualian audio (suara palsu), simulasi biometrik sangat jauh di bawah daftar tantangan yang dihadapi sintesis gambar manusia. Dalam hal apapun, mereproduksi timbre dan kualitas lain dari suara manusia tidak mereproduksi kekhasan dan ‘tells’nya, atau cara subjek asli menggunakan konstruksi semantik. Oleh karena itu, bahkan perfeksi simulasi suara AI yang dihasilkan tidak menyelesaikan potensi firewall otentikasi biometrik.

Di Arxiv saja, beberapa strategi deteksi deepfake dan inovasi dirilis setiap minggu. Pendekatan baru-baru ini telah bergantung pada Kehomogenan Wajah-Suara, Histogram Pola Biner Lokal (FF-LBPH), persepsi manusia tentang deepfake audio, menganalisis perbatasan wajah, menghitung degradasi video, dan ‘Balistik Forensik’ – di antara banyak lainnya.

Analisis histogram tersegmentasi adalah salah satu teknik terbaru yang ditawarkan untuk meningkatkan deteksi deepfake. Source: https://arxiv.org/pdf/2203.09928.pdf

Analisis histogram tersegmentasi adalah salah satu teknik terbaru yang ditawarkan untuk meningkatkan deteksi deepfake. Source: https://arxiv.org/pdf/2203.09928.pdf

Pendekatan, Data, dan Arsitektur

POI-Forensics mengambil pendekatan multi-modal untuk verifikasi identitas, memanfaatkan biometrik lunak berdasarkan petunjuk visual dan audio. Kerangka kerja ini memiliki jaringan audio dan video terpisah, yang pada akhirnya menghasilkan data vektor karakteristik yang dapat dibandingkan dengan fitur yang diekstrak dari video deepfake potensial yang sedang dipelajari.

Arsitektur POI-Forensics.

Arsitektur konseptual POI-Forensics.

Analisis terpisah (audio atau video) dan fusi dapat dilakukan pada klip target, akhirnya menghasilkan indeks kesamaan POI. Fungsi kerugian kontras yang digunakan didasarkan pada kolaborasi akademis 2021 antara Google Research, Boston University, Snap Inc. (SNAP ), dan MIT.

Dataset dasar dibagi berdasarkan identitas per kasus. 4608 identitas digunakan untuk pelatihan, dengan 512 sisanya untuk validasi. 500 identitas yang digunakan dalam FakeAVCelebV2 (kandidat pengujian, lihat di bawah) dikecualikan untuk mendapatkan hasil yang tidak berpihak.

Kedua jaringan dilatih selama 12 epoch dengan ukuran batch yang tidak biasa besar sebesar 2304 batch per epoch, dengan setiap batch terdiri dari 8×8 segmen video – 8 segmen untuk 8 identitas yang berbeda. Optimizer Adam digunakan dengan penurunan berat yang dipisahkan pada tingkat pembelajaran 10−4, dan penurunan berat sebesar 0,01.

Pengujian dan Hasil

Dataset deepfake yang diuji untuk proyek ini adalah dataset Tantangan Deteksi Deepfake, yang menampilkan face-swaps di seluruh 68 subjek, dari mana 44 identitas dipilih yang memiliki lebih dari sembilan video terkait, total 920 video asli dan 2925 video palsu; DeepFake-TIMIT, dataset berbasis GAN yang menampilkan 320 video dari 32 subjek, total 290 video asli dan 580 video palsu dengan durasi minimal empat detik; FakeAVCelebV2, yang terdiri dari 500 video asli dari Voxceleb2, dan sekitar 20.000 video palsu dari berbagai dataset, ke mana audio palsu yang dikloning ditambahkan dengan SV2TTS untuk kompatibilitas; dan KoDF, dataset deepfake Korea dengan 403 identitas yang dipalsukan melalui FaceSwap, DeepFaceLab, dan FSGAN, serta tiga Model Gerakan Pertama (FOMM).

Yang terakhir juga menampilkan sintesis wajah yang digerakkan audio ATFHP, dan output dari Wav2Lip, dengan penulis menggunakan dataset yang dihasilkan yang menampilkan 276 video asli dan 544 video palsu.

Metrik yang digunakan termasuk area di bawah kurva karakteristik operasi penerima (AUC), dan tingkat ‘false alarm’ sekitar 10% yang diperkirakan, yang akan menjadi masalah dalam kerangka kerja yang menggabungkan dan melatih data palsu, tetapi yang kekhawatiran ini dihilangkan oleh fakta bahwa POI-Forensics hanya mengambil video asli sebagai inputnya.

Metode ini diuji melawan detektor deepfake Seferbekov, yang mencapai posisi pertama dalam Tantangan Deteksi Deepfake Kaggle; FTCN (Jaringan Konvolusi Waktu Penuh), kolaborasi antara Universitas Xiamen di Cina dan Microsoft (MSFT ) Research Asia; LipForensics, karya bersama 2021 antara Imperial College London dan Facebook; dan ID-Reveal, proyek sebelumnya dari beberapa penulis makalah baru, yang menghilangkan aspek audio, dan yang menggunakan Model Morfologi 3D dalam kombinasi dengan skenario permainan adversarial untuk mendeteksi output palsu.

Hasilnya (lihat tabel di atas), POI-Forensics mengungguli pemimpin referensi Seferbekov sebesar 2,5% dalam AUC, dan 1,5% dalam hal akurasi. Kinerja lebih kompetitif di atas dataset lainnya pada HQ.

Namun, pendekatan baru ini menunjukkan keunggulan yang signifikan atas metode referensi kompetitif lainnya untuk video berkualitas rendah, yang tetap menjadi skenario paling mungkin di mana deepfakes cenderung menipu pemirsa kasual, berdasarkan konteks ‘dunia nyata’.

Penulis menyatakan:

‘Memang, dalam skenario yang menantang ini, hanya pendekatan berbasis identitas yang terus memberikan kinerja yang baik, karena mereka bergantung pada fitur semantik tingkat tinggi, yang cukup tahan terhadap kerusakan gambar.’

Mengingat bahwa PIO-Forensics hanya menggunakan video asli sebagai materi sumber, pencapaian ini secara tidak langsung diperbesar, dan menunjukkan bahwa menggunakan sifat biometrik asli dari korban deepfake potensial adalah jalan yang layak untuk melarikan diri dari ‘perang dingin artefak’ antara perangkat lunak deepfake dan solusi deteksi deepfake.

Di pengujian terakhir, peneliti menambahkan noise adversarial ke input, metode yang dapat secara andal menipu klasifikasi. Metode tanda gradient cepat masih terbukti sangat efektif dalam hal ini.

Strategi serangan adversarial menurunkan tingkat keberhasilan di semua metode dan dataset, dengan AUC menurun dalam interval antara 10% hingga 38%. Namun, hanya POI-Forensics, dan metode sebelumnya penulis ID-Reveal yang dapat mempertahankan kinerja yang masuk akal dalam skenario serangan ini, menunjukkan bahwa fitur tingkat tinggi yang terkait dengan biometrik lunak sangat tahan terhadap evasi deteksi deepfake.

Penulis menyimpulkan:

‘Secara keseluruhan, kami percaya metode kami adalah batu loncatan pertama; khususnya, penggunaan fitur semantik tingkat tinggi adalah jalur penelitian yang menjanjikan di masa depan. Selain itu, analisis multimodal dapat diperkaya lebih lanjut dengan memasukkan lebih banyak informasi dari domain lain seperti data teks.’

 

Dipublikasikan pertama kali pada 8 April 2022.

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai