มุมมองของ Anderson
การตรวจจับ Deepfake โดยอาศัยลักษณะชีวมิติของมนุษย์ดั้งเดิม

วิจัยใหม่จากนักวิจัยในอิตาลีและเยอรมนีเสนอวิธีการตรวจจับวิดีโอ Deepfake โดยอาศัยพฤติกรรมทางชีวมิติของใบหน้าและเสียงของมนุษย์แทนที่จะพึ่งพาเครื่องมือสร้างใบหน้าหรือวิธีการอื่นๆ ที่มีค่าใช้จ่ายสูง
เฟรมเวิร์กนี้ต้องการวิดีโอที่ไม่ใช่ Deepfake ของบุคคลนั้นอย่างน้อย 10 วิดีโอ แต่ไม่ต้องการการฝึกอบรมหรือการเพิ่มประสิทธิภาพเฉพาะสำหรับวิดีโอแต่ละคลิป เนื่องจากโมเดลที่รวมอยู่แล้วสามารถจัดการกับระยะห่างระหว่างวิดีโอที่แท้จริงและวิดีโอ Deepfake ได้อย่างกว้างขวาง

การเรียนรู้แบบ Contrastive เป็นพื้นฐานของ POI-Forensics เวกเตอร์ที่ได้มาจากวัสดุแหล่งที่มาในแต่ละกรณีจะถูกเปรียบเทียบกับเวกเตอร์เดียวกันในวิดีโอที่อาจเป็น Deepfake โดยมีลักษณะและคุณลักษณะที่ได้มาจากทั้งวิดีโอและเสียงของวิดีโอที่อาจเป็น Deepfake Source: https://arxiv.org/pdf/2204.03083.pdf
ชื่อ POI-Forensics วิธีการนี้อาศัยการเคลื่อนไหวและเสียงที่เป็นเอกลักษณ์ของบุคคลที่ถูกสร้างเป็น Deepfake
ระบบนี้สามารถใช้สำหรับการยืนยันตัวตนแบบอัตโนมัติสำหรับคนดัง นักการเมือง ผู้มีอิทธิพลใน YouTube และบุคคลอื่นๆ ที่มีวิดีโอมากมายที่สามารถเข้าถึงได้ และยังสามารถปรับเปลี่ยนเป็นแพลตฟอร์มสำหรับเหยื่อของ Deepfake ที่ต้องการพิสูจน์ว่าวิดีโอนั้นไม่แท้

การแสดงภาพคุณลักษณะที่ถูกถอดรหัสจากวิดีโอที่แท้จริงและวิดีโอ Deepfake ของ POI-Forensics โดยใช้เฟรมเวิร์ก t-SNE
ผู้เขียนอ้างว่า POI-Forensics สามารถตรวจจับ Deepfake ได้ดีกว่าวิธีการอื่นๆ ในชุดข้อมูลที่ทดสอบ โดยมีการปรับปรุงคะแนน AUC 3%, 10% และ 7% สำหรับวิดีโอคุณภาพสูง ต่ำ และที่ถูกโจมตีตามลำดับ นักวิจัยสัญญาว่าจะเผยแพร่โค้ดในเร็วๆ นี้

ผลการทำงานของ POI-Forensics เมื่อเทียบกับวิธีการอื่นๆ
การแข่งขัน Deepfake
เพื่อเอาชนะระบบตรวจจับนี้ ระบบ Deepfake และการสร้างภาพของมนุษย์จะต้องสามารถจำลองลักษณะชีวมิติของใบหน้าและเสียงของบุคคลที่ต้องการสร้างเป็น Deepfake ได้ ซึ่งเป็นเทคโนโลยีที่ยังอยู่ห่างไกลและอาจยังคงอยู่ในระบบปิดที่มีค่าใช้จ่ายสูง

วิธีการก่อนหน้าของผู้เขียน ID-Reveal มุ่งเน้นไปที่ข้อมูลทางภาพเท่านั้น Source: https://arxiv.org/pdf/2012.02512.pdf
วิธีการ Deepfake ที่ประสบความสำเร็จและเป็นที่นิยม เช่น FaceSwap และ DeepFaceLab ไม่สามารถสร้างลักษณะชีวมิติที่ละเอียดได้ และยังขึ้นอยู่กับการเลียนแบบที่มีพรสวรรค์หรือการใช้ภาพในโลกแห่งความเป็นจริงของบุคคลที่คล้ายคลึงกัน
ระบบเหล่านี้อาศัยการทำงานของ autoencoder ซึ่งไม่สามารถเพิ่มฟังก์ชันการสร้างลักษณะชีวมิติได้ วิธีการสังเคราะห์ภาพของมนุษย์ที่ใช้ Generative Adversarial Network (GAN) หรือ Neural Radiance Field (NeRF) ยังต้องใช้เวลาหลายปีในการสร้างวิดีโอที่มีคุณภาพสูงและสมจริง
การจำลองเสียงของมนุษย์เป็นเรื่องที่ยากและไม่สามารถสร้างลักษณะที่เป็นเอกลักษณ์ของเสียงของบุคคลได้ ดังนั้นการสร้างเสียงที่สมบูรณ์แบบจึงไม่ใช่วิธีแก้ปัญหาในการตรวจจับ Deepfake
มีวิธีการตรวจจับ Deepfake หลายวิธีที่ถูกเผยแพร่ใน Arxiv ทุกสัปดาห์ วิธีการเหล่านี้รวมถึงการตรวจสอบความสม่ำเสมอของเสียงและใบหน้า การวิเคราะห์ฮิสโตแกรมของลักษณะท้องถิ่น การตรวจสอบการรับรู้ของมนุษย์ต่อเสียง Deepfake การวิเคราะห์ขอบเขตของใบหน้า และการคำนึงถึงการเสื่อมสภาพของวิดีโอ

การวิเคราะห์ฮิสโตแกรมที่แบ่งออกเป็นช่วงๆ เป็นหนึ่งในเทคนิคใหม่ๆ ที่ถูกนำมาใช้ในการตรวจจับ Deepfake Source: https://arxiv.org/pdf/2203.09928.pdf
วิธีการ ข้อมูล และสถาปัตยกรรม
POI-Forensics ใช้วิธีการหลายรูปแบบในการยืนยันตัวตน โดยอาศัยลักษณะชีวมิติที่อ่อนของใบหน้าและเสียงของมนุษย์ ระบบนี้ประกอบด้วยเครือข่ายเสียงและวิดีโอที่แยกจากกัน ซึ่งสามารถสร้างเวกเตอร์ที่มีลักษณะเฉพาะที่สามารถเปรียบเทียบกับเวกเตอร์ที่ถูกถอดรหัสจากวิดีโอที่อาจเป็น Deepfake ได้

สถาปัตยกรรมของ POI-Forensics
สามารถทำการวิเคราะห์แบบแยกจากกัน (เสียงหรือวิดีโอ) และการวิเคราะห์แบบรวม (เสียงและวิดีโอ) ได้ โดยจะส่งผลให้ได้ดัชนีความคล้ายคลึงกันของ POI
ฟังก์ชันการเสียหายที่ใช้ในการฝึกอบรมเป็นไปตามการทำงานร่วมกันทางวิชาการในปี 2021 ระหว่าง Google Research, Boston University, Snap Inc. (SNAP ) และ MIT
(MSFT )ชุดข้อมูลที่ใช้ในการฝึกอบรมถูกแบ่งออกเป็นชุดข้อมูลสำหรับการฝึกอบรมและชุดข้อมูลสำหรับการทดสอบ โดยใช้ข้อมูลจาก 4608 บุคคลสำหรับการฝึกอบรมและ 512 บุคคลสำหรับการทดสอบ
เครือข่ายทั้งสองถูกฝึกอบรมเป็นเวลา 12 ยุคด้วยขนาดแบตช์ที่ใหญ่มาก โดยมี 8×8 วิดีโอที่แตกต่างกันในแต่ละแบตช์
การทดสอบและผลลัพธ์
ชุดข้อมูลที่ใช้ในการทดสอบคือชุดข้อมูล DeepFake Detection Challenge, DeepFake-TIMIT, FakeAVCelebV2 และ KoDF
ผลลัพธ์แสดงให้เห็นว่า POI-Forensics สามารถตรวจจับ Deepfake ได้ดีกว่าวิธีการอื่นๆ ในชุดข้อมูลที่ทดสอบ โดยมีการปรับปรุงคะแนน AUC 3%, 10% และ 7% สำหรับวิดีโอคุณภาพสูง ต่ำ และที่ถูกโจมตีตามลำดับ
ผู้เขียนสรุปว่า “โดยรวมแล้ว เราเชื่อว่าวิธีการของเราคือก้าวแรกที่สำคัญ โดยเฉพาะอย่างยิ่งการใช้คุณลักษณะระดับสูงเป็นแนวทางที่มีแนวโน้มสำหรับการวิจัยในอนาคต นอกจากนี้ การวิเคราะห์แบบหลายรูปแบบสามารถเพิ่มคุณลักษณะจากโดเมนอื่นๆ เช่น ข้อมูลข้อความได้”
งานวิจัยนี้เผยแพร่ครั้งแรกเมื่อวันที่ 8 เมษายน 2022












