มุมมองของ Anderson

การตรวจจับ Deepfake โดยอาศัยลักษณะชีวมิติของมนุษย์ดั้งเดิม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

วิจัยใหม่จากนักวิจัยในอิตาลีและเยอรมนีเสนอวิธีการตรวจจับวิดีโอ Deepfake โดยอาศัยพฤติกรรมทางชีวมิติของใบหน้าและเสียงของมนุษย์แทนที่จะพึ่งพาเครื่องมือสร้างใบหน้าหรือวิธีการอื่นๆ ที่มีค่าใช้จ่ายสูง

เฟรมเวิร์กนี้ต้องการวิดีโอที่ไม่ใช่ Deepfake ของบุคคลนั้นอย่างน้อย 10 วิดีโอ แต่ไม่ต้องการการฝึกอบรมหรือการเพิ่มประสิทธิภาพเฉพาะสำหรับวิดีโอแต่ละคลิป เนื่องจากโมเดลที่รวมอยู่แล้วสามารถจัดการกับระยะห่างระหว่างวิดีโอที่แท้จริงและวิดีโอ Deepfake ได้อย่างกว้างขวาง

การเรียนรู้แบบ Contrastive เป็นพื้นฐานของ POI-Forensics เวกเตอร์ที่ได้มาจากวัสดุแหล่งที่มาในแต่ละกรณีจะถูกเปรียบเทียบกับเวกเตอร์เดียวกันในวิดีโอที่อาจเป็น Deepfake โดยมีลักษณะและคุณลักษณะที่ได้มาจากทั้งวิดีโอและเสียงของวิดีโอที่อาจเป็น Deepfake

การเรียนรู้แบบ Contrastive เป็นพื้นฐานของ POI-Forensics เวกเตอร์ที่ได้มาจากวัสดุแหล่งที่มาในแต่ละกรณีจะถูกเปรียบเทียบกับเวกเตอร์เดียวกันในวิดีโอที่อาจเป็น Deepfake โดยมีลักษณะและคุณลักษณะที่ได้มาจากทั้งวิดีโอและเสียงของวิดีโอที่อาจเป็น Deepfake Source: https://arxiv.org/pdf/2204.03083.pdf

ชื่อ POI-Forensics วิธีการนี้อาศัยการเคลื่อนไหวและเสียงที่เป็นเอกลักษณ์ของบุคคลที่ถูกสร้างเป็น Deepfake

ระบบนี้สามารถใช้สำหรับการยืนยันตัวตนแบบอัตโนมัติสำหรับคนดัง นักการเมือง ผู้มีอิทธิพลใน YouTube และบุคคลอื่นๆ ที่มีวิดีโอมากมายที่สามารถเข้าถึงได้ และยังสามารถปรับเปลี่ยนเป็นแพลตฟอร์มสำหรับเหยื่อของ Deepfake ที่ต้องการพิสูจน์ว่าวิดีโอนั้นไม่แท้

การแสดงภาพคุณลักษณะที่ถูกถอดรหัสจากวิดีโอที่แท้จริงและวิดีโอ Deepfake ของ POI-Forensics โดยใช้เฟรมเวิร์ก t-SNE

การแสดงภาพคุณลักษณะที่ถูกถอดรหัสจากวิดีโอที่แท้จริงและวิดีโอ Deepfake ของ POI-Forensics โดยใช้เฟรมเวิร์ก t-SNE

ผู้เขียนอ้างว่า POI-Forensics สามารถตรวจจับ Deepfake ได้ดีกว่าวิธีการอื่นๆ ในชุดข้อมูลที่ทดสอบ โดยมีการปรับปรุงคะแนน AUC 3%, 10% และ 7% สำหรับวิดีโอคุณภาพสูง ต่ำ และที่ถูกโจมตีตามลำดับ นักวิจัยสัญญาว่าจะเผยแพร่โค้ดในเร็วๆ นี้

ผลการทำงานของ POI-Forensics เมื่อเทียบกับวิธีการอื่นๆ

ผลการทำงานของ POI-Forensics เมื่อเทียบกับวิธีการอื่นๆ

การแข่งขัน Deepfake

เพื่อเอาชนะระบบตรวจจับนี้ ระบบ Deepfake และการสร้างภาพของมนุษย์จะต้องสามารถจำลองลักษณะชีวมิติของใบหน้าและเสียงของบุคคลที่ต้องการสร้างเป็น Deepfake ได้ ซึ่งเป็นเทคโนโลยีที่ยังอยู่ห่างไกลและอาจยังคงอยู่ในระบบปิดที่มีค่าใช้จ่ายสูง

วิธีการก่อนหน้าของผู้เขียน ID-Reveal มุ่งเน้นไปที่ข้อมูลทางภาพเท่านั้น

วิธีการก่อนหน้าของผู้เขียน ID-Reveal มุ่งเน้นไปที่ข้อมูลทางภาพเท่านั้น Source: https://arxiv.org/pdf/2012.02512.pdf

วิธีการ Deepfake ที่ประสบความสำเร็จและเป็นที่นิยม เช่น FaceSwap และ DeepFaceLab ไม่สามารถสร้างลักษณะชีวมิติที่ละเอียดได้ และยังขึ้นอยู่กับการเลียนแบบที่มีพรสวรรค์หรือการใช้ภาพในโลกแห่งความเป็นจริงของบุคคลที่คล้ายคลึงกัน

ระบบเหล่านี้อาศัยการทำงานของ autoencoder ซึ่งไม่สามารถเพิ่มฟังก์ชันการสร้างลักษณะชีวมิติได้ วิธีการสังเคราะห์ภาพของมนุษย์ที่ใช้ Generative Adversarial Network (GAN) หรือ Neural Radiance Field (NeRF) ยังต้องใช้เวลาหลายปีในการสร้างวิดีโอที่มีคุณภาพสูงและสมจริง

การจำลองเสียงของมนุษย์เป็นเรื่องที่ยากและไม่สามารถสร้างลักษณะที่เป็นเอกลักษณ์ของเสียงของบุคคลได้ ดังนั้นการสร้างเสียงที่สมบูรณ์แบบจึงไม่ใช่วิธีแก้ปัญหาในการตรวจจับ Deepfake

มีวิธีการตรวจจับ Deepfake หลายวิธีที่ถูกเผยแพร่ใน Arxiv ทุกสัปดาห์ วิธีการเหล่านี้รวมถึงการตรวจสอบความสม่ำเสมอของเสียงและใบหน้า การวิเคราะห์ฮิสโตแกรมของลักษณะท้องถิ่น การตรวจสอบการรับรู้ของมนุษย์ต่อเสียง Deepfake การวิเคราะห์ขอบเขตของใบหน้า และการคำนึงถึงการเสื่อมสภาพของวิดีโอ

การวิเคราะห์ฮิสโตแกรมที่แบ่งออกเป็นช่วงๆ เป็นหนึ่งในเทคนิคใหม่ๆ ที่ถูกนำมาใช้ในการตรวจจับ Deepfake

การวิเคราะห์ฮิสโตแกรมที่แบ่งออกเป็นช่วงๆ เป็นหนึ่งในเทคนิคใหม่ๆ ที่ถูกนำมาใช้ในการตรวจจับ Deepfake Source: https://arxiv.org/pdf/2203.09928.pdf

วิธีการ ข้อมูล และสถาปัตยกรรม

POI-Forensics ใช้วิธีการหลายรูปแบบในการยืนยันตัวตน โดยอาศัยลักษณะชีวมิติที่อ่อนของใบหน้าและเสียงของมนุษย์ ระบบนี้ประกอบด้วยเครือข่ายเสียงและวิดีโอที่แยกจากกัน ซึ่งสามารถสร้างเวกเตอร์ที่มีลักษณะเฉพาะที่สามารถเปรียบเทียบกับเวกเตอร์ที่ถูกถอดรหัสจากวิดีโอที่อาจเป็น Deepfake ได้

สถาปัตยกรรมของ POI-Forensics

สถาปัตยกรรมของ POI-Forensics

สามารถทำการวิเคราะห์แบบแยกจากกัน (เสียงหรือวิดีโอ) และการวิเคราะห์แบบรวม (เสียงและวิดีโอ) ได้ โดยจะส่งผลให้ได้ดัชนีความคล้ายคลึงกันของ POI

ฟังก์ชันการเสียหายที่ใช้ในการฝึกอบรมเป็นไปตามการทำงานร่วมกันทางวิชาการในปี 2021 ระหว่าง Google Research, Boston University, Snap Inc. (SNAP ) และ MIT

(MSFT )

ชุดข้อมูลที่ใช้ในการฝึกอบรมถูกแบ่งออกเป็นชุดข้อมูลสำหรับการฝึกอบรมและชุดข้อมูลสำหรับการทดสอบ โดยใช้ข้อมูลจาก 4608 บุคคลสำหรับการฝึกอบรมและ 512 บุคคลสำหรับการทดสอบ

เครือข่ายทั้งสองถูกฝึกอบรมเป็นเวลา 12 ยุคด้วยขนาดแบตช์ที่ใหญ่มาก โดยมี 8×8 วิดีโอที่แตกต่างกันในแต่ละแบตช์

การทดสอบและผลลัพธ์

ชุดข้อมูลที่ใช้ในการทดสอบคือชุดข้อมูล DeepFake Detection Challenge, DeepFake-TIMIT, FakeAVCelebV2 และ KoDF

ผลลัพธ์แสดงให้เห็นว่า POI-Forensics สามารถตรวจจับ Deepfake ได้ดีกว่าวิธีการอื่นๆ ในชุดข้อมูลที่ทดสอบ โดยมีการปรับปรุงคะแนน AUC 3%, 10% และ 7% สำหรับวิดีโอคุณภาพสูง ต่ำ และที่ถูกโจมตีตามลำดับ

ผู้เขียนสรุปว่า “โดยรวมแล้ว เราเชื่อว่าวิธีการของเราคือก้าวแรกที่สำคัญ โดยเฉพาะอย่างยิ่งการใช้คุณลักษณะระดับสูงเป็นแนวทางที่มีแนวโน้มสำหรับการวิจัยในอนาคต นอกจากนี้ การวิเคราะห์แบบหลายรูปแบบสามารถเพิ่มคุณลักษณะจากโดเมนอื่นๆ เช่น ข้อมูลข้อความได้”

งานวิจัยนี้เผยแพร่ครั้งแรกเมื่อวันที่ 8 เมษายน 2022

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai