มุมมองของ Anderson
ข้อมูลความลึกสามารถเปิดเผย Deepfakes ในแบบเรียลไทม์

การวิจัยใหม่จากประเทศอิตาลีได้ค้นพบว่าข้อมูลความลึกที่ได้รับจากภาพสามารถเป็นเครื่องมือที่มีประโยชน์ในการตรวจจับ Deepfakes – แม้กระทั่งในแบบเรียลไทม์
ในขณะที่ส่วนใหญ่ของการวิจัยเกี่ยวกับการตรวจจับ Deepfakes ในช่วง 5 ปีที่ผ่านมาได้มุ่งเน้นไปที่ การระบุอาร์ติแฟคต์ (ซึ่งสามารถลดลงได้ด้วยเทคนิคที่ดีขึ้น หรือสับสนกับการบีบอัดวิดีโอโค้ดคุณภาพต่ำ) การให้แสงสว่างโดยรอบ คุณลักษณะชีวภาพ การหยุดชะงักของเวลา และแม้กระทั่ง สัญชาตญาณของมนุษย์ การศึกษใหม่นี้เป็นครั้งแรกที่แนะนำว่าข้อมูลความลึกอาจเป็นคีย์ที่มีค่าสำหรับการตรวจจับ Deepfakes

ตัวอย่างของแผนที่ความลึกที่ได้รับ และความแตกต่างในข้อมูลความลึกเชิงสังเกตระหว่างภาพจริงและภาพปลอม Source: https://arxiv.org/pdf/2208.11074.pdf
อย่างสำคัญ ระบบตรวจจับที่พัฒนาในงานศึกษานี้สามารถทำงานได้ดีบนเครือข่ายที่มีน้ำหนักเบา เช่น Xception และสามารถทำงานได้ดีบน MobileNet และงานศึกษานี้ยังรับทราบว่าความหน่วงต่ำของการอนุมานที่ได้รับจากเครือข่ายเหล่านี้สามารถช่วยให้สามารถตรวจจับ Deepfakes ในแบบเรียลไทม์ได้
การประหยัดเวลาในการอนุมานสามารถทำได้เพราะว่าระบบไม่ต้องการภาพสีเต็มเพื่อแยกความแตกต่างระหว่างแผนที่ความลึกปลอมและแผนที่ความลึกจริง แต่สามารถทำงานได้ดีบนภาพสีเทาเพียงอย่างเดียว
ผู้เขียนระบุว่า: ‘ผลลัพธ์นี้แสดงให้เห็นว่าความลึกในกรณีนี้มีส่วนร่วมมากกว่าอาร์ติแฟคต์สี’
ผลลัพธ์นี้เป็นส่วนหนึ่งของการวิจัยใหม่เกี่ยวกับการตรวจจับ Deepfakes ที่มุ่งเน้นไปที่ระบบสังเคราะห์ใบหน้าแบบเรียลไทม์ เช่น DeepFaceLive – ซึ่งเป็นจุดสนใจที่ได้รับการเร่งรัดอย่างมากในช่วง 3-4 เดือนที่ผ่านมา หลังจากที่ FBI ได้เตือนเกี่ยวกับความเสี่ยงของวิดีโอและเสียง Deepfakes แบบเรียลไทม์
งานวิจัยนี้มีชื่อเรื่องว่า DepthFake: กลยุทธ์ในการตรวจจับวิดีโอ Deepfakes โดยใช้ข้อมูลความลึก และมาจากนักวิจัย 5 คนจากมหาวิทยาลัย Sapienza ของ Rome
กรณีชายขอบ
ระหว่างการฝึกอบรม โมเดล Deepfake ที่ใช้โครงข่ายอัตโนมัติจะให้ความสำคัญกับบริเวณภายในของใบหน้า เช่น ดวงตา จมูก และปาก ในกรณีส่วนใหญ่ บริเวณนอกของใบหน้าจะไม่ถูกกำหนดไว้จนกว่าจะถึงช่วงหลังของการฝึกอบรม และไม่น่าจะมีคุณภาพเท่ากับบริเวณภายในของใบหน้า

จากการศึกษาก่อนหน้านี้ เราจะเห็นภาพที่แสดง ‘แผนที่ความสำคัญ’ ของใบหน้า Source: https://arxiv.org/pdf/2203.01318.pdf
โดยปกติแล้ว สิ่งนี้ไม่สำคัญ เนื่องจากเรามีแนวโน้มที่จะให้ความสำคัญกับดวงตาก่อน และจัดลำดับความสำคัญ ‘ออกไป’ ในระดับที่ลดลง ซึ่งหมายความว่าเราน่าจะไม่ถูกขัดขวางโดยการลดลงของคุณภาพในบริเวณนอกของใบหน้า – โดยเฉพาะอย่างยิ่งหากเรากำลังพูดกับบุคคลที่กำลังปลอมตัวเป็นอีกคนหนึ่ง ซึ่งจะทำให้เกิดความเข้าใจผิดและข้อจำกัดในการประมวลผลที่ไม่มีอยู่เมื่อเราวิเคราะห์วิดีโอ Deepfakes ที่ถูกสร้างขึ้น
อย่างไรก็ตาม การขาดรายละเอียดหรือความแม่นยำในบริเวณนอกของใบหน้าปลอมสามารถตรวจจับได้ด้วยอัลกอริทึม ในเดือนมีนาคม ระบบที่ใช้ข้อมูลจากบริเวณนอกของใบหน้าได้รับการประกาศแล้ว อย่างไรก็ตาม ระบบนี้ต้องการข้อมูลการฝึกอบรมที่มากกว่าปกติ และมีไว้สำหรับคนดังที่มีแนวโน้มที่จะปรากฏในฐานข้อมูลใบหน้า เช่น ImageNet
แทนระบบใหม่นี้ที่เรียกว่า DepthFake สามารถทำงานได้ดีบนใบหน้าที่ไม่ค่อยมีคนรู้จัก โดยการแยกความแตกต่างระหว่างคุณภาพของแผนที่ความลึกที่ประมาณการได้จากวิดีโอจริงและวิดีโอปลอม
การฝึกอบรมลึก
ข้อมูลแผนที่ความลึกมีการเพิ่มขึ้นเรื่อยๆ ในสมาร์ทโฟน รวมถึงการนำไปใช้ การนำไปใช้แบบสเตอริโอ ที่มีประโยชน์มากสำหรับการศึกษาด้านการมองเห็นของคอมพิวเตอร์ ในการศึกษานี้ ผู้เขียนได้ใช้โมเดล FaceDepth ของ National University of Ireland ซึ่งเป็นเครือข่ายที่สามารถประมาณการแผนที่ความลึกจากภาพเดี่ยวได้อย่างมีประสิทธิภาพ
ต่อไป ระบบจะถอดรูปภาพใบหน้าจากภาพต้นฉบับและแผนที่ความลึกที่ได้รับ โดยการทำเช่นนี้จะช่วยให้สามารถคัดลอกเนื้อหาที่สำคัญได้โดยไม่ต้องเปลี่ยนขนาด ซึ่งสำคัญมาก เนื่องจากการเปลี่ยนขนาดโดยใช้อัลกอริทึมมาตรฐานจะส่งผลเสียต่อคุณภาพของบริเวณที่มุ่งเน้น
โดยใช้ข้อมูลนี้จากทั้งแหล่งที่มาของภาพจริงและภาพปลอม ผู้เขียนได้ฝึกอบรมเครือข่ายประสาทเทียมที่สามารถแยกความแตกต่างระหว่างภาพจริงและภาพปลอมได้โดยอาศัยความแตกต่างในคุณภาพของแผนที่ความลึก
โมเดล FaceDepth ได้รับการฝึกอบรมบนข้อมูลที่มีรายละเอียดและข้อมูลสังเคราะห์โดยใช้ฟังก์ชันไฮบริดที่ให้รายละเอียดมากกว่าในบริเวณนอกของใบหน้า ทำให้เหมาะสมสำหรับ DepthFake มันใช้ MobileNet เป็นตัวแยกคุณลักษณะ และได้รับการฝึกอบรมด้วยภาพขนาด 480×640 และผลลัพธ์แผนที่ความลึกขนาด 240×320
แผนที่ความลึกถูกฝังลงในภาพต้นฉบับโดยอัตโนมัติเพื่อให้ได้ภาพ RGBD ที่มีข้อมูลความลึก ซึ่งเป็นภาพที่กล้องสมาร์ทโฟนสมัยใหม่สามารถผลิตได้
การฝึกอบรม
โมเดลได้รับการฝึกอบรมบนเครือข่าย Xception ที่ได้รับการฝึกอบรมล่วงหน้าบน ImageNet แม้ว่าโครงสร้างจะต้องมีการปรับเปลี่ยนเพื่อให้สามารถรองรับข้อมูลความลึกเพิ่มเติมได้
นอกจากนี้ ความแตกต่างในค่าระหว่างข้อมูลความลึกและค่าที่เครือข่ายคาดหวังทำให้ผู้เขียนต้องปรับเทียบค่าให้เท่ากับ 0-255
ระหว่างการฝึกอบรม มีการใช้การพลิกและการหมุนเท่านั้น ในหลายกรณี การเปลี่ยนแปลงด้านภาพอื่นๆ จะถูกนำเสนอให้กับโมเดลเพื่อสร้างการอนุมานที่มีความทนทาน แต่ความจำเป็นในการรักษาความลึกของขอบที่จำกัดและอ่อนไหวในภาพต้นฉบับทำให้ผู้เขียนต้องใช้การลดความซับซ้อน
ระบบได้รับการฝึกอบรมบนภาพสีเทา 2 ช่องสัญญาณเพื่อกำหนดความซับซ้อนที่ต้องการของภาพต้นฉบับเพื่อให้ได้ผลลัพธ์ที่ใช้ได้
การฝึกอบรมเกิดขึ้นผ่าน API ของ TensorFlow บน NVIDIA GTX 1080 โดยมี VRAM 8GB โดยใช้ ADAMAX optimizer ใน 25 ยุค โดยมีขนาดชุดข้อมูล 32 และความละเอียดของภาพถูกตั้งค่าไว้ที่ 224×224 ระหว่างการคัดเลือกและถอดรูปภาพใบหน้าใช้ไลบรารี C++ ของ dlib
ผลลัพธ์
ความแม่นยำของผลลัพธ์ถูกทดสอบกับ Deepfake Face2Face FaceSwap Neural Texture และชุดข้อมูลที่มี RGB และ RGBD โดยใช้ FaceForensic++

ผลลัพธ์ความแม่นยำของวิธีการตรวจจับ Deepfakes 4 วิธี และผลลัพธ์โดยรวมของชุดข้อมูลที่ไม่ถูกแบ่งออกมา
ในกรณีทั้งหมด ช่องความลึกจะช่วยให้โมเดลมีประสิทธิภาพที่ดีขึ้นในทุกการกำหนดค่า Xception ได้ผลลัพธ์ที่ดีที่สุด โดยมี MobileNet ที่มีความสามารถในการทำงานที่ดีใกล้เคียงกัน ในสิ่งนี้ ผู้เขียนได้แสดงความคิดเห็นว่า:
‘[มัน] น่าสนใจที่จะทราบว่า MobileNet มีความสามารถที่ด้อยกว่า Xception และมีประสิทธิภาพมากกว่า ResNet50 เล็กน้อย ซึ่งเป็นผลลัพธ์ที่น่าสนใจเมื่อพิจารณาวัตถุประสงค์ของการลดเวลาในการอนุมานสำหรับการใช้งานแบบเรียลไทม์’
ผู้เขียนยังได้แสดงความได้เปรียบอย่างต่อเนื่องของการเข้าถึง RGBD และ 2 ช่องสัญญาณสีเทาเหนือ RGB และสีเทาโดยตรง โดยสังเกตว่าการแปลงสีเทาของการอนุมานความลึก ซึ่งมีค่าใช้จ่ายในการคำนวณที่ต่ำมาก ช่วยให้โมเดลสามารถให้ผลลัพธ์ที่ดีขึ้นด้วยทรัพยากรที่จำกัดมาก ทำให้สามารถพัฒนาได้ในการตรวจจับ Deepfakes แบบเรียลไทม์โดยใช้ข้อมูลความลึก
เผยแพร่ครั้งแรกเมื่อวันที่ 24 สิงหาคม 2022














