มุมมองของ Anderson

การตรวจจับวิดีโอคอล Deepfake ผ่านการฉายแสงจอแสดงผล

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การทำงานร่วมกันใหม่ระหว่างนักวิจัยจาก National Security Agency (NSA) ของสหรัฐอเมริกาและมหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ เสนอวิธีการตรวจจับเนื้อห Deepfake ในสภาพแวดล้อมวิดีโอแบบเรียลไทม์ – โดยการสังเกตผลกระทบของแสงจอแสดงผลต่อการปรากฏตัวของบุคคลที่ปลายทางของวิดีโอคอล

ผู้ใช้ DeepFaceLive ที่ได้รับความนิยม Druuzil Tech & Games ทดสอบ Christian Bale DeepFaceLab model ของเขาเองในเซสชันแบบเรียลไทม์กับผู้ติดตามของเขา ในขณะที่แหล่งกำเนิดแสงเปลี่ยนแปลง

ผู้ใช้ DeepFaceLive ที่ได้รับความนิยม Druuzil Tech & Games ทดสอบ Christian Bale DeepFaceLab model ของเขาเองในเซสชันแบบเรียลไทม์กับผู้ติดตามของเขา ในขณะที่แหล่งกำเนิดแสงเปลี่ยนแปลง Source: https://www.youtube.com/watch?v=XPQLDnogLKA

ระบบนี้ทำงานโดยการวางองค์ประกอบกราฟิกบนหน้าจอของผู้ใช้ที่เปลี่ยนช่วงสีแคบๆ ของมันเร็วกว่าที่ระบบ Deepfake ทั่วไปสามารถตอบสนองได้ – แม้ว่าจะมีความสามารถในการรักษาการถ่ายโอนสีแบบเรียลไทม์และการปรับเปลี่ยนแสงโดยรอบ

ภาพสีสม่ำเสมอแสดงบนจอของบุคคลที่ปลายทาง (เช่น ผู้ฉ้อโกง Deepfake ที่อาจเกิดขึ้น) จะวนซ้ำผ่านการเปลี่ยนแปลงของสีที่ออกแบบมาเพื่อไม่กระตุ้นการปรับสมดุลสีขาวอัตโนมัติของเว็บแคมและระบบการชดเชยแสงอื่นๆ ซึ่งจะบ่อนทำลายวิธีการนี้

จากเอกสารวิจัย แสดงการเปลี่ยนแปลงของสภาพแวดล้อมแสงจากจอแสดงผลหน้าผู้ใช้ ซึ่งทำงานเหมือน 'แสงพื้นที่' ที่กระจาย

จากเอกสารวิจัย แสดงการเปลี่ยนแปลงของสภาพแวดล้อมแสงจากจอแสดงผลหน้าผู้ใช้ ซึ่งทำงานเหมือน ‘แสงพื้นที่’ ที่กระจาย Source: https://farid.berkeley.edu/downloads/publications/cvpr22a.pdf

ทฤษฎีเบื้องหลังแนวทางนี้คือระบบ Deepfake แบบเรียลไทม์ไม่สามารถตอบสนองต่อการเปลี่ยนแปลงที่แสดงในกราฟิกบนจอได้ทันเวลา ซึ่งเพิ่ม ‘ความล่าช้า’ ของผลกระทบ Deepfake ที่บางส่วนของสเปกตรัมสี ทำให้สามารถตรวจจับได้

เพื่อสามารถวัดแสงสะท้อนจากจอแสดงผลได้อย่างแม่นยำ ระบบจำเป็นต้องคำนึงถึงและลบผลกระทบของแสงโดยรอบที่ไม่เกี่ยวข้องกับแสงจากจอแสดงผล

โดยการจำกัดการเปลี่ยนแปลงสีในกราฟิก 'ตัวตรวจจับ' บนจอ และรับประกันว่าเว็บแคมของผู้ใช้ไม่ได้รับการกระตุ้นให้ปรับแต่งการตั้งค่าการบันทึกอัตโนมัติโดยการเปลี่ยนแปลงแสงจอแสดงผลมากเกินไป นักวิจัยสามารถแยกความล่าช้าในระบบ Deepfake ที่จะปรับเปลี่ยนการเปลี่ยนแปลงแสงได้

โดยการจำกัดการเปลี่ยนแปลงสีในกราฟิก ‘ตัวตรวจจับ’ บนจอ และรับประกันว่าเว็บแคมของผู้ใช้ไม่ได้รับการกระตุ้นให้ปรับแต่งการตั้งค่าการบันทึกอัตโนมัติโดยการเปลี่ยนแปลงแสงจอแสดงผลมากเกินไป นักวิจัยสามารถแยกความล่าช้าในระบบ Deepfake ที่จะปรับเปลี่ยนการเปลี่ยนแปลงแสงได้

เอกสารวิจัยสรุปว่า:

‘เนื่องจากความไว้วางใจที่สมเหตุสมผลที่เราให้กับการโทรวิดีโอแบบเรียลไทม์ และความแพร่หลายที่เพิ่มขึ้นของการโทรวิดีโอในชีวิตส่วนตัวและอาชีพของเรา เราเสนอแนะว่าเทคนิคในการตรวจสอบความถูกต้องของวิดีโอ (และเสียง) จะมีความสำคัญมากขึ้น’

เอกสารวิจัยนี้มีชื่อเรื่องว่า การตรวจจับวิดีโอ Deepfake แบบเรียลไทม์โดยใช้แสงจอแสดงผล และมาจาก Candice R. Gerstner นักคณิตศาสตร์เชิงใช้งานที่กระทรวงกลาโหมสหรัฐฯ และ Professor Hany Farid จากมหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์

การกัดเซาะความไว้วางใจ

สภาพแวดล้อมการวิจัยต่อต้าน Deepfake ได้เปลี่ยนไปอย่างมากในช่วง 6 เดือนที่ผ่านมา จากการตรวจจับ Deepfake ทั่วไป (เช่น การกำหนดเป้าหมายวิดีโอที่บันทึกไว้และเนื้อหาที่ไม่เหมาะสม) ไปสู่การตรวจจับ ‘ความเป็นจริง’ ในการตอบสนองต่อการเพิ่มขึ้นของเหตุการณ์การใช้ Deepfake ในการโทรวิดีโอ และการเตือนล่าสุดของ FBI เกี่ยวกับการใช้เทคโนโลยีเหล่านี้ในงานระยะไกล

แม้ว่าการโทรวิดีโอมิได้ถูก Deepfake แต่โอกาสที่เพิ่มขึ้นสำหรับคนปลอมตัววิดีโอขับเคลื่อนด้วย AI ก็เริ่มสร้างความหวาดกลัว

เอกสารวิจัยใหม่ระบุว่า:

‘การสร้าง Deepfake แบบเรียลไทม์ [นำเสนอ] ความเสี่ยงที่ไม่เหมือนใครเนื่องจากความรู้สึกทั่วไปของความไว้วางใจที่มีต่อการโทรวิดีโอหรือโทรศัพท์แบบเรียลไทม์ และความท้าทายในการตรวจจับ Deepfake ในแบบเรียลไทม์ ในขณะที่การโทรกำลังดำเนินอยู่’

ชุมชนการวิจัยได้ตั้งเป้าหมายในการค้นหาสัญญาณที่ไม่สามารถหลีกเลี่ยงได้ของเนื้อห Deepfake ที่ไม่สามารถชดเชยได้ง่ายๆ มาเป็นเวลานานแล้ว แม้ว่าสื่อจะอธิบายสิ่งนี้ในแง่ของสงครามเทคโนโลยีระหว่างนักวิจัยด้านความปลอดภัยและนักพัฒนา Deepfake แต่การปฏิเสธแนวทางต่างๆ ในช่วงแรก (เช่น การวิเคราะห์การกระพริบตา การแยกแยะท่าทางของศีรษะ และการวิเคราะห์พฤติกรรม) เกิดขึ้นเพียงเพราะผู้พัฒนาและผู้ใช้พยายามสร้าง Deepfake ที่สมจริงมากขึ้นโดยทั่วไป ไม่ใช่เพื่อตอบสนองต่อ ‘สัญญาณ’ ล่าสุดที่ระบุโดยชุมชนความปลอดภัย

การโยนแสงบน Deepfake วิดีโอแบบเรียลไทม์

การตรวจจับ Deepfake ในสภาพแวดล้อมวิดีโอแบบเรียลไทม์แบกภาระของการคำนึงถึงการเชื่อมต่อวิดีโอที่ไม่ดี ซึ่งพบได้ทั่วไปในสถานการณ์วิดีโอการประชุม แม้ว่าจะไม่มีระดับ Deepfake ระหว่างการเชื่อมต่อ วิดีโอก็อาจได้รับผลกระทบจากความล่าช้าแบบ NASA การแสดงภาพที่ไม่สมบูรณ์ และการเสื่อมสภาพอื่นๆ ของเสียงและวิดีโอ ซึ่งสามารถซ่อนขอบเขตที่ไม่เรียบของ Deepfake ได้ ทั้งในแง่ของวิดีโอและเสียง

ระบบใหม่ของนักวิจัยนี้ดีขึ้นกว่าผลลัพธ์และวิธีการที่นำเสนอใน การเผยแพร่ในปี 2020 จากศูนย์คอมพิวเตอร์เครือข่ายที่มหาวิทยาลัยเทมเพิลในฟิลาเดลเฟีย

จากเอกสารวิจัยในปี 2020 เราสามารถสังเกตการเปลี่ยนแปลงของการฉายแสงบนใบหน้าเมื่อเนื้อหาของหน้าจอของผู้ใช้เปลี่ยนแปลง

จากเอกสารวิจัยในปี 2020 เราสามารถสังเกตการเปลี่ยนแปลงของการฉายแสงบนใบหน้าเมื่อเนื้อหาของหน้าจอของผู้ใช้เปลี่ยนแปลง Source: https://cis.temple.edu/~jiewu/research/publications/Publication_files/FakeFace__ICDCS_2020.pdf

ความแตกต่างในงานใหม่นี้คือการคำนึงถึงวิธีการตอบสนองของเว็บแคมต่อการเปลี่ยนแปลงแสง นักวิจัยอธิบายว่า:

‘เนื่องจากเว็บแคมทั้งหมดทำงานแบบอัตโนมัติ การฉายแสงจอแสดงผลที่มีความเข้มสูง [ที่ใช้ในงานก่อนหน้า] มีแนวโน้มที่จะกระตุ้นการปรับสมดุลสีขาวอัตโนมัติของกล้องซึ่งจะบ่อนทำลายการปรากฏตัวของใบหน้าที่บันทึกไว้’

‘เพื่อหลีกเลี่ยงสิ่งนี้ เราใช้การฉายแสงจอแสดงผลที่เปลี่ยนแปลงสีเท่ากัน ซึ่งหลีกเลี่ยงการปรับสมดุลสีขาวอัตโนมัติของกล้อง’

สำหรับโครงการริเริ่มนี้ นักวิจัยยังพิจารณาแนวทางที่คล้ายกัน เช่น LiveScreen ซึ่งบังคับให้มีรูปแบบแสงไม่เห็นได้บนจอแสดงผลของผู้ใช้เพื่อเปิดเผยเนื้อห Deepfake

แม้ว่าระบบนั้นจะได้ผลลัพธ์ความแม่นยำถึง 94.8% แต่นักวิจัยสรุปว่าความอ่อนไหวของรูปแบบแสงจะทำให้การนำไปใช้ในสภาพแวดล้อมที่มีแสงสว่างมากยาก และแทนที่จะเสนอแนะว่าระบบของตนเองหรือระบบที่คล้ายกันสามารถรวมเข้ากับซอฟต์แวร์วิดีโอการประชุมได้โดยตรง:

‘การแทรกแซงที่เราเสนอแนะอาจเกิดขึ้นได้โดยผู้เข้าร่วมการโทรที่แบ่งปันหน้าจอและแสดงรูปแบบที่เปลี่ยนแปลงตามเวลา หรือในอุดมคติ อาจรวมเข้ากับซอฟต์แวร์วิดีโอการประชุมได้โดยตรง’

การทดสอบ

นักวิจัยใช้การผสมผสานระหว่างวัตถุจำลองและวัตถุจริงเพื่อทดสอบตัวตรวจจับ Deepfake ที่ขับเคลื่อนด้วย Dlib สำหรับสถานการณ์จำลอง นักวิจัยใช้ Mitsuba ซึ่งเป็นตัวให้แสงและตัวเรนเดอร์แบบกลับด้านจากสถาบันเทคโนโลยีแห่งสหพันธรัฐสวิสแห่งลอสาน

ตัวอย่างจากชุดข้อมูลจำลอง โดยมีการเปลี่ยนแปลงสีของผิว ตamanho ของแหล่งกำเนิดแสง ความเข้มของแสงโดยรอบ และระยะห่างจากกล้อง

ตัวอย่างจากการทดสอบสภาพแวดล้อมจำลอง โดยมีการเปลี่ยนแปลงสีของผิว ขนาดของแหล่งกำเนิดแสง ความเข้มของแสงโดยรอบ และระยะห่างจากกล้อง

ฉากที่แสดงรวมถึงหัว CGI ที่จับภาพจากกล้องเสมือนจริงที่มีมุมมอง 90 องศา หัวเหล่านี้มีการสะท้อนแสง Lambertian และสีผิวที่เป็นกลาง และตั้งอยู่ห่างจากกล้องเสมือนจริง 2 ฟุต

เพื่อทดสอบเฟรมเวิร์กข้ามชุดการกำหนดค่าที่เป็นไปได้หลายแบบ นักวิจัยได้ดำเนินการทดสอบหลายครั้ง โดยเปลี่ยนแปลงแง่มุมต่างๆ ลำดับ ซึ่งรวมถึงสีผิว ระยะห่าง และขนาดของแหล่งกำเนิดแสง

นักวิจัยอธิบายว่า:

‘ในการจำลอง โดยสมมติฐานต่างๆ ของเราที่ได้รับการตอบสนอง เทคนิคที่เราเสนอแนะมีความทนทานสูงต่อการกำหนดค่าภาพที่หลากหลาย’

สำหรับสถานการณ์จริง นักวิจัยใช้志อาสาสมัคร 15 คน โดยมีสีผิวที่หลากหลาย ในสภาพแวดล้อมที่แตกต่างกัน แต่ละคนได้รับการทดสอบสองครั้งด้วยการเปลี่ยนแปลงสีแบบจำกัดภายใต้สภาพที่อัตราการอัปเดตหน้าจอ 30Hz ถูกสynchronizes กับเว็บแคม ซึ่งหมายความว่าการฉายแสงจอแสดงผลจะมีระยะเวลาสูงสุด 1 วินาที ผลลัพธ์โดยรวมคล้ายกับการทดสอบแบบจำลอง แม้ว่าความสัมพันธ์จะเพิ่มขึ้นอย่างมีนัยสำคัญเมื่อค่าความสว่างเพิ่มขึ้น

ทิศทางในอนาคต

ระบบนี้ยังไม่คำนึงถึงการปิดบังใบหน้าทั่วไป เช่น ผมหน้า กางเกง หรือหนวด แต่นักวิจัยชี้ว่าสามารถเพิ่มการปิดบังได้ในระบบที่จะตามมา (ผ่านการระบุฉลากและการแบ่งส่วนเชิงความหมาย) ซึ่งสามารถฝึกให้ใช้ค่าจากพื้นที่ผิวที่รับรู้ได้จากวัตถุเป้าหมาย

นักวิจัยยังแนะนำว่าแนวทางที่คล้ายกันสามารถใช้ในการตรวจจับเสียง Deepfake และเสียงที่จำเป็นในการตรวจจับสามารถเล่นในความถี่ที่อยู่นอกช่วงการได้ยินของมนุษย์

นักวิจัยชี้ว่า:

‘การประมาณค่าแสง 3 มิติที่ซับซ้อนกว่านี้จะให้โมเดลการปรากฏตัวที่มีความ豊富มากขึ้น ซึ่งจะยากต่อการหลีกเลี่ยงสำหรับผู้ปลอมตัวมากขึ้น ในขณะที่เรามุ่งเน้นไปที่ใบหน้าเท่านั้น จอแสดงผลคอมพิวเตอร์ยังฉายแสงไปที่คอ ส่วนบนของร่างกาย และพื้นหลังโดยรอบ ซึ่งสามารถวัดได้เช่นกัน’

‘การวัดเพิ่มเติมเหล่านี้จะบังคับให้ผู้ปลอมตัวพิจารณาสถานการณ์ 3 มิติทั้งหมด ไม่ใช่แค่ใบหน้า’

* การแปลงอ้างอิงแบบแทรกของฉันให้เป็นลิงก์

เผยแพร่ครั้งแรกเมื่อวันที่ 6 กรกฎาคม 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai