มุมมองของ Anderson

ตรวจจับ Deepfake ใหม่: โมเดล Latent Diffusion และ GANs

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ความคิดเห็น  

เมื่อเร็วๆ นี้ ชุมชนการวิจัยการตรวจจับ Deepfake ซึ่งได้ให้ความสนใจกับโครงสร้างแบบ autoencoder มาตั้งแต่ปลายปี 2017 ได้เริ่มให้ความสนใจกับโครงสร้างที่นิ่งน้อยลง รวมถึง โมเดล Latent Diffusion เช่น DALL-E 2 และ Stable Diffusion รวมถึงผลลัพธ์ของ Generative Adversarial Networks (GANs) เช่นกัน ตัวอย่างเช่น ในเดือนมิถุนายน มหาวิทยาลัยแคลิฟอร์เนีย เบิร์กลีย์ เผยแพร่ผลการวิจัย เกี่ยวกับการพัฒนาระบบตรวจจับสำหรับผลลัพธ์ของ DALL-E 2 ซึ่งเป็นโมเดลที่มีประสิทธิภาพสูงสุดในขณะนั้น

สิ่งที่ดูเหมือนจะขับเคลื่อนความสนใจที่เพิ่มขึ้นนี้คือการกระโดดวิวัฒนาการที่突然ในความสามารถและความพร้อมใช้งานของโมเดล Latent Diffusion ในปี 2022 โดยมีการเปิดตัว DALL-E 2 ในฤดูใบไม้ผลิ ซึ่งเป็นโมเดลที่มีการเข้าถึงจำกัด และต่อมาในฤดูร้อน มีการเปิดตัว Stable Diffusion โดย stability.ai ซึ่งเป็นโมเดลที่มีการเข้าถึงสาธารณะ

GANs ก็ได้รับการศึกษาอย่างกว้างขวางในบริบทนี้เช่นกัน แม้ว่าจะไม่ได้รับการศึกษากันมากนัก เนื่องจากเป็นเรื่องที่ยากมากที่จะใช้ GANs ในการสร้างวิดีโอที่มีคุณภาพสูงและสมจริง โดยเฉพาะอย่างยิ่งเมื่อเทียบกับแพ็คเกจ autoencoder ที่มีประสิทธิภาพสูง เช่น FaceSwap และ DeepFaceLab รวมถึง DeepFaceLive ซึ่งเป็นแพ็คเกจที่สามารถสตรีมวิดีโอ Deepfake ได้แบบเรียลไทม์

ภาพเคลื่อนไหว

ในกรณีใดๆ ปัจจัยที่กระตุ้นให้เกิดความสนใจนี้ดูเหมือนจะเป็นความเป็นไปได้ของการวิ่งพัฒนาสำหรับ วิดีโอ สังเคราะห์ การเริ่มต้นของเดือนตุลาคม ซึ่งเป็นช่วงฤดูการประชุมใหญ่ของปี 2022 ได้เห็นการเปิดตัวของโซลูชันใหม่ๆ ที่ไม่คาดคิดสำหรับปัญหาการสังเคราะห์วิดีโอที่ยังไม่ได้รับการแก้ไข เช่น การเปิดตัวแพลตฟอร์ม text-to-video ของ Facebook และการประกาศของ Google Research เกี่ยวกับโครงสร้าง Imagen-to-Video T2V ซึ่งสามารถสร้างวิดีโอความละเอียดสูงได้

หากคุณเชื่อว่าสิ่งนี้มาในสามครั้ง ให้พิจารณา stability.ai ที่สัญญาว่า “วิดีโอจะมา” ใน Stable Diffusion ซึ่งดูเหมือนจะเป็นช่วงปลายปีนี้ ในขณะที่ Runway ซึ่งเป็นผู้พัฒนา Stable Diffusion ร่วมกับ stability.ai ก็ได้สัญญาเช่นเดียวกัน แม้ว่าจะไม่ชัดเจนว่าพวกเขากำลังอ้างถึงระบบเดียวกันหรือไม่

สิ่งที่ดูเหมือนจะเป็นจุดเริ่มต้นของการเปลี่ยนแปลงนี้คือการเปิดตัวของเฟรมเวิร์กการสร้างเสียงใหม่ๆ (บางส่วนใช้ Latent Diffusion) และโมเดลการกระจายที่สามารถสร้างการเคลื่อนไหวของตัวละครได้อย่างสมจริง

Blade Runner

สองบทความล่าสุดที่กล่าวถึงการตรวจจับ Deepfake โดยใช้ Latent Diffusion และ GANs คือ DE-FAKE: การตรวจจับและ归属ของภาพปลอมที่สร้างโดยโมเดลการกระจายข้อความถึงภาพ ซึ่งเป็นความร่วมมือระหว่าง CISPA Helmholtz Center for Information Security และ Salesforce และ BLADERUNNER: การต่อต้านการสร้างภาพปลอมโดยใช้ StyleGAN จาก Adam Dorian Wong ที่ MIT’s Lincoln Laboratory

ก่อนที่จะอธิบายวิธีการใหม่ บทความหลังได้ใช้เวลาในการตรวจสอบวิธีการก่อนหน้านี้ในการกำหนดว่าภาพถูกสร้างโดย GAN หรือไม่

วิธีการ “Brady Bunch” ระบุเนื้อหาที่ถูกสร้างโดย GAN โดยพิจารณาจากตำแหน่งที่แน่นอนของส่วนต่างๆ ของใบหน้า ซึ่งเป็นผลมาจากการผลิตที่ซ้ำซากและเป็นแบบแผน

วิธีการอื่นๆ ที่รู้จักกันคือการตรวจสอบการวางตำแหน่งของดวงตาในภาพ ซึ่งเป็นคุณลักษณะที่พบได้บ่อยในผลลัพธ์ของ StyleGAN

โครงสร้างที่เสนอในบทความใหม่นี้มีชื่อว่า Blade Runner ซึ่งอ้างอิงถึงการตรวจสอบ Voight-Kampff ในชุดภาพยนตร์ sci-fi

ระบบประกอบด้วยสองขั้นตอน ขั้นตอนแรกคือ PapersPlease analyzer ซึ่งสามารถประเมินข้อมูลที่เก็บจากเว็บไซต์ที่สร้างใบหน้าโดย GAN เช่น thispersondoesnotexist.com หรือ generated.photos

ขั้นตอนที่สองคือ AmongUs detector ซึ่งออกแบบมาเพื่อค้นหาการวางตำแหน่งของดวงตาที่สอดคล้องกันในภาพ

DE-FAKE

โครงสร้าง DE-FAKE มีเป้าหมายที่จะบรรลุการตรวจจับ “สากล” สำหรับภาพที่สร้างโดยโมเดลการกระจายข้อความถึงภาพ และเพื่อให้วิธีการในการระบุ โมเดลการกระจายที่สร้างภาพ

เพื่อความจริงแล้ว ในขณะนี้ สิ่งนี้เป็นงานที่ง่ายเนื่องจากโมเดล Latent Diffusion ที่ได้รับความนิยมทั้งหมดมีลักษณะที่แตกต่างกัน

นอกจากนี้ โมเดลเหล่านี้ยังมีความอ่อนแอทางร่วม เช่น การตัดหัว เนื่องจากวิธีการที่ไม่สม่ำเสมอในการนำภาพที่ไม่ใช่สี่เหลี่ยมเข้ามาในฐานข้อมูลขนาดใหญ่ที่ใช้ในการฝึกอบรมระบบ เช่น DALL-E 2, Stable Diffusion และ MidJourney

DE-FAKE ใช้ไลบรารี Contrastive Language-Image Pretraining (CLIP) ของ OpenAI เพื่อแยกเอาเนื้อหาออกจากภาพที่ถูกสร้างโดยโมเดล Latent Diffusion และฝึกตัวจำแนกบนรูปแบบและชั้นที่สังเกตได้

ในสถานการณ์ที่ “กล่องดำ” มากขึ้น โดยที่ชิ้นส่วนที่ถูกตัดออกจากกระบวนการสร้างภาพไม่สามารถเข้าถึงได้ นักวิจัยใช้เฟรมเวิร์ก BLIP ของ Salesforce เพื่อ “สุ่ม” หาโครงสร้างเชิงความหมายของคำสั่งที่สร้างภาพ

ผลลัพธ์ของทีมนักวิจัยเป็นไปในเชิงบวกอย่างมาก เนื่องจากไม่มีงานวิจัยก่อนหน้านี้ที่จะเทียบเคียงได้ และเนื่องจากสาขาการสังเคราะห์ภาพยังคงอยู่ในขั้นตอนเริ่มต้น

ในขณะเดียวกัน Stability.ai ได้แสดงถึงความมุ่งมั่นที่จะพัฒนา Stable Diffusion ต่อไป และมีแผนการสำหรับเวอร์ชัน 2 และ 3 ของระบบ

ดังนั้น จึงมีแนวโน้มว่าโลกของการตรวจจับ Deepfake จะมีการเปลี่ยนแปลงอย่างรวดเร็วในอนาคต

เหตุการณ์สำคัญในช่วงสามเดือนที่ผ่านมา ทำให้ไม่มีการนอนหลับของบริษัทที่แข่งขันกันในพื้นที่สังเคราะห์ภาพ และมีแนวโน้มที่จะเห็นการพัฒนาที่รวดเร็วในพื้นที่นี้

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: [email protected]