มุมมองของ Anderson

วิธีการสร้าง Deepfake ใบหน้าใหม่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

แม้ว่าจะมีการพูดถึงศักยภาพของภาพ Deepfake ที่จะทำลายความเชื่อมั่นในความถูกต้องของวิดีโอ แต่วิธีการที่ได้รับความนิยมในปัจจุบันยังต้องอาศัยการค้นหา “โฮสต์ใบหน้า” ที่มีลักษณะคล้ายคลึงกับใบหน้าเป้าหมาย

เมื่อภาพต้นฉบับมีใบหน้าที่กว้าง แต่ใบหน้าเป้าหมายมีลักษณะแคบ ผลลัพธ์จะไม่ดีเนื่องจากต้องตัดบางส่วนของใบหน้าเดิมและสร้างพื้นหลังใหม่ วิธีการที่มีอยู่ในปัจจุบัน เช่น DeepFaceLab และ FaceSwap สามารถผลิตผลลัพธ์ที่จำกัดเมื่อการกำหนดค่าถูกกลับด้าน (แคบ > กว้าง) แต่ไม่มีการจัดการกับสถานการณ์นี้อย่างมีประสิทธิภาพ

ทีมนักวิจัยจาก Tencent และมหาวิทยาลัย Xiamen ในจีนได้พัฒนาวิธีการใหม่ ที่เรียกว่า HifiFace เพื่อแก้ไขปัญหานี้

สองภาพ Deepfake ที่สร้างด้วย HifiFace ใบหน้าแรกเป็นของ Anne Hathaway ซึ่งมีลักษณะคล้ายคลึงกับใบหน้าเดิมแม้ว่าจะมีลักษณะที่ไม่เข้ากันก็ตาม

สองภาพ Deepfake ที่สร้างด้วย HifiFace ใบหน้าแรกเป็นของ Anne Hathaway ซึ่งมีลักษณะคล้ายคลึงกับใบหน้าเดิมแม้ว่าจะมีลักษณะที่ไม่เข้ากันก็ตาม Source: https://arxiv.org/pdf/2106.09965.pdf

การสร้างใบหน้า Deepfake ใหม่

วิธีการก่อนหน้านี้ เช่น FSGAN ในปี 2019 ได้พึ่งพา 3DMM fitting (3D Morphable Models) หรือวิธีการอื่นๆ ที่อาศัยการรู้จักใบหน้าหรือการเปลี่ยนแปลง ใบหน้าที่จะถูก “เขียนทับ” จะกำหนดขอบเขตของการเปลี่ยนแปลง

การตรวจจับใบหน้า 3DMM

การตรวจจับใบหน้า 3DMM Source: https://github.com/Yinghao-Li/3DMM-fitting

วิธีการที่แข่งขันกัน ได้ใช้คุณลักษณะที่ได้รับจากเครือข่ายการรู้จักใบหน้า แต่ส่วนใหญ่จะใช้สำหรับการสร้างข้อความใหม่มากกว่าการเปลี่ยนแปลงโครงสร้าง และจะสร้างผลลัพธ์ที่ดูเหมือน “หน้ากาก” ในกรณีที่ใบหน้าโฮสต์ไม่เข้ากันกับใบหน้าเป้าหมาย

เพื่อแก้ไขปัญหานี้ ทีมนักวิจัยจากจีนได้พัฒนาวิธีการใหม่ที่ใช้เครือข่ายแบบ end-to-end ที่ลดค่าสัมประสิทธิ์ของใบหน้าเป้าหมายและใบหน้าเดิมโดยใช้แบบจำลอง 3D การสร้างใหม่ และรวมกับข้อมูลวิดเจ็ตจากเครือข่ายการรู้จักใบหน้า

ข้อมูลทางเรขาคณิตนี้จะถูกส่งเข้าไปในแบบจำลอง encoder-decoder เป็นข้อมูลโครงสร้าง และผสมกับข้อมูลน้ำเสียงและท่าทางของใบหน้าเป้าหมาย ซึ่งจะช่วยให้การถ่ายโอนมีความแม่นยำ

การผสมผสานใบหน้าแบบ Semantic

HifiFace ยังมีคุณลักษณะ Semantic Facial Fusion (SFF) ที่ใช้คุณลักษณะระดับต่ำใน encoder เพื่อรักษาข้อมูลพื้นที่และข้อความ без การเสียสละอัตลักษณ์ของใบหน้าเป้าหมาย คุณลักษณะจาก encoder และ decoder จะถูกผสมเข้ากับหน้ากากแบบ adaptive ที่ได้รับการเรียนรู้ และข้อมูลพื้นหลังจะถูกผสมเข้ากับผลลัพธ์โดยใช้หน้ากากใบหน้าที่ได้รับการเรียนรู้

HifiFace ในการทำงาน

HifiFace ในการทำงาน Source: https://johann.wang/HifiFace/

ด้วยวิธีนี้ HifiFace จะไม่พึ่งพาเส้นขอบของใบหน้าเดิมเป็นขอบเขตที่แน่นอน แต่จะใช้การแบ่งส่วนใบหน้าแบบ dilated เพื่อให้สามารถผสมผสานข้อมูลได้ดีขึ้น

สองวิธีการก่อนหน้า (ด้านบนและด้านล่างซ้าย) และสถาปัตยกรรม HifiFace ใหม่ ซึ่งประกอบด้วย encoder, decoder, 3D shape-aware identity extractor และ SFF module

สองวิธีการก่อนหน้า (ด้านบนและด้านล่างซ้าย) และสถาปัตยกรรม HifiFace ใหม่ ซึ่งประกอบด้วย encoder, decoder, 3D shape-aware identity extractor และ SFF module

เมื่อเปรียบเทียบกับวิธีการก่อนหน้า เช่น FSGAN, SimSwap และ FaceShifter HifiFace แสดงให้เห็นถึงการสร้างใบหน้าที่ดีกว่า เนื่องจากไม่ได้สร้าง “ส่วนโฮสต์” ที่ไม่เข้ากันกับใบหน้าเป้าหมาย แต่จะสร้างใบหน้าใหม่ที่มีลักษณะคล้ายคลึงกับใบหน้าเดิม

การทดสอบ

ทีมนักวิจัยได้ใช้ระบบโดยใช้ VGGFace2 และ DeepGlint Asian-Celeb datasets ใบหน้าจะถูกจัดตำแหน่งโดยใช้ 5 จุดランド์มาร์กและตัดออกเป็น 256×256 พิกเซล เครือข่ายการเพิ่มคุณภาพภาพยังถูกใช้เพื่อสร้างภาพขนาด 512×512 พิกเซล สำหรับแบบจำลองที่มีความละเอียดสูงกว่า โมเดลจะถูกฝึกโดยใช้ Adam

แม้ว่า FaceShifter จะรักษาอัตลักษณ์ได้ดี แต่ก็ไม่สามารถจัดการกับปัญหาเช่น น้ำเสียง สี และการบดบังได้ดีเท่ากับ HifiFace และมีโครงสร้างเครือข่ายที่ซับซ้อนกว่า FSGAN มีปัญหาในการถ่ายโอนแสงจากใบหน้าเดิมไปยังใบหน้าเป้าหมาย

ทีมนักวิจัยได้ใช้ FaceForensics++ สำหรับการเปรียบเทียบเชิงปริมาณ โดยการ取ตัวอย่าง 10 เฟรมจากวิดีโอที่ถูกแปลงโดยวิธีการที่แข่งขันกัน และพบว่า HifiFace มีคะแนน ID ที่ดีกว่า ในการทดสอบปัจจัยอื่นๆ เช่น คุณภาพภาพ ทีมนักวิจัยพบว่าวิธีการของตนเองมีประสิทธิภาพมากกว่าวิธีการที่แข่งขันกัน

ใบหน้าของ Benedict Cumberbatch ถูกสร้างขึ้นใหม่ด้วยความแม่นยำ

ใบหน้าของ Benedict Cumberbatch ถูกสร้างขึ้นใหม่ด้วยความแม่นยำ

งานนี้แสดงถึงขั้นตอนต่อไปในการสร้างใบหน้า Deepfake ที่มีลักษณะคล้ายคลึงกับใบหน้าเดิม โดยที่วัสดุเดิมจะถูกใช้เป็นเพียงแบบจำลองที่จะถูกถ่ายโอนเข้าไปในใบหน้าเป้าหมาย

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai