มุมมองของ Anderson

วิธีการสร้าง Deepfake ที่ง่ายและดีกว่าวิธีการเดิม

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การทำงานร่วมกันระหว่างกลุ่มวิจัย AI ของจีนและนักวิจัยจากสหรัฐฯ ได้พัฒนาวิธีการสร้าง Deepfake ที่อาจเป็นการพัฒนาที่แท้จริงในเทคโนโลยี Deepfake นับตั้งแต่ปรากฏการณ์นี้เกิดขึ้นเมื่อ 4 ปีที่แล้ว

วิธีการใหม่นี้สามารถทำการ faceswap ที่เหนือกว่าวิธีการอื่นๆ ที่มีอยู่ในขณะนี้โดยไม่ต้องรวบรวมและจัดระเบียบข้อมูลขนาดใหญ่และฝึกฝนข้อมูลเหล่านั้นเป็นเวลาหนึ่งสัปดาห์สำหรับอัตลักษณ์เดียว สำหรับตัวอย่างที่นำเสนอในเอกสารใหม่ โมเดลเหล่านี้ได้รับการฝึกฝนบนเซตข้อมูลของดารา 2 ชุดยอดนิยมบน GPU NVIDIA Tesla P40 เพียง 3 วัน

วิดีโอทั้งหมดอยู่ที่ส่วนล่างของบทความนี้ ในตัวอย่างนี้จากวิดีโอในเอกสารเสริมสำหรับเอกสารใหม่ ใบหน้าของ Scarlett Johansson ถูกถ่ายโอนไปยังวิดีโอที่เป็นแหล่งที่มา CihaNet ลดปัญหาของการสร้างขอบเขตเมื่อทำการ faceswap โดยการสร้างและดำเนินการตามความสัมพันธ์ที่ลึกซึ้งยิ่งขึ้นระหว่างอัตลักษณ์ที่เป็นแหล่งที่มาและเป้าหมาย ซึ่งหมายถึงการสิ้นสุดของ 'ขอบเขตที่ชัดเจน' และข้อผิดพลาดอื่นๆ ที่เกิดขึ้นในแนวทาง Deepfake truyền thống Source: https://mitchellx.github.io/#video

วิดีโอทั้งหมดอยู่ที่ส่วนล่างของบทความนี้ ในตัวอย่างนี้จากวิดีโอในเอกสารเสริมที่จัดทำโดยหนึ่งในผู้เขียนเอกสารใหม่ ใบหน้าของ Scarlett Johansson ถูกถ่ายโอนไปยังวิดีโอที่เป็นแหล่งที่มา CihaNet ลดปัญหาของการสร้างขอบเขตเมื่อทำการ faceswap โดยการสร้างและดำเนินการตามความสัมพันธ์ที่ลึกซึ้งยิ่งขึ้นระหว่างอัตลักษณ์ที่เป็นแหล่งที่มาและเป้าหมาย ซึ่งหมายถึงการสิ้นสุดของ ‘ขอบเขตที่ชัดเจน’ และข้อผิดพลาดอื่นๆ ที่เกิดขึ้นในแนวทาง Deepfake truyền thống Source: Source: https://mitchellx.github.io/#video

แนวทางใหม่นี้ลบการจำเป็นในการ ‘วาง’ อัตลักษณ์ที่ถ่ายโอนอย่างหยาบคายเข้าไปในวิดีโอที่เป็นเป้าหมาย ซึ่งบ่อยครั้งนำไปสู่การเกิด อาร์ติแฟคต์ ที่ปรากฏที่จุดสิ้นสุดของใบหน้าที่ปลอมและใบหน้าที่แท้จริงที่อยู่ภายใต้ ในทางกลับกัน ‘แผนที่การหลอกลวง’ ถูกใช้เพื่อทำการผสมผสานของลักษณะที่เห็นได้ชัดเจนยิ่งขึ้น เนื่องจากระบบแยกอัตลักษณ์ออกจากบริบทได้ดีกว่าวิธีการปัจจุบัน และดังนั้นจึงสามารถผสมผสานอัตลักษณ์ที่เป็นเป้าหมายได้อย่างลึกซึ้งยิ่งขึ้น

จากเอกสาร CihaNet transformations are facilitated through hallucination maps (bottom row)

จากเอกสาร CihaNet transformations are facilitated through hallucination maps (bottom row) ระบบใช้ข้อมูลบริบท (เช่น ทิศทางของใบหน้า ผม แว่นตาและอุปสรรคอื่นๆ) จากภาพที่จะถูกวางอัตลักษณ์ใหม่ และข้อมูลอัตลักษณ์ใบหน้าจากบุคคลที่จะถูกใส่เข้าไปในภาพ ความสามารถในการแยกใบหน้าออกจากบริบทนี้เป็นสิ่งสำคัญที่สุดในการทำงานของระบบ Source: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257 Source: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

โดยสรุป แผนที่การหลอกลวงใหม่นี้ให้บริบทที่สมบูรณ์ยิ่งขึ้นสำหรับการ faceswap เมื่อเทียบกับแมสค์ที่ยากที่จะใช้และต้องการการดูแลอย่างมาก (และในกรณีของ DeepFaceLab การฝึกอบรมแยกต่างหาก) ในขณะเดียวกันก็มีความยืดหยุ่นในการผสมผสานอัตลักษณ์ที่แท้จริง

จากตัวอย่างที่จัดทำในเอกสารเสริม โดยใช้เซตข้อมูล FFHQ และ Celeb-A HQ ทั้งสองชุด คอลัมน์แรกและคอลัมน์ที่สองแสดงภาพที่ถูกเลือกแบบสุ่ม (จริง) ที่จะถูก faceswap คอลัมน์ที่สามถึงคอลัมน์ที่หกแสดงผลลัพธ์ของ faceswap โดยใช้วิธีการที่มีประสิทธิภาพสูงสุดสี่วิธีที่มีอยู่ในปัจจุบัน ในขณะที่คอลัมน์สุดท้ายแสดงผลลัพธ์จาก CihaNet Source: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip Source: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

ไม่ต้องการความเท่าเทียมกัน ‘หน้าตรง’

ทั้ง DeepFaceLab ซอฟต์แวร์ Deepfake ที่ได้รับความนิยมมากที่สุดในปัจจุบัน และ FaceSwap ซอฟต์แวร์ที่แข่งขันกัน ทำงานผ่านกระบวนการที่ซับซ้อนและต้องทำด้วยมือเพื่อระบุว่าใบหน้ากำลังหันไปทางไหน อุปสรรคที่ต้องคำนึงถึง (อีกครั้งด้วยมือ) และต้องรับมือกับอุปสรรคที่น่ารำคาญอื่นๆ (รวมถึงแสง) ที่ทำให้การใช้งานไม่สะดวก

ในทางกลับกัน CihaNet ไม่ต้องการให้ภาพสองภาพหันหน้าตรงเข้าหากันเพื่อถ่ายโอนและใช้ข้อมูลอัตลักษณ์ที่มีประโยชน์จากภาพเดียว

<img class="size-full wp-image-178605" src="https://www.unite.ai/wp-content/uploads/2021/11/cihanet-angles.jpg" alt="ในตัวอย่างเหล่านี้ ซอฟต์แวร์ Deepfake ที่แข่งขันกันหลายตัวถูกทดสอบด้วยการ faceswap ใบหน้าที่ไม่เพียงแต่ต่างกันในอัตลักษณ์ แต่ยังหันไปในมุมที่ต่างกัน ด้วยซอฟต์แวร์ที่มาจาก仓庫 Deepfakes เดิม (เช่น DeepFaceLab และ FaceSwap ที่แสดงด้านบน) ไม่สามารถจัดการกับความแตกต่างในมุมระหว่างภาพสองภาพที่จะถูก faceswap (ดูคอลัมน์ที่สาม) ในขณะที่ CihaNet สามารถถ่ายโอนอัตลักษณ์ได้อย่างถูกต้อง เนื่องจาก 'ท่า' ของใบหน้าไม่ใช่ส่วนหนึ่งของข้อมูลอัตลักษณ์

สถาปัตยกรรม

โครงการ CihaNet ตามคำกล่าวของผู้เขียน ได้รับแรงบันดาลใจจากความร่วมมือในปี 2019 ระหว่าง Microsoft Research และ Peking University ที่เรียกว่า FaceShifter แต่มีการเปลี่ยนแปลงที่สำคัญบางอย่างในโครงสร้างพื้นฐานของวิธีการเก่า

FaceShifter ใช้เครือข่าย Adaptive Instance Normalization (AdaIN) สองตัวเพื่อจัดการข้อมูลอัตลักษณ์ ซึ่งถูกถ่ายโอนไปยังภาพเป้าหมายผ่านแมสค์ ในลักษณะที่คล้ายกับซอฟต์แวร์ Deepfake ที่ได้รับความนิยมในปัจจุบัน (และข้อจำกัดที่เกี่ยวข้อง) โดยใช้เครือข่าย HEAR-Net (HEAR-Net) ที่มีเครือข่ายย่อยที่ฝึกฝนแยกกันสำหรับการขัดขวาง

แทน CihaNet ใช้ข้อมูล ‘บริบท’ นี้โดยตรงสำหรับการ faceswap ผ่านการดำเนินการ Cascading Adaptive Instance Normalization (C-AdaIN) สองขั้นตอน ซึ่งให้ความสอดคล้องของบริบท (เช่น ใบหน้าและอุปสรรค) ของพื้นที่ที่เกี่ยวข้องกับอัตลักษณ์

เครือข่ายย่อยที่สำคัญที่สุดของระบบคือ Swapping Block (SwapBlk) ซึ่งสร้างคุณลักษณะที่รวมกันจากบริบทของภาพอ้างอิงและ ‘อัตลักษณ์’ ที่ฝังอยู่ในภาพต้นฉบับ โดยไม่ต้องผ่านขั้นตอนที่ซับซ้อนหลายขั้นตอน

เพื่อช่วยแยกความแตกต่างระหว่างบริบทและอัตลักษณ์ จะมีการสร้าง ‘แผนที่การหลอกลวง’ สำหรับแต่ละระดับ ซึ่งทำหน้าที่เป็นแมสค์แบ่งส่วนนุ่มและดำเนินการบนคุณลักษณะที่กว้างขึ้นสำหรับส่วนสำคัญของกระบวนการ faceswap

เมื่อค่าของแผนที่การหลอกลวง (ภาพด้านล่างขวา) เพิ่มขึ้น เส้นทางที่ชัดเจนระหว่างอัตลักษณ์จะปรากฏขึ้น

เมื่อค่าของแผนที่การหลอกลวง (ภาพด้านล่างขวา) เพิ่มขึ้น เส้นทางที่ชัดเจนระหว่างอัตลักษณ์จะปรากฏขึ้น

ข้อมูลและทดสอบ

เพื่อทดสอบระบบ นักวิจัยได้ฝึกฝนโมเดลสี่ตัวบนเซตข้อมูลภาพที่เปิดกว้างและหลากหลายสองชุด คือ CelebA-HQ และ FFHQ ของ NVIDIA ซึ่งมีภาพ 30,000 และ 70,000 ภาพตามลำดับ

ไม่มีการตัดหรือกรองข้อมูลเหล่านี้ ในแต่ละกรณี นักวิจัยได้ฝึกฝนเซตข้อมูลทั้งหมดบน GPU Tesla P40 เดียวเป็นเวลา 3 วัน โดยมีอัตราการเรียนรู้ 0.0002 บน Adam optimization

จากนั้นพวกเขาจึงสร้างการ faceswap แบบสุ่มระหว่างบุคลิกที่มีจำนวนหลายพันในเซตข้อมูล โดยไม่คำนึงถึงว่าใบหน้าเหล่านั้นจะเหมือนกันหรือไม่ และเปรียบเทียบผลลัพธ์ของ CihaNet กับผลลัพธ์จากเฟรมเวิร์ก Deepfake สี่ตัวที่มีประสิทธิภาพสูงสุด

เมื่อเปรียบเทียบผลลัพธ์ผ่าน VGG-Face, FFHQ, CelebA-HQ และ FaceForensics++ ผู้เขียนพบว่าโมเดลใหม่ของพวกเขาทำงานได้ดีกว่าโมเดลก่อนหน้าทั้งหมด

มีการใช้เมตริกสามตัวในการประเมินผลลัพธ์ ได้แก่ Structural Similarity (SSIM), pose estimation error และ ID retrieval accuracy ซึ่งคำนวณจากเปอร์เซ็นต์ของคู่ที่ถูก检索สำเร็จ

นักวิจัยอ้างว่า CihaNet เป็นตัวแทนของแนวทางที่เหนือกว่าในแง่ของผลลัพธ์คุณภาพ และความก้าวหน้าที่สำคัญในเทคโนโลยี Deepfake ปัจจุบัน โดยการลบภาระของโครงสร้างแมสค์ที่ซับซ้อนและยืดหยุ่น และบรรลุการแยกอัตลักษณ์ออกจากบริบทได้อย่างมีประสิทธิภาพ

ดูวิดีโอตัวอย่างเพิ่มเติมของเทคนิคใหม่นี้ด้านล่าง คุณสามารถดูวิดีโอทั้งหมด ที่นี่

จากเอกสารเสริมสำหรับเอกสารใหม่ CihaNet ทำการ faceswapping บนอัตลักษณ์ที่หลากหลาย Source: https://mitchellx.github.io/#video

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai