มุมมองของ Anderson

GAN ในฐานะ Face Renderer สำหรับ ‘Traditional’ CGI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ความคิดเห็น เมื่อ Generative Adversarial Networks (GANs) แสดงให้เห็นถึงความสามารถในการสร้างหน้า 3D ที่สมจริง เมื่อไม่นานมานี้ ก็ได้กระตุ้นให้เกิดการค้นหาทองในศักยภาพที่ยังไม่ได้ถูกขุดของ GANs ในการสร้างวิดีโอที่มีความสอดคล้องทางเวลา โดยมีหน้ามนุษย์เป็นตัวเอก

ที่ไหนสักแห่งในพื้นที่ Latent ของ GAN ดูเหมือนว่าจะต้องมีลำดับและเหตุผลที่ซ่อนอยู่ – สกีมานาสเซมันติกที่ฝังอยู่ในโค้ด Latent ที่จะทำให้ GAN สามารถสร้างมุมมองและความเข้าใจที่สอดคล้องกัน (เช่น การเปลี่ยนแปลงน้ำเสียง) ของ หน้าเดียวกัน – และในทางกลับกัน จะนำเสนอวิธีการสร้างวิดีโอที่มีหน้ามนุษย์ที่น่าเชื่อถือทางเวลา ซึ่งจะทำให้ อัตลักษณ์ ออกไปจากน้ำ

การผลิตภาพที่มีความละเอียดสูงจะไม่ใช่เรื่องยาก เมื่อเทียบกับสภาพแวดล้อมที่มีความละเอียดต่ำ เช่น DeepFaceLab และ FaceSwap ซึ่งถูกบังคับให้ทำงานใน GPU ส่วน ‘zone’ ของการเปลี่ยนแปลงหน้า (ในกระบวนการทำงานของอัตลักษณ์) จะกลายเป็น ‘zone’ ของการสร้างของ GAN ซึ่งได้รับข้อมูลจากภาพเข้าเพียงไม่กี่ภาพ หรือแม้กระทั่งเพียงภาพเดียว

ไม่มีการไม่ตรงกันระหว่าง ‘การเปลี่ยนแปลง’ และ ‘การเปลี่ยนแปลง’ ของหน้า เนื่องจาก ทั้งหมด ของภาพจะถูกสร้างขึ้นจากศูนย์ รวมถึงเส้นผม แนวขากรรไกร และส่วนปลายของเส้นรอบวงของหน้า ซึ่งมักจะเป็นเรื่องที่ท้าทายสำหรับ ‘การเปลี่ยนแปลง’ ของอัตลักษณ์

GAN Facial Video Winter

เมื่อเวลาผ่านไป ก็ไม่ได้เป็นเรื่องที่ง่ายเลย สุดท้ายแล้ว การแยกแยะ เป็นปัญหาหลัก และยังคงเป็นความท้าทายหลัก การรักษาหน้าเดียวกันและเปลี่ยนมุมมองหรือน้ำเสียงโดยไม่ต้องรวบรวมภาพอ้างอิงหลายพันภาพที่สอนให้เครือข่ายประสาทว่าเกิดอะไรขึ้นเมื่อมีการเปลี่ยนแปลงเหล่านี้เกิดขึ้น เช่นเดียวกับระบบอัตลักษณ์ที่ทำอย่างยากลำบาก

ความคิดที่ตามมาในการวิจัยการสร้างและซินเทซิสของ GAN คือการนำหน้าเอกลักษณ์มาใช้การเปลี่ยนแปลงที่มีแบบแผนและไม่เฉพาะเจาะจง ตัวอย่างเช่น การนำน้ำเสียงมาใช้กับหน้า GAN ที่ไม่มีอยู่ในภาพใดๆ ของบุคคลที่ GAN รู้จัก

จากเอกสารวิจัย 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space การนำน้ำเสียงมาใช้กับหน้าจาก FFHQ dataset

จากเอกสารวิจัย 2022 Tensor-based Emotion Editing in the StyleGAN Latent Space การนำน้ำเสียงมาใช้กับหน้าจาก FFHQ dataset Source: https://arxiv.org/pdf/2205.06102.pdf

เห็นได้ชัดว่าการใช้ ‘หนึ่งขนาดที่เหมาะสมทั้งหมด’ ไม่สามารถครอบคลุมความหลากหลายของน้ำเสียงที่เป็นเอกลักษณ์ของแต่ละบุคคล เราต้องสงสัยว่าน้ำเสียงที่เป็นเอกลักษณ์เช่น Jack Nicholson หรือ Willem Dafoe จะได้รับการตีความที่ซื่อสัตย์ภายใต้การควบคุมของ ‘น้ำเสียงเฉลี่ย’ โค้ด Latent เช่นนี้

ใครคือคนแปลกหน้าคนนี้? แม้ว่า GAN จะสร้างหน้าที่สมจริงและละเอียดสูงกว่า แต่การเปลี่ยนแปลงนั้นไม่ได้รับข้อมูลจากหลายภาพจริงของนักแสดง เช่นเดียวกับ DeepFaceLab ซึ่งฝึกอบรมอย่างเข้มข้นและบางครั้งใช้เวลานานบนฐานข้อมูลหลายพันภาพดังกล่าว

ใครคือคนแปลกหน้าคนนี้? แม้ว่า GAN จะสร้างหน้าที่สมจริงและละเอียดสูงกว่า แต่การเปลี่ยนแปลงนั้นไม่ได้รับข้อมูลจากหลายภาพจริงของนักแสดง เช่นเดียวกับ DeepFaceLab ซึ่งฝึกอบรมอย่างเข้มข้นและบางครั้งใช้เวลานานบนฐานข้อมูลหลายพันภาพดังกล่าว ตัวอย่างจาก https://www.youtube.com/watch?v=9tr35y-yQRY (2022) และ https://arxiv.org/pdf/2205.06102.pdf.

มีการนำเสนอ GAN facial expression editors จำนวนมากในช่วงไม่กี่ปีที่ผ่านมา ส่วนใหญ่ จัดการกับเอกลักษณ์ที่ไม่รู้จัก ซึ่งความจริงของการเปลี่ยนแปลงเหล่านั้นเป็นเรื่องที่ยากสำหรับผู้อ่านโดยทั่วไปที่จะรู้ได้ เนื่องจากสิ่งเหล่านี้ไม่ใช่หน้าที่คุ้นเคย

เอกลักษณ์ที่ไม่รู้จักถูกเปลี่ยนแปลงใน Cascade-EF-GAN ในปี 2020

เอกลักษณ์ที่ไม่รู้จักถูกเปลี่ยนแปลงใน Cascade-EF-GAN ในปี 2020 Source: https://arxiv.org/pdf/2003.05905.pdf

อาจเป็น GAN face editor ที่ได้รับความสนใจมากที่สุด (และอ้างอิง) ในช่วงสามปีที่ผ่านมา คือ InterFaceGAN ซึ่งสามารถทำการเปลี่ยนแปลงในพื้นที่ Latent ของโค้ดที่เกี่ยวข้องกับมุมมอง (มุมของกล้อง/หน้า) น้ำเสียง อายุ เพศ และคุณลักษณะอื่นๆ ที่สำคัญ

ความสามารถในการ ‘เปลี่ยนแปลง’ ของ InterFaceGAN และเฟรมเวิร์กที่คล้ายกัน ส่วนใหญ่เป็นวิธีการแสดงเส้นทางสู่การเปลี่ยนแปลงเมื่อภาพถูกส่งกลับผ่านโค้ด Latent ที่เหมาะสม (เช่น ‘อายุ’) ในแง่ของการผลิตวิดีโอที่มีความสอดคล้องทางเวลา แพลตฟอร์มเหล่านี้จนถึงขณะนี้ได้ถูกมองว่าเป็น ‘ความสำเร็จที่น่าประทับใจ’

หากคุณเพิ่มความยากในการสร้างเส้นผมที่สอดคล้องทางเวลา และข้อเท็จจริงที่ว่าเทคนิคการสำรวจ/การเปลี่ยนแปลงโค้ด Latent ไม่มีแนวทางที่เป็นธรรมชาติในการทำงาน (และยากที่จะรู้ว่าจะ.inject แนวทางเหล่านี้เข้าไปในเฟรมเวิร์กที่ออกแบบมาเพื่อสร้างและสร้างภาพนิ่ง และไม่มีการจัดเตรียมการผลิตวิดีโอโดยธรรมชาติ) อาจเป็นไปได้ที่จะสรุปได้ว่า GAN ไม่ใช่ทุกสิ่งที่คุณต้องการ ™ สำหรับการสังเคราะห์วิดีโอหน้า

ดังนั้น ความพยายามที่ตามมาได้นำไปสู่ การปรับปรุงที่เพิ่มขึ้น ในการแยกแยะ ในขณะที่คนอื่นๆ ได้เพิ่มการเปลี่ยนแปลงอื่นๆ ในการมองเห็นคอมพิวเตอร์เป็น ‘ชั้นการเปลี่ยนแปลง’ เช่น การใช้การแบ่งส่วนเชิงวิทยาศาสตร์เป็นกลไกควบคุมในเอกสารวิจัยปลายปี 2021 SemanticStyleGAN: การเรียนรู้ Compositional Generative Priors สำหรับการสังเคราะห์และการแก้ไขภาพที่ควบคุมได้

การแบ่งส่วนเชิงวิทยาศาสตร์เป็นวิธีการทำงานในพื้นที่ Latent ใน SemanticStyleGAN

การแบ่งส่วนเชิงวิทยาศาสตร์เป็นวิธีการทำงานในพื้นที่ Latent ใน SemanticStyleGAN Source: https://semanticstylegan.github.io/

การเปลี่ยนแปลงแบบพาราเมตริก

ชุมชนการวิจัยการสังเคราะห์หน้า GAN กำลังหันไปสู่การใช้ ‘การเปลี่ยนแปลงแบบพาราเมตริก’ ของ CGI หน้าแบบดั้งเดิมเป็นวิธีการนำความสอดคล้องและความเป็นระเบียบมาสู่โค้ด Latent ที่น่าประทับใจแต่ไม่สอดคล้องกันในพื้นที่ Latent ของ GAN

แม้ว่าการใช้พาราเมตริกของหน้าแบบดั้งเดิมจะเป็นเรื่องที่มีมานานกว่า 20 ปีแล้ว แต่ความสนใจในแนวทางนี้ได้เพิ่มขึ้นในช่วงหลัง โดยเฉพาะอย่างยิ่งการนำ Skinned Multi-Person Linear Model (SMPL) CGI พาราเมตริกมาใช้ ซึ่งเป็นแนวทางที่ได้รับการบุกเบิกโดย Max Planck Institute และ ILM และได้รับการปรับปรุงโดย Sparse Trained Articulated Human Body Regressor (STAR) เฟรมเวิร์ก

SMPL (ในกรณีนี้เป็น SMPL-X) สามารถกำหนดพาราเมตริก CGI ที่สอดคล้องกับโพสต์ที่คาดการณ์ไว้ (รวมถึงน้ำเสียงที่จำเป็น) ของร่างกายทั้งหมดที่ปรากฏในภาพ ทำให้สามารถดำเนินการใหม่ๆ บนภาพโดยใช้พาราเมตริก CGI เป็นแนวทางเชิงปริมาณหรือการรับรู้

SMPL (ในกรณีนี้เป็น SMPL-X) สามารถกำหนดพาราเมตริก CGI ที่สอดคล้องกับโพสต์ที่คาดการณ์ไว้ (รวมถึงน้ำเสียงที่จำเป็น) ของร่างกายทั้งหมดที่ปรากฏในภาพ ทำให้สามารถดำเนินการใหม่ๆ บนภาพโดยใช้พาราเมตริก CGI เป็นแนวทางเชิงปริมาณหรือการรับรู้ Source: https://arxiv.org/pdf/1904.05866.pdf

การพัฒนาที่ได้รับการยกย่องมากที่สุดในแนวทางนี้คือ Disney’s 2019 การแสดงผลด้วยสไตล์ ซึ่งผสมผสานการใช้แผนที่สีแบบดั้งเดิมกับภาพที่สร้างโดย GAN เพื่อสร้างภาพเคลื่อนไหวที่มีคุณภาพสูง

การผสมผสานระหว่างการแสดงผลแบบดั้งเดิมและ GAN ในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูง

การผสมผสานระหว่างการแสดงผลแบบดั้งเดิมและ GAN ในการสร้างภาพเคลื่อนไหวที่มีคุณภาพสูง Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

วิธีการของ Disney นำพาราเมตริก CGI มาใช้ในการแสดงผล StyleGAN2 เพื่อ ‘เขียนทับ’ หัวข้อหน้ามนุษย์ใน ‘พื้นที่ที่มีปัญหา’ เช่น สภาพผิวหนัง

การทำงานของ Rendering with Style

การทำงานของ Rendering with Style

เนื่องจากหัว CGI ที่ควบคุมกระบวนการนี้สามารถปรับเปลี่ยนได้ตามความต้องการ ผู้ใช้สามารถสะท้อนการเปลี่ยนแปลงเหล่านั้นได้ รวมถึงการเปลี่ยนแปลงของมุมมองและน้ำเสียง

แม้ว่าจะถูกออกแบบมาเพื่อรวมการทำงานของ CGI และความสมจริงของ GAN แต่ผลลัพธ์สุดท้ายแสดงให้เห็นว่าเป็น ‘โลกที่แย่ที่สุดของทั้งสองโลก’ และยังคงไม่สามารถรักษาความสอดคล้องของเส้นผมและแม้กระทั่งการวางตำแหน่งคุณสมบัติพื้นฐาน

การเกิดขึ้นของ 'หุบเขาที่ไม่สบาย' ใหม่จาก Rendering with Style แม้ว่าจะมีศักยภาพบางอย่าง

การเกิดขึ้นของ ‘หุบเขาที่ไม่สบาย’ ใหม่จาก Rendering with Style แม้ว่าจะมีศักยภาพบางอย่าง

เอกสารวิจัยในปี 2020 StyleRig: Rigging StyleGAN สำหรับการควบคุม 3 มิติของภาพพอร์เทรต นำแนวทางที่ได้รับความนิยมมากขึ้น โดยใช้ แบบจำลองหน้า 3 มิติ (3DMMs) เป็นตัวแทนในการเปลี่ยนแปลงคุณสมบัติใน StyleGAN

3DMMs ทำหน้าที่เป็นตัวแทนในการตีความโค้ด Latent ใน StyleRig

3DMMs ทำหน้าที่เป็นตัวแทนในการตีความโค้ด Latent ใน StyleRig Source: https://arxiv.org/pdf/2004.00121.pdf

อย่างไรก็ตาม เช่นเดียวกับโครงการก่อนหน้า ผลลัพธ์ที่ได้จนถึงขณะนี้ดูเหมือนจะจำกัดอยู่ที่การเปลี่ยนแปลงมุมมองและน้ำเสียงที่ไม่มาก

การปรับปรุงการควบคุมใน StyleRig แม้ว่าเส้นผมที่สอดคล้องทางเวลาจะเป็นความท้าทายที่ยังไม่ได้รับการแก้ไข

การปรับปรุงการควบคุมใน StyleRig แม้ว่าเส้นผมที่สอดคล้องทางเวลาจะเป็นความท้าทายที่ยังไม่ได้รับการแก้ไข Source: https://www.youtube.com/watch?v=eaW_P85wQ9k

ผลลัพธ์ที่คล้ายกันสามารถพบได้จาก Mitsubishi Research’s MOST-GAN ซึ่งเป็นเอกสารวิจัยในปี 2021 ที่ใช้ 3DMM ที่ไม่เป็นเส้นตรงเป็นโครงสร้างการแยกแยะ แต่ก็ยังคง ดิ้นรน ที่จะบรรลุการเคลื่อนไหวที่มีความสอดคล้องทางเวลา

การวิจัยล่าสุดที่พยายามสร้างการเปลี่ยนแปลงและแยกแยะคือ One-Shot Face Reenactment on Megapixels ซึ่งใช้ 3DMM พาราเมตริกเป็นอินเทอร์เฟซที่เป็นมิตรสำหรับ StyleGAN

ใน MegaFR ของ One-Shot Face Reenactment เครือข่ายจะสังเคราะห์หน้าโดยการรวมภาพจริงที่กลับด้านกับพาราเมตริกที่ได้รับจาก 3DMM ที่แสดงผล

ใน MegaFR ของ One-Shot Face Reenactment เครือข่ายจะสังเคราะห์หน้าโดยการรวมภาพจริงที่กลับด้านกับพาราเมตริกที่ได้รับจาก 3DMM ที่แสดงผล Source: https://arxiv.org/pdf/2205.13368.pdf

OSFR เป็นส่วนหนึ่งของคลาส GAN face editors ที่พยายามสร้างการทำงานแบบ Photoshop/After Effects โดยผู้ใช้สามารถนำภาพที่ต้องการมาใช้และดำเนินการเปลี่ยนแปลงได้

อีกครั้ง การแสดงออกแบบพาราเมตริกเป็นวิธีการที่ครอบคลุมและไม่เฉพาะเจาะจงในการฉีดการแสดงออก ซึ่งนำไปสู่การเปลี่ยนแปลงที่ดู ‘ไม่สบาย’ ในบางครั้ง

การฉีดการแสดงออกใน OSFR

การฉีดการแสดงออกใน OSFR

เช่นเดียวกับงานก่อนหน้า OSFR สามารถอนุมานมุมมองเดิมจากภาพเดียว และสามารถดำเนินการ ‘การกลับหน้า’ ได้ โดยที่ภาพที่มีมุมมองที่ไม่ใช่ตรงกลางจะถูกแปลงเป็นภาพหน้าตรง

ภาพดั้งเดิม (ด้านบน) และภาพหน้าตรงจาก OSFR

ภาพดั้งเดิม (ด้านบน) และภาพหน้าตรงจาก OSFR

ในทางปฏิบัติ การอนุมานนี้คล้ายกับหลักการโฟโตแกรมเมทริกซึ่งเป็นพื้นฐานของ Neural Radiance Fields (NeRF) แต่ในกรณีนี้เราต้องกำหนดเรขาคณิตจากภาพเดียว ไม่ใช่ 3-4 มุมมองที่ NeRF ใช้ในการสร้างสภาพแวดล้อม 3 มิติที่สามารถสำรวจได้

GAN มีตำแหน่งใน Facial Video Synthesis หรือไม่?

การบรรลุการแสดงออกที่มีความสอดคล้องทางเวลาและน้ำเสียงที่ไม่คาดคิดจากภาพเดียวดูเหมือนจะเป็นความหลงใหลที่คล้ายกับการทำทองในงานวิจัยการสังเคราะห์หน้า GAN ในขณะนี้ เนื่องจาก GANs เป็นวิธีเดียวที่สามารถสร้างหน้าที่มีความละเอียดสูงและความสมจริงที่สูงได้ แม้ว่าเฟรมเวิร์ก Deepfake อัตลักษณ์สามารถฝึกอบรมบนหลายมุมมองและน้ำเสียงจริง แต่ก็ต้องทำงานในความละเอียดที่จำกัดและต้องการ ‘โฮสต์’ ในขณะที่ NeRF มีข้อจำกัดที่คล้ายกัน และไม่มีวิธีการที่กำหนดไว้สำหรับการเปลี่ยนแปลงน้ำเสียงและความสามารถในการแก้ไขที่จำกัด

ดูเหมือนว่าวิธีเดียวที่จะไปต่อสำหรับระบบสังเคราะห์หน้า CGI/GAN ที่แม่นยำคือการค้นหาวิธีการสร้างหน่วยตัวตนหลายภาพในพื้นที่ Latent โดยที่โค้ด Latent สำหรับเอกลักษณ์ของบุคคลไม่ต้องเดินทางไปทั่วพื้นที่ Latent เพื่อใช้พาราเมตริกที่ไม่เกี่ยวข้อง แต่สามารถอ้างอิงภาพจริงที่เกี่ยวข้องเป็นข้อมูลอ้างอิงสำหรับการเปลี่ยนแปลง

แม้ว่าจะเป็นเช่นนั้น หรือแม้กระทั่งหาก StyleGAN ทั้งเครือข่ายถูกฝึกอบรมบนชุดหน้าเอกลักษณ์เดียว (คล้ายกับชุดฝึกอบรมที่อัตลักษณ์ใช้) โลจิกเชิงวิทยาศาสตร์ที่ไม่เพียงพอจะยังคงต้องได้รับการจัดหาด้วยเทคโนโลยีเสริม เช่น การแบ่งส่วนเชิงวิทยาศาสตร์หรือหน้า 3DMM พาราเมตริก ซึ่งในกรณีนี้จะมีเนื้อหามากขึ้นที่จะทำงานด้วย

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: [email protected]