มุมมองของ Anderson

การจัดการ ‘วันผมไม่ดี’ ในการสร้างภาพมนุษย์

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นับตั้งแต่ยุคทองของประติมากรรมโรมัน การสร้างภาพผมมนุษย์เป็นความท้าทายที่ยากจะเอาชนะ หัวของมนุษย์平均มีเส้นผม 100,000 เส้น มีดัชนีการหักเหที่แตกต่างกันไปตามสี และเมื่อความยาวเกินระดับหนึ่ง จะเคลื่อนไหวและเปลี่ยนรูปในลักษณะที่สามารถจำลองได้โดยใช้ แบบจำลองฟิสิกส์ที่ซับซ้อน ซึ่งจนถึงปัจจุบันสามารถใช้ได้เฉพาะในกระบวนการ CGI แบบดั้งเดิมเท่านั้น

จากผลงานวิจัยของ Disney ในปี 2017 แบบจำลองที่อาศัยฟิสิกส์พยายามใช้การเคลื่อนไหวที่สมจริงกับลักษณะผมที่เป็นของเหลวในกระบวนการสร้างภาพ CGI

จากผลงานวิจัยของ Disney ในปี 2017 แบบจำลองที่อาศัยฟิสิกส์พยายามใช้การเคลื่อนไหวที่สมจริงกับลักษณะผมที่เป็นของเหลวในกระบวนการสร้างภาพ CGI Source: https://www.youtube.com/watch?v=-6iF3mufDW0

ปัญหานี้ไม่ได้รับการแก้ไขอย่างเหมาะสมจากวิธีการสร้างภาพ deepfakes ในปัจจุบัน ในช่วงหลายปีที่ผ่านมา ชุดซอฟต์แวร์ DeepFaceLab มีแบบจำลอง ‘หัวเต็ม’ ซึ่งสามารถจับภาพได้เฉพาะรูปทรงที่แข็งของลักษณะผมสั้น (โดยทั่วไปเป็นผมชาย) และ FaceSwap ซึ่งเป็นชุดซอฟต์แวร์ที่เกี่ยวข้อง ได้ใช้แบบจำลอง BiseNet สำหรับการแบ่งส่วนแบบ语义 ซึ่งช่วยให้ผู้ใช้สามารถรวมหูและผมเข้ากับผลลัพธ์ของ deepfakes ได้

แม้จะพยายามสร้างลักษณะผมสั้น ผลลัพธ์ก็มักจะ มีคุณภาพต่ำ โดยที่หัวเต็มจะดูเหมือนถูกวางทับบนภาพบันทึกวิดีโอแทนการรวมเข้ากับภาพ

GAN Hair

มีสองแนวทางหลักในการสร้างภาพมนุษย์ คือ Neural Radiance Fields (NeRF) ซึ่งสามารถจับภาพจากหลายมุมมองและเก็บข้อมูล 3 มิติของมุมมองเหล่านั้นไว้ในเครือข่ายประสาทที่สามารถสำรวจได้ และ Generative Adversarial Networks (GANs) ซึ่งมีความก้าวหน้ามากกว่าในด้านการสร้างภาพมนุษย์ (เนื่องจาก NeRF เพิ่งเกิดขึ้นในปี 2020)

ความเข้าใจของ NeRF เกี่ยวกับเรขาคณิต 3 มิติทำให้สามารถจำลองฉากได้อย่างมีเสถียรภาพและความสม่ำเสมอ แต่ปัจจุบันไม่มีความสามารถในการใช้แบบจำลองฟิสิกส์ และมีความสามารถในการเปลี่ยนแปลงข้อมูลที่รวบรวมได้จำกัดมาก ซึ่งไม่เกี่ยวข้องกับการเปลี่ยนมุมมองของกล้อง

GAN ที่เทียบเท่ากับ NeRF มีข้อเสียเปรียบอย่างมาก เนื่องจากพื้นที่ 潜在ของ GAN ไม่ได้เข้าใจข้อมูล 3 มิติโดยธรรมชาติ ดังนั้นการสร้างภาพใบหน้าแบบ 3 มิติโดยใช้ GAN จึงกลายเป็นเป้าหมายสำคัญในการวิจัยการสร้างภาพล่าสุด โดยมี InterFaceGAN ในปี 2019 เป็นหนึ่งในความก้าวหน้าที่สำคัญ

อย่างไรก็ตาม ผลลัพธ์ที่แสดงและเลือกจาก InterFaceGAN ยังคงแสดงให้เห็นว่าความสม่ำเสมอของเส้นผมในด้านเวลาเป็นความท้าทายที่ยากจะเอาชนะในด้านการทำงาน VFX ที่อาจเกิดขึ้น

เส้นผม 'สิ้นสุด' ในการเปลี่ยน姿勢จาก InterFaceGAN

เส้นผม ‘สิ้นสุด’ ในการเปลี่ยน姿勢จาก InterFaceGAN Source: https://www.youtube.com/watch?v=uoftpl3Bj6w

เมื่อเห็นได้ชัดว่าการสร้างมุมมองที่สม่ำเสมอผ่านการเปลี่ยนแปลงพื้นที่ 潜在 อาจเป็นเป้าหมายที่ไม่สามารถทำได้ ผู้วิจัยจำนวนมากเริ่มรวมข้อมูล 3 มิติจาก CGI เข้ากับกระบวนการ GAN เพื่อใช้เป็นข้อจำกัดที่ทำให้เสถียรและปกติ

องค์ประกอบ CGI อาจแสดงเป็นรูปทรง 3 มิติเช่น Skinned Multi-Person Linear Model (SMPL) หรือโดยใช้เทคนิคการอนุมาน 3 มิติในลักษณะที่คล้ายกับ NeRF โดยที่เรขาคณิตจะถูกประเมินจากภาพหรือวิดีโอที่มีแหล่งที่มา

งานวิจัยใหม่หนึ่งงานที่ออกมาเมื่อเร็วๆ นี้ คือ Multi-View Consistent Generative Adversarial Networks for 3D-aware Image Synthesis (MVCGAN) ซึ่งเป็นความร่วมมือระหว่าง ReLER, AAII, University of Technology Sydney, DAMO Academy at Alibaba Group และ Zhejiang University

ท่าทางใบหน้าที่สมจริงและแข็งแกร่งที่สร้างโดย MVCGAN จากชุดข้อมูล CELEBA-HQ

ท่าทางใบหน้าที่สมจริงและแข็งแกร่งที่สร้างโดย MVCGAN จากชุดข้อมูล CELEBA-HQ Source: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN รวม เครือข่ายรัศมีสร้างสรรค์ (GRAF) ที่สามารถให้ข้อจำกัดเรขาคณิตใน GAN ได้ และอาจบรรลุความสามารถในการวางท่าทางที่สมจริงที่สุดในบรรดาการเข้าใกล้ GAN ที่คล้ายกัน

การเปรียบเทียบระหว่าง MVCGAN และวิธีการก่อนหน้า GRAF, GIRAFFE และ pi-GAN

การเปรียบเทียบระหว่าง MVCGAN และวิธีการก่อนหน้า GRAF, GIRAFFE และ pi-GAN

อย่างไรก็ตาม สิ่งที่เสริมใน MVCGAN เปิดเผยว่าการได้รับเส้นผมที่สม่ำเสมอในด้านปริมาณ ทิศทาง การวางตำแหน่ง และพฤติกรรมเป็นปัญหาที่ไม่สามารถแก้ไขได้ง่ายๆ โดยใช้ข้อจำกัดที่อาศัยเรขาคณิต 3 มิติจากภายนอก

จากสิ่งที่เสริมที่ไม่ได้เผยแพร่สาธารณะในขณะเขียน เราจะเห็นว่าแม้ว่าการสร้างท่าทางใบหน้าจาก MVCGAN จะเป็นความก้าวหน้าที่สำคัญ แต่ความสม่ำเสมอของเส้นผมในด้านเวลา仍เป็นปัญหา

จากสิ่งที่เสริมที่ไม่ได้เผยแพร่สาธารณะในขณะเขียน เราจะเห็นว่าแม้ว่าการสร้างท่าทางใบหน้าจาก MVCGAN จะเป็นความก้าวหน้าที่สำคัญ แต่ความสม่ำเสมอของเส้นผมในด้านเวลา仍เป็นปัญหา

เนื่องจากกระบวนการ CGI ที่ ‘ตรงไปตรงมา’ ยังคงพบว่าการสร้างเส้นผมในด้านเวลาเป็นความท้าทาย จึงไม่มีเหตุผลที่จะเชื่อว่าแนวทางที่อาศัยเรขาคณิตแบบดั้งเดิมจะนำการสร้างเส้นผมที่สม่ำเสมอเข้าสู่พื้นที่ 潜在 ในระยะเวลาอันใกล้นี้

การทำให้เส้นผมมีเสถียรภาพด้วยเครือข่ายประสาทแบบ卷積

งานวิจัยที่จะเผยแพร่ในอนาคตจากนักวิจัย 3 คนจาก Chalmers Institute of Technology ในสวีเดนอาจนำเสนอความก้าวหน้าเพิ่มเติมในการจำลองเส้นผมโดยใช้เครือข่ายประสาท

ทางด้านซ้ายคือการแสดงเส้นผมที่มีเสถียรภาพโดยใช้ CNN และทางด้านขวาคือภาพที่ถูกต้อง

ทางด้านซ้ายคือการแสดงเส้นผมที่มีเสถียรภาพโดยใช้ CNN และทางด้านขวาคือภาพที่ถูกต้อง Source: https://www.youtube.com/watch?v=AvnJkwCmsT4

งานวิจัยที่มีชื่อว่า การกรองเส้นผมแบบเรียลไทม์ด้วยเครือข่ายประสาทแบบ卷積 จะเผยแพร่ใน i3D symposium ในต้นเดือนพฤษภาคม

ระบบประกอบด้วยเครือข่ายแบบอัตโนมัติที่สามารถประเมินความละเอียดของเส้นผม รวมถึงการสร้างเงาและพิจารณาความหนาของเส้นผมในแบบเรียลไทม์ โดยอาศัยตัวอย่างที่สุ่มเกิดขึ้นจาก OpenGL geometry

แนวทางนี้จะแสดงตัวอย่างที่มีการโปร่งใสแบบสุ่มและฝึก U-net เพื่อสร้างภาพเดิมขึ้นมาใหม่

ภายใต้ MVCGAN เครือข่ายประสาทแบบ卷積จะกรองปัจจัยสีที่สุ่มเกิดขึ้น พร้อมด้วยไฮไลต์ เวกเตอร์ ทิศทาง และความลึก เพื่อสร้างภาพสังเคราะห์

ภายใต้ MVCGAN เครือข่ายประสาทแบบ卷積จะกรองปัจจัยสีที่สุ่มเกิดขึ้น พร้อมด้วยไฮไลต์ เวกเตอร์ ทิศทาง และความลึก เพื่อสร้างภาพสังเคราะห์

เครือข่ายจะถูกฝึกโดยใช้ PyTorch และจะบรรลุความสอดคล้องภายใน 6 ถึง 12 ชั่วโมง ขึ้นอยู่กับขนาดเครือข่ายและจำนวนคุณลักษณะที่เข้ามา

ข้อมูลการฝึกจะถูกสร้างโดยการแสดงภาพหลายร้อยภาพสำหรับลักษณะผมตรงและลักษณะผมที่มีลักษณะเป็นคลื่น โดยใช้ระยะห่างและท่าทางสุ่ม รวมถึงสภาพแสงหลากหลาย

ตัวอย่างข้อมูลการฝึกที่หลากหลาย

ตัวอย่างข้อมูลการฝึกที่หลากหลาย

ความโปร่งใสของเส้นผมจะถูกเฉลี่ยจากภาพที่แสดงด้วยการโปร่งใสแบบสุ่มที่มีความละเอียดสูง และข้อมูลที่มีความละเอียดสูงจะถูกย่อให้เล็กลงเพื่อให้เหมาะสมกับข้อจำกัดของเครือข่ายและฮาร์ดแวร์

การนำไปใช้แบบเรียลไทม์จะใช้การผสมผสานระหว่าง NVIDIA CUDA และ OpenGL โดยที่คุณลักษณะเริ่มต้นจะถูกโหลดเข้าไปในบัฟเฟอร์สีของ OpenGL ที่มีการตัวอย่างหลายครั้ง และผลลัพธ์จะถูกส่งต่อไปยังเทนเซอร์ของ cuDNN เพื่อการประมวลผลในเครือข่ายประสาทแบบ卷積

ระบบจะทำงานบน NVIDIA RTX 2080 โดยมีความละเอียด 1024×1024 พิกเซล

เนื่องจากค่าของสีผมจะถูกแยกออกจากกันในค่าที่ได้รับจากเครือข่าย การเปลี่ยนสีผมจึงเป็นงานที่ง่าย แต่ผลกระทบเช่นการไล่สีและเส้นสีเป็นความท้าทายที่ต้องเผชิญในอนาคต

ผู้เขียนได้เผยแพร่โค้ดที่ใช้ในการประเมินผลงานวิจัย ที่ GitLab สามารถดูวิดีโอส่วนเสริมสำหรับ MVCGAN ได้ด้านล่าง

สรุป

การนำทางในพื้นที่ 潜在ของเครือข่ายอัตโนมัติหรือ GAN ยังคงคล้ายกับการเดินเรือมากกว่าการขับรถที่แม่นยำ ในช่วงไม่นานมานี้ เราเริ่มเห็นผลลัพธ์ที่น่าเชื่อถือสำหรับการสร้างท่าทาง ‘ง่าย’ เช่น ใบหน้า ในแนวทางเช่น NeRF, GANs และเฟรมเวิร์กอัตโนมัติที่ไม่ใช่ deepfakes (2017)

ความซับซ้อนทางสถาปัตยกรรมที่สำคัญของเส้นผมมนุษย์ รวมถึงความจำเป็นในการรวมแบบจำลองฟิสิกส์และคุณลักษณะอื่นๆ ที่แนวทางสังเคราะห์ภาพปัจจุบันไม่มีให้ บ่งชี้ว่าการสร้างเส้นผมไม่น่าจะยังคงเป็นส่วนประกอบที่รวมอยู่ในกระบวนการสังเคราะห์ใบหน้าทั่วไป แต่ต้องใช้เครือข่ายที่มีความซับซ้อนและแยกออกมา – แม้ว่าเครือข่ายเหล่านั้นอาจรวมเข้ากับเฟรมเวิร์กสังเคราะห์ใบหน้าที่กว้างขึ้นและซับซ้อนกว่านี้ในอนาคต

 

เผยแพร่ครั้งแรกเมื่อวันที่ 15 เมษายน 2022

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai