มุมมองของ Anderson

ดิสนีย์รวม CGI และการเรนเดอร์แบบニューラルเพื่อแก้ปัญหา ‘Uncanny Valley’

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ดิสนีย์ ได้พัฒนาเทคนิคใหม่สำหรับการจำลองใบหน้าที่มีคุณภาพสูง โดยการรวมความสามารถของการเรนเดอร์แบบニューラล์และเทคนิค CGI ที่มีความสม่ำเสมอ

บทความที่กำลังจะเผยแพร่จะมีชื่อเรื่องว่า การเรนเดอร์ด้วยสไตล์: การรวมเทคนิคแบบดั้งเดิมและแบบニューラล์สำหรับการเรนเดอร์ใบหน้าที่มีคุณภาพสูง และสามารถดูได้ใน วิดีโอที่เผยแพร่ล่าสุด ในช่อง Disney Research YouTube (ติดไว้ที่ส่วนล่างของบทความนี้*).

เมชที่รวมกับการเรนเดอร์แบบニューラล์

เมชที่รวมกับการเรนเดอร์แบบニューラล์ ดูวิดีโอเพื่อดูรายละเอียดและคุณภาพที่ดีกว่า Source: https://www.youtube.com/watch?v=k-RKSGbWLng (ถูกแทนที่ด้วย https://www.youtube.com/watch?v=TwpLqTmvqVk)

ตามที่วิดีโอบอก การเรนเดอร์แบบニューラล์ของใบหน้า (รวมถึง deepfakes) สามารถสร้าง眼睛และปากที่มีความสมจริงมากกว่า CGI แต่การเรนเดอร์แบบ CGI สามารถสร้างสีผิวที่สม่ำเสมอและเหมาะสมสำหรับการผลิตภาพยนตร์ได้ดีกว่า

ดังนั้น ดิสนีย์จึงทดลองใช้ NVIDIA’s StyleGan2 เพื่อสร้างส่วนรอบๆ ใบหน้าและ ‘ส่วนสำคัญ’ เช่น ตา และการเรนเดอร์แบบ CGI เพื่อสร้างสีผิวที่สม่ำเสมอและเหมาะสม

จากวิดีโอ (ดูส่วนล่างของบทความ) แนวคิดทางสถาปัตยกรรมของเทคนิคใหม่ของดิสนีย์ โดยที่เมชแบบดั้งเดิมที่ใช้ในการสร้าง 'คาร์รี่ ฟิชเชอร์' และ 'ปีเตอร์ คัชชิง' ในภาพยนตร์ Rogue One (2016) ถูกรวมเข้ากับสภาพแวดล้อมของการเรนเดอร์แบบニューラล์

จากวิดีโอ (ดูส่วนล่างของบทความ) แนวคิดทางสถาปัตยกรรมของเทคนิคใหม่ของดิสนีย์ โดยที่เมชแบบดั้งเดิมที่ใช้ในการสร้าง ‘คาร์รี่ ฟิชเชอร์’ และ ‘ปีเตอร์ คัชชิง’ ในภาพยนตร์ Rogue One (2016) ถูกรวมเข้ากับสภาพแวดล้อมของการเรนเดอร์แบบニューラล์

วิดีโอบอกว่า:

‘ยังมีช่องว่างที่กว้างระหว่างสิ่งที่คนสามารถจับภาพและเรนเดอร์ได้ง่ายๆ กับสิ่งที่เป็นดิจิตอลที่มีคุณภาพสูงและสมบูรณ์แบบ รวมถึงเส้นผม ตา และปากที่มีความสมจริง To ปิดช่องว่างนี้ มันจำเป็นต้องมีการทำงานอย่างมากจากศิลปินฝีมือ

จริงๆ แล้ว แม้แต่ระบบจับภาพใบหน้าที่ทันสมัยที่สุดก็ไม่ได้พยายามสร้างตา ปาก หรือเส้นผม ซึ่งมีปัญหาเรื่องความสมจริงหรือความสม่ำเสมอ

วิดีโอบอกว่าศิลปิน VFX จะได้รับหลังจากการเรนเดอร์แบบ CGI ทั่วไป

วิดีโอบอกว่าศิลปิน VFX จะได้รับหลังจากการเรนเดอร์แบบ CGI ทั่วไป ตา เส้นผม และปากจะถูกจัดการโดยทีมงานอื่นๆ ในการผลิต

การควบคุมแสง

เทคนิคใหม่นี้ยังมีประโยชน์ในการควบคุมแสง ซึ่งเป็นความท้าทายสำหรับการเรนเดอร์แบบニューラล์ของใบหน้า เนื่องจากการเรนเดอร์แบบ CGI สามารถควบคุมแสงได้ง่ายกว่า

การเรนเดอร์แบบแอนิเมชั่นของเทคนิค CGI/ニューラล์

การเรนเดอร์แบบแอนิเมชั่นของเทคนิค CGI/ニューラล์

ในสถานการณ์ที่ท้าทาย เช่น การถ่ายภาพภายนอก นักวิจัยได้พัฒนาเทคนิคในการเติมสีรอบๆ พื้นที่ที่ถูกสร้างขึ้น

พื้นที่สีดำถูกสร้างขึ้นเพื่อใช้เป็น 'ผืนผ้า' สำหรับการเติมสีและรวมการเรนเดอร์แบบ CGI

พื้นที่สีดำถูกสร้างขึ้นเพื่อใช้เป็น ‘ผืนผ้า’ สำหรับการเติมสีและรวมการเรนเดอร์แบบ CGI

วิดีโอบอกว่า:

‘การเรนเดอร์แบบニューラล์ไม่ตรงกับข้อจำกัดของพื้นหลังอย่างสมบูรณ์แบบ – มันแค่ให้คำแนะนำเท่านั้น เนื่องจากการเพิ่มความสมจริงของส่วนประกอบของมนุษย์ เช่น เส้นผม ตา และฟัน เป็นเป้าหมายหลัก การที่จะรักษาความสม่ำเสมอของตัวตนในขณะที่เปลี่ยนสภาพแวดล้อมเป็นเรื่องที่ท้าทาย’

การสร้างเมช CGI จากการเรนเดอร์แบบニューラล์

ทีมวิจัยได้พัฒนาเทคนิคใหม่ในการสร้างเมช 3 มิติจากภาพใบหน้า โดยใช้การเรนเดอร์แบบニューラล์และการเรนเดอร์แบบ CGI

มีข้อจำกัดที่ต้อง克服 เช่น ความยากในการรักษาความสม่ำเสมอของเส้นผมในระหว่างการเรนเดอร์แบบニューラล์ และวิดีโอ (ดูส่วนล่าง) แสดงตัวอย่างของเส้นผมที่เปลี่ยนแปลงอย่างรวดเร็วในระหว่างการเรนเดอร์แบบ CGI/ニューラล์

การรักษาความสม่ำเสมอของวิดีโอแบบニューラล์เป็นปัญหาที่กว้างกว่าไม่ใช่แค่ของดิสนีย์ และมันอาจจะใช้เทคนิคใหม่ๆ ในการสร้างเส้นผมในอนาคต

การใช้ในการสร้างข้อมูล

เทคนิคใหม่นี้ยังสามารถใช้ในการสร้างข้อมูลสังเคราะห์และเพิ่มความหลากหลายของภาพใบหน้า ซึ่งได้กลายเป็นเรื่องที่น่าเบื่อในหลายๆ ปีที่ผ่านมา

ดิสนีย์เห็นถึงโอกาสในการใช้เทคนิคใหม่นี้ในการสร้างข้อมูลสังเคราะห์

ดิสนีย์เห็นถึงโอกาสในการใช้เทคนิคใหม่นี้ในการสร้างข้อมูลสังเคราะห์

‘ผลลัพธ์ที่เราสร้างขึ้นทุกๆ อย่างมีจุดเริ่มต้นและแผนที่สภาพที่ถูกเรนเดอร์จากมุมมองที่ไม่รู้จักและมีแสงสว่างที่ทราบ ผลลัพธ์เหล่านี้สามารถใช้ในการฝึกอบรมแอปพลิเคชันต่างๆ เช่น การสร้างภาพ 3 มิติ การรู้จำใบหน้า หรือการทำความเข้าใจฉาก และผลลัพธ์เหล่านี้สามารถสร้างขึ้นได้หลายๆ ครั้งสำหรับบุคคลต่างๆ ‘

‘นอกจากนี้ สำหรับบุคคลเดียวกันที่ถูกเรนเดอร์ในน้ำเสียงเดียวกันกับแสงสว่างเดียวกัน เราสามารถสร้างการเปลี่ยนแปลงสุ่มของภาพที่มีคุณภาพสูงได้โดยการเปลี่ยนแปลงตัวสุ่มระหว่างการปรับแต่ง’

นักวิจัยบอกว่าความหลากหลายของผลลัพธ์ที่สามารถปรับแต่งได้สามารถใช้ในการฝึกอบรมแอปพลิเคชันการรู้จำใบหน้า และสรุปว่า:

‘เทคนิคของเราสามารถใช้เทคโนโลยีปัจจุบันสำหรับการจับภาพใบหน้า การสร้างแบบจำลองและการเรนเดอร์ และสร้างภาพใบหน้าที่มีคุณภาพสูงโดยอัตโนมัติ ซึ่งสามารถใช้ในการสร้างภาพยนตร์และความบันเทิง และช่วยลดการทำงานของศิลปิน’

สำหรับการดูเทคนิคใหม่นี้อย่างลึกซึ้งยิ่งขึ้น สามารถดูวิดีโอที่เผยแพร่ล่าสุดได้ที่:

 * วิดีโอต้นฉบับถูกแทนที่ด้วยวิดีโอใหม่ที่เหมือนกัน 8 ชั่วโมงหลังจากที่บทความนี้ถูกเผยแพร่ ฉันเปลี่ยนลิงก์ที่เกี่ยวข้องทั้งหมด เนื่องจากไม่มีร่องรอยของวิดีโอต้นฉบับ

 

8:24 GMT+2 – วิดีโอถูกแทนที่ด้วยวิดีโอใหม่ เนื่องจากช่อง Disney Research YouTube ถูกเปลี่ยนโดยไม่ทราบสาเหตุ

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai