มุมมองของ Anderson

ระบบใหม่สำหรับ Stable Diffusion วิดีโอตัวละครที่มีความสม่ำเสมอทางเวลา

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

โครงการใหม่จาก Alibaba Group เสนอวิธีการที่ดีที่สุดในการสร้างอวตารมนุษย์แบบเต็มตัวจากแบบจำลองฐาน Stable Diffusion

ที่เรียกว่า MIMO (MIMicking with Object Interactions) ระบบใช้เทคโนโลยีและโมดูลที่ได้รับความนิยม รวมถึงโมเดลมนุษย์ CGI และ AnimateDiff เพื่อเปิดใช้งานการแทนที่ตัวละครที่สม่ำเสมอทางวิดีโอ หรือเพื่อขับเคลื่อนตัวละครด้วยท่าทางที่กำหนดโดยผู้ใช้

ที่นี่เราจะเห็นตัวละครที่ถูกแทรกจากแหล่งภาพเดียว และขับเคลื่อนด้วยการเคลื่อนไหวที่กำหนดไว้ล่วงหน้า:

[คลิกวิดีโอด้านล่างเพื่อเล่น]

จากภาพเดียวสามตัวละครที่หลากหลายถูกขับเคลื่อนด้วยลำดับ 3D โพส (ด้านซ้าย) โดยใช้ระบบ MIMO ดูเว็บไซต์โครงการและวิดีโอยูทูบที่ติดตาม (ฝังไว้ที่สิ้นสุดของบทความนี้) สำหรับตัวอย่างเพิ่มเติมและความละเอียดที่ดีกว่า แหล่ง: https://menyifang.github.io/projects/MIMO/index.html

ตัวละครที่สร้างขึ้นซึ่งสามารถมาจากเฟรมในวิดีโอและวิธีอื่น ๆ ที่หลากหลาย สามารถรวมเข้ากับภาพจริงได้

MIMO เสนอระบบใหม่ที่สร้างการเข้ารหัสที่แยกจากกันสามแบบ แต่ละแบบสำหรับตัวละคร ฉาก และการบดบัง (เช่น การตัดต่อเมื่อวัตถุหรือบุคคลใดบุคคลหนึ่งผ่านหน้าตัวละครที่แสดง)

[คลิกวิดีโอด้านล่างเพื่อเล่น]

MIMO สามารถแทนที่ตัวละครดั้งเดิมด้วยตัวละครที่มีลักษณะเหมือนจริงหรือแบบสไตล์ที่ติดตามการเคลื่อนไหวจากวิดีโอลูกขาว

ระบบได้รับการฝึกฝนเหนือแบบจำลอง Stable Diffusion V1.5 โดยใช้เซตข้อมูลที่กำหนดเองโดยนักวิจัย และประกอบด้วยวิดีโอที่เป็นของจริงและจำลองเท่าๆ กัน

ปัญหาที่ยิ่งใหญ่ที่สุดของวิดีโอที่ใช้การแพร่กระจายคือ ความเสถียรทางเวลา ซึ่งเนื้อหาของวิดีโอก็จะกระพริบหรือ ‘พัฒนา’ ในวิธีที่ไม่พึงประสงค์สำหรับการแสดงตัวละครที่สม่ำเสมอ

MIMO ใช้ภาพเดียวเป็นแผนที่สำหรับการชี้นำที่สม่ำเสมอ ซึ่งสามารถจัดและจำกัดโดยโมเดล SMPL CGI ระหว่าง

เนื่องจากการอ้างอิงที่สม่ำเสมอนี้ และแบบจำลองฐานที่ระบบได้รับการฝึกฝนได้รับการปรับปรุงด้วยตัวอย่างการเคลื่อนไหวที่เหมาะสมแล้ว ความสามารถของระบบในการผลิตสัญญาณออกมาที่สม่ำเสมอกว่ามาตรฐานทั่วไปสำหรับอวตารที่ใช้การแพร่กระจาย

[คลิกวิดีโอด้านล่างเพื่อเล่น]

ตัวอย่างเพิ่มเติมของตัวละคร MIMO ที่ขับเคลื่อนด้วยท่าทาง

มันจะกลายเป็นเรื่องธรรมดามากขึ้นที่จะใช้ภาพเดียวเป็นแหล่งสำหรับการแสดงภาพประสาทที่มีประสิทธิภาพ ไม่ว่าจะเป็นภาพเดียวหรือแบบหลายโหมดที่รวมกับข้อความส่งเสริม

นักวิจัยเชื่อว่าหลักการที่ใช้ในระบบ MIMO สามารถขยายไปยังระบบและเฟรมเวิร์กที่สร้างสรรค์ใหม่ ๆ ได้

บทความใหม่เรื่อง MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling มาจากนักวิจัยสี่คนจากสถาบันคอมพิวเตอร์ฉลาดของ Alibaba Group

วิธีการ

MIMO ประสบความสำเร็จในการแยกส่วนประกอบที่กล่าวถึงสามส่วนนี้โดยอัตโนมัติและไม่มีการดูแล ในสถาปัตยกรรมแบบปลายสิ้นสุด (เช่น กระบวนการทั้งหมดถูกผสมเข้ากับระบบ และผู้ใช้เพียงต้องให้วัสดุอินพุต)

วัตถุในแหล่งวิดีโอถูกแปลจาก 2D เป็น 3D โดยใช้การประมาณการความลึกแบบโมโนคูลาร์ Depth Anything

องค์ประกอบของมนุษย์ในเฟรมใดๆ ถูกแยกออกโดยใช้วิธีการที่ปรับให้เหมาะสมจากโครงการ Tune-A-Video

คุณลักษณะเหล่านี้ถูกแปลเป็นลักษณะเชิงปริมาตรของวิดีโอผ่านสถาปัตยกรรม Segment Anything 2 ของ Facebook Research

ชั้นฉากเองได้รับโดยการลบวัตถุที่ตรวจจับในสองชั้นอื่น ๆ โดยให้หน้ากากแบบ rotoscope อัตโนมัติ

สำหรับการเคลื่อนไหว ชุดรหัส 潛ในขององค์ประกอบของมนุษย์ถูกยึดเข้ากับโมเดล SMPL CGI ที่กำหนดไว้ล่วงหน้า ซึ่งการเคลื่อนไหวของมันให้ความหมายที่จะแสดงเนื้อหาของมนุษย์

แผนภาพคุณลักษณะ 2D สำหรับเนื้อหาของมนุษย์ถูกได้รับจาก differentiable rasterizer ที่ได้รับจาก 2020 initiative ของ NVIDIA

การผสมผสานข้อมูล 3D ที่ได้รับจาก SMPL กับข้อมูล 2D ที่ได้รับจากวิธีของ NVIDIA รหัส 潜ในที่แสดงถึง ‘บุคคลประสาท’ มีความสอดคล้องกันอย่างมั่นคงในการแสดงผล

ในจุดนี้ จำเป็นต้องกำหนดท่าทางที่กำหนดโดยทั่วไปในสถาปัตยกรรมที่ใช้ SMPL – ท่าทาง ท่าทางมาตรฐาน

การเปลี่ยนแปลงเหล่านี้หรือ ‘การเปลี่ยนแปลงจากมาตรฐาน’ แสดงถึงการเคลื่อนไหวของมนุษย์ ในขณะที่โมเดล SMPL รักษารหัส 潜ในที่ประกอบขึ้นเป็นเอกลักษณ์ของมนุษย์ที่ถูกแยกออกมา และดังนั้นจึงแสดงถึงอวตารที่ถูกต้องในแง่ของท่าทางและเนื้อหา

ข้อมูลและทดสอบ

สำหรับการฝึกฝน นักวิจัยได้สร้างชุดข้อมูลวิดีโอมนุษย์ที่เรียกว่า HUD-7K ซึ่งประกอบด้วยวิดีโอตัวละครที่แท้จริง 5,000 รายการและวิดีโอแอนิเมชั่น 2,000 รายการที่สร้างโดยระบบ En3D

วิดีโอที่แท้จริงไม่ต้องมีการบันทึกเนื่องจากการแยกองค์ประกอบที่ไม่ใช่สัมผัสในสถาปัตยกรรมของ MIMO

ระบบได้รับการฝึกฝนบน GPU ของ NVIDIA A100 สองตัว (แม้ว่าบทความจะไม่ระบุว่าเป็นรุ่น 40GB หรือ 80GB VRAM) สำหรับการวนซ้ำ 50 ครั้ง โดยใช้เฟรมวิดีโอ 24 เฟรมและขนาดชุดข้อมูล 4 ชุด จนกว่าจะถึง ความเท่าเทียม

โมดูลการเคลื่อนไหวของระบบได้รับการฝึกฝนจากน้ำหนักของ AnimateDiff

ในระหว่างกระบวนการฝึกอบรม น้ำหนักของ VAE encoder/decoder และ CLIP image encoder ถูก ปิด (ในทางตรงกันข้ามกับการ ปรับให้เหมาะสม ที่สมบูรณ์ ซึ่งจะมีผลกระทบกว้างขวางต่อแบบจำลองฐาน)

แม้ว่า MIMO จะไม่ได้รับการทดสอบกับระบบที่คล้ายคลึงกัน นักวิจัยได้ทดสอบมันบนลำดับการเคลื่อนไหวที่ยากลำบากที่มาจาก AMASS และ Mixamo

พวกเขาได้ทดสอบระบบบน วิดีโอมนุษย์แบบธรรมชาติอีกด้วย

แม้ว่าบทความจะนำเสนอผลลัพธ์ภาพนิ่งหลายรายการเพื่อแสดงถึงประสิทธิภาพของระบบ แต่การแสดงผลที่แท้จริงของ MIMO ควรประเมินจากผลลัพธ์วิดีโอที่กว้างขวางที่ให้ไว้ที่หน้าโครงการและวิดีโอยูทูบที่ฝังไว้ที่ด้านล่างของบทความนี้

ผู้เขียนสรุปว่า:

‘ผลการทดลอง [แสดงให้เห็นว่า] วิธีการของเราสามารถควบคุมตัวละคร การเคลื่อนไหว และฉากได้อย่างยืดหยุ่น และยังสามารถปรับขนาดให้เหมาะสมกับตัวละคร 3D ใหม่ ๆ และใช้งานได้กับวิดีโอที่มีการโต้ตอบ’

‘เรายังเชื่อว่าวิธีแก้ปัญหาของเราที่พิจารณาถึงธรรมชาติ 3D ที่แท้จริงและเข้ารหัสวิดีโอ 2D เป็นองค์ประกอบเชิงพื้นที่แบบ階層สามารถสร้างแรงบันดาลใจให้กับการวิจัยในอนาคตเกี่ยวกับการสังเคราะห์วิดีโอ 3D ที่ตระหนัก’

สรุป

เป็นเรื่องที่น่าดึงดูดที่จะเห็นระบบอวตารที่สร้างจาก Stable Diffusion ที่ดูเหมือนว่าจะมีความเสถียรทางเวลาได้

ตัวละครที่มีลักษณะเหมือนจริงที่แสดงในผลลัพธ์มีประสิทธิภาพ และแม้ว่าระดับของความเหมือนจริงที่ MIMO สามารถสร้างได้จะไม่เท่ากับ Gaussian Avatars ที่สามารถทำได้ แต่ข้อดีของการสร้างมนุษย์ที่สม่ำเสมอทางวิดีโอในเครือข่ายการแพร่กระจายแบบ 潜ใน (LDM) นั้นเป็นที่น่าพอใจ

* การแปลงอ้างอิงแบบอินไลน์ของผู้เขียนให้เป็นลิงก์ และเมื่อจำเป็น ลิงก์เชิงอธิบายภายนอก

เผยแพร่ครั้งแรกวันพุธที่ 25 กันยายน 2024

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai