มุมมองของ Anderson
ระบบใหม่สำหรับ Stable Diffusion วิดีโอตัวละครที่มีความสม่ำเสมอทางเวลา

โครงการใหม่จาก Alibaba Group เสนอวิธีการที่ดีที่สุดในการสร้างอวตารมนุษย์แบบเต็มตัวจากแบบจำลองฐาน Stable Diffusion
ที่เรียกว่า MIMO (MIMicking with Object Interactions) ระบบใช้เทคโนโลยีและโมดูลที่ได้รับความนิยม รวมถึงโมเดลมนุษย์ CGI และ AnimateDiff เพื่อเปิดใช้งานการแทนที่ตัวละครที่สม่ำเสมอทางวิดีโอ หรือเพื่อขับเคลื่อนตัวละครด้วยท่าทางที่กำหนดโดยผู้ใช้
ที่นี่เราจะเห็นตัวละครที่ถูกแทรกจากแหล่งภาพเดียว และขับเคลื่อนด้วยการเคลื่อนไหวที่กำหนดไว้ล่วงหน้า:
[คลิกวิดีโอด้านล่างเพื่อเล่น]
จากภาพเดียวสามตัวละครที่หลากหลายถูกขับเคลื่อนด้วยลำดับ 3D โพส (ด้านซ้าย) โดยใช้ระบบ MIMO ดูเว็บไซต์โครงการและวิดีโอยูทูบที่ติดตาม (ฝังไว้ที่สิ้นสุดของบทความนี้) สำหรับตัวอย่างเพิ่มเติมและความละเอียดที่ดีกว่า แหล่ง: https://menyifang.github.io/projects/MIMO/index.html
ตัวละครที่สร้างขึ้นซึ่งสามารถมาจากเฟรมในวิดีโอและวิธีอื่น ๆ ที่หลากหลาย สามารถรวมเข้ากับภาพจริงได้
MIMO เสนอระบบใหม่ที่สร้างการเข้ารหัสที่แยกจากกันสามแบบ แต่ละแบบสำหรับตัวละคร ฉาก และการบดบัง (เช่น การตัดต่อเมื่อวัตถุหรือบุคคลใดบุคคลหนึ่งผ่านหน้าตัวละครที่แสดง)
[คลิกวิดีโอด้านล่างเพื่อเล่น]
MIMO สามารถแทนที่ตัวละครดั้งเดิมด้วยตัวละครที่มีลักษณะเหมือนจริงหรือแบบสไตล์ที่ติดตามการเคลื่อนไหวจากวิดีโอลูกขาว
ระบบได้รับการฝึกฝนเหนือแบบจำลอง Stable Diffusion V1.5 โดยใช้เซตข้อมูลที่กำหนดเองโดยนักวิจัย และประกอบด้วยวิดีโอที่เป็นของจริงและจำลองเท่าๆ กัน
ปัญหาที่ยิ่งใหญ่ที่สุดของวิดีโอที่ใช้การแพร่กระจายคือ ความเสถียรทางเวลา ซึ่งเนื้อหาของวิดีโอก็จะกระพริบหรือ ‘พัฒนา’ ในวิธีที่ไม่พึงประสงค์สำหรับการแสดงตัวละครที่สม่ำเสมอ
MIMO ใช้ภาพเดียวเป็นแผนที่สำหรับการชี้นำที่สม่ำเสมอ ซึ่งสามารถจัดและจำกัดโดยโมเดล SMPL CGI ระหว่าง
เนื่องจากการอ้างอิงที่สม่ำเสมอนี้ และแบบจำลองฐานที่ระบบได้รับการฝึกฝนได้รับการปรับปรุงด้วยตัวอย่างการเคลื่อนไหวที่เหมาะสมแล้ว ความสามารถของระบบในการผลิตสัญญาณออกมาที่สม่ำเสมอกว่ามาตรฐานทั่วไปสำหรับอวตารที่ใช้การแพร่กระจาย
[คลิกวิดีโอด้านล่างเพื่อเล่น]
ตัวอย่างเพิ่มเติมของตัวละคร MIMO ที่ขับเคลื่อนด้วยท่าทาง
มันจะกลายเป็นเรื่องธรรมดามากขึ้นที่จะใช้ภาพเดียวเป็นแหล่งสำหรับการแสดงภาพประสาทที่มีประสิทธิภาพ ไม่ว่าจะเป็นภาพเดียวหรือแบบหลายโหมดที่รวมกับข้อความส่งเสริม
นักวิจัยเชื่อว่าหลักการที่ใช้ในระบบ MIMO สามารถขยายไปยังระบบและเฟรมเวิร์กที่สร้างสรรค์ใหม่ ๆ ได้
บทความใหม่เรื่อง MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling มาจากนักวิจัยสี่คนจากสถาบันคอมพิวเตอร์ฉลาดของ Alibaba Group
วิธีการ
MIMO ประสบความสำเร็จในการแยกส่วนประกอบที่กล่าวถึงสามส่วนนี้โดยอัตโนมัติและไม่มีการดูแล ในสถาปัตยกรรมแบบปลายสิ้นสุด (เช่น กระบวนการทั้งหมดถูกผสมเข้ากับระบบ และผู้ใช้เพียงต้องให้วัสดุอินพุต)
วัตถุในแหล่งวิดีโอถูกแปลจาก 2D เป็น 3D โดยใช้การประมาณการความลึกแบบโมโนคูลาร์ Depth Anything
องค์ประกอบของมนุษย์ในเฟรมใดๆ ถูกแยกออกโดยใช้วิธีการที่ปรับให้เหมาะสมจากโครงการ Tune-A-Video
คุณลักษณะเหล่านี้ถูกแปลเป็นลักษณะเชิงปริมาตรของวิดีโอผ่านสถาปัตยกรรม Segment Anything 2 ของ Facebook Research
ชั้นฉากเองได้รับโดยการลบวัตถุที่ตรวจจับในสองชั้นอื่น ๆ โดยให้หน้ากากแบบ rotoscope อัตโนมัติ
สำหรับการเคลื่อนไหว ชุดรหัส 潛ในขององค์ประกอบของมนุษย์ถูกยึดเข้ากับโมเดล SMPL CGI ที่กำหนดไว้ล่วงหน้า ซึ่งการเคลื่อนไหวของมันให้ความหมายที่จะแสดงเนื้อหาของมนุษย์
แผนภาพคุณลักษณะ 2D สำหรับเนื้อหาของมนุษย์ถูกได้รับจาก differentiable rasterizer ที่ได้รับจาก 2020 initiative ของ NVIDIA
การผสมผสานข้อมูล 3D ที่ได้รับจาก SMPL กับข้อมูล 2D ที่ได้รับจากวิธีของ NVIDIA รหัส 潜ในที่แสดงถึง ‘บุคคลประสาท’ มีความสอดคล้องกันอย่างมั่นคงในการแสดงผล
ในจุดนี้ จำเป็นต้องกำหนดท่าทางที่กำหนดโดยทั่วไปในสถาปัตยกรรมที่ใช้ SMPL – ท่าทาง ท่าทางมาตรฐาน
การเปลี่ยนแปลงเหล่านี้หรือ ‘การเปลี่ยนแปลงจากมาตรฐาน’ แสดงถึงการเคลื่อนไหวของมนุษย์ ในขณะที่โมเดล SMPL รักษารหัส 潜ในที่ประกอบขึ้นเป็นเอกลักษณ์ของมนุษย์ที่ถูกแยกออกมา และดังนั้นจึงแสดงถึงอวตารที่ถูกต้องในแง่ของท่าทางและเนื้อหา
ข้อมูลและทดสอบ
สำหรับการฝึกฝน นักวิจัยได้สร้างชุดข้อมูลวิดีโอมนุษย์ที่เรียกว่า HUD-7K ซึ่งประกอบด้วยวิดีโอตัวละครที่แท้จริง 5,000 รายการและวิดีโอแอนิเมชั่น 2,000 รายการที่สร้างโดยระบบ En3D
วิดีโอที่แท้จริงไม่ต้องมีการบันทึกเนื่องจากการแยกองค์ประกอบที่ไม่ใช่สัมผัสในสถาปัตยกรรมของ MIMO
ระบบได้รับการฝึกฝนบน GPU ของ NVIDIA A100 สองตัว (แม้ว่าบทความจะไม่ระบุว่าเป็นรุ่น 40GB หรือ 80GB VRAM) สำหรับการวนซ้ำ 50 ครั้ง โดยใช้เฟรมวิดีโอ 24 เฟรมและขนาดชุดข้อมูล 4 ชุด จนกว่าจะถึง ความเท่าเทียม
โมดูลการเคลื่อนไหวของระบบได้รับการฝึกฝนจากน้ำหนักของ AnimateDiff
ในระหว่างกระบวนการฝึกอบรม น้ำหนักของ VAE encoder/decoder และ CLIP image encoder ถูก ปิด (ในทางตรงกันข้ามกับการ ปรับให้เหมาะสม ที่สมบูรณ์ ซึ่งจะมีผลกระทบกว้างขวางต่อแบบจำลองฐาน)
แม้ว่า MIMO จะไม่ได้รับการทดสอบกับระบบที่คล้ายคลึงกัน นักวิจัยได้ทดสอบมันบนลำดับการเคลื่อนไหวที่ยากลำบากที่มาจาก AMASS และ Mixamo
พวกเขาได้ทดสอบระบบบน วิดีโอมนุษย์แบบธรรมชาติอีกด้วย
แม้ว่าบทความจะนำเสนอผลลัพธ์ภาพนิ่งหลายรายการเพื่อแสดงถึงประสิทธิภาพของระบบ แต่การแสดงผลที่แท้จริงของ MIMO ควรประเมินจากผลลัพธ์วิดีโอที่กว้างขวางที่ให้ไว้ที่หน้าโครงการและวิดีโอยูทูบที่ฝังไว้ที่ด้านล่างของบทความนี้
ผู้เขียนสรุปว่า:
‘ผลการทดลอง [แสดงให้เห็นว่า] วิธีการของเราสามารถควบคุมตัวละคร การเคลื่อนไหว และฉากได้อย่างยืดหยุ่น และยังสามารถปรับขนาดให้เหมาะสมกับตัวละคร 3D ใหม่ ๆ และใช้งานได้กับวิดีโอที่มีการโต้ตอบ’
‘เรายังเชื่อว่าวิธีแก้ปัญหาของเราที่พิจารณาถึงธรรมชาติ 3D ที่แท้จริงและเข้ารหัสวิดีโอ 2D เป็นองค์ประกอบเชิงพื้นที่แบบ階層สามารถสร้างแรงบันดาลใจให้กับการวิจัยในอนาคตเกี่ยวกับการสังเคราะห์วิดีโอ 3D ที่ตระหนัก’
สรุป
เป็นเรื่องที่น่าดึงดูดที่จะเห็นระบบอวตารที่สร้างจาก Stable Diffusion ที่ดูเหมือนว่าจะมีความเสถียรทางเวลาได้
ตัวละครที่มีลักษณะเหมือนจริงที่แสดงในผลลัพธ์มีประสิทธิภาพ และแม้ว่าระดับของความเหมือนจริงที่ MIMO สามารถสร้างได้จะไม่เท่ากับ Gaussian Avatars ที่สามารถทำได้ แต่ข้อดีของการสร้างมนุษย์ที่สม่ำเสมอทางวิดีโอในเครือข่ายการแพร่กระจายแบบ 潜ใน (LDM) นั้นเป็นที่น่าพอใจ
* การแปลงอ้างอิงแบบอินไลน์ของผู้เขียนให้เป็นลิงก์ และเมื่อจำเป็น ลิงก์เชิงอธิบายภายนอก
เผยแพร่ครั้งแรกวันพุธที่ 25 กันยายน 2024












