โมเดลและแพลตฟอร์ม AI
MagicDance : การสร้างวิดีโอการเต้นรำของมนุษย์ที่มีลักษณะเหมือนจริง
การมองเห็นของคอมพิวเตอร์เป็นหนึ่งในสาขาที่ถูกพูดถึงมากที่สุดในอุตสาหกรรม AI เนื่องจากมีการใช้งานที่หลากหลายในงานที่ต้องใช้เวลาในการประมวลผลในแบบเรียลไทม์ ในช่วงไม่กี่ปีที่ผ่านมา ระบบการมองเห็นของคอมพิวเตอร์ได้พัฒนาไปอย่างรวดเร็ว โดยมีโมเดลสมัยใหม่ที่สามารถวิเคราะห์ลักษณะใบหน้า วัตถุ และอื่นๆ ในสถานการณ์แบบเรียลไทม์ได้ แม้ว่าจะมีความสามารถเหล่านี้ แต่การถ่ายโอนการเคลื่อนไหวของมนุษย์ยังคงเป็นความท้าทายที่ยิ่งใหญ่สำหรับโมเดลการมองเห็นของคอมพิวเตอร์ งานนี้เกี่ยวข้องกับการกำหนดเป้าหมายการเคลื่อนไหวของใบหน้าและร่างกายจากภาพหรือวิดีโอที่เป็นแหล่งที่มาไปยังภาพหรือวิดีโอที่เป็นเป้าหมาย การถ่ายโอนการเคลื่อนไหวของมนุษย์ถูกใช้กันอย่างแพร่หลายในโมเดลการมองเห็นของคอมพิวเตอร์สำหรับการตกแต่งภาพหรือวิดีโอ การแก้ไขเนื้อหามัลติมีเดีย การสังเคราะห์มนุษย์แบบดิจิทัล และแม้กระทั่งการสร้างข้อมูลสำหรับเฟรมเวิร์กที่ขึ้นอยู่กับการรับรู้
ในบทความนี้ เราจะมุ่งเน้นไปที่ MagicDance ซึ่งเป็นโมเดลที่อาศัยการกระจายตัวที่ได้รับการออกแบบมาเพื่อปฏิวัติงานการถ่ายโอนการเคลื่อนไหวของมนุษย์ เฟรมเวิร์ก MagicDance มีเป้าหมายโดยเฉพาะในการถ่ายโอนน้ำเสียงและน้ำเสียงใบหน้าของมนุษย์ 2 มิติไปยังวิดีโอการเต้นรำที่ท้าทาย โดยมีเป้าหมายในการสร้างวิดีโอการเต้นรำที่ขับเคลื่อนด้วยลำดับโพสที่ใหม่สำหรับอัตลักษณ์ที่เป็นเป้าหมายโดยเฉพาะ ในขณะเดียวกันก็รักษาอัตลักษณ์ดั้งเดิมไว้ เฟรมเวิร์ก MagicDance ใช้กลยุทธ์การฝึกอบรมสองขั้นตอน โดยเน้นไปที่การแยกการเคลื่อนไหวของมนุษย์และปัจจัยด้านการปรากฏตัว เช่น สีผิว การแสดงออกบนใบหน้า และเสื้อผ้า เราจะสำรวจเฟรมเวิร์ก MagicDance โดยการตรวจสอบสถาปัตยกรรม ฟังก์ชันการทำงาน และประสิทธิภาพเมื่อเทียบกับเฟรมเวิร์กการถ่ายโอนการเคลื่อนไหวของมนุษย์ที่ทันสมัยอื่นๆ มาเริ่มกันเลย
MagicDance : การถ่ายโอนการเคลื่อนไหวของมนุษย์ที่มีลักษณะเหมือนจริง
ตามที่กล่าวไว้ก่อนหน้านี้ การถ่ายโอนการเคลื่อนไหวของมนุษย์เป็นหนึ่งในงานที่ซับซ้อนที่สุดในงานการมองเห็นของคอมพิวเตอร์ เนื่องจากความซับซ้อนที่เกี่ยวข้องกับการถ่ายโอนการเคลื่อนไหวของมนุษย์และน้ำเสียงจากภาพหรือวิดีโอที่เป็นแหล่งที่มาไปยังภาพหรือวิดีโอที่เป็นเป้าหมาย ในแบบดั้งเดิม เฟรมเวิร์กการมองเห็นของคอมพิวเตอร์สามารถทำการถ่ายโอนการเคลื่อนไหวของมนุษย์ได้โดยการฝึกอบรมโมเดลที่สร้างขึ้นโดยเฉพาะ เช่น GAN หรือ Generative Adversarial Networks บนดาต้าเซตที่เป็นเป้าหมายสำหรับการแสดงออกบนใบหน้าและโพสที่ของร่างกาย แม้ว่าการฝึกอบรมและการใช้โมเดลที่สร้างขึ้นโดยเฉพาะจะให้ผลลัพธ์ที่น่าพอใจในบางกรณี แต่ก็มักจะประสบปัญหาจากข้อจำกัดสองประการ
- พวกมันพึ่งพาส่วนประกอบการบิดเบือนภาพเป็นอย่างมาก ซึ่งทำให้พวกมันบิดเบือนส่วนของร่างกายที่มองไม่เห็นในภาพที่เป็นแหล่งที่มาได้ เนื่องจากการเปลี่ยนแปลงมุมมองหรือการปิดบังตนเอง
- พวกมันไม่สามารถสร้างแบบจำลองให้กับภาพอื่นๆ ที่มาจากภายนอกได้ ซึ่งจำกัดความสามารถในการใช้งาน โดยเฉพาะในสถานการณ์แบบเรียลไทม์ในที่สาธารณะ

โมเดลการกระจายตัวสมัยใหม่ได้แสดงให้เห็นถึงความสามารถในการสร้างภาพที่น่าประทับใจในหลายสถานการณ์ และสามารถนำไปใช้ในการสร้างวิดีโอและภาพที่สมบูรณ์แบบได้โดยการเรียนรู้จากเซตข้อมูลภาพขนาดใหญ่บนเว็บ โมเดลการกระจายตัวอาจเป็นตัวเลือกที่เหมาะสมสำหรับงานการถ่ายโอนการเคลื่อนไหวของมนุษย์ แต่ก็มีข้อจำกัดบางประการ เช่น คุณภาพของเนื้อหาที่สร้างขึ้นหรือการรักษาอัตลักษณ์หรือการขาดความสอดคล้องในแง่ของเวลา เนื่องจากการออกแบบและกลยุทธ์การฝึกอบรม
เพื่อเอาชนะอุปสรรคที่เฟรมเวิร์กการกระจายตัวและ GAN ต้องเผชิญในงานการถ่ายโอนการเคลื่อนไหวของมนุษย์ ผู้พัฒนาได้แนะนำ MagicDance ซึ่งเป็นเฟรมเวิร์กใหม่ที่มีเป้าหมายในการใช้ประโยชน์จากโมเดลการกระจายตัวสำหรับการถ่ายโอนการเคลื่อนไหวของมนุษย์ โดยแสดงให้เห็นถึงระดับการรักษาอัตลักษณ์ที่ไม่เคยเห็นมาก่อน คุณภาพการแสดงภาพที่เหนือกว่า และความสามารถในการสร้างแบบจำลองได้ดี

รูปด้านบนให้ภาพรวมของเฟรมเวิร์ก MagicDance และสามารถเห็นได้ว่าเฟรมเวิร์กใช้ Stable Diffusion model และมีส่วนประกอบเพิ่มเติมสองส่วน: Appearance Control Model และ Pose ControlNet ซึ่งให้คำแนะนำด้านการปรากฏตัวจากภาพอ้างอิงผ่านความสนใจ และให้คำแนะนำด้านน้ำเสียงและโพสที่ของร่างกายจากภาพหรือวิดีโอที่มีเงื่อนไข
โดยสรุป เฟรมเวิร์ก MagicDance เป็น
- เฟรมเวิร์กใหม่และเป็นผลที่มีประสิทธิภาพ โดยประกอบด้วยการควบคุมโพสที่แยกออกจากกันและการฝึกอบรมการควบคุมการปรากฏตัว
- เฟรมเวิร์ก MagicDance สามารถสร้างน้ำเสียงและโพสที่ของร่างกายที่มีลักษณะเหมือนจริงได้ภายใต้การควบคุมของอินพุตโพสที่และภาพอ้างอิงหรือวิดีโอ
- เฟรมเวิร์ก MagicDance มีเป้าหมายในการสร้างเนื้อหาที่มีลักษณะเหมือนจริงโดยการแนะนำโมดูลการดึงความสนใจจากหลายแหล่งที่ให้คำแนะนำที่แม่นยำสำหรับเฟรมเวิร์ก Stable Diffusion UNet
- เฟรมเวิร์ก MagicDance สามารถใช้เป็นส่วนขยายหรือปลั๊กอินสำหรับเฟรมเวิร์ก Stable Diffusion ได้ และรับประกันความเข้ากันได้กับน้ำหนักโมเดลที่มีอยู่โดยไม่ต้องปรับพารามิเตอร์เพิ่มเติม
นอกจากนี้ เฟรมเวิร์ก MagicDance ยังแสดงให้เห็นถึงความสามารถในการสร้างแบบจำลองที่ดีสำหรับทั้งการปรากฏตัวและโพสที่
- การสร้างแบบจำลองการปรากฏตัว: เฟรมเวิร์ก MagicDance แสดงให้เห็นถึงความสามารถที่เหนือกว่าในการสร้างการปรากฏตัวที่หลากหลาย
- การสร้างแบบจำลองโพสที่: เฟรมเวิร์ก MagicDance ยังมีความสามารถในการสร้างโพสที่ที่หลากหลาย
MagicDance : วัตถุประสงค์และสถาปัตยกรรม
สำหรับภาพอ้างอิงที่กำหนดของมนุษย์จริงหรือภาพที่มีลักษณะเฉพาะ เฟรมเวิร์ก MagicDance มีเป้าหมายหลักในการสร้างภาพหรือวิดีโอที่มีเงื่อนไขจากอินพุตและอินพุตโพสที่ {P, F} โดยที่ P แสดงถึงโครงกระดูกของมนุษย์และ F แสดงถึงลักษณะใบหน้า
สถาปัตยกรรม
ระหว่างการฝึกอบรม เฟรมเวิร์ก MagicDance ถูกฝึกอบรมเป็นงานการกู้คืนเฟรมเพื่อกู้คืนความจริงจากภาพอ้างอิงและอินพุตโพสที่ที่มาจากวิดีโออ้างอิงเดียวกัน ระหว่างการทดสอบเพื่อให้การถ่ายโอนการเคลื่อนไหว อินพุตโพสที่และภาพอ้างอิงมาจากแหล่งที่แตกต่างกัน
โดยรวมแล้ว สถาปัตยกรรมของเฟรมเวิร์ก MagicDance สามารถแบ่งออกเป็นสี่ประเภท: ขั้นตอนเบื้องต้น การฝึกอบรมการควบคุมการปรากฏตัว การควบคุมโพสที่ที่แยกออกจากกัน และโมดูลการเคลื่อนไหว
ขั้นตอนเบื้องต้น
โมเดลการกระจายตัวแบบ 잠ลึกหรือ LDM เป็นตัวแทนของโมเดลการกระจายตัวที่ได้รับการออกแบบมาเพื่อทำงานในพื้นที่แบบจำลองที่ได้รับการอำนวยความสะดวกโดยการใช้เครื่องบิดเบือนอัตโนมัติ และเฟรมเวิร์ก Stable Diffusion เป็นตัวอย่างที่สำคัญของ LDMs ที่ใช้ Vector Quantized-Variational AutoEncoder และสถาปัตยกรรม U-Net แบบชั่วคราว
การฝึกอบรมการควบคุมการปรากฏตัว
ปัญหาหลักของเฟรมเวิร์ก ControlNet เดิมคือความไม่สามารถควบคุมการปรากฏตัวระหว่างการเคลื่อนไหวที่เปลี่ยนแปลงไปได้ แม้ว่าจะสร้างภาพที่มีโพสที่ที่คล้ายกับภาพอินพุตโดยรวม แต่การปรากฏตัวโดยรวมจะถูกกำหนดโดยอินพุตข้อความเป็นหลัก
โมดูลการฝึกอบรมการควบคุมการปรากฏตัวในเฟรมเวิร์ก MagicDance ได้รับการออกแบบมาเพื่อให้คำแนะนำสำหรับการควบคุมการปรากฏตัวในแนวทางแบบชั้น ๆ แทนที่จะพึ่งพาอินพุตข้อความ โมดูลโดยรวมจะเน้นไปที่การใช้ลักษณะการปรากฏตัวจากภาพอ้างอิงโดยมีเป้าหมายในการปรับปรุงความสามารถของเฟรมเวิร์กในการสร้างลักษณะการปรากฏตัวได้อย่างแม่นยำ โดยเฉพาะในสถานการณ์ที่เกี่ยวข้องกับพลวัตการเคลื่อนไหวที่ซับซ้อน นอกจากนี้ โมดูลการควบคุมการปรากฏตัวเท่านั้นที่สามารถฝึกอบรมได้ระหว่างการฝึกอบรมการควบคุมการปรากฏตัว
การควบคุมโพสที่ที่แยกออกจากกัน
วิธีแก้ปัญหาที่ตรงไปตรงมาสำหรับการควบคุมโพสที่ในภาพที่สร้างขึ้นคือการรวมโมเดล ControlNet ที่ฝึกอบรมไว้แล้วเข้ากับโมเดลการควบคุมการปรากฏตัวที่ฝึกอบรมไว้แล้วโดยตรงโดยไม่ต้องปรับพารามิเตอร์อย่างไรก็ตาม การรวมนี้อาจทำให้เฟรมเวิร์กต้องดิ้นรนในการควบคุมโพสที่ที่แยกออกจากกัน ซึ่งอาจทำให้เกิดความไม่สอดคล้องกันระหว่างโพสที่ที่อินพุตและโพสที่ที่สร้างขึ้น
โมดูลการเคลื่อนไหว
เมื่อทำงานร่วมกัน โมดูลการควบคุมโพสที่ที่แยกออกจากกันและโมดูลการควบคุมการปรากฏตัวสามารถทำการถ่ายโอนภาพไปยังการเคลื่อนไหวได้อย่างแม่นยำและเป็นผล แม้ว่าจะทำให้เกิดความไม่สอดคล้องในแง่ของเวลา เพื่อให้แน่ใจว่ามีความสอดคล้องในแง่ของเวลา เฟรมเวิร์กได้บูรณาการโมดูลการเคลื่อนไหวเพิ่มเติมเข้าไปในสถาปัตยกรรม U-Net ของ Stable Diffusion
MagicDance : การฝึกอบรมก่อนและดาต้าเซต
สำหรับการฝึกอบรมก่อนหน้า เฟรมเวิร์ก MagicDance ใช้ดาต้าเซต TikTok ที่ประกอบด้วยวิดีโอการเต้นรำมากกว่า 350 วิดีโอที่มีความยาวต่างกันระหว่าง 10 ถึง 15 วินาที โดยมีคนเดินเต้นรำส่วนใหญ่ในแต่ละวิดีโอ โดยมีใบหน้าและร่างกายส่วนบนของมนุษย์
สำหรับการฝึกอบรมก่อนหน้า โมดูลการควบคุมการปรากฏตัวถูกฝึกอบรมด้วยขนาดแบตช์ของ 64 บน 8 NVIDIA A100 GPUs เป็นเวลา 10,000 ขั้นตอน โดยมีขนาดภาพ 512 x 512 ตามด้วยการปรับพารามิเตอร์ร่วมกันของโมดูลการควบคุมโพสที่และโมดูลการควบคุมการปรากฏตัวด้วยขนาดแบตช์ของ 16 เป็นเวลา 20,000 ขั้นตอน ระหว่างการฝึกอบรม เฟรมเวิร์ก MagicDance จะตัวอย่างสุ่มสองเฟรมเป็นเป้าหมายและอ้างอิงตามลำดับ โดยมีการตัดภาพที่ตำแหน่งเดียวกันและความสูงเดียวกัน ระหว่างการประเมิน โมเดลจะตัดภาพที่จุดศูนย์กลางแทนการตัดภาพสุ่ม
MagicDance : ผลลัพธ์
ผลลัพธ์การทดลองที่ดำเนินการบนเฟรมเวิร์ก MagicDance แสดงไว้ในรูปด้านล่าง และสามารถเห็นได้ว่าเฟรมเวิร์ก MagicDance มีประสิทธิภาพเหนือเฟรมเวิร์กอื่นๆ เช่น Disco และ DreamPose ในการถ่ายโอนการเคลื่อนไหวของมนุษย์

เป็นที่น่าสนใจที่จะทราบว่าเฟรมเวิร์ก MagicDance ได้รับคะแนน Face-Cos ที่ 0.426 ซึ่งเป็นการปรับปรุงที่ 156.62% เมื่อเทียบกับเฟรมเวิร์ก Disco และเพิ่มขึ้นเกือบ 400% เมื่อเทียบกับเฟรมเวิร์ก DreamPose ผลลัพธ์เหล่านี้แสดงให้เห็นถึงความสามารถที่แข็งแกร่งของเฟรมเวิร์ก MagicDance ในการรักษาอัตลักษณ์ และการเพิ่มขึ้นของประสิทธิภาพที่เห็นได้ชัดเจนแสดงให้เห็นถึงความเหนือกว่าของเฟรมเวิร์ก MagicDance เมื่อเทียบกับวิธีการที่ทันสมัยอื่นๆ
รูปด้านล่างเปรียบเทียบคุณภาพของการสร้างวิดีโอของมนุษย์ระหว่างเฟรมเวิร์ก MagicDance, Disco และ TPS และสามารถเห็นได้ว่าผลลัพธ์ที่สร้างโดยเฟรมเวิร์ก GT, Disco และ TPS มีปัญหาในการสอดคล้องกันของอัตลักษณ์ของมนุษย์และน้ำเสียงบนใบหน้า

นอกจากนี้ รูปด้านล่างแสดงให้เห็นถึงการแสดงออกของน้ำเสียงและโพสที่ของมนุษย์บนเซตข้อมูล TikTok โดยเฟรมเวิร์ก MagicDance สามารถสร้างน้ำเสียงและโพสที่ที่มีลักษณะเหมือนจริงและเป็นผลได้ภายใต้น้ำเสียงและโพสที่ที่หลากหลาย และรักษาอัตลักษณ์จากภาพอ้างอิงได้อย่างแม่นยำ

เป็นที่น่าสนใจที่จะทราบว่าเฟรมเวิร์ก MagicDance มีความสามารถในการสร้างแบบจำลองที่ดีสำหรับภาพอ้างอิงภายนอกที่ไม่เคยเห็นมาก่อนและรูปแบบที่หลากหลาย โดยไม่ต้องมีการปรับพารามิเตอร์เพิ่มเติมบนโดเมนที่เป็นเป้าหมาย และผลลัพธ์เหล่านี้แสดงไว้ในรูปด้านล่าง

รูปด้านล่างแสดงให้เห็นถึงความสามารถในการแสดงออกของเฟรมเวิร์ก MagicDance ในด้านการถ่ายโอนน้ำเสียงและโพสที่ของมนุษย์ และสามารถเห็นได้ว่าเฟรมเวิร์ก MagicDance สร้างแบบจำลองได้อย่างสมบูรณ์แบบสำหรับการเคลื่อนไหวของมนุษย์ในที่สาธารณะ

MagicDance : ข้อจำกัด
OpenPose เป็นส่วนประกอบที่สำคัญของเฟรมเวิร์ก MagicDance เนื่องจากมีบทบาทสำคัญในการควบคุมโพสที่ ซึ่งส่งผลต่อคุณภาพและความสอดคล้องในแง่ของเวลาของภาพที่สร้างขึ้นอย่างมาก อย่างไรก็ตาม เฟรมเวิร์ก MagicDance ยังคงพบปัญหาในการตรวจจับลักษณะใบหน้าและโพสที่ของมนุษย์ได้อย่างแม่นยำ โดยเฉพาะอย่างยิ่งเมื่อวัตถุในภาพมองไม่เห็นหรือเคลื่อนไหวอย่างรวดเร็ว ซึ่งอาจทำให้เกิดปัญหาในภาพที่สร้างขึ้น
สรุป
ในบทความนี้ เราได้พูดถึง MagicDance ซึ่งเป็นโมเดลที่อาศัยการกระจายตัวที่มีเป้าหมายในการปฏิวัติงานการถ่ายโอนการเคลื่อนไหวของมนุษย์ โดยมีเป้าหมายในการถ่ายโอนน้ำเสียงและโพสที่ของมนุษย์ 2 มิติไปยังวิดีโอการเต้นรำที่ท้าทาย โดยมีเป้าหมายในการสร้างวิดีโอการเต้นรำที่ขับเคลื่อนด้วยลำดับโพสที่ที่ใหม่สำหรับอัตลักษณ์ที่เป็นเป้าหมายโดยเฉพาะ ในขณะเดียวกันก็รักษาอัตลักษณ์ดั้งเดิมไว้
MagicDance เป็นแนวทางใหม่ในการสร้างวิดีโอของมนุษย์ที่มีลักษณะเหมือนจริงโดยการรวมการถ่ายโอนน้ำเสียงและโพสที่ และทำให้เกิดการเคลื่อนไหวที่สอดคล้องกันในสถานการณ์แบบเรียลไทม์โดยไม่ต้องมีการปรับพารามิเตอร์เพิ่มเติม ซึ่งแสดงให้เห็นถึงความก้าวหน้าที่สำคัญเหนือวิธีการที่มีอยู่ นอกจากนี้ เฟรมเวิร์ก MagicDance ยังแสดงให้เห็นถึงความสามารถในการสร้างแบบจำลองที่ดีสำหรับลำดับการเคลื่อนไหวที่ซับซ้อนและอัตลักษณ์ของมนุษย์ที่หลากหลาย โดยทำให้เฟรมเวิร์ก MagicDance เป็นผู้นำในด้านการถ่ายโอนการเคลื่อนไหวของมนุษย์และการสร้างวิดีโอที่ได้รับการช่วยเหลือจาก AI












