نماذج ومنصات الذكاء الاصطناعي
MagicDance: إنشاء فيديوهات رقص بشرية واقعية
يعتبر الرؤية الحاسوبية واحدة من المجالات الأكثر مناقشة في صناعة الذكاء الاصطناعي، وذلك بسبب التطبيقات المحتملة على نطاق واسع من المهام في الوقت الفعلي. في السنوات الأخيرة، تقدمت إطارات الرؤية الحاسوبية بسرعة، حيث أصبحت النماذج الحديثة قادرة على تحليل الميزاتFacial، والأجسام، والمزيد في ظروف زمنية حقيقية. على الرغم من هذه القدرات، لا يزال نقل حركة الإنسان تحديًا كبيرًا للنماذج الحاسوبية للرؤية. يتضمن هذا المهمة إعادة توجيه حركات الوجه والجسم من صورة أو فيديو مصدر إلى صورة أو فيديو مستهدف. يستخدم نقل حركة الإنسان على نطاق واسع في نماذج الرؤية الحاسوبية لتحويل الصور أو الفيديوهات، وتحرير المحتوى المتعددي، والتركيب البشري الرقمي، وحتى توليد البيانات لإطارات الإدراك القائم على الإدراك.
في هذه المقالة، نركز على MagicDance، وهو نموذج قائم على الاندماج مصمم لثورة نقل حركة الإنسان. يهدف إطار MagicDance بشكل خاص إلى نقل تعابير الوجه والحركات البشرية ثنائية الأبعاد إلى فيديوهات رقص بشرية صعبة. هدفها هو توليد فيديوهات رقص جديدة مدفوعة بتسلسل المواقف للهويات المستهدفة مع الحفاظ على الهوية الأصلية. يستخدم إطار MagicDance استراتيجية تدريب من مرحلتين، تركز على فصل حركة الإنسان وعوامل المظهر مثل لون البشرة، وتعابير الوجه، والملابس. سنغوص في إطار MagicDance، استكشاف هيكله، ووظائفه، وأدائه مقارنةً بإطارات نقل حركة الإنسان الأخرى المتقدمة. دعونا نغوص في الموضوع.
MagicDance: نقل حركة بشرية واقعية
كما ذكرنا سابقًا، نقل حركة الإنسان هو واحد من أكثر مهام الرؤية الحاسوبية تعقيدًا بسبب التعقيد الشديد المشارك في نقل الحركات والإعبرات البشرية من الصورة أو الفيديو المصدر إلى الصورة أو الفيديو المستهدف. تقليديًا، حققت إطارات الرؤية الحاسوبية نقل حركة الإنسان من خلال تدريب نموذج مولد محدد للمهمة، بما في ذلك GAN أو الشبكات التوليدية المعارضة على مجموعات بيانات مستهدفة لتعابير الوجه ومواقف الجسم. على الرغم من أن تدريب واستخدام النماذج المولدة يؤديان نتائج مرضية في بعض الحالات، غالبًا ما يعانيان من两个 قيود رئيسية.
- يعتمدان بشكل كبير على مكون تشويش الصورة نتيجة لذلك غالبًا ما يصعب عليهما استيفاء أجزاء الجسم غير المرئية في الصورة المصدر بسبب تغيير في المنظور أو الإغلاق الذاتي.
- لا يمكنهما تعميمها إلى صور أخرى مصدرة خارجيًا مما يقيد تطبيقاتهما خاصةً في السيناريوهات الزمنية الحقيقية في البرية.

أظهرت النماذج الحديثة للاندماج القدرة الاستثنائية على توليد الصور عبر ظروف مختلفة، واليوم يمكن للنماذج الاندماجية تقديم صور قوية في مجموعة من المهام الزمنية مثل توليد الفيديو وملء الصور من خلال التعلم من مجموعات بيانات الصور على مستوى الويب. نظرًا لقدراتها، قد تكون النماذج الاندماجية خيارًا مثاليًا لمهام نقل حركة الإنسان. على الرغم من أن النماذج الاندماجية يمكن تنفيذها لنقل حركة الإنسان، إلا أنها تملك بعض القيود إما من حيث جودة المحتوى المولدة أو من حيث الحفاظ على الهوية أو معاناة من عدم الاتساق الزمني نتيجة لتصميم النموذج واستراتيجية التدريب.
للتغلب على العوائق التي تواجهها النماذج الاندماجية والGAN في مهام نقل حركة الإنسان، قدم المطورون MagicDance، وهو إطار جديد يهدف إلى استغلال إمكانيات إطارات الاندماج لنقل حركة الإنسان مع مستوى غير مسبوق من الحفاظ على الهوية، وجودة بصرية فائقة، وعمومية النطاق. في جوهره، مفهوم إطار MagicDance الأساسي هو تقسيم المشكلة إلى مرحلتين: التحكم في المظهر والتحكم في الحركة، وهي القدرتان المطلوبتان من إطارات الاندماج لتقديم مخرجات نقل حركة دقيقة.

الرسم أعلاه يوفر نظرة عامة موجزة على إطار MagicDance، ويمكن رؤية أن الإطار يستخدم نموذج الاندماج المستقر، ويتم توزيع مكونين إضافيين: نموذج التحكم في المظهر وشبكة التحكم في المواقف، حيث يوفر الأول توجيه المظهر إلى نموذج SD من خلال صورة مرجعية عن طريق الانتباه، بينما يوفر الآخر توجيه التعبير/المواقف إلى نموذج الاندماج من صورة أو فيديو مشروط. يدمج الإطار أيضًا استراتيجية تدريب متعددة المراحل لتعلم هذه الوحدات الفرعية بشكل فعال لفصل التحكم في المواقف والمظهر.
باختصار، إطار MagicDance هو
- إطار جديد وفعال يتكون من التحكم في المواقف المنفصل عن المظهر، والتحكم المسبق في المظهر.
- إطار MagicDance قادر على توليد تعابير وجهية بشرية وحركات بشرية واقعية تحت سيطرة مدخلات الحالة ومواقف الإشارة وصور أو فيديوهات المرجع.
- يهدف إطار MagicDance إلى توليد محتوى بشري متسق في المظهر من خلال إدخال وحدة الانتباه متعددة المصادر التي توفر توجيهًا دقيقًا لإطار الاندماج المستقر.
- يمكن استخدام إطار MagicDance أيضًا كتوسيع أو ملحق مناسب لإطار الاندماج المستقر، ويتوافق مع أوزان النموذج الحالية دون الحاجة إلى تعديل إضافي لل매개 Variables.
إضافة إلى ذلك، يظهر إطار MagicDance قدرات عامة استثنائية لكل من المظهر والحركة.
- تعميم المظهر: يظهر إطار MagicDance قدرات فائقة عند توليد مظاهر متنوعة.
- تعميم الحركة: يمتلك إطار MagicDance أيضًا القدرة على توليد مجموعة واسعة من الحركات.
MagicDance: الأهداف والهيكل
对于 صورة مرجعية معينة إما لشخص حقيقي أو صورة مصممة، الهدف الرئيسي لإطار MagicDance هو توليد صورة أو فيديوخرج مشروط على المدخلات ومواقف الإشارة {P, F} حيث تمثل P هيكل مواقف الإنسان، وF تمثل معالم الوجه. يجب أن تكون الصورة أو الفيديو الناتج قادرة على الحفاظ على مظهر وهوية الأشخاص المشاركين بالإضافة إلى المحتوى الخلفي الموجود في صورة المرجع مع الحفاظ على المواقف والتعبيرات المحددة بواسطة مدخلات المواقف.
الهيكل
خلال التدريب، يُدرَب إطار MagicDance كمهام إعادة بناء الإطارات لتحقيق الصورة الحقيقية مع صورة المرجع ومدخلات المواقف المستمدة من نفس فيديو المرجع. خلال الاختبار لتحقيق نقل الحركة، يتم الحصول على مدخلات المواقف وصور المرجع من مصادر مختلفة.
يمكن تقسيم هيكل إطار MagicDance بشكل عام إلى أربعة فئات: المرحلة الأولية، وتحكم المظهر مسبقًا، وتحكم المواقف المنفصل عن المظهر، ووحدة الحركة.
المرحلة الأولية
تمثل نماذج الاندماج الكفء نماذج اندماجية مصممة بشكل فريد للعمل في الفضاء الكفئ بفضل استخدام المُحَوِّل الذاتي، ويُعد إطار الاندماج المستقر مثالًا بارزًا على نماذج LDMs التي تستخدم محول كمومي-متغير ذاتي وتركيب U-Net الزمني. يستخدم إطار الاندماج المستقر محول CLIP-قائم على.transformer كمحول نصي لمعالجة المدخلات النصية من خلال تحويل النصوص إلى تعبيرات.
تحكم المظهر مسبقًا
تُعد مشكلة رئيسية مع إطار التحكم في الشبكة الأصلي عدم قدرته على التحكم في المظهر بين الحركات المتغيرة مكانيًا بشكل متسق، على الرغم من أنه يولد صورًا تتشابه مواقفها مع تلك الموجودة في صورة الإدخال، مع تأثير المظهر العام بشكل رئيسي بواسطة المدخلات النصية. على الرغم من أن هذه الطريقة تعمل، إلا أنها لا تتناسب مع مهام نقل الحركة التي لا تعتمد على المدخلات النصية ولكن على صورة المرجع كالمصدر الأساسي للمعلومات حول المظهر.
تم تصميم وحدة تحكم المظهر مسبقًا في إطار MagicDance كفرع مساعد لتوجيه التحكم في المظهر بطريقة متدرجة. بدلاً من الاعتماد على المدخلات النصية، يركز الإطار العام على استغلال سمات المظهر من صورة المرجع بهدف تعزيز قدرة الإطار على توليد سمات المظهر بدقة، خاصة في السيناريوهات التي تتضمن ديناميات حركية معقدة. بالإضافة إلى ذلك، يكون نموذج التحكم في المظهر فقط قابلًا للتدريب خلال تدريب التحكم في المظهر.
تحكم المواقف المنفصل عن المظهر
يمكن حل التحكم في المواقف في الصورة الناتجة بدمج نموذج التحكم في الشبكة المسبق التدريب مباشرة مع نموذج التحكم في المظهر المسبق التدريب دون تعديل. ومع ذلك، قد يؤدي هذا الدمج إلى صعوبة في التحكم المستقل في المواقف، مما يؤدي إلى اختلاف بين مواقف الإدخال والمواقف المولدة. لمعالجة هذا الاختلاف، يُعدل إطار MagicDance نموذج التحكم في الشبكة بشكل مشترك مع نموذج التحكم في المظهر المسبق التدريب.
وحدة الحركة
عند العمل معًا، يمكن لنموذج التحكم في المواقف المنفصل عن المظهر ونموذج التحكم في المظهر تحقيق نقل صورة إلى حركة دقيق وفعال، على الرغم من أنه قد يؤدي إلى عدم الاتساق الزمني. لضمان الاتساق الزمني، يدمج الإطار وحدة حركة إضافية في هيكل الاندماج المستقر الأساسي.
MagicDance: التدريب مسبقًا والبيانات
للتدريب المسبق، يستخدم إطار MagicDance مجموعة بيانات TikTok التي تتكون من أكثر من 350 فيديو رقص بطول مختلف يتراوح بين 10 و15 ثانية، ويتم تسجيل معظم هذه الفيديوهات لشخص واحد يرقص، وتحتوي معظمها على الوجه وجزء العلوي من الجسم. يُستخرج كل فيديو فردي بسرعة 30 إطارًا في الثانية، ويتعين تشغيل OpenPose على كل إطار على حدة لاستنتاج هيكل المواقف، ومواقف اليدين، ومعالم الوجه.
للتدريب المسبق، يتم تدريب نموذج التحكم في المظهر مسبقًا بكمية 배ッチ 64 على 8 وحدات معالجة رسومات NVIDIA A100 لمدة 10 آلاف خطوة مع حجم صورة 512 × 512، يلي ذلك تعديل مشترك لنموذج التحكم في المواقف ونموذج التحكم في المظهر بكمية 배ッチ 16 لمدة 20 ألف خطوة. خلال التدريب، يُختار إطار MagicDance بشكل عشوائي إطارين كهدف ومرجع على التوالي، مع تقطيع الصور في نفس الموقع وبنفس الارتفاع. خلال التقييم، يُقطع الإطار الصورة بشكل مركزي بدلاً من تقطيعها بشكل عشوائي.
MagicDance: النتائج
تظهر النتائج التجريبية التي أجريت على إطار MagicDance في الصورة التالية، ويمكن رؤية أن إطار MagicDance يتفوق على الإطارات الحالية مثل Disco وDreamPose لنقل الحركة البشرية عبر جميع المقاييس. الإطارات التي تحتوي على “*” قبل اسمها تستخدم صورة المستهدف مباشرة كمدخل، وتشمل المزيد من المعلومات مقارنةً بالإطارات الأخرى.

من المثير للاهتمام أن إطار MagicDance يحقق درجة Face-Cos تبلغ 0.426، مما يعكس تحسنًا بنسبة 156.62% مقارنةً بإطار Disco، وزيادة تقارب 400% عند مقارنته بإطار DreamPose. تشير النتائج إلى القدرة القوية لإطار MagicDance على الحفاظ على معلومات الهوية، وتظهر التحسينات الواضحة في الأداء تفوق إطار MagicDance على الطرق الحالية المتقدمة.
تظهر الصور التالية مقارنةً بجودة توليد فيديو الإنسان بين إطارات MagicDance وDisco وTPS. كما يمكن ملاحظة أن النتائج التي تم توليدها بواسطة الإطارات GT وDisco وTPS تعاني من عدم الاتساق في هوية المواقف والتعبيرات الوجهية.

علاوة على ذلك، تُظهر الصورة التالية تجسيد نقل تعبير الوجه ومواقف الإنسان على مجموعة بيانات TikTok، حيث يمكن لإطار MagicDance توليد تعابير واقعية وحركات تحت معالم وجهية ومدخلات هيكل المواقف المتنوعة مع الحفاظ الدقيق على معلومات الهوية من صورة الإدخال المرجعية.

يُلاحظ أن إطار MagicDance يمتلك قدرات عامة استثنائية لصور المرجع الخارجية غير المرئية ومواقف وأساليب غير مسبوقة مع سيطرة ممتازة على المظهر حتى بدون أي تعديل إضافي على المجال المستهدف، وتظهر النتائج في الصورة التالية.

تُظهر الصور التالية قدرات التجسيد لحركة الإنسان وإمكانية نقل تعبير الوجه لحركة الإنسان. كما يمكن رؤية أن إطار MagicDance يعمم الحركات البشرية في البرية بشكل مثالي.

MagicDance: القيود
يُعد OpenPose مكونًا أساسيًا في إطار MagicDance لأنه يلعب دورًا حاسمًا في التحكم في المواقف، مما يؤثر على جودة وثبات الصور المولدة بشكل كبير. ومع ذلك، يجد إطار MagicDance بعض الصعوبة في الكشف عن معالم الوجه وهيكل المواقف بدقة، خاصةً عندما تكون الأجسام في الصور غير مرئية بشكل 부분ي أو تظهر حركة سريعة. يمكن أن تؤدي هذه القضايا إلى تشويهات في الصورة الناتجة.
الختام
في هذه المقالة، ناقشنا إطار MagicDance، وهو نموذج قائم على الاندماج يهدف إلى ثورة نقل حركة الإنسان. يحاول إطار MagicDance نقل تعابير الوجه وحركات الإنسان ثنائية الأبعاد إلى فيديوهات رقص بشرية صعبة، مع هدف توليد فيديوهات رقص بشرية جديدة مدفوعة بتسلسل المواقف للهويات المستهدفة مع الحفاظ على الهوية الثابتة. يُعتمد إطار MagicDance على استراتيجية تدريب من مرحلتين لفصل حركة الإنسان وعوامل المظهر مثل لون البشرة وتعابير الوجه والملابس.
يُعد MagicDance نهجًا جديدًا لتوليد فيديوهات بشرية واقعية من خلال دمج نقل تعبير الوجه وحركة الإنسان، وتمكين التحرير المستمر في البرية دون الحاجة إلى أي تعديل إضافي، مما يُظهر تقدمًا كبيرًا على الطرق الحالية. بالإضافة إلى ذلك، يُظهر إطار MagicDance قدرات عامة استثنائية على تسلسلات الحركة المعقدة والهويات البشرية المتنوعة، مما يُثبت أن إطار MagicDance يُعد الرائد في مجال نقل الحركة وإنشاء الفيديو بمساعدة الذكاء الاصطناعي.












