زاوية Anderson
نظام جديد لإنشاء شخصيات فيديو مستقرة زمنياً باستخدام التبديل المستقر

مبادرة جديدة من مجموعة Alibaba توفر واحدة من أفضل الطرق التي رأيتها لإنشاء تماثيل ثلاثية الأبعاد كاملة الجسم من نموذج أساسي قائم على التبديل المستقر.
المسمى MIMO (MIMicking with Object Interactions)، يستخدم النظام مجموعة من التكنولوجيات والوحدات الشهيرة، بما في ذلك نماذج ثلاثية الأبعاد قائمة على الحاسوب و AnimateDiff، لتمكين استبدال الشخصيات بانتظام زمني في مقاطع الفيديو – أو لتشغيل الشخصية بوسائل姿ية محددة من قبل المستخدم.
نرى هنا شخصيات مطبقة من مصدر صورة واحد، ومدفوعة بحركة محددة:
[انقر على الفيديو أدناه للتشغيل]
من صور مصدر واحدة، ثلاث شخصيات متنوعة مدفوعة بتسلسل وضع ثلاثي الأبعاد (المنطقة اليسرى) باستخدام نظام MIMO. انظر موقع المشروع والفيديو المصاحب على يوتيوب (مضمن في نهاية هذه المقالة) لمزيد من الأمثلة وبدقة أعلى. المصدر: https://menyifang.github.io/projects/MIMO/index.html
يمكن دمج الشخصيات التي تم إنشاؤها، والتي يمكن أيضًا أن تأتي من إطارات في مقاطع الفيديو وبالطرق المختلفة الأخرى، في لقطات من العالم الحقيقي.
يقدم نظام MIMO نظامًا جديدًا يولد ثلاثة ترميزات منفصلة، لكل من الشخصية والمنظر والتحديد (أي، التخفي، عندما يمر كائن أو شخص ما أمام الشخصية الموصوفة). يتم دمج هذه الترميزات في وقت الاستدلال.
[انقر على الفيديو أدناه للتشغيل]
يمكن لنظام MIMO استبدال الشخصيات الأصلية بشخصيات متوافقة أو مصنعة بشكل واقعي تتبع الحركة من مقطع الفيديو المستهدف. انظر موقع المشروع والفيديو المصاحب على يوتيوب (مضمن في نهاية هذه المقالة) لمزيد من الأمثلة وبدقة أعلى.
تم تدريب النظام على نموذج التبديل المستقر V1.5، باستخدام مجموعة بيانات مخصصة من قبل الباحثين، ومكونة بالتساوي من مقاطع فيديو حقيقية ومحاكاة.
الشر الحقيقي لمقاطع الفيديو القائمة على التبديل هو الاستقرار الزمني، حيث يلمع محتوى مقطع الفيديو أو “يتطور” بطرق غير مرغوبة لتمثيل الشخصية بشكل متسق.
نظام MIMO، بدلاً من ذلك، يستخدم صورة واحدة بشكل فعال كخريطة لتوجيه متسق، والتي يمكن أن تكون منسقة ومحددة بواسطة نموذج SMPL ثلاثي الأبعاد.
منذ أن يكون المرجع المستخدم متسقًا، ونموذج القاعدة الذي تم تدريبه عليه النظام قد تم تحسينه بمثالات حركة ممثلة بشكل كافٍ، فإن قدرات النظام لخرج متسق زمنيًا تتجاوز بشكل جيد المعيار العام للأفاتار القائم على التبديل.
[انقر على الفيديو أدناه للتشغيل]
أمثلة إضافية للشخصيات التي يتم تشغيلها بواسطة نظام MIMO. انظر موقع المشروع والفيديو المصاحب على يوتيوب (مضمن في نهاية هذه المقالة) لمزيد من الأمثلة وبدقة أعلى.
يصبح من الشائع استخدام صور فردية كمرجع لفعالية تمثيلات العصبية، إما بمفردها أو بطرق متعددة، مع تحفيزات نصية.
يعتقد الباحثون أن المبادئ المستخدمة في نظام MIMO يمكن توسيعها إلى أنظمة واطارات توليدية جديدة.
الورقة الجديدة بعنوان MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling، وهي من أربعة باحثين في معهد Alibaba للكمبيوتر الذكي. العمل له صفحة مشروع محمولة بالفيديو و صفحة مشروع و فيديو على يوتيوب، وهو أيضًا مضمن في نهاية هذه المقالة.
الطريقة
يحقق نظام MIMO الفصل التلقائي والغير مُشرّف للثلاثة مكونات المكانية المذكورة، في هيكل نهاية إلى نهاية (أي أن جميع العمليات الفرعية متكاملة في النظام، ويتعين على المستخدم فقط تقديم المواد المدخلة).

الschema المفاهيمي لنظام MIMO. المصدر: https://arxiv.org/pdf/2409.16160
تُترجم الكائنات في مقاطع الفيديو الأصلية من 2D إلى 3D، في البداية باستخدام مقدر عمق أحادي العين Depth Anything. يتم استخراج العنصر البشري في أي إطار باستخدام طرق مُعدلة من مشروع Tune-A-Video.
تُترجم هذه الميزات إلى مكونات حجمية فيديو عبر هيكل Segment Anything 2 من بحث فيسبوك.
يتحصل على طبقة المشهد نفسها عن طريق إزالة الكائنات المكتشفة في الطبقات الأخرى، مما يوفر قناعًا شبيهًا بالروتوسكوب تلقائيًا.
对于 الحركة، يتم تثبيت مجموعة من رموز الكائنات البشرية المستخرجة إلى نموذج SMPL ثلاثي الأبعاد القياسي، الذي يوفر السياق لمحتوى الإنسان المُحاكى.
يتم الحصول على خريطة ميزة 2D لمحتوى الإنسان بواسطة مُحاكي قابل للتفريق مُشتق من مبادرة 2020 من NVIDIA. بالجمع بين البيانات الثلاثية الأبعاد التي تم الحصول عليها من SMPL مع البيانات الثنائية الأبعاد التي تم الحصول عليها بواسطة طريقة NVIDIA، فإن رموز الكائنات العصبية التي تمثل “الشخص العصبي” لها مرجعية صلبة لموضوعها.
في هذه النقطة، من الضروري إنشاء مرجع مشترك يُستخدم عادةً في الهياكل التي تستخدم SMPL – الوضع القياسي. هذا مشابه ل “‘رجل فيتروفيان’” لليوناردو دا فينشي، حيث يمثل قالبًا صفرًا يمكن أن يقبل المحتوى ثم يُشوه، مع أخذ المحتوى المُخيط بالنقاط معه.
تُمثل هذه التشوهات، أو “الانحرافات عن القاعدة”، الحركة البشرية، بينما يحافظ نموذج SMPL على رموز الكائنات التي تشكل الهوية البشرية التي تم استخراجها، وبالتالي يمثل التمثال الناتج بشكل صحيح من حيث الوضع والtexture.

مثال على وضع قياسي في نموذج SMPL. المصدر: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
بخصوص مسألة الارتباط (مدى عدم مرونة البيانات المدربة عند تمديدها إلى ما وراء حدودها وارتباطاتها)، يقول المؤلفون*:
‘للفصل الكامل للمظهر عن إطارات الفيديو المُوضحة، الحل المثالي هو تعلم التمثيل البشري الديناميكي من الفيديو الأحادي العين و تحويله من مساحة المُوضحة إلى الفضاء القياسي.
‘نظرًا للكفاءة، نستخدم طريقة مبسطة تُحول مباشرة الصورة البشرية المُوضحة إلى النتيجة القياسية باستخدام نموذج إعادة وضع بشري مُسبق التدريب. يتم تغذية صورة المظهر القياسي المُ合نتة إلى مشفرات الهوية للحصول على رمز الهوية.
‘هذا التصميم البسيط يُمكن من فصل كامل لسمات الهوية والحركة. بعد [Animate Anyone], تشمل مشفرات الهوية مشفر صورة CLIP و هيكل شبكة المرجع لتحويل الميزة العالمية والمحلية، [على التوالي].’
对于 جوانب المشهد والتحديد، يتم استخدام محول متغير مشترك وثابت (VAE – في هذه الحالة المشتق من نشر 2013) لتحويل عناصر المشهد والتحديد إلى الفضاء الكمومي. يتم التعامل مع التناقضات بواسطة طريقة التمليس من مشروع ProPainter 2023.
بمجرد تجميعها وتصحيحها بهذه الطريقة، سيوفر كل من الخلفية والكائنات التي تحجب في مقطع الفيديو قناعًا للتمثال البشري المتحرك.
تُغذى هذه السمات المُفككة إلى هيكل U-Net المُستند إلى هيكل التبديل المستقر V1.5. يتم إضافة رمز المشهد الكامل مع الضوضاء الكمومية الأصلية للنظام. يتم دمج المكون البشري بواسطة طبقات الانتباه الذاتي والانتباه المتقاطع، على التوالي.
ثم يتم إخراج النتيجة المُزالة من الضوضاء عبر مُشفر VAE.
البيانات والاختبارات
للتدريب، أنشأ الباحثون مجموعة بيانات فيديو بشرية بعنوان HUD-7K، والتي تتكون من 5000 فيديو بشري حقيقي و 2000 تحريك اصطناعي تم إنشاؤها بواسطة نظام En3D. لم تكن مقاطع الفيديو الحقيقية بحاجة إلى تعليقات، بسبب الطبيعة غير الدلالية لإجراءات استخراج الشكل في هيكل نظام MIMO.
تم تدريب النموذج على ثمانية من وحدات معالجة الرسومات A100 من NVIDIA (على الرغم من أن الورقة لا تحدد ما إذا كانت هذه النماذج من نوع 40GB أو 80GB من ذاكرة VRAM)، لمدة 50 تكرارًا، باستخدام 24 إطارًا فيديو و حجم批ة من أربعة، حتى التوافق.
تم تدريب وحدة الحركة للنظام على أوزان AnimateDiff. خلال عملية التدريب، تم تجميد أوزان مشفر VAE و مشفر صورة CLIP (على عكس التحسين الدقيق الكامل، الذي سيكون له تأثير أوسع على نموذج أساسي).
على الرغم من أن نظام MIMO لم يتم تجريبه ضد أنظمة مماثلة، اختبر الباحثون النظام على تسلسلات حركة صعبة غير موجودة في التوزيع من AMASS و Mixamo. وشملت هذه الحركات التسلق واللعب والرقص.
كما اختبروا النظام على مقاطع فيديو بشرية في البرية. في كلتا الحالتين، تقارير الورقة “المتانة العالية” لهذه الحركات الثلاثية الأبعاد غير الموجودة في التوزيع من زوايا مختلفة.
على الرغم من أن الورقة تقدم نتائج صور ثابتة متعددة تُظهر فعالية النظام، فإن الأداء الحقيقي لنظام MIMO يتم تقييمه بشكل أفضل مع النتائج الفيديوية الواسعة المقدمة في صفحة المشروع وفي الفيديو على يوتيوب المضمن في نهاية هذه المقالة (الذي تم استخلاصه من مقاطع الفيديو في بداية هذه المقالة).
يختم المؤلفون بالقول:
‘تُظهر النتائج التجريبية أن طريقةنا تمكّن من التحكم المرن في الشخصية والحركة والمشهد، بالإضافة إلى القدرة على التوسع إلى شخصيات وحركات جديدة، وتنطبق على مشاهد تفاعلية.
‘نعتقد أيضًا أن حلنا، الذي يأخذ في الاعتبار الطبيعة الثلاثية الأبعاد الأساسية ويكون ترميز الفيديو الثنائي الأبعاد تلقائيًا إلى مكونات مكانية هرمية، يمكن أن يلهم الأبحاث المستقبلية لتركيب فيديو ثلاثي الأبعاد.
‘علاوة على ذلك، فإن إطارنا لا يصلح فقط لإنشاء مقاطع فيديو للشخصيات، بل يمكن أيضًا تعديله بشكل محتمل لمهام تركيب فيديو قابلة للتحكم أخرى.’
الاستنتاج
من المُفرح أن نرى نظامًا لتمثيل الأفاتار يعتمد على التبديل المستقر ويبدو قادرًا على استقرار زمني如此.
الأفاتار المُصمم بشكل مصنّع الذي تمثله النتائج فعال، وعلى الرغم من أن مستوى الواقعية التي يمكن أن ينتجها نظام MIMO لا يُقارن حاليًا بما يمكن أن ينتجه التصب الجاوسي، فإن الفوائد المتعددة لإنشاء أفاتار بشري متسق زمنيًا في شبكة انتشار لاتنتي متعددة الشبكات هي كبيرة.
* تحويلي لمراجع المؤلفين الداخلية إلى روابط وروابط توضيحية خارجية عند الضرورة.
نُشر لأول مرة يوم الأربعاء، 25 سبتمبر 2024












