زاوية Anderson

إنشاء فيديو أفضل باستخدام الذكاء الاصطناعي من صورة واحدة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Images from the accompanying YouTube video for the paper 'Framer: Interactive Frame Interpolation'. Source: https://www.youtube.com/watch?v=4MPGKgn7jRc

تعد تقنية تحويل الإطارات (VFI) مشكلة مفتوحة في أبحاث الفيديو التوليدية. وتتمثل التحديات في توليد إطارات متوسطة بين إطارين موجودين في تسلسل فيديو.

انقر للعب. تعد إطار FILM إطارًا مشتركًا بين جوجل وجامعة واشنطن، واقترح طريقة فعالة لتحويل الإطارات التي لا تزال شائعة في مجالات الهواة والمحترفين. على اليسار ، يمكننا رؤية الإطارات المنفصلة والمختلفة المتراكبة؛ في منتصف الصورة ، الإطار “النهاية”؛ وعلى اليمين ، التركيب النهائي بين الإطارات. مصادر: https://film-net.github.io/ و https://arxiv.org/pdf/2202.04901

بشكل عام، تعود هذه التقنية إلى أكثر من قرن، وكانت مستخدمة في الرسوم المتحركة التقليدية منذ ذلك الحين. في ذلك السياق، تم إنشاء إطارات رئيسية من قبل فنان رسوم متحركة رئيسي، بينما كانت مهمة “التWEEN” لإطارات متوسطة يتم إجراؤها بواسطة موظفين آخرين، كمهمة أكثر تقليدية.

قبل ظهور الذكاء الاصطناعي التوليدي، تم استخدام تقنية تحويل الإطارات في مشاريع مثل تقدير التدفق المتوسط في الوقت الفعلي (RIFE)، تحويل إطارات الفيديو المتأثر بالعمق (DAIN)، و تحويل الإطارات من أجل الحركة الكبيرة (FILM – انظر أعلاه) لغرض زيادة معدل الإطارات في فيديو موجود، أو تمكين تأثيرات البطء الاصطناعي. يتم ذلك من خلال تقسيم الإطارات الموجودة في مقطع إلى إطارات متوسطة مقدرة.

إطارات النهاية في أنظمة الفيديو التوليدية

تسمح الأنظمة التوليدية الحديثة مثل Luma و Kling للمستخدمين بتحديد إطار بداية و إطار نهاية، ويمكن أن تقوم بهذه المهمة من خلال تحليل النقاط الرئيسية في الصورتين و تقدير مسار بين الصورتين.

كما يمكننا رؤية في الأمثلة أدناه، تقديم “إطار إغلاق” يسمح للنظام التوليدي للفيديو (في هذه الحالة، Kling) بالحفاظ على جوانب مثل الهوية، حتى لو كانت النتائج ليست مثالية (特别 مع الحركات الكبيرة).

انقر للعب. Kling هو واحد من عدد متزايد من مولدي الفيديو، بما في ذلك Runway و Luma، التي تسمح للمستخدم بتحديد إطار نهاية. في معظم الحالات، سوف يؤدي الحركة الأقل إلى نتائج أكثر واقعية وأقل عيوب. مصدر: https://www.youtube.com/watch?v=8oylqODAaH8

في المثال أعلاه، يتم الحفاظ على هوية الشخص بين الإطارات الرئيسية المحددة من قبل المستخدم، مما يؤدي إلى توليد فيديو متسق نسبيًا.

عندما يتم توفير إطار البداية فقط، فإن نافذة الانتباه للنظام التوليدي ليست عادة كبيرة بما يكفي ل “تذكر” ما كان يبدو عليه الشخص في بداية الفيديو. بدلاً من ذلك، من المحتمل أن تتغير الهوية قليلاً مع كل إطار، حتى تفقد كل الشبه.

Framer

هذا يأتي إلى ورقة بحثية مثيرة للاهتمام حديثة من الصين، والتي تدعي أنها حققت حالة جديدة من الفن في تحويل الإطارات الواقعية – وهي الأولى من نوعها التي تقدم تفاعل مستخدم قائم على السحب.

Framer يسمح للمستخدم بتوجيه الحركة باستخدام واجهة سحب直观، على الرغم من أنه يحتوي أيضًا على وضع “أوتوماتيكي”. مصدر: https://www.youtube.com/watch?v=4MPGKgn7jRc

تطبيقات السحب أصبحت معتادة في الأدب أخيرًا، حيث يكافح قطاع البحث لتقديم أدوات للنظام التوليدي الذي لا يعتمد على النتائج الخشنة التي تم الحصول عليها بواسطة نصوص التحفيز.

يمكن للنظام الجديد، الذي يسمى Framer، اتباع السحب الموجه من قبل المستخدم، بالإضافة إلى وضع “طيار tự động” أكثر تقليدية. بالإضافة إلى التWEEN المعتاد، يمكن للنظام إنتاج محاكاة समय، بالإضافة إلى تحويل الشكل وتصوير جديد للصورة الإدخال.

الطريقة

يستخدم Framer تحويل الإطارات القائم على النقاط في أي من وضائعه. يتم تقييم الصورة الإدخال لتحديد Sites الأساسية، وتم تخصيص Sites “قابل للحركة” عند الضرورة.

قام الباحثون بتحسين Stable Video Diffusion (SVD) على مجموعة بيانات OpenVid-1M، بإضافة القدرة على合成 الإطار الأخير.

البيانات والاختبارات

لتحسين Framer، تم تجميد الانتباه المكاني والكتل المتبقية، وتم影响 فقط طبقات الانتباه الزمني والكتل المتبقية.

تم تدريب النموذج لمدة 10,000 تكرار تحت AdamW، بمعدل تعلم 1e-4، و حجم.batch 16. تم إجراء التدريب عبر 16 معالجًا رسوميًا من نوع NVIDIA A100.

نظرًا لأن النهج السابقة للمشكلة لا تقدم تحريرًا قائمًا على السحب، فقد اخترت الباحثون مقارنة وضع تشغيل Framer التلقائي بالوظائف القياسية للعروض القديمة.

تم اختبار الإطارات التالية لفئة أنظمة توليد الفيديو القائمة على الانتشار: LDMVFI؛ Dynamic Crafter؛ و SVDKFI. بالنسبة لأنظمة الفيديو التقليدية، كانت الإطارات المتسابقة هي AMT؛ RIFE؛ FLAVR؛ والإطار المذكور أعلاه.

الاستنتاج

من الصعب التأكيد على مدى أهمية هذا التحدي الحالي لمهمة توليد الفيديو القائم على الذكاء الاصطناعي. حتى الآن، تم استخدام حلول أقدم مثل FILM و EbSynth، من قبل المجتمعات الهواة والمحترفة، لتحويل الإطارات؛ ولكن هذه الحلول تأتي مع قيود ملحوظة.

بسبب التحرير غير الصادق لمقاطع الفيديو الرسمية للعوامل الجديدة من النوع T2V، هناك مفهوم خاطئ واسع النطاق بين الجمهور بأن أنظمة التعلم الآلي يمكن أن تدرك بدقة الهندسة في الحركة دون اللجوء إلى آليات التوجيه مثل نماذج المورفولوجيا ثلاثية الأبعاد (3DMMs)، أو نهجًا مساعدًا آخر مثل LoRAs.

لقد كان من الصعب تحقيق حركات كبيرة وبطولة، نظرًا للطبيعة التدريجية لاستخلاص إطار جديد من مجموعة صغيرة من الإطارات السابقة.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai