زاوية Anderson
مايكروسوفت تقترح GODIVA، إطار عمل تعلم الآلة لتحويل النص إلى فيديو

تعاون بين Microsoft Research Asia وجامعة ديوك أنتج نظامًا قائمًا على تعلم الآلة يمكنه توليد فيديو من النص فقط بدون استخدام الشبكات المعادية التوليدية (GANs).
المشروع هو GODIVA (توليد فيديوهات مفتوحة المجال من وصفات طبيعية)، ويتأسس على بعض المناهج المستخدمة في نظام合成 الصور DALL-E من OpenAI، المكشوف في وقت سابق من هذا العام.

نتائج أولية من GODIVA، مع إطارات من الفيديوهات التي تم إنشاؤها من两个 نصين. مصدر: https://arxiv.org/pdf/2104.14806.pdf
GODIVA يستخدم نموذج VQ-VAE المقدم لأول مرة من قبل الباحثين من مشروع DeepMind في Google في عام 2018، وهو أيضًا مكون أساسي في قدرات DALL-E التحويلية.

هيكل نموذج VQ-VAE، مع مساحة التضمين إلى اليمين ومساحة المشفر والفك التشفير المشتركة لتقليل الخسائر أثناء الإعادة بناء. مصدر: https://arxiv.org/pdf/1711.00937.pdf
تم استخدام VQ-VAE في العديد من المشاريع لتوليد فيديو متوقع، حيث يقدم المستخدم عددًا من الإطارات الأولية ويتطلب من النظام توليد إطارات إضافية:

عمل سابق: VQ-VAE يفترض الإطارات من المواد المصدر المحدودة. مصدر: المواد الإضافية في https://openreview.net/forum?id=bBDlTR5eDIX
然而، يزعم مؤلفو الورقة الجديدة أن GODIVA يمثل التنفيذ الأول للنص إلى الفيديو (T2V) الذي يستخدم VQ-VAE بدلاً من النتائج غير المنتظمة التي حصلت عليها المشاريع السابقة باستخدام GANs.
نقاط البذرة في النص إلى الفيديو
على الرغم من أن الورقة قصيرة على التفاصيل حول المعايير التي يتم بموجبها إنشاء الإطارات الأولية، يبدو أن GODIVA يستدعي صورًا أولية من لا مكان قبل أن يستمر في استخلاصها إلى إطارات فيديو منخفضة الدقة.
في الواقع، تأتي البذرة من التسميات في البيانات المستخدمة: تم تدريب GODIVA مسبقًا على مجموعة بيانات Howto100M، التي تتكون من 136 مليون مقطع فيديو مصحوبًا بالتعليقات من يوتيوب على مدار 15 عامًا، وتتميز بـ 23,000 نشاطًا مصنفًا. ومع ذلك، فإن كل نشاط ممكن موجود في أعداد كبيرة جدًا من المقاطع، ويزيد مع التعميم (أي أن ‘الحيوانات الأليفة والحيوانات’ لها 3.5 مليون مقطع، بينما ‘الكلاب’ لها 762,000 مقطع)، ولذلك لا يزال هناك خيار كبير لبدء النقاط.
تم تقييم النموذج على مجموعة بيانات Microsoft’s MSR Video to Text (MSR-VTT). كما تم اختبار GODIVA كتجربة إضافية للهيكل، تم تدريبه من الصفر على مجموعة بيانات Moving Mnist ومجموعة بيانات Double Moving Mnist، وكلاهما مشتق من قاعدة بيانات MNIST الأصلية، وهي تعاون بين Microsoft وGoogle ومعهد Courant للعلوم الرياضية في NYU.
تقييم الإطارات في توليد الفيديو المستمر
في خط مع IRC-GAN من جامعة بكين، يضيف GODIVA أربعة فحوصات عمودية إضافية إلى طريقة MNIST الأصلية، والتي تقييم الإطارات السابقة واللاحقة بالانتقال من الأعلى إلى الأسفل ثم من اليسار إلى اليمين. IRC-GAN وGODIVA يعتبران أيضًا الإطارات بالانتقال من اليسار إلى اليمين، من اليمين إلى اليسار، من الأعلى إلى الأسفل ومن الأسفل إلى الأعلى.
تقييم جودة الفيديو والولاء للنص
为了了解 كيف نجح توليد الصورة، استخدم الباحثون两个 معايير: أحدهما يعتمد على تشابه CLIP، والآخر هو معيار التطابق النسبي (RM) الجديد.
إطار عمل CLIP من OpenAI يمكنه مطابقة الصور للنص بدون إطلاق، بالإضافة إلى تسهيل توليد الصور من خلال عكس هذا النموذج. قام الباحثون بقسم تقييم CLIP المشتق على التشابه الحسابي بين النص والفيديو الحقيقي لتحقيق درجة RM. في جولة تقييم منفصلة، تم تقييم الإخراج بواسطة 200 شخص والنتائج مقارنة بالدرجات البرمجية.
أخيرًا، تم اختبار GODIVA ضد إطاران سابقان، TFGAN و T2V من تعاون ديوك/NEC في عام 2017.
TFGAN يمكنه إنتاج 128 بكسل مربع مقارنةً بالخرج 64×64 الذي يحد من GODIVA و T2V في الأمثلة السابقة، ولكن الباحثون يلاحظون ليس فقط أن GODIVA ينتج حركة أكثر ثقة واضحة، بل سيولد أيضًا تغييرات في المشهد بدون أي توجيه محدد، ولا يتردد في توليد لقطات قريبة.
في تشغيلات لاحقة، يولد GODIVA أيضًا خرج 128x128px، مع تغييرات في زاوية الرؤية:
في معيار RM الخاص بالمشروع، يمكن لـGODIVA تحقيق درجات تقترب من 100% من حيث الصحة (جودة الفيديو) والولاء (مدى تطابق المحتوى المولَّد مع النص الإدخالي).
يقر الباحثون، ومع ذلك، بأن تطوير معايير CLIP الخاصة بالفيديو سيكون إضافة مرحب بها إلى هذا المجال من توليد الصور، حيث سوف يوفر ساحة لعب متساوية لتقييم جودة النتائج بدون اللجوء إلى التكيف المفرط ونقص التعميم الذي أصبح ينتقد بشكل متزايد فيما يتعلق بتحديات الرؤية الحاسوبية التقليدية خلال العشر سنوات الماضية.
هم أيضًا يلاحظون أن توليد فيديوهات أطول سيكون اعتبارًا منطقيًا في تطوير النظام، حيث إن 10 إطارات فقط من خرج 64x64px يتطلب 2560 رمزًا مرئيًا، وهو انتفاخ أنبوبي من المحتمل أن يصبح مكلفًا وغير قابل للإدارة بسرعة.
















