زاوية Anderson
استخدام الذكاء الاصطناعي لتلخيص مقاطع الفيديو التعليمية الطويلة

إذا كنت من الذين يزيدون من سرعة مقطع فيديو تعليمي على يوتيوب من أجل الحصول على المعلومات التي تريدها؛ أو تقرأ نص مقطع الفيديو لاستخراج المعلومات الأساسية المخفية في أوقات التشغيل الطويلة والمليئة بالإعلانات؛ أو تنتظر أن يقوم WikiHow بإنشاء نسخة أقل إستهلاكاً للوقت من المعلومات في مقطع الفيديو التعليمي؛那么 قد يكون مشروع جديد من جامعة كاليفورنيا بيركلي، وغوغل ريسيرتش، وجامعة براون من المثير لاهتمامك.
مصطلح TL;DW؟ تلخيص مقاطع الفيديو التعليمية مع صلة المهام والوضوح عبر الوسائط، يُظهر الورقة الجديدة الورقة الجديدة تفاصيل إنشاء نظام تلخيص مقاطع الفيديو بمساعدة الذكاء الاصطناعي يمكنه تحديد الخطوات المهمة من مقطع الفيديو وإلغاء كل ما يهمله، مما يؤدي إلى تلخيصات قصيرة تصل سريعا إلى النقطة.

استغلال ويكي هاو لمقاطع الفيديو الطويلة الحالية من أجل الحصول على نص ومعلومات فيديو يستخدمه مشروع IV-Sum لإنشاء تلخيصات وهمية توفر الحقيقة الأرضية لتدريب النظام. مصدر: https://arxiv.org/pdf/2208.06773.pdf
التلخيصات الناتجة لها جزء صغير من وقت تشغيل مقطع الفيديو الأصلي، كما يتم تسجيل المعلومات متعددة الوسائط (أي النصية) أثناء العملية بحيث يمكن أن تتمكن الأنظمة المستقبلية من تلقاء نفسها من إنشاء منشورات على ويكي هاو التي يمكنها تلقاء نفسها تحليل مقطع فيديو تعليمي طويل إلى مقال قصير ومبحوث، كامل مع الصور، مما قد يوفر الوقت والضيق.
النظام الجديد يسمى IV-Sum (ملخص مقاطع الفيديو التعليمية)، ويستخدم خوارزمية التعرف على الرؤية الحاسوبية مفتوحة المصدر ResNet-50، من بين تقنيات أخرى، لتحديد الإطارات والقطاعات المهمة من مقطع فيديو طويل.
يتدرب النظام على تلخيصات وهمية تم إنشاؤها من هيكل المحتوى لموقع ويكي هاو، حيث غالباً ما يستخدم الأشخاص مقاطع فيديو تعليمية شائعة لإنشاء شكل متعدد الوسائط مسطح، غالباً ما يستخدم مقاطع قصيرة وصور GIF متحركة من مقاطع الفيديو التعليمية الأصلية.
في مناقشة مشروع استخدام تلخيصات ويكي هاو كبيانات حقيقة أرضية للنظام، يقول المؤلفون:
‘تتكون كل مقال على موقع WikiHow Videos من مقطع فيديو تعليمي رئيسي يُظهر مهمة غالباً ما تشمل محتوى ترويجي، ومقاطع من المعلم يتحدث إلى الكاميرا بدون معلومات بصرية للمهمة، وخطوات لا تعتبر ضرورية لأداء المهمة. ‘
‘المشاهدون الذين يريدون نظرة عامة على المهمة يفضلون مقطع فيديو أقصر بدون كل المعلومات غير ذات الصلة. تحتوي مقالات ويكي هاو (على سبيل المثال، انظر كيفية صنع أرز السوشي) على ذلك بالضبط: نص يحتوي على جميع الخطوات المهمة في المقطع مع صور توضح الخطوات المختلفة في المهمة.’
البيانات الناتجة من هذه عملية حوسبة الويب تسمى WikiHow Summaries. يتكون قاعدة البيانات من 2106 مقطع فيديو إدخال وملخصاتها. هذا هو حجم قاعدة بيانات أكبر مما هو متاح عادة لمشاريع تلخيص مقاطع الفيديو، والتي عادة ما تتطلب تعليم وتنقيح يدويين مكلفين – عملية تم تسهيلها بشكل كبير في العمل الجديد، بفضل نطاق تلخيص مقاطع الفيديو التعليمية (بدلاً من مقاطع الفيديو العامة).
يستخدم IV-Sum تمثيلات الشبكات العصبية التلافعية ثلاثية الأبعاد، بدلاً من تمثيلات الإطار التي تتميز بالأعمال المماثلة السابقة، ودراسة الإلغاء المذكورة في الورقة تؤكد أن جميع مكونات هذا النهج ضرورية لوظيفة النظام.
تم اختبار IV-Sum بشكل إيجابي ضد إطارات قابلة للمقارنة، بما في ذلك CLIP-It (التي عمل بعض مؤلفي الورقة عليها).

يحصل IV-Sum على نتائج جيدة ضد الطرق المماثلة، ربما بسبب نطاق التطبيق المقيد أكثر، بالمقارنة مع معظم مبادرات تلخيص مقاطع الفيديو. تفاصيل المعايير وطرق التقييم أدناه في هذه المقالة.
الطريقة
المرحلة الأولى في عملية التلخيص تتضمن استخدام خوارزمية منخفضة الجهد ومدربة ضعيفاً لإنشاء تلخيصات وهمية و درجات أهمية إطارية لمجموعة كبيرة من مقاطع الفيديو التعليمية الممسوحة ضوئياً، مع وجود علامة مهمة واحدة فقط في كل مقطع.
بعد ذلك، يتم تدريب شبكة تلخيص تعليمية على هذه البيانات. يتكون النظام من معالج فيديو ومتحويل درجات القطاعات (SST)، ويتم توجيه التدريب بواسطة درجات الأهمية المحددة في التلخيصات الوهمية. يتم إنشاء الملخص النهائي عن طريق دمج القطاعات التي حققت درجة أهمية عالية.
من الورقة:
‘الفكرة الرئيسية وراء трубوتنا لإنشاء تلخيص وهمي هي أنه إذا كان لدينا العديد من مقاطع الفيديو لمهمة، فإن الخطوات التي تعتبر حاسمة للمهمة من المحتمل أن تظهر عبر مقاطع فيديو متعددة (صلة المهمة). ‘
‘إضافة إلى ذلك، إذا كانت الخطوة مهمة، فمن النمط الشائع للمعلم التحدث عن هذه الخطوة قبل أو أثناء أو بعد أدائها. لذلك، فإن النص الفرعي لمقطع الفيديو الذي تم الحصول عليه باستخدام التعرف على الكلام التلقائي (ASR) سيشير على الأرجح إلى هذه الخطوات الرئيسية (وضوح عبر الوسائط).’

لإنشاء التلخيص الوهمي، يتم تقسيم مقطع الفيديو أولاً إلى قطاعات بشكل موحد، وتم تجميع القطاعات بناءً على التشابه البصري في ‘خطوات’ (ألوان مختلفة في الصورة أعلاه). يتم بعد ذلك تعيين درجات أهمية للخطوات بناءً على ‘صلة المهمة’ و ‘وضوح عبر الوسائط’ (أي العلاقة بين نص ASR والصور). يتم اختيار الخطوات ذات الدرجات العالية لتمثيل مراحل في التلخيص الوهمي.
يستخدم النظام وضوح عبر الوسائط لمساعدة في تحديد صلة كل خطوة، من خلال مقارنة الكلام المترجم مع الصور والافعال في مقطع الفيديو. يتم ذلك من خلال استخدام نموذج فيديو-نص مسبق التدريب حيث يتم تدريب كل عنصر بشكل مشترك تحت خسارة MIL-NCE، باستخدام مُشفر فيديو ثلاثي الأبعاد تم تطويره من قبل ديب مايند وغيرهم.
يتم الحصول على درجة أهمية عامة من متوسط هذه مراحل صلة المهمة وتحليل عبر الوسائط.
البيانات
تم إنشاء مجموعة بيانات تلخيصات وهمية أولية لهذه العملية، تتكون من معظم محتويات مجموعتي بيانات سابقة – COIN، وهي مجموعة تحتوي على 11000 مقطع فيديو تتعلق ب 180 مهمة؛ و Cross-Task، التي تحتوي على 4700 مقطع فيديو تعليمي، منهم 3675 استخدموا في البحث. تحتوي Cross-Task على 83 مهمة مختلفة.

أعلى، أمثلة من COIN؛ أسفل، من Cross-Task. مصادر، على التوالي: https://arxiv.org/pdf/1903.02874.pdf و https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf
باستخدام مقاطع الفيديو التي ظهرت في كلا المجموعتين فقط مرة واحدة، تمكن الباحثون من الحصول على 12160 مقطع فيديو تغطي 263 مهمة مختلفة، و 628.53 ساعة من المحتوى لمجموعتهم البيانية.
لتحديث مجموعة بيانات ويكي هاو، وتوفير الحقيقة الأرضية للنظام، قام المؤلفون بفحص مقاطع الفيديو التعليمية الطويلة على ويكي هاو، مع الصور ومقاطع الفيديو (أي GIFs) المرتبطة بكل خطوة. وبالتالي، كان من المفترض أن يخدم هيكل المحتوى المشتق من ويكي هاو كقالب لتحديد الخطوات في النظام الجديد.
تم استخدام الميزات المستخرجة بواسطة ResNet50 لمطابقة القطاعات المختارة من مقطع الفيديو في صور ويكي هاو، وأداء تحديد موقع الخطوات. تم استخدام الصورة الأكثر تشابهاً داخل نافذة فيديو مدتها 5 ثواني كنقطة مرجعية.
تم بعد ذلك لصق هذه المقاطع القصيرة معاً لتشكيل مقاطع فيديو ستكون الحقيقة الأرضية لتدريب النموذج.
تم تعيين علامات لكل إطار في مقطع الفيديو الإدخال، للإعلان عن ما إذا كانت تنتمي إلى الملخص الإدخال أو لا، مع كل مقطع فيديو تلقى من الباحثين علامة ثنائية على مستوى الإطار، ودرجة ملخص متوسطة تم الحصول عليها من درجات الأهمية لجميع الإطارات في القطاع.
في هذه المرحلة، أصبحت ‘الخطوات’ في كل مقطع فيديو تعليمي الآن مرتبطة بالبيانات النصية، ومُسمّاة.
التدريب والاختبارات والمقاييس
تم تقسيم مجموعة بيانات ويكي هاو النهائية إلى 1339 مقطع فيديو اختبار و 768 مقطع فيديو للتحقق – زيادة ملحوظة في حجم مجموعة البيانات غير الخام المخصصة لتحليل مقاطع الفيديو.
تم تدريب معالج الفيديو والنص في الشبكة الجديدة بشكل مشترك على شبكة S3D مع أوزان محملة من نموذج HowTo100M المسبق التدريب تحت خسارة MIL-NCE.
تم تدريب النموذج بمتعلم آدم بمعدل تعلم 0.01 وبحجم 배치 24، مع ربط البيانات الموازية ينتشر التدريب عبر ثمانية معالجات رسومات NVIDIA RTX 2080، لمجموع 24GB من VRAM الموزعة.
تم بعد ذلك مقارنة IV-Sum مع سيناريوهات مختلفة ل CLIP-It وفقاً لدراسات سابقة مثل هذه الأعمال، بما في ذلك دراسة على CLIP-It. المقاييس المستخدمة كانت قيم الدقة والاسترجاع و F-Score، عبر ثلاثة أسس غير خاضعة للإشراف (انظر الورقة للتفاصيل).
تظهر النتائج في الصورة السابقة، ولكن الباحثون يلاحظون أيضاً أن CLIP-It يفقد عدداً من الخطوات الممكنة في مراحل مختلفة من الاختبارات التي لا يفعلها IV-Sum. ويعزون ذلك إلى أن CLIP-It تم تدريبه وتطويره باستخدام مجموعات بيانات أصغر بكثير من قاعدة ويكي هاو الجديدة.
الآثار
القيمة الطويلة الأمد لهذا النوع من البحث (الذي يشاركه IV-Sum مع تحدي تحليل مقاطع الفيديو الأوسع) يمكن أن يكون جعل مقاطع الفيديو التعليمية أكثر إمكانية للفهرسة بواسطة محركات البحث التقليدية، وتمكين نوع المقاطع القصيرة ‘مقتطفات’ في النتائج لمقاطع الفيديو التي غالباً ما يستخرجها جوجل من مقال طويل.
من الواضح أن تطوير أي عملية مدعومة بالذكاء الاصطناعي تقلل من التزامنا بالانتباه الخطي والحصري لمحتوى مقاطع الفيديو يمكن أن يكون له عواقب على جاذبية الوسيط لجيل من المسوقين الذين ربما شعروا أن opakness من مقاطع الفيديو كانت الطريقة الوحيدة التي يمكنهم من خلالها إشراكنا حصرياً.
مع صعوبة تحديد موقع ‘المحتوى القيم’، تمتكن مقاطع الفيديو التي ساهم فيها المستخدمون من التمتع باهتمام واسع النطاق من مستهلكي الوسائط فيما يتعلق بمواقع الإعلانات، ومواقع الرعاية، والتعظيم الذاتي الذي غالباً ما يتم دمج قيمة مقطع الفيديو فيه. مشاريع مثل IV-Sum تُعد بموعد واعد في النهاية لجعل جوانب محتوى مقاطع الفيديو صغيرة وقابلة للفصل عن ما يعتبره الكثيرون ‘حمل زائد’ من الإعلانات في المحتوى والتحديثات غير المتعلقة بالمحتوى.
نشر لأول مرة في 16 أغسطس 2022. تم تحديثه في الساعة 2:52 مساءً في 16 أغسطس، تم إزالة الجملة المكررة.













