زاوية Anderson

استعادة مقاطع الفيديو المضغوطة على منصات التواصل الاجتماعي باستخدام التعلم الآلي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Main image source: DALL-E 2

أظهرت الأبحاث الجديدة الصادرة عن الصين طريقة فعالة وجديدة لاستعادة التفاصيل والدقة لمقاطع الفيديو التي يتم تحميلها من قبل المستخدمين والتي يتم ضغطها تلقائيًا على منصات مثل WeChat وYouTube من أجل توفير النطاق الترددي والمساحة التخزينية.

مقارنة بين الطريقة الجديدة والطرق السابقة فيما يتعلق بقدرتها على استعادة التفاصيل بدقة بعد عملية الضغط التلقائي على منصات التواصل الاجتماعي. مصدر: https://arxiv.org/pdf/2208.08597.pdf

مقارنة بين الطريقة الجديدة والطرق السابقة فيما يتعلق بقدرتها على استعادة التفاصيل بدقة بعد عملية الضغط التلقائي على منصات التواصل الاجتماعي. مصدر: https://arxiv.org/pdf/2208.08597.pdf

على عكس الطرق السابقة التي يمكنها تحسين جودة مقاطع الفيديو وتوسيعها بناءً على بيانات التدريب العامة، تعتمد الطريقة الجديدة على استخراج خريطة ميزات التدهور (DFM) لكل إطار من مقطع الفيديو المضغوط – وهي في الأساس نظرة عامة على المناطق الأكثر تضررًا أو تدهورًا في الإطار الناتجة عن عملية الضغط.

من دراسات الإزالة في الورقة الجديدة: ثانيًا من اليمين، الحقيقة الأرضية لخريطة تدهور

من دراسات الإزالة في الورقة الجديدة: ثانيًا من اليمين، الحقيقة الأرضية لخريطة تدهور “نقية” (DFM)؛ ثالثًا من اليمين، تقدير للتدهور دون استخدام DFM. إلى اليسار، خريطة أكثر دقة للتدهور مع DFM.

عملية الاستعادة، التي تستخدم شبكات العصبية التلافية (CNNs) بين تقنيات أخرى، تُوجه وتُركز بواسطة المعلومات في DFM، مما يسمح للطريقة الجديدة بالتفوق على أداء الطرق السابقة ودقتها.

تم الحصول على الحقيقة الأرضية لعملية الاستعادة من خلال تحميل الباحثين مقاطع فيديو عالية الجودة إلى أربع منصات مشاركة شائعة، وتنزيل النتائج المضغوطة، وتنمية خط أنابيب رؤية حاسوبية قادرة على التعلم المجرد لتدهور الضغط وفقدان التفاصيل، بحيث يمكن تطبيقها عبر عدد من المنصات لاستعادة مقاطع الفيديو إلى جودة قريبة من الأصل، بناءً على بيانات كاملة ومتنوعة.

أمثلة من مجموعة بيانات UVSSM الجديدة.

أمثلة من مجموعة بيانات UVSSM الجديدة.

تم تجميع المواد المستخدمة في البحث في مجموعة بيانات HQ/LQ بعنوان “مقاطع فيديو المستخدمين المشتركة على منصات التواصل الاجتماعي” (UVSSM)، وتم إتاحتها للتحميل (كلمة المرور: rsqw) على منصة Baidu، لصالح مشاريع البحث اللاحقة التي تسعى إلى تطوير طرق جديدة لاستعادة مقاطع الفيديو المضغوطة على المنصات.

مقارنة بين عينتين متساويتين من مجموعة بيانات UVSSM القابلة للتحميل (انظر الروابط أعلاه لمصادر URLs). منذ أن قد تكون هذه العينة خاضعة لعدة جولات من الضغط (تطبيق الصور، نظام إدارة المحتوى، شبكة توزيع المحتوى، إلخ)، يرجى الرجوع إلى البيانات الأصلية للمصدر للحصول على مقارنة أكثر دقة.

مقارنة بين عينتين متساويتين من مجموعة بيانات UVSSM القابلة للتحميل (انظر الروابط أعلاه لمصادر URLs). منذ أن قد تكون هذه العينة خاضعة لعدة جولات من الضغط (تطبيق الصور، نظام إدارة المحتوى، شبكة توزيع المحتوى، إلخ)، يرجى الرجوع إلى البيانات الأصلية للمصدر للحصول على مقارنة أكثر دقة.

تم إطلاق رمز النظام، المعروف باسم استعادة الفيديو من خلال استشعار التدهور التكيفي (VOTES)، على منصة GitHub، على الرغم من أن تنفيذه يتطلب عددًا من الاعتماديات القائمة على السحب.

الورقة الورقة بعنوان استعادة مقاطع فيديو المستخدمين المشتركة على منصات التواصل الاجتماعي، وهي من ثلاثة باحثين في جامعة شينزين، وواحد من قسم الهندسة الإلكترونية والمعلوماتية في جامعة هونغ كونغ البوليتكنيكية.

من المخلفات إلى الحقائق

قد يكون القدرة على استعادة جودة مقاطع الفيديو الممسوحة من الويب دون “تخيل” التفاصيل الزائد الذي تقدمه برامج مثل Gigapixel (وأكثر الحزم المفتوحة الحالية من نفس النطاق) له آثار على قطاع أبحاث الرؤية الحاسوبية.

غالبًا ما تعتمد الأبحاث حول تقنيات الرؤية الحاسوبية القائمة على الفيديو على لقطات فيديو مأخوذة من منصات مثل YouTube وTwitter، حيث يتم الحفاظ على أساليب الضغط والترميز المستخدمة سرية، ولا يمكن استخلاصها بسهولة بناءً على أنماط المخلفات أو المؤشرات البصرية الأخرى، وقد تتغير بشكل دوري.

معظم المشاريع التي تستخدم مقاطع فيديو مكتشفة على الويب لا تبحث في الضغط، و phải تجعل مساحات للجودة المتاحة لمقاطع الفيديو المضغوطة التي تقدمها المنصات، منذ أن لا تملك وصولًا إلى الإصدارات الأصلية عالية الجودة التي ي上传ها المستخدمون.

لذلك، قد تساعد القدرة على استعادة جودة وأدق تفاصيل لمثل هذه المقاطع الفيديو، دون إدخال تأثيرات لاحقة من مجموعات بيانات الرؤية الحاسوبية غير المرتبطة، في التغلب على الحلول والتنازلات التي يجب على مشاريع الرؤية الحاسوبية القيام بها حاليًا لمصادر الفيديو المتدهورة.

على الرغم من أن منصات مثل YouTube قد تعلن أحيانًا عن تغييرات كبيرة في طريقة ضغط مقاطع فيديو المستخدمين (مثل VP9)، إلا أن لا تُعلن عن عملية الضغط بأكملها أو الترميز والإعدادات المستخدمة لتقليل حجم الملفات عالية الجودة التي ي上传ها المستخدمون.

لذلك، أصبحت تحسين جودة الإخراج من التحميلات عالية الجودة نوعًا من الفن الدرويدي الدروري في السنوات العشر الماضية، مع تحول مختلف “الحلول” (معظمها غير مؤكدة) ‘داخل وخارج الموضة.

الطريقة

الطرق السابقة لاستعادة الفيديو القائمة على التعلم العميق تضمنت استخراج الميزات العامة، إما كطريقة لاستعادة الإطار الفردي أو في هندسة متعددة الإطارات التي تستخدم الflux البصري (أي أن تأخذ في الاعتبار الإطارات المجاورة واللاحقة عند استعادة إطار حالي).

جميع هذه الطرق اضطرت إلى التعامل مع “تأثير الصندوق الأسود” – حقيقة أن لا يمكنها فحص تأثيرات الضغط في التقنيات الأساسية، لأن لا يُستطاع معرفة ما هي التقنيات الأساسية أو كيف تم تكوينها لمقطع فيديو معين تم تحميله من قبل المستخدم.

بدلاً من ذلك، تسعى VOTES إلى استخراج الميزات البارزة مباشرة من الفيديو الأصلي والمضغوط، وتحديد أنماط التحويل التي سوف تُعمم إلى معايير عدد من المنصات.

هندسة مفهومية مبسطة ل VOTES.

هندسة مفهومية مبسطة ل VOTES.

تستخدم VOTES وحدة استشعار تدهور خاصة (DSM، انظر الصورة أعلاه) لاستخراج الميزات في الكتل التلافية. ثم يتم تمرير إطارات متعددة إلى وحدة استخراج وتركيب الميزات (FEAM)، مع تمريرها بعد ذلك إلى وحدة تعديل التدهور (DMM). أخيرًا، تعرض وحدة البناء الإخراج المُستعاد.

البيانات والتحеримات

في العمل الجديد، ركز الباحثون جهودهم على استعادة مقاطع الفيديو التي تم تحميلها إلى منصة WeChat وتنزيلها، ولكنهم كانوا مهتمين بضمان أن الخوارزمية الناتجة يمكن تعديلها لمنصات أخرى.

تبين أن بعد الحصول على نموذج استعادة فعال لمقاطع فيديو WeChat، كان تعديله لمنصات Bilibili وTwitter وYouTube يتطلب فقط 90 ثانية لepoch واحد لكل نموذج مخصص لكل منصة (على جهاز يعمل ب 4 وحدات معالجة رسومات NVIDIA Tesla P40 مع 96GB من VRAM).

为了填充 مجموعة بيانات UVSSM، جمع الباحثون 264 مقطع فيديو يتراوح بين 5-30 ثانية، كل منها بمعدل إطار 30fps، مصدرة إما مباشرة من كاميرات الهواتف المحمولة أو من الإنترنت. كانت جميع مقاطع الفيديو إما 1920 × 1080 أو 1280 × 720.

شمل المحتوى (انظر الصورة السابقة) مناظر مدينة، مناظر طبيعية، أشخاص، حيوانات، وغيرها من الموضوعات، ويمكن استخدامها في مجموعة البيانات العامة عبر ترخيص Creative Commons Attribution، مما يسمح بإعادة الاستخدام.

تم تحميل 214 مقطع فيديو إلى WeChat باستخدام خمسة ماركات مختلفة من الهواتف المحمولة، مع الحصول على دقة فيديو افتراضية ل WeChat 960×540 (ما لم تكن دقة الفيديو الأصلية أصغر من هذه الأبعاد)، من بين التحويلات الأكثر “عقابية” عبر المنصات الشائعة.

الجزء العلوي الأيسر، الإطار HQ الأصلي مع ثلاثة أقسام مكبرة؛ الجزء العلوي الأيمن، نفس الإطار من نسخة مضغوطة من نفس الفيديو؛ الجزء السفلي الأيسر، التدهور المحسوب للإطار المضغوط؛ والجزء السفلي الأيمن، منطقة

الجزء العلوي الأيسر، الإطار HQ الأصلي مع ثلاثة أقسام مكبرة؛ الجزء العلوي الأيمن، نفس الإطار من نسخة مضغوطة من نفس الفيديو؛ الجزء السفلي الأيسر، التدهور المحسوب للإطار المضغوط؛ والجزء السفلي الأيمن، منطقة “العمل” الناتجة ل VOTES لتوجيه انتباهها إليها. من الواضح أن حجم الصورة منخفضة الجودة هو نصف حجم الصورة HQ، ولكن تم تعديله هنا لتوضيح المقارنة.

للمقارنات اللاحقة ضد روتينات التحويل الخاصة بالمنصات الأخرى، قام الباحثون بتحميل 50 مقطع فيديو غير مدرجة في الأصل 214 إلى Bilibili وYouTube وTwitter. كانت دقة الفيديو الأصلية 1280×270، مع دقة الإصدارات المضغوطة 640×360.

هذا يجعل مجموعة بيانات UVSSM تصل إلى 364 زوجًا من مقاطع الفيديو HQ/LQ، مع 214 مقطع ل WeChat، و 50 مقطع لكل من Bilibili وYouTube وTwitter.

للتجارب، تم اختيار 10 مقاطع فيديو عشوائية ك مجموعة الاختبار، وأربعة كمجموعة التحقق، و 200 الباقي كمجموعة التدريب الأساسية. تم إجراء التجارب خمس مرات مع التحقق الصليب، مع ت平均 النتائج عبر هذه الحالات.

في اختبارات استعادة الفيديو، تم مقارنة VOTES مع Spatio-Temporal Deformable Fusion (STDF). لتحسين الدقة، تم اختبارها ضد Enhanced Deformable convolutions (EDVR), RSDN, Video Super-resolution with Temporal Group Attention (VSR_TGA), و BasicVSR. تم تضمين طريقة Google المرحلة COMISR، على الرغم من أنها لا تتناسب مع نوع هندسة الأعمال السابقة.

تم اختبار الطرق ضد مجموعتي UVSS و REDS، مع تحقيق VOTES أعلى الدرجات:

يُدعي المؤلفون أن النتائج النوعية تشير أيضًا إلى تفوق VOTES على الأنظمة السابقة:

إطارات فيديو من REDS تم استعادةها بواسطة النهج التنافسية. الدقة الإرشادية فقط - انظر الورقة للدقة النهائية.

إطارات فيديو من REDS تم استعادةها بواسطة النهج التنافسية. الدقة الإرشادية فقط – انظر الورقة للدقة النهائية.

 

نشر لأول مرة في 19 أغسطس 2022.

كاتب في مجال تعلم الآلة، متخصص في توليد صور البشر. كان رئيسًا سابقًا لمحتوى البحث في Metaphysic.ai، حتى دمجه في Brahma.ai التابعة لـ DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai