زاوية Anderson
الطريق إلى تحرير فيديو أفضل باستخدام الذكاء الاصطناعي

يتابع قطاع البحث في التركيب الصوري للفيديو بنية تحرير الفيديو، وخلال التسعة أشهر الماضية، أصبحت هذه النتائج أكثر تواترًا. ومع ذلك، فإن معظمها يمثل تقدمًا طفيفًا على حالة الفن، لأن التحديات الأساسية هي كبيرة.
然而، أدت التعاون الجديد بين الصين واليابان هذا الأسبوع إلى إنتاج بعض الأمثلة التي تستحق الفحص الوثيق للنهج، حتى لو لم يكن بالضرورة عملًا رائدًا.
في مقطع الفيديو أدناه (من موقع المشروع المرتبط، الذي قد يُثقل متصفحك) نرى أن قدرات النظام على تحرير الوجه لا توجد في التكوين الحالي، لكن النظام يؤدي مهمة جيدة في تغيير هوية الشابة في الصورة بشكل معقول ومهم، بناءً على قناع الفيديو (الزاوية اليسرى السفلى):
انقر للعب. بناءً على قناع التجزئة النحوية المرئية في الزاوية السفلى اليسرى، يتم تحويل المرأة الأصلية (الزاوية العلوية اليسرى) إلى هوية متميزة بشكل ملحوظ، على الرغم من أن هذا العملية لا تحقق تبادل الهوية المشار إليه في التوجيه. مصدر: https://yxbian23.github.io/project/video-painter/ (كن على علم بأن الموقع في وقت الكتابة كان يميل إلى تعطيل متصفحي). يرجى الرجوع إلى مقاطع الفيديو الأصلية، إذا كنت تستطيع الوصول إليها، للحصول على دقة أفضل و تفاصيل، أو تحقق من الأمثلة في مقطع الفيديو التمهيدي للمشروع على https://www.youtube.com/watch?v=HYzNfsD3A0s
تحرير القناع من هذا النوع هو أمر مُستقر في نماذج الانتشار الكامن الثابتة، باستخدام أدوات مثل ControlNet. ومع ذلك، الحفاظ على συνέafdية الخلفية في الفيديو هو تحد أكبر، حتى عندما توفر المناطق المقنعة للمodel مرونة إبداعية، كما هو موضح أدناه:
انقر للعب. تغيير في النوع، باستخدام طريقة VideoPainter الجديدة. يرجى الرجوع إلى مقاطع الفيديو الأصلية، إذا كنت تستطيع الوصول إليها، للحصول على دقة أفضل و تفاصيل، أو تحقق من الأمثلة في مقطع الفيديو التمهيدي للمشروع على https://github.com/lllyasviel/ControlNet
يعتبر مؤلفو العمل الجديد نهجهم فيما يتعلق بعمارة BrushNet التابعة لشركة Tencent (التي غطيناها العام الماضي)، و ControlNet، كلاهما يعالجان معمارية ثنائية الفرع قادرة على عزل تكوين الخلفية والأمام.
ومع ذلك، تطبيق هذه الطريقة مباشرة على نهج Diffusion Transformers (DiT) المقترح من OpenAI’s Sora يطرح تحديات معينة، كما يشير المؤلفون
‘[تطبيق] المباشر لهذه الهندسة على فيديو DiTs يطرح عدة تحديات: [أولاً، نظرًا] لأساس التوليد القوي لحجم نموذج فيديو DiT الكبير، فإن تكرار كامل نصف خلفية فيديو DiT كمدخل لمشفر السياق سيكون غير ضروري ومحرم من الناحية الحاسوبية.
‘[ثانياً،] على عكس فرع التحكم الخالي من ال convolution في BrushNet، تحتوي رموز DiT في المناطق المقنعة على معلومات الخلفية بفعل الانتباه العالمي، مما يُ复ّق الفرق بين المناطق المقنعة وغير المقنعة في خلفية DiT.
‘[أخيراً،] يفتقر ControlNet إلى حقن الميزة عبر جميع الطبقات، مما يعوق التحكم الكثيف في الخلفية لمهام التعبئة.’
لذلك قام الباحثون بتطوير نهج من النوع القابل للتشغيل البيني في شكل إطار ثنائي الفرع يسمى VideoPainter.
يقدم VideoPainter إطارًا لتعبئة الفيديو ثنائي الفرع يحسن من DiTs المُعدَّل مسبقًا مع مشفر سياق خفيف الوزن. يُزعم أن هذا المشفر ي Represents فقط 6٪ من معاملات الظهر، والتي يُزعم أنها تجعل النهج أكثر كفاءة من الطرق التقليدية.
يقترح النموذج ثلاث ابتكارات رئيسية: مشفر سياق مبسط من طبقتين لتقديم إرشادات الخلفية الفعالة؛ نظام دمج الميزة الانتقائي المقنّع الذي يفصل بين الرموز المقنعة وغير المقنعة؛ وتقنية إعادة عينة منطقة التعبئة التي تحتفظ بالتوافق الهوياتي عبر تسلسلات الفيديو الطويلة.
من خلال تجميد DiT المُعدَّل مسبقًا ومشفر السياق أثناء إدخال محول الهوية، يضمن VideoPainter أن رموز منطقة التعبئة من مقاطع سابقة تظل عبر الفيديو، مما يقلل من الوميض والتناقضات.
كما تم تصميم الإطار للتشغيل البيني، مما يسمح للمستخدمين بدمجه بسهولة في سير عمل توليد وتحرير الفيديو الحالية.
لدعم العمل، الذي يستخدم CogVideo-5B-I2V كمحرك توليد، قام المؤلفون بإنشاء ما يُدَّعى أنه أكبر مجموعة بيانات لتعبئة الفيديو حتى الآن. يُطلق على هذه المجموعة اسم VPData، وتتكون من أكثر من 390,000 مقطع فيديو، بإجمالي مدة فيديو تزيد عن 886 ساعة. كما طوروا إطار اختبار متعلق يسمى VPBench.
انقر للعب. من الأمثلة على الموقع، نرى قدرات التجزئة التي تعمل بها مجموعة بيانات VP و إطار اختبار VPBench. يرجى الرجوع إلى مقاطع الفيديو الأصلية، إذا كنت تستطيع الوصول إليها، للحصول على دقة أفضل و تفاصيل، أو تحقق من الأمثلة في مقطع الفيديو التمهيدي للمشروع على https://arxiv.org/pdf/1706.04983.pdf
يعتبر العمل الجديد بعنوان VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control، ويأتي من سبعة مؤلفين في Tencent ARC Lab، و The Chinese University of Hong Kong، و The University of Tokyo، و University of Macau.
بالإضافة إلى موقع المشروع المذكور أعلاه، قام المؤلفون أيضًا بنشر مقطع فيديو تمهيدي على YouTube، بالإضافة إلى صفحة على Hugging Face.
الطريقة
يتكون خط أنابيب جمع البيانات لمجموعة VPData من جمع البيانات، وترميز البيانات، و تقسيم البيانات، و اختيار البيانات، و كتابة التعليقات.
مخطط لخط أنابيب بناء المجموعة. مصدر: https://www.youtube.com/watch?v=HYzNfsD3A0s
جاءت المجموعات المصدر المستخدمة لهذه المجموعة من Videvo و Pexels، مع حصيلة أولية تبلغ حوالي 450,000 فيديو.
تضمن مرحلة المعالجة المسبقة مكتبات وطرق مساهمة متعددة: استُخدم إطار Recognize Anything لتوفير تعليمات الفيديو المفتوحة، مهمة تحديد الكائنات الرئيسية؛ استُخدم Grounding Dino لتحديد صناديق التحديد حول الكائنات المحددة؛ واستُخدم إطار Segment Anything Model 2 (SAM 2) لتحسين هذه التحديدات الخشنة إلى تجزئة عالية الجودة.
لإدارة انتقالات المشهد وضمان الاتساق في تعبئة الفيديو، يستخدم VideoPainter PySceneDetect لتحديد مقاطع الفيديو عند النقاط الطبيعية، وتجنب التحولات المزعجة التي تسببها تتبع نفس الكائن من زوايا متعددة. تم تقسيم المقاطع إلى فترات زمنية مدتها 10 ثوان، وتم إهمال أي شيء أقل من 6 ثوان.
لاختيار البيانات، تم تطبيق ثلاثة معايير تصفية: الجودة الجمالية، تم تقييمها بواسطة Laion-Aesthetic Score Predictor؛ قوة الحركة، تم قياسها بواسطة الflux البصري باستخدام RAFT؛ و سلامة المحتوى، تم التحقق منها بواسطة محدد السلامة للاستحواذ المستقر.
تتمثل إحدى القيود الرئيسية في مجموعات بيانات التجزئة الفيديوية الحالية في عدم وجود تعليقات نصية مفصلة، والتي هي ضرورية لتوجيه النماذج التوليدية:
يشير الباحثون إلى نقص التوجيهات النصية للفيديو في المجموعات المماثلة.
لذلك، يدمج عملية جمع بيانات VideoPainter نماذج رؤية-لغة رائدة، بما في ذلك CogVLM2 و Chat GPT-4o، لتوليد تعليقات مفتاحية ووصف مفصل للمناطق المقنعة.
يحسن VideoPainter من DiTs المُعدَّل مسبقًا من خلال إدخال مشفر سياق خفيف الوزن. يقترح النموذج ثلاث ابتكارات رئيسية: مشفر سياق مبسط من طبقتين لتقديم إرشادات الخلفية الفعالة؛ نظام دمج الميزة الانتقائي المقنّع الذي يفصل بين الرموز المقنعة وغير المقنعة؛ وتقنية إعادة عينة منطقة التعبئة التي تحتفظ بالتوافق الهوياتي عبر تسلسلات الفيديو الطويلة.
يتمثل أحد الابتكارات الرئيسية في VideoPainter في تقنية إعادة عينة منطقة التعبئة التي تُستخدم لضمان استمرار رموز منطقة التعبئة عبر مقاطع الفيديو.
تم تصميم الإطار للتشغيل البيني، مما يسمح للمستخدمين بدمجه بسهولة في سير عمل توليد وتحرير الفيديو الحالية.
البيانات والاختبارات
تم تدريب VideoPainter باستخدام نموذج CogVideo-5B-I2V، جنبًا إلى جنب مع نظيره النصي-الفيديوي. تم استخدام مجموعة بيانات VP المعدة في دقة 480x720px، مع معدل تعلم يبلغ 1×10^-5.
تم تدريب محول الهوية لمدة 2,000 خطوة، ومشفر السياق لمدة 80,000 خطوة، كلاهما باستخدام مثبط AdamW. تم إجراء التدريب في مرحلتين باستخدام 64 من وحدات معالجة الرسومات V100 من NVIDIA (على الرغم من أن الورقة لا تحدد ما إذا كانت هذه الوحدات تحتوي على 16 غيغابايت أو 32 غيغابايت من ذاكرة الوصول العشوائي).
للاختبار، تم استخدام Davis للأقنعة العشوائية، و VPBench للأقنعة المبنية على التجزئة.
يتضمن إطار VPBench كائنات، وحيوانات، وبشر، ومناظر طبيعية، ومهام متنوعة، ويتضمن أربعة إجراءات: إضافة، إزالة، تغيير، و تبديل. يتكون الإطار من 45 مقطع فيديو مدته 6 ثوان، وتسعة مقاطع فيديو مدتها 30 ثانية في المتوسط.
تم استخدام ثمانية مقاييس للاختبار. لتحفظ منطقة التعبئة، استُخدم نسبة الإشارة إلى الضوضاء القصوى (PSNR)؛ مقياس التشابه الإدراكي المُتعلم (LPIPS)؛ مؤشر التشابه الهيكلي (SSIM)؛ و متوسط الخطأ المطلق (MAE).
للتوجيه النصي، استُخدم تشابه CLIP لتقييم المسافة الدلالية بين تعليق المقطع و محتواه الفعلي، وتقييم دقة المناطق المقنعة.
لتحديد جودة الفيديو الناتج بشكل عام، استُخدم مسافة الفيديو Fréchet (FVD).
للمقارنة الكمية لتعبئة الفيديو، قام المؤلفون بتحديد نظامهم ضد النهج السابقة ProPainter، و COCOCO، و Cog-Inp (CogVideoX). تم اختبار تعبئة الإطار الأول من مقطع فيديو باستخدام نماذج تعبئة الصور، ثم استخدام نموذج الصورة إلى الفيديو (I2V) لتوسيع النتائج إلى عملية خلط لاتنتج.
نظرًا لأن موقع المشروع لا يعمل بالكامل في وقت الكتابة، ولا يحتوي مقطع الفيديو التمهيدي للمشروع على جميع الأمثلة، فمن الصعب العثور على أمثلة فيديو محددة جدًا لنتائج المحددة في الورقة. لذلك سنعرض بعض النتائج الثابتة الموجودة في الورقة، ونسخ بعض الأمثلة من مقاطع الفيديو “النتائج” على موقع المشروع.
المقارنة الكمية بين VideoPainter و ProPainter و COCOCO و Cog-Inp على VPBench (أقنعة التجزئة) و Davis (الأقنعة العشوائية). تشمل المقاييس حفظ منطقة التعبئة، و التوجيه النصي، و جودة الفيديو. الأحمر = الأفضل، الأزرق = الثاني أفضل.
يتعلق المؤلفون بما يلي:
‘في VPBench القائم على التجزئة، يظهر ProPainter و COCOCO أسوأ أداء عبر معظم المقاييس، بشكل رئيسي بسبب عدم القدرة على تعبئة الكائنات المقنعة بالكامل و صعوبة معمارية الفرع الواحد في تحقيق التوازن بين حفظ الخلفية و توليد المقدمة. ‘
‘في اختبار الأقنعة العشوائية Davis، يُظهر ProPainter تحسنًا من خلال الاستفادة من معلومات الخلفية الجزئية. ومع ذلك، يتحقق VideoPainter من الأداء الأمثل عبر التجزئة (الطول القياسي و الطويل) و الأقنعة العشوائية من خلال معمارية الفرع المزدوج التي تفصل بشكل فعال بين حفظ الخلفية و توليد المقدمة.’
يُقدم المؤلفون أيضًا أمثلة ثابتة للاختبارات النوعية، والتي نُشرت أدناه. في جميع الحالات، ننصح القارئ بزيارة موقع المشروع ومقطع الفيديو على YouTube للحصول على دقة أفضل.
مقارنة مع أساليب التعبئة في الإطارات السابقة.
انقر للعب. أمثلة تم دمجها من مقاطع الفيديو “النتائج” على موقع المشروع.
يتعلق المؤلفون بما يلي:
‘يُظهر VideoPainter باستمرار نتائج استثنائية في الاتساق الفيديوي، و الجودة، و التوجيه النصي. و يُلاحظ أن ProPainter يفشل في توليد كائنات مقنعة بالكامل لأنها تعتمد فقط على انتشار الخلفية بدلاً من التوليد. ‘
‘في حين يُظهر COCOCO الوظيفة الأساسية، فإنه يفشل في الحفاظ على هوية متسقة في المناطق المقنعة (مظاهر السفن غير المتسقة و تغييرات التضاريس الحادة) بسبب معمارية الفرع الواحد التي تحاول تحقيق التوازن بين حفظ الخلفية و توليد المقدمة. ‘
‘يحقق Cog-Inp نتائج تعبئة أساسية؛ ومع ذلك، فإن عدم قدرة عملية الخلط على الكشف عن حدود المقنعة يؤدي إلى تشوهات كبيرة. ‘
‘علاوة على ذلك، يمكن لـ VideoPainter توليد فيديوهات متسقة تتجاوز دقيقة واحدة مع الحفاظ على توافق الهوية من خلال تقنية إعادة عينة الهوية.’
كما قام الباحثون بتحديد قدرة VideoPainter على تعزيز التعليقات وتحقيق نتائج محسنة من خلال هذه الطريقة، ووضع النظام مقابل UniEdit، و DiTCtrl، و ReVideo.
نتائج تحرير الفيديو مقابل ثلاثة نهج سابقة.
يتعلق المؤلفون بما يلي:
‘للفيديوهات القياسية و الطويلة في VPBench، يُحقق VideoPainter أداءً متفوقًا، حتى يتفوق على ReVideo من النهاية إلى النهاية. و يمكن أن يُعزى هذا النجاح إلى معمارية الفرع المزدوج التي تضمن حفظًا جيدًا للخلفية و توليد المقدمة، مع الحفاظ على هوية عالية في المناطق غير المعدلة، و تعبئة المناطق المعدلة التي تتماشى بشكل وثيق مع توجيهات التحرير، مدعومة بتقنية إعادة عينة منطقة التعبئة التي تحتفظ بالتوافق الهوياتي في الفيديو الطويل.’
على الرغم من أن الورقة تحتوي على أمثلة ثابتة لذلك المقاييس، إلا أنها غير مُ启َة، و ننصح القارئ بزيارة الأمثلة المتنوعة الموزعة عبر مقاطع الفيديو المنشورة لهذا المشروع.
أخيرًا، تم إجراء دراسة على المستخدمين، حيث طُلب من 30 مستخدمًا تقييم 50 جيلًا تم اختياره عشوائيًا من مجموعتي VPBench و التحرير. و تم تسليط الضوء على حفظ الخلفية، و التوجيه النصي، و جودة الفيديو بشكل عام.
نتائج دراسة المستخدمين ل VideoPainter.
يتعلق المؤلفون بما يلي:
‘يُحقق VideoPainter أداءً متفوقًا بشكل كبير، و يحقق معدلات تفضيل أعلى عبر جميع معايير التقييم في كلا المهمتين.’
يُقر المؤلفون، مع ذلك، بأن جودة توليدات VideoPainter تعتمد على النموذج الأساسي، الذي قد يُبلي في الحركة المعقدة والفيزياء؛ و يُلاحظون أيضًا أنه يؤدي أداءً سيئًا مع أقنعة رديئة أو تعليقات غير متوافقة.
الاستنتاج
يبدو أن VideoPainter إضافة جيدة إلى الأدبيات. و كما هو الحال مع الحلول الحديثة، فإن لديها طلبات حاسوبية كبيرة. و كما أن العديد من الأمثلة المختارة للعرض على موقع المشروع بعيد جدًا عن أفضل الأمثلة؛ و سيكون من المثير رؤية هذا الإطار في مواجهة مدخلات مستقبلية و نهج سابقة أوسع نطاقًا.
* من الجدير بالذكر أن “تحرير الفيديو” في هذا السياق لا يعني “تجميع مقاطع فيديو مختلفة في تسلسل”، وهو المعنى التقليدي لهذا المصطلح؛ بل يعني تغيير أو تعديل محتوى مقاطع الفيديو الحالية بطريقة ما، باستخدام تقنيات التعلم الآلي
نُشر لأول مرة يوم الإثنين، 10 مارس 2025. تم تحديثه يوم السبت، 25 يوليو 2026 لاستبدال مقطع الفيديو.












