نماذج ومنصات الذكاء الاصطناعي
نموذج انتشار فيديو مستقر: نماذج انتشار فيديو كامنة لتسلسلات البيانات الكبيرة
الذكاء الاصطناعي التوليدي كان قوة دافعة في مجتمع الذكاء الاصطناعي لبعض الوقت الآن، والتقدم المحرز في مجال نمذجة الصور التوليدية خاصة مع استخدام نماذج الانتشار قد ساعد نماذج الفيديو التوليدية على التقدم بشكل كبير ليس فقط في البحث ولكن أيضًا فيما يتعلق بالتطبيقات العملية. بشكل تقليدي، يتم تدريب نماذج الفيديو التوليدية من الصفر، أو يتم تعديلها جزئيًا أو كليًا من نماذج الصور المسبقة التدريب مع طبقات زمنية إضافية، على مزيج من مجموعات بيانات الصور والفيديو.
بناءً على التقدم المحرز في نماذج الفيديو التوليدية، في هذه المقالة، سنناقش نموذج انتشار فيديو مستقر، وهو نموذج انتشار فيديو كامن قادر على توليد محتوى فيديو عالي الدقة ومحتوى فيديو من الصور والنصوص. سنناقش كيف أن نماذج الانتشار الكامنة المدربة لتنمية الصور ثنائية الأبعاد قد تحسنت من قدرات وكفاءة نماذج الفيديو التوليدية من خلال إضافة طبقات زمنية وضبط النماذج على مجموعات بيانات صغيرة تتكون من فيديوهات عالية الجودة. سنقوم بدراسة أعمق في هيكل وآلية عمل نموذج انتشار الفيديو المستقر، وتقييم أدائه على مختلف المقاييس ومقارنته مع الإطارات الحالية من حيث جودة توليد الفيديو. لذا دعونا نبدأ.
نموذج انتشار فيديو مستقر ونماذج الفيديو التوليدية: مقدمة
بفضل إمكانياته الكبيرة تقريبًا، كان الذكاء الاصطناعي التوليدي موضوعًا رئيسيًا للبحث لأخصائيي الذكاء الاصطناعي والتعلم الآلي لبعض الوقت الآن، والسنوات القليلة الماضية شهدت تقدمًا سريعًا في كفاءة وأداء نماذج الصور التوليدية. وقد مكّننا التعلم من نماذج الصور التوليدية من إحراز تقدم في نماذج الفيديو التوليدية، مما أدى إلى تحسين الواقعية والتطبيقات العملية. ومع ذلك، فإن معظم الأبحاث التي تحاول تحسين قدرات نماذج الفيديو التوليدية تركز بشكل رئيسي على الترتيب الدقيق للطبقات الزمنية والمكانية، مع القليل من الاهتمام بالتحقيق في تأثير اختيار البيانات الصحيحة على نتائج هذه النماذج التوليدية.
بفضل التقدم المحرز في نماذج الصور التوليدية، لاحظ الباحثون أن تأثير توزيع بيانات التدريب على أداء النماذج التوليدية هو في الواقع كبير وغير متنازع عليه. بالإضافة إلى ذلك، لاحظ الباحثون أن التدريب المسبق لنماذج الصور التوليدية على مجموعة بيانات كبيرة ومتنوعة متبوعًا بضبط دقيق على مجموعة بيانات أصغر ذات جودة أفضل غالبًا ما يؤدي إلى تحسين الأداء بشكل كبير. تقليديًا، تطبق نماذج الفيديو التوليدية التعلمات المستفادة من نماذج الصور التوليدية الناجحة، والباحثون لم يدرسوا بعد تأثير البيانات وстрategies التدريب. نموذج انتشار الفيديو المستقر هو محاولة لتحسين قدرات نماذج الفيديو التوليدية من خلال الاستكشاف في مجالات غير مكتشفة من قبل، مع التركيز بشكل خاص على اختيار البيانات.

تعتمد نماذج الفيديو التوليدية الحديثة على نماذج الانتشار أو التكييف النصي أو التكييف بالصورة لتحليل إطارات فيديو متعددة متسقة. تعرف نماذج الانتشار بقدرتها على تعلم كيفية تقليل الضوضاء تدريجيًا من عينة من التوزيع الطبيعي من خلال تنفيذ عملية تكرارية لتحسين الدقة، وقد قدمت نتائج مرغوبة في توليد فيديو عالي الدقة وتوليد الصور من النص. باستخدام نفس المبدأ في لبّها، يتدرب نموذج انتشار الفيديو المستقر على نموذج انتشار فيديو كامن على مجموعة بيانات فيديو مع استخدام شبكات التوليد المعاكس أو GANs، وحتى نماذج التكرار إلى حد ما.
يتبع نموذج انتشار الفيديو المستقر استراتيجية فريدة لم تُطبق من قبل أي نموذج فيديو توليدي، حيث يعتمد على أسس انتشار فيديو كامن مع هيكل ثابت و استراتيجية تدريب ثابتة متبوعة بتقييم تأثير تحضير البيانات. يهدف نموذج انتشار الفيديو المستقر إلى إحراز المساهمات التالية في مجال نمذجة الفيديو التوليدية.
- تقديم سير عمل منهجي وفعال لتحضير البيانات في محاولة لتحويل مجموعة كبيرة من عينات الفيديو غير المعالجة إلى مجموعة بيانات عالية الجودة تستخدمها نماذج الفيديو التوليدية.
- تدريب نماذج الصور إلى فيديو والنص إلى فيديو التي تتفوق على الإطارات الحالية.
- إجراء تجارب محددة لاستكشاف الفهم ثلاثي الأبعاد وال motion السابق للمodel.
الآن، يطبق نموذج انتشار الفيديو المستقر التعلمات من نماذج انتشار الفيديو الكامنة وتقنيات تحضير البيانات في لبّه.
نماذج انتشار الفيديو الكامنة
تتبع نماذج انتشار الفيديو الكامنة أو Video-LDMs نهج تدريب النموذج التوليدي الأساسي في فضاء كامن مع تعقيد حسابي مخفض، ويطبق معظم Video-LDMs نموذج نص إلى صورة مسبق التدريب مع إضافة طبقات مزيج زمني في هيكل التدريب. ونتيجة لذلك، يتدرب معظم Video Latent Diffusion Models فقط على الطبقات الزمنية أو يتجاوز عملية التدريب بشكل مختلف عن نموذج انتشار الفيديو المستقر الذي يضبط الإطار كله.
تحضير البيانات
يعد تحضير البيانات مكونًا أساسيًا ليس فقط لنموذج انتشار الفيديو المستقر ولكن لنماذج التوليد بشكل عام، حيث من الضروري تدريب النماذج الكبيرة على مجموعات بيانات كبيرة النطاق لتعزيز الأداء عبر مهام مختلفة بما في ذلك نمذجة اللغة أو توليد الصور التمييزية، وغيرها. وقد تم تطبيق تحضير البيانات بنجاح على نماذج الصور التوليدية من خلال استغلال قدرات التمثيلات الكفئة للغة والصورة، على الرغم من أن مثل هذه المناقشات لم تكن محور تركيز لتنمية نماذج الفيديو التوليدية.
تحضير البيانات لتركيب فيديو عالي الجودة
كما ناقشنا في القسم السابق، يطبق نموذج انتشار الفيديو المستقر استراتيجية تدريب ثلاثية المراحل، مما يؤدي إلى نتائج محسنة وزيادة كبيرة في الأداء. المرحلة الأولى هي مرحلة التدريب على الصور التي تستخدم نموذج انتشار الصور ثنائية الأبعاد. المرحلة الثانية هي مرحلة التدريب على الفيديو التي يتدرب فيها الإطار على كمية كبيرة من بيانات الفيديو. وأخيرًا، لدينا المرحلة الثالثة ل ضبط الفيديو حيث يتم تعدين النموذج على مجموعة فرعية صغيرة من الفيديوهات عالية الجودة وعالية الدقة.
ومع ذلك، قبل أن يطبق نموذج انتشار الفيديو المستقر هذه المراحل الثلاث، من المهم معالجة البيانات وتحديدها لأنها تعمل كقاعدة للمرحلة الثانية أو مرحلة التدريب على الفيديو، وتلعب دورًا حاسمًا في ضمان الإخراج الأمثل. لضمان الكفاءة القصوى، يطبق الإطار أولاً трубة كاسكاد لتحديد القطع عند ثلاثة مستويات مختلفة لFPS أو إطارات في الثانية، ويتضح الحاجة إلى هذه الأنابيب في الصورة التالية.

بعد ذلك، يحدد نموذج انتشار الفيديو المستقر كل مقطع فيديو باستخدام ثلاثة طرق مختلفة لتعليق الوسم الاصطناعي. يقارن الجدول التالي مجموعات البيانات المستخدمة في إطار انتشار المستقر قبل وبعد عملية الترشيح.

المرحلة الأولى: التدريب على الصور
المرحلة الأولى في трубة التدريب الثلاثية التي يطبقها نموذج انتشار الفيديو المستقر هي مرحلة التدريب على الصور، ولتحقيق ذلك، يعتمد الإطار الأولي لنموذج انتشار الفيديو المستقر على نموذج انتشار الصور المسبق التدريب، وهو نموذج انتشار مستقر 2.1 الذي يزوّده بممثلات بصرية أقوى.

المرحلة الثانية: التدريب على الفيديو
المرحلة الثانية هي مرحلة التدريب على الفيديو، وهي تبني على الاكتشافات التي تشير إلى أن استخدام تحضير البيانات في نماذج الصور التوليدية متعددة الوضع غالبًا ما يؤدي إلى نتائج أفضل وزيادة في الكفاءة، جنبًا إلى جنب مع توليد الصور التمييزية القوية. ومع ذلك، بسبب عدم وجود تمثيلات قوية جاهزة لتصفية العينات غير المرغوب فيها لنماذج الفيديو التوليدية، يعتمد نموذج انتشار الفيديو المستقر على تفضيلات الإنسان كإشارات مدخلة لإنشاء مجموعة بيانات مناسبة لتدريب الإطار.

لمزيد من الدقة، يستخدم الإطار طرقًا مختلفة لتحضير مجموعات فرعية من انتشار الفيديو الكامن، ويعتبر ترتيب نماذج LVD المدربة على هذه المجموعات. بالإضافة إلى ذلك، يجد إطار انتشار الفيديو المستقر أن استخدام مجموعات بيانات محضرة يساعد في تعزيز أداء الإطار ونموذج الانتشار بشكل عام. علاوة على ذلك، تعمل استراتيجية تحضير البيانات على مجموعات بيانات أكبر وأكثر صلة وأكثر عملية.

المرحلة الثالثة: ضبط عالي الجودة
حتى المرحلة الثانية، يركز إطار انتشار الفيديو المستقر على تحسين الأداء قبل التدريب على الفيديو، وفي المرحلة الثالثة، يركز الإطار على تحسين أداء الإطار بعد ضبط فيديو عالي الجودة، وكيف يتم الانتقال من المرحلة الثانية إلى المرحلة الثالثة في الإطار. في المرحلة الثالثة، يستفيد الإطار من تقنيات التدريب المستعارة من نماذج انتشار الصور الكامنة، ويزيد من دقة أمثلة التدريب.
النتائج والاكتشافات
لقد حان الوقت لمعرفة كيف يؤدي إطار انتشار الفيديو المستقر في المهام العملية، وكيف يقارن مع الإطارات الحالية. يبدأ إطار انتشار الفيديو المستقر باستخدام نهج البيانات الأمثل لتدريب نموذج قاعدي، ثم يؤدي ضبط دقيق لإنشاء عدة نماذج من الدرجة الأولى، حيث يؤدي كل نموذج مهمة محددة.

تظهر الصورة أعلاه عينات فيديو من الصور إلى الفيديو عالية الدقة التي تم إنشاؤها بواسطة الإطار، بينما تظهر الشكل التالي قدرة الإطار على توليد عينات فيديو عالية الجودة من النص إلى الفيديو.

النموذج القاعدي المسبق التدريب
كما ناقشنا من قبل، يتم بناء نموذج انتشار الفيديو المستقر على إطار انتشار مستقر 2.1، واعتمادًا على الاكتشافات الحديثة، كان من الضروري على المطورين تبني جدول الضوضاء وزيادة الضوضاء للحصول على صور بأفضل دقة عند تدريب نماذج انتشار الصور. بفضل هذا النهج، يتعلم نموذج انتشار الفيديو المستقر تمثيلات حركة قوية، ويتفوق على نماذج قاعدة في توليد فيديو من النص في إعدادات الصورة الفردية، والنتائج موضحة في الجدول التالي.

تضمين الإطارات وتوليد متعدد المناظير
يضبط إطار انتشار الفيديو المستقر نموذج الصور إلى فيديو على مجموعات بيانات متعددة المناظير للحصول على مناظير متعددة جديدة لعنصر، ويُعرف هذا النموذج باسم SVD-MV أو نموذج انتشار فيديو مستقر-متعدد المناظير. يتم ضبط النموذج الأصلي SVD باستخدام مجموعتين من البيانات بطريقة تُدخل فيه صورة واحدة وتُرجع تسلسلًا من صور متعددة المناظير كإخراج.
كما هو موضح في الصور التالية، يقدم إطار انتشار الفيديو المستقر-متعدد المناظير أداءً عاليًا قابلًا للمقارنة مع إطار Scratch متعدد المناظير، ويتضح من النتائج أن الإطار يمكن أن يستفيد من التعلمات التي حصل عليها من النموذج الأصلي SVD لتحليل الصور متعددة المناظير. بالإضافة إلى ذلك، تشير النتائج إلى أن تشغيل النموذج لعدد صغير من التكرارات يساعد في تقديم نتائج مثالية، كما هو الحال مع معظم النماذج المعدلة من إطار SVD.


في الشكل أعلاه، يتم تحديد المقاييس على الجانب الأيسر ويمكن رؤية أن إطار انتشار الفيديو المستقر-متعدد المناظير يتفوق على إطار Scratch-MV و SD2.1 متعدد المناظير بفارق معقول. يظهر الشكل الثاني تأثير عدد تكرارات التدريب على أداء الإطار بشكل عام من حيث درجة Clip، ويتضح أن إطارات SVD-MV تقدم نتائج مستدامة.
أفكار ختامية
في هذه المقالة، ناقشنا نموذج انتشار فيديو مستقر، وهو نموذج انتشار فيديو كامن قادر على توليد محتوى فيديو عالي الدقة ومحتوى فيديو من الصور والنصوص. يتبع نموذج انتشار الفيديو المستقر استراتيجية فريدة لم تُطبق من قبل أي نموذج فيديو توليدي، حيث يعتمد على أسس انتشار فيديو كامن مع هيكل ثابت و استراتيجية تدريب ثابتة متبوعة بتقييم تأثير تحضير البيانات.
لقد ناقشنا كيف أن نماذج الانتشار الكامنة المدربة لتنمية الصور ثنائية الأبعاد قد تحسنت من قدرات وكفاءة نماذج الفيديو التوليدية من خلال إضافة طبقات زمنية وضبط النماذج على مجموعات بيانات صغيرة تتكون من فيديوهات عالية الجودة. لجمع بيانات التدريب المسبق، يجرّب الإطار دراسة التوسع ويتبع ممارسات جمع بيانات منهجية، ويفترض في النهاية طريقة لتحضير كمية كبيرة من بيانات الفيديو، وتحويل فيديوهات ضعيفة الجودة إلى بيانات مدخلة مناسبة لنماذج الفيديو التوليدية.
علاوة على ذلك، يستخدم إطار انتشار الفيديو المستقر ثلاث مراحل منفصلة لتدريب نماذج الفيديو التي يتم تحليلها بشكل مستقل لتقييم تأثيرها على أداء الإطار. ينتج الإطار في النهاية تمثيل فيديو قوي بما يكفي لضبط النماذج لتحقيق توليد فيديو أمثل، ويتوافق النتائج مع نماذج توليد الفيديو الحالية من حيث الجودة.












