زاوية Anderson
إضافة الحوار إلى الفيديو الحقيقي باستخدام الذكاء الاصطناعي

يتدخل في مقاطع الفيديو الحقيقية ويضع كلاما جديدا في الفيديو الحالي (بدلا من إنشاء مقطع جدير بالتوليد من وجه
يُمكن لإطار عمل جديد للذكاء الاصطناعي إعادة كتابة أو حذف أو إضافة كلمات شخص ما في مقطع فيديو دون الحاجة إلى إعادة التصوير، وذلك ضمن نظام متكامل. قبل ثلاث سنوات، كان الإنترنت سيُثير ضجة كبيرة حول أيٍّ من أطر عمل الفيديو المُعدّلة بالذكاء الاصطناعي، والتي يتراوح عددها بين 20 و30 إطارًا، والتي كانت تُنشر أسبوعيًا في المنافذ الأكاديمية؛ أما الآن، فقد أصبح هذا النوع من الأبحاث شائعًا ومثمرًا لدرجة أنه يُشكّل فرعًا جديدًا من “سلوك الذكاء الاصطناعي”، ولذلك أُغطي عددًا أقل من هذه الإصدارات مقارنةً بما كنت أُغطيه قبل عامين أو ثلاثة أعوام. مع ذلك، لفت انتباهي إصدار حديث في هذا السياق: نظام متكامل يُمكنه أو إطار، وهو أمر أكثر شيوعا). في الأمثلة أدناه ، والتي قمت بتحريرها معا من مجموعة من مقاطع الفيديو المتاحة في موقع المشروع ، نرى أولا مقطع المصدر الحقيقي ، ثم ، في الأسفل ، الكلام المضاف بواسطة الذكاء الاصطناعي
في منتصف المقطع للانتاج التلفزيوني والسينمائي: تيتانيك ‘يحتاج صانعو الأفلام والمنتجون الإعلاميون أحيانا إلى تعديل أجزاء معينة تضمين الصوت ومزامنة حركة الشفاه: (/video) انقر للتشغيل. المصدر – https://facedit.github.io/ التحرير المحلي مع دمج المقاطع – إحدى الطرق المُطوّرة لـ FaceEDiT. يُرجى الرجوع إلى المصدرللحصول على معلومات أكثر دقة، يُرجى زيارة الموقع. هذا الأسلوب هو أحد ثلاثة أساليب طُوّرت لمنهجية جديدة، آخرها بعنوان “التحرير الموضعي مع دمج الصور”، وهو ما يهمّ المؤلفين (وأنا أيضاً). باختصار، يتم تمديد المقطع باستخدام إحدى الإطارات الوسطى كنقطة انطلاق لتفسير الذكاء الاصطناعي الجديد، والإطار الحقيقي اللاحق كهدف يجب أن يتوافق معه المقطع المُنشأ. يقترح المؤلفون هذا الأسلوب لتحليل الوجه والصوت كأول طريقة متكاملة وشاملة لتحرير الفيديو باستخدام الذكاء الاصطناعي، مشيرين إلى إمكانات إطار عمل متكامل كهذا:
مقاطع الفيديو المسجلة – ربما كان كلمة مخطئة أو تغير السيناريو بعد التصوير. على سبيل المثال ، في المشهد الأيقوني من “لن أتركك أبدا ، من ، “لن أنساك جاك” (1997) حيث تقول روز يقرر المخرج لاحقا أن يكون . ‘تتطلب أبدا ، جاك” ، قدالتغييرات
، وهو ما يعتبر مكلفا ومستهلكا للوقت. يوفر التحرير التحدثي بوجه mặt بديلا عمليا عن طريق تعديل حركة الوجه تلقائيا لتطابق الكلام المنقح ، مما يلغي الحاجة إلى إعادة
التقليدية إعادة التصوير لل مشهد بأكمله التصوير.’ على الرغم من أن التحريرات بواسطة الذكاء الاصطناعي من هذا النوع قد تواجه مقاومة ثقافية أو صناعية ، إلا أنها قد تشكل نوعا جديدا من الوظائف في أنظمة التأثيرات البصرية بقيادة الإنسان وأنظمة الأدوات. بالإضافة إلى تمديد مقطع الفيديو من خلال حوار جديد بواسطة الذكاء الاصطناعي ، يمكن للنظام الجديد أيضًا تعديل الكلام الحالي: (/video) انقر للعب. مثال
على تغيير الحوار الحالي بدلا من إضافة حوار جديد. يرجى الرجوع إلى موقع المصدر للحصول على دقة أفضل.
حالة الفن
هناك حاليا لا توجد أنظمة منتهي إلى منتهي تقدم هذه القدرة على التحليل.على الرغم من أن هناك عددا متزايدا من منصات الذكاء الاصطناعي مثل سلسلة Veoمن جوجل ، يمكن أن تولد الصوت ، ومنصات أخرىمع أنه قادر على توليد صوت مُضلل، إلا أنه لا يزال من الضروري إنشاء مجموعة معقدة من الهياكل والتقنيات المتنوعة لتحرير مقاطع الفيديو الحقيقية بطريقة فعّالة حقاً. الذي أن يحققها النظام الجديد – يسمى FacEDiT. يستخدم النظام معالجات Diffusion (DiT) مع Flow Matching لإنشاء حركات الوجه مشروطة بالحركات المحيطة (السياق) و محتوى الصوت. يستخدم النظام حزم موجودة شائعة لتحليل الوجه ، بما في ذلك LivePortrait (التي تم الاستحواذ عليها مؤخرا بواسطة Kling). بالإضافة إلى هذه الطريقة ، نظرا لأن نهجهم هو الأول الذي يدمج هذه التحديات في حل واحد ، فقد أنشأ المؤلفون معيارا جديدا يسمى FacEDiTBench ، إلى جانب معايير تقييم جديدة تماما ملائمة لهذه المهمة المحددة. يعتبر العمل كوريا المتقدم للعلوم والتكنولوجيا (KAIST) ، وجامعة تكساس في أوستن.الجديد بعنوان FacEDiT: تحرير وتوليد وجه التحدث الموحد من خلال تعبئة الحركة الوجهية ، ويأتي من أربعة باحثين من جامعة بوهانج للعلوم والتكنولوجيا (POSTECH) ، ومعهد
الطريقة
يتم تدريب FacEDiT على إعادة بناء حركة الوجه من خلال تعلم كيفية ملء الأجزاء المفقودة من أداء الممثل الأصلي ، بناء على الحركة المحيطة والصوت. كما هو موضح في مخطط أدناه ، يسمح هذا العملية للنموذج بالعمل كملء فجوات أثناء التدريب ، وتوقع حركات وجه تتوافق

المحرر في الاستدلال ، وأخيرا إعادة تقديمه إلى الفيديو عن طريق إعادة استخدام مظهر الفيديو الأصلي مع استبدال الحركة المستهدفة فقط. المصدر في وقت الاستدلال ، يدعم نفس الهيكل مخرجات مختلفة اعتمادا على مقدار الفيديو الذي يتمتسليطه: يتم تدريب النموذج من خلال Flow Matching ، الذي يعامل تعديلات الفيديو كنوع من المسار بين نسختين من حركة الوجه. بدلا من تعلم التخمين ما يجب أن يبدو عليه وجه محرر من الصفر ، يتعلم Flow Matching التحرك تدريجيا وبشكل سلس بين محمل مكانة خاطئة وحركة صحيحة. تم تصميم متجهات الحركة لوصف التعبيرات ووضع الرأس دون تشابك الهوية ، بحيث يمكن أن يتم تعديل التغييرات في الكلام دون التأثير على مظهر الشخص بشكل عام.
تدريب FacEDiT
في تدريب FacEDiT، قُسِّم كل مقطع فيديو إلى سلسلة من لقطات حركة الوجه، ورُبط كل إطار بمقطع صوتي مطابق. أُخفيت أجزاء عشوائية من بيانات الحركة، وطُلب من النموذج تحديد شكل هذه الحركات المفقودة، باستخدام الكلام والحركة المحيطة كسياق. ونظرًا لاختلاف الأجزاء المخفية ومواقعها من نموذج لآخر… مثالتدريب إلى آخر ، يتعلم النموذج تدريجيا كيفية التعامل مع تعديلات داخلية صغيرة ، وفتحات أطول ، من أجل توليد تسلسل كامل ، وفقا لمقدار المعلومات التي يتم توفيرها. يتعلم معالج Diffusion Transformer كيفية استعادة الحركة المخفية من خلال تحسين المدخلات المضطربة مع مرور الوقت. خلال التدريب ، يتعلم النظام كيفية التنبؤ بحركة الوجه المفقودة من خلال إعادة بناء الأجزاء المخفية بناء على الكلام والحركة غير المخفية.
البيانات والاختبارات
يتكون هيكل النظام من 22 طبقة للمتحول Diffusion ، كل طبقة مع 16 رأس attention وابعاد تغذية أمامية 1024 و 2024px.تم تدريب النموذج باستخدامAdamW عند معدل تعلم هدف 1e-4 ، لمدة مليون خطوة ، على جهازين A6000 GPU (كل منهما مع 48GB من VRAM) ، عند حجم.batch الكلي من ثمانية.
FacEDiTBench
يحتوي معيار FacEDiTBench على 250 مثال ، كل
منها مع مقطع فيديو للكلام الأصلي والمحرر ، والنسخ للكلامين. تم اختبار نظام FacEDiT على مجموعة من الإطارات التي تكرر بعض الوظائف المستهدفة ، وتم استخدامها كمرجع.
الاختبارات
تم اختبار نظام FacEDiT على مجموعة من الإطارات التي تكرر بعض الوظائف المستهدفة ، وتم استخدامها كمرجع. تم استخدام مجموعة من المعايير لتقييم جودة

وثقة التزامن وتماسك الهوية وواقعية
التزامن الشفوي
لإنشاء مقاطع
الفيديو. تم استخدام نظام FacEDiT

، وتم تقييم جودة المخرجات باستخدام المعايير المذكورة أعلاه.
الاستنتاج
FacEDiT نظام متكامل تمامًا، قادر على تحرير مقاطع الفيديو الحقيقية بإضافة الكلام أو حذفه أو تعديله. خضع النظام للاختبار على مجموعة من الإطارات التي تحاكي بعض الوظائف المستهدفة، واستُخدمت كمرجع. أظهرت النتائج تفوق FacEDiT على الإطارات الأخرى في التحرير وجودة الإنتاج. مع ذلك، قد يتطلب النظام موارد حاسوبية كبيرة أثناء الاستدلال، مما قد يُصعِّب تشغيله على أجهزتهم. على الرغم من ذلك، يُعد FacEDiT نظامًا واعدًا يُمكنه تقديم أداء جيد في تحرير مقاطع الفيديو الحقيقيةمقاطع الفيديو. نُشرت هذه المقالة لأول مرة يوم الأربعاء، 17 ديسمبر/كانون الأول 2022.
تم تحريره في 20:10 بتوقيت شرق أوروبا ، في نفس اليوم ، لإضافة مساحة إضافية في الفقرة الأولى.












