زاوية Anderson

إعادة تشكيل الوجوه في مقاطع الفيديو باستخدام التعلم الآلي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قد قام تعاون بحثي بين الصين والمملكة المتحدة بوضع طريقة جديدة لتحويل الوجوه في مقاطع الفيديو. تسمح التقنية بتحويل هيكل الوجه بشكل مقنع، مع استمرارية عالية وغياب للتشوهات.

من مقطع فيديو على يوتيوب استخدم كمواد مصدر من قبل الباحثين، تظهر الممثلة جينيفر لورانس كشخصية أكثر نحافة (يمين). انظر المقطع المصاحب المدمج في أسفل المقال لمزيد من الأمثلة بدقة أفضل. مصدر: https://www.youtube.com/watch?v=tA2BxvrKvjE

من مقطع فيديو على يوتيوب استخدم كمواد مصدر من قبل الباحثين، تظهر الممثلة جينيفر لورانس كشخصية أكثر نحافة (يمين). انظر المقطع المصاحب المدمج في أسفل المقال لمزيد من الأمثلة بدقة أفضل. مصدر: https://www.youtube.com/watch?v=tA2BxvrKvjE

عادة ما يتم هذا النوع من التحويل فقط من خلال أساليب CGI التقليدية التي تحتاج إلى إعادة إنشاء الوجه بالكامل من خلال إجراءات متحركة وتركيب وتلوين مفصلة ومكلفة.

بدلاً من ذلك، يتم دمج ما يوجد من CGI في التقنية في خط أنابيب عصبوني كبيانات ثلاثية الأبعاد لوجه معلمات يتم استخدامها لاحقًا كأساس لتدفق عمل التعلم الآلي.

الوجوه المعلمة التقليدية يتم استخدامها بشكل متزايد كدليل للعمليات التحويلية التي تستخدم التعلم الآلي بدلاً من CGI. مصدر: https://arxiv.org/pdf/2205.02538.pdf

الوجوه المعلمة التقليدية يتم استخدامها بشكل متزايد كدليل للعمليات التحويلية التي تستخدم التعلم الآلي بدلاً من CGI. مصدر: https://arxiv.org/pdf/2205.02538.pdf

يصرح المؤلفون:

‘هدفنا هو توليد نتائج عالية الجودة لتحويل مقاطع الفيديو للوجوه من خلال تحرير الشكل العام للوجوه وفقًا لتشوهات الوجه الطبيعية في العالم الواقعي. يمكن استخدام هذا للتطبيقات مثل توليد الوجوه الجميلة للتحسين، وتضخيم الوجه للتأثيرات البصرية.’

على الرغم من أن تحويل وتشويه الوجه ثنائي الأبعاد كان متاحًا للمستهلكين منذ ظهور برنامج الفوتوشوب (وهو ما أدى إلى ثقافات غريبة وأحيانًا غير مقبولة حول تشويه الوجه واضطرابات الجسم)، إلا أن هذا الأمر صعب التنفيذ في مقاطع الفيديو دون استخدام CGI.

تم توسيع أبعاد مارك زوكربيرج وتضييقها بواسطة التقنية الصينية البريطانية الجديدة.

تم توسيع أبعاد مارك زوكربيرج وتضييقها بواسطة التقنية الصينية البريطانية الجديدة.

يعد تحويل الجسم حاليًا مجالًا للاهتمام الشديد في قطاع رؤية الكمبيوتر، chủ yếu بسبب إمكاناته في تجارة الملابس الإلكترونية، على الرغم من أن جعل شخص ما يبدو أطول أو أكثر تنوعًا عظميًا ما زال تحديًا ملحًا.

كما أن تغيير شكل الرأس في مقاطع الفيديو بطريقة متسقة ومقنعة كان موضوع عمل سابقة من قبل باحثي الورقة الجديدة، على الرغم من أن التنفيذ السابق كان يعاني من تشوهات وقيود أخرى. تمتد الإمكانية الجديدة للعمل السابق من البحث من الإخراج الثابت إلى الإخراج الفيديوي.

تم تدريب النظام الجديد على جهاز كمبيوتر مكتبي مع AMD Ryzen 9 3950X و 32GB من الذاكرة، ويستخدم خوارزمية تدفق光ي من OpenCV لخرائط الحركة، ومُحسَّنة بواسطة إطار StructureFlow؛ شبكة Facial Alignment Network (FAN) لمحاكاة المعالم، والتي تستخدم أيضًا في حزم Deepfakes الشهيرة؛ و Ceres Solver لحل التحديات التأملية.

مثال على تشويه الوجه الشديد بالنظام الجديد.

مثال على تشويه الوجه الشديد بالنظام الجديد.

الورقة بعنوان تحويل الوجوه المعلمة في مقاطع الفيديو، وهي من ثلاثة باحثين من جامعة Zhejiang وواحد من جامعة Bath.

حول الوجه

تحت النظام الجديد، يتم استخراج مقطع الفيديو إلى تسلسل صورة، ويتم تقدير وضع صلب لكل وجه. ثم يتم تقدير عدد من الإطارات التالية بشكل مشترك لإنشاء معلمات هوية متسقة على مدار تشغيل الصور (أي إطارات مقطع الفيديو).

هيكل النظام لتحويل الوجه.

هيكل النظام لتحويل الوجه.

بعد ذلك، يتم تقييم التعبير، مما يؤدي إلى معلمة تحويل يتم تنفيذها بواسطة الانحدار الخطي. ثم يتم استخدام نهج دالة المسافة الموقعة (SDF) لإنشاء خريطة كثيفة ثنائية الأبعاد للخطوط الوجهية قبل وبعد التحويل.

أخيرًا، يتم تنفيذ تحسين تحويل متوافق المحتوى على مقطع الفيديو الناتج.

الوجوه المعلمة

تستخدم العملية نموذج وجه معلم ثلاثي الأبعاد (3DMM)، وهو مكون متزايد الشعبية لأنظمة合成 الوجه العصبونية وGAN، بالإضافة إلى كونه مفيدًا لاكتشاف عمليات Deepfakes.

ليس من الورقة، ولكن مثال على نموذج وجه معلم ثلاثي الأبعاد (3DMM) – نموذج وجه معلم يستخدم في المشروع الجديد. أعلى يسار، تطبيق معالم على وجه 3DMM. أعلى يمين، رأس الشبكة الثلاثية الأبعاد لخريطة الإيزوماب. يظهر أسفل يسار التركيب المعلمي؛ أسفل الوسط، خريطة إيزوماب لنسيج الوجه المستخرج؛ وأسفل يمين، التركيب الناتج والشكل.

ليس من الورقة، ولكن مثال على نموذج وجه معلم ثلاثي الأبعاد (3DMM) – نموذج وجه معلم يستخدم في المشروع الجديد. مصدر: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

يجب أن يأخذ تدفق العمل للنظام الجديد في الاعتبار حالات العوائق، مثل حالة يلتفت فيها الموضوع بعيدًا. هذه هي واحدة من أكبر التحديات في برامج Deepfakes، حيث تقلل معالم FAN القليل من القدرة على معالجة هذه الحالات، وتتدهور جودتها مع ابتعاد الوجه أو عُقده.

يتمكن النظام الجديد من تجنب هذه الفخاخ عن طريق تعريف طاقة الحد التي تتمكن من مطابقة الحدود بين الوجه ثلاثي الأبعاد (3DMM) والوجه ثنائي الأبعاد (كما هو محدد بواسطة معالم FAN).

التنظيم

يمكن أن يكون تطبيق مفيد للنظام هو تنفيذ تشوه في الوقت الفعلي، على سبيل المثال في مرشحات دردشة الفيديو. لا يسمح الإطار الحالي بذلك، وستكون الموارد الحاسوبية اللازمة لتجعل التشوه “حَي” تحديًا ملحًا.

وفقًا للورقة، وافتراضًا أن الهدف هو فيديو بسرعة 24 إطارًا في الثانية، تمثل العمليات لكل إطار في خط الأنابيب زمن تأخير يبلغ 16.344 ثانية لكل ثانية من الفيديو، مع ضربات إضافية لتقدير الهوية وتشوه الوجه ثلاثي الأبعاد (321 مللي ثانية و 160 مللي ثانية، على التوالي).

لذلك، التنظيم هو مفتاح التقدم نحو خفض زمن التأخير. منذ أن يضيف التنظيم المشترك عبر جميع الإطارات أعباء شديدة إلى العملية، ويمكن أن يؤدي التنظيم النمطي (افتراض هوية المتحدث الثابتة من الإطار الأول) إلى شذوذ، فقد اعتمد المؤلفون مخططًا نادرًا لحساب معاملات الإطارات العينات بفترات زمنية عملية.

ثم يتم تنفيذ التنظيم المشترك على هذا الجزء الفرعي من الإطارات، مما يؤدي إلى عملية إعادة بناء أكثر رشاقة.

تحويل الوجه

تكنيك التحويل المستخدم في المشروع هو تعديل للعمل السابق للمؤلفين في عام 2020 الصور الشخصية الشكلية العميقة (DSP).

الصور الشخصية الشكلية العميقة، وهي ورقة قدمت إلى ACM Multimedia. يترأس الورقة باحثون من ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. مصدر: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

الصور الشخصية الشكلية العميقة، وهي ورقة قدمت إلى ACM Multimedia. مصدر: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

يلاحظ المؤلفون ‘نحن نوسع هذه الطريقة من تحويل صورة واحدة إلى تحويل تسلسل الصورة بأكمله.’

الاختبارات

تلاحظ الورقة أن هناك لا يوجد مواد قابلة للمقارنة سابقة لتقييم الطريقة الجديدة. لذلك قام المؤلفون بمقارنة إطارات من خرج الفيديو المحول ضد خرج DSP الثابت.

اختبار النظام الجديد مقابل صور ثابتة من الصور الشخصية الشكلية العميقة.

اختبار النظام الجديد مقابل صور ثابتة من الصور الشخصية الشكلية العميقة.

يلاحظ المؤلفون أن التشوهات الناجمة عن طريقة DSP، بسبب استخدامها لتحويل نادر – مشكلة ي 해결ها الإطار الجديد بتحويل كثيف.

يصرح المؤلفون:

‘تظهر النتائج أن نهجنا يمكن أن ينتج بثبات مقاطع فيديو محولة للوجوه بشكل متسق، بينما يمكن أن يؤدي الأسلوب القائم على الصورة بسهولة إلى تشوهات فلاش واضحة.’

انظر المقطع المصاحب أدناه لمزيد من الأمثلة:

 

نشر لأول مرة في 9 مايو 2022. تم تعديله في الساعة 6 مساءً بتوقيت شرق أوروبا، واستبدل ‘حقل’ بـ ‘دالة’ لـ SDF.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai