زاوية Anderson

تقنية LipSync3D من جوجل توفر تحسينات في مزامنة حركة الشفاه

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تعاون بين باحثي جوجل آي آي و المعهد الهندي للتقنية في خاراغبور يقدم إطارًا جديدًا لتحليل رؤوس المتحدثين من المحتوى الصوتي. وتهدف هذه المشروع إلى إنتاج طرق محسنة وموارد معقولة لإنشاء محتوى فيديو “رؤوس متحدثة” من الصوت ، لغرض مزامنة حركة الشفاه مع الصوت المُدبلج أو المُترجم آليًا ، واستخدامه في التماثيل ، والتطبيقات التفاعلية ، والبيئات الوقت الحقيقي الأخرى.

المصدر: https://www.youtube.com/watch?v=L1StbX9OznY

المصدر: https://www.youtube.com/watch?v=L1StbX9OznY

النماذج التي تم تدريبها في هذه العملية – تسمى LipSync3D – تتطلب فقط فيديو واحد للهوية الوجهية المستهدفة كبيانات إدخال. وتسمح خط أنابيب تحضير البيانات بفصل استخراج الهندسة الوجهية عن تقييم الإضاءة والجوانب الأخرى للفيديو الإدخالي ، مما يسمح بتدريب أكثر اقتصادية وتركيز.

عملية LipSync3D على مرحلتين. في الأعلى ، إنشاء وجه ثلاثي الأبعاد ديناميكي النسيج من الصوت

عملية LipSync3D على مرحلتين. في الأعلى ، إنشاء وجه ثلاثي الأبعاد ديناميكي النسيج من الصوت “الهدف” ؛ في الأسفل ، إدراج الشبكة المولدة في فيديو الهدف.

في الواقع ، قد يكون المساهمة الأكثر أهمية لـ LipSync3D في جسم الجهد البحثي في هذا المجال هو خوارزمية تحسين الإضاءة ، التي تفصل بين تدريب و استدلال الإضاءة.

LipSync3D ، كما يوحي اسمها ، لا تقوم بتحليل البكسل البسيط على الوجوه التي تقيمها ، ولكنها تستخدم بالفعل معالم الوجهية المحددة لإنشاء شبكات CGI متحركة ، مع النسيج “غير متجاوز” الذي يتم لفه حولها في خط أنابيب CGI تقليدي.

[caption id="attachment_176016" align="alignnone" width="1306"]تعويض الموضع في LipSync3D. على اليسار ، إطارات الإدخال والميزات المكتشفة ؛ في الوسط ، رأس الشبكة المولدة ؛ وعلى اليمين ، أطلس النسيج ، الذي يوفر الحقيقة الأرضية لتوقع النسيج. تعويض الموضع في LipSync3D. على اليسار ، إطارات الإدخال والميزات المكتشفة ؛ في الوسط ، رأس الشبكة المولدة ؛ وعلى اليمين ، أطلس النسيج ، الذي يوفر الحقيقة الأرضية لتوقع النسيج. Source: https://arxiv.org/pdf/2106.04185.pdf

بصرف النظر عن طريقة تحسين الإضاءة الجديدة ، يزعم الباحثون أن LipSync3D تقدم ثلاثة ابتكارات رئيسية على الأعمال السابقة: فصل الهندسة والإضاءة والموضع والنسيج إلى تيارات بيانات منفصلة في مساحة معيارية ؛ نموذج توقع نسيج ذاتي قابل للتدريب بسهولة ينتج تركيبات فيديو متسقة زمنياً ؛ وزيادة الواقعية ، كما تقييمه التقييمات البشرية والمقاييس الموضوعية.

تقسيم مختلف جوانب الصور الوجهية في الفيديو يسمح بمزيد من التحكم في تركيبات الفيديو.

تقسيم مختلف جوانب الصور الوجهية في الفيديو يسمح بمزيد من التحكم في تركيبات الفيديو.

يمكن لـ LipSync3D استخراج هندسة شفاه مناسبة مباشرة من الصوت عن طريق تحليل الأصوات والجوانب الأخرى للكلام ، وترجمتها إلى مواضع عضلية معروفة حول منطقة الفم.

تستخدم هذه العملية خط أنابيب التنبؤ المشترك ، حيث يكون للهندسة والنسيج المحددتين معالجات مخصصة في مجموعة من المعالجات ، ولكنها تشترك في معالج الصوت مع الكلام الذي يُقصد إضفاءه على النموذج:

كما أن ت合성 حركة LipSync3D القابلة للتغيير تعني لتزويد التماثيل CGI الأسلوبية بالطاقة:

تمثال CGI أسلوبي ثلاثي الأبعاد له حركات شفاه مدفوعة في الوقت الفعلي من فيديو متحدث مصدر. في مثل هذا السيناريو ، ستكون أفضل النتائج هي التي تم الحصول عليها من خلال التدريب المسبق المخصص.

تمثال CGI أسلوبي ثلاثي الأبعاد له حركات شفاه مدفوعة في الوقت الفعلي من فيديو متحدث مصدر. في مثل هذا السيناريو ، ستكون أفضل النتائج هي التي تم الحصول عليها من خلال التدريب المسبق المخصص.

يتوقع الباحثون أيضًا استخدام التماثيل مع شعور قليلا أكثر واقعية:

أوقات التدريب العينة للفيديوهات تتراوح من 3-5 ساعات لفيلم يتراوح من 2-5 دقائق ، في خط أنابيب يستخدم TensorFlow و Python و C++ على GeForce GTX 1080. استخدمت جلسات التدريب حجمًا مجمعيًا من 128 إطارًا على 500-1000 عصر ، مع تمثيل كل عصر تقييمًا كاملاً للفيديو.

نحو مزامنة ديناميكية لحركة الشفاه

حظيت مجال مزامنة الشفاه لاستيعاب مسار صوتي جديد باهتمام كبير في أبحاث الرؤية الحاسوبية في السنوات القليلة الماضية (انظر أدناه) ، ولا سيما لأنها منتج ثانوي لتكنولوجيا Deepfake الجدلية.

في عام 2017 ، قدمت جامعة واشنطن بحثًا قادرًا على تعلم مزامنة الشفاه من الصوت ، واستخدامه لتغيير حركة الشفاه للرئيس السابق أوباما. في عام 2018 ، قاد معهد ماكس بلانك للإنفورماتيكا مبادرة بحثية أخرى لتمكين نقل الفيديو من هوية إلى هوية ، مع مزامنة الشفاه كمنتج ثانوي للعملية: وفي مايو 2021 ، كشفت شركة FlawlessAI الحائزة على جوائز عن تقنية مزامنة الشفاه الخاصة بها TrueSync ، والتي تم استقبالها على نطاق واسع في الصحافة كمنشئ لتكنولوجيا الدبلجة المحسنة لأفلام رئيسية عبر اللغات.

وبالطبع ، فإن التطوير المستمر لمستودعات Deepfake المفتوحة المصدر يوفر فرعًا آخر من البحث النشط المساهم من قبل المستخدمين في مجال 합성 الصور الوجهية.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai