زاوية Anderson
ديزني تجمع بين CGI والتصيير العصبي لمواجهة ‘وادي الغرابة’

قامت وحدة أبحاث الذكاء الاصطناعي في ديزني بتطوير طريقة هجينة لمحاكاة الوجوه بجودة الأفلام، تجمع بين قوة التصيير العصبي للوجوه واتساق النهج القائم على CGI.
العنوان المقترح للورقة هو Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering، وتمت معاينتها في فيديو جديد مدته 10 دقائق على قناة Disney Research على يوتيوب (مضمن في نهاية هذه المقالة*).

Meshes combined with neural facial renders. See video embed at end of article for better detail and quality. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk
كما يشير الفيديو، يمكن لـ التصيير العصبي للوجوه (بما في ذلك الـ deepfakes) إنتاج عيون وداخل أفواه أكثر واقعية بكثير مما يستطيع CGI تحقيقه، بينما تكون القوام الوجهية المدفوعة بـ CGI أكثر اتساقًا ومناسبة لإنتاج مؤثرات بصرية بمستوى السينما.
لذلك تقوم ديزني بتجربة السماح لمولد NVIDIA StyleGan2 العصبي بالتعامل مع الميزات المحيطة بالوجه والعناصر ‘الحاسمة للحياة’ مثل العيون، مع وضع جلد وجه CGI المتسق والعناصر المرتبطة به فوق النتيجة.

From the video (see end of article), the architectural concept behind Disney’s hybrid approach, where an old-school CGI mesh, of the type used to recreate ‘young’ Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.
يشير الفيديو ضمنيًا إلى الانتقادات المتكررة حول عدم الأصالة وتأثير ‘وادي الغرابة’ في إعادة إنشاء CGI للراحل الممثل البريطاني Star Wars بيتر كوشينغ في فيلم Rogue One (2016)، معترفًا بذلك:
‘[لا يزال] هناك فجوة هائلة بين ما يمكن للناس التقاطه وتصويره بسهولة وبين النسخ الرقمية الفوتوغرافية النهائية، المكتملة بالشعر والعيون وداخل الفم. لسد هذه الفجوة، عادةً ما يتطلب الأمر الكثير من العمل اليدوي من الفنانين الماهرين.’
في الواقع، حتى أكثر أنظمة التقاط الوجوه الحديثة لا تحاول إعادة إنشاء العيون أو داخل الفم أو الشعر، حيث تواجه هذه العناصر إما مشاكل في الأصالة في مثل هذه التقنيات (العيون) أو مشاكل في الاتساق الزمني (الشعر).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline, in addition to texturing and lighting.
التحكم في الإضاءة
النهج الهجين يُعد أيضًا فائدة في إعادة الإضاءة – وهو تحدٍ ملحوظ للتصيير العصبي للوجوه، حيث يمكن إعادة إضاءة طبقات جلد CGI بسهولة أكبر.

An animated version of the CGI/Neural approach.
في بيئات أكثر تحديًا، مثل التصوير الخارجي، طور الباحثون طريقة للملء داخل الصورة حول ما يشبه المنطقة المنزوعة السلاح المحيطة بالشخص الذي يتم ‘إنشاؤه’.

A black margin is generated to allow a ‘canvas’ for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.
يشير الفيديو إلى:
‘[إن] التصيير العصبي لا يتطابق مع قيود الخلفية بشكل كامل. – هو مجرد دليل، حيث إن تحسين المكونات البشرية الواقعية مثل الشعر والعيون والأسنان هو الهدف الرئيسي. التحدي الأكبر هو محاولة الحفاظ على هوية متسقة، مع تغيير إضاءة البيئة.’
إنشاء شبكات CGI من التصييرات العصبية
طور فريق البحث أيضًا مشفرًا تلقائيًا متغيرًا تم تدريبه على قاعدة بيانات (غير محددة) كبيرة من صور الوجوه ثلاثية الأبعاد، ويدعي أنه يمكنه إنتاج شبكات وجوه ثلاثية الأبعاد ‘عشوائية ولكن معقولة’ من بيانات الحقيقة الأرضية.
هناك قيود يجب على هذا البحث تجاوزها، بما في ذلك الصعوبة في الحفاظ على اتساق الشعر زمنيًا في التصييرات العصبية، ويظهر الفيديو (انظر أدناه) عدة أمثلة لشعر يتغير بسرعة في دوران ثابت حول وجه CGI/عصبي.
الاتساق الزمني في تصيير الفيديو العصبي مشكلة أوسع بكثير من مشكلة ديزني فقط، ويبدو أن الإصدارات اللاحقة من هذا النظام قد تلجأ إلى إضافة الشعر ‘بعد المعالجة’، أو إلى أساليب أخرى محتملة لتوليد الشعر بدلاً من الاعتماد على أن يحل نهج عصبي جديد هذه المشكلة في النهاية.
استخدامات توليد مجموعات البيانات
يُقترح أيضًا أن تكون هذه الطريقة وسيلة محتملة لتوليد بيانات اصطناعية، وإثراء مشهد مجموعات صور الوجوه، التي أصبحت في السنوات الأخيرة متجانسة بشكل خطر.

Disney envisages the new technique populating facial image datasets.
‘[كل] نتيجة فوتوغرافية واقعية نولدها لديها هندسة أساسية مقابلة وخرائط مظهر، تُصوَّر من زوايا كاميرا غير معروفة بإضاءة معروفة. يمكن أن تكون هذه المعلومات ‘الحقيقة الأرضية’ حيوية لتدريب التطبيقات اللاحقة، مثل إعادة بناء الوجه ثلاثي الأبعاد من صورة واحدة، أو التعرف على الوجوه، أو فهم المشهد. وبالتالي يمكن اعتبار كل نتيجة تصيير عينة بيانات، ويمكننا توليد العديد من التنويعات للعديد من الأفراد المختلفين.’
‘علاوة على ذلك، حتى بالنسبة لشخص واحد يُصوَّر بتعبير واحد وزاوية إضاءة وإضاءة واحدة، يمكننا توليد تنويعات عشوائية من التصيير الفوتوغرافي الواقعي عن طريق تغيير بذرة العشوائية أثناء التحسين.’
يشير الباحثون إلى أن هذا التنوع في المخرجات القابلة للتكوين قد يكون مفيدًا في تدريب تطبيقات التعرف على الوجوه، ختامًا:
‘[طريقتنا] قادرة على الاستفادة من التقنية الحالية لالتقاط جلد الوجه، والنمذجة، والتصيير، وإنشاء تصييرات وجوه فوتوغرافية واقعية كاملة تلقائيًا تتطابق مع الهوية المطلوبة، والتعبير، وتكوين المشهد. لهذا النهج تطبيقات في تصيير الوجوه للأفلام والترفيه، مما يوفر جهد الفنانين اليدوي، وكذلك لتوليد البيانات في مجالات مختلفة من التعلم العميق.’
لإلقاء نظرة أعمق على النهج الجديد، تفقد الفيديو المدته 10 دقائق الذي صدر اليوم:
* تم استبدال رابط الفيديو الأصلي بآخر يبدو متطابقًا بعد 8 ساعات من نشر هذه المقالة. قمت بتغيير جميع الروابط ذات الصلة، حيث لا يوجد أي أثر للفيديو الأصلي.
8:24 GMT+2 – تم استبدال الفيديو، حيث قام قناة Disney Research على يوتيوب بتغييره لسبب ما.












