زاوية Anderson

ST-NeRF: تركيب وتحرير لتنسيق الفيديو

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
ST-NeRF

قد طور اتحاد بحثي صيني تقنيات لجلب القدرات على التحرير والتركيب إلى واحدة من أهم قطاعات 합성 الصور البحثية الساخنة في العام الماضي – مجالات الإشعاع العصبية (NeRF). ويُطلق على النظام اسم ST-NeRF (حقل الإشعاع العصبي المتوافق مكانيًا وزمنيًا).

ما يبدو وكأنه حركة كاميرا فيزيائية في الصورة أدناه هو في الواقع مجرد مستخدم “يتحرك” من خلال وجهات نظر على محتوى فيديو موجود في مساحة ذات أربعة أبعاد. لا يتم قفل نقطة المشاهدة إلى أداء الأشخاص الموضحين في الفيديو ، ويمكن عرض تحركاتهم من أي جزء من نصف قطر 180 درجة.

ST-NeRF

كل جانب داخل الفيديو هو عنصر تم التقاطه بشكل منفصل ، وتم تجميعه معًا في مشهد متوافق يمكن استكشافه ديناميكيًا.

يمكن تكرار الجوانب بحرية داخل المشهد ، أو إعادة تحجيمها:

ST-NeRF

بالإضافة إلى ذلك ، يمكن تعديل السلوك الزمني لكل جانب بسهولة ، تباطؤه ، تشغيله إلى الوراء ، أو تعديله بطرق عديدة ، مما يفتح الطريق إلى هياكل المرشحات ودرجة تفسيرية عالية جدًا.

جزئين من NeRF منفصلين يعملان بسرعات مختلفة في نفس المشهد. مصدر: https://www.youtube.com/watch?v=Wp4HfOwFGP4

جزئين من NeRF منفصلين يعملان بسرعات مختلفة في نفس المشهد. مصدر: https://www.youtube.com/watch?v=Wp4HfOwFGP4

لا يوجد حاجة إلى روتوسكوبية للمؤدين أو البيئات ، أو أن يقوم المؤديون بتنفيذ تحركاتهم بشكل أعمى وخارج سياق المشهد المقصود. بدلاً من ذلك ، يتم التقاط اللقطات بشكل طبيعي عبر مصفوفة من 16 كاميرا فيديو تغطي 180 درجة:

16 كاميرا ST-NeRF

العناصر الثلاثة الموضحة أعلاه ، الأشخاص والبيئة ، هي منفصلة ومحددة فقط لأغراض توضيحية. يمكن استبدال كل منها ، ويمكن إدراج كل منها في المشهد في نقطة سابقة أو لاحقة في جدول زمني التقاطه الفردية.

العناصر الثلاثة الموضحة أعلاه ، الأشخاص والبيئة ، هي منفصلة ومحددة فقط لأغراض توضيحية. يمكن استبدال كل منها ، ويمكن إدراج كل منها في المشهد في نقطة سابقة أو لاحقة في جدول زمني التقاطه الفردية.

ST-NeRF هو ابتكار في البحث في مجالات الإشعاع العصبية (NeRF) ، وهو إطار عمل للتعلم الآلي يُ合ن فيه العديد من وجهات النظر الملتقطة في مساحة افتراضية قابلة للملاحة عن طريق التدريب الشامل (على الرغم من أن التقاط وجهة النظر الواحدة هو أيضًا فرع من فروع بحث NeRF).

تعمل مجالات الإشعاع العصبية عن طريق تجميع العديد من وجهات النظر الملتقطة في مساحة ثلاثية الأبعاد متوافقة وقابلة للملاحة ، مع تقدير الفجوات بين التغطية وتحويلها بواسطة شبكة عصبية. حيث يتم استخدام الفيديو (بدلاً من الصور الثابتة) ، فإن الموارد اللازمة للتحويل غالبًا ما تكون كبيرة. مصدر: https://www.matthewtancik.com/nerf

تعمل مجالات الإشعاع العصبية عن طريق تجميع العديد من وجهات النظر الملتقطة في مساحة ثلاثية الأبعاد متوافقة وقابلة للملاحة ، مع تقدير الفجوات بين التغطية وتحويلها بواسطة شبكة عصبية. حيث يتم استخدام الفيديو (بدلاً من الصور الثابتة) ، فإن الموارد اللازمة للتحويل غالبًا ما تكون كبيرة. مصدر: https://www.matthewtancik.com/nerf

أصبح الاهتمام ب NeRF شديدًا في الأشهر التسعة الماضية ، وقائمة محفوظة على Reddit حاليًا لورقات بحثية مشتقة أو استكشافية NeRF تضم ستين مشروعًا.

 

بعض الفروع القليلة من ورقة NeRF الأصلية. مصدر: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

بعض الفروع القليلة من ورقة NeRF الأصلية. مصدر: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

تدريب ميسور التكلفة

الورقة هي تعاون بين الباحثين في جامعة شنغهاي تيك وجين ديجيتال تكنولوجي ، وقد تم قبولها ببعض الحماس على منصة Open Review.

يقدم ST-NeRF العديد من الابتكارات على المبادرات السابقة في مجالات الفضاء القابلة للملاحة المشتقة من التعلم الآلي. ليس أقلها ، أنه يصل إلى مستوى عالٍ من الواقعية مع 16 كاميرا فقط. على الرغم من أن DyNeRF من فيسبوك يستخدم كاميرتين أكثر من ذلك ، إلا أنه يقدم مسارًا قابلاً للملاحة أكثر تقييدًا.

مثال على بيئة DyNeRF من فيسبوك ، مع مسار حركة أكثر تقييدًا ، وعدد أكبر من الكاميرات لكل قدم مربع مطلوب لإعادة بناء المشهد. مصدر: https://neural-3d-video.github.io

مثال على بيئة DyNeRF من فيسبوك ، مع مسار حركة أكثر تقييدًا ، وعدد أكبر من الكاميرات لكل قدم مربع مطلوب لإعادة بناء المشهد. مصدر: https://neural-3d-video.github.io

إضافة إلى عدم القدرة على تحرير وتركيب الجوانب الفردية ، فإن DyNeRF مكلف للغاية من حيث الموارد الحاسوبية. من ناحية أخرى ، يصرح الباحثون الصينيون بأن تكلفة التدريب لبياناتهم تتراوح بين 900 دولار و 3000 دولار ، مقارنة بـ 30 ألف دولار لنموذج توليد الفيديو المتقدم DVDGAN ، والأنظمة المكثفة مثل DyNeRF.

لاحظ المراجعون أيضًا أن ST-NeRF يقدم ابتكارًا كبيرًا في فصل عملية التعلم عن الحركة عن عملية 합성 الصور. هذا الفصل هو ما يمكّن التحرير والتركيب ، مع أن النهج السابقة كانت مقيدة وخطية بالمقارنة.

على الرغم من أن 16 كاميرا هي مصفوفة محدودة جدًا لشبه دائرة كاملة من المشاهدة ، يأمل الباحثون في خفض هذا العدد في العمل اللاحق من خلال استخدام خلفيات سابقة مسبقة مسحها ، ومواد أكثر لنمذجة المشهد. كما يأملون في دمج القدرات لإعادة الإضاءة ، وهي ابتكار حديث في بحث NeRF.

معالجة قيود ST-NeRF

في سياق الأوراق البحثية الأكاديمية التي تميل إلى التخلص من قابلية استخدام النظام الجديد في فقرة نهاية رمية ، حتى القيود التي يعترف بها الباحثون ل ST-NeRF هي غير عادية.

يلاحظون أن النظام لا يمكنه حاليًا تحديد الأجسام الفردية في المشهد وتحويلها بشكل منفصل ، لأن الأشخاص في اللقطات يتم تقسيمهم إلى كيانات فردية عبر نظام مصمم لتعرف البشر وليس الأجسام – مشكلة يبدو أنها يمكن حلها بسهولة باستخدام إطارات مثل YOLO ، مع أن العمل الأصعب لاستخراج الفيديو البشري قد تم إنجازه بالفعل.

على الرغم من أن الباحثين يلاحظون أنه لا يمكن حاليًا توليد حركة بطيئة ، يبدو أنه لا يوجد ما يمنع تنفيذ ذلك باستخدام الابتكارات الحالية في تقنيات الاستيفاء الإطاري مثل DAIN و RIFE.

كما هو الحال مع جميع تطبيقات NeRF ، وفي العديد من مجالات البحث الأخرى في الرؤية الحاسوبية ، يمكن أن يفشل ST-NeRF في حالات العُقَد الشديدة ، حيث يتم حجب الموضوع مؤقتًا بواسطة شخص آخر أو كائن ، ويمكن أن يكون من الصعب تتبعه بشكل مستمر أو إعادة اكتسابه بدقة بعد ذلك. كما يُقر الباحثون بأن التدخل اليدوي ضروري في هذه الإطارات المحجوبة.

أخيرًا ، يلاحظ الباحثون أن إجراءات تحديد الأشخاص الحالية تعتمد على الفروق اللونية ، مما قد يؤدي إلى تجميع غير مقصود لشخصين في كتلة واحدة – عائق لا يقتصر على ST-NeRF ، ولكن هو ذو طبيعة جوهرية للиблиواري المستخدمة ، ويمكن حلها ربما بواسطة تحليل التدفق البصري وتقنيات أخرى ناشئة.

نشر لأول مرة في 7 مايو 2021.

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]