زاوية Anderson

التصور العصبي: NeRF في الهواء الطلق

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تعاون بين بحث جوجل وجامعة هارفارد أدى إلى تطوير طريقة جديدة لإنشاء فيديو عصبي 360 درجة للمشهد الكامل باستخدام حقول الإشعاع العصبية (NeRF). هذا النهج الجديد يقرب NeRF من الاستخدام المجرد في أي بيئة ، دون أن يكون مقيدًا بالطرازات على الطاولة أو السيناريوهات الداخلية المغلقة.

المصدر: https://www.youtube.com/watch?v=YStDS2-Ln1s

انظر نهاية المقال لمشاهدة الفيديو الكامل. المصدر: https://www.youtube.com/watch?v=YStDS2-Ln1s

Mip-NeRF 360 يمكنه التعامل مع الخلفيات الممتدة والأجسام “اللامتناهية” مثل السماء ، لأنها ، على عكس معظم الإصدارات السابقة ، تضع حدودًا على طريقة تفسير أشعة الضوء ، وتخلق حدودًا للانتباه التي ترشح أوقات التدريب الطويلة.

المقال الجديد بعنوان Mip-NeRF 360: حقول الإشعاع العصبية غير المحدودة والمضادة للتحويل ، ويقوده عالم الأبحاث الأول في جوجل جون بارون.

ما هو NeRF؟

من الصعب وصف شبكة NeRF بالفيديو ، لأنه أقرب إلى بيئة افتراضية ثلاثية الأبعاد قائمة على الذكاء الاصطناعي ، حيث يتم استخدام عدة وجهات نظر من الصور الفردية (بما في ذلك إطارات الفيديو) لخيط المشهد معًا ، وهو موجود تقنيًا فقط في الفضاء الكامن لخوارزمية التعلم الآلي – ولكن يمكن استخراج عدد كبير من وجهات النظر والفيديوهات منه عند الرغبة.

صورة توضح نقاط التقاط الكاميرا المتعددة التي توفر البيانات التي يجمعها NeRF في مشهد عصبي (يمين).

صورة توضح نقاط التقاط الكاميرا المتعددة التي توفر البيانات التي يجمعها NeRF في مشهد عصبي (يمين).

المعلومات المستمدة من الصور يتم تدريبها في مصفوفة تشبه شبكة الفوكسل التقليدية في تدفقات CGI ، بحيث يصبح كل نقطة في الفضاء ثلاثي الأبعاد لها قيمة ، مما يجعل المشهد قابلاً للتحرك.

مصفوفة الفوكسل التقليدية توضع المعلومات النقطية (التي توجد عادةً في سياق ثنائي الأبعاد ، مثل شبكة النقاط في ملف JPEG) في فضاء ثلاثي الأبعاد. المصدر: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

مصفوفة الفوكسل التقليدية توضع المعلومات النقطية (التي توجد عادةً في سياق ثنائي الأبعاد ، مثل شبكة النقاط في ملف JPEG) في فضاء ثلاثي الأبعاد. المصدر: ResearchGate

بعد حساب الفضاء بين الصور (إذا لزم الأمر) ، يتم توجيه مسار كل بكسل ممكن من كل صورة مساهمة وتعيين قيمة لون لها ، بما في ذلك قيمة الشفافية (بدون التي ستكون المصفوفة العصبية غير شفافة أو فارغة).

منظور أوسع للبكسل

Mip-NeRF 360 هو امتداد للبحث من مارس 2021 ، الذي أدخل بشكل فعال التخفيض المتعالي الفعال إلى NeRF دون عينة مكثفة.

NeRF تقليديًا يحسب مسار بكسل واحد فقط ، وهو يميل إلى إنتاج نوع من الحدود الخشنة التي تميز صيغ الصور المبكرة على الإنترنت ، بالإضافة إلى أنظمة الألعاب المبكرة. تم حل هذه الحواف الخشنة bằng طرق مختلفة ، عادةً عن طريق أخذ عينات البكسلات المجاورة وإيجاد تمثيل متوسط.

因为 NeRF التقليدية يأخذ فقط مسار بكسل واحد ، أدخل Mip-NeRF منطقة التقاط مخروطية ، مثل شعاع واسع ، يوفر معلومات كافية حول البكسلات المجاورة لإنتاج تخفيض متعالي اقتصادي مع تفاصيل محسنة.

منطقة التقاط المخروطي التي يستخدمها Mip-NeRF مقطعة إلى مخروطيات متساوية (أسفل) ، والتي يتم تقليلها بشكل أكبر لتمثيل فضاء غاوسي غامض يمكن استخدامه لحساب دقة البكسل وتحويله.

منطقة التقاط المخروطي التي يستخدمها Mip-NeRF مقطعة إلى مخروطيات متساوية (الصورة السفلية) ، والتي يتم تقليلها بشكل أكبر لتمثيل فضاء غاوسي غامض يمكن استخدامه لحساب دقة البكسل وتحويله. المصدر: https://www.youtube.com/watch?v=EpH175PY1A0

NeRF غير المحدود

الورقة من مارس تركت ثلاث مشاكل غير محلولة فيما يتعلق باستخدام Mip-NeRF في البيئات غير المحدودة التي قد تشمل أشياء بعيدة جدًا ، مثل السماء. تحل الورقة الجديدة هذه المشكلة bằng تطبيق تحويل Kalman-Style على Gaussians Mip-NeRF.

ثانيًا ، تتطلب المشاهد الأكبر قوة معالجة أكبر وأوقات تدريب أطول ، وهو ما يحله Mip-NeRF 360 عن طريق تقليص هندسة المشهد بملف متعدد الطبقات صغير (MLP) ، الذي يحدد مسبقًا الهندسة التي تتنبأ بها NeRF MLP القياسي. هذا يسرع من وقت التدريب بثلاث مرات.

أخيرًا ، تميل المشاهد الأكبر إلى جعل التقطيع الغامض للهندسة المفسرة غامضًا ، مما يؤدي إلى نوع من العيوب التي قد تكون معروفة لدى اللاعبين عندما ي出现 “تجزئة” الإخراج. ت解决 الورقة الجديدة هذه المشكلة bằng إنشاء منظم جديد لفترات أشعة Mip-NeRF.

على اليمين ، نرى عيوب غير مرغوب فيها في Mip-NeRF بسبب صعوبة تحديد المشهد الكبير. على اليسار ، نرى أن المنظم الجديد قد حسّن المشهد بما يكفي لإزالة هذه الاضطرابات.

على اليمين ، نرى عيوب غير مرغوب فيها في Mip-NeRF بسبب صعوبة تحديد المشهد الكبير. على اليسار ، نرى أن المنظم الجديد قد حسّن المشهد بما يكفي لإزالة هذه الاضطرابات.

لمعرفة المزيد حول الورقة الجديدة ، انظر الفيديو أدناه ، وكذلك مقدمة فيديو مارس 2021 إلى Mip-NeRF. يمكنك أيضًا معرفة المزيد حول أبحاث NeRF من خلال التغطية التي قمنا بها حتى الآن.

نشر في الأصل في 25 نوفمبر 2021
21 ديسمبر 2021 ، 12:25 مساءً – استبدل الفيديو التالف. – MA

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai