زاوية Anderson

تحسين الواقعية التصويرية لمحاكاة القيادة باستخدام الشبكات العصبية التوليدية المعارضة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قد提出了 مبادرة بحثية جديدة بين الولايات المتحدة والصين لاستخدام الشبكات العصبية التوليدية المعارضة (GANs) لزيادة واقعية محاكيات القيادة.

في نهج جديد لتحدي إنتاج مشاهد قيادة POV فوتوغرافية واقعية، قام الباحثون بتطوير طريقة هجينة تلعب على نقاط القوة للنهج المختلفة، من خلال مزج الإخراج الأكثر واقعية للنظم المستندة إلى CycleGAN مع عناصر تقليدية أكثر، والتي تتطلب مستوى أعلى من التفاصيل والاتساق، مثل علامات الطريق والمركبات الفعلية التي تُلاحظ من منظور السائق.

الرسومات العصبية الهجينة التوليدية (HGNG) تقدم اتجاها جديدا لمحاكاة القيادة التي تحتفظ بالدقة من النماذج ثلاثية الأبعاد للعناصر الأساسية (مثل علامات الطريق والمركبات)، في حين تلعب على نقاط قوة الشبكات العصبية التوليدية في توليد خلفيات و细节 بيئية غير مكررة ومثيرة للاهتمام.

الرسومات العصبية الهجينة التوليدية (HGNG) تقدم اتجاها جديدا لمحاكاة القيادة التي تحتفظ بالدقة من النماذج ثلاثية الأبعاد للعناصر الأساسية (مثل علامات الطريق والمركبات)، في حين تلعب على نقاط قوة الشبكات العصبية التوليدية في توليد خلفيات و细يات بيئية غير مكررة ومثيرة للاهتمام. المصدر

النظام، الذي يسمى الرسومات العصبية الهجينة التوليدية (HGNG)، يقوم بحقن الإخراج المحدود من محاكي القيادة التقليدية القائم على CGI إلى خط أنابيب GAN، حيث يأخذ إطار العمل SPADE من نفيديا على عاتقه مهمة توليد البيئة.

الميزة، وفقا للمؤلفين، هي أن بيئات القيادة ستصبح محتملة أكثر تنوعا، مما يخلق تجربة أكثر غمرة. كما هو الحال الآن، حتى تحويل الإخراج من CGI إلى إخراج تحويل عصبي فوتوغرافي لا يمكن حل مشكلة التكرار، لأن الفيديو الأصلي الذي يدخل خط الأنابيب العصبي مقيد بقيود بيئات النماذج، وتميل إلى تكرار النسيج والمشابك.

المصدر: https://www.youtube.com/watch?v=0fhUJT21-bs

الفيديو المحول من ورقة 2021 ‘تحسين الواقعية الفوتوغرافية’، الذي لا يزال يعتمد على فيديو CGI، بما في ذلك الخلفية وال细يات البيئية، مما يحد من تنوع البيئة في التجربة المحاكاة.المصدر: https://www.youtube.com/watch?v=P1IcaBn3ej0

تذكر الورقة*:

‘دقة محاكي القيادة التقليدية تعتمد على جودة خط أنابيب الرسومات الحاسوبية، الذي يتكون من نماذج ثلاثية الأبعاد، وتنسيق، ومحرك تحويل. النماذج ثلاثية الأبعاد وتنسيق ذات جودة عالية تتطلب مهارة، في حين يجب على محرك التحويل تشغيل حسابات فيزيائية معقدة لتمثيل واقعي للضوء والظلال.’

الورقة الجديدة* هي بعنوان الواقعية الفوتوغرافية في محاكاة القيادة: مزج التوليد العصبي للصورة مع التحويل، وهي تأتي من باحثين في قسم الهندسة الكهربائية والحاسوب في جامعة ولاية أوهايو، وشركة تشونغتشينغ تشانجان للسيارات المحدودة في تشونغتشينغ، الصين.

المادة الخلفية

تتحول الرسومات العصبية الهجينة التوليدية تخطيط Семантиك للمشهد المدخل من CGI إلى بيئة توليدية. قام الباحثون بتجربة مجموعات بيانات مختلفة لتدريب النماذج، وأكثرها فعالية كان مجموعة KITTI الرؤية، التي تحتوي في الغالب على لقطات من منظور السائق من مدينة كارلسروه الألمانية.

<img class="wp-image-182694" src="https://www.unite.ai/wp-content/uploads/2022/07/semantic-layout2.jpg" alt="توليد الرسومات العصبية الهجينة التوليدية تخطيط Семантиك من الإخراج CGI، ثم تضع SPADE مع ترميزات أسلوب مختلفة لإنشاء خلفيات و细يات بيئية فوتوغرافية غير مكررة ومثيرة للاهتمام، بما في ذلك الأجسام القريبة في المشاهد الحضرية. تقول الورقة الجديدة أن الأنماط المتكررة، التي هي شائعة في خطوط أنابيب CGI المقيدة بالموارد، 'تكسير الغمرة' للسائقين البشر الذين يستخدمون محاكي، وأن الخلفيات الأكثر تنوعا التي يمكن أن توفرها الشبكات العصبية التوليدية يمكن أن يخفف من هذه المشكلة.

قام الباحثون بتجربة الشبكات العصبية التوليدية الشرطية (cGAN) وCYcleGAN (CyGAN) كشبكات توليدية، ووجدوا في النهاية أن كل واحدة لها نقاط قوة وضعف: cGAN تتطلب مجموعات بيانات مزدوجة، وCYGAN لا. ومع ذلك، لا يمكن لCYGAN أن يتفوق على الدولة الفنية في المحاكيات التقليدية، في انتظار تحسينات إضافية في التكيف النطاقي والاتساق الدوري. لذلك، cGAN، مع متطلباتها الإضافية لمجموعات البيانات المزدوجة، تحصل على أفضل النتائج في الوقت الحالي.

الهيكل المفهومی للرسومات العصبية الهجينة التوليدية.

الهيكل المفهومی للرسومات العصبية الهجينة التوليدية.

في خط أنابيب الرسومات العصبية الهجينة التوليدية، يتم تشكيل التمثيلات ثنائية الأبعاد من مشاهد CGI المولدة. الأجسام التي يتم تمريرها إلى خط أنابيب GAN من CGI هي محدودة إلى ‘الأساسية’، بما في ذلك علامات الطريق والمركبات، والتي لا يمكن للشبكات العصبية التوليدية توليدها حاليا بثبات زمني وكفاءة كافية لمحاكي القيادة. ثم يتم مزج الصورة المولدة بواسطة cGAN مع الإخراج الجزئي للمحاكاة الفيزيائية.

الاختبارات

为了 اختبار النظام، استخدم الباحثون SPADE، الذي تم تدريبه على Cityscapes، لتحويل تخطيط Семантиك للمشهد إلى إخراج فوتوغرافي. جاء الإخراج CGI من محاكي القيادة المفتوح المصدر CARLA، الذي يستخدم محرك Unreal Engine 4 (UE4).

الإخراج من محاكي القيادة المفتوح المصدر CARLA. المصدر: https://arxiv.org/pdf/1711.03938.pdf

الإخراج من محاكي القيادة المفتوح المصدر CARLA. المصدر: https://arxiv.org/pdf/1711.03938.pdf

تم استخدام محرك الظلال والإضاءة من UE4 لتوفير تخطيط Семантиك والصور المولدة جزئيا، مع مركبات و علامات الطريق فقط. تم تحقيق المزج باستخدام مثيل GP-GAN تم تدريبه على قاعدة بيانات Transient Attributes، وتم تشغيل جميع التجارب على NVIDIA RTX 2080 مع 8 غيغابايت من VRAM.

قام الباحثون باختبار ‘الاحتفاظ Семантиك’ – القدرة على الصورة المولدة على対応 إلى تخطيط Семантиك الأصلي المقصود كقالب للمشهد.

في الصور الاختبارية أعلاه، نرى أن الصورة ‘الترندر فقط’ (الأسفل اليسار) لا تحصل على ظلال واقعية. يشير الباحثون إلى أن الظلال للشجرة التي تقع على الرصيف (الدائرة الصفراء) تم تصنيفها بشكل خاطئ بواسطة DeepLabV3 (إطار تخطيط Семантиك المستخدم في هذه التجارب) على أنها ‘محتوى الطريق’.

في العمود الأوسط، نرى أن المركبات المولدة بواسطة cGAN لا تمتلك تعريفا كافيا لاستخدامها في محاكي القيادة (الدائرة الحمراء). في العمود الأيمن، الصورة الممزوجة تتوافق مع التعريف Семантиك الأصلي، مع الاحتفاظ بالعناصر الأساسية المولدة بواسطة CGI.

为了 تقييم الواقعية، استخدم الباحثون مسافة Fréchet Inception (FID) كمقياس أداء، منذ أن يمكنه العمل على بيانات مزدوجة أو غير مزدوجة.

تم استخدام ثلاث مجموعات بيانات كحقيقة اساسية: Cityscapes، KITTI، و ADE20K.

تم مقارنة الصور المولدة مع بعضها البعض باستخدام درجات FID، ومع خط أنابيب الفيزيائية (أي CGI)، في حين تم تقييم الاحتفاظ Семантиك أيضا.

في النتائج أعلاه، التي تتعلق بالاحتفاظ Семантиك، الدرجات الأعلى هي الأفضل، مع نهج الهرمية المبنية على cGAN (واحد من خطوط الأنابيب المتعددة التي تم اختبارها من قبل الباحثين) يحصل على أعلى درجة.

النتائج المذكورة أعلاه تتعلق بدرجات FID، مع HGNG يحصل على أعلى درجة من خلال استخدام مجموعة KITTI.

طريقة ‘الترندر فقط’ (المشار إليها باسم [23]) تتعلق بالإخراج من CARLA، وهو خط أنابيب CGI لا يتوقع أن يكون فوتوغرافيا.

النتائج النوعية على محرك التحويل التقليدية (‘c’ في الصورة أعلاه) تظهر معلومات خلفية غير واقعية، مثل الأشجار والنباتات، في حين تتطلب نماذج مفصلة وتحميل شبكي في الوقت المناسب، بالإضافة إلى إجراءات أخرى مكثفة للمعالجة. في الوسط (‘b’)، نرى أن cGAN لا تحصل على تعريف كاف لعناصر الأساسية، السيارات و علامات الطريق. في الإخراج الممزوج المقترح (‘a’)، التعريف للسيارات و علامات الطريق جيد، في حين أن البيئة المحيطة متنوعة و فوتوغرافية.

تختتم الورقة باقتراح أن ثبات زمني للجزء المولد بواسطة GAN من خط أنابيب التحويل يمكن أن يزيد من خلال استخدام مجموعات بيانات حضرية أكبر، وأن العمل المستقبلي في هذا الاتجاه يمكن أن يقدم بديلا حقيقيا للتحويلات العصبية المكلفة للتدفقات القائمة على CGI، مع تقديم واقعية وتنوع أكبر.

* تحويلي لمراجع المؤلفين إلى روابط.

نشر لأول مرة في 23 يوليو 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai