زاوية Anderson

تحويل ليدار إلى صور فوتوغرافية حقيقية باستخدام شبكة معادية توليدية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في وقت سابق من الأسبوع ، تم إصدار مقطع فيديو يظهر نظام التوجيه الآلي لشركة تيسلا يصطدم مباشرة بجانب مركبة متوقفة على طريق سريع في يونيو 2021. حقيقة أن السيارة كانت مظلمة وصعبة التمييز أدت إلى مناقشة حول حدود الاعتماد على رؤية الكمبيوتر في سيناريوهات القيادة الآلية.

على الرغم من أن ضغط الفيديو في الفيديو المشارك على نطاق واسع يعطي انطباعا مبالغا فيه عن مدى سرعة ظهور الشاحنة المعطلة على السائق في هذه الحالة ، فإن فيديو عالي الجودة للحدث نفسه يظهر أن سائقا متيقظا تماما سوف يجد صعوبة في الاستجابة بأي شيء إلا انحناء متأخر أو فرملة نصف فعالة.

أضاف الفيديو إلى الجدل حول قرار تيسلا إزالة حساسات الرادار للاutopilot ، الذي تم الإعلان عنه في مايو 2021 ، وموقفه من التفضيل الأنظمة القائمة على الرؤية على تقنيات التخاطر الصوتي الأخرى ، مثل ليدار.

بالتزامن ، قدمت ورقة بحثية جديدة من إسرائيل هذا الأسبوع نهجا لجسر مجالات ليدار والرؤية الكمبيوترية ، من خلال تحويل سحب نقطة ليدار إلى صور فوتوغرافية حقيقية باستخدام شبكة معادية توليدية (GAN).

يصرح المؤلفون:

‘تعلمت نماذجنا كيفية التنبؤ بالصور الواقعية من بيانات سحابة النقاط فقط ، حتى الصور التي تحتوي على سيارات سوداء.

‘السيارات السوداء صعبة الكشف عنها مباشرة من سحابة النقاط بسبب مستوى انعكاسها المنخفض. قد يتم استخدام هذا النهج في المستقبل لأداء التعرف على الكائنات البصرية على الصور الفوتوغرافية الحقيقية التي تم إنشاؤها من سحابة النقاط ليدار.’

صور فوتوغرافية حقيقية ، سحب ليدار

الورقة الجديدة بعنوان إنشاء صور فوتوغرافية حقيقية من سحابة النقاط ليدار باستخدام شبكات معادية توليدية ، وهي تأتي من سبعة باحثين في ثلاث كليات أكاديمية إسرائيلية ، جنبا إلى جنب مع ستة باحثين من شركة إينوفيز تكنولوجيز الإسرائيلية.

سعى الباحثون إلى اكتشاف ما إذا كان يمكن إنتاج صور اصطناعية من سحابة النقاط التي تم إنشاؤها بواسطة أنظمة ليدار بسرعة مناسبة ، بحيث يمكن استخدام تيار الصور الناتج في تدفقات الكائنات والتقسيم الدلالي.

بيانات

الفكرة المركزية ، كما هو الحال في العديد من مشاريع الترجمة الصورية الجديدة ، هي تدريب خوارزمية على بيانات متوافقة ، حيث يتم تدريب صور سحابة النقاط ليدار (التي تعتمد على ضوء المنبع) ضد إطار متطابق من كاميرا أمامية.

由于 تم أخذ الفيديو في النهار ، حيث يمكن للرؤية الكمبيوترية تمييز سيارة سوداء خفيضة بسهولة أكبر (مثل السيارة التي اصطدمت بها تيسلا في يونيو) ، nên هذا التدريب يجب أن يوفر حقيقة أساسية أكثر مقاومة للظروف المظلمة.

تم جمع البيانات باستخدام حساس ليدار إينوفيز وان ، الذي يوفر معدل التقاط 10 إطارات في الثانية أو 15 إطارًا في الثانية ، حسب الطراز.

أجرى الباحثون两个 تجربة: واحدة حيث تحتوي بيانات سحابة النقاط على معلومات الانعكاس فقط ؛ وثانية ، حيث تحتوي بيانات سحابة النقاط على قناتين ، واحدة للانعكاس والdistance.

对于 التجربة الأولى ، تم تدريب GAN لمدة 50 دورة ، بعد ذلك تم ملاحظة مشكلة التكيف الزائد.

对于 التجربة الثانية ، تم تدريب GAN لمدة 40 دورة مع حجم.batch 1 ، مما أدى إلى عرض مماثل لسيارات سوداء “ممثلة” تم الحصول عليها بشكل رئيسي من السياق.

التقييم

لم يكن من الممكن إجراء عملية التقييم والتحقق من صحة هذا المشروع بسبب طابعه الفريد. بدلاً من ذلك ، قام الباحثون بتصميم مقياس مخصص يتعلق بمدى تمثيل السيارات (الأجزاء الصغيرة والزمنية من الفيديو المصدر) في الفيديو الناتج.

اختاروا 100 زوج من الصور ليدار / الصور المولدة من كل مجموعة وقسموا عدد الصور التي تحتوي على سيارات في الفيديو المصدر على عدد الصور التي تحتوي على سيارات في البيانات الاصطناعية التي تم إنشاؤها ، مما أدى إلى مقياس يتراوح بين 0 و 1.

يصرح المؤلفون:

‘النقاط في كلا التجربتين كانت بين 0.7 و 0.8. إذا أخذنا في الاعتبار حقيقة أن جودة الصور المتوقعة أقل من جودة الصور الحقيقية (من الصعب بشكل عام الكشف عن الكائنات في الصور ذات الجودة الأقل) ، فإن هذا المقياس يشير إلى أن الغالبية العظمى من السيارات الموجودة في الصور الحقيقية تظهر في الصور المولدة.’

اختتم الباحثون أن الكشف عن المركبات السوداء ، وهو مشكلة للنظم القائمة على الرؤية الكمبيوترية ولليدار ، يمكن أن يؤثر على تحديد نقص في البيانات لجزء من الصورة:

‘حقيقة أن الصور المتوقعة لا تحتوي على معلومات لون واشكال دقيقة مثل الصور الحقيقية ، تشير إلى أن التنبؤ بالسيارات السوداء يعتمد بشكل رئيسي على المعلومات السياقية وليس على انعكاس ليدار النقاط نفسها. ‘

‘نقترح أن نظاما ثانيا يولد صورا فوتوغرافية حقيقية من سحابة النقاط ليدار سوف يعمل بشكل متزامن مع نظام الكشف البصري في الوقت الفعلي.’

التأخير والتحميل الزاحف لمعالجة SDV

من بين التعليقات على المنشور المشارك على تويتر عن حادث Autopilot ، قدر أحد المعلقين أن سيارة تسافر بسرعة 75 ميلًا في الساعة (110 قدمًا في الثانية) مع فيديو يعمل بسرعة 20 إطارًا في الثانية سوف يغطي فقط 5.5 قدمًا لكل إطار. ومع ذلك ، إذا كانت السيارة تعمل بآخر الأجهزة والبرامج من تيسلا ، فإن معدل الإطار سيكون 36 إطارًا في الثانية (للكاميرا الرئيسية) ، مما يضع معدل التقييم عند 110 قدمًا في الثانية (3 أقدام لكل إطار).

بصرف النظر عن التكلفة والergonomics ، مشكلة استخدام ليدار كدفق بيانات إضافي هي حجم حركة المرور المعلوماتية الكبيرة لمدخلات إطار معالجة SDV. جنبا إلى جنب مع الطبيعة الحرجة للمهمة ، يبدو أن هذا قد أدى إلى إزالة الرادار والليدار من chồng Autopilot لصالح أساليب التقييم القائمة على الصور.

لذلك يبدو من غير المحتمل أن نظامًا يستخدم ليدار – الذي سيزيد من حجز المعالجة على Autopilot – لاستنتاج الصور الفوتوغرافية الحقيقية هو قابلة للتطبيق من وجهة نظر تيسلا.

مؤسس تيسلا إيلون ماسك ليس ناقدا مطلقا لليدار ، الذي يشير إلى أنه يستخدمه سبيس إكس لأغراض الرسو ، لكنه يعتبر أن التكنولوجيا “عديمة الفائدة” للسيارات ذاتية القيادة. يعتقد ماسك أن طول موجة اختراق العوائق ، مثل الرادار الدقيق ~4mm ، سيكون أكثر فائدة.

ومع ذلك ، اعتبارًا من يونيو 2021 ، لم تكن سيارات تيسلا مجهزة بالرادار أيضًا. لا يبدو أن هناك العديد من المشاريع المصممة لإنشاء تيارات الصور من الرادار بنفس الطريقة التي يحاولها المشروع الإسرائيلي الحالي (على الرغم من أن وزارة الطاقة الأمريكية أقامت محاولة واحدة لصورة GAN المشتقة من الرادار في 2018).

نشر لأول مرة في 23 ديسمبر 2021.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai