نماذج ومنصات الذكاء الاصطناعي

تقنية جديدة تساعد الذكاء الاصطناعي في تحديد الأجسام ثلاثية الأبعاد

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تم تطوير تقنية جديدة من قبل باحثين في جامعة ولاية كارولينا الشمالية تحسن من قدرة برامج الذكاء الاصطناعي على تحديد الأجسام ثلاثية الأبعاد. وتسمى هذه التقنية مونوكون، وتساعد أيضا الذكاء الاصطناعي على التعلم كيفية علاقات الأجسام ثلاثية الأبعاد ببعضها البعض في الفضاء باستخدام صور ثنائية الأبعاد.

يمكن لمونوكون أن يكون له تطبيقات واسعة النطاق، بما في ذلك مساعدة المركبات ذاتية القيادة في التنقل حول المركبات الأخرى باستخدام صور ثنائية الأبعاد تتلقاها من الكاميرا المثبتة على متنها. كما يمكن أن يلعب دورا في التصنيع والروبوتات.

تيانفو وو هو المؤلف الرئيسي للورقة البحثية و أستاذ مساعد في الهندسة الكهربائية والحاسوب في جامعة ولاية كارولينا الشمالية.

“نحن نعيش في عالم ثلاثي الأبعاد، ولكن عندما تاخذ صورة، فإنها تسجل هذا العالم في صورة ثنائية الأبعاد”، يقول وو.

“برامج الذكاء الاصطناعي تتلقى المدخلات البصرية من الكاميرات. لذلك إذا كنا نريد أن يتفاعل الذكاء الاصطناعي مع العالم، فإننا نحتاج إلى التأكد من أنه قادر على تفسير ما يمكن أن تخبرنا به الصور ثنائية الأبعاد حول الفضاء ثلاثي الأبعاد. في هذا البحث، نحن مركزون على جزء واحد من هذا التحدي: كيف يمكننا الحصول على الذكاء الاصطناعي لتحديد الأجسام ثلاثية الأبعاد – مثل الأشخاص أو السيارات – في الصور ثنائية الأبعاد، ووضع هذه الأجسام في الفضاء”، يواصل وو.

المركبات ذاتية القيادة

المركبات ذاتية القيادة غالبا ما تعتمد على ليدار للتنقل في الفضاء ثلاثي الأبعاد. ليدار، الذي يستخدم الليزر لقياس المسافة، هو مكلف، مما يعني أن الأنظمة الذكية لا تتضمن الكثير من التكرار. وضع عشرات أجهزة ليدار على سيارة ذاتية القيادة من إنتاج كبير سيكون مكلفا جدا.

“لكن إذا كانت مركبة ذاتية القيادة يمكن أن تستخدم المدخلات البصرية للتنقل في الفضاء، يمكنك بناء التكرار”، يقول وو. “因为 الكاميرات أقل تكلفة من ليدار، سيكون من الممكن تضمين كاميرات إضافية – بناء التكرار في النظام وجعله أكثر أمانا ومتانة.

“هذه هي التطبيق العملي. ومع ذلك، نحن متحمسون أيضا للتقدم الأساسي لهذا العمل: إنه من الممكن الحصول على بيانات ثلاثية الأبعاد من أجسام ثنائية الأبعاد.”

تدريب الذكاء الاصطناعي

مونوكون يمكن أن يحدد الأجسام ثلاثية الأبعاد في الصور ثنائية الأبعاد قبل وضعها في “صندوق حدودي”، الذي يخبر الذكاء الاصطناعي بحواف الصندوق.

“ما يميز عملنا هو كيفية تدريب الذكاء الاصطناعي، الذي يبني على تقنيات التدريب السابقة”، يقول وو. “مثل الجهود السابقة، نضع الأجسام في صناديق حدودية ثلاثية الأبعاد أثناء تدريب الذكاء الاصطناعي. ومع ذلك، بالإضافة إلى طلب الذكاء الاصطناعي لتحديد المسافة بين الكاميرا والجسم وقياس صناديق الحدود، نطلب أيضا من الذكاء الاصطناعي لتحديد مواقع كل من نقاط الصندوق الثمانية ومسافة كل نقطة من مركز الصندوق في بعدين. نسمي هذا “سياق مساعد”، ووجدنا أنه يساعد الذكاء الاصطناعي على تحديد الأجسام ثلاثية الأبعاد بشكل أكثر دقة بناء على الصور ثنائية الأبعاد.

“الطريقة المقترحة мотивiert من قبل مبرهنة مشهورة في نظرية القياس، مبرهنة كرامر-وولد. كما أنها قابلة للتطبيق على مهام أخرى للتنبؤ بالخرج المنظم في رؤية الحاسوب.”

تم اختبار مونوكون باستخدام مجموعة بيانات معيارية شائعة تسمى كيتي.

“في الوقت الذي قدمنا فيه هذه الورقة، أدى مونوكون بشكل أفضل من أي من البرامج الأخرى العديدة للذكاء الاصطناعي التي تهدف إلى استخراج بيانات ثلاثية الأبعاد حول السيارات من الصور ثنائية الأبعاد”، يقول وو.

سوف يبحث الفريق الآن في كيفية توسيع هذه العملية مع مجموعات بيانات أكبر.

“نحن ننتقل إلى الأمام ونعمل مع مجموعات بيانات أكبر لتقييم وتحسين مونوكون للاستخدام في القيادة الذاتية”، يقول وو. “نريد أيضا استكشاف التطبيقات في التصنيع، لمعرفة ما إذا كان يمكننا تحسين أداء المهام مثل استخدام الأذرع الروبوتية.”

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.