الروبوتات والذكاء الاصطناعي الفيزيائي

نموذج التعلم الآلي يفهم العلاقات بين الكائنات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قام باحثون في معهد ماساتشوستس للتكنولوجيا (MIT) بتطوير نموذج تعلم آلي جديد ي理解 العلاقات الأساسية بين الكائنات في المشهد. ويمثل النموذج العلاقات الفردية واحدة تلو الأخرى قبل الجمع بين التمثيلات لوصف المشهد بشكل عام.

من خلال هذا النهج الجديد، يمكن للنموذج التوليف الصور بشكل أكثر دقة من وصف النص، ويمكنه القيام بذلك حتى عندما يكون المشهد يحتوي على مشاريع متعددة مرتبة في علاقات مختلفة مع بعضها البعض.

تعد هذه التطورات الجديدة مهمة بالنظر إلى أن العديد من نماذج التعلم العميق لا تستطيع فهم العلاقات المتشابكة بين الكائنات الفردية.

يمكن استخدام نموذج الفريق في الحالات التي يجب أن يقوم الروبوتات الصناعية بأداء مهام مكونة من عدة خطوات، مثل تراكب العناصر أو تجميع الأجهزة. كما يساهم في تمكين الآلات في النهاية من التعلم من بيئاتها وتفاعلها معها، تمامًا مثل البشر.

ييلون دو هو طالب دكتوراه في معمل علوم الحاسوب والذكاء الاصطناعي (CSAIL) وشارك في قيادة البحث مع شوانغ لي، طالب دكتوراه في CSAIL، ونان 刘، طالب دراسات عليا في جامعة إلينوي في أوربانا-شامبين. كما شمل البحث جوشوا ب. تينينباوم، أستاذ التنمية المهنية في العلوم المعرفية والحوسبة في قسم العلوم العصبية وال认知، والكاتب الرئيسي أنطونيو تورالبا، أستاذ كهرباء وهندسة حاسوب في معهد دلتا إلكترونيكس. وكلاهما عضو في CSAIL.

الإطار الجديد

“عندما أنظر إلى طاولة، لا أستطيع أن أقول إن هناك كائنًا في موقع XYZ. أذهاننا لا تعمل بهذه الطريقة. عندما نفهم مشهدًا، نفهمه حقًا بناءً على العلاقات بين الكائنات. نعتقد أنه من خلال بناء نظام يمكنه فهم العلاقات بين الكائنات، يمكننا استخدام هذا النظام لتغيير بيئاتنا بشكل أكثر فعالية،” يقول دو.

يمكن للإطار الجديد توليد صورة لمشهد بناءً على وصف نصي للكائنات وعلاقاتها.

يمكن للنظام بعد ذلك تقسيم هذه الجمل إلى قطع أصغر تصف كل علاقة فردية. يتم نمذجة كل جزء بشكل منفصل، ويتم الجمع بين القطع من خلال عملية تحسين توليد صورة للمشهد.

مع تقسيم الجمل إلى قطع أقصر، يمكن للنظام بعد ذلك إعادة组ها بطرق مختلفة، مما يسمح له بالتكيف مع описات المشهد التي لم يتعرض لها من قبل.

“النظم الأخرى تأخذ جميع العلاقات بشكل شمولي وتوليد الصورة في لفة واحدة من الوصف. ومع ذلك، فإن هذه النهج تفشل عندما يكون لدينا описات خارج التوزيع، مثل الأوصاف التي تحتوي على علاقات أكثر، لأن هذه النماذج لا تستطيع بالفعل التكيف بشكل فعال لتوليد صور تحتوي على علاقات أكثر. ومع ذلك، نظرًا لأننا نكون هذه النماذج الأصغر بشكل منفصل معًا، يمكننا نمذجة عدد أكبر من العلاقات والتعامل مع التوليفات الجديدة،” يقول دو.

يمكن للنظام أيضًا أداء هذه العملية بالعكس. إذا تم إطعامه صورة، يمكنه العثور على описات نصية تطابق علاقات الكائنات في المشهد.

تقييم النموذج

طلب الباحثون من البشر تقييم ما إذا كانت الصور المولدة تطابق وصف المشهد الأصلي. عندما تحتوي الأوصاف على ثلاث علاقات، والتي كانت أكثر أنواع الأوصاف تعقيدًا، قال 91٪ من المشاركين إن النموذج الجديد أداء أفضل من أساليب التعلم العميق الأخرى.

“شيء interessant وجدناه هو أن نموذجنا يمكننا زيادة جملنا من وصف علاقة واحدة إلى وصف علاقتين أو ثلاث أو حتى أربع علاقات، ويمكننا الاستمرار في توليد صور تصف بشكل صحيح تلك الأوصاف، في حين تفشل الأساليب الأخرى،” يقول دو.

أظهر النموذج أيضًا القدرة على العمل مع الأوصاف التي لم يتعرض لها من قبل.

“هذا واعد جدًا لأن ذلك أقرب إلى كيفية عمل البشر. قد نرى البشر فقط عدة أمثلة، ولكننا يمكننا استخراج المعلومات المفيدة من تلك الأمثلة القليلة ودمجها معًا لإنشاء توليفات لا حصر لها. ونموذجنا لديه خاصية تسمح له بالتعلم من بيانات أقل وتوليد مشاهد أو صور أكثر تعقيدًا،” يقول لي.

سيبحث الفريق الآن في اختبار النموذج على صور العالم الحقيقي الأكثر تعقيدًا واستكشاف كيفية دمج النموذج في النهاية في أنظمة الروبوتات.

أليكس يقود عمليات الأخبار المدعومة بالذكاء الاصطناعي في Unite.AI، حيث يجمع بين الصحافة والبحث والأتمتة لدعم تغطية الذكاء الاصطناعي في الوقت المناسب وبشكل قابل للتوسع. يساعد عمله في ضمان ظهور التطورات الناشئة في مجال الذكاء الاصطناعي بكفاءة، مع الحفاظ على معايير التحرير الخاصة بالموقع.