نماذج ومنصات الذكاء الاصطناعي
باحثون يطورون نموذج JL2P الحاسوبي لترجمة نصوص السيناريو إلى رسومات متحركة

قام باحثون في جامعة كارنيجي ميلون بتطوير نموذج حاسوبي يمكنه ترجمة النصوص التي تصف الحركات الجسدية إلى رسومات متحركة بسيطة تم إنشاؤها بواسطة الكمبيوتر. ويمكن أن تجعل هذه التطورات الجديدة من الممكن إنشاء الأفلام والرسومات المتحركة الأخرى مباشرة من نموذج كمبيوتر يقرأ النصوص.
لقد كان العلماء يحرزون تقدمًا في جعل الكمبيوتر يفهم كل من اللغة الطبيعية وينتج مواقف جسدية من النص. ويمكن أن يكون هذا النموذج الحاسوبي هو الارتباط بينهما.
لويس فيليب مورينسي، أستاذ مساعد في معهد اللغة والتكنولوجيا (LTI)، وشيتبانيا أهوجا، طالب دكتوراه في LTI، قد استخدما هندسة عصبية تسمى اللغة المشتركة إلى الوضع (JL2P). ويمكن للنموذج JL2P دمج الجمل والحركات الجسدية بشكل مشترك. وهذا يسمح له بالتعلم عن كيفية ربط اللغة بالفعل والايماءات والحركات.
“أعتقد أننا في مرحلة مبكرة من هذا البحث، ولكن من منظور النمذجة والذكاء الاصطناعي والنظرية، فهذا момент مثير جدًا”، قال مورينسي. “في الوقت الحالي، نتحدث عن تحريك الشخصيات الافتراضية. وفي النهاية، يمكن تطبيق هذا الارتباط بين اللغة والايماءات على الروبوتات؛ قد نكون قادرين على कहनة روبوت مساعد شخصي ما نريد أن يفعله.
“كما يمكننا في النهاية أن نذهب في الاتجاه الآخر – باستخدام هذا الارتباط بين اللغة والرسومات المتحركة حتى يتمكن الكمبيوتر من وصف ما يحدث في الفيديو”، أضاف.
سيتم تقديم نموذج اللغة المشتركة إلى الوضع بواسطة Ahuja في 19 سبتمبر في مؤتمر الرؤية ثلاثية الأبعاد الدولي. وسيعقد المؤتمر في مدينة كيبيك، كندا.
تم إنشاء نموذج اللغة المشتركة إلى الوضع بواسطة نهج تعلم المناهج. كانت الخطوة الأولى المهمة هي تعلم النموذج لتسلسلات قصيرة وسهلة. وهذا شيء مثل “شخص يمشي إلى الأمام”. ثم انتقل إلى تسلسلات أطول وأصعب مثل “شخص يخطو إلى الأمام، ثم يلتفت ويتحرك إلى الأمام مرة أخرى”، أو “شخص يقفز فوق عقبة أثناء الجري”.
عندما يستخدم النموذج التسلسلات، فإنه ينظر إلى الأفعال والظروف. وتلك تصف الفعل والسرعة / التسارع للفعل. ثم ينظر إلى الأسماء والصفات التي تصف المواقع والاتجاهات. ووفقًا لأهوجا، فإن الهدف النهائي للنموذج هو تحريك تسلسلات معقدة مع أفعال متعددة تحدث في نفس الوقت أو بالتسلسل.
في الوقت الحالي، الرسومات المتحركة محدودة بالرسومات البسيطة، ولكن العلماء سيواصلون تطوير النموذج. واحدة من التعقيدات التي تظهر هي أن هناك العديد من الأشياء تحدث في نفس الوقت. وبعضها حتى يحدث في تسلسلات بسيطة.
“التزامن بين أجزاء الجسم مهم جدًا”، قال مورينسي. “كل مرة تتحرك ساقيك، تتحرك أيضًا ذراعيك وجذعك ورأسك. تحتاج الرسومات المتحركة للجسم إلى تنسيق هذه المكونات المختلفة، وفي الوقت نفسه تحقيق أفعال معقدة. جلب السرد اللغوي داخل بيئة الرسومات المتحركة المعقدة هو تحدي ومثير. هذا هو طريقًا لفهم أفضل للكلام والايماءات.”
إذا كان نموذج اللغة المشتركة إلى الوضع قادرًا على التطور إلى الحد الذي يمكنه فيه إنشاء رسومات متحركة معقدة وأفعال dựa على اللغة، فإن الإمكانيات巨ة. لا يمكن استخدامه فقط في مجالات مثل السينما والرسومات المتحركة، ولكن سيساهم أيضًا في التطورات في فهم الكلام والايماءات.
بالنسبة إلى الذكاء الاصطناعي، يمكن استخدام نموذج JL2P على الروبوتات. على سبيل المثال، قد تكون الروبوتات قادرة على التحكم بها و कहनة ما نريد أن تفعله، وستكون قادرة على فهم اللغة والاستجابة وفقًا لذلك.
ستؤثر هذه التطورات الجديدة على العديد من المجالات المختلفة، وسيستمر النموذج في الحصول على القدرة على فهم اللغة المعقدة.












