Моделі та платформи ШІ
Дослідники розробили комп’ютерну модель JL2P для перекладу сценаріїв фільмів у анімацію

Дослідники у Університеті Карнегі-Меллона розробили комп’ютерну модель, яка здатна перекладати текст, що описує фізичні рухи, у прості комп’ютерні анімації. Ці нові розробки можуть зробити можливим створення фільмів та інших анімацій безпосередньо з комп’ютерної моделі, яка читає сценарії.
Учені робили прогрес у тому, щоб комп’ютери розуміли природну мову та генерували фізичні пози з сценарію. Ця нова комп’ютерна модель може бути ланкою між ними.
Луї-Філіп Моренсі, асоційований професор у Інституті мовних технологій (LTI), та Чайтанья Ахуджа, студент докторантури LTI, використовували нейронну архітектуру, яку називають Спільна мова-поза (JL2P). Модель JL2P здатна спільно вкладати речення та фізичні рухи. Це дозволяє їй вивчати, як мова пов’язана з дією, жестами та рухами.
“Я думаю, що ми находимося на ранній стадії цих досліджень, але з точки зору моделювання, штучного інтелекту та теорії це дуже цікавий момент”, – сказав Моренсі. “Наразі ми говоримо про анімацію віртуальних персонажів. Зрештою, ця ланка між мовою та жестами може бути застосована до роботів; нам, можливо, буде достатньо просто сказати роботові, що ми хочемо, щоб він зробив.
“Ми також можемо згодом піти в інший бік – використовувати цю ланку між мовою та анімацією, щоб комп’ютер міг описати, що відбувається у відео”, – додав він.
Модель Joint Language-to-Pose буде представлена Ахуджою 19 вересня на Міжнародній конференції з 3D-видіння. Ця конференція відбудеться у місті Квебек, Канада.
Модель JL2P була створена за допомогою підходу навчання за допомогою навчальної програми. Перший важливий крок полягав у тому, щоб модель навчилася коротким, легким послідовностям. Це було щось на зразок “Людина йде вперед”. Потім вона перейшла до довших і складніших послідовностей, таких як “Людина крокує вперед, потім повертається і крокує вперед знову” або “Людина стрибає через перешкоду під час бігу”.
Коли модель використовує ці послідовності, вона розглядає дієслова та прислівники. Вони описують дію та швидкість/прискорення дії. Потім вона розглядає іменники та прикметники, які описують місця та напрямки. За словами Ахуджі, кінцевою метою моделі є анімація складних послідовностей з кількома діями, які відбуваються одночасно або послідовно.
Наразі анімації обмежені лише силуетами, але вчені будуть продовжувати розробляти модель. Однією з ускладнень, які виникають, є те, що, за словами Моренсі, багато речей відбуваються одночасно. Деякі з них відбуваються навіть у простих послідовностях.
“Синхронність між частинами тіла дуже важлива”, – сказав Моренсі. “Кожного разу, коли ви рухаєте ногами, ви також рухаєте руками, тулубом та, можливо, головою. Анімація тіла повинна координувати ці різні компоненти, одночасно досягаючи складних дій. Включення мовної розповіді в це складне середовище анімації є як складним, так і цікавим. Це шлях до кращого розуміння мови та жестів”.
Якщо модель Joint Language-to-Pose зможе розвинутися до того рівня, щоб створювати складні анімації та дії на основі мови, можливості будуть величезними. Не тільки її можна буде використовувати в таких сферах, як кіно та анімація, але вона також допоможе привести до розробок у розумінні мови та жестів.
Перейшовши до штучного інтелекту, модель JL2P може бути використана на роботах. Наприклад, роботам, можливо, буде достатньо просто сказати, що ми хочемо, щоб вони зробили, і вони будуть здатні зрозуміти мову та відповісти відповідно.
Ці нові розробки вплинуть на багато різних сфер, і модель буде продовжувати ставати все більш здатною розуміти складну мову.












