Моделі та платформи ШІ

Дослідники розробили комп’ютерну модель JL2P для перекладу сценаріїв фільмів у анімацію

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники у Університеті Карнегі-Меллона розробили комп’ютерну модель, яка здатна перекладати текст, що описує фізичні рухи, у прості комп’ютерні анімації. Ці нові розробки можуть зробити можливим створення фільмів та інших анімацій безпосередньо з комп’ютерної моделі, яка читає сценарії.

Учені робили прогрес у тому, щоб комп’ютери розуміли природну мову та генерували фізичні пози з сценарію. Ця нова комп’ютерна модель може бути ланкою між ними.

Луї-Філіп Моренсі, асоційований професор у Інституті мовних технологій (LTI), та Чайтанья Ахуджа, студент докторантури LTI, використовували нейронну архітектуру, яку називають Спільна мова-поза (JL2P). Модель JL2P здатна спільно вкладати речення та фізичні рухи. Це дозволяє їй вивчати, як мова пов’язана з дією, жестами та рухами.

“Я думаю, що ми находимося на ранній стадії цих досліджень, але з точки зору моделювання, штучного інтелекту та теорії це дуже цікавий момент”, – сказав Моренсі. “Наразі ми говоримо про анімацію віртуальних персонажів. Зрештою, ця ланка між мовою та жестами може бути застосована до роботів; нам, можливо, буде достатньо просто сказати роботові, що ми хочемо, щоб він зробив.

“Ми також можемо згодом піти в інший бік – використовувати цю ланку між мовою та анімацією, щоб комп’ютер міг описати, що відбувається у відео”, – додав він.

Модель Joint Language-to-Pose буде представлена Ахуджою 19 вересня на Міжнародній конференції з 3D-видіння. Ця конференція відбудеться у місті Квебек, Канада.

Модель JL2P була створена за допомогою підходу навчання за допомогою навчальної програми. Перший важливий крок полягав у тому, щоб модель навчилася коротким, легким послідовностям. Це було щось на зразок “Людина йде вперед”. Потім вона перейшла до довших і складніших послідовностей, таких як “Людина крокує вперед, потім повертається і крокує вперед знову” або “Людина стрибає через перешкоду під час бігу”.

Коли модель використовує ці послідовності, вона розглядає дієслова та прислівники. Вони описують дію та швидкість/прискорення дії. Потім вона розглядає іменники та прикметники, які описують місця та напрямки. За словами Ахуджі, кінцевою метою моделі є анімація складних послідовностей з кількома діями, які відбуваються одночасно або послідовно.

Наразі анімації обмежені лише силуетами, але вчені будуть продовжувати розробляти модель. Однією з ускладнень, які виникають, є те, що, за словами Моренсі, багато речей відбуваються одночасно. Деякі з них відбуваються навіть у простих послідовностях.

“Синхронність між частинами тіла дуже важлива”, – сказав Моренсі. “Кожного разу, коли ви рухаєте ногами, ви також рухаєте руками, тулубом та, можливо, головою. Анімація тіла повинна координувати ці різні компоненти, одночасно досягаючи складних дій. Включення мовної розповіді в це складне середовище анімації є як складним, так і цікавим. Це шлях до кращого розуміння мови та жестів”.

Якщо модель Joint Language-to-Pose зможе розвинутися до того рівня, щоб створювати складні анімації та дії на основі мови, можливості будуть величезними. Не тільки її можна буде використовувати в таких сферах, як кіно та анімація, але вона також допоможе привести до розробок у розумінні мови та жестів.

Перейшовши до штучного інтелекту, модель JL2P може бути використана на роботах. Наприклад, роботам, можливо, буде достатньо просто сказати, що ми хочемо, щоб вони зробили, і вони будуть здатні зрозуміти мову та відповісти відповідно.

Ці нові розробки вплинуть на багато різних сфер, і модель буде продовжувати ставати все більш здатною розуміти складну мову.

Alex очолює новинний підрозділ Unite.AI, що працює на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію для підтримки своєчасного та масштабованого висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок ШІ, зберігаючи редакційні стандарти видання.