Модели и платформы ИИ
Исследователи разработали компьютерную модель JL2P для перевода сценариев фильмов в анимации

Исследователи в Университете Карнеги-Меллона разработали компьютерную модель, способную переводить текст, описывающий физические движения, в простые компьютерные анимации. Эти новые разработки могут сделать возможным создание фильмов и других анимаций непосредственно из компьютерной модели, читающей сценарии.
Ученые добились прогресса в понимании компьютерами как естественного языка, так и генерации физических поз из сценария. Эта новая компьютерная модель может стать связующим звеном между ними.
Луи-Филипп Моренси, доцент в Институте языковых технологий (LTI), и Чайтанья Ахуджа, аспирант LTI, используют нейронную архитектуру, называемую Joint Language-to-Pose (JL2P). Модель JL2P способна совместно встраивать предложения и физические движения. Это позволяет ей учиться, как язык связан с действием, жестами и движениями.
“Я думаю, мы находимся на ранней стадии этого исследования, но с точки зрения моделирования, искусственного интеллекта и теории это очень интересный момент”, – сказал Моренси. “Пока мы говорим об анимации виртуальных персонажей. В конечном итоге эта связь между языком и жестами может быть применена к роботам; мы, возможно, сможем просто сказать роботу-ассистенту, что мы хотим, чтобы он сделал.
“Мы также можем в конечном итоге пойти в обратном направлении – использовать эту связь между языком и анимацией, чтобы компьютер мог описать, что происходит в видео”, – добавил он.
Модель Joint Language-to-Pose будет представлена Ахуджей 19 сентября на Международной конференции по 3D-видению. Эта конференция пройдет в городе Квебек, Канада.
Модель JL2P была создана с помощью подхода обучения по учебной программе. Первым важным шагом было обучение модели коротким, простым последовательностям. Это было бы что-то вроде “Человек идет вперед”. Затем она перешла к более длинным и сложным последовательностям, таким как “Человек шагает вперед, затем поворачивается и шагает вперед снова” или “Человек прыгает через препятствие, бегая”.
Когда модель использует последовательности, она смотрит на глаголы и наречия. Они описывают действие и скорость/ускорение действия. Затем она смотрит на существительные и прилагательные, которые описывают местоположения и направления. Согласно Ахудже, конечной целью модели является анимация сложных последовательностей с несколькими действиями, происходящими одновременно или последовательно.
Пока анимации ограничены простыми фигурами, но ученые будут продолжать развивать модель. Одна из осложнений, возникающих при этом, заключается в том, что, по словам Моренси, многое происходит одновременно. Некоторые из них даже происходят в простых последовательностях.
“Синхронизация между частями тела очень важна”, – сказал Моренси. “Каждый раз, когда вы двигаете ногами, вы также двигаете руками, туловищем и, возможно, головой. Анимации тела должны координировать эти различные компоненты, а также достигать сложных действий. Введение языковой нарративной структуры в эту сложную среду анимации является одновременно сложным и интересным. Это путь к лучшему пониманию речи и жестов”.
Если модель Joint Language-to-Pose сможет развиться до такой степени, что сможет создавать сложные анимации и действия на основе языка, возможности будут огромными. Не только она может быть использована в таких областях, как кино и анимация, но также поможет привести к разработкам в понимании речи и жестов.
Переходя к искусственному интеллекту, модель JL2P может быть использована на роботах. Например, роботы могут быть контролируемы и им могут быть даны указания, и они будут способны понимать язык и реагировать соответствующим образом.
Эти новые разработки повлияют на многие различные области, и модель будет продолжать улучшаться в понимании сложного языка.












