Modelos e plataformas de IA

Pesquisadores Desenvolvem Modelo de Computador JL2P para Traduzir Roteiros de Filmes em Animações

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores da Universidade Carnegie Mellon desenvolveram um modelo de computador capaz de traduzir textos que descrevem movimentos físicos em animações computacionais simples. Esses novos desenvolvimentos podem tornar possível a criação de filmes e outras animações diretamente a partir de um modelo de computador que lê os roteiros.

Cientistas vêm fazendo progressos para que os computadores entendam tanto a linguagem natural quanto gerem poses físicas a partir de roteiros. Esse novo modelo de computador pode ser o elo entre eles.

Louis-Philippe Morency, professor associado no Instituto de Tecnologias de Linguagem (LTI), e Chaitanya Ahuja, estudante de doutorado do LTI, vêm usando uma arquitetura neural chamada Linguagem-Junta-para-Posição (JL2P). O modelo JL2P é capaz de incorporar conjuntamente frases e movimentos físicos. Isso permite que ele aprenda como a linguagem está conectada à ação, gestos e movimentos.

“Acho que estamos em uma fase inicial dessa pesquisa, mas do ponto de vista da modelagem, inteligência artificial e teoria, é um momento muito emocionante”, disse Morency. “Agora, estamos falando sobre animar personagens virtuais. Eventualmente, essa ligação entre linguagem e gestos pode ser aplicada a robôs; podemos simplesmente dizer a um robô assistente o que queremos que ele faça.

“Também podemos eventualmente ir no sentido oposto – usando essa ligação entre linguagem e animação para que um computador possa descrever o que está acontecendo em um vídeo”, acrescentou.

O modelo Joint Language-to-Pose será apresentado por Ahuja em 19 de setembro na Conferência Internacional sobre Visão 3D. Essa conferência será realizada na cidade de Quebec, Canadá.

O modelo JL2P foi criado por meio de uma abordagem de aprendizado curricular. O primeiro passo importante foi para o modelo aprender sequências curtas e fáceis. Isso seria algo como “Uma pessoa caminha para frente”. Em seguida, ele passou para sequências mais longas e difíceis, como “Uma pessoa dá um passo para frente, então gira e dá outro passo para frente”, ou “Uma pessoa pula sobre um obstáculo enquanto corre”.

Quando o modelo usa as sequências, ele olha para verbos e advérbios. Esses descrevem a ação e a velocidade/aceleração da ação. Em seguida, ele olha para substantivos e adjetivos, que descrevem locais e direções. De acordo com Ahuja, o objetivo final para o modelo é animar sequências complexas com múltiplas ações que ocorrem simultaneamente ou em sequência.

Até agora, as animações estão limitadas a figuras de palito, mas os cientistas continuarão desenvolvendo o modelo. Uma das complicações que surgem é que, de acordo com Morency, muitas coisas estão acontecendo ao mesmo tempo. Algumas delas estão acontecendo em sequências simples.

“A sincronia entre as partes do corpo é muito importante”, disse Morency. “Toda vez que você move as pernas, você também move os braços, o torso e possivelmente a cabeça. As animações do corpo precisam coordenar esses diferentes componentes, ao mesmo tempo em que realizam ações complexas. Trazer a narrativa da linguagem dentro desse ambiente de animação complexa é um desafio e também é emocionante. Isso é um caminho para uma melhor compreensão da fala e dos gestos.”

Se o modelo Joint Language-to-Pose for capaz de se desenvolver ao ponto de criar animações e ações complexas com base na linguagem, as possibilidades são enormes. Não apenas pode ser usado em áreas como cinema e animação, mas também ajudará a levar a desenvolvimentos na compreensão da fala e dos gestos.

Voltando para a inteligência artificial, o modelo JL2P pode ser usado em robôs. Por exemplo, robôs podem ser controlados e instruídos sobre o que fazer, e eles serão capazes de entender a linguagem e responder de acordo.

Esses novos desenvolvimentos terão impacto em muitos campos diferentes, e o modelo continuará a melhorar sua capacidade de entender a linguagem complexa.

Alex McFarland é um jornalista e escritor de IA que explora os últimos desenvolvimentos em inteligência artificial. Ele colaborou com inúmeras startups de IA e publicações em todo o mundo.