Modèles et plateformes d’IA
Les chercheurs développent le modèle d’ordinateur JL2P pour traduire les scripts de film en animations

Les chercheurs de l’Université Carnegie Mellon ont développé un modèle d’ordinateur capable de traduire le texte qui décrit les mouvements physiques en animations informatiques simples. Ces nouveaux développements pourraient rendre possible la création de films et d’autres animations directement à partir d’un modèle d’ordinateur lisant les scripts.
Les scientifiques ont fait des progrès dans la compréhension par les ordinateurs du langage naturel et la génération de poses physiques à partir de scripts. Ce nouveau modèle d’ordinateur peut être le lien entre eux.
Louis-Philippe Morency, professeur associé à l’Institut des technologies linguistiques (LTI), et Chaitanya Ahuja, étudiant en doctorat à l’LTI, ont utilisé une architecture neuronale appelée Joint Language-to-Pose (JL2P). Le modèle JL2P est capable d’intégrer conjointement des phrases et des mouvements physiques. Cela lui permet d’apprendre comment le langage est lié à l’action, aux gestes et aux mouvements.
“Je pense que nous sommes à un stade précoce de cette recherche, mais du point de vue de la modélisation, de l’intelligence artificielle et de la théorie, c’est un moment très excitant”, a déclaré Morency. “Actuellement, nous parlons d’animer des personnages virtuels. Éventuellement, ce lien entre le langage et les gestes pourrait être appliqué aux robots ; nous pourrions simplement dire à un robot personnel ce que nous voulons qu’il fasse.
“Nous pourrions également aller dans l’autre sens – en utilisant ce lien entre le langage et l’animation pour que l’ordinateur puisse décrire ce qui se passe dans une vidéo”, a-t-il ajouté.
Le modèle Joint Language-to-Pose sera présenté par Ahuja le 19 septembre à la Conférence internationale sur la vision 3D. Cette conférence aura lieu à Québec, au Canada.
Le modèle JL2P a été créé par une approche d’apprentissage par curriculum. La première étape importante était que le modèle apprenne des séquences courtes et faciles. Cela pourrait être quelque chose comme “Une personne marche vers l’avant.” Il a ensuite progressé à des séquences plus longues et plus difficiles, telles que “Une personne fait un pas en avant, puis se retourne et fait un pas en avant à nouveau”, ou “Une personne saute par-dessus un obstacle en courant.”
Lorsque le modèle utilise les séquences, il examine les verbes et les adverbes. Ceux-ci décrivent l’action et la vitesse/accélération de l’action. Ensuite, il examine les noms et les adjectifs qui décrivent les emplacements et les directions. Selon Ahuja, l’objectif final du modèle est d’animer des séquences complexes avec plusieurs actions se produisant simultanément ou en séquence.
Actuellement, les animations sont limitées à des silhouettes, mais les scientifiques vont continuer à développer le modèle. L’une des complications qui surgit est que, selon Morency, de nombreuses choses se produisent en même temps. Certaines d’entre elles se produisent même dans des séquences simples.
“La synchronisation entre les parties du corps est très importante”, a déclaré Morency. “Chaque fois que vous bougez vos jambes, vous bougez également vos bras, votre torse et possiblement votre tête. Les animations du corps doivent coordonner ces différents composants, tout en réalisant des actions complexes. Intégrer le récit linguistique dans cet environnement d’animation complexe est à la fois difficile et excitant. C’est un chemin vers une meilleure compréhension de la parole et des gestes.”
Si le modèle Joint Language-to-Pose est capable de se développer au point de créer des animations et des actions complexes basées sur le langage, les possibilités sont immenses. Non seulement cela peut être utilisé dans des domaines tels que le cinéma et l’animation, mais cela aidera également à conduire à des développements dans la compréhension de la parole et des gestes.
En ce qui concerne l’intelligence artificielle, le modèle JL2P pourrait être utilisé sur les robots. Par exemple, les robots pourraient être contrôlés et on pourrait leur dire ce qu’on veut qu’ils fassent, et ils seraient capables de comprendre le langage et de répondre en conséquence.
Ces nouveaux développements auront un impact sur de nombreux domaines différents, et le modèle continuera à devenir plus capable de comprendre le langage complexe.












