Modelos y plataformas de IA

Investigadores Desarrollan el Modelo de Computadora JL2P para Traducir Guiones de Películas a Animaciones

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los investigadores de la Universidad Carnegie Mellon han desarrollado un modelo de computadora que es capaz de traducir textos que describen movimientos físicos en animaciones generadas por computadora simples. Estos nuevos desarrollos podrían hacer posible que las películas y otras animaciones se creen directamente a partir de un modelo de computadora que lee los guiones.

Los científicos han estado haciendo progresos en la comprensión de lenguaje natural y la generación de poses físicas a partir de guiones. Este nuevo modelo de computadora puede ser el enlace entre ellos.

Louis-Philippe Morency, profesor asociado en el Instituto de Tecnologías del Lenguaje (LTI), y Chaitanya Ahuja, estudiante de doctorado en LTI, han estado utilizando una arquitectura neuronal llamada Joint Language-to-Pose (JL2P). El modelo JL2P es capaz de incrustar conjuntamente oraciones y movimientos físicos. Esto le permite aprender cómo el lenguaje se conecta con la acción, los gestos y los movimientos.

“Creo que estamos en una etapa temprana de esta investigación, pero desde una perspectiva de modelado, inteligencia artificial y teoría, es un momento muy emocionante”, dijo Morency. “En este momento, estamos hablando de animar personajes virtuales. Eventualmente, este enlace entre lenguaje y gestos podría aplicarse a robots; podríamos simplemente decirle a un robot asistente personal qué queremos que haga.

“También podríamos eventualmente ir en la otra dirección, utilizando este enlace entre lenguaje y animación para que una computadora pueda describir lo que está sucediendo en un video”, agregó.

El modelo Joint Language-to-Pose se presentará el 19 de septiembre en la Conferencia Internacional sobre Visión 3D. La conferencia tendrá lugar en la ciudad de Quebec, Canadá.

El modelo JL2P se creó mediante un enfoque de aprendizaje de currículum. El primer paso importante fue que el modelo aprendiera secuencias cortas y fáciles. Eso sería algo como “Una persona camina hacia adelante”. Luego, pasó a secuencias más largas y difíciles, como “Una persona da un paso adelante, luego se da la vuelta y da otro paso adelante”, o “Una persona salta sobre un obstáculo mientras corre”.

Cuando el modelo utiliza las secuencias, examina los verbos y adverbios. Estos describen la acción y la velocidad / aceleración de la acción. Luego, examina los sustantivos y adjetivos que describen ubicaciones y direcciones. Según Ahuja, el objetivo final del modelo es animar secuencias complejas con múltiples acciones que ocurren simultáneamente o en secuencia.

En este momento, las animaciones están limitadas a figuras de palo, pero los científicos seguirán desarrollando el modelo. Una de las complicaciones que surgen es que, según Morency, muchas cosas están sucediendo al mismo tiempo. Algunas de ellas incluso están sucediendo en secuencias simples.

“La sincronización entre las partes del cuerpo es muy importante”, dijo Morency. “Cada vez que mueves las piernas, también mueves los brazos, el torso y posiblemente la cabeza. Las animaciones del cuerpo necesitan coordinar estos diferentes componentes, al mismo tiempo que logran acciones complejas. Incorporar la narrativa del lenguaje dentro de este entorno de animación compleja es un desafío y emocionante. Esto es un camino hacia una mejor comprensión del habla y los gestos”.

Si el modelo Joint Language-to-Pose puede desarrollarse hasta el punto en que pueda crear animaciones y acciones complejas basadas en lenguaje, las posibilidades son enormes. No solo se puede utilizar en áreas como la película y la animación, sino que también ayudará a liderar los desarrollos en la comprensión del habla y los gestos.

Volviendo a la inteligencia artificial, este modelo JL2P podría utilizarse en robots. Por ejemplo, los robots podrían ser controlados y decirles qué hacer, y podrían entender el lenguaje y responder en consecuencia.

Estos nuevos desarrollos impactarán muchos campos diferentes, y el modelo seguirá mejorando su capacidad para comprender lenguaje complejo.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.