Robótica e IA física

Modelo de aprendizaje automático que comprende las relaciones entre objetos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los investigadores del Instituto de Tecnología de Massachusetts (MIT) han desarrollado un nuevo modelo de aprendizaje automático (ML) que comprende las relaciones subyacentes entre los objetos en una escena. El modelo representa las relaciones individuales una a la vez antes de combinar las representaciones para describir la escena en general.

A través de este nuevo enfoque, el modelo de ML puede generar imágenes más precisas a partir de descripciones de texto, y puede hacerlo incluso cuando la escena tiene múltiples proyectos dispuestos en diferentes relaciones entre sí.

Este nuevo desarrollo es importante, ya que muchos modelos de aprendizaje profundo no pueden comprender las relaciones entre los objetos individuales.

El modelo del equipo podría ser utilizado en casos en los que los robots industriales deben realizar tareas de manipulación en varias etapas, como apilar objetos o ensamblar electrodomésticos. También ayuda a que las máquinas puedan aprender de su entorno y interactuar con él, al igual que los humanos.

Yilun Du es un estudiante de doctorado en el Laboratorio de Ciencia y Inteligencia Artificial (CSAIL) y coautor principal del artículo. Du codirigió la investigación con Shuang Li, un estudiante de doctorado en CSAIL, y Nan Liu, un estudiante de posgrado en la Universidad de Illinois en Urbana-Champaign. También incluyó a Joshua B. Tenenbaum, profesor de Ciencia Cognitiva y Computación en el Departamento de Ciencias del Cerebro y la Computación, y al autor senior Antonio Torralba, profesor de Ingeniería Eléctrica y Ciencia de la Computación. Tanto Tenenbaum como Torralba son miembros de CSAIL.

El nuevo marco

“Cuando miro una mesa, no puedo decir que hay un objeto en la ubicación XYZ. Nuestras mentes no funcionan de esa manera. Cuando entendemos una escena, realmente la entendemos en función de las relaciones entre los objetos. Creemos que al construir un sistema que pueda comprender las relaciones entre los objetos, podríamos utilizar ese sistema para manipular y cambiar nuestro entorno de manera más efectiva”, dice Du.

El nuevo marco puede generar una imagen de una escena a partir de una descripción de texto de los objetos y sus relaciones.

El sistema puede descomponer estas oraciones en piezas más pequeñas que describen cada relación individual. Cada parte se modela por separado, y las piezas se combinan a través de un proceso de optimización que genera una imagen de la escena.

Con las oraciones descompuestas en piezas más cortas, el sistema puede recombinarlas de diferentes maneras, lo que le permite adaptarse a descripciones de escenas que nunca ha encontrado.

“Otros sistemas tomarían todas las relaciones de manera holística y generarían la imagen de una sola vez a partir de la descripción. Sin embargo, estos enfoques fallan cuando tenemos descripciones fuera de la distribución, como descripciones con más relaciones, ya que estos modelos no pueden adaptarse de una sola vez para generar imágenes que contengan más relaciones. Sin embargo, como estamos componiendo estos modelos separados y más pequeños, podemos modelar un número mayor de relaciones y adaptarnos a combinaciones nuevas”, dice Du.

El sistema también puede realizar este proceso en sentido inverso. Si se le proporciona una imagen, puede encontrar descripciones de texto que coincidan con las relaciones entre los objetos en la escena.

Evaluación del modelo

Los investigadores pidieron a los humanos que evaluaran si las imágenes generadas coincidían con la descripción original de la escena. Cuando las descripciones contenían tres relaciones, que era el tipo más complejo, el 91 por ciento de los participantes dijo que el nuevo modelo funcionaba mejor que otros métodos de aprendizaje profundo.

“Una cosa interesante que encontramos es que para nuestro modelo, podemos aumentar nuestra oración desde una descripción de relación hasta dos, o tres, o incluso cuatro descripciones, y nuestro enfoque sigue siendo capaz de generar imágenes que se describen correctamente con esas descripciones, mientras que otros métodos fallan”, dice Du.

El modelo también demostró una capacidad impresionante para trabajar con descripciones que no había encontrado previamente.

“Esto es muy prometedor porque es más similar a cómo funcionan los humanos. Los humanos pueden ver solo varios ejemplos, pero podemos extraer información útil de solo esos pocos ejemplos y combinarlos para crear combinaciones infinitas. Y nuestro modelo tiene una propiedad que le permite aprender de menos datos pero generalizar a escenas o generaciones de imágenes más complejas”, dice Li.

El equipo ahora buscará probar el modelo en imágenes del mundo real que sean más complejas y explorar cómo incorporar eventualmente el modelo en sistemas de robótica.

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.