Modelos y plataformas de IA
Investigadores Desarrollan Nuevo Método para Controlar la Generación de Imágenes de Inteligencia Artificial
Investigadores de la Universidad Estatal de Carolina del Norte han desarrollado un nuevo método para controlar la generación de imágenes de inteligencia artificial, que podría ser utilizado en campos como los vehículos autónomos.
Generación de Imágenes Condicional y Otras Técnicas
La generación de imágenes condicional es una tarea de inteligencia artificial que implica que los sistemas de inteligencia artificial creen imágenes basadas en un conjunto específico de condiciones, que el usuario puede solicitar. Técnicas más recientes han llevado esto aún más lejos y incorporan condiciones para el diseño de la imagen, lo que permite a los usuarios especificar los tipos de objetos que desean que aparezcan en lugares específicos de la pantalla.
El nuevo método de última generación desarrollado por los investigadores de la universidad se basa en todas estas técnicas y permite a los usuarios tener más control sobre las imágenes mientras retiene ciertas características a lo largo de una serie de imágenes.
Tianfu Wu es coautor del artículo de investigación y profesor asistente de ingeniería informática en NC State.
“Nuestro enfoque es muy reconfigurable”, dice Wu. “Al igual que los enfoques anteriores, el nuestro permite a los usuarios que el sistema genere una imagen basada en un conjunto específico de condiciones. Pero el nuestro también permite retener esa imagen y agregarle elementos. Por ejemplo, los usuarios podrían tener que el sistema cree una escena de montaña. Luego, los usuarios podrían tener que el sistema agregue esquiadores a esa escena.”
Manipulación de Elementos
Con el nuevo método, los usuarios también pueden permitir que la inteligencia artificial manipule los elementos para que sean identificables como los mismos mientras aún se mueven o cambian de alguna manera. Un ejemplo de esto sería que la inteligencia artificial cree una serie de imágenes donde los esquiadores se vuelven hacia el espectador mientras se mueven a través de un paisaje.
“Una aplicación para esto sería ayudar a los robots autónomos a ‘imaginar’ cómo podría ser el resultado final antes de comenzar una tarea determinada”, dice Wu. “También podrías usar el sistema para generar imágenes para el entrenamiento de la inteligencia artificial. Así, en lugar de compilar imágenes de fuentes externas, podrías usar este sistema para crear imágenes para entrenar otros sistemas de inteligencia artificial.”
El nuevo enfoque se probó con el conjunto de datos COCO-Stuff y el conjunto de datos Visual Genome, y según los estándares de calidad de la imagen, supera las técnicas de última generación anteriores.
“Nuestro próximo paso es ver si podemos extender este trabajo a videos y imágenes tridimensionales”, dice Wu.
Para entrenar el nuevo enfoque, los investigadores tuvieron que confiar en una estación de trabajo de 4 GPU, dada la gran potencia de cálculo necesaria. A pesar de esto, implementar el sistema sigue siendo menos costoso en términos computacionales.
“Encontramos que una GPU nos da casi velocidad en tiempo real”, dice Wu.
“Además de nuestro artículo, hemos hecho que el código fuente de este enfoque esté disponible en GitHub. Dicho esto, siempre estamos abiertos a colaborar con socios de la industria.”












