Modelos y plataformas de IA

Control Preciso en Modelos de Difusión con Adaptadores LoRA: Deslizadores de Conceptos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Gracias a sus capacidades, los modelos de difusión de texto a imagen han ganado una gran popularidad en la comunidad artística. Sin embargo, los modelos actuales, incluidos los marcos de vanguardia, a menudo luchan por mantener el control sobre los conceptos y atributos visuales en las imágenes generadas, lo que lleva a resultados insatisfactorios. La mayoría de los modelos se basan únicamente en prompts de texto, lo que plantea desafíos para modular atributos continuos como la intensidad del clima, la nitidez de las sombras, las expresiones faciales o la edad de una persona de manera precisa. Esto hace que sea difícil para los usuarios finales ajustar las imágenes para satisfacer sus necesidades específicas. Además, aunque estos marcos generativos producen imágenes de alta calidad y realistas, son propensos a distorsiones como caras deformadas o dedos faltantes.

Para superar estas limitaciones, los desarrolladores han propuesto el uso de Deslizadores de Conceptos interpretables. Estos deslizadores prometen un mayor control para los usuarios finales sobre los atributos visuales, mejorando la generación y edición de imágenes dentro de los modelos de difusión. Los Deslizadores de Conceptos en los modelos de difusión funcionan identificando una dirección de parámetro correspondiente a un concepto individual mientras minimizan la interferencia con otros atributos. El marco crea estos deslizadores utilizando imágenes de muestra o un conjunto de prompts, estableciendo así direcciones para conceptos textuales y visuales.

En última instancia, el uso de Deslizadores de Conceptos en los modelos de difusión de texto a imagen puede resultar en la generación de imágenes con un grado mínimo de interferencia y un control mejorado sobre la salida final, aumentando también la realismo percibida sin alterar el contenido de las imágenes, y generando así imágenes realistas. En este artículo, discutiremos el concepto de utilizar Deslizadores de Conceptos en los marcos de texto a imagen en mayor profundidad y analizaremos cómo su uso puede resultar en imágenes generadas por IA de mayor calidad.

Introducción a los Deslizadores de Conceptos

Como se mencionó anteriormente, los marcos de difusión de texto a imagen actuales a menudo luchan por controlar los conceptos y atributos visuales en las imágenes generadas, lo que lleva a resultados insatisfactorios. Además, muchos de estos modelos encuentran difícil modular atributos continuos, lo que contribuye aún más a resultados insatisfactorios. Los Deslizadores de Conceptos pueden ayudar a mitigar estos problemas, dotando a los creadores de contenido y a los usuarios finales de un control mejorado sobre el proceso de generación de imágenes y abordando los desafíos que enfrentan los marcos actuales.

La mayoría de los modelos de difusión de texto a imagen actuales se basan en la modificación directa del prompt de texto para controlar los atributos de la imagen. Si bien este enfoque permite la generación de imágenes, no es óptimo, ya que cambiar el prompt puede alterar drásticamente la estructura de la imagen. Otro enfoque utilizado por estos marcos implica técnicas post-hoc, que invierten el proceso de difusión y modifican las atenciones cruzadas para editar conceptos visuales. Sin embargo, las técnicas post-hoc tienen limitaciones, ya que solo admiten un número limitado de ediciones simultáneas y requieren pasos de interferencia individuales para cada nuevo concepto. Además, pueden introducir una confusión conceptual si no se diseñan cuidadosamente.

En contraste, los Deslizadores de Conceptos ofrecen una solución más eficiente para la generación de imágenes. Estos adaptadores ligeros y fáciles de usar se pueden aplicar a modelos preentrenados, mejorando el control y la precisión sobre los conceptos deseados en una sola pasada de interferencia con un entrelazamiento mínimo. Los Deslizadores de Conceptos también permiten la edición de conceptos visuales que no están cubiertos por descripciones textuales, una característica que los distingue de los métodos de edición basados en prompts de texto. Si bien los métodos de personalización basados en imágenes pueden agregar tokens para conceptos basados en imágenes, son difíciles de implementar para la edición de imágenes. Los Deslizadores de Conceptos, por otro lado, permiten a los usuarios proporcionar un pequeño número de imágenes emparejadas que definen un concepto deseado. Los deslizadores luego generalizan este concepto y lo aplican automáticamente a otras imágenes, con el objetivo de mejorar la realismo y corregir distorsiones como las que se encuentran en las manos.

Los Deslizadores de Conceptos buscan aprender y abordar problemas comunes a cuatro conceptos de inteligencia artificial generativa y marcos de difusión: Edición de Imágenes, Métodos basados en Orientación, Edición de Modelos y Direcciones Semánticas.

Edición de Imágenes

Los marcos de inteligencia artificial actuales se centran en el uso de una entrada condicional para guiar la estructura de la imagen o manipulan las atenciones cruzadas de la imagen de origen con su prompt de destino para permitir la edición de una sola imagen en los marcos de difusión de texto a imagen. En consecuencia, estos enfoques solo se pueden implementar en imágenes individuales y también requieren la optimización de la base latente para cada imagen como resultado de la evolución de la estructura geométrica a lo largo de los pasos de tiempo y los prompts.

Métodos basados en Orientación

El uso de métodos de orientación basados en clasificadores libres ha demostrado su capacidad para mejorar la calidad de las imágenes generadas y aumentar la alineación texto-imagen. Al incorporar términos de orientación durante la interferencia, el método mejora la composicionalidad limitada heredada por los marcos de difusión y se pueden utilizar para guiar a través de conceptos no seguros en los marcos de difusión.

Edición de Modelos

El uso de Deslizadores de Conceptos también se puede ver como una técnica de edición de modelos que emplea un adaptador de bajo rango para producir un solo atributo semántico que permite el control continuo que se alinea con el atributo. Los métodos de personalización basados en afinamiento se utilizan luego para personalizar el marco y agregar nuevos conceptos. Además, la técnica de Difusión Personalizada propone una forma de afinar las capas de atención cruzada para incorporar nuevos conceptos visuales en los modelos de difusión preentrenados. Por el contrario, la técnica de Difusión Textual propone optimizar un vector de incrustación para activar las capacidades del modelo e introducir conceptos textuales en el marco.

Direcciones Semánticas en GANs

La manipulación de atributos semánticos es una de las características clave de las Redes Generativas Adversarias, y las trayectorias del espacio latente se han encontrado alineadas de manera auto-supervisada. En los marcos de difusión, estas trayectorias del espacio latente existen en las capas intermedias de la arquitectura U-Net, y la dirección principal de los espacios latentes en los marcos de difusión captura la semántica global. Los Deslizadores de Conceptos entrenan subespacios de bajo rango correspondientes a atributos especiales directamente y obtienen direcciones de edición precisas y localizadas utilizando pares de texto o imagen para optimizar las direcciones globales.

Deslizadores de Conceptos: Arquitectura y Funcionamiento

Modelos de Difusión y Adaptadores LoRA o de Bajo Rango

Los modelos de difusión son esencialmente una subclase de marcos de inteligencia artificial generativa que operan sobre el principio de sintetizar datos invirtiendo un proceso de difusión. El proceso de difusión hacia adelante agrega inicialmente ruido a los datos, por lo que la transición de un estado organizado a un ruido gaussiano completo. El objetivo principal de los modelos de difusión es invertir el proceso de difusión denoizando gradualmente la imagen y muestreando un ruido gaussiano aleatorio para generar una imagen. En aplicaciones del mundo real, el objetivo principal de los marcos de difusión es predecir el ruido real cuando se alimenta el ruido gaussiano completo con entradas adicionales como acondicionamiento y paso de tiempo.

La técnica de Adaptadores LoRA o de Bajo Rango descompone las actualizaciones de peso durante el afinamiento para permitir una adaptación eficiente de los marcos preentrenados grandes en tareas downstream. La técnica LoRA descompone las actualizaciones de peso para una capa de modelo preentrenado con respecto a ambas dimensiones de entrada y salida, y restringe la actualización a un subespacio de bajo dimensionalidad.

Deslizadores de Conceptos

El objetivo principal de los Deslizadores de Conceptos es servir como un enfoque para afinar los adaptadores LoRA en un marco de difusión para facilitar un mayor grado de control sobre las imágenes dirigidas por conceptos, y lo mismo se demuestra en la siguiente imagen.

Cuando se condicionan en conceptos de destino, los Deslizadores de Conceptos aprenden direcciones de parámetros de bajo rango para aumentar o disminuir la expresión de atributos específicos. Para un modelo y su concepto de destino, el objetivo principal de los Deslizadores de Conceptos es obtener un modelo mejorado que modifica la probabilidad de aumentar y suprimir atributos para una imagen cuando se condiciona en el concepto de destino para aumentar la probabilidad de aumentar atributos y disminuir la probabilidad de suprimir atributos. Utilizando la reparametrización y la fórmula de Tweedie, el marco introduce un proceso de ruido que varía con el tiempo y expresa cada puntuación como una predicción de desenoise. Además, el objetivo de desentrelazamiento afinada los módulos en los Deslizadores de Conceptos mientras mantiene los pesos preentrenados constantes, y el factor de escala introducido durante la formulación LoRA se modifica durante la interferencia. El factor de escala también facilita ajustar las fuerzas de la edición y hace que las ediciones sean más fuertes sin volver a entrenar el marco, como se demuestra en la siguiente imagen.

Los métodos de edición utilizados anteriormente por los marcos facilitaban ediciones más fuertes volviendo a entrenar el marco con una orientación aumentada. Sin embargo, escalar el factor de escala durante la interferencia produce los mismos resultados de edición sin aumentar el costo de volver a entrenar y el tiempo.

Aprendizaje de Conceptos Visuales

Los Deslizadores de Conceptos están diseñados para controlar conceptos visuales que los prompts de texto no pueden definir bien, y estos deslizadores aprovechan conjuntos de datos pequeños que están emparejados antes o después para entrenar en estos conceptos. La diferencia entre los pares de imágenes permite a los deslizadores aprender los conceptos visuales. Además, el proceso de entrenamiento de los Deslizadores de Conceptos optimiza el componente LoRA implementado en ambas direcciones, hacia adelante y hacia atrás. Como resultado, el componente LoRA se alinea con la dirección que causa los efectos visuales en ambas direcciones.

Deslizadores de Conceptos: Resultados de Implementación

Para analizar el aumento en el rendimiento, los desarrolladores han evaluado el uso de Deslizadores de Conceptos principalmente en el Stable Diffusion XL, un marco de alta resolución de 1024 píxeles con experimentos adicionales realizados en el marco de Stable Diffusion v1.4, con los modelos entrenados durante 500 épocas cada uno.

Deslizadores de Conceptos Textuales

Para evaluar el rendimiento de los Deslizadores de Conceptos textuales, se validó en un conjunto de 30 conceptos basados en texto, y el método se comparó con dos líneas base que utilizan un prompt de texto estándar para un número fijo de pasos de tiempo y luego comienzan la composición agregando prompts para dirigir la imagen. Como se puede ver en la siguiente figura, el uso de Deslizadores de Conceptos resulta en una puntuación CLIP constantemente más alta y una reducción constante en la puntuación LPIPS en comparación con el marco original sin Deslizadores de Conceptos.

Como se puede ver en la imagen de arriba, el uso de Deslizadores de Conceptos facilita la edición precisa de los atributos deseados durante el proceso de generación de imágenes, manteniendo la estructura general de la imagen.

Deslizadores de Conceptos Visuales

Los modelos de difusión de texto a imagen que solo utilizan prompts de texto a menudo encuentran difícil mantener un mayor grado de control sobre los atributos visuales, como el cabello facial o la forma de los ojos. Para asegurar un mejor control sobre los atributos granulares, los Deslizadores de Conceptos aprovechan la orientación textual opcional emparejada con conjuntos de datos de imágenes. Como se puede ver en la figura a continuación, los Deslizadores de Conceptos crean deslizadores individuales para “tamaño de ojo” y “forma de ceja” que capturan las transformaciones deseadas utilizando los pares de imágenes.

Los resultados se pueden refinar aún más proporcionando textos específicos para que la dirección se centre en esa región facial y cree deslizadores con control paso a paso sobre el atributo objetivo.

Composición de Deslizadores

Una de las principales ventajas del uso de Deslizadores de Conceptos es su capacidad de composición, que permite a los usuarios combinar múltiples deslizadores para un control mejorado en lugar de centrarse en un solo concepto a la vez, lo que se puede deber a las direcciones de deslizadores de bajo rango utilizadas en los Deslizadores de Conceptos. Además, dado que los Deslizadores de Conceptos son adaptadores LoRA ligeros, son fáciles de compartir y también se pueden superponer fácilmente en los modelos de difusión. Los usuarios también pueden ajustar múltiples perillas simultáneamente para dirigir generaciones complejas descargando conjuntos de deslizadores interesantes.

La siguiente imagen demuestra las capacidades de composición de los deslizadores de conceptos, y múltiples deslizadores se componen progresivamente en cada fila de izquierda a derecha, permitiendo así la travesía de espacios de conceptos de alta dimensionalidad con un mayor grado de control sobre los conceptos.

Mejora de la Calidad de la Imagen

Aunque los marcos de difusión de texto a imagen de vanguardia y los modelos generativos de gran escala como el modelo Stable Diffusion XL son capaces de generar imágenes realistas y de alta calidad, a menudo sufren de distorsiones de imagen como objetos borrosos o deformados, aunque los parámetros de estos marcos de vanguardia están equipados con la capacidad latente de generar salidas de alta calidad con menos generaciones. El uso de Deslizadores de Conceptos puede resultar en la generación de imágenes con menos distorsiones al desbloquear las capacidades reales de estos modelos al identificar direcciones de parámetros de bajo rango.

Corrección de Manos

Generar imágenes con manos realistas ha sido siempre un obstáculo para los marcos de difusión, y el uso de Deslizadores de Conceptos tiene el control directo sobre la tendencia a distorsionar las manos. La siguiente imagen demuestra el efecto de utilizar los Deslizadores de Conceptos “corregir manos” que permite al marco generar imágenes con manos más realistas.

Deslizadores de Reparación

El uso de Deslizadores de Conceptos no solo puede resultar en la generación de manos más realistas, sino que también ha demostrado su potencial para mejorar la realismo general de las imágenes generadas por el marco. Los Deslizadores de Conceptos también identifican una sola dirección de parámetro de bajo rango que permite el desplazamiento en las imágenes desde problemas de distorsión comunes, y los resultados se demuestran en la siguiente imagen.

Pensamientos Finales

En este artículo, hemos hablado sobre los Deslizadores de Conceptos, un nuevo paradigma simple pero escalable que permite un control interpretable sobre la salida generada en los modelos de difusión. El uso de Deslizadores de Conceptos tiene como objetivo resolver los problemas que enfrentan los marcos de difusión de texto a imagen actuales, que encuentran difícil mantener el control requerido sobre los conceptos y atributos visuales incluidos en la imagen generada, lo que a menudo lleva a resultados insatisfactorios. Además, la mayoría de los modelos de difusión de texto a imagen encuentran difícil modular atributos continuos en una imagen, lo que a menudo lleva a resultados insatisfactorios. El uso de Deslizadores de Conceptos podría permitir que los marcos de difusión de texto a imagen mitiguen estos problemas y doten a los creadores de contenido y a los usuarios finales de un mayor grado de control sobre el proceso de generación de imágenes y resuelvan los problemas que enfrentan los marcos actuales.

Kunal Kejriwal es un ingeniero de backend especializado en Python, PostgreSQL, Redis e infraestructura en la nube en GCP y AWS. Con tres años de experiencia construyendo y escalando sistemas de producción, escribe sobre infraestructura de IA, sistemas distribuidos y la arquitectura detrás del despliegue de cargas de trabajo de aprendizaje automático.