Modelos y plataformas de IA

Control Preciso en Modelos de DifusiÃģn con Adaptadores LoRA: Deslizadores de Conceptos

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Gracias a sus capacidades, los modelos de difusiÃģn de texto a imagen han ganado una gran popularidad en la comunidad artística. Sin embargo, los modelos actuales, incluidos los marcos de vanguardia, a menudo luchan por mantener el control sobre los conceptos y atributos visuales en las imÃĄgenes generadas, lo que lleva a resultados insatisfactorios. La mayoría de los modelos se basan Únicamente en prompts de texto, lo que plantea desafíos para modular atributos continuos como la intensidad del clima, la nitidez de las sombras, las expresiones faciales o la edad de una persona de manera precisa. Esto hace que sea difícil para los usuarios finales ajustar las imÃĄgenes para satisfacer sus necesidades específicas. AdemÃĄs, aunque estos marcos generativos producen imÃĄgenes de alta calidad y realistas, son propensos a distorsiones como caras deformadas o dedos faltantes.

Para superar estas limitaciones, los desarrolladores han propuesto el uso de Deslizadores de Conceptos interpretables. Estos deslizadores prometen un mayor control para los usuarios finales sobre los atributos visuales, mejorando la generaciÃģn y ediciÃģn de imÃĄgenes dentro de los modelos de difusiÃģn. Los Deslizadores de Conceptos en los modelos de difusiÃģn funcionan identificando una direcciÃģn de parÃĄmetro correspondiente a un concepto individual mientras minimizan la interferencia con otros atributos. El marco crea estos deslizadores utilizando imÃĄgenes de muestra o un conjunto de prompts, estableciendo así direcciones para conceptos textuales y visuales.

En Última instancia, el uso de Deslizadores de Conceptos en los modelos de difusiÃģn de texto a imagen puede resultar en la generaciÃģn de imÃĄgenes con un grado mínimo de interferencia y un control mejorado sobre la salida final, aumentando tambiÃĐn la realismo percibida sin alterar el contenido de las imÃĄgenes, y generando así imÃĄgenes realistas. En este artículo, discutiremos el concepto de utilizar Deslizadores de Conceptos en los marcos de texto a imagen en mayor profundidad y analizaremos cÃģmo su uso puede resultar en imÃĄgenes generadas por IA de mayor calidad.

IntroducciÃģn a los Deslizadores de Conceptos

Como se mencionÃģ anteriormente, los marcos de difusiÃģn de texto a imagen actuales a menudo luchan por controlar los conceptos y atributos visuales en las imÃĄgenes generadas, lo que lleva a resultados insatisfactorios. AdemÃĄs, muchos de estos modelos encuentran difícil modular atributos continuos, lo que contribuye aÚn mÃĄs a resultados insatisfactorios. Los Deslizadores de Conceptos pueden ayudar a mitigar estos problemas, dotando a los creadores de contenido y a los usuarios finales de un control mejorado sobre el proceso de generaciÃģn de imÃĄgenes y abordando los desafíos que enfrentan los marcos actuales.

La mayoría de los modelos de difusiÃģn de texto a imagen actuales se basan en la modificaciÃģn directa del prompt de texto para controlar los atributos de la imagen. Si bien este enfoque permite la generaciÃģn de imÃĄgenes, no es Ãģptimo, ya que cambiar el prompt puede alterar drÃĄsticamente la estructura de la imagen. Otro enfoque utilizado por estos marcos implica tÃĐcnicas post-hoc, que invierten el proceso de difusiÃģn y modifican las atenciones cruzadas para editar conceptos visuales. Sin embargo, las tÃĐcnicas post-hoc tienen limitaciones, ya que solo admiten un nÚmero limitado de ediciones simultÃĄneas y requieren pasos de interferencia individuales para cada nuevo concepto. AdemÃĄs, pueden introducir una confusiÃģn conceptual si no se diseÃąan cuidadosamente.

En contraste, los Deslizadores de Conceptos ofrecen una soluciÃģn mÃĄs eficiente para la generaciÃģn de imÃĄgenes. Estos adaptadores ligeros y fÃĄciles de usar se pueden aplicar a modelos preentrenados, mejorando el control y la precisiÃģn sobre los conceptos deseados en una sola pasada de interferencia con un entrelazamiento mínimo. Los Deslizadores de Conceptos tambiÃĐn permiten la ediciÃģn de conceptos visuales que no estÃĄn cubiertos por descripciones textuales, una característica que los distingue de los mÃĐtodos de ediciÃģn basados en prompts de texto. Si bien los mÃĐtodos de personalizaciÃģn basados en imÃĄgenes pueden agregar tokens para conceptos basados en imÃĄgenes, son difíciles de implementar para la ediciÃģn de imÃĄgenes. Los Deslizadores de Conceptos, por otro lado, permiten a los usuarios proporcionar un pequeÃąo nÚmero de imÃĄgenes emparejadas que definen un concepto deseado. Los deslizadores luego generalizan este concepto y lo aplican automÃĄticamente a otras imÃĄgenes, con el objetivo de mejorar la realismo y corregir distorsiones como las que se encuentran en las manos.

Los Deslizadores de Conceptos buscan aprender y abordar problemas comunes a cuatro conceptos de inteligencia artificial generativa y marcos de difusiÃģn: EdiciÃģn de ImÃĄgenes, MÃĐtodos basados en OrientaciÃģn, EdiciÃģn de Modelos y Direcciones SemÃĄnticas.

EdiciÃģn de ImÃĄgenes

Los marcos de inteligencia artificial actuales se centran en el uso de una entrada condicional para guiar la estructura de la imagen o manipulan las atenciones cruzadas de la imagen de origen con su prompt de destino para permitir la ediciÃģn de una sola imagen en los marcos de difusiÃģn de texto a imagen. En consecuencia, estos enfoques solo se pueden implementar en imÃĄgenes individuales y tambiÃĐn requieren la optimizaciÃģn de la base latente para cada imagen como resultado de la evoluciÃģn de la estructura geomÃĐtrica a lo largo de los pasos de tiempo y los prompts.

MÃĐtodos basados en OrientaciÃģn

El uso de mÃĐtodos de orientaciÃģn basados en clasificadores libres ha demostrado su capacidad para mejorar la calidad de las imÃĄgenes generadas y aumentar la alineaciÃģn texto-imagen. Al incorporar tÃĐrminos de orientaciÃģn durante la interferencia, el mÃĐtodo mejora la composicionalidad limitada heredada por los marcos de difusiÃģn y se pueden utilizar para guiar a travÃĐs de conceptos no seguros en los marcos de difusiÃģn.

EdiciÃģn de Modelos

El uso de Deslizadores de Conceptos tambiÃĐn se puede ver como una tÃĐcnica de ediciÃģn de modelos que emplea un adaptador de bajo rango para producir un solo atributo semÃĄntico que permite el control continuo que se alinea con el atributo. Los mÃĐtodos de personalizaciÃģn basados en afinamiento se utilizan luego para personalizar el marco y agregar nuevos conceptos. AdemÃĄs, la tÃĐcnica de DifusiÃģn Personalizada propone una forma de afinar las capas de atenciÃģn cruzada para incorporar nuevos conceptos visuales en los modelos de difusiÃģn preentrenados. Por el contrario, la tÃĐcnica de DifusiÃģn Textual propone optimizar un vector de incrustaciÃģn para activar las capacidades del modelo e introducir conceptos textuales en el marco.

Direcciones SemÃĄnticas en GANs

La manipulaciÃģn de atributos semÃĄnticos es una de las características clave de las Redes Generativas Adversarias, y las trayectorias del espacio latente se han encontrado alineadas de manera auto-supervisada. En los marcos de difusiÃģn, estas trayectorias del espacio latente existen en las capas intermedias de la arquitectura U-Net, y la direcciÃģn principal de los espacios latentes en los marcos de difusiÃģn captura la semÃĄntica global. Los Deslizadores de Conceptos entrenan subespacios de bajo rango correspondientes a atributos especiales directamente y obtienen direcciones de ediciÃģn precisas y localizadas utilizando pares de texto o imagen para optimizar las direcciones globales.

Deslizadores de Conceptos: Arquitectura y Funcionamiento

Modelos de DifusiÃģn y Adaptadores LoRA o de Bajo Rango

Los modelos de difusiÃģn son esencialmente una subclase de marcos de inteligencia artificial generativa que operan sobre el principio de sintetizar datos invirtiendo un proceso de difusiÃģn. El proceso de difusiÃģn hacia adelante agrega inicialmente ruido a los datos, por lo que la transiciÃģn de un estado organizado a un ruido gaussiano completo. El objetivo principal de los modelos de difusiÃģn es invertir el proceso de difusiÃģn denoizando gradualmente la imagen y muestreando un ruido gaussiano aleatorio para generar una imagen. En aplicaciones del mundo real, el objetivo principal de los marcos de difusiÃģn es predecir el ruido real cuando se alimenta el ruido gaussiano completo con entradas adicionales como acondicionamiento y paso de tiempo.

La tÃĐcnica de Adaptadores LoRA o de Bajo Rango descompone las actualizaciones de peso durante el afinamiento para permitir una adaptaciÃģn eficiente de los marcos preentrenados grandes en tareas downstream. La tÃĐcnica LoRA descompone las actualizaciones de peso para una capa de modelo preentrenado con respecto a ambas dimensiones de entrada y salida, y restringe la actualizaciÃģn a un subespacio de bajo dimensionalidad.

Deslizadores de Conceptos

El objetivo principal de los Deslizadores de Conceptos es servir como un enfoque para afinar los adaptadores LoRA en un marco de difusiÃģn para facilitar un mayor grado de control sobre las imÃĄgenes dirigidas por conceptos, y lo mismo se demuestra en la siguiente imagen.

Cuando se condicionan en conceptos de destino, los Deslizadores de Conceptos aprenden direcciones de parÃĄmetros de bajo rango para aumentar o disminuir la expresiÃģn de atributos específicos. Para un modelo y su concepto de destino, el objetivo principal de los Deslizadores de Conceptos es obtener un modelo mejorado que modifica la probabilidad de aumentar y suprimir atributos para una imagen cuando se condiciona en el concepto de destino para aumentar la probabilidad de aumentar atributos y disminuir la probabilidad de suprimir atributos. Utilizando la reparametrizaciÃģn y la fÃģrmula de Tweedie, el marco introduce un proceso de ruido que varía con el tiempo y expresa cada puntuaciÃģn como una predicciÃģn de desenoise. AdemÃĄs, el objetivo de desentrelazamiento afinada los mÃģdulos en los Deslizadores de Conceptos mientras mantiene los pesos preentrenados constantes, y el factor de escala introducido durante la formulaciÃģn LoRA se modifica durante la interferencia. El factor de escala tambiÃĐn facilita ajustar las fuerzas de la ediciÃģn y hace que las ediciones sean mÃĄs fuertes sin volver a entrenar el marco, como se demuestra en la siguiente imagen.

Los mÃĐtodos de ediciÃģn utilizados anteriormente por los marcos facilitaban ediciones mÃĄs fuertes volviendo a entrenar el marco con una orientaciÃģn aumentada. Sin embargo, escalar el factor de escala durante la interferencia produce los mismos resultados de ediciÃģn sin aumentar el costo de volver a entrenar y el tiempo.

Aprendizaje de Conceptos Visuales

Los Deslizadores de Conceptos estÃĄn diseÃąados para controlar conceptos visuales que los prompts de texto no pueden definir bien, y estos deslizadores aprovechan conjuntos de datos pequeÃąos que estÃĄn emparejados antes o despuÃĐs para entrenar en estos conceptos. La diferencia entre los pares de imÃĄgenes permite a los deslizadores aprender los conceptos visuales. AdemÃĄs, el proceso de entrenamiento de los Deslizadores de Conceptos optimiza el componente LoRA implementado en ambas direcciones, hacia adelante y hacia atrÃĄs. Como resultado, el componente LoRA se alinea con la direcciÃģn que causa los efectos visuales en ambas direcciones.

Deslizadores de Conceptos: Resultados de ImplementaciÃģn

Para analizar el aumento en el rendimiento, los desarrolladores han evaluado el uso de Deslizadores de Conceptos principalmente en el Stable Diffusion XL, un marco de alta resoluciÃģn de 1024 píxeles con experimentos adicionales realizados en el marco de Stable Diffusion v1.4, con los modelos entrenados durante 500 ÃĐpocas cada uno.

Deslizadores de Conceptos Textuales

Para evaluar el rendimiento de los Deslizadores de Conceptos textuales, se validÃģ en un conjunto de 30 conceptos basados en texto, y el mÃĐtodo se comparÃģ con dos líneas base que utilizan un prompt de texto estÃĄndar para un nÚmero fijo de pasos de tiempo y luego comienzan la composiciÃģn agregando prompts para dirigir la imagen. Como se puede ver en la siguiente figura, el uso de Deslizadores de Conceptos resulta en una puntuaciÃģn CLIP constantemente mÃĄs alta y una reducciÃģn constante en la puntuaciÃģn LPIPS en comparaciÃģn con el marco original sin Deslizadores de Conceptos.

Como se puede ver en la imagen de arriba, el uso de Deslizadores de Conceptos facilita la ediciÃģn precisa de los atributos deseados durante el proceso de generaciÃģn de imÃĄgenes, manteniendo la estructura general de la imagen.

Deslizadores de Conceptos Visuales

Los modelos de difusiÃģn de texto a imagen que solo utilizan prompts de texto a menudo encuentran difícil mantener un mayor grado de control sobre los atributos visuales, como el cabello facial o la forma de los ojos. Para asegurar un mejor control sobre los atributos granulares, los Deslizadores de Conceptos aprovechan la orientaciÃģn textual opcional emparejada con conjuntos de datos de imÃĄgenes. Como se puede ver en la figura a continuaciÃģn, los Deslizadores de Conceptos crean deslizadores individuales para “tamaÃąo de ojo” y “forma de ceja” que capturan las transformaciones deseadas utilizando los pares de imÃĄgenes.

Los resultados se pueden refinar aÚn mÃĄs proporcionando textos específicos para que la direcciÃģn se centre en esa regiÃģn facial y cree deslizadores con control paso a paso sobre el atributo objetivo.

ComposiciÃģn de Deslizadores

Una de las principales ventajas del uso de Deslizadores de Conceptos es su capacidad de composiciÃģn, que permite a los usuarios combinar mÚltiples deslizadores para un control mejorado en lugar de centrarse en un solo concepto a la vez, lo que se puede deber a las direcciones de deslizadores de bajo rango utilizadas en los Deslizadores de Conceptos. AdemÃĄs, dado que los Deslizadores de Conceptos son adaptadores LoRA ligeros, son fÃĄciles de compartir y tambiÃĐn se pueden superponer fÃĄcilmente en los modelos de difusiÃģn. Los usuarios tambiÃĐn pueden ajustar mÚltiples perillas simultÃĄneamente para dirigir generaciones complejas descargando conjuntos de deslizadores interesantes.

La siguiente imagen demuestra las capacidades de composiciÃģn de los deslizadores de conceptos, y mÚltiples deslizadores se componen progresivamente en cada fila de izquierda a derecha, permitiendo así la travesía de espacios de conceptos de alta dimensionalidad con un mayor grado de control sobre los conceptos.

Mejora de la Calidad de la Imagen

Aunque los marcos de difusiÃģn de texto a imagen de vanguardia y los modelos generativos de gran escala como el modelo Stable Diffusion XL son capaces de generar imÃĄgenes realistas y de alta calidad, a menudo sufren de distorsiones de imagen como objetos borrosos o deformados, aunque los parÃĄmetros de estos marcos de vanguardia estÃĄn equipados con la capacidad latente de generar salidas de alta calidad con menos generaciones. El uso de Deslizadores de Conceptos puede resultar en la generaciÃģn de imÃĄgenes con menos distorsiones al desbloquear las capacidades reales de estos modelos al identificar direcciones de parÃĄmetros de bajo rango.

CorrecciÃģn de Manos

Generar imÃĄgenes con manos realistas ha sido siempre un obstÃĄculo para los marcos de difusiÃģn, y el uso de Deslizadores de Conceptos tiene el control directo sobre la tendencia a distorsionar las manos. La siguiente imagen demuestra el efecto de utilizar los Deslizadores de Conceptos “corregir manos” que permite al marco generar imÃĄgenes con manos mÃĄs realistas.

Deslizadores de ReparaciÃģn

El uso de Deslizadores de Conceptos no solo puede resultar en la generaciÃģn de manos mÃĄs realistas, sino que tambiÃĐn ha demostrado su potencial para mejorar la realismo general de las imÃĄgenes generadas por el marco. Los Deslizadores de Conceptos tambiÃĐn identifican una sola direcciÃģn de parÃĄmetro de bajo rango que permite el desplazamiento en las imÃĄgenes desde problemas de distorsiÃģn comunes, y los resultados se demuestran en la siguiente imagen.

Pensamientos Finales

En este artículo, hemos hablado sobre los Deslizadores de Conceptos, un nuevo paradigma simple pero escalable que permite un control interpretable sobre la salida generada en los modelos de difusiÃģn. El uso de Deslizadores de Conceptos tiene como objetivo resolver los problemas que enfrentan los marcos de difusiÃģn de texto a imagen actuales, que encuentran difícil mantener el control requerido sobre los conceptos y atributos visuales incluidos en la imagen generada, lo que a menudo lleva a resultados insatisfactorios. AdemÃĄs, la mayoría de los modelos de difusiÃģn de texto a imagen encuentran difícil modular atributos continuos en una imagen, lo que a menudo lleva a resultados insatisfactorios. El uso de Deslizadores de Conceptos podría permitir que los marcos de difusiÃģn de texto a imagen mitiguen estos problemas y doten a los creadores de contenido y a los usuarios finales de un mayor grado de control sobre el proceso de generaciÃģn de imÃĄgenes y resuelvan los problemas que enfrentan los marcos actuales.

Un ingeniero por profesiÃģn, un escritor por corazÃģn. Kunal es un escritor tÃĐcnico con un profundo amor y comprensiÃģn de la IA y el ML, dedicado a simplificar conceptos complejos en estos campos a travÃĐs de su documentaciÃģn atractiva e informativa.