Ángulo de Anderson

Hacia LoRAs que puedan sobrevivir a las actualizaciones de versiones de modelos

mm
Añade Unite.AI a tus fuentes preferidas en Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Desde mi cobertura reciente del crecimiento en la cantidad de LoRAs de video Hunyuan (archivos pequeños y entrenados que pueden inyectar personalidades personalizadas en modelos de texto a video y de imagen a video de varios miles de millones de parámetros), el número de LoRAs relacionadas disponibles en la comunidad de Civit ha aumentado un 185%.

A pesar de que no hay métodos particularmente fáciles o de bajo esfuerzo para crear un LoRA de video Hunyuan, el catálogo de LoRAs de celebridades y temáticas en Civit está creciendo diariamente. Fuente: https://civitai.com/

A pesar de que no hay métodos particularmente fáciles o de bajo esfuerzo para crear un LoRA de video Hunyuan, el catálogo de LoRAs de celebridades y temáticas en Civit está creciendo diariamente. Fuente: https://civitai.com/

La misma comunidad que se está esforzando por aprender a producir estas “personalidades adicionales” para Hunyuan Video también está presionando para la prometida liberación de una funcionalidad de imagen a video (I2V) en Hunyuan Video.

En cuanto a la síntesis de imágenes humanas de código abierto, esto es un gran avance; combinado con el crecimiento de LoRAs de Hunyuan, podría permitir a los usuarios transformar fotos de personas en videos de una manera que no erosione su identidad a medida que el video se desarrolla, lo cual es actualmente el caso en todos los generadores de imagen a video de última generación, incluyendo Kling, Kaiber y el celebrado RunwayML:

Haga clic para reproducir. Una generación de imagen a video desde el modelo Gen 3 Turbo de RunwayML. Sin embargo, al igual que todos los modelos rivales similares y menos destacados, no puede mantener la identidad coherente cuando el sujeto se aleja de la cámara, y las características distintivas de la imagen inicial se convierten en una “mujer de difusión genérica”. Fuente: https://app.runwayml.com/

Al desarrollar un LoRA personalizado para la personalidad en cuestión, uno podría, en un flujo de trabajo de I2V de HV, utilizar una foto real de ellos como punto de partida. Esto es una “semilla” mucho mejor que enviar un número aleatorio al espacio latente del modelo y conformarse con el escenario semántico resultante. Luego, uno podría utilizar el LoRA, o varios LoRAs, para mantener la coherencia de la identidad, peinados, ropa y otros aspectos fundamentales de una generación.

Potencialmente, la disponibilidad de tal combinación podría representar uno de los cambios más significativos en la inteligencia artificial generativa desde el lanzamiento de Stable Diffusion, con un poder generativo formidable entregado a entusiastas de código abierto, sin la regulación (o “control de acceso”, si lo prefiere) proporcionada por los censores de contenido en la actual generación de sistemas de video populares.

Al escribir esto, Hunyuan de imagen a video es un elemento sin marcar en el repositorio de GitHub de Hunyuan Video, con la comunidad de aficionados informando (de forma anecdótica) un comentario de Discord de un desarrollador de Hunyuan, que aparentemente declaró que la liberación de esta funcionalidad se ha retrasado hasta algún momento más tarde en el primer trimestre debido a que el modelo es “demasiado sin censurar”.

La lista oficial de verificación de características de Hunyuan Video. Fuente: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

La lista oficial de verificación de características de Hunyuan Video. Fuente: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Aunque no es exacto, los desarrolladores del repositorio han entregado sustancialmente en el resto de la lista de verificación de Hunyuan, y por lo tanto, Hunyuan I2V parece que llegará eventualmente, ya sea censurado, sin censurar o de alguna manera “desbloqueable”.

Pero como podemos ver en la lista anterior, la liberación de I2V es aparentemente un modelo completamente separado, lo que hace que sea poco probable que cualquiera de los LoRAs de HV actuales en Civit y en otros lugares funcione con él.

En este escenario (ahora) predecible, los marcos de entrenamiento de LoRA como Musubi Tuner y OneTrainer serán establecidos o restablecidos en cuanto a la compatibilidad con el nuevo modelo. Mientras tanto, uno o dos de los luminares de YouTube más técnicamente astutos (y emprendedores) cobrarán sus soluciones a través de Patreon hasta que la escena se ponga al día.

Agotamiento por actualización

Casi nadie experimenta el agotamiento por actualización tanto como un entusiasta de LoRA o de ajuste fino, porque el ritmo rápido y competitivo del cambio en la inteligencia artificial generativa anima a las fundiciones de modelos como Stability.ai, Tencent y Black Forest Labs a producir modelos más grandes y (a veces) mejores al máximo frecuencia viable.

Desde que estos nuevos y mejorados modelos tendrán al menos diferentes sesgos y pesos, y más comúnmente tendrán una escala y/o arquitectura diferentes, esto significa que la comunidad de ajuste fino tiene que sacar sus conjuntos de datos nuevamente y repetir el proceso de entrenamiento agotador para la nueva versión.

Por esta razón, hay una multiplicidad de tipos de LoRA de Stable Diffusion disponibles en Civit:

La ruta de actualización, visualizada en las opciones de filtro de búsqueda en civit.ai

La ruta de actualización, visualizada en las opciones de filtro de búsqueda en civit.ai

Dado que ninguno de estos modelos LoRA ligeros es interoperable con versiones de modelo más altas o más bajas, y dado que muchos de ellos tienen dependencias de fusiones y ajustes finos populares a gran escala que se adhieren a una arquitectura de modelo más antigua, una parte significativa de la comunidad tiende a aferrarse a una versión “legada”, de la misma manera que la lealtad del cliente a Windows XP persistió años después de que finalizó el soporte oficial.

Adaptación al cambio

Este tema viene a la mente debido a un nuevo documento de Qualcomm AI Research que afirma haber desarrollado un método para “actualizar” LoRAs existentes a una versión de modelo recién lanzada.

Ejemplo de conversión de LoRAs entre versiones de modelo. Fuente: https://arxiv.org/pdf/2501.16559

Ejemplo de conversión de LoRAs entre versiones de modelo. Fuente: https://arxiv.org/pdf/2501.16559

Esto no significa que el nuevo enfoque, titulado LoRA-X, pueda traducir libremente entre todos los modelos del mismo tipo (es decir, modelos de texto a imagen o modelos de lenguaje grande [LLM]); pero los autores han demostrado una transliteración efectiva de un LoRA de Stable Diffusion v1.5 a SDXL, y una conversión de un LoRA para el modelo de texto TinyLlama 3T al TinyLlama 2.5T.

LoRA-X transfiere parámetros de LoRA entre diferentes modelos base preservando el adaptador dentro del subespacio del modelo de origen; pero solo en partes del modelo que son lo suficientemente similares en diferentes versiones del modelo.

A la izquierda, un esquema de la forma en que el modelo de origen LoRA-X ajusta un adaptador, que luego se ajusta para que se adapte al modelo de destino utilizando su propia estructura interna. A la derecha, imágenes generadas por los modelos de destino SD Eff-v1.0 y SSD-1B, después de aplicar adaptadores transferidos desde SD-v1.5 y SDXL sin entrenamiento adicional.

A la izquierda, un esquema de la forma en que el modelo de origen LoRA-X ajusta un adaptador, que luego se ajusta para que se adapte al modelo de destino. A la derecha, imágenes generadas por los modelos de destino SD Eff-v1.0 y SSD-1B, después de aplicar adaptadores transferidos desde SD-v1.5 y SDXL sin entrenamiento adicional.

Mientras que esto ofrece una solución práctica para escenarios en los que el retrato no es deseable o imposible (como un cambio de licencia en los datos de entrenamiento originales), el método está restringido a arquitecturas de modelo similares, entre otras limitaciones.

Aunque esto es una rara incursión en un campo poco estudiado, no examinaremos este documento en profundidad debido a las numerosas limitaciones de LoRA-X, como se evidencia en los comentarios de sus críticos y asesores en Open Review.

La dependencia del método en similitud de subespacio restringe su aplicación a modelos estrechamente relacionados, y los autores han concedido en el foro de revisión que LoRA-X no puede ser transferido fácilmente entre arquitecturas significativamente diferentes.

Otros enfoques de PEFT

La posibilidad de hacer que los LoRAs sean más portátiles entre versiones es un hilo de estudio pequeño pero interesante en la literatura, y la principal contribución que LoRA-X hace a esta búsqueda es su afirmación de que no requiere entrenamiento. Esto no es estrictamente cierto, si se lee el documento, pero requiere el menor entrenamiento de todos los métodos anteriores.

LoRA-X es otra entrada en el canon de métodos de ajuste fino eficiente de parámetros (PEFT), que abordan el desafío de adaptar modelos preentrenados grandes a tareas específicas sin un entrenamiento extensivo. Este enfoque conceptual apunta a modificar un número mínimo de parámetros mientras mantiene el rendimiento.

Destacados entre ellos están:

X-Adapter

El marco de X-Adapter transfiere adaptadores ajustados finamente entre modelos con cierta cantidad de retrato. El sistema apunta a permitir que los módulos preentrenados y listos para usar (como ControlNet y LoRA) de un modelo de difusión base (es decir, Stable Diffusion v1.5) funcionen directamente con un modelo de difusión actualizado como SDXL sin retrato, actuando efectivamente como un “actualizador universal” para complementos.

El sistema logra esto entrenando una red adicional que controla el modelo actualizado, utilizando una copia congelada del modelo base para preservar los conectores de complementos:

Esquema para X-Adapter. Fuente: https://arxiv.org/pdf/2312.02238

Esquema para X-Adapter. Fuente: https://arxiv.org/pdf/2312.02238

X-Adapter fue desarrollado y probado originalmente para transferir adaptadores desde SD1.5 a SDXL, mientras que LoRA-X ofrece una variedad más amplia de transliteraciones.

DoRA (Adaptación de bajo rango con descomposición de pesos)

DoRA es un método de ajuste fino mejorado que mejora a LoRA utilizando una estrategia de descomposición de pesos que se asemeja más al ajuste fino completo:

DoRA no intenta simplemente copiar un adaptador en un entorno congelado, como LoRA-X, sino que cambia parámetros fundamentales de los pesos, como magnitud y dirección. Fuente: https://arxiv.org/pdf/2402.09353

DoRA no intenta simplemente copiar un adaptador en un entorno congelado, como LoRA-X, sino que cambia parámetros fundamentales de los pesos, como magnitud y dirección. Fuente: https://arxiv.org/pdf/2402.09353

DoRA se centra en mejorar el proceso de ajuste fino en sí, descomponiendo los pesos del modelo en magnitud y dirección (ver imagen anterior). En cambio, LoRA-X se centra en permitir la transferencia de parámetros ajustados finamente existentes entre diferentes modelos base

Sin embargo, el enfoque de LoRA-X adapta las técnicas de proyección desarrolladas para DoRA, y en pruebas contra este sistema más antiguo afirma una puntuación DINO mejorada.

FouRA (Adaptación de bajo rango de Fourier)

Publicado en junio de 2024, el método FouRA proviene, al igual que LoRA-X, de Qualcomm AI Research, y comparte algunos de sus temas y pruebas de promoción.

Ejemplos de colapso de distribución en LoRA, del documento de 2024 FouRA, utilizando el modelo Realistic Vision 3.0 entrenado con LoRA y FouRA para adaptadores de estilo 'Fuego Azul' y 'Origami', en cuatro semillas. Las imágenes de LoRA exhiben colapso de distribución y diversidad reducida, mientras que FouRA genera salidas más variadas. Fuente: https://arxiv.org/pdf/2406.08798

Ejemplos de colapso de distribución en LoRA, del documento de 2024 FouRA, utilizando el modelo Realistic Vision 3.0 entrenado con LoRA y FouRA para adaptadores de estilo ‘Fuego Azul’ y ‘Origami’, en cuatro semillas. Las imágenes de LoRA exhiben colapso de distribución y diversidad reducida, mientras que FouRA genera salidas más variadas. Fuente: https://arxiv.org/pdf/2406.08798

FouRA se centra en mejorar la diversidad y la calidad de las imágenes generadas adaptando LoRA en el dominio de frecuencia, utilizando un enfoque de transformada de Fourier.

Aquí, nuevamente, LoRA-X logró resultados mejores que el enfoque basado en Fourier de FouRA.

Aunque ambos marcos caen dentro de la categoría de PEFT, tienen casos de uso y enfoques muy diferentes; en este caso, FouRA es quizás “haciendo números” para una ronda de pruebas con rivales limitados para que los autores del nuevo documento interactúen.

SVDiff

SVDiff también tiene objetivos diferentes a LoRA-X, pero se utiliza en gran medida en el nuevo documento. SVDiff está diseñado para mejorar la eficiencia del ajuste fino de los modelos de difusión, y modifica directamente los valores dentro de las matrices de pesos del modelo, manteniendo los vectores singulares sin cambios. SVDiff utiliza SVD truncado, modificando solo los valores más grandes, para ajustar los pesos del modelo.

Este enfoque utiliza una técnica de aumento de datos llamada Cut-Mix-Unmix:

La generación de múltiples sujetos opera como un sistema de aislamiento de conceptos en SVDiff. Fuente: https://arxiv.org/pdf/2303.11305

La generación de múltiples sujetos opera como un sistema de aislamiento de conceptos en SVDiff. Fuente: https://arxiv.org/pdf/2303.11305

Cut-Mix-Unmix está diseñado para ayudar al modelo de difusión a aprender múltiples conceptos distintos sin mezclarlos. La idea central es tomar imágenes de diferentes sujetos y concatenarlas en una sola imagen. Luego, el modelo se entrena con prompts que describen explícitamente los elementos separados en la imagen. Esto fuerza al modelo a reconocer y preservar conceptos distintos en lugar de fusionarlos.

Durante el entrenamiento, un término de regularización adicional ayuda a prevenir la interferencia entre sujetos. La teoría de los autores sostiene que esto facilita una mejor generación de múltiples sujetos, donde cada elemento permanece visualmente distinto, en lugar de estar fusionado.

SVDiff, excluido de la ronda de pruebas de LoRA-X, apunta a crear un espacio de parámetros compacto. LoRA-X, en cambio, se centra en la transferibilidad de parámetros de LoRA entre diferentes modelos base operando dentro del subespacio del modelo original.

Conclusión

Los métodos discutidos aquí no son los únicos habitantes de PEFT. Otros incluyen QLoRA y QA-LoRA; Prefix Tuning; Prompt-Tuning; y ajuste de adaptador, entre otros.

La búsqueda de un LoRA “actualizable” es, quizás, una búsqueda alquímica; ciertamente, no hay nada inmediatamente en el horizonte que evite que los modeladores de LoRA tengan que sacar sus conjuntos de datos antiguos nuevamente para la última y mejor versión de pesos. Si hay algún prototipo de estándar posible para la revisión de pesos, capaz de sobrevivir a los cambios en la arquitectura y los parámetros que se inflan entre las versiones del modelo, no ha surgido en la literatura aún, y tendrá que seguir siendo extraído de los datos en una base por modelo.

 

Publicado por primera vez el jueves 30 de enero de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]