Ángulo de Anderson

La lucha por la personalización de cero disparos en la inteligencia artificial generativa

mm
Añade Unite.AI a tus fuentes preferidas en Google
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

Si deseas colocarte en una herramienta de generación de imágenes o videos populares, pero no eres lo suficientemente famoso para que el modelo base te reconozca, necesitarás entrenar un modelo de adaptación de rango bajo (LoRA) utilizando una colección de tus propias fotos. Una vez creado, este modelo LoRA personalizado permite que el modelo generativo incluya tu identidad en los resultados futuros.

Esto se conoce comúnmente como personalización en el sector de investigación de síntesis de imágenes y videos. Surgió por primera vez unos meses después del surgimiento de Stable Diffusion en el verano de 2022, con el proyecto DreamBooth de Google Research, que ofreció modelos de personalización de alta capacidad, en un esquema de código cerrado que pronto fue adaptado por entusiastas y lanzado a la comunidad.

Los modelos LoRA siguieron rápidamente y ofrecieron un entrenamiento más fácil y tamaños de archivo mucho más ligeros, con un costo mínimo o nulo en la calidad, dominando rápidamente la escena de personalización para Stable Diffusion y sus sucesores, como los modelos más recientes como Flux, y ahora los nuevos modelos de video generativos como Hunyuan Video y Wan 2.1.

Lavar y repetir

El problema es que, como hemos señalado antes, cada vez que sale un nuevo modelo, se necesita una nueva generación de LoRAs para entrenar, lo que representa una fricción considerable para los productores de LoRAs, que pueden entrenar una serie de modelos personalizados solo para descubrir que una actualización del modelo o un modelo más popular significa que deben empezar de nuevo.

Por lo tanto, los enfoques de personalización de cero disparos se han convertido en una corriente fuerte en la literatura recientemente. En este escenario, en lugar de necesitar curar un conjunto de datos y entrenar su propio submodelo, simplemente proporciona una o más fotos del sujeto que se va a inyectar en la generación, y el sistema interpreta estas fuentes de entrada en una salida combinada.

A continuación, vemos que, además de la sustitución de caras, un sistema de este tipo (aquí utilizando PuLID) también puede incorporar valores de ID en la transferencia de estilo:

Ejemplos de transferencia de ID facial utilizando el sistema PuLID. Fuente: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Ejemplos de transferencia de ID facial utilizando el sistema PuLID. Fuente: https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

Mientras que reemplazar un sistema laborioso y frágil como LoRA con un adaptador genérico es una idea grande (y popular), también es desafiante; el detalle extremo y la cobertura obtenidos en el proceso de entrenamiento de LoRA son muy difíciles de imitar en un modelo de tipo IP-Adapter, que debe igualar el nivel de detalle y flexibilidad de LoRA sin la ventaja previa de analizar un conjunto integral de imágenes de identidad.

HyperLoRA

Con esto en mente, hay un papel interesante nuevo de ByteDance que propone un sistema que genera código LoRA real al vuelo, que es único entre las soluciones de cero disparos:

A la izquierda, imágenes de entrada. A la derecha, una gama flexible de salida basada en las imágenes de entrada, produciendo efectivamente deepfakes de los actores Anthony Hopkins y Anne Hathaway. Fuente: https://arxiv.org/pdf/2503.16944

A la izquierda, imágenes de entrada. A la derecha, una gama flexible de salida basada en las imágenes de entrada, produciendo efectivamente deepfakes de los actores Anthony Hopkins y Anne Hathaway. Fuente: https://arxiv.org/pdf/2503.16944

El papel establece:

‘Las técnicas basadas en adaptadores, como IP-Adapter, congelan los parámetros del modelo base y emplean una arquitectura de plug-in para permitir la inferencia de cero disparos, pero a menudo exhiben una falta de naturalidad y autenticidad, que no deben ser pasadas por alto en tareas de síntesis de retratos.

‘[Nosotros] presentamos un método de generación adaptativa de parámetros eficientes, llamado HyperLoRA, que utiliza una red de plug-in adaptativa para generar pesos LoRA, combinando el rendimiento superior de LoRA con la capacidad de cero disparos del esquema de adaptador.

‘A través de nuestra estructura de red y estrategia de entrenamiento cuidadosamente diseñadas, logramos la generación personalizada de retratos de cero disparos (que admite tanto entradas de imagen única como múltiple) con alta fotorealismo, fidelidad y editabilidad.’

Lo más útil, el sistema entrenado puede ser utilizado con el existente ControlNet, permitiendo un alto nivel de especificidad en la generación:

Timothy Chalomet hace una aparición inesperadamente alegre en 'The Shining' (1980), basada en tres fotos de entrada en HyperLoRA.

Timothy Chalomet hace una aparición inesperadamente alegre en ‘The Shining’ (1980), basada en tres fotos de entrada en HyperLoRA, con una máscara ControlNet que define la salida (en concierto con un texto de prompt).

En cuanto a si el nuevo sistema será puesto a disposición de los usuarios finales, ByteDance tiene un récord razonable en este sentido, habiendo lanzado el poderoso marco de sincronización de labios LatentSync y habiendo lanzado recientemente el marco InfiniteYou.

Negativamente, el papel no da ninguna indicación de intención de lanzarlo, y los recursos de entrenamiento necesarios para recrear el trabajo son tan exorbitantes que sería un desafío para la comunidad de entusiastas recrearlo (como lo hizo con DreamBooth).

El nuevo papel se titula HyperLoRA: Generación adaptativa de parámetros eficientes para síntesis de retratos, y proviene de siete investigadores de ByteDance y su departamento de Creación Inteligente.

Método

El nuevo método utiliza el modelo de difusión latente de Stable Diffusion (LDM) SDXL como modelo base, aunque los principios parecen aplicables a modelos de difusión en general (aunque las demandas de entrenamiento – ver a continuación – podrían hacer que sea difícil aplicarlos a modelos de video generativos).

El proceso de entrenamiento para HyperLoRA se divide en tres etapas, cada una diseñada para aislar y preservar información específica en los pesos aprendidos. El objetivo de este procedimiento acotado es evitar que los rasgos relevantes para la identidad sean contaminados por elementos irrelevantes como ropa o fondo, al mismo tiempo que se logra una convergencia rápida y estable.

Esquema conceptual para HyperLoRA. El modelo se divide en 'Hyper ID-LoRA' para rasgos de identidad y 'Hyper Base-LoRA' para fondo y ropa. Esta separación reduce la fuga de rasgos. Durante el entrenamiento, la base SDXL y los codificadores se congelan, y solo se actualizan los módulos HyperLoRA. En la inferencia, solo se requiere ID-LoRA para generar imágenes personalizadas.

Esquema conceptual para HyperLoRA. El modelo se divide en ‘Hyper ID-LoRA’ para rasgos de identidad y ‘Hyper Base-LoRA’ para fondo y ropa. Esta separación reduce la fuga de rasgos. Durante el entrenamiento, la base SDXL y los codificadores se congelan, y solo se actualizan los módulos HyperLoRA. En la inferencia, solo se requiere ID-LoRA para generar imágenes personalizadas.

La primera etapa se centra exclusivamente en aprender un ‘Base-LoRA’ (abajo a la izquierda en la imagen del esquema anterior), que captura detalles irrelevantes para la identidad.

Para hacer cumplir esta separación, los investigadores deliberadamente desenfocaron la cara en las imágenes de entrenamiento, lo que permitió al modelo centrarse en cosas como el fondo, la iluminación y la pose, pero no en la identidad. Esta etapa de “calentamiento” actúa como un filtro, eliminando distracciones de bajo nivel antes de que comience el aprendizaje específico de la identidad.

En la segunda etapa, se introduce un ‘ID-LoRA’ (arriba a la izquierda en la imagen del esquema anterior). Aquí, la identidad facial se codifica utilizando dos vías paralelas: un CLIP Vision Transformer (CLIP ViT) para rasgos estructurales y el codificador InsightFace AntelopeV2 para representaciones de identidad más abstractas.

Enfoque transitorio

Las características de CLIP ayudan al modelo a converger rápidamente, pero corren el riesgo de sobreajuste, mientras que las incrustaciones de Antelope son más estables pero más lentas en el entrenamiento. Por lo tanto, el sistema comienza confiando más en CLIP y gradualmente incorpora Antelope, para evitar la inestabilidad.

En la etapa final, las capas de atención guiadas por CLIP se congelan por completo. Solo los módulos de atención vinculados a AntelopeV2 continúan entrenándose, lo que permite al modelo refinar la preservación de la identidad sin degradar la fidelidad o la generalidad de los componentes aprendidos previamente.

Esta estructura en fases es esencialmente un intento de desentrelazamiento. Los rasgos de identidad y no identidad se separan primero y luego se refinan de forma independiente. Es una respuesta metódica a los modos de falla habituales de la personalización: deriva de identidad, baja editabilidad y sobreajuste a rasgos incidentales.

Mientras que pesas

Después de que CLIP ViT y AntelopeV2 extraen tanto rasgos estructurales como rasgos específicos de la identidad de un retrato determinado, los rasgos obtenidos se pasan a través de un muestreador de perceptor (derivado del proyecto IP-Adapter mencionado anteriormente) – un módulo basado en transformador que asigna los rasgos a un conjunto compacto de coeficientes.

Dos muestreadores separados se utilizan: uno para generar pesos Base-LoRA (que codifican elementos de fondo y no identidad) y otro para pesos ID-LoRA (que se centran en la identidad facial).

Esquema para la estructura de la red HyperLoRA.

Esquema para la estructura de la red HyperLoRA.

Los coeficientes de salida se combinan linealmente con un conjunto de matrices base LoRA aprendidas, produciendo pesos LoRA completos sin necesidad de ajuste fino del modelo base.

Este enfoque permite que el sistema genere pesos personalizados enteramente al vuelo, utilizando solo codificadores de imágenes y proyección ligera, mientras aún aprovecha la capacidad de LoRA para modificar el comportamiento del modelo base directamente.

Datos y pruebas

Para entrenar HyperLoRA, los investigadores utilizaron un subconjunto de 4,4 millones de imágenes de caras del conjunto de datos LAION-2B (ahora mejor conocido como la fuente de datos para los modelos de Stable Diffusion originales de 2022).

Se utilizó InsightFace para filtrar caras no retrato y múltiples imágenes. Las imágenes se anotaron con el sistema de subtítulos BLIP-2.

En cuanto a la ampliación de datos, las imágenes se recortaron aleatoriamente alrededor de la cara, pero siempre se centraron en la región de la cara.

Los rangos LoRA respectivos tuvieron que adaptarse a la memoria disponible en la configuración de entrenamiento. Por lo tanto, el rango LoRA para ID-LoRA se estableció en 8 y el rango para Base-LoRA en 4, mientras que se utilizó una acumulación de gradiente de ocho pasos para simular un tamaño de lote más grande de lo que realmente era posible en el hardware.

Los investigadores entrenaron los módulos Base-LoRA, ID-LoRA (CLIP) e ID-LoRA (incrustación de identidad) secuencialmente durante 20K, 15K y 55K iteraciones, respectivamente. Durante el entrenamiento de ID-LoRA, se muestrearon de tres escenarios de acondicionamiento con probabilidades de 0,9, 0,05 y 0,05.

El sistema se implementó utilizando PyTorch y Diffusers, y el proceso de entrenamiento completo se ejecutó durante aproximadamente diez días en 16 GPU NVIDIA A100*.

Pruebas ComfyUI

Los autores construyeron flujos de trabajo en la plataforma de síntesis ComfyUI para comparar HyperLoRA con tres métodos rivales: InstantID; el mencionado anteriormente IP-Adapter, en la forma del marco IP-Adapter-FaceID-Portrait; y el citado anteriormente PuLID. Se utilizaron semillas consistentes, prompts y métodos de muestreo en todos los marcos.

Los autores señalan que los métodos basados en adaptadores (en lugar de LoRA) generalmente requieren escalas de orientación de clasificador más bajas (CFG), mientras que LoRA (incluido HyperLoRA) es más permissivo en este respecto.

Así, para una comparación justa, los investigadores utilizaron la variante de punto de referencia de SDXL ajustada LEOSAM’s Hello World en todas las pruebas. Para pruebas cuantitativas, se utilizó el conjunto de datos de imágenes Unsplash-50.

Métricas

Para una referencia de fidelidad, los autores midieron la similitud facial utilizando distancias cosenos entre incrustaciones de imágenes CLIP (CLIP-I) y incrustaciones de identidad separadas (Sim ID) extraídas a través de CurricularFace, un modelo no utilizado durante el entrenamiento.

Cada método generó cuatro retratos de alta resolución por identidad en el conjunto de prueba, con resultados promediados.

La editabilidad se evaluó tanto en la comparación de las puntuaciones CLIP-I entre salidas con y sin los módulos de identidad (para ver cuánto alteraban las restricciones de identidad la imagen); y midiendo la alineación de imagen-texto CLIP (CLIP-T) en diez variaciones de prompt que cubrían estilos de cabello, accesorios, ropa y fondos.

Los autores incluyeron el modelo base Arc2Face en las comparaciones – un modelo base entrenado en subtítulos fijos y regiones faciales recortadas.

Para HyperLoRA, se probaron dos variantes: una que utilizaba solo el módulo ID-LoRA y otra que utilizaba tanto ID-LoRA como Base-LoRA, con este último ponderado en 0,4. Mientras que Base-LoRA mejoró la fidelidad, ligeramente limitó la editabilidad.

Resultados de la comparación cuantitativa inicial.

Resultados de la comparación cuantitativa inicial.

De las pruebas cuantitativas, los autores comentan:

‘Base-LoRA ayuda a mejorar la fidelidad pero limita la editabilidad. Aunque nuestro diseño desacopla las características de la imagen en diferentes LoRAs, es difícil evitar la fuga mutua. Por lo tanto, podemos ajustar el peso de Base-LoRA para adaptarnos a diferentes escenarios de aplicación.

‘Nuestro HyperLoRA (Completo e ID) logra la mejor y segunda mejor fidelidad facial, mientras que InstantID muestra superioridad en la similitud de ID facial pero menor fidelidad facial.

‘Ambas métricas deben considerarse juntas para evaluar la fidelidad, ya que la similitud de ID facial es más abstracta y la fidelidad facial refleja más detalles.’

En pruebas cualitativas, los diversos compromisos involucrados en la proposición esencial salen a la luz (tenga en cuenta que no tenemos espacio para reproducir todas las imágenes de los resultados cualitativos y nos referimos al lector al papel fuente para más imágenes a mejor resolución):

Comparación cualitativa. De arriba a abajo, los prompts utilizados fueron: camisa blanca y orejas de lobo (ver el papel para ejemplos adicionales).

Comparación cualitativa. De arriba a abajo, los prompts utilizados fueron: ‘camisa blanca’ y ‘orejas de lobo’ (ver el papel para ejemplos adicionales).

Aquí los autores comentan:

‘La piel de los retratos generados por IP-Adapter y InstantID tiene una textura aparentemente generada por IA, que es un poco [sobre saturada] y lejos de la fotorealismo.

‘Es un defecto común de los métodos basados en adaptadores. PuLID mejora este problema debilitando la intrusión en el modelo base, superando a IP-Adapter e InstantID, pero aún sufriendo de desenfoque y falta de detalles.

‘En contraste, LoRA modifica directamente los pesos del modelo base en lugar de introducir módulos de atención extra, generalmente generando imágenes muy detalladas y fotorealistas.’

Los autores sostienen que porque HyperLoRA modifica los pesos del modelo base directamente en lugar de confiar en módulos de atención externos, retiene la capacidad no lineal de los métodos tradicionales basados en LoRA, lo que potencialmente ofrece una ventaja en fidelidad y permite una mejor captura de detalles sutiles como el color de las pupilas.

En comparaciones cualitativas, el papel afirma que los diseños de HyperLoRA eran más coherentes y mejor alineados con los prompts, y similares a los producidos por PuLID, mientras que notablemente más fuertes que InstantID o IP-Adapter (que ocasionalmente fallaban en seguir los prompts o producían composiciones no naturales).

Más ejemplos de generaciones de ControlNet con HyperLoRA.

Más ejemplos de generaciones de ControlNet con HyperLoRA.

Conclusión

La corriente constante de varios sistemas de personalización de cero disparos en los últimos 18 meses ha adquirido, por ahora, una calidad de desesperación. Muy pocas de las ofertas han hecho un avance notable en el estado del arte; y aquellas que han avanzado un poco tienden a tener demandas de entrenamiento exorbitantes y/o demandas de inferencia extremadamente complejas o intensivas en recursos.

Mientras que el propio régimen de entrenamiento de HyperLoRA es tan agotador como muchas entradas recientes similares, al menos se termina con un modelo que puede manejar la personalización ad hoc fuera de la caja.

Del material suplementario del papel, observamos que la velocidad de inferencia de HyperLoRA es mejor que la de IP-Adapter, pero peor que las dos otras metodologías anteriores – y que estas cifras se basan en una GPU NVIDIA V100, que no es hardware de consumo típico (aunque las GPU NVIDIA más nuevas pueden igualar o superar el máximo de 32 GB de VRAM de la V100).

Las velocidades de inferencia de los métodos rivales, en milisegundos.

Las velocidades de inferencia de los métodos rivales, en milisegundos.

Es justo decir que la personalización de cero disparos sigue siendo un problema sin resolver desde un punto de vista práctico, ya que las demandas de hardware significativas de HyperLoRA están en desacuerdo con su capacidad para producir un modelo base de largo plazo verdaderamente único.

 

* Representando ya sea 640 GB o 1280 GB de VRAM, dependiendo del modelo utilizado (esto no se especifica)

Publicado por primera vez el lunes 24 de marzo de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai