Ângulo de Anderson

Em Direção a LoRAs Que Podem Sobreviver às Atualizações de Versão do Modelo

mm
Adicione Unite.AI às suas fontes preferidas no Google
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

Desde a minha cobertura recente do crescimento no número de entusiastas de LoRAs de vídeo Hunyuan (arquivos pequenos e treinados que podem injetar personalidades personalizadas em modelos de texto-para-vídeo e imagem-para-vídeo de bilhões de parâmetros), o número de LoRAs relacionadas disponíveis na comunidade Civit aumentou 185%.

Apesar de não haver maneiras fáceis ou de baixo esforço para criar uma LoRA de vídeo Hunyuan, o catálogo de LoRAs de celebridades e temas na Civit está crescendo diariamente. Fonte: https://civitai.com/

Apesar de não haver maneiras fáceis ou de baixo esforço para criar uma LoRA de vídeo Hunyuan, o catálogo de LoRAs de celebridades e temas na Civit está crescendo diariamente. Fonte: https://civitai.com/

A mesma comunidade que está se esforçando para aprender a produzir essas “personalidades adicionais” para Hunyuan Video (HV) também está ulcerando para a prometida liberação de uma funcionalidade de imagem-para-vídeo (I2V) no Hunyuan Video.

No que diz respeito à síntese de imagem humana de código aberto, isso é um grande negócio; combinado com o crescimento das LoRAs Hunyuan, pode permitir que os usuários transformem fotos de pessoas em vídeos de uma maneira que não erode sua identidade à medida que o vídeo se desenvolve – o que é atualmente o caso em todos os geradores de imagem-para-vídeo de estado da arte, incluindo Kling, Kaiber e o muito celebrado RunwayML:

Clique para reproduzir. Uma geração de imagem-para-vídeo do modelo Gen 3 Turbo da RunwayML. No entanto, assim como todos os modelos semelhantes e rivais menores, não consegue manter a identidade consistente quando o assunto se afasta da câmera, e as características distintas da imagem inicial se tornam uma “mulher de difusão genérica”. Fonte: https://app.runwayml.com/

Ao desenvolver uma LoRA personalizada para a personalidade em questão, um poderia, em um fluxo de trabalho de I2V do HV, usar uma foto real como ponto de partida. Isso é um “semente” muito melhor do que enviar um número aleatório para o espaço latente do modelo e se contentar com o cenário semântico resultante. Em seguida, um poderia usar a LoRA, ou várias LoRAs, para manter a consistência da identidade, penteados, roupas e outros aspectos fundamentais da geração.

Em potencial, a disponibilidade de tal combinação poderia representar uma das mudanças mais épicas na IA geradora desde o lançamento da Stable Diffusion, com um poder gerador formidável entregue a entusiastas de código aberto, sem a regulação (ou “gatekeeping”, se preferir) fornecida pelos censores de conteúdo nos atuais sistemas de vídeo gen.

À medida que escrevo, a imagem-para-vídeo do Hunyuan é um item não marcado no repositório GitHub do Hunyuan Video, com a comunidade de entusiastas relatando (anecdoticamente) um comentário do Discord de um desenvolvedor do Hunyuan, que aparentemente afirmou que a liberação dessa funcionalidade foi adiada para algum momento mais tarde no Q1 devido ao modelo ser “muito sem censura“.

A lista oficial de recursos para liberação do Hunyuan Video. Fonte: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

A lista oficial de recursos para liberação do Hunyuan Video. Fonte: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

Exato ou não, os desenvolvedores do repositório entregaram substancialmente no resto da lista de recursos do Hunyuan, e portanto, o I2V do Hunyuan parece estar prestes a chegar eventualmente, seja censurado, não censurado ou de alguma forma “desbloqueável”.

Mas como podemos ver na lista acima, a liberação do I2V é aparentemente um modelo separado – o que torna improvável que qualquer uma das atuais LoRAs do HV em crescimento no Civit e em outros lugares funcionem com ele.

Nesse cenário (agora) previsível, os quadros de treinamento de LoRA, como Musubi Tuner e OneTrainer, serão ou redefinidos ou redefinidos em relação ao suporte ao novo modelo. Enquanto isso, um ou dois dos luminares de IA mais tecnicamente astutos (e empreendedores) no YouTube podem resgatar suas soluções via Patreon até que a cena se recupere.

Fadiga de Atualização

Quase ninguém experimenta fadiga de atualização tanto quanto um entusiasta de LoRA ou fine-tuning, porque o ritmo rápido e competitivo de mudança na IA geradora incentiva as fundidoras de modelos, como Stability.ai, Tencent e Black Forest Labs, a produzir modelos maiores e (às vezes) melhores no máximo frequência viável.

Desde que esses novos e aprimorados modelos terão, no mínimo, diferentes vieses e pesos, e mais comumente terão uma escala e/ou arquitetura diferentes, isso significa que a comunidade de fine-tuning tem que tirar seus conjuntos de dados novamente e repetir o processo de treinamento árduo para a nova versão.

Por essa razão, uma multiplicidade de tipos de LoRA da Stable Diffusion está disponível no Civit:

A trilha de atualização, visualizada em opções de filtro de pesquisa no civit.ai

A trilha de atualização, visualizada em opções de filtro de pesquisa no civit.ai

Como nenhuma dessas LoRAs leves é interoperável com versões de modelo mais altas ou mais baixas, e como muitas delas têm dependências de mesclas e fine-tunes populares em larga escala que aderem a uma arquitetura de modelo mais antiga, uma parte significativa da comunidade tende a se ater a uma versão “legada”, da mesma forma que a lealdade do cliente ao Windows XP persistiu anos após o fim do suporte oficial.

Adaptando-se à Mudança

Esse assunto vem à mente devido a um novo artigo da Qualcomm AI Research que afirma ter desenvolvido um método pelo qual as LoRAs existentes podem ser “atualizadas” para uma nova versão de modelo.

Exemplo de conversão de LoRAs entre versões de modelo. Fonte: https://arxiv.org/pdf/2501.16559

Exemplo de conversão de LoRAs entre versões de modelo. Fonte: https://arxiv.org/pdf/2501.16559

Isso não significa que a nova abordagem, intitulada LoRA-X, possa traduzir livremente entre todos os modelos do mesmo tipo (por exemplo, modelos de texto-para-imagem ou grandes modelos de linguagem [LLMs]); mas os autores demonstraram uma transliteração eficaz de uma LoRA da Stable Diffusion v1.5 para SDXL, e uma conversão de uma LoRA para o modelo de texto TinyLlama 3T para TinyLlama 2.5T.

A LoRA-X transfere parâmetros de LoRA entre diferentes modelos de base, preservando o adaptador dentro do subespaço do modelo de origem; mas apenas em partes do modelo que são suficientemente semelhantes entre as versões do modelo.

À esquerda, um esquema para a forma como o modelo de origem da LoRA-X ajusta um adaptador, que é então ajustado para se adequar ao modelo de destino usando sua própria estrutura interna. À direita, imagens geradas pelos modelos de destino SD Eff-v1.0 e SSD-1B, após a aplicação de adaptadores transferidos da SD-v1.5 e SDXL sem treinamento adicional.

À esquerda, um esquema para a forma como o modelo de origem da LoRA-X ajusta um adaptador, que é então ajustado para se adequar ao modelo de destino. À direita, imagens geradas pelos modelos de destino SD Eff-v1.0 e SSD-1B, após a aplicação de adaptadores transferidos da SD-v1.5 e SDXL sem treinamento adicional.

Embora isso ofereça uma solução prática para cenários em que o re-treinamento é indesejável ou impossível (como uma mudança de licença nos dados de treinamento originais), o método é restrito a arquiteturas de modelo semelhantes, entre outras limitações.

Embora isso seja uma rara incursão em um campo subestudado, não examinaremos este artigo em profundidade devido às numerousas limitações da LoRA-X, como evidenciado pelos comentários de seus críticos e assessores no Open Review.

A dependência do método em semelhança de subespaço restringe sua aplicação a modelos intimamente relacionados, e os autores concederam no fórum de revisão que a LoRA-X não pode ser facilmente transferida entre arquiteturas significativamente diferentes

Outras Abordagens PEFT

A possibilidade de tornar as LoRAs mais portáteis entre versões é um pequeno, mas interessante, fio de estudo na literatura, e a principal contribuição que a LoRA-X faz para essa busca é sua afirmação de que não requer treinamento. Isso não é estritamente verdadeiro, se alguém lê o artigo, mas requer o menor treinamento de todos os métodos anteriores.

A LoRA-X é mais uma entrada no cânone de métodos de Fine-Tuning Eficiente de Parâmetro (PEFT), que abordam o desafio de adaptar grandes modelos pré-treinados a tarefas específicas sem re-treinamento extensivo. Essa abordagem conceitual visa modificar um número mínimo de parâmetros, mantendo o desempenho.

Notáveis entre esses são:

X-Adapter

O quadro de trabalho X-Adapter transfere adaptadores fine-tuned entre modelos com uma certa quantidade de re-treinamento. O sistema visa permitir que módulos pré-treinados (como ControlNet e LoRA) de um modelo de difusão de base (por exemplo, Stable Diffusion v1.5) funcionem diretamente com um modelo de difusão atualizado, como SDXL, sem re-treinamento – atuando efetivamente como um “atualizador universal” para plugins.

O sistema alcança isso treinando uma rede adicional que controla o modelo atualizado, usando uma cópia congelada do modelo de base para preservar conectores de plugin:

Esquema para X-Adapter. Fonte: https://arxiv.org/pdf/2312.02238

Esquema para X-Adapter. Fonte: https://arxiv.org/pdf/2312.02238

O X-Adapter foi originalmente desenvolvido e testado para transferir adaptadores da SD1.5 para a SDXL, enquanto a LoRA-X oferece uma variedade mais ampla de transliterações.

DoRA (Adaptação de Baixo Nível com Decomposição de Peso)

A DoRA é um método de fine-tuning aprimorado que melhora a LoRA, usando uma estratégia de decomposição de peso que se assemelha mais à fine-tuning completa:

A DoRA não tenta apenas copiar um adaptador em um ambiente congelado, como a LoRA-X, mas muda parâmetros fundamentais dos pesos, como magnitude e direção. Fonte: https://arxiv.org/pdf/2402.09353

A DoRA não tenta apenas copiar um adaptador em um ambiente congelado, como a LoRA-X, mas muda parâmetros fundamentais dos pesos, como magnitude e direção. Fonte: https://arxiv.org/pdf/2402.09353

A DoRA se concentra em melhorar o próprio processo de fine-tuning, decompondo os pesos do modelo em magnitude e direção (veja a imagem acima). Em vez disso, a LoRA-X se concentra em permitir a transferência de parâmetros fine-tuned existentes entre diferentes modelos de base

No entanto, a abordagem LoRA-X adapta as técnicas de projecção desenvolvidas para a DoRA, e em testes contra esse sistema mais antigo, afirma uma pontuação DINO aprimorada.

FouRA (Adaptação de Baixo Nível de Fourier)

Publicada em junho de 2024, o método FouRA vem, como a LoRA-X, da Qualcomm AI Research, e compartilha alguns de seus prompts de teste e temas.

Exemplos de colapso de distribuição na LoRA, do artigo de 2024 da FouRA, usando o modelo Realistic Vision 3.0 treinado com LoRA e FouRA para adaptadores de estilo “Fogo Azul” e “Origami”, em quatro sementes. As imagens da LoRA exibem colapso de distribuição e diversidade reduzida, enquanto a FouRA gera saídas mais variadas. Fonte: https://arxiv.org/pdf/2406.08798

A FouRA se concentra em melhorar a diversidade e a qualidade das imagens geradas, adaptando a LoRA no domínio da frequência, usando uma abordagem de transformada de Fourier.

Aqui, novamente, a LoRA-X foi capaz de alcançar melhores resultados do que a abordagem baseada em Fourier da FouRA.

Embora ambos os quadros de trabalho sejam da categoria PEFT, eles têm casos de uso e abordagens muito diferentes; nesse caso, a FouRA é, possivelmente, “fazendo os números” para uma rodada de teste com rivais limitados para os autores do novo artigo.

SVDiff

A SVDiff também tem objetivos diferentes da LoRA-X, mas é fortemente utilizada no novo artigo. A SVDiff é projetada para melhorar a eficiência do fine-tuning de modelos de difusão, e modifica diretamente os valores dentro das matrizes de peso do modelo, mantendo os vetores singulares inalterados. A SVDiff usa SVD truncada, modificando apenas os maiores valores, para ajustar os pesos do modelo.

Essa abordagem usa uma técnica de aumento de dados chamada Cut-Mix-Unmix:

Geração de multi-assunto opera como um sistema de isolamento de conceito na SVDiff. Fonte: https://arxiv.org/pdf/2303.11305

Geração de multi-assunto opera como um sistema de isolamento de conceito na SVDiff. Fonte: https://arxiv.org/pdf/2303.11305

O Cut-Mix-Unmix é projetado para ajudar o modelo de difusão a aprender conceitos distintos sem misturá-los. A ideia central é pegar imagens de diferentes assuntos e concatená-las em uma única imagem. Em seguida, o modelo é treinado com prompts que descrevem explicitamente os elementos separados na imagem. Isso força o modelo a reconhecer e preservar conceitos distintos em vez de misturá-los.

Durante o treinamento, um termo de regularização adicional ajuda a prevenir a interferência entre assuntos. A teoria dos autores sustenta que isso facilita a geração de multi-assunto aprimorada, onde cada elemento permanece visualmente distinto, em vez de ser fundido.

A SVDiff, excluída da rodada de teste da LoRA-X, visa criar um espaço de parâmetro compacto. A LoRA-X, em vez disso, se concentra na transferibilidade de parâmetros de LoRA entre diferentes modelos de base, operando dentro do subespaço do modelo original.

Conclusão

Os métodos discutidos aqui não são os únicos habitantes da PEFT. Outros incluem QLoRA e QA-LoRA; Prefix Tuning; Prompt-Tuning; e adapter-tuning, entre outros.

A “LoRA atualizável” é, talvez, uma busca alquímica; certamente, não há nada imediatamente no horizonte que impeça os modeladores de LoRA de ter que tirar seus conjuntos de dados antigos novamente para a última e melhor liberação de pesos. Se houver algum padrão de protótipo possível para revisão de pesos, capaz de sobreviver às mudanças de arquitetura e parâmetros inflados entre versões de modelo, isso ainda não surgiu na literatura, e precisará continuar sendo extraído dos dados em uma base por modelo.

 

Publicado pela primeira vez na quinta-feira, 30 de janeiro de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai