Modelos e plataformas de IA

Controles de Conceito: Controle Preciso em Modelos de Difusão com Adaptadores LoRA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Obrigado às suas capacidades, os modelos de difusão de texto para imagem se tornaram extremamente populares na comunidade artística. No entanto, os modelos atuais, incluindo os quadros de ponta, frequentemente lutam para manter o controle sobre os conceitos visuais e atributos nas imagens geradas, levando a saídas insatisfatórias. A maioria dos modelos depende apenas de prompts de texto, o que apresenta desafios na modulação de atributos contínuos, como a intensidade do clima, a nitidez das sombras, as expressões faciais ou a idade de uma pessoa, com precisão. Isso torna difícil para os usuários finais ajustar as imagens para atender às suas necessidades específicas. Além disso, embora esses quadros gerativos produzam imagens de alta qualidade e realistas, eles são propensos a distorções, como rostos deformados ou dedos faltantes.

Para superar essas limitações, os desenvolvedores propuseram o uso de Controles de Conceito interpretáveis. Esses controles prometem um maior controle para os usuários finais sobre os atributos visuais, melhorando a geração e edição de imagens dentro dos modelos de difusão. Os Controles de Conceito nos modelos de difusão funcionam identificando uma direção de parâmetro correspondente a um conceito individual, minimizando a interferência com outros atributos. O quadro cria esses controles usando imagens de amostra ou um conjunto de prompts, estabelecendo assim direções para conceitos textuais e visuais.

Em última análise, o uso de Controles de Conceito em modelos de difusão de texto para imagem pode resultar em geração de imagens com um mínimo de interferência e controle aprimorado sobre a saída final, aumentando a realidade percebida sem alterar o conteúdo das imagens, e gerando assim imagens realistas. Neste artigo, discutiremos o conceito de usar Controles de Conceito em quadros de texto para imagem em maior profundidade e analisaremos como seu uso pode resultar em imagens geradas por IA de qualidade superior.

Introdução aos Controles de Conceito

Como mencionado anteriormente, os quadros de difusão de texto para imagem atuais frequentemente lutam para controlar conceitos visuais e atributos nas imagens geradas, levando a resultados insatisfatórios. Além disso, muitos desses modelos encontram dificuldades em modular atributos contínuos, contribuindo ainda mais para saídas insatisfatórias. Os Controles de Conceito podem ajudar a mitigar esses problemas, capacitando criadores de conteúdo e usuários finais com controle aprimorado sobre o processo de geração de imagens e abordando desafios enfrentados pelos quadros atuais.

A maioria dos modelos de difusão de texto para imagem atuais depende da modificação direta do prompt de texto para controlar os atributos da imagem. Embora essa abordagem permita a geração de imagens, não é ideal, pois alterar o prompt pode alterar drasticamente a estrutura da imagem. Outra abordagem usada por esses quadros envolve técnicas pós-hoc, que invertem o processo de difusão e modificam as atenções cruzadas para editar conceitos visuais. No entanto, as técnicas pós-hoc têm limitações, suportando apenas um número limitado de edições simultâneas e exigindo passes de interferência individuais para cada novo conceito. Além disso, elas podem introduzir entrelaçamento conceitual se não forem projetadas com cuidado.

Em contraste, os Controles de Conceito oferecem uma solução mais eficiente para a geração de imagens. Esses adaptadores leves e fáceis de usar podem ser aplicados a modelos pré-treinados, aprimorando o controle e a precisão sobre conceitos desejados em uma única passagem de interferência com mínimo entrelaçamento. Os Controles de Conceito também permitem a edição de conceitos visuais que não são cobertos por descrições textuais, uma característica que os distingue dos métodos de edição baseados em prompts de texto. Embora os métodos de personalização baseados em imagens possam adicionar tokens para conceitos baseados em imagens, eles são difíceis de implementar para edição de imagens. Os Controles de Conceito, por outro lado, permitem que os usuários finais forneçam um pequeno número de imagens em pares que definem um conceito desejado. Os controles então generalizam esse conceito e o aplicam automaticamente a outras imagens, visando aprimorar a realidade e corrigir distorções, como aquelas encontradas nas mãos.

Os Controles de Conceito visam aprender e abordar problemas comuns a quatro conceitos de IA gerativa e quadros de difusão: Edição de Imagem, Métodos Baseados em Orientação, Edição de Modelo e Direções Semânticas.

Edição de Imagem

Os quadros de IA atuais ou se concentram em usar uma entrada condicional para guiar a estrutura da imagem, ou manipulam as atenções cruzadas da imagem de origem com seu prompt de destino para permitir a edição de imagem única em quadros de difusão de texto para imagem. Consequentemente, essas abordagens podem ser implementadas apenas em imagens individuais e também exigem otimização da base latente para cada imagem como resultado da evolução da estrutura geométrica ao longo dos passos de tempo entre prompts.

Métodos Baseados em Orientação

O uso de métodos de orientação baseados em classificadores livres indicou sua capacidade de aprimorar a qualidade das imagens geradas e aumentar a alinhamento texto-imagem. Ao incorporar termos de orientação durante a interferência, o método melhora a composicionalidade limitada herdada pelos quadros de difusão, e eles podem ser usados para orientar conceitos inseguros em quadros de difusão.

Edição de Modelo

O uso de Controles de Conceito também pode ser visto como uma técnica de edição de modelo que emprega um adaptador de baixa classificação para produzir um único atributo semântico que permite controle contínuo que se alinha com o atributo. Métodos de personalização baseados em ajuste fino são então usados para personalizar o quadro e adicionar novos conceitos. Além disso, a técnica de Difusão Personalizada propõe uma forma de ajustar as camadas de atenção cruzada para incorporar novos conceitos visuais em modelos de difusão pré-treinados. Por outro lado, a técnica de Difusão Textual propõe otimizar um vetor de incorporação para ativar as capacidades do modelo e introduzir conceitos textuais no quadro.

Direções Semânticas em GANs

A manipulação de atributos semânticos é uma das principais características das Redes Adversárias Gerativas, com as trajetórias do espaço latente encontradas alinhadas de forma auto-supervisionada. Nos quadros de difusão, essas trajetórias do espaço latente existem nas camadas intermediárias da arquitetura U-Net, e a direção principal do espaço latente nos quadros de difusão captura a semântica global. Os Controles de Conceito treinam subespaços de baixa classificação correspondentes a atributos especiais diretamente e obtêm direções de edição precisas e localizadas usando pares de texto ou imagem para otimizar direções globais.

Controles de Conceito: Arquitetura e Funcionamento

Modelos de Difusão e Adaptadores LoRA ou de Baixa Classificação

Os modelos de difusão são essencialmente uma subclasse de quadros de IA gerativa que operam no princípio de sintetizar dados revertendo um processo de difusão. O processo de difusão direto inicialmente adiciona ruído aos dados, portanto, a transição de um estado organizado para um ruído gaussiano completo. O objetivo principal dos modelos de difusão é reverter o processo de difusão, desfazendo gradualmente o ruído da imagem e amostrando um ruído gaussiano aleatório para gerar uma imagem. Em aplicações do mundo real, o objetivo principal dos quadros de difusão é prever o ruído real quando o ruído gaussiano completo é fornecido como entrada, juntamente com entradas adicionais, como condicionamento e passo de tempo.

A técnica de Adaptadores LoRA ou de Baixa Classificação descompõe as atualizações de peso durante o ajuste fino para permitir a adaptação eficiente de grandes quadros pré-treinados em tarefas downstream. A técnica LoRA descompõe as atualizações de peso para uma camada de modelo pré-treinado em relação tanto às dimensões de entrada quanto de saída e restringe a atualização a um subespaço de baixa dimensionalidade.

Controles de Conceito

O objetivo principal dos Controles de Conceito é servir como uma abordagem para ajustar os adaptadores LoRA em um quadro de difusão para facilitar um maior grau de controle sobre imagens direcionadas a conceitos, e o mesmo é demonstrado na imagem a seguir.

Quando condicionados em conceitos de destino, os Controles de Conceito aprendem direções de parâmetro de baixa classificação para aumentar ou diminuir a expressão de atributos específicos. Para um modelo e seu conceito de destino, o objetivo principal dos Controles de Conceito é obter um modelo aprimorado que modifica a probabilidade de aumentar e suprimir atributos para uma imagem quando condicionada no conceito de destino para aumentar a probabilidade de aumentar atributos e diminuir a probabilidade de suprimir atributos. Usando reparametrização e a fórmula de Tweedie, o quadro introduz um processo de ruído variável no tempo e expressa cada pontuação como uma previsão de desruído. Além disso, o objetivo de desentrelaçamento ajusta os módulos nos Controles de Conceito, mantendo os pesos pré-treinados constantes, e o fator de escala introduzido durante a formulação LoRA é modificado durante a interferência. O fator de escala também facilita ajustar as forças da edição e torna as edições mais fortes sem retreinar o quadro, como demonstrado na imagem a seguir.

Os métodos de edição usados anteriormente pelos quadros facilitavam edições mais fortes retreinando o quadro com orientação aumentada. No entanto, escalar o fator de escala durante a interferência produz os mesmos resultados de edição sem aumentar o custo de retreinamento e tempo.

Aprendizado de Conceitos Visuais

Os Controles de Conceito são projetados para controlar conceitos visuais que os prompts de texto não conseguem definir bem, e esses controles aproveitam conjuntos de dados pequenos que são emparelhados antes ou depois para treinar esses conceitos. O contraste entre os pares de imagens permite que os controles aprendam os conceitos visuais. Além disso, o processo de treinamento dos Controles de Conceito otimiza o componente LoRA implementado em ambas as direções, para a frente e para trás. Como resultado, o componente LoRA se alinha com a direção que causa os efeitos visuais em ambas as direções.

Controles de Conceito: Resultados de Implementação

Para analisar o ganho de desempenho, os desenvolvedores avaliaram o uso de Controles de Conceito principalmente no Stable Diffusion XL, um quadro de alta resolução de 1024 pixels com experimentos adicionais realizados no Stable Diffusion v1.4, com os modelos sendo treinados por 500 épocas cada.

Controles de Conceito Textuais

Para avaliar o desempenho dos Controles de Conceito textuais, foi validado em um conjunto de 30 conceitos baseados em texto, e o método foi comparado com duas linhas de base que usam um prompt de texto padrão por um número fixo de passos de tempo e, em seguida, começa a composição adicionando prompts para direcionar a imagem. Como pode ser visto na figura a seguir, o uso de Controles de Conceito resulta em uma pontuação CLIP constantemente mais alta e uma redução constante na pontuação LPIPS em comparação com o quadro original sem Controles de Conceito.

Como pode ser visto na imagem acima, o uso de Controles de Conceito facilita a edição precisa dos atributos desejados durante o processo de geração de imagens, mantendo a estrutura geral da imagem.

Controles de Conceito Visuais

Os modelos de difusão de texto para imagem que usam apenas prompts de texto frequentemente encontram dificuldades em manter um alto grau de controle sobre atributos visuais, como cabelo facial ou formato de olhos. Para garantir um melhor controle sobre atributos granulares, os Controles de Conceito aproveitam orientação de texto opcional emparelhada com conjuntos de dados de imagens. Como pode ser visto na figura abaixo, os Controles de Conceito criam controles individuais para “tamanho do olho” e “forma da sobrancelha” que capturam as transformações desejadas usando os pares de imagens.

Os resultados podem ser refinados ainda mais fornecendo textos específicos para que a direção se concentre naquela região facial e crie controles com controle passo a passo sobre o atributo visado.

Composição de Controles

Uma das principais vantagens do uso de Controles de Conceito é sua composabilidade, que permite que os usuários combinem vários controles para um controle aprimorado, em vez de se concentrar em um conceito de cada vez, o que pode ser atribuído às direções de classificação baixa usadas nos Controles de Conceito. Além disso, como os Controles de Conceito são adaptadores LoRA leves, eles são fáceis de compartilhar e podem ser facilmente sobrepostos em modelos de difusão. Os usuários também podem ajustar várias alavancas simultaneamente para direcionar gerações complexas, baixando conjuntos de controles interessantes.

A imagem a seguir demonstra as capacidades de composição dos controles de conceito, e vários controles são compostos progressivamente em cada linha da esquerda para a direita, permitindo assim a navegação de espaços de conceito de alta dimensionalidade com um controle aprimorado sobre os conceitos.

Melhorando a Qualidade da Imagem

Embora os quadros de difusão de texto para imagem de ponta e os grandes modelos gerativos, como o modelo Stable Diffusion XL, sejam capazes de gerar imagens realistas e de alta qualidade, eles frequentemente sofrem de distorções de imagem, como objetos borrosos ou deformados, mesmo que os parâmetros desses quadros de ponta sejam equipados com a capacidade latente de gerar saídas de alta qualidade com menos gerações. O uso de Controles de Conceito pode resultar em imagens geradas com menos distorções, desbloqueando as capacidades reais desses modelos, identificando direções de parâmetro de baixa classificação.

Corrigindo Mãos

Gerar imagens com mãos realistas sempre foi um desafio para os quadros de difusão, e o uso de Controles de Conceito tem o controle direto sobre a tendência de distorcer as mãos. A imagem a seguir demonstra o efeito do uso dos Controles de Conceito “corrigir mãos” que permite ao quadro gerar imagens com mãos mais realistas.

Controles de Reparo

O uso de Controles de Conceito não apenas resulta em gerar mãos mais realistas, mas também mostrou seu potencial em melhorar a realidade geral das imagens geradas pelo quadro. Os Controles de Conceito identificam uma direção de parâmetro de baixa classificação que permite a mudança nas imagens de problemas de distorção comuns, e os resultados são demonstrados na imagem a seguir.

Pensamentos Finais

Neste artigo, discutimos os Controles de Conceito, um novo paradigma simples, mas escalável, que permite controle interpretável sobre a saída gerada nos modelos de difusão. O uso de Controles de Conceito visa resolver os problemas enfrentados pelos quadros de difusão de texto para imagem atuais que encontram dificuldades em manter o controle necessário sobre conceitos visuais e atributos incluídos na imagem gerada, o que frequentemente leva a saídas insatisfatórias. Além disso, a maioria dos modelos de difusão de texto para imagem encontra dificuldades em modular atributos contínuos em uma imagem, o que frequentemente leva a saídas insatisfatórias. O uso de Controles de Conceito pode permitir que os quadros de difusão de texto para imagem mitiguem esses problemas, capacitando criadores de conteúdo e usuários finais com um controle aprimorado sobre o processo de geração de imagens e resolvendo problemas enfrentados pelos quadros atuais.

Kunal Kejriwal é engenheiro de backend especializado em Python, PostgreSQL, Redis e infraestrutura de nuvem na GCP e AWS. Com três anos de experiência construindo e dimensionando sistemas de produção, ele escreve sobre infraestrutura de IA, sistemas distribuídos e a arquitetura por trás da implantação de cargas de trabalho de aprendizado de máquina.