Modelos e plataformas de IA

Controles de Conceito: Controle Preciso em Modelos de DifusÃĢo com Adaptadores LoRA

mm
Adicione Unite.AI às suas fontes preferidas no Google

Obrigado às suas capacidades, os modelos de difusÃĢo de texto para imagem se tornaram extremamente populares na comunidade artística. No entanto, os modelos atuais, incluindo os quadros de ponta, frequentemente lutam para manter o controle sobre os conceitos visuais e atributos nas imagens geradas, levando a saídas insatisfatÃģrias. A maioria dos modelos depende apenas de prompts de texto, o que apresenta desafios na modulaçÃĢo de atributos contínuos, como a intensidade do clima, a nitidez das sombras, as expressÃĩes faciais ou a idade de uma pessoa, com precisÃĢo. Isso torna difícil para os usuÃĄrios finais ajustar as imagens para atender às suas necessidades específicas. AlÃĐm disso, embora esses quadros gerativos produzam imagens de alta qualidade e realistas, eles sÃĢo propensos a distorçÃĩes, como rostos deformados ou dedos faltantes.

Para superar essas limitaçÃĩes, os desenvolvedores propuseram o uso de Controles de Conceito interpretÃĄveis. Esses controles prometem um maior controle para os usuÃĄrios finais sobre os atributos visuais, melhorando a geraçÃĢo e ediçÃĢo de imagens dentro dos modelos de difusÃĢo. Os Controles de Conceito nos modelos de difusÃĢo funcionam identificando uma direçÃĢo de parÃĒmetro correspondente a um conceito individual, minimizando a interferÊncia com outros atributos. O quadro cria esses controles usando imagens de amostra ou um conjunto de prompts, estabelecendo assim direçÃĩes para conceitos textuais e visuais.

Em Última anÃĄlise, o uso de Controles de Conceito em modelos de difusÃĢo de texto para imagem pode resultar em geraçÃĢo de imagens com um mínimo de interferÊncia e controle aprimorado sobre a saída final, aumentando a realidade percebida sem alterar o conteÚdo das imagens, e gerando assim imagens realistas. Neste artigo, discutiremos o conceito de usar Controles de Conceito em quadros de texto para imagem em maior profundidade e analisaremos como seu uso pode resultar em imagens geradas por IA de qualidade superior.

IntroduçÃĢo aos Controles de Conceito

Como mencionado anteriormente, os quadros de difusÃĢo de texto para imagem atuais frequentemente lutam para controlar conceitos visuais e atributos nas imagens geradas, levando a resultados insatisfatÃģrios. AlÃĐm disso, muitos desses modelos encontram dificuldades em modular atributos contínuos, contribuindo ainda mais para saídas insatisfatÃģrias. Os Controles de Conceito podem ajudar a mitigar esses problemas, capacitando criadores de conteÚdo e usuÃĄrios finais com controle aprimorado sobre o processo de geraçÃĢo de imagens e abordando desafios enfrentados pelos quadros atuais.

A maioria dos modelos de difusÃĢo de texto para imagem atuais depende da modificaçÃĢo direta do prompt de texto para controlar os atributos da imagem. Embora essa abordagem permita a geraçÃĢo de imagens, nÃĢo ÃĐ ideal, pois alterar o prompt pode alterar drasticamente a estrutura da imagem. Outra abordagem usada por esses quadros envolve tÃĐcnicas pÃģs-hoc, que invertem o processo de difusÃĢo e modificam as atençÃĩes cruzadas para editar conceitos visuais. No entanto, as tÃĐcnicas pÃģs-hoc tÊm limitaçÃĩes, suportando apenas um nÚmero limitado de ediçÃĩes simultÃĒneas e exigindo passes de interferÊncia individuais para cada novo conceito. AlÃĐm disso, elas podem introduzir entrelaçamento conceitual se nÃĢo forem projetadas com cuidado.

Em contraste, os Controles de Conceito oferecem uma soluçÃĢo mais eficiente para a geraçÃĢo de imagens. Esses adaptadores leves e fÃĄceis de usar podem ser aplicados a modelos prÃĐ-treinados, aprimorando o controle e a precisÃĢo sobre conceitos desejados em uma Única passagem de interferÊncia com mínimo entrelaçamento. Os Controles de Conceito tambÃĐm permitem a ediçÃĢo de conceitos visuais que nÃĢo sÃĢo cobertos por descriçÃĩes textuais, uma característica que os distingue dos mÃĐtodos de ediçÃĢo baseados em prompts de texto. Embora os mÃĐtodos de personalizaçÃĢo baseados em imagens possam adicionar tokens para conceitos baseados em imagens, eles sÃĢo difíceis de implementar para ediçÃĢo de imagens. Os Controles de Conceito, por outro lado, permitem que os usuÃĄrios finais forneçam um pequeno nÚmero de imagens em pares que definem um conceito desejado. Os controles entÃĢo generalizam esse conceito e o aplicam automaticamente a outras imagens, visando aprimorar a realidade e corrigir distorçÃĩes, como aquelas encontradas nas mÃĢos.

Os Controles de Conceito visam aprender e abordar problemas comuns a quatro conceitos de IA gerativa e quadros de difusÃĢo: EdiçÃĢo de Imagem, MÃĐtodos Baseados em OrientaçÃĢo, EdiçÃĢo de Modelo e DireçÃĩes SemÃĒnticas.

EdiçÃĢo de Imagem

Os quadros de IA atuais ou se concentram em usar uma entrada condicional para guiar a estrutura da imagem, ou manipulam as atençÃĩes cruzadas da imagem de origem com seu prompt de destino para permitir a ediçÃĢo de imagem Única em quadros de difusÃĢo de texto para imagem. Consequentemente, essas abordagens podem ser implementadas apenas em imagens individuais e tambÃĐm exigem otimizaçÃĢo da base latente para cada imagem como resultado da evoluçÃĢo da estrutura geomÃĐtrica ao longo dos passos de tempo entre prompts.

MÃĐtodos Baseados em OrientaçÃĢo

O uso de mÃĐtodos de orientaçÃĢo baseados em classificadores livres indicou sua capacidade de aprimorar a qualidade das imagens geradas e aumentar a alinhamento texto-imagem. Ao incorporar termos de orientaçÃĢo durante a interferÊncia, o mÃĐtodo melhora a composicionalidade limitada herdada pelos quadros de difusÃĢo, e eles podem ser usados para orientar conceitos inseguros em quadros de difusÃĢo.

EdiçÃĢo de Modelo

O uso de Controles de Conceito tambÃĐm pode ser visto como uma tÃĐcnica de ediçÃĢo de modelo que emprega um adaptador de baixa classificaçÃĢo para produzir um Único atributo semÃĒntico que permite controle contínuo que se alinha com o atributo. MÃĐtodos de personalizaçÃĢo baseados em ajuste fino sÃĢo entÃĢo usados para personalizar o quadro e adicionar novos conceitos. AlÃĐm disso, a tÃĐcnica de DifusÃĢo Personalizada propÃĩe uma forma de ajustar as camadas de atençÃĢo cruzada para incorporar novos conceitos visuais em modelos de difusÃĢo prÃĐ-treinados. Por outro lado, a tÃĐcnica de DifusÃĢo Textual propÃĩe otimizar um vetor de incorporaçÃĢo para ativar as capacidades do modelo e introduzir conceitos textuais no quadro.

DireçÃĩes SemÃĒnticas em GANs

A manipulaçÃĢo de atributos semÃĒnticos ÃĐ uma das principais características das Redes AdversÃĄrias Gerativas, com as trajetÃģrias do espaço latente encontradas alinhadas de forma auto-supervisionada. Nos quadros de difusÃĢo, essas trajetÃģrias do espaço latente existem nas camadas intermediÃĄrias da arquitetura U-Net, e a direçÃĢo principal do espaço latente nos quadros de difusÃĢo captura a semÃĒntica global. Os Controles de Conceito treinam subespaços de baixa classificaçÃĢo correspondentes a atributos especiais diretamente e obtÊm direçÃĩes de ediçÃĢo precisas e localizadas usando pares de texto ou imagem para otimizar direçÃĩes globais.

Controles de Conceito: Arquitetura e Funcionamento

Modelos de DifusÃĢo e Adaptadores LoRA ou de Baixa ClassificaçÃĢo

Os modelos de difusÃĢo sÃĢo essencialmente uma subclasse de quadros de IA gerativa que operam no princípio de sintetizar dados revertendo um processo de difusÃĢo. O processo de difusÃĢo direto inicialmente adiciona ruído aos dados, portanto, a transiçÃĢo de um estado organizado para um ruído gaussiano completo. O objetivo principal dos modelos de difusÃĢo ÃĐ reverter o processo de difusÃĢo, desfazendo gradualmente o ruído da imagem e amostrando um ruído gaussiano aleatÃģrio para gerar uma imagem. Em aplicaçÃĩes do mundo real, o objetivo principal dos quadros de difusÃĢo ÃĐ prever o ruído real quando o ruído gaussiano completo ÃĐ fornecido como entrada, juntamente com entradas adicionais, como condicionamento e passo de tempo.

A tÃĐcnica de Adaptadores LoRA ou de Baixa ClassificaçÃĢo descompÃĩe as atualizaçÃĩes de peso durante o ajuste fino para permitir a adaptaçÃĢo eficiente de grandes quadros prÃĐ-treinados em tarefas downstream. A tÃĐcnica LoRA descompÃĩe as atualizaçÃĩes de peso para uma camada de modelo prÃĐ-treinado em relaçÃĢo tanto às dimensÃĩes de entrada quanto de saída e restringe a atualizaçÃĢo a um subespaço de baixa dimensionalidade.

Controles de Conceito

O objetivo principal dos Controles de Conceito ÃĐ servir como uma abordagem para ajustar os adaptadores LoRA em um quadro de difusÃĢo para facilitar um maior grau de controle sobre imagens direcionadas a conceitos, e o mesmo ÃĐ demonstrado na imagem a seguir.

Quando condicionados em conceitos de destino, os Controles de Conceito aprendem direçÃĩes de parÃĒmetro de baixa classificaçÃĢo para aumentar ou diminuir a expressÃĢo de atributos específicos. Para um modelo e seu conceito de destino, o objetivo principal dos Controles de Conceito ÃĐ obter um modelo aprimorado que modifica a probabilidade de aumentar e suprimir atributos para uma imagem quando condicionada no conceito de destino para aumentar a probabilidade de aumentar atributos e diminuir a probabilidade de suprimir atributos. Usando reparametrizaçÃĢo e a fÃģrmula de Tweedie, o quadro introduz um processo de ruído variÃĄvel no tempo e expressa cada pontuaçÃĢo como uma previsÃĢo de desruído. AlÃĐm disso, o objetivo de desentrelaçamento ajusta os mÃģdulos nos Controles de Conceito, mantendo os pesos prÃĐ-treinados constantes, e o fator de escala introduzido durante a formulaçÃĢo LoRA ÃĐ modificado durante a interferÊncia. O fator de escala tambÃĐm facilita ajustar as forças da ediçÃĢo e torna as ediçÃĩes mais fortes sem retreinar o quadro, como demonstrado na imagem a seguir.

Os mÃĐtodos de ediçÃĢo usados anteriormente pelos quadros facilitavam ediçÃĩes mais fortes retreinando o quadro com orientaçÃĢo aumentada. No entanto, escalar o fator de escala durante a interferÊncia produz os mesmos resultados de ediçÃĢo sem aumentar o custo de retreinamento e tempo.

Aprendizado de Conceitos Visuais

Os Controles de Conceito sÃĢo projetados para controlar conceitos visuais que os prompts de texto nÃĢo conseguem definir bem, e esses controles aproveitam conjuntos de dados pequenos que sÃĢo emparelhados antes ou depois para treinar esses conceitos. O contraste entre os pares de imagens permite que os controles aprendam os conceitos visuais. AlÃĐm disso, o processo de treinamento dos Controles de Conceito otimiza o componente LoRA implementado em ambas as direçÃĩes, para a frente e para trÃĄs. Como resultado, o componente LoRA se alinha com a direçÃĢo que causa os efeitos visuais em ambas as direçÃĩes.

Controles de Conceito: Resultados de ImplementaçÃĢo

Para analisar o ganho de desempenho, os desenvolvedores avaliaram o uso de Controles de Conceito principalmente no Stable Diffusion XL, um quadro de alta resoluçÃĢo de 1024 pixels com experimentos adicionais realizados no Stable Diffusion v1.4, com os modelos sendo treinados por 500 ÃĐpocas cada.

Controles de Conceito Textuais

Para avaliar o desempenho dos Controles de Conceito textuais, foi validado em um conjunto de 30 conceitos baseados em texto, e o mÃĐtodo foi comparado com duas linhas de base que usam um prompt de texto padrÃĢo por um nÚmero fixo de passos de tempo e, em seguida, começa a composiçÃĢo adicionando prompts para direcionar a imagem. Como pode ser visto na figura a seguir, o uso de Controles de Conceito resulta em uma pontuaçÃĢo CLIP constantemente mais alta e uma reduçÃĢo constante na pontuaçÃĢo LPIPS em comparaçÃĢo com o quadro original sem Controles de Conceito.

Como pode ser visto na imagem acima, o uso de Controles de Conceito facilita a ediçÃĢo precisa dos atributos desejados durante o processo de geraçÃĢo de imagens, mantendo a estrutura geral da imagem.

Controles de Conceito Visuais

Os modelos de difusÃĢo de texto para imagem que usam apenas prompts de texto frequentemente encontram dificuldades em manter um alto grau de controle sobre atributos visuais, como cabelo facial ou formato de olhos. Para garantir um melhor controle sobre atributos granulares, os Controles de Conceito aproveitam orientaçÃĢo de texto opcional emparelhada com conjuntos de dados de imagens. Como pode ser visto na figura abaixo, os Controles de Conceito criam controles individuais para “tamanho do olho” e “forma da sobrancelha” que capturam as transformaçÃĩes desejadas usando os pares de imagens.

Os resultados podem ser refinados ainda mais fornecendo textos específicos para que a direçÃĢo se concentre naquela regiÃĢo facial e crie controles com controle passo a passo sobre o atributo visado.

ComposiçÃĢo de Controles

Uma das principais vantagens do uso de Controles de Conceito ÃĐ sua composabilidade, que permite que os usuÃĄrios combinem vÃĄrios controles para um controle aprimorado, em vez de se concentrar em um conceito de cada vez, o que pode ser atribuído às direçÃĩes de classificaçÃĢo baixa usadas nos Controles de Conceito. AlÃĐm disso, como os Controles de Conceito sÃĢo adaptadores LoRA leves, eles sÃĢo fÃĄceis de compartilhar e podem ser facilmente sobrepostos em modelos de difusÃĢo. Os usuÃĄrios tambÃĐm podem ajustar vÃĄrias alavancas simultaneamente para direcionar geraçÃĩes complexas, baixando conjuntos de controles interessantes.

A imagem a seguir demonstra as capacidades de composiçÃĢo dos controles de conceito, e vÃĄrios controles sÃĢo compostos progressivamente em cada linha da esquerda para a direita, permitindo assim a navegaçÃĢo de espaços de conceito de alta dimensionalidade com um controle aprimorado sobre os conceitos.

Melhorando a Qualidade da Imagem

Embora os quadros de difusÃĢo de texto para imagem de ponta e os grandes modelos gerativos, como o modelo Stable Diffusion XL, sejam capazes de gerar imagens realistas e de alta qualidade, eles frequentemente sofrem de distorçÃĩes de imagem, como objetos borrosos ou deformados, mesmo que os parÃĒmetros desses quadros de ponta sejam equipados com a capacidade latente de gerar saídas de alta qualidade com menos geraçÃĩes. O uso de Controles de Conceito pode resultar em imagens geradas com menos distorçÃĩes, desbloqueando as capacidades reais desses modelos, identificando direçÃĩes de parÃĒmetro de baixa classificaçÃĢo.

Corrigindo MÃĢos

Gerar imagens com mÃĢos realistas sempre foi um desafio para os quadros de difusÃĢo, e o uso de Controles de Conceito tem o controle direto sobre a tendÊncia de distorcer as mÃĢos. A imagem a seguir demonstra o efeito do uso dos Controles de Conceito “corrigir mÃĢos” que permite ao quadro gerar imagens com mÃĢos mais realistas.

Controles de Reparo

O uso de Controles de Conceito nÃĢo apenas resulta em gerar mÃĢos mais realistas, mas tambÃĐm mostrou seu potencial em melhorar a realidade geral das imagens geradas pelo quadro. Os Controles de Conceito identificam uma direçÃĢo de parÃĒmetro de baixa classificaçÃĢo que permite a mudança nas imagens de problemas de distorçÃĢo comuns, e os resultados sÃĢo demonstrados na imagem a seguir.

Pensamentos Finais

Neste artigo, discutimos os Controles de Conceito, um novo paradigma simples, mas escalÃĄvel, que permite controle interpretÃĄvel sobre a saída gerada nos modelos de difusÃĢo. O uso de Controles de Conceito visa resolver os problemas enfrentados pelos quadros de difusÃĢo de texto para imagem atuais que encontram dificuldades em manter o controle necessÃĄrio sobre conceitos visuais e atributos incluídos na imagem gerada, o que frequentemente leva a saídas insatisfatÃģrias. AlÃĐm disso, a maioria dos modelos de difusÃĢo de texto para imagem encontra dificuldades em modular atributos contínuos em uma imagem, o que frequentemente leva a saídas insatisfatÃģrias. O uso de Controles de Conceito pode permitir que os quadros de difusÃĢo de texto para imagem mitiguem esses problemas, capacitando criadores de conteÚdo e usuÃĄrios finais com um controle aprimorado sobre o processo de geraçÃĢo de imagens e resolvendo problemas enfrentados pelos quadros atuais.

Um engenheiro por profissÃĢo, um escritor por coraçÃĢo. Kunal ÃĐ um escritor tÃĐcnico com um amor e compreensÃĢo profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentaçÃĢo envolvente e informativa.