Modelos e plataformas de IA
Controles de Conceito: Controle Preciso em Modelos de DifusÃĢo com Adaptadores LoRA
Obrigado à s suas capacidades, os modelos de difusÃĢo de texto para imagem se tornaram extremamente populares na comunidade artÃstica. No entanto, os modelos atuais, incluindo os quadros de ponta, frequentemente lutam para manter o controle sobre os conceitos visuais e atributos nas imagens geradas, levando a saÃdas insatisfatÃģrias. A maioria dos modelos depende apenas de prompts de texto, o que apresenta desafios na modulaçÃĢo de atributos contÃnuos, como a intensidade do clima, a nitidez das sombras, as expressÃĩes faciais ou a idade de uma pessoa, com precisÃĢo. Isso torna difÃcil para os usuÃĄrios finais ajustar as imagens para atender à s suas necessidades especÃficas. AlÃĐm disso, embora esses quadros gerativos produzam imagens de alta qualidade e realistas, eles sÃĢo propensos a distorçÃĩes, como rostos deformados ou dedos faltantes.
Para superar essas limitaçÃĩes, os desenvolvedores propuseram o uso de Controles de Conceito interpretÃĄveis. Esses controles prometem um maior controle para os usuÃĄrios finais sobre os atributos visuais, melhorando a geraçÃĢo e ediçÃĢo de imagens dentro dos modelos de difusÃĢo. Os Controles de Conceito nos modelos de difusÃĢo funcionam identificando uma direçÃĢo de parÃĒmetro correspondente a um conceito individual, minimizando a interferÊncia com outros atributos. O quadro cria esses controles usando imagens de amostra ou um conjunto de prompts, estabelecendo assim direçÃĩes para conceitos textuais e visuais.

Em Última anÃĄlise, o uso de Controles de Conceito em modelos de difusÃĢo de texto para imagem pode resultar em geraçÃĢo de imagens com um mÃnimo de interferÊncia e controle aprimorado sobre a saÃda final, aumentando a realidade percebida sem alterar o conteÚdo das imagens, e gerando assim imagens realistas. Neste artigo, discutiremos o conceito de usar Controles de Conceito em quadros de texto para imagem em maior profundidade e analisaremos como seu uso pode resultar em imagens geradas por IA de qualidade superior.
IntroduçÃĢo aos Controles de Conceito
Como mencionado anteriormente, os quadros de difusÃĢo de texto para imagem atuais frequentemente lutam para controlar conceitos visuais e atributos nas imagens geradas, levando a resultados insatisfatÃģrios. AlÃĐm disso, muitos desses modelos encontram dificuldades em modular atributos contÃnuos, contribuindo ainda mais para saÃdas insatisfatÃģrias. Os Controles de Conceito podem ajudar a mitigar esses problemas, capacitando criadores de conteÚdo e usuÃĄrios finais com controle aprimorado sobre o processo de geraçÃĢo de imagens e abordando desafios enfrentados pelos quadros atuais.
A maioria dos modelos de difusÃĢo de texto para imagem atuais depende da modificaçÃĢo direta do prompt de texto para controlar os atributos da imagem. Embora essa abordagem permita a geraçÃĢo de imagens, nÃĢo ÃĐ ideal, pois alterar o prompt pode alterar drasticamente a estrutura da imagem. Outra abordagem usada por esses quadros envolve tÃĐcnicas pÃģs-hoc, que invertem o processo de difusÃĢo e modificam as atençÃĩes cruzadas para editar conceitos visuais. No entanto, as tÃĐcnicas pÃģs-hoc tÊm limitaçÃĩes, suportando apenas um nÚmero limitado de ediçÃĩes simultÃĒneas e exigindo passes de interferÊncia individuais para cada novo conceito. AlÃĐm disso, elas podem introduzir entrelaçamento conceitual se nÃĢo forem projetadas com cuidado.
Em contraste, os Controles de Conceito oferecem uma soluçÃĢo mais eficiente para a geraçÃĢo de imagens. Esses adaptadores leves e fÃĄceis de usar podem ser aplicados a modelos prÃĐ-treinados, aprimorando o controle e a precisÃĢo sobre conceitos desejados em uma Única passagem de interferÊncia com mÃnimo entrelaçamento. Os Controles de Conceito tambÃĐm permitem a ediçÃĢo de conceitos visuais que nÃĢo sÃĢo cobertos por descriçÃĩes textuais, uma caracterÃstica que os distingue dos mÃĐtodos de ediçÃĢo baseados em prompts de texto. Embora os mÃĐtodos de personalizaçÃĢo baseados em imagens possam adicionar tokens para conceitos baseados em imagens, eles sÃĢo difÃceis de implementar para ediçÃĢo de imagens. Os Controles de Conceito, por outro lado, permitem que os usuÃĄrios finais forneçam um pequeno nÚmero de imagens em pares que definem um conceito desejado. Os controles entÃĢo generalizam esse conceito e o aplicam automaticamente a outras imagens, visando aprimorar a realidade e corrigir distorçÃĩes, como aquelas encontradas nas mÃĢos.
Os Controles de Conceito visam aprender e abordar problemas comuns a quatro conceitos de IA gerativa e quadros de difusÃĢo: EdiçÃĢo de Imagem, MÃĐtodos Baseados em OrientaçÃĢo, EdiçÃĢo de Modelo e DireçÃĩes SemÃĒnticas.
EdiçÃĢo de Imagem
Os quadros de IA atuais ou se concentram em usar uma entrada condicional para guiar a estrutura da imagem, ou manipulam as atençÃĩes cruzadas da imagem de origem com seu prompt de destino para permitir a ediçÃĢo de imagem Única em quadros de difusÃĢo de texto para imagem. Consequentemente, essas abordagens podem ser implementadas apenas em imagens individuais e tambÃĐm exigem otimizaçÃĢo da base latente para cada imagem como resultado da evoluçÃĢo da estrutura geomÃĐtrica ao longo dos passos de tempo entre prompts.
MÃĐtodos Baseados em OrientaçÃĢo
O uso de mÃĐtodos de orientaçÃĢo baseados em classificadores livres indicou sua capacidade de aprimorar a qualidade das imagens geradas e aumentar a alinhamento texto-imagem. Ao incorporar termos de orientaçÃĢo durante a interferÊncia, o mÃĐtodo melhora a composicionalidade limitada herdada pelos quadros de difusÃĢo, e eles podem ser usados para orientar conceitos inseguros em quadros de difusÃĢo.
EdiçÃĢo de Modelo
O uso de Controles de Conceito tambÃĐm pode ser visto como uma tÃĐcnica de ediçÃĢo de modelo que emprega um adaptador de baixa classificaçÃĢo para produzir um Único atributo semÃĒntico que permite controle contÃnuo que se alinha com o atributo. MÃĐtodos de personalizaçÃĢo baseados em ajuste fino sÃĢo entÃĢo usados para personalizar o quadro e adicionar novos conceitos. AlÃĐm disso, a tÃĐcnica de DifusÃĢo Personalizada propÃĩe uma forma de ajustar as camadas de atençÃĢo cruzada para incorporar novos conceitos visuais em modelos de difusÃĢo prÃĐ-treinados. Por outro lado, a tÃĐcnica de DifusÃĢo Textual propÃĩe otimizar um vetor de incorporaçÃĢo para ativar as capacidades do modelo e introduzir conceitos textuais no quadro.
DireçÃĩes SemÃĒnticas em GANs
A manipulaçÃĢo de atributos semÃĒnticos ÃĐ uma das principais caracterÃsticas das Redes AdversÃĄrias Gerativas, com as trajetÃģrias do espaço latente encontradas alinhadas de forma auto-supervisionada. Nos quadros de difusÃĢo, essas trajetÃģrias do espaço latente existem nas camadas intermediÃĄrias da arquitetura U-Net, e a direçÃĢo principal do espaço latente nos quadros de difusÃĢo captura a semÃĒntica global. Os Controles de Conceito treinam subespaços de baixa classificaçÃĢo correspondentes a atributos especiais diretamente e obtÊm direçÃĩes de ediçÃĢo precisas e localizadas usando pares de texto ou imagem para otimizar direçÃĩes globais.
Controles de Conceito: Arquitetura e Funcionamento
Modelos de DifusÃĢo e Adaptadores LoRA ou de Baixa ClassificaçÃĢo
Os modelos de difusÃĢo sÃĢo essencialmente uma subclasse de quadros de IA gerativa que operam no princÃpio de sintetizar dados revertendo um processo de difusÃĢo. O processo de difusÃĢo direto inicialmente adiciona ruÃdo aos dados, portanto, a transiçÃĢo de um estado organizado para um ruÃdo gaussiano completo. O objetivo principal dos modelos de difusÃĢo ÃĐ reverter o processo de difusÃĢo, desfazendo gradualmente o ruÃdo da imagem e amostrando um ruÃdo gaussiano aleatÃģrio para gerar uma imagem. Em aplicaçÃĩes do mundo real, o objetivo principal dos quadros de difusÃĢo ÃĐ prever o ruÃdo real quando o ruÃdo gaussiano completo ÃĐ fornecido como entrada, juntamente com entradas adicionais, como condicionamento e passo de tempo.
A tÃĐcnica de Adaptadores LoRA ou de Baixa ClassificaçÃĢo descompÃĩe as atualizaçÃĩes de peso durante o ajuste fino para permitir a adaptaçÃĢo eficiente de grandes quadros prÃĐ-treinados em tarefas downstream. A tÃĐcnica LoRA descompÃĩe as atualizaçÃĩes de peso para uma camada de modelo prÃĐ-treinado em relaçÃĢo tanto à s dimensÃĩes de entrada quanto de saÃda e restringe a atualizaçÃĢo a um subespaço de baixa dimensionalidade.
Controles de Conceito
O objetivo principal dos Controles de Conceito ÃĐ servir como uma abordagem para ajustar os adaptadores LoRA em um quadro de difusÃĢo para facilitar um maior grau de controle sobre imagens direcionadas a conceitos, e o mesmo ÃĐ demonstrado na imagem a seguir.

Quando condicionados em conceitos de destino, os Controles de Conceito aprendem direçÃĩes de parÃĒmetro de baixa classificaçÃĢo para aumentar ou diminuir a expressÃĢo de atributos especÃficos. Para um modelo e seu conceito de destino, o objetivo principal dos Controles de Conceito ÃĐ obter um modelo aprimorado que modifica a probabilidade de aumentar e suprimir atributos para uma imagem quando condicionada no conceito de destino para aumentar a probabilidade de aumentar atributos e diminuir a probabilidade de suprimir atributos. Usando reparametrizaçÃĢo e a fÃģrmula de Tweedie, o quadro introduz um processo de ruÃdo variÃĄvel no tempo e expressa cada pontuaçÃĢo como uma previsÃĢo de desruÃdo. AlÃĐm disso, o objetivo de desentrelaçamento ajusta os mÃģdulos nos Controles de Conceito, mantendo os pesos prÃĐ-treinados constantes, e o fator de escala introduzido durante a formulaçÃĢo LoRA ÃĐ modificado durante a interferÊncia. O fator de escala tambÃĐm facilita ajustar as forças da ediçÃĢo e torna as ediçÃĩes mais fortes sem retreinar o quadro, como demonstrado na imagem a seguir.

Os mÃĐtodos de ediçÃĢo usados anteriormente pelos quadros facilitavam ediçÃĩes mais fortes retreinando o quadro com orientaçÃĢo aumentada. No entanto, escalar o fator de escala durante a interferÊncia produz os mesmos resultados de ediçÃĢo sem aumentar o custo de retreinamento e tempo.
Aprendizado de Conceitos Visuais
Os Controles de Conceito sÃĢo projetados para controlar conceitos visuais que os prompts de texto nÃĢo conseguem definir bem, e esses controles aproveitam conjuntos de dados pequenos que sÃĢo emparelhados antes ou depois para treinar esses conceitos. O contraste entre os pares de imagens permite que os controles aprendam os conceitos visuais. AlÃĐm disso, o processo de treinamento dos Controles de Conceito otimiza o componente LoRA implementado em ambas as direçÃĩes, para a frente e para trÃĄs. Como resultado, o componente LoRA se alinha com a direçÃĢo que causa os efeitos visuais em ambas as direçÃĩes.
Controles de Conceito: Resultados de ImplementaçÃĢo
Para analisar o ganho de desempenho, os desenvolvedores avaliaram o uso de Controles de Conceito principalmente no Stable Diffusion XL, um quadro de alta resoluçÃĢo de 1024 pixels com experimentos adicionais realizados no Stable Diffusion v1.4, com os modelos sendo treinados por 500 ÃĐpocas cada.
Controles de Conceito Textuais
Para avaliar o desempenho dos Controles de Conceito textuais, foi validado em um conjunto de 30 conceitos baseados em texto, e o mÃĐtodo foi comparado com duas linhas de base que usam um prompt de texto padrÃĢo por um nÚmero fixo de passos de tempo e, em seguida, começa a composiçÃĢo adicionando prompts para direcionar a imagem. Como pode ser visto na figura a seguir, o uso de Controles de Conceito resulta em uma pontuaçÃĢo CLIP constantemente mais alta e uma reduçÃĢo constante na pontuaçÃĢo LPIPS em comparaçÃĢo com o quadro original sem Controles de Conceito.


Como pode ser visto na imagem acima, o uso de Controles de Conceito facilita a ediçÃĢo precisa dos atributos desejados durante o processo de geraçÃĢo de imagens, mantendo a estrutura geral da imagem.
Controles de Conceito Visuais
Os modelos de difusÃĢo de texto para imagem que usam apenas prompts de texto frequentemente encontram dificuldades em manter um alto grau de controle sobre atributos visuais, como cabelo facial ou formato de olhos. Para garantir um melhor controle sobre atributos granulares, os Controles de Conceito aproveitam orientaçÃĢo de texto opcional emparelhada com conjuntos de dados de imagens. Como pode ser visto na figura abaixo, os Controles de Conceito criam controles individuais para âtamanho do olhoâ e âforma da sobrancelhaâ que capturam as transformaçÃĩes desejadas usando os pares de imagens.

Os resultados podem ser refinados ainda mais fornecendo textos especÃficos para que a direçÃĢo se concentre naquela regiÃĢo facial e crie controles com controle passo a passo sobre o atributo visado.
ComposiçÃĢo de Controles
Uma das principais vantagens do uso de Controles de Conceito ÃĐ sua composabilidade, que permite que os usuÃĄrios combinem vÃĄrios controles para um controle aprimorado, em vez de se concentrar em um conceito de cada vez, o que pode ser atribuÃdo à s direçÃĩes de classificaçÃĢo baixa usadas nos Controles de Conceito. AlÃĐm disso, como os Controles de Conceito sÃĢo adaptadores LoRA leves, eles sÃĢo fÃĄceis de compartilhar e podem ser facilmente sobrepostos em modelos de difusÃĢo. Os usuÃĄrios tambÃĐm podem ajustar vÃĄrias alavancas simultaneamente para direcionar geraçÃĩes complexas, baixando conjuntos de controles interessantes.

A imagem a seguir demonstra as capacidades de composiçÃĢo dos controles de conceito, e vÃĄrios controles sÃĢo compostos progressivamente em cada linha da esquerda para a direita, permitindo assim a navegaçÃĢo de espaços de conceito de alta dimensionalidade com um controle aprimorado sobre os conceitos.

Melhorando a Qualidade da Imagem
Embora os quadros de difusÃĢo de texto para imagem de ponta e os grandes modelos gerativos, como o modelo Stable Diffusion XL, sejam capazes de gerar imagens realistas e de alta qualidade, eles frequentemente sofrem de distorçÃĩes de imagem, como objetos borrosos ou deformados, mesmo que os parÃĒmetros desses quadros de ponta sejam equipados com a capacidade latente de gerar saÃdas de alta qualidade com menos geraçÃĩes. O uso de Controles de Conceito pode resultar em imagens geradas com menos distorçÃĩes, desbloqueando as capacidades reais desses modelos, identificando direçÃĩes de parÃĒmetro de baixa classificaçÃĢo.
Corrigindo MÃĢos
Gerar imagens com mÃĢos realistas sempre foi um desafio para os quadros de difusÃĢo, e o uso de Controles de Conceito tem o controle direto sobre a tendÊncia de distorcer as mÃĢos. A imagem a seguir demonstra o efeito do uso dos Controles de Conceito âcorrigir mÃĢosâ que permite ao quadro gerar imagens com mÃĢos mais realistas.

Controles de Reparo
O uso de Controles de Conceito nÃĢo apenas resulta em gerar mÃĢos mais realistas, mas tambÃĐm mostrou seu potencial em melhorar a realidade geral das imagens geradas pelo quadro. Os Controles de Conceito identificam uma direçÃĢo de parÃĒmetro de baixa classificaçÃĢo que permite a mudança nas imagens de problemas de distorçÃĢo comuns, e os resultados sÃĢo demonstrados na imagem a seguir.

Pensamentos Finais
Neste artigo, discutimos os Controles de Conceito, um novo paradigma simples, mas escalÃĄvel, que permite controle interpretÃĄvel sobre a saÃda gerada nos modelos de difusÃĢo. O uso de Controles de Conceito visa resolver os problemas enfrentados pelos quadros de difusÃĢo de texto para imagem atuais que encontram dificuldades em manter o controle necessÃĄrio sobre conceitos visuais e atributos incluÃdos na imagem gerada, o que frequentemente leva a saÃdas insatisfatÃģrias. AlÃĐm disso, a maioria dos modelos de difusÃĢo de texto para imagem encontra dificuldades em modular atributos contÃnuos em uma imagem, o que frequentemente leva a saÃdas insatisfatÃģrias. O uso de Controles de Conceito pode permitir que os quadros de difusÃĢo de texto para imagem mitiguem esses problemas, capacitando criadores de conteÚdo e usuÃĄrios finais com um controle aprimorado sobre o processo de geraçÃĢo de imagens e resolvendo problemas enfrentados pelos quadros atuais.












