Modelos e plataformas de IA

InstantStyle: Preservação de Estilo em Geração de Imagem de Texto

mm
Adicione Unite.AI às suas fontes preferidas no Google

Nos últimos anos, os modelos de difusão baseados em ajuste demonstraram um progresso notável em uma ampla gama de tarefas de personalização e customização de imagens. No entanto, apesar de seu potencial, os atuais modelos de difusão baseados em ajuste continuam a enfrentar uma série de desafios complexos na produção e geração de imagens consistentes em termos de estilo, e pode haver três razões para isso. Primeiro, o conceito de estilo ainda permanece amplamente indefinido e indeterminado, e compreende uma combinação de elementos, incluindo atmosfera, estrutura, design, material, cor e muito mais. Segundo, os métodos baseados em inversão são propensos a degradação de estilo, resultando em perda frequente de detalhes finos. Finalmente, as abordagens baseadas em adaptadores exigem ajustes frequentes de pesos para cada imagem de referência para manter um equilíbrio entre a controlabilidade do texto e a intensidade do estilo.

Além disso, o objetivo principal da maioria das abordagens de transferência de estilo ou geração de imagem estilizada é usar a imagem de referência e aplicar seu estilo específico a partir de um conjunto de referência ou imagem de referência a uma imagem de conteúdo alvo. No entanto, é o grande número de atributos de estilo que torna o trabalho difícil para os pesquisadores coletar conjuntos de dados estilizados, representar o estilo corretamente e avaliar o sucesso da transferência. Anteriormente, os modelos e estruturas que lidam com o processo de difusão baseado em ajuste fine-tunam o conjunto de dados de imagens que compartilham um estilo comum, um processo que é ao mesmo tempo demorado e com limitada generalização em tarefas do mundo real, pois é difícil reunir um subconjunto de imagens que compartilhem o mesmo ou quase idêntico estilo.

Neste artigo, vamos falar sobre o InstantStyle, uma estrutura projetada com o objetivo de lidar com os problemas enfrentados pelos atuais modelos de difusão baseados em ajuste para geração e customização de imagens. Vamos falar sobre as duas estratégias principais implementadas pela estrutura InstantStyle:

  1. Uma abordagem simples, mas eficaz, para desacoplar o estilo e o conteúdo das imagens de referência dentro do espaço de recursos, previsto com base na suposição de que os recursos dentro do mesmo espaço de recursos podem ser adicionados ou subtraídos uns dos outros.
  2. Prevenir vazamentos de estilo injetando os recursos da imagem de referência exclusivamente nos blocos de estilo específicos e evitando deliberadamente a necessidade de usar pesos pesados para ajuste, que frequentemente caracterizam projetos mais pesados em parâmetros.

Este artigo visa cobrir a estrutura InstantStyle em profundidade e exploramos o mecanismo, a metodologia, a arquitetura da estrutura, juntamente com sua comparação com estruturas de ponta. Também vamos falar sobre como a estrutura InstantStyle demonstra resultados notáveis de estilização visual e atinge um equilíbrio ótimo entre a controlabilidade dos elementos textuais e a intensidade do estilo. Vamos começar.

InstantStyle: Preservação de Estilo em Geração de Imagem de Texto

As estruturas de geração de imagem de texto baseadas em difusão têm alcançado um sucesso notável em uma ampla gama de tarefas de personalização e customização, particularmente em tarefas de geração de imagem consistente, incluindo customização de objetos, preservação de imagens e transferência de estilo. No entanto, apesar do recente sucesso e aumento de desempenho, a transferência de estilo continua sendo uma tarefa desafiadora para os pesquisadores devido à natureza indeterminada e indefinida do estilo, que frequentemente inclui uma variedade de elementos, incluindo atmosfera, estrutura, design, material, cor e muito mais. Com isso dito, o objetivo principal da geração de imagem estilizada ou transferência de estilo é aplicar o estilo específico a partir de uma imagem de referência ou um conjunto de referência de imagens à imagem de conteúdo alvo. No entanto, o grande número de atributos de estilo torna o trabalho difícil para os pesquisadores coletar conjuntos de dados estilizados, representar o estilo corretamente e avaliar o sucesso da transferência. Anteriormente, os modelos e estruturas que lidam com o processo de difusão baseado em ajuste fine-tunam o conjunto de dados de imagens que compartilham um estilo comum, um processo que é ao mesmo tempo demorado e com limitada generalização em tarefas do mundo real, pois é difícil reunir um subconjunto de imagens que compartilhem o mesmo ou quase idêntico estilo.

Com os desafios enfrentados pela abordagem atual, os pesquisadores têm se interessado em desenvolver abordagens de ajuste para transferência de estilo ou geração de imagem estilizada, e essas estruturas podem ser divididas em dois grupos diferentes:

  • Abordagens sem Adaptador: As abordagens e estruturas sem adaptador aproveitam o poder da auto-atenção dentro do processo de difusão e, implementando uma operação de atenção compartilhada, esses modelos são capazes de extrair recursos essenciais, incluindo chaves e valores, de imagens de estilo de referência diretamente.
  • Abordagens com Adaptador: As abordagens e estruturas com adaptador incorporam um modelo leve projetado para extrair representações de imagem detalhadas das imagens de estilo de referência. A estrutura, em seguida, integra essas representações no processo de difusão habilmente, usando mecanismos de atenção cruzada. O objetivo principal do processo de integração é guiar o processo de geração e garantir que a imagem resultante esteja alinhada com as nuances estilísticas desejadas da imagem de referência.

No entanto, apesar das promessas, os métodos sem ajuste frequentemente encontram alguns desafios. Primeiro, a abordagem sem adaptador exige uma troca de chaves e valores dentro das camadas de auto-atenção e pré-pegue as matrizes de chaves e valores derivadas das imagens de estilo de referência. Quando implementada em imagens naturais, a abordagem sem adaptador exige a inversão da imagem de volta ao ruído latente usando técnicas como DDIM ou Inversão de Difusão Implícita de Modelo. No entanto, usar DDIM ou outras abordagens de inversão pode resultar na perda de detalhes finos, como cor e textura, diminuindo, assim, as informações de estilo nas imagens geradas. Além disso, o passo adicional introduzido por essas abordagens é um processo demorado e pode apresentar desvantagens significativas em aplicações práticas. Por outro lado, o desafio principal para os métodos baseados em adaptador reside em atingir o equilíbrio correto entre o vazamento de contexto e a intensidade do estilo. O vazamento de contexto ocorre quando um aumento na intensidade do estilo resulta na aparência de elementos não estilizados da imagem de referência na saída gerada, com o ponto principal de dificuldade sendo separar estilos do conteúdo dentro da imagem de referência de forma eficaz. Para resolver esse problema, algumas estruturas constroem conjuntos de dados emparelhados que representam o mesmo objeto em diferentes estilos, facilitando a extração da representação de conteúdo e estilos desacoplados. No entanto, graças à representação inherentemente indeterminada do estilo, a tarefa de criar conjuntos de dados emparelhados em grande escala é limitada em termos da diversidade de estilos que pode capturar e é um processo intensivo em recursos.

Para lidar com essas limitações, a estrutura InstantStyle é introduzida, que é um mecanismo sem ajuste baseado em métodos baseados em adaptador existentes, com a capacidade de integrar-se perfeitamente com outros métodos de injeção baseados em atenção e atingir a desacoplamento de conteúdo e estilo de forma eficaz. Além disso, a estrutura InstantStyle introduz não uma, mas duas maneiras eficazes de completar a desacoplamento de estilo e conteúdo, atingindo uma melhor migração de estilo sem a necessidade de introduzir métodos adicionais para atingir a desacoplamento ou construir conjuntos de dados emparelhados.

Além disso, as estruturas baseadas em adaptador anteriores têm sido amplamente utilizadas nos métodos baseados em CLIP como um extrator de recursos de imagem, e algumas estruturas exploraram a possibilidade de implementar a desacoplamento de recursos dentro do espaço de recursos, e, quando comparado com a indeterminação do estilo, é mais fácil descrever o conteúdo com texto. Como as imagens e os textos compartilham um espaço de recursos nos métodos baseados em CLIP, uma operação de subtração simples de recursos de texto de contexto e recursos de imagem pode reduzir significativamente o vazamento de conteúdo. Além disso, na maioria dos modelos de difusão, há uma camada específica em sua arquitetura que injeta as informações de estilo e atinge a desacoplamento de conteúdo e estilo injetando recursos de imagem apenas nos blocos de estilo específicos. Implementando essas duas estratégias simples, a estrutura InstantStyle é capaz de resolver os problemas de vazamento de conteúdo encontrados pela maioria das estruturas existentes, mantendo a força do estilo.

Para resumir, a estrutura InstantStyle emprega dois mecanismos simples, diretos, mas eficazes para atingir uma desacoplamento eficaz de conteúdo e estilo a partir de imagens de referência. A estrutura InstantStyle é um modelo independente e sem ajuste que demonstra um desempenho notável em tarefas de transferência de estilo, com um grande potencial para tarefas downstream.

Instant-Style: Metodologia e Arquitetura

Como demonstrado por abordagens anteriores, há um equilíbrio na injeção de condições de estilo nos modelos de difusão sem ajuste. Se a intensidade da condição de imagem for muito alta, pode resultar em vazamento de conteúdo, enquanto se a intensidade da condição de imagem for muito baixa, o estilo pode não ser óbvio o suficiente. Uma razão principal para essa observação é que, em uma imagem, o estilo e o conteúdo estão interligados, e devido à representação indeterminada do estilo, é difícil desacoplar o estilo e a intenção. Como resultado, pesos meticulosos são frequentemente ajustados para cada imagem de referência, tentando equilibrar a controlabilidade do texto e a força do estilo. Além disso, para uma imagem de referência de entrada e sua descrição de texto correspondente nos métodos baseados em inversão, as abordagens de inversão, como DDIM, são adotadas sobre a imagem para obter a trajetória de difusão invertida, um processo que aproxima a equação de inversão para transformar uma imagem em uma representação de ruído latente. Com base nisso e começando com a trajetória de difusão invertida, juntamente com um novo conjunto de prompts, esses métodos geram novo conteúdo com seu estilo alinhado com a entrada. No entanto, como mostrado na figura a seguir, a abordagem de inversão DDIM para imagens reais é frequentemente instável, pois depende de suposições de linearização local, resultando na propagação de erros e levando à perda de conteúdo e reconstrução de imagem incorreta.

Vindo à metodologia, em vez de empregar estratégias complexas para desacoplar conteúdo e estilo de imagens, a estrutura Instant-Style adota a abordagem mais simples para atingir um desempenho semelhante. Quando comparado com os atributos de estilo indeterminados, o conteúdo pode ser representado por texto natural, permitindo que a estrutura Instant-Style use o codificador de texto do CLIP para extrair as características do texto de conteúdo como representações de contexto. Simultaneamente, a estrutura Instant-Style implementa o codificador de imagem do CLIP para extrair os recursos da imagem de referência. Aproveitando a caracterização dos recursos globais do CLIP e subtraindo os recursos de texto de conteúdo dos recursos de imagem, a estrutura Instant-Style é capaz de desacoplar explicitamente o estilo e o conteúdo. Embora seja uma estratégia simples, ajuda a estrutura Instant-Style a manter o vazamento de conteúdo ao mínimo.

Além disso, cada camada dentro de uma rede profunda é responsável por capturar informações semânticas diferentes, e a observação principal dos modelos anteriores é que existem duas camadas de atenção responsáveis por lidar com o estilo. Especificamente, são as camadas blocks.0.attentions.1 e down blocks.2.attentions.1, que são responsáveis por capturar o estilo, como cor, material, atmosfera, e a camada de layout espacial captura estrutura e composição, respectivamente. A estrutura Instant-Style usa essas camadas implicitamente para extrair informações de estilo e prevenir vazamento de conteúdo sem perder a força do estilo. A estratégia é simples, mas eficaz, pois o modelo localizou os blocos de estilo que podem injetar os recursos de imagem nesses blocos para atingir uma transferência de estilo perfeita. Além disso, como o modelo reduz significativamente o número de parâmetros do adaptador, a capacidade de controle do texto da estrutura é aprimorada, e o mecanismo também é aplicável a outros modelos de injeção de recursos baseados em atenção para edição e outras tarefas.

Instant-Style: Experimentos e Resultados

A estrutura Instant-Style é implementada na estrutura Stable Diffusion XL e usa o adaptador IR pré-treinado como seu exemplar para validar sua metodologia, e silencia todos os blocos, exceto os blocos de estilo, para recursos de imagem. O modelo Instant-Style também treina o adaptador IR em 4 milhões de conjuntos de dados de imagem-texto emparelhados em grande escala do zero e, em vez de treinar todos os blocos, atualiza apenas os blocos de estilo.

Para conduzir suas capacidades de generalização e robustez, a estrutura Instant-Style realiza numerosos experimentos de transferência de estilo com vários estilos em diferentes conteúdos, e os resultados podem ser observados nas imagens a seguir. Dado uma única imagem de referência de estilo, juntamente com prompts variados, a estrutura Instant-Style entrega geração de imagem de alta qualidade e consistente em termos de estilo.

Além disso, como o modelo injeta informações de imagem apenas nos blocos de estilo, é capaz de mitigar significativamente o problema de vazamento de conteúdo e, portanto, não precisa realizar ajustes de peso.

Em seguida, a estrutura Instant-Style também adota a arquitetura ControlNet para atingir estilização de imagem com controle espacial, e os resultados são demonstrados na imagem a seguir.

Quando comparado com os métodos de ponta anteriores, incluindo StyleAlign, B-LoRA, Swapping Self Attention e IP-Adapter, a estrutura Instant-Style demonstra os melhores efeitos visuais.

Pensamentos Finais

Neste artigo, falamos sobre o Instant-Style, uma estrutura geral que emprega duas estratégias simples, mas eficazes, para atingir uma desacoplamento eficaz de conteúdo e estilo a partir de imagens de referência. A estrutura InstantStyle é projetada com o objetivo de lidar com os problemas enfrentados pelos atuais modelos de difusão baseados em ajuste para geração e customização de imagens. A estrutura Instant-Style implementa duas estratégias principais: uma abordagem simples, mas eficaz, para desacoplar o estilo e o conteúdo das imagens de referência dentro do espaço de recursos, previsto com base na suposição de que os recursos dentro do mesmo espaço de recursos podem ser adicionados ou subtraídos uns dos outros. Em segundo lugar, prevenir vazamentos de estilo injetando os recursos da imagem de referência exclusivamente nos blocos de estilo específicos e evitando deliberadamente a necessidade de usar pesos pesados para ajuste, que frequentemente caracterizam projetos mais pesados em parâmetros.

Um engenheiro por profissão, um escritor por coração. Kunal é um escritor técnico com um amor e compreensão profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentação envolvente e informativa.