Modelos e plataformas de IA
InstantID: Geração de Imagem de Preservação de Identidade em Segundos
A tecnologia de geração de imagens impulsionada por IA tem experimentado um crescimento notável nos últimos anos, desde que grandes modelos de difusão de texto para imagem, como DALL-E, GLIDE, Stable Diffusion, Imagen e mais, surgiram no cenário. Apesar de os modelos de IA de geração de imagens terem arquiteturas e métodos de treinamento únicos, todos compartilham um foco comum: geração de imagens personalizadas e customizadas que visam criar imagens com personagem ID, assunto e estilo consistentes com base em imagens de referência. Devido às suas notáveis capacidades gerativas, os frameworks de IA de geração de imagens modernos encontraram aplicações em campos que incluem animação de imagens, realidade virtual, E-Commerce, retratos de IA e mais. No entanto, apesar de suas notáveis capacidades gerativas, esses frameworks todos compartilham um obstáculo comum, a maioria deles não consegue gerar imagens personalizadas preservando os delicados detalhes de identidade de objetos humanos.
Gerar imagens personalizadas preservando detalhes intrincados é de importância crítica, especialmente em tarefas de identidade facial humana que exigem um alto padrão de fidelidade e detalhe, e semântica sutil quando comparadas a tarefas de geração de imagens de objetos gerais que se concentram principalmente em texturas e cores grosseiras. Além disso, os frameworks de síntese de imagens personalizadas nos últimos anos, como LoRA, DreamBooth, Textual Inversion e mais, avançaram significativamente. No entanto, os modelos de IA de geração de imagens personalizadas ainda não são perfeitos para implantação em cenários do mundo real, pois têm uma alta exigência de armazenamento, exigem múltiplas imagens de referência e frequentemente têm um longo processo de ajuste fino. Por outro lado, embora os métodos baseados em incorporação de ID existentes exijam apenas uma única referência direta, eles ou carecem de compatibilidade com modelos pré-treinados disponíveis publicamente, ou exigem um excessivo processo de ajuste fino em numerosos parâmetros, ou falham em manter alta fidelidade facial.
Para abordar esses desafios e melhorar ainda mais as capacidades de geração de imagens, neste artigo, vamos falar sobre o InstantID, uma solução baseada em modelo de difusão para geração de imagens. O InstantID é um módulo plug and play que lida com geração de imagens e personalização de forma hábil em vários estilos com apenas uma imagem de referência e também garante alta fidelidade. O objetivo principal deste artigo é fornecer aos nossos leitores uma compreensão aprofundada dos fundamentos técnicos e componentes do framework InstantID, pois teremos uma visão detalhada da arquitetura do modelo, do processo de treinamento e de cenários de aplicação. Vamos começar.
InstantID: Geração de Imagem de Preservação de Identidade em Segundos
O surgimento de modelos de difusão de texto para imagem contribuiu significativamente para o avanço da tecnologia de geração de imagens. O objetivo principal desses modelos é a geração personalizada e customizada, criando imagens com sujeito, estilo e ID de personagem consistentes usando uma ou mais imagens de referência. A capacidade desses frameworks de criar imagens consistentes criou aplicações potenciais em diferentes indústrias, incluindo animação de imagens, geração de retratos de IA, E-Commerce, realidade virtual e aumentada, e muito mais.
No entanto, apesar de suas notáveis capacidades, esses frameworks enfrentam um desafio fundamental: frequentemente lutam para gerar imagens personalizadas que preservam os detalhes intrincados de sujeitos humanos com precisão. É importante notar que gerar imagens personalizadas com detalhes intrincados é uma tarefa desafiadora, pois a identidade facial humana exige um grau mais alto de fidelidade e detalhe, além de semântica mais avançada em comparação com objetos gerais ou estilos que se concentram principalmente em cores ou texturas grosseiras. Os modelos de IA de geração de imagens existentes dependem de descrições textuais detalhadas e lutam para alcançar relevância semântica forte para geração de imagens personalizadas. Além disso, alguns grandes frameworks de IA de geração de imagens pré-treinados adicionam controles de condicionamento espacial para melhorar a capacidade de controle, facilitando o controle estrutural fino usando elementos como poses, mapas de profundidade, esboços desenhados pelo usuário, mapas de segmentação semântica e mais. No entanto, apesar dessas adições e melhorias, esses frameworks são capazes de alcançar apenas fidelidade parcial da imagem gerada para a imagem de referência.
Para superar esses obstáculos, o framework InstantID se concentra na síntese de imagens de preservação de identidade instantânea e tenta fechar a lacuna entre eficiência e alta fidelidade, introduzindo um módulo simples plug and play que permite ao framework lidar com personalização de imagens usando apenas uma imagem facial única, mantendo alta fidelidade. Além disso, para preservar a identidade facial da imagem de referência, o framework InstantID implementa um codificador de face novo que retém os detalhes intrincados da imagem, adicionando condições espaciais fracas e semânticas fortes que guiam o processo de geração de imagens, incorporando prompts textuais, imagem de referência e imagem facial.
Existem três recursos distintivos que separam o framework InstantID dos frameworks de geração de imagens de texto para imagem existentes.
- Compatibilidade e Conectividade: Em vez de treinar os parâmetros completos do framework UNet, o framework InstantID se concentra em treinar um adaptador leve. Como resultado, o framework InstantID é compatível e conectável com modelos pré-treinados existentes.
- Ajuste Livre: A metodologia do framework InstantID elimina a necessidade de ajuste fino, pois precisa apenas de uma única propagação direta para inferência, tornando o modelo altamente prático e econômico para ajuste fino.
- Desempenho Superior: O framework InstantID demonstra alta flexibilidade e fidelidade, pois é capaz de entregar desempenho de estado da arte usando apenas uma imagem de referência, comparável a métodos baseados em treinamento que dependem de múltiplas imagens de referência.
No geral, as contribuições do framework InstantID podem ser categorizadas nos seguintes pontos.
- O framework InstantID é um método inovador de adaptação de preservação de ID para modelos de difusão de texto para imagem pré-treinados, com o objetivo de fechar a lacuna entre eficiência e fidelidade.
- O framework InstantID é compatível e conectável com modelos personalizados ajustados com o mesmo modelo de difusão em sua arquitetura, permitindo a preservação de ID em modelos pré-treinados sem custo adicional.
InstantID: Metodologia e Arquitetura
Como mencionado anteriormente, o framework InstantID é um adaptador leve eficiente que confere aos modelos de difusão de texto para imagem pré-treinados capacidades de preservação de ID sem esforço.
Falando sobre a arquitetura, o framework InstantID é construído sobre o modelo de Stable Diffusion, renomado por sua capacidade de realizar o processo de difusão com alta eficiência computacional em um espaço latente de baixa dimensão, em vez de espaço de pixel com um autoencoder. Para uma imagem de entrada, o codificador primeiro mapeia a imagem para uma representação latente com fator de downsampling e dimensões latentes. Além disso, para desdenizar um ruído normalmente distribuído com ruído latente, condição e tempo de passo atual, o processo de difusão adota um componente de UNet de desdenização. A condição é uma incorporação de prompts textuais gerados usando um codificador de texto CLIP pré-treinado.
Além disso, o framework InstantID também utiliza um componente ControlNet capaz de adicionar controle espacial a um modelo de difusão pré-treinado como sua condição, estendendo-se além das capacidades tradicionais de prompts textuais. O componente ControlNet também integra a arquitetura UNet do framework Stable Diffusion usando uma réplica treinada do componente UNet. A réplica do componente UNet apresenta zero camadas de convolução dentro dos blocos médios e dos blocos do codificador. Apesar de suas semelhanças, o componente ControlNet se distingue do modelo Stable Diffusion; eles diferem no item residual posterior. O componente ControlNet codifica informações de condição espacial, como poses, mapas de profundidade, esboços e mais, adicionando os resíduos ao bloco UNet, e então incorpora esses resíduos na rede original.
O framework InstantID também se inspira no IP-Adapter ou Adaptador de Prompt de Imagem, que introduz uma abordagem nova para alcançar capacidades de prompt de imagem em paralelo com prompts textuais, sem necessidade de modificar os modelos de texto para imagem originais. O componente IP-Adapter também emprega uma estratégia de atenção cruzada desacoplada única que usa camadas de atenção cruzada adicionais para incorporar as características de imagem, deixando os outros parâmetros inalterados.
Metodologia
Para dar uma visão geral, o framework InstantID visa gerar imagens personalizadas com diferentes estilos ou poses usando apenas uma imagem de referência de ID com alta fidelidade. A figura a seguir fornece uma visão geral do framework InstantID.

Como pode ser observado, o framework InstantID tem três componentes essenciais:
- Um componente de incorporação de ID que captura informações semânticas robustas das características faciais na imagem.
- Um módulo adaptado leve com um componente de atenção cruzada desacoplada para facilitar o uso de uma imagem como prompt visual.
- Um componente IdentityNet que codifica as características detalhadas da imagem de referência usando controle espacial adicional.
Incorporação de ID
Ao contrário dos métodos existentes, como FaceStudio, PhotoMaker, IP-Adapter e mais, que dependem de um codificador de imagem CLIP pré-treinado para extrair prompts visuais, o framework InstantID se concentra em fidelidade aprimorada e detalhes semânticos mais fortes na tarefa de preservação de ID. É importante notar que as limitações inerentes do componente CLIP residem principalmente em seu processo de treinamento em dados fracamente alinhados, significando que as características codificadas do codificador CLIP capturam principalmente informações semânticas amplas e ambíguas, como cores, estilo e composição. Embora essas características possam atuar como suplemento geral para incorporações de texto, elas não são adequadas para tarefas de preservação de ID precisas que enfatizam fortemente semântica e alta fidelidade. Além disso, pesquisas recentes em modelos de representação facial, especialmente em torno do reconhecimento facial, demonstraram a eficiência da representação facial em tarefas complexas, incluindo reconstrução e reconhecimento facial. Com base nisso, o framework InstantID visa aproveitar um modelo de face pré-treinado para detectar e extrair incorporações de ID de face da imagem de referência, guiando o modelo para geração de imagens.
Adaptador de Imagem
A capacidade dos modelos de difusão de texto para imagem pré-treinados em tarefas de prompt de imagem melhora significativamente os prompts textuais, especialmente em cenários que não podem ser descritos adequadamente por prompts textuais. O framework InstantID adota uma estratégia semelhante à usada pelo modelo IP-Adapter para prompt de imagem, que introduz um módulo adaptado leve emparelhado com um componente de atenção cruzada desacoplada para suportar imagens como prompts de entrada. No entanto, contrariamente às incorporações CLIP alinhadas grosseiramente, o framework InstantID se distancia ao empregar incorporações de ID como prompts de imagem em uma tentativa de alcançar uma integração de prompt mais rica e sutil semanticamente.
IdentityNet
Embora os métodos existentes sejam capazes de integrar prompts de imagem com prompts textuais, o framework InstantID argumenta que esses métodos apenas melhoram características grosseiras com um nível de integração que é insuficiente para geração de imagens de preservação de ID. Além disso, adicionar tokens de imagem e texto em camadas de atenção cruzada diretamente tende a enfraquecer o controle dos tokens de texto, e uma tentativa de melhorar a força dos tokens de imagem pode resultar em prejudicar as capacidades dos tokens de texto em tarefas de edição. Para contrariar esses desafios, o framework InstantID opta por ControlNet, um método de incorporação de recurso alternativo que utiliza informações espaciais como entrada para o módulo controlável, permitindo que ele mantenha consistência com as configurações UNet nos modelos de difusão.
O framework InstantID faz duas alterações na arquitetura tradicional do ControlNet: para entradas condicionais, o framework InstantID opta por 5 pontos de referência faciais em vez de pontos de referência faciais OpenPose finos. Em segundo lugar, o framework InstantID usa incorporações de ID em vez de prompts textuais como condições para as camadas de atenção cruzada na arquitetura ControlNet.
Treinamento e Inferência
Durante a fase de treinamento, o framework InstantID otimiza os parâmetros do IdentityNet e do Adaptador de Imagem, congelando os parâmetros do modelo de difusão pré-treinado. A pipeline completa do InstantID é treinada em pares de imagem-texto que apresentam sujeitos humanos e emprega um objetivo de treinamento semelhante ao usado no framework de difusão estável, com condições de imagem específicas da tarefa. O destaque do método de treinamento do InstantID é a separação entre as camadas de atenção cruzada de imagem e texto dentro do adaptador de prompt de imagem, uma escolha que permite ao framework InstantID ajustar os pesos dessas condições de imagem de forma flexível e independente, garantindo um processo de inferência e treinamento mais direcionado e controlado.
InstantID: Experimentos e Resultados
O framework InstantID implementa o Stable Diffusion e o treina no LAION-Face, um conjunto de dados de grande escala e código aberto que consiste em mais de 50 milhões de pares de imagem-texto. Além disso, o framework InstantID coleta mais de 10 milhões de imagens humanas com automação geradas automaticamente pelo modelo BLIP2 para melhorar ainda mais a qualidade da geração de imagens. O framework InstantID se concentra principalmente em imagens de uma única pessoa e emprega um modelo de face pré-treinado para detectar e extrair incorporações de ID de face de imagens humanas, e, em vez de treinar conjuntos de dados de face recortados, treina as imagens humanas originais. Além disso, durante o treinamento, o framework InstantID congela o modelo de texto para imagem pré-treinado e atualiza apenas os parâmetros do IdentityNet e do Adaptador de Imagem.
Geração de Imagem Apenas
O modelo InstantID usa um prompt vazio para guiar o processo de geração de imagens usando apenas a imagem de referência, e os resultados sem prompts são demonstrados na imagem a seguir.

A geração de ‘Prompt Vazio’ demonstrada na imagem acima mostra a capacidade do framework InstantID de manter características faciais semânticas ricas, como identidade, idade e expressão, de forma robusta. No entanto, é importante notar que usar prompts vazios pode não ser capaz de replicar os resultados em outras semânticas, como gênero, com precisão. Além disso, na imagem acima, as colunas 2 a 4 usam uma imagem e um prompt, e, como pode ser visto, a imagem gerada não demonstra degradação nas capacidades de controle de texto e também garante consistência de identidade. Finalmente, as colunas 5 a 9 usam uma imagem, um prompt e controle espacial, demonstrando a compatibilidade do modelo com modelos de controle espacial pré-treinados, permitindo que o modelo InstantID introduza controles espaciais de forma flexível usando um componente ControlNet pré-treinado.

Também é importante notar que o número de imagens de referência tem um impacto significativo na imagem gerada, como demonstrado na imagem acima. Embora o framework InstantID seja capaz de entregar bons resultados usando uma única imagem de referência, múltiplas imagens de referência produzem uma imagem de melhor qualidade, pois o framework InstantID calcula a média das incorporações de ID como prompt de imagem. Em seguida, é essencial comparar o framework InstantID com métodos anteriores que geram imagens personalizadas usando uma única imagem de referência. A figura a seguir compara os resultados gerados pelo framework InstantID e modelos de estado da arte existentes para geração de imagens personalizadas com uma única referência.

Como pode ser visto, o framework InstantID é capaz de preservar características faciais graças à incorporação de ID que carrega informações semânticas ricas, como identidade, idade e gênero. Pode-se dizer com segurança que o framework InstantID supera os frameworks existentes em geração de imagens personalizadas, pois é capaz de preservar a identidade humana, mantendo controle e flexibilidade estilística.

Pensamentos Finais
Neste artigo, falamos sobre o InstantID, uma solução baseada em modelo de difusão para geração de imagens. O InstantID é um módulo plug and play que lida com geração de imagens e personalização de forma hábil em vários estilos com apenas uma imagem de referência e também garante alta fidelidade. O framework InstantID se concentra na síntese de imagens de preservação de identidade instantânea e tenta fechar a lacuna entre eficiência e alta fidelidade, introduzindo um módulo simples plug and play que permite ao framework lidar com personalização de imagens usando apenas uma imagem facial única, mantendo alta fidelidade. O InstantID é um framework que se concentra em geração de imagens de preservação de identidade instantânea, e tenta fechar a lacuna entre eficiência e alta fidelidade, introduzindo um módulo simples plug and play que permite ao framework lidar com personalização de imagens usando apenas uma imagem facial única, mantendo alta fidelidade. ty. O framework InstantID se concentra em geração de imagens de preservação de identidade instantânea, e tenta fechar a lacuna entre eficiência e alta fidelidade, introduzindo um módulo simples plug and play que permite ao framework lidar com personalização de imagens usando apenas uma imagem facial única, mantendo alta fidelidade.












