Modelos e plataformas de IA

InstantID: GeraçÃĢo de Imagem de PreservaçÃĢo de Identidade em Segundos

mm
Adicione Unite.AI às suas fontes preferidas no Google

A tecnologia de geraçÃĢo de imagens impulsionada por IA tem experimentado um crescimento notÃĄvel nos Últimos anos, desde que grandes modelos de difusÃĢo de texto para imagem, como DALL-E, GLIDE, Stable Diffusion, Imagen e mais, surgiram no cenÃĄrio. Apesar de os modelos de IA de geraçÃĢo de imagens terem arquiteturas e mÃĐtodos de treinamento Únicos, todos compartilham um foco comum: geraçÃĢo de imagens personalizadas e customizadas que visam criar imagens com personagem ID, assunto e estilo consistentes com base em imagens de referÊncia. Devido às suas notÃĄveis capacidades gerativas, os frameworks de IA de geraçÃĢo de imagens modernos encontraram aplicaçÃĩes em campos que incluem animaçÃĢo de imagens, realidade virtual, E-Commerce, retratos de IA e mais. No entanto, apesar de suas notÃĄveis capacidades gerativas, esses frameworks todos compartilham um obstÃĄculo comum, a maioria deles nÃĢo consegue gerar imagens personalizadas preservando os delicados detalhes de identidade de objetos humanos.

Gerar imagens personalizadas preservando detalhes intrincados ÃĐ de importÃĒncia crítica, especialmente em tarefas de identidade facial humana que exigem um alto padrÃĢo de fidelidade e detalhe, e semÃĒntica sutil quando comparadas a tarefas de geraçÃĢo de imagens de objetos gerais que se concentram principalmente em texturas e cores grosseiras. AlÃĐm disso, os frameworks de síntese de imagens personalizadas nos Últimos anos, como LoRA, DreamBooth, Textual Inversion e mais, avançaram significativamente. No entanto, os modelos de IA de geraçÃĢo de imagens personalizadas ainda nÃĢo sÃĢo perfeitos para implantaçÃĢo em cenÃĄrios do mundo real, pois tÊm uma alta exigÊncia de armazenamento, exigem mÚltiplas imagens de referÊncia e frequentemente tÊm um longo processo de ajuste fino. Por outro lado, embora os mÃĐtodos baseados em incorporaçÃĢo de ID existentes exijam apenas uma Única referÊncia direta, eles ou carecem de compatibilidade com modelos prÃĐ-treinados disponíveis publicamente, ou exigem um excessivo processo de ajuste fino em numerosos parÃĒmetros, ou falham em manter alta fidelidade facial.

Para abordar esses desafios e melhorar ainda mais as capacidades de geraçÃĢo de imagens, neste artigo, vamos falar sobre o InstantID, uma soluçÃĢo baseada em modelo de difusÃĢo para geraçÃĢo de imagens. O InstantID ÃĐ um mÃģdulo plug and play que lida com geraçÃĢo de imagens e personalizaçÃĢo de forma hÃĄbil em vÃĄrios estilos com apenas uma imagem de referÊncia e tambÃĐm garante alta fidelidade. O objetivo principal deste artigo ÃĐ fornecer aos nossos leitores uma compreensÃĢo aprofundada dos fundamentos tÃĐcnicos e componentes do framework InstantID, pois teremos uma visÃĢo detalhada da arquitetura do modelo, do processo de treinamento e de cenÃĄrios de aplicaçÃĢo. Vamos começar.

InstantID: GeraçÃĢo de Imagem de PreservaçÃĢo de Identidade em Segundos


O surgimento de modelos de difusÃĢo de texto para imagem contribuiu significativamente para o avanço da tecnologia de geraçÃĢo de imagens. O objetivo principal desses modelos ÃĐ a geraçÃĢo personalizada e customizada, criando imagens com sujeito, estilo e ID de personagem consistentes usando uma ou mais imagens de referÊncia. A capacidade desses frameworks de criar imagens consistentes criou aplicaçÃĩes potenciais em diferentes indÚstrias, incluindo animaçÃĢo de imagens, geraçÃĢo de retratos de IA, E-Commerce, realidade virtual e aumentada, e muito mais.

No entanto, apesar de suas notÃĄveis capacidades, esses frameworks enfrentam um desafio fundamental: frequentemente lutam para gerar imagens personalizadas que preservam os detalhes intrincados de sujeitos humanos com precisÃĢo. É importante notar que gerar imagens personalizadas com detalhes intrincados ÃĐ uma tarefa desafiadora, pois a identidade facial humana exige um grau mais alto de fidelidade e detalhe, alÃĐm de semÃĒntica mais avançada em comparaçÃĢo com objetos gerais ou estilos que se concentram principalmente em cores ou texturas grosseiras. Os modelos de IA de geraçÃĢo de imagens existentes dependem de descriçÃĩes textuais detalhadas e lutam para alcançar relevÃĒncia semÃĒntica forte para geraçÃĢo de imagens personalizadas. AlÃĐm disso, alguns grandes frameworks de IA de geraçÃĢo de imagens prÃĐ-treinados adicionam controles de condicionamento espacial para melhorar a capacidade de controle, facilitando o controle estrutural fino usando elementos como poses, mapas de profundidade, esboços desenhados pelo usuÃĄrio, mapas de segmentaçÃĢo semÃĒntica e mais. No entanto, apesar dessas adiçÃĩes e melhorias, esses frameworks sÃĢo capazes de alcançar apenas fidelidade parcial da imagem gerada para a imagem de referÊncia.

Para superar esses obstÃĄculos, o framework InstantID se concentra na síntese de imagens de preservaçÃĢo de identidade instantÃĒnea e tenta fechar a lacuna entre eficiÊncia e alta fidelidade, introduzindo um mÃģdulo simples plug and play que permite ao framework lidar com personalizaçÃĢo de imagens usando apenas uma imagem facial Única, mantendo alta fidelidade. AlÃĐm disso, para preservar a identidade facial da imagem de referÊncia, o framework InstantID implementa um codificador de face novo que retÃĐm os detalhes intrincados da imagem, adicionando condiçÃĩes espaciais fracas e semÃĒnticas fortes que guiam o processo de geraçÃĢo de imagens, incorporando prompts textuais, imagem de referÊncia e imagem facial.

Existem trÊs recursos distintivos que separam o framework InstantID dos frameworks de geraçÃĢo de imagens de texto para imagem existentes.

  • Compatibilidade e Conectividade: Em vez de treinar os parÃĒmetros completos do framework UNet, o framework InstantID se concentra em treinar um adaptador leve. Como resultado, o framework InstantID ÃĐ compatível e conectÃĄvel com modelos prÃĐ-treinados existentes.
  • Ajuste Livre: A metodologia do framework InstantID elimina a necessidade de ajuste fino, pois precisa apenas de uma Única propagaçÃĢo direta para inferÊncia, tornando o modelo altamente prÃĄtico e econÃīmico para ajuste fino.
  • Desempenho Superior: O framework InstantID demonstra alta flexibilidade e fidelidade, pois ÃĐ capaz de entregar desempenho de estado da arte usando apenas uma imagem de referÊncia, comparÃĄvel a mÃĐtodos baseados em treinamento que dependem de mÚltiplas imagens de referÊncia.

No geral, as contribuiçÃĩes do framework InstantID podem ser categorizadas nos seguintes pontos.

  1. O framework InstantID ÃĐ um mÃĐtodo inovador de adaptaçÃĢo de preservaçÃĢo de ID para modelos de difusÃĢo de texto para imagem prÃĐ-treinados, com o objetivo de fechar a lacuna entre eficiÊncia e fidelidade.
  2. O framework InstantID ÃĐ compatível e conectÃĄvel com modelos personalizados ajustados com o mesmo modelo de difusÃĢo em sua arquitetura, permitindo a preservaçÃĢo de ID em modelos prÃĐ-treinados sem custo adicional.

InstantID: Metodologia e Arquitetura

Como mencionado anteriormente, o framework InstantID ÃĐ um adaptador leve eficiente que confere aos modelos de difusÃĢo de texto para imagem prÃĐ-treinados capacidades de preservaçÃĢo de ID sem esforço.

Falando sobre a arquitetura, o framework InstantID ÃĐ construído sobre o modelo de Stable Diffusion, renomado por sua capacidade de realizar o processo de difusÃĢo com alta eficiÊncia computacional em um espaço latente de baixa dimensÃĢo, em vez de espaço de pixel com um autoencoder. Para uma imagem de entrada, o codificador primeiro mapeia a imagem para uma representaçÃĢo latente com fator de downsampling e dimensÃĩes latentes. AlÃĐm disso, para desdenizar um ruído normalmente distribuído com ruído latente, condiçÃĢo e tempo de passo atual, o processo de difusÃĢo adota um componente de UNet de desdenizaçÃĢo. A condiçÃĢo ÃĐ uma incorporaçÃĢo de prompts textuais gerados usando um codificador de texto CLIP prÃĐ-treinado.

AlÃĐm disso, o framework InstantID tambÃĐm utiliza um componente ControlNet capaz de adicionar controle espacial a um modelo de difusÃĢo prÃĐ-treinado como sua condiçÃĢo, estendendo-se alÃĐm das capacidades tradicionais de prompts textuais. O componente ControlNet tambÃĐm integra a arquitetura UNet do framework Stable Diffusion usando uma rÃĐplica treinada do componente UNet. A rÃĐplica do componente UNet apresenta zero camadas de convoluçÃĢo dentro dos blocos mÃĐdios e dos blocos do codificador. Apesar de suas semelhanças, o componente ControlNet se distingue do modelo Stable Diffusion; eles diferem no item residual posterior. O componente ControlNet codifica informaçÃĩes de condiçÃĢo espacial, como poses, mapas de profundidade, esboços e mais, adicionando os resíduos ao bloco UNet, e entÃĢo incorpora esses resíduos na rede original.

O framework InstantID tambÃĐm se inspira no IP-Adapter ou Adaptador de Prompt de Imagem, que introduz uma abordagem nova para alcançar capacidades de prompt de imagem em paralelo com prompts textuais, sem necessidade de modificar os modelos de texto para imagem originais. O componente IP-Adapter tambÃĐm emprega uma estratÃĐgia de atençÃĢo cruzada desacoplada Única que usa camadas de atençÃĢo cruzada adicionais para incorporar as características de imagem, deixando os outros parÃĒmetros inalterados.

Metodologia

Para dar uma visÃĢo geral, o framework InstantID visa gerar imagens personalizadas com diferentes estilos ou poses usando apenas uma imagem de referÊncia de ID com alta fidelidade. A figura a seguir fornece uma visÃĢo geral do framework InstantID.

Como pode ser observado, o framework InstantID tem trÊs componentes essenciais:

  1. Um componente de incorporaçÃĢo de ID que captura informaçÃĩes semÃĒnticas robustas das características faciais na imagem.
  2. Um mÃģdulo adaptado leve com um componente de atençÃĢo cruzada desacoplada para facilitar o uso de uma imagem como prompt visual.
  3. Um componente IdentityNet que codifica as características detalhadas da imagem de referÊncia usando controle espacial adicional.

IncorporaçÃĢo de ID

Ao contrÃĄrio dos mÃĐtodos existentes, como FaceStudio, PhotoMaker, IP-Adapter e mais, que dependem de um codificador de imagem CLIP prÃĐ-treinado para extrair prompts visuais, o framework InstantID se concentra em fidelidade aprimorada e detalhes semÃĒnticos mais fortes na tarefa de preservaçÃĢo de ID. É importante notar que as limitaçÃĩes inerentes do componente CLIP residem principalmente em seu processo de treinamento em dados fracamente alinhados, significando que as características codificadas do codificador CLIP capturam principalmente informaçÃĩes semÃĒnticas amplas e ambíguas, como cores, estilo e composiçÃĢo. Embora essas características possam atuar como suplemento geral para incorporaçÃĩes de texto, elas nÃĢo sÃĢo adequadas para tarefas de preservaçÃĢo de ID precisas que enfatizam fortemente semÃĒntica e alta fidelidade. AlÃĐm disso, pesquisas recentes em modelos de representaçÃĢo facial, especialmente em torno do reconhecimento facial, demonstraram a eficiÊncia da representaçÃĢo facial em tarefas complexas, incluindo reconstruçÃĢo e reconhecimento facial. Com base nisso, o framework InstantID visa aproveitar um modelo de face prÃĐ-treinado para detectar e extrair incorporaçÃĩes de ID de face da imagem de referÊncia, guiando o modelo para geraçÃĢo de imagens.

Adaptador de Imagem

A capacidade dos modelos de difusÃĢo de texto para imagem prÃĐ-treinados em tarefas de prompt de imagem melhora significativamente os prompts textuais, especialmente em cenÃĄrios que nÃĢo podem ser descritos adequadamente por prompts textuais. O framework InstantID adota uma estratÃĐgia semelhante à usada pelo modelo IP-Adapter para prompt de imagem, que introduz um mÃģdulo adaptado leve emparelhado com um componente de atençÃĢo cruzada desacoplada para suportar imagens como prompts de entrada. No entanto, contrariamente às incorporaçÃĩes CLIP alinhadas grosseiramente, o framework InstantID se distancia ao empregar incorporaçÃĩes de ID como prompts de imagem em uma tentativa de alcançar uma integraçÃĢo de prompt mais rica e sutil semanticamente.

IdentityNet

Embora os mÃĐtodos existentes sejam capazes de integrar prompts de imagem com prompts textuais, o framework InstantID argumenta que esses mÃĐtodos apenas melhoram características grosseiras com um nível de integraçÃĢo que ÃĐ insuficiente para geraçÃĢo de imagens de preservaçÃĢo de ID. AlÃĐm disso, adicionar tokens de imagem e texto em camadas de atençÃĢo cruzada diretamente tende a enfraquecer o controle dos tokens de texto, e uma tentativa de melhorar a força dos tokens de imagem pode resultar em prejudicar as capacidades dos tokens de texto em tarefas de ediçÃĢo. Para contrariar esses desafios, o framework InstantID opta por ControlNet, um mÃĐtodo de incorporaçÃĢo de recurso alternativo que utiliza informaçÃĩes espaciais como entrada para o mÃģdulo controlÃĄvel, permitindo que ele mantenha consistÊncia com as configuraçÃĩes UNet nos modelos de difusÃĢo.

O framework InstantID faz duas alteraçÃĩes na arquitetura tradicional do ControlNet: para entradas condicionais, o framework InstantID opta por 5 pontos de referÊncia faciais em vez de pontos de referÊncia faciais OpenPose finos. Em segundo lugar, o framework InstantID usa incorporaçÃĩes de ID em vez de prompts textuais como condiçÃĩes para as camadas de atençÃĢo cruzada na arquitetura ControlNet.

Treinamento e InferÊncia

Durante a fase de treinamento, o framework InstantID otimiza os parÃĒmetros do IdentityNet e do Adaptador de Imagem, congelando os parÃĒmetros do modelo de difusÃĢo prÃĐ-treinado. A pipeline completa do InstantID ÃĐ treinada em pares de imagem-texto que apresentam sujeitos humanos e emprega um objetivo de treinamento semelhante ao usado no framework de difusÃĢo estÃĄvel, com condiçÃĩes de imagem específicas da tarefa. O destaque do mÃĐtodo de treinamento do InstantID ÃĐ a separaçÃĢo entre as camadas de atençÃĢo cruzada de imagem e texto dentro do adaptador de prompt de imagem, uma escolha que permite ao framework InstantID ajustar os pesos dessas condiçÃĩes de imagem de forma flexível e independente, garantindo um processo de inferÊncia e treinamento mais direcionado e controlado.

InstantID: Experimentos e Resultados

O framework InstantID implementa o Stable Diffusion e o treina no LAION-Face, um conjunto de dados de grande escala e cÃģdigo aberto que consiste em mais de 50 milhÃĩes de pares de imagem-texto. AlÃĐm disso, o framework InstantID coleta mais de 10 milhÃĩes de imagens humanas com automaçÃĢo geradas automaticamente pelo modelo BLIP2 para melhorar ainda mais a qualidade da geraçÃĢo de imagens. O framework InstantID se concentra principalmente em imagens de uma Única pessoa e emprega um modelo de face prÃĐ-treinado para detectar e extrair incorporaçÃĩes de ID de face de imagens humanas, e, em vez de treinar conjuntos de dados de face recortados, treina as imagens humanas originais. AlÃĐm disso, durante o treinamento, o framework InstantID congela o modelo de texto para imagem prÃĐ-treinado e atualiza apenas os parÃĒmetros do IdentityNet e do Adaptador de Imagem.

GeraçÃĢo de Imagem Apenas

O modelo InstantID usa um prompt vazio para guiar o processo de geraçÃĢo de imagens usando apenas a imagem de referÊncia, e os resultados sem prompts sÃĢo demonstrados na imagem a seguir.

A geraçÃĢo de ‘Prompt Vazio’ demonstrada na imagem acima mostra a capacidade do framework InstantID de manter características faciais semÃĒnticas ricas, como identidade, idade e expressÃĢo, de forma robusta. No entanto, ÃĐ importante notar que usar prompts vazios pode nÃĢo ser capaz de replicar os resultados em outras semÃĒnticas, como gÊnero, com precisÃĢo. AlÃĐm disso, na imagem acima, as colunas 2 a 4 usam uma imagem e um prompt, e, como pode ser visto, a imagem gerada nÃĢo demonstra degradaçÃĢo nas capacidades de controle de texto e tambÃĐm garante consistÊncia de identidade. Finalmente, as colunas 5 a 9 usam uma imagem, um prompt e controle espacial, demonstrando a compatibilidade do modelo com modelos de controle espacial prÃĐ-treinados, permitindo que o modelo InstantID introduza controles espaciais de forma flexível usando um componente ControlNet prÃĐ-treinado.

TambÃĐm ÃĐ importante notar que o nÚmero de imagens de referÊncia tem um impacto significativo na imagem gerada, como demonstrado na imagem acima. Embora o framework InstantID seja capaz de entregar bons resultados usando uma Única imagem de referÊncia, mÚltiplas imagens de referÊncia produzem uma imagem de melhor qualidade, pois o framework InstantID calcula a mÃĐdia das incorporaçÃĩes de ID como prompt de imagem. Em seguida, ÃĐ essencial comparar o framework InstantID com mÃĐtodos anteriores que geram imagens personalizadas usando uma Única imagem de referÊncia. A figura a seguir compara os resultados gerados pelo framework InstantID e modelos de estado da arte existentes para geraçÃĢo de imagens personalizadas com uma Única referÊncia.

Como pode ser visto, o framework InstantID ÃĐ capaz de preservar características faciais graças à incorporaçÃĢo de ID que carrega informaçÃĩes semÃĒnticas ricas, como identidade, idade e gÊnero. Pode-se dizer com segurança que o framework InstantID supera os frameworks existentes em geraçÃĢo de imagens personalizadas, pois ÃĐ capaz de preservar a identidade humana, mantendo controle e flexibilidade estilística.

Pensamentos Finais

Neste artigo, falamos sobre o InstantID, uma soluçÃĢo baseada em modelo de difusÃĢo para geraçÃĢo de imagens. O InstantID ÃĐ um mÃģdulo plug and play que lida com geraçÃĢo de imagens e personalizaçÃĢo de forma hÃĄbil em vÃĄrios estilos com apenas uma imagem de referÊncia e tambÃĐm garante alta fidelidade. O framework InstantID se concentra na síntese de imagens de preservaçÃĢo de identidade instantÃĒnea e tenta fechar a lacuna entre eficiÊncia e alta fidelidade, introduzindo um mÃģdulo simples plug and play que permite ao framework lidar com personalizaçÃĢo de imagens usando apenas uma imagem facial Única, mantendo alta fidelidade. O InstantID ÃĐ um framework que se concentra em geraçÃĢo de imagens de preservaçÃĢo de identidade instantÃĒnea, e tenta fechar a lacuna entre eficiÊncia e alta fidelidade, introduzindo um mÃģdulo simples plug and play que permite ao framework lidar com personalizaçÃĢo de imagens usando apenas uma imagem facial Única, mantendo alta fidelidade. ty. O framework InstantID se concentra em geraçÃĢo de imagens de preservaçÃĢo de identidade instantÃĒnea, e tenta fechar a lacuna entre eficiÊncia e alta fidelidade, introduzindo um mÃģdulo simples plug and play que permite ao framework lidar com personalizaçÃĢo de imagens usando apenas uma imagem facial Única, mantendo alta fidelidade.

Um engenheiro por profissÃĢo, um escritor por coraçÃĢo. Kunal ÃĐ um escritor tÃĐcnico com um amor e compreensÃĢo profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentaçÃĢo envolvente e informativa.