Modelos e plataformas de IA

EasyPhoto: Seu Gerador de Fotos de IA Pessoal

mm
Adicione Unite.AI às suas fontes preferidas no Google
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web User Interface, ou SD-WebUI, é um projeto abrangente para modelos de Stable Diffusion que utiliza a biblioteca Gradio para fornecer uma interface de navegador. Hoje, vamos falar sobre o EasyPhoto, um plugin de WebUI inovador que permite aos usuários finais gerar retratos e imagens de IA. O plugin de WebUI do EasyPhoto cria retratos de IA usando vários modelos, suportando diferentes estilos de foto e múltiplas modificações. Além disso, para aumentar ainda mais as capacidades do EasyPhoto, os usuários podem gerar imagens usando o modelo SDXL para obter resultados mais satisfatórios, precisos e diversificados. Vamos começar.

Introdução ao EasyPhoto e ao Stable Diffusion

O framework de Stable Diffusion é um framework de geração de difusão popular e robusto usado por desenvolvedores para gerar imagens realistas com base em descrições de texto de entrada. Graças às suas capacidades, o framework de Stable Diffusion tem uma ampla gama de aplicações, incluindo pintura de imagem, preenchimento de imagem e tradução de imagem para imagem. A interface de usuário da Web de Stable Diffusion, ou SD-WebUI, se destaca como uma das aplicações mais populares e conhecidas desse framework. Ela apresenta uma interface de navegador construída na biblioteca Gradio, fornecendo uma interface interativa e amigável para os modelos de Stable Diffusion. Para aumentar ainda mais o controle e a usabilidade na geração de imagens, a SD-WebUI integra numerousas aplicações de Stable Diffusion.

Devido à conveniência oferecida pelo framework da SD-WebUI, os desenvolvedores do framework do EasyPhoto decidiram criá-lo como um plugin da Web em vez de um aplicativo completo. Em contraste com os métodos existentes que frequentemente sofrem perda de identidade ou introduzem recursos irreais nas imagens, o framework do EasyPhoto aproveita as capacidades de imagem para imagem dos modelos de Stable Diffusion para produzir imagens precisas e realistas. Os usuários podem facilmente instalar o framework do EasyPhoto como uma extensão dentro da WebUI, aumentando a usabilidade e acessibilidade para uma ampla gama de usuários. O framework do EasyPhoto permite que os usuários gerem retratos de IA guiados por identidade, de alta qualidade e realistas que se assemelham estreitamente à identidade de entrada.

Primeiramente, o framework do EasyPhoto pede aos usuários que criem seu duplo digital carregando algumas imagens para treinar um modelo de LoRA ou Adaptação de Baixo Nível online. O framework de LoRA ajusta rapidamente os modelos de difusão usando a tecnologia de adaptação de baixo nível. Esse processo permite que o modelo base entenda as informações de ID de usuários específicos. Os modelos treinados são então mesclados e integrados ao modelo de Stable Diffusion de base para interferência. Além disso, durante o processo de interferência, o modelo usa modelos de difusão estável em uma tentativa de repintar as regiões faciais no modelo de interferência, e a semelhança entre as imagens de entrada e saída é verificada usando as várias unidades de ControlNet.

O framework do EasyPhoto também implanta um processo de difusão em duas etapas para lidar com problemas potenciais como artefatos de limite e perda de identidade, garantindo que as imagens geradas minimizem as inconsistências visuais ao mesmo tempo em que mantêm a identidade do usuário. Além disso, o pipeline de interferência no framework do EasyPhoto não é limitado apenas à geração de retratos, mas também pode ser usado para gerar qualquer coisa relacionada à ID do usuário. Isso implica que, uma vez que você treine o modelo de LoRA para uma ID específica, você pode gerar uma ampla gama de imagens de IA, e, portanto, pode ter aplicações generalizadas, incluindo provas virtuais.

Para resumir, o framework do EasyPhoto

  1. Propõe uma abordagem nova para treinar o modelo de LoRA incorporando vários modelos de LoRA para manter a fidelidade facial das imagens geradas.
  2. Faz uso de vários métodos de aprendizado por reforço para otimizar os modelos de LoRA para recompensas de identidade facial que ajudam a melhorar a semelhança de identidades entre as imagens de treinamento e os resultados gerados.
  3. Propõe um processo de difusão baseado em inpintura em duas etapas que visa gerar fotos de IA com alta estética e semelhança.

EasyPhoto: Arquitetura e Treinamento

A figura a seguir demonstra o processo de treinamento do framework de IA do EasyPhoto.

Como pode ser visto, o framework primeiro pede aos usuários que forneçam as imagens de treinamento e, em seguida, realiza a detecção de face para detectar as localizações da face. Uma vez que o framework detecta a face, ele recorta a imagem de entrada usando uma razão específica pré-definida que se concentra apenas na região facial. O framework, em seguida, implanta um modelo de beleza de pele e um modelo de detecção de saliência para obter uma imagem de treinamento de face limpa e clara. Esses dois modelos desempenham um papel crucial na melhoria da qualidade visual da face e também garantem que as informações de fundo tenham sido removidas e a imagem de treinamento contenha predominantemente a face. Finalmente, o framework usa essas imagens processadas e as prompts de entrada para treinar o modelo de LoRA, equipando-o com a capacidade de compreender melhor as características faciais específicas do usuário.

Além disso, durante a fase de treinamento, o framework inclui uma etapa de validação crítica, na qual o framework calcula a lacuna de ID de face entre a imagem de entrada do usuário e a imagem de verificação gerada pelo modelo de LoRA treinado. A etapa de validação é um processo fundamental que desempenha um papel importante na obtenção da fusão dos modelos de LoRA, garantindo que o modelo de LoRA treinado se transforme em um duplo, ou uma representação digital precisa do usuário. Além disso, a imagem de verificação que tem a pontuação de face_id ótima será selecionada como a imagem de face_id, e essa imagem de face_id será usada para melhorar a semelhança de identidade da geração de interferência.

Avançando, com base no processo de ensemble, o framework treina os modelos de LoRA com a estimativa de probabilidade como o objetivo principal, enquanto a preservação da semelhança de identidade facial é o objetivo downstream. Para lidar com isso, o framework do EasyPhoto faz uso de técnicas de aprendizado por reforço para otimizar o objetivo downstream diretamente. Como resultado, as características faciais que os modelos de LoRA aprendem mostram melhoria que leva a uma semelhança aprimorada entre os resultados gerados pelo modelo e também demonstra a generalização em modelos.

Processo de Interferência

A figura a seguir demonstra o processo de interferência para um ID de usuário individual no framework do EasyPhoto e é dividido em três partes

  • Pré-processamento de Face para obter a referência de ControlNet e a imagem de entrada pré-processada.
  • Primeira Difusão que ajuda a gerar resultados grosseiros que se assemelham à entrada do usuário.
  • Segunda Difusão que corrige os artefatos de limite, tornando as imagens mais precisas e realistas.

Para a entrada, o framework usa uma imagem de face_id (gerada durante a validação do treinamento usando a pontuação de face_id ótima) e um modelo de interferência. A saída é um retrato altamente detalhado, preciso e realista do usuário, e se assemelha estreitamente à identidade e aparência única do usuário com base no modelo de interferência. Vamos dar uma olhada detalhada nesses processos.

Pré-processamento de Face

Uma maneira de gerar um retrato de IA com base em um modelo de interferência sem raciocínio consciente é usar o modelo de SD para preencher a região facial no modelo de interferência. Além disso, adicionar o framework de ControlNet ao processo não apenas melhora a preservação da identidade do usuário, mas também melhora a semelhança entre as imagens geradas. No entanto, usar ControlNet diretamente para preenchimento regional pode introduzir problemas potenciais que podem incluir

  • Inconsistência entre a Imagem de Entrada e a Imagem Gerada: É evidente que os pontos-chave na imagem do modelo não são compatíveis com os pontos-chave na imagem de face_id, o que é por que usar ControlNet com a imagem de face_id como referência pode levar a algumas inconsistências na saída.
  • Defeitos na Região de Preenchimento: Mascarar uma região e, em seguida, preenchê-la com um novo rosto pode levar a defeitos notáveis, especialmente ao longo da borda de preenchimento, o que não apenas afetará a autenticidade da imagem gerada, mas também afetará negativamente a realidade da imagem.
  • Perda de Identidade por Control Net: Como o processo de treinamento não utiliza o framework de ControlNet, usá-lo durante a fase de interferência pode afetar a capacidade dos modelos de LoRA treinados de preservar a identidade do usuário.

Para lidar com os problemas mencionados acima, o framework do EasyPhoto propõe três procedimentos.

  • Alinhar e Colar: Usando um algoritmo de colagem de face, o framework do EasyPhoto visa lidar com o problema de incompatibilidade entre marcos faciais entre a face_id e o modelo. Primeiramente, o modelo calcula os marcos faciais da face_id e da imagem do modelo, após o que o modelo determina a matriz de transformação afim que será usada para alinhar os marcos faciais da imagem do modelo com a face_id. A imagem resultante retém os mesmos marcos da face_id e também se alinha com a imagem do modelo.
  • Fusão de Face: Fusão de Face é uma abordagem nova usada para corrigir os artefatos de limite resultantes do preenchimento de máscara, e envolve a retificação de artefatos usando o framework de ControlNet. O método permite que o framework do EasyPhoto garanta a preservação de bordas harmônicas e, portanto, orienta o processo de geração de imagens. O algoritmo de fusão de face também funde a imagem roop (imagens de usuário reais) e o modelo, permitindo que a imagem resultante exiba melhor estabilização das bordas, o que leva a uma saída aprimorada durante a primeira etapa de difusão.
  • Validação Orientada por ControlNet: Como os modelos de LoRA não foram treinados usando o framework de ControlNet, usá-lo durante o processo de inferência pode afetar a capacidade do modelo de LoRA de preservar as identidades. Para melhorar as capacidades de generalização do EasyPhoto, o framework considera a influência do framework de ControlNet e incorpora modelos de LoRA de diferentes estágios.

Primeira Difusão

A primeira etapa de difusão usa a imagem do modelo para gerar uma imagem com um ID único que se assemelha à identidade do usuário de entrada. A imagem de entrada é uma fusão da imagem de entrada do usuário e da imagem do modelo, enquanto a máscara facial calibrada é a máscara de entrada. Para aumentar ainda mais o controle sobre a geração de imagens, o framework do EasyPhoto integra três unidades de ControlNet, onde a primeira unidade de ControlNet se concentra no controle das imagens fundidas, a segunda unidade de ControlNet controla as cores da imagem fundida e a terceira unidade de ControlNet é a pose (controle de pose humana em tempo real) da imagem substituída que não apenas contém a estrutura facial da imagem do modelo, mas também a identidade facial do usuário.

Segunda Difusão

Na segunda etapa de difusão, os artefatos perto da borda da face são refinados e ajustados, além de fornecer aos usuários a flexibilidade de mascarar uma região específica na imagem para aumentar a eficácia da geração dentro daquela área dedicada. Nessa etapa, o framework funde a imagem de saída obtida da primeira etapa de difusão com a imagem roop ou o resultado da imagem do usuário, gerando a imagem de entrada para a segunda etapa de difusão. No geral, a segunda etapa de difusão desempenha um papel crucial na melhoria da qualidade geral e dos detalhes da imagem gerada.

Múltiplos IDs de Usuário

Um dos destaques do EasyPhoto é seu suporte à geração de múltiplos IDs de usuário, e a figura abaixo demonstra o pipeline do processo de interferência para múltiplos IDs de usuário no framework do EasyPhoto.

Para fornecer suporte à geração de múltiplos IDs de usuário, o framework do EasyPhoto primeiro realiza a detecção de face no modelo de interferência. Esses modelos de interferência são então divididos em várias máscaras, onde cada máscara contém apenas uma face, e o resto da imagem é mascarado em branco, tornando a geração de múltiplos IDs de usuário em uma tarefa simples de gerar IDs de usuário individuais. Uma vez que o framework gera as imagens de ID de usuário, essas imagens são mescladas no modelo de interferência, facilitando uma integração sem problemas das imagens do modelo com as imagens geradas, o que resulta em uma imagem de alta qualidade.

Experimentos e Resultados

Agora que temos uma compreensão do framework do EasyPhoto, é hora de explorar o desempenho do framework do EasyPhoto.

A imagem acima é gerada pelo plugin do EasyPhoto e usa um modelo de SD baseado em estilo para a geração de imagens. Como pode ser observado, as imagens geradas parecem realistas e são bastante precisas.

A imagem adicionada acima é gerada pelo framework do EasyPhoto usando um modelo de SD baseado em estilo de quadrinhos. Como pode ser visto, as fotos de quadrinhos e as fotos realistas parecem bastante realistas e se assemelham estreitamente à imagem de entrada com base nas prompts ou requisitos do usuário.

A imagem adicionada abaixo foi gerada pelo framework do EasyPhoto usando um modelo de múltiplas pessoas. Como pode ser claramente visto, as imagens geradas são claras, precisas e se assemelham à imagem original.

Com a ajuda do EasyPhoto, os usuários agora podem gerar uma ampla gama de retratos de IA, ou gerar múltiplos IDs de usuário usando modelos preservados, ou usar o modelo de SD para gerar modelos de interferência. As imagens adicionadas acima demonstram a capacidade do framework do EasyPhoto em produzir imagens de IA diversificadas e de alta qualidade.

Conclusão

Neste artigo, falamos sobre o EasyPhoto, um plugin de WebUI inovador que permite aos usuários finais gerar retratos e imagens de IA. O plugin de WebUI do EasyPhoto gera retratos de IA usando modelos arbitrários e o suporte atual do plugin de WebUI do EasyPhoto inclui diferentes estilos de foto e múltiplas modificações. Além disso, para aumentar ainda mais as capacidades do EasyPhoto, os usuários têm a flexibilidade de gerar imagens usando o modelo SDXL para obter resultados mais satisfatórios, precisos e diversificados. O framework do EasyPhoto utiliza um modelo de difusão estável de base acoplado a um modelo de LoRA pré-treinado que produz saídas de imagem de alta qualidade.

Interessado em geradores de imagens? Também fornecemos uma lista dos Melhores Geradores de Retratos de IA e os Melhores Geradores de Imagens de IA que são fáceis de usar e não exigem conhecimento técnico.

Um engenheiro por profissão, um escritor por coração. Kunal é um escritor técnico com um amor e compreensão profundos de AI e ML, dedicado a simplificar conceitos complexos nestes campos por meio de sua documentação envolvente e informativa.