AI-modeller og platforme

EasyPhoto: Din personlige AI-foto-generator

mm
Føj Unite.AI til dine foretrukne kilder på Google
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web-brugergrænseflade, eller SD-WebUI, er et omfattende projekt til Stable Diffusion-modeller, der udnytter Gradio-biblioteket til at give en browsergrænseflade. I dag skal vi tale om EasyPhoto, en innovativ WebUI-plugin, der giver slutbrugerne mulighed for at generere AI-portrætter og billeder. EasyPhoto WebUI-plugin genererer AI-portrætter ved hjælp af forskellige skabeloner, der understøtter forskellige foto-stilarter og multiple ændringer. Desuden kan brugerne generere billeder ved hjælp af SDXL-modellen for at opnå mere tilfredsstillende, præcise og varierede resultater. Lad os begynde.

En introduktion til EasyPhoto og Stable Diffusion

Stable Diffusion-rammen er en populær og robust diffusion-baseret genereringsramme, der bruges af udviklere til at generere realistiske billeder baseret på tekstbeskrivelser. Takket være dens evner har Stable Diffusion-rammen en bred vifte af anvendelser, herunder billedudmaling, billedindmaling og billed-til-billed-oversættelse. Stable Diffusion Web UI, eller SD-WebUI, er en af de mest populære og kendte anvendelser af denne ramme. Den har en browsergrænseflade bygget på Gradio-biblioteket, der giver en interaktiv og brugervenlig grænseflade til Stable Diffusion-modeller. For at forbedre kontrollen og brugervenligheden i billedgenerering integrerer SD-WebUI flere Stable Diffusion-applikationer.

På grund af den bekvemmelighed, der tilbydes af SD-WebUI-rammen, besluttede udviklerne af EasyPhoto-rammen at oprette den som en web-plugin i stedet for en selvstændig applikation. I modsætning til eksisterende metoder, der ofte lider af identitetstab eller introducerer urealistiske funktioner i billeder, udnytter EasyPhoto-rammen billed-til-billed-kapaciteterne i Stable Diffusion-modellerne til at producere præcise og realistiske billeder. Brugerne kan let installere EasyPhoto-rammen som en udvidelse inden for WebUI, hvilket forbedrer brugervenligheden og tilgængeligheden for en bredere vifte af brugere. EasyPhoto-rammen giver brugerne mulighed for at generere identitetsrettet, højkvalitets- og realistiske AI-portrætter, der ligner input-identiteten.

Først beder EasyPhoto-rammen brugerne om at oprette deres digitale dobbeltgænger ved at uploade nogle billeder for at træne en face LoRA eller Low-Rank Adaptation-model online. LoRA-rammen finjusterer hurtigt diffusion-modellerne ved at anvende lav-rang-tilpasnings-teknologi. Dette proces giver den basale model mulighed for at forstå ID-informationen omkring specifikke brugere. De trænede modeller bliver derefter sammenføjet og integreret i den basale Stable Diffusion-model til interferens. Desuden under interferensprocessen anvender modellen stable diffusion-modeller i et forsøg på at genmale de ansigtsområder i interferens-skabelonen, og ligheden mellem input- og output-billeder verificeres ved hjælp af forskellige ControlNet-enheder.

EasyPhoto-rammen anvender også en to-trins diffusion-proces for at tackle potentielle problemer som grænse-artefakter og identitetstab, hvilket sikrer, at de genererede billeder minimiserer visuelle inkonsistenser, mens brugerens identitet opretholdes. Desuden er interferens-røret i EasyPhoto-rammen ikke kun begrænset til at generere portrætter, men kan også anvendes til at generere noget, der er relateret til brugerens ID. Dette indebærer, at når du træner LoRA-modellen for en bestemt ID, kan du generere en bred vifte af AI-billeder, og det kan have vidtrækkende anvendelser, herunder virtuelle prøver.

For at sammenfatte, foreslår EasyPhoto-rammen

  1. En ny tilgang til at træne LoRA-modellen ved at inkorporere flere LoRA-modeller for at opretholde ansigtets trofasthed i de genererede billeder.
  2. Anvender forskellige forstærkning-læringsmetoder til at optimere LoRA-modellerne for ansigtets identitetsbelønninger, hvilket yderligere hjælper med at forbedre ligheden mellem identiteterne i træningsbillederne og resultaterne.
  3. Foreslår en dobbelt-trins indmaling-baseret diffusion-proces, der sigter mod at generere AI-fotografier med høj æstetik og lighed.

EasyPhoto: Arkitektur & Træning

Den følgende figur demonstrerer træningsprocessen for EasyPhoto AI-rammen.

Som det kan ses, beder rammen først brugerne om at indtaste træningsbillederne og derefter udfører ansigtsgenkendelse for at detectere ansigtslokationerne. Når rammen har detecteret ansigtet, beskærer den input-billedet ved hjælp af en foruddefineret bestemt ratio, der fokuserer udelukkende på ansigtsområdet. Rammen anvender derefter en hudforbedrings- og en saliencedetektionsmodel til at få et rent og klart ansigtstræningsbillede. Disse to modeller spiller en afgørende rolle i at forbedre den visuelle kvalitet af ansigtet og sikre, at baggrundsinformationen er fjernet, og træningsbilledet primært indeholder ansigtet. Til sidst anvender rammen disse bearbejdede billeder og input-prompter til at træne LoRA-modellen, hvilket giver den mulighed for at forstå bruger-specifikke ansigtstræk mere effektivt og præcist.

Desuden under træningsfasen inkluderer rammen en kritisk validerings-trin, hvor rammen beregner ansigt-ID-gapet mellem bruger-input-billedet og verificationsbilledet, der er genereret af den trænede LoRA-model. Validerings-trinet er en fundamental proces, der spiller en afgørende rolle i at opnå fusionen af LoRA-modellerne, hvilket ultimativt sikrer, at den trænede LoRA-ramme forvandler sig til en dobbeltgænger eller en præcis digital repræsentation af brugeren. Desuden vil verificationsbilledet med den optimale face_id-score vælges som face_id-billedet, og dette face_id-billede vil derefter anvendes til at forbedre identitetssammenhængen i interferens-genereringen.

Herefter, baseret på ensemble-processen, træner rammen LoRA-modellerne med sandsynligheds-estimation som det primære mål, mens bevarelse af ansigtets identitetssammenhæng er det nedstrøms-mål. For at tackle dette problem anvender EasyPhoto-rammen forstærkning-lærings-teknikker til at optimere det nedstrøms-mål direkte.Som resultat viser de ansigtstræk, som LoRA-modellerne lærer, forbedring, der fører til en forbedret lighed mellem skabelon-genererede resultater og demonstrerer generalisering på tværs af skabeloner.

Interferens-proces

Den følgende figur demonstrerer interferens-processen for en enkelt bruger-ID i EasyPhoto-rammen og er inddelt i tre dele

  • Ansigt-forbehandling for at få ControlNet-referencen og det forbehandlede input-billede.
  • Første diffusion der hjælper med at generere grove resultater, der ligner bruger-input.
  • Anden diffusion der retter grænse-artefakterne, hvilket gør billederne mere præcise og realistiske.

For input anvender rammen et face_id-billede (genereret under trænings-validering med den optimale face_id-score) og en interferens-skabelon. Outputtet er et højdetaljeret, præcist og realistisk portræt af brugeren, der ligner identiteten og det unikke udseende af brugeren på basis af interferens-skabelonen. Lad os se nærmere på disse processer.

Ansigt-forbehandling

En måde at generere et AI-portræt baseret på en interferens-skabelon uden bevidst grund til at bruge SD-modellen til at indmale ansigtet i interferens-skabelonen. Desuden tilføjer ControlNet-rammen processen ikke kun bevarelse af bruger-identitet, men også forbedrer ligheden mellem de genererede billeder. Men anvendelse af ControlNet direkte til regional indmaling kan introducere potentielle problemer, der kan inkludere

  • Inkonsistens mellem input og genereret billede: Det er tydeligt, at nøglepunkterne i skabelon-billedet ikke er kompatible med nøglepunkterne i face_id-billedet, hvilket er hvorfor anvendelse af ControlNet med face_id-billedet som reference kan føre til nogle inkonsistenser i outputtet.
  • Defekter i indmaling-området: Maskering af et område og derefter indmaling af det med et nyt ansigt kan føre til synlige defekter, især langs indmaling-grænsen, hvilket ikke kun vil påvirke billedets ægthed, men også påvirke billedets realisme.
  • Identitetstab ved Control Net: Da træningsprocessen ikke anvender ControlNet-rammen, kan anvendelse af ControlNet under interferens-fasen påvirke evnen af den trænede LoRA-model til at bevare input-bruger-ID’et.

For at tackle de nævnte problemer foreslår EasyPhoto-rammen tre procedurer.

  • Align og Paste: Ved at anvende en ansigt-klæb-algoritme sigter EasyPhoto-rammen mod at tackle problemet med mismatch mellem ansigt-landemærker mellem face_id og skabelon. Først beregner modellen ansigt-landemærkerne for face_id og skabelon-billedet, hvorefter modellen bestemmer den affine-transformation-matrix, der vil blive anvendt til at alignere ansigt-landemærkerne i skabelon-billedet med face_id-billedet. Det resulterende billede bevarer de samme landemærker som face_id-billedet og alignerer med skabelon-billedet.
  • Ansigt-fusion: Ansigt-fusion er en ny tilgang, der anvendes til at korrigere grænse-artefakter, der skyldes mask-indmaling, og det indebærer rettelse af artefakter ved hjælp af ControlNet-rammen. Metoden giver EasyPhoto-rammen mulighed for at sikre bevarelse af harmoniske kanter og guider derefter billed-genererings-processen. Ansigt-fusions-algoritmen fusionerer yderligere roop (ground truth-bruger-billeder) og skabelon-billedet, hvilket giver det resulterende fusionerede billede bedre stabilisering af kant-grænser, der derefter fører til en forbedret output under den første diffusion-trin.
  • ControlNet-guidet validering: Da LoRA-modellerne ikke blev trænet med ControlNet-rammen, kan anvendelse af den under interferens-processen påvirke evnen af LoRA-modellen til at bevare identiteterne. For at forbedre generaliserings-evnerne i EasyPhoto-rammen tager rammen ControlNet-rammens indflydelse i betragtning og inkorporerer LoRA-modeller fra forskellige stadier.

Første diffusion

Den første diffusion-trin anvender skabelon-billedet til at generere et billede med en unik ID, der ligner input-bruger-ID’et. Input-billedet er en fusion af bruger-input-billedet og skabelon-billedet, mens den justerede ansigt-maske er input-maske. For yderligere at øge kontrollen over billed-generering integrerer EasyPhoto-rammen tre ControlNet-enheder, hvor den første ControlNet-enhed fokuserer på kontrol af de fusionerede billeder, den anden ControlNet-enhed kontrollerer farverne i de fusionerede billeder, og den sidste ControlNet-enhed er openpose (real-time multi-person human pose-kontrol) af det erstattede billede, der ikke kun indeholder ansigtets struktur i skabelon-billedet, men også brugerens ansigt-identitet.

Anden diffusion

I den anden diffusion-trin forfineres artefakterne nær ansigtets grænse og gives brugerne mulighed for at maskere et bestemt område i billedet for at forbedre effekten af generering inden for det dedikerede område. I denne trin fusionerer rammen output-billedet fra den første diffusion-trin med roop-billedet eller resultatet af brugerens billede, hvilket genererer input-billedet til den anden diffusion-trin. Samlet set spiller den anden diffusion-trin en afgørende rolle i at forbedre den overordnede kvalitet og detaljerne i det genererede billede.

Flere bruger-ID’er

En af EasyPhoto’s højdepunkter er dens understøttelse af generering af flere bruger-ID’er, og figuren nedenfor demonstrerer pipeline’en for interferens-processen for flere bruger-ID’er i EasyPhoto-rammen.

For at give understøttelse til generering af flere bruger-ID’er først udfører EasyPhoto-rammen ansigtsgenkendelse på interferens-skabelonen. Disse interferens-skabeloner deles derefter op i flere masker, hvor hver maske indeholder kun ét ansigt, og resten af billedet er maskeret i hvidt, hvilket omdanner genereringen af flere bruger-ID’er til en simpel opgave med at generere enkelt-bruger-ID’er. Når rammen har genereret bruger-ID-billederne, bliver disse billeder sammenføjet med interferens-skabelonen, hvilket giver en samlet integration af skabelon-billederne med de genererede billeder, der ultimativt resulterer i et højkvalitetsbillede.

Eksperimenter og resultater

Nu, hvor vi har en forståelse af EasyPhoto-rammen, er det tid til, at vi udforsker EasyPhoto-rammens præstation.

Det ovenstående billede er genereret af EasyPhoto-plugin’et og anvender en Style-baseret SD-model til billed-generering. Som det kan ses, ligner de genererede billeder realistiske og er ret præcise.

Billedet ovenfor er genereret af EasyPhoto-rammen ved hjælp af en Comic Style-baseret SD-model. Som det kan ses, ligner både comic-fotografierne og de realistiske fotografier ret realistiske og ligner input-billedet på basis af brugerens prompter eller krav.

Billedet nedenfor er genereret af EasyPhoto-rammen ved hjælp af en Multi-Person-skabelon. Som det kan ses, er de genererede billeder klare, præcise og ligner det originale billede.

Med EasyPhoto kan brugerne nu generere en bred vifte af AI-portrætter eller generere flere bruger-ID’er ved hjælp af bevarede skabeloner eller anvende SD-modellen til at generere interferens-skabeloner. Billederne ovenfor demonstrerer EasyPhoto-rammens evne til at producere diverse og højkvalitets-AI-billeder.

Konklusion

I denne artikel har vi talt om EasyPhoto, en ny WebUI-plugin, der giver slutbrugerne mulighed for at generere AI-portrætter og billeder. EasyPhoto WebUI-plugin genererer AI-portrætter ved hjælp af vilkårlige skabeloner, og den nuværende implikation af EasyPhoto WebUI understøtter forskellige foto-stilarter og multiple ændringer. Desuden kan brugerne generere billeder ved hjælp af SDXL-modellen for at opnå mere tilfredsstillende, præcise og varierede billeder. EasyPhoto-rammen anvender en stabil diffusion-basemodel kombineret med en forudtrænet LoRA-model, der producerer højkvalitets-billeder.

Interesseret i billed-generering? Vi tilbyder også en liste over de bedste AI-headshot-genereringer og de bedste AI-billed-genereringer, der er lette at bruge og kræver ingen teknisk ekspertise.

En ingeniør af profession, en forfatter af hjerte. Kunal er en teknisk forfatter med en dyb kærlighed og forståelse af AI og ML, dedikeret til at forenkle komplekse koncepter inden for disse felter gennem sin engagerende og informative dokumentation.