AI-modeller og platforme
EasyPhoto: Din personlige AI-foto-generator

Stable Diffusion Web-brugergrænseflade, eller SD-WebUI, er et omfattende projekt til Stable Diffusion-modeller, der udnytter Gradio-biblioteket til at give en browsergrænseflade. I dag skal vi tale om EasyPhoto, en innovativ WebUI-plugin, der giver slutbrugerne mulighed for at generere AI-portrætter og billeder. EasyPhoto WebUI-plugin genererer AI-portrætter ved hjælp af forskellige skabeloner, der understøtter forskellige foto-stilarter og multiple ændringer. Desuden kan brugerne generere billeder ved hjælp af SDXL-modellen for at opnå mere tilfredsstillende, præcise og varierede resultater. Lad os begynde.
En introduktion til EasyPhoto og Stable Diffusion
Stable Diffusion-rammen er en populær og robust diffusion-baseret genereringsramme, der bruges af udviklere til at generere realistiske billeder baseret på tekstbeskrivelser. Takket være dens evner har Stable Diffusion-rammen en bred vifte af anvendelser, herunder billedudmaling, billedindmaling og billed-til-billed-oversættelse. Stable Diffusion Web UI, eller SD-WebUI, er en af de mest populære og kendte anvendelser af denne ramme. Den har en browsergrænseflade bygget på Gradio-biblioteket, der giver en interaktiv og brugervenlig grænseflade til Stable Diffusion-modeller. For at forbedre kontrollen og brugervenligheden i billedgenerering integrerer SD-WebUI flere Stable Diffusion-applikationer.
På grund af den bekvemmelighed, der tilbydes af SD-WebUI-rammen, besluttede udviklerne af EasyPhoto-rammen at oprette den som en web-plugin i stedet for en selvstændig applikation. I modsætning til eksisterende metoder, der ofte lider af identitetstab eller introducerer urealistiske funktioner i billeder, udnytter EasyPhoto-rammen billed-til-billed-kapaciteterne i Stable Diffusion-modellerne til at producere præcise og realistiske billeder. Brugerne kan let installere EasyPhoto-rammen som en udvidelse inden for WebUI, hvilket forbedrer brugervenligheden og tilgængeligheden for en bredere vifte af brugere. EasyPhoto-rammen giver brugerne mulighed for at generere identitetsrettet, højkvalitets- og realistiske AI-portrætter, der ligner input-identiteten.
Først beder EasyPhoto-rammen brugerne om at oprette deres digitale dobbeltgænger ved at uploade nogle billeder for at træne en face LoRA eller Low-Rank Adaptation-model online. LoRA-rammen finjusterer hurtigt diffusion-modellerne ved at anvende lav-rang-tilpasnings-teknologi. Dette proces giver den basale model mulighed for at forstå ID-informationen omkring specifikke brugere. De trænede modeller bliver derefter sammenføjet og integreret i den basale Stable Diffusion-model til interferens. Desuden under interferensprocessen anvender modellen stable diffusion-modeller i et forsøg på at genmale de ansigtsområder i interferens-skabelonen, og ligheden mellem input- og output-billeder verificeres ved hjælp af forskellige ControlNet-enheder.
EasyPhoto-rammen anvender også en to-trins diffusion-proces for at tackle potentielle problemer som grænse-artefakter og identitetstab, hvilket sikrer, at de genererede billeder minimiserer visuelle inkonsistenser, mens brugerens identitet opretholdes. Desuden er interferens-røret i EasyPhoto-rammen ikke kun begrænset til at generere portrætter, men kan også anvendes til at generere noget, der er relateret til brugerens ID. Dette indebærer, at når du træner LoRA-modellen for en bestemt ID, kan du generere en bred vifte af AI-billeder, og det kan have vidtrækkende anvendelser, herunder virtuelle prøver.
For at sammenfatte, foreslår EasyPhoto-rammen
- En ny tilgang til at træne LoRA-modellen ved at inkorporere flere LoRA-modeller for at opretholde ansigtets trofasthed i de genererede billeder.
- Anvender forskellige forstærkning-læringsmetoder til at optimere LoRA-modellerne for ansigtets identitetsbelønninger, hvilket yderligere hjælper med at forbedre ligheden mellem identiteterne i træningsbillederne og resultaterne.
- Foreslår en dobbelt-trins indmaling-baseret diffusion-proces, der sigter mod at generere AI-fotografier med høj æstetik og lighed.
EasyPhoto: Arkitektur & Træning
Den følgende figur demonstrerer træningsprocessen for EasyPhoto AI-rammen.

Som det kan ses, beder rammen først brugerne om at indtaste træningsbillederne og derefter udfører ansigtsgenkendelse for at detectere ansigtslokationerne. Når rammen har detecteret ansigtet, beskærer den input-billedet ved hjælp af en foruddefineret bestemt ratio, der fokuserer udelukkende på ansigtsområdet. Rammen anvender derefter en hudforbedrings- og en saliencedetektionsmodel til at få et rent og klart ansigtstræningsbillede. Disse to modeller spiller en afgørende rolle i at forbedre den visuelle kvalitet af ansigtet og sikre, at baggrundsinformationen er fjernet, og træningsbilledet primært indeholder ansigtet. Til sidst anvender rammen disse bearbejdede billeder og input-prompter til at træne LoRA-modellen, hvilket giver den mulighed for at forstå bruger-specifikke ansigtstræk mere effektivt og præcist.
Desuden under træningsfasen inkluderer rammen en kritisk validerings-trin, hvor rammen beregner ansigt-ID-gapet mellem bruger-input-billedet og verificationsbilledet, der er genereret af den trænede LoRA-model. Validerings-trinet er en fundamental proces, der spiller en afgørende rolle i at opnå fusionen af LoRA-modellerne, hvilket ultimativt sikrer, at den trænede LoRA-ramme forvandler sig til en dobbeltgænger eller en præcis digital repræsentation af brugeren. Desuden vil verificationsbilledet med den optimale face_id-score vælges som face_id-billedet, og dette face_id-billede vil derefter anvendes til at forbedre identitetssammenhængen i interferens-genereringen.
Herefter, baseret på ensemble-processen, træner rammen LoRA-modellerne med sandsynligheds-estimation som det primære mål, mens bevarelse af ansigtets identitetssammenhæng er det nedstrøms-mål. For at tackle dette problem anvender EasyPhoto-rammen forstærkning-lærings-teknikker til at optimere det nedstrøms-mål direkte.Som resultat viser de ansigtstræk, som LoRA-modellerne lærer, forbedring, der fører til en forbedret lighed mellem skabelon-genererede resultater og demonstrerer generalisering på tværs af skabeloner.
Interferens-proces
Den følgende figur demonstrerer interferens-processen for en enkelt bruger-ID i EasyPhoto-rammen og er inddelt i tre dele
- Ansigt-forbehandling for at få ControlNet-referencen og det forbehandlede input-billede.
- Første diffusion der hjælper med at generere grove resultater, der ligner bruger-input.
- Anden diffusion der retter grænse-artefakterne, hvilket gør billederne mere præcise og realistiske.

For input anvender rammen et face_id-billede (genereret under trænings-validering med den optimale face_id-score) og en interferens-skabelon. Outputtet er et højdetaljeret, præcist og realistisk portræt af brugeren, der ligner identiteten og det unikke udseende af brugeren på basis af interferens-skabelonen. Lad os se nærmere på disse processer.
Ansigt-forbehandling
En måde at generere et AI-portræt baseret på en interferens-skabelon uden bevidst grund til at bruge SD-modellen til at indmale ansigtet i interferens-skabelonen. Desuden tilføjer ControlNet-rammen processen ikke kun bevarelse af bruger-identitet, men også forbedrer ligheden mellem de genererede billeder. Men anvendelse af ControlNet direkte til regional indmaling kan introducere potentielle problemer, der kan inkludere
- Inkonsistens mellem input og genereret billede: Det er tydeligt, at nøglepunkterne i skabelon-billedet ikke er kompatible med nøglepunkterne i face_id-billedet, hvilket er hvorfor anvendelse af ControlNet med face_id-billedet som reference kan føre til nogle inkonsistenser i outputtet.
- Defekter i indmaling-området: Maskering af et område og derefter indmaling af det med et nyt ansigt kan føre til synlige defekter, især langs indmaling-grænsen, hvilket ikke kun vil påvirke billedets ægthed, men også påvirke billedets realisme.
- Identitetstab ved Control Net: Da træningsprocessen ikke anvender ControlNet-rammen, kan anvendelse af ControlNet under interferens-fasen påvirke evnen af den trænede LoRA-model til at bevare input-bruger-ID’et.
For at tackle de nævnte problemer foreslår EasyPhoto-rammen tre procedurer.
- Align og Paste: Ved at anvende en ansigt-klæb-algoritme sigter EasyPhoto-rammen mod at tackle problemet med mismatch mellem ansigt-landemærker mellem face_id og skabelon. Først beregner modellen ansigt-landemærkerne for face_id og skabelon-billedet, hvorefter modellen bestemmer den affine-transformation-matrix, der vil blive anvendt til at alignere ansigt-landemærkerne i skabelon-billedet med face_id-billedet. Det resulterende billede bevarer de samme landemærker som face_id-billedet og alignerer med skabelon-billedet.
- Ansigt-fusion: Ansigt-fusion er en ny tilgang, der anvendes til at korrigere grænse-artefakter, der skyldes mask-indmaling, og det indebærer rettelse af artefakter ved hjælp af ControlNet-rammen. Metoden giver EasyPhoto-rammen mulighed for at sikre bevarelse af harmoniske kanter og guider derefter billed-genererings-processen. Ansigt-fusions-algoritmen fusionerer yderligere roop (ground truth-bruger-billeder) og skabelon-billedet, hvilket giver det resulterende fusionerede billede bedre stabilisering af kant-grænser, der derefter fører til en forbedret output under den første diffusion-trin.
- ControlNet-guidet validering: Da LoRA-modellerne ikke blev trænet med ControlNet-rammen, kan anvendelse af den under interferens-processen påvirke evnen af LoRA-modellen til at bevare identiteterne. For at forbedre generaliserings-evnerne i EasyPhoto-rammen tager rammen ControlNet-rammens indflydelse i betragtning og inkorporerer LoRA-modeller fra forskellige stadier.
Første diffusion
Den første diffusion-trin anvender skabelon-billedet til at generere et billede med en unik ID, der ligner input-bruger-ID’et. Input-billedet er en fusion af bruger-input-billedet og skabelon-billedet, mens den justerede ansigt-maske er input-maske. For yderligere at øge kontrollen over billed-generering integrerer EasyPhoto-rammen tre ControlNet-enheder, hvor den første ControlNet-enhed fokuserer på kontrol af de fusionerede billeder, den anden ControlNet-enhed kontrollerer farverne i de fusionerede billeder, og den sidste ControlNet-enhed er openpose (real-time multi-person human pose-kontrol) af det erstattede billede, der ikke kun indeholder ansigtets struktur i skabelon-billedet, men også brugerens ansigt-identitet.
Anden diffusion
I den anden diffusion-trin forfineres artefakterne nær ansigtets grænse og gives brugerne mulighed for at maskere et bestemt område i billedet for at forbedre effekten af generering inden for det dedikerede område. I denne trin fusionerer rammen output-billedet fra den første diffusion-trin med roop-billedet eller resultatet af brugerens billede, hvilket genererer input-billedet til den anden diffusion-trin. Samlet set spiller den anden diffusion-trin en afgørende rolle i at forbedre den overordnede kvalitet og detaljerne i det genererede billede.
Flere bruger-ID’er
En af EasyPhoto’s højdepunkter er dens understøttelse af generering af flere bruger-ID’er, og figuren nedenfor demonstrerer pipeline’en for interferens-processen for flere bruger-ID’er i EasyPhoto-rammen.

For at give understøttelse til generering af flere bruger-ID’er først udfører EasyPhoto-rammen ansigtsgenkendelse på interferens-skabelonen. Disse interferens-skabeloner deles derefter op i flere masker, hvor hver maske indeholder kun ét ansigt, og resten af billedet er maskeret i hvidt, hvilket omdanner genereringen af flere bruger-ID’er til en simpel opgave med at generere enkelt-bruger-ID’er. Når rammen har genereret bruger-ID-billederne, bliver disse billeder sammenføjet med interferens-skabelonen, hvilket giver en samlet integration af skabelon-billederne med de genererede billeder, der ultimativt resulterer i et højkvalitetsbillede.
Eksperimenter og resultater
Nu, hvor vi har en forståelse af EasyPhoto-rammen, er det tid til, at vi udforsker EasyPhoto-rammens præstation.

Det ovenstående billede er genereret af EasyPhoto-plugin’et og anvender en Style-baseret SD-model til billed-generering. Som det kan ses, ligner de genererede billeder realistiske og er ret præcise.

Billedet ovenfor er genereret af EasyPhoto-rammen ved hjælp af en Comic Style-baseret SD-model. Som det kan ses, ligner både comic-fotografierne og de realistiske fotografier ret realistiske og ligner input-billedet på basis af brugerens prompter eller krav.
Billedet nedenfor er genereret af EasyPhoto-rammen ved hjælp af en Multi-Person-skabelon. Som det kan ses, er de genererede billeder klare, præcise og ligner det originale billede.

Med EasyPhoto kan brugerne nu generere en bred vifte af AI-portrætter eller generere flere bruger-ID’er ved hjælp af bevarede skabeloner eller anvende SD-modellen til at generere interferens-skabeloner. Billederne ovenfor demonstrerer EasyPhoto-rammens evne til at producere diverse og højkvalitets-AI-billeder.
Konklusion
I denne artikel har vi talt om EasyPhoto, en ny WebUI-plugin, der giver slutbrugerne mulighed for at generere AI-portrætter og billeder. EasyPhoto WebUI-plugin genererer AI-portrætter ved hjælp af vilkårlige skabeloner, og den nuværende implikation af EasyPhoto WebUI understøtter forskellige foto-stilarter og multiple ændringer. Desuden kan brugerne generere billeder ved hjælp af SDXL-modellen for at opnå mere tilfredsstillende, præcise og varierede billeder. EasyPhoto-rammen anvender en stabil diffusion-basemodel kombineret med en forudtrænet LoRA-model, der producerer højkvalitets-billeder.
Interesseret i billed-generering? Vi tilbyder også en liste over de bedste AI-headshot-genereringer og de bedste AI-billed-genereringer, der er lette at bruge og kræver ingen teknisk ekspertise.












