AI-modeller og plattformer
EasyPhoto: Din personlige AI-bildegenerator

Stable Diffusion Web-brukergrensesnitt, eller SD-WebUI, er et omfattende prosjekt for Stable Diffusion-modeller som bruker Gradio-biblioteket til å tilby et nettlesergrensesnitt. I dag skal vi snakke om EasyPhoto, en innovativ WebUI-utvidelse som gjør det mulig for sluttbrukere å generere AI-portretter og bilder. EasyPhoto WebUI-utvidelsen lager AI-portretter ved hjelp av ulike maler, og støtter forskjellige foto-stiler og flere modifikasjoner. I tillegg til å forbedre EasyPhotos funksjonalitet ytterligere, kan brukerne generere bilder ved hjelp av SDXL-modellen for mer tilfredsstillende, nøyaktige og varierte resultater. La oss begynne.
En innføring i EasyPhoto og Stable Diffusion
Stable Diffusion-rammeverket er et populært og robust diffusjonsbasert genereringsrammeverk som brukes av utviklere til å generere realistiske bilder basert på tekstbeskrivelser. Takk til dens funksjonalitet, har Stable Diffusion-rammeverket en rekke anvendelser, inkludert bilde-utmalning, bilde-innmalning og bilde-til-bilde-oversettelse. Stable Diffusion Web UI, eller SD-WebUI, er ett av de mest populære og kjente anvendelsene av dette rammeverket. Det har et nettlesergrensesnitt bygget på Gradio-biblioteket, og tilbyr et interaktivt og brukervennlig grensesnitt for Stable Diffusion-modeller. For å ytterligere forbedre kontroll og brukervennlighet i bilde-generering, integrerer SD-WebUI flere Stable Diffusion-applikasjoner.
Takk til den komforten som tilbys av SD-WebUI-rammeverket, bestemte utviklerne av EasyPhoto-rammeverket å lage det som en nett-utvidelse i stedet for en fullstendig applikasjon. I motsetning til eksisterende metoder som ofte lider av identitetstap eller introduserer urealistiske trekk i bilder, utnytter EasyPhoto-rammeverket bilde-til-bilde-kapasiteten i Stable Diffusion-modellene til å produsere nøyaktige og realistiske bilder. Brukere kan enkelt installere EasyPhoto-rammeverket som en utvidelse innenfor WebUI, og forbedre brukervennlighet og tilgjengelighet for en bredere rekke brukere. EasyPhoto-rammeverket lar brukerne generere identitets-guidede, høykvalitets- og realistiske AI-portretter som ligner på inndata-identiteten.
Først ber EasyPhoto-rammeverket brukerne om å lage sine digitale dobbeltgjengere ved å laste opp noen bilder for å trene en ansikt-LoRA eller Low-Rank Adaptation-modell på nettet. LoRA-rammeverket finjusterer raskt diffusjonsmodellene ved å bruke lav-rank-adaptasjonsteknologi. Denne prosessen lar basis-modellen forstå ID-informasjonen til bestemte brukere. De trenede modellene blir deretter slått sammen og integrert i Stable Diffusion-modellen for interferens. Videre, under interferensprosessen, bruker modellen stabile diffusjonsmodeller i et forsøk på å male om ansiktsregionene i interferens-malen, og likheten mellom inndata- og utdata-bildene verifiseres ved hjelp av ulike ControlNet-enheter.
EasyPhoto-rammeverket setter også i gang en to-trinns diffusjonsprosess for å takle potensielle problemer som grense-arter og identitetstap, og sikrer at bildene som genereres minimerer visuelle inkonsistenser samtidig som de opprettholder brukerens identitet. Videre, interferens-pipelineen i EasyPhoto-rammeverket er ikke bare begrenset til å generere portretter, men kan også brukes til å generere alt som er relatert til brukerens ID. Dette betyr at når du har trenet LoRA-modellen for en bestemt ID, kan du generere en rekke AI-bilder, og derfor kan det ha vidstrakte anvendelser, inkludert virtuelle prøver.
For å sammenfatte, EasyPhoto-rammeverket
- Forslår en ny tilnærming til å trene LoRA-modellen ved å inkorporere flere LoRA-modeller for å opprettholde ansiktets trofasthet i de genererte bildene.
- Bruker ulike forsterkingslæringsmetoder til å optimere LoRA-modellene for ansikts-identitetsbelønninger som ytterligere hjelper til å forbedre likheten mellom identitetene i treningbildene og resultater.
- Forslår en dobbeltrinns innmalingsbasert diffusjonsprosess som har som mål å generere AI-bilder med høy estetikk og likhet.
EasyPhoto: Arkitektur & Trening
Følgende figur demonstrerer treningprosessen av EasyPhoto AI-rammeverket.

Som det kan ses, ber rammeverket først brukerne om å angi treningbildene, og deretter utfører det ansiktsgjenkjenning for å gjenkjenne ansiktslokasjonene. Når rammeverket har gjenkjent ansiktet, beskjerer det inndata-bildet ved hjelp av et forhåndsdefinert bestemt forhold som fokuserer utelukkende på ansiktsregionen. Rammeverket setter deretter i gang en hud-forbedring og en saliensi-dettekteringsmodell for å få en ren og klar ansikts-trening-bilde. Disse to modellene spiller en avgjørende rolle i å forbedre den visuelle kvaliteten på ansiktet, og sikrer også at bakgrunnsinformasjonen har blitt fjernet, og at trening-bildet hovedsakelig består av ansiktet. Til slutt bruker rammeverket disse prosesserte bildene og inndata-forespørsler til å trene LoRA-modellen, og dermed utstyre den med evnen til å forstå bruker-spesifikke ansikts-karakteristika mer effektivt og nøyaktig.
Videre, under trening-fasen, inkluderer rammeverket en kritisk validerings-trinn, hvor rammeverket beregner ansikt-ID-gapet mellom bruker-inndata-bildet og verifiserings-bildet som ble generert av den trenede LoRA-modellen. Validerings-trinnet er en grunnleggende prosess som spiller en avgjørende rolle i å oppnå fusjonen av LoRA-modellene, og sikrer at den trenede LoRA-rammeverket transformerer til en dobbeltgjenger, eller en nøyaktig digital representasjon av brukeren. I tillegg vil verifiserings-bildet med den optimale ansikt-ID-scoren bli valgt som ansikt-ID-bildet, og dette ansikt-ID-bildet vil deretter brukes til å forbedre identitet-likheten i interferens-genereringen.
Videre, basert på ensemble-prosessen, trener rammeverket LoRA-modellene med sannsynlighets-estimering som det primære målet, mens opprettholdelse av ansikts-identitet-likhet er det nedstrøms-målet. For å takle dette problemet, bruker EasyPhoto-rammeverket forsterkingslærings-teknikker til å optimere det nedstrøms-målet direkte.Som et resultat, viser ansikts-trekkene som LoRA-modellene lærer en forbedring som fører til en forbedret likhet mellom mal-genererte resultater, og demonstrerer også generalisering over maler.
Interferens-prosess
Følgende figur demonstrerer interferens-prosessen for en enkelt bruker-ID i EasyPhoto-rammeverket, og er delt inn i tre deler
- Ansikt-forbehandling for å få ControlNet-referansen og det forbehandlet inndata-bildet.
- Første diffusjon som hjelper til å generere grove resultater som ligner på bruker-inndata.
- Andre diffusjon som fikser grense-arter, og gjør bildene mer nøyaktige og realistiske.

For inndata, tar rammeverket et ansikt-ID-bilde (generert under trening-validering ved hjelp av den optimale ansikt-ID-scoren) og en interferens-mal. Utdata er et høydetaljert, nøyaktig og realistisk portrett av brukeren, og ligner på identiteten og den unike utseendet til brukeren basert på malen. La oss se nærmere på disse prosessene.
Ansikt-forbehandling
En måte å generere et AI-portrett basert på en interferens-mal uten bevisst resonnering er å bruke SD-modellen til å innmalings-ansiktsregionen i interferens-malen. I tillegg, ved å legge til ControlNet-rammeverket i prosessen, ikke bare forbedres opprettholdelse av bruker-identitet, men også likheten mellom de genererte bildene.
- Inkonsistens mellom inndata og generert bilde: Det er tydelig at nøkkel-punktene i mal-bildet ikke er kompatible med nøkkel-punktene i ansikt-ID-bildet, og derfor kan bruk av ControlNet med ansikt-ID-bildet som referanse føre til noen inkonsistenser i utdata.
- Defekter i innmalings-området: Maskering av et område og deretter innmalings med et nytt ansikt kan føre til merkbare defekter, spesielt langs innmalings-grensen, som ikke bare vil påvirke autentisiteten av det genererte bildet, men også negativt påvirke realisme.
- Identitetstap ved Control Net: Ettersom trening-prosessen ikke bruker ControlNet-rammeverket, kan bruk av ControlNet under interferens-fasen påvirke evnen til den trenede LoRA-modellen til å opprettholde inndata-bruker-ID-identiteten.
For å takle problemene ovenfor, foreslår EasyPhoto-rammeverket tre prosedyrer.
- Align og lim: Ved å bruke en ansikt-limings-algoritme, forsøker EasyPhoto-rammeverket å takle problemet med mismatch mellom ansikts-landemerker mellom ansikt-ID og mal.
- Ansikt-fusjon: Ansikt-fusjon er en ny tilnærming som brukes til å korrigere grense-arter som er et resultat av mask-innmalings, og det involverer rettelse av arter ved hjelp av ControlNet-rammeverket.
- ControlNet-guidet validering: Ettersom LoRA-modellene ikke ble trenet ved hjelp av ControlNet-rammeverket, kan bruk av det under interferens-prosessen påvirke evnen til LoRA-modellen til å opprettholde identitetene.
Første diffusjon
Første diffusjons-trinn bruker mal-bildet til å generere et bilde med en unik ID som ligner på inndata-bruker-ID. Inndata-bildet er en fusjon av bruker-inndata-bildet og mal-bildet, mens den justerte ansikt-masken er inndata-masken.
Andre diffusjon
I andre diffusjons-trinn, fikseres arter nær grensen av ansiktet og finjusteres, samt gir brukerne mulighet til å maskere et bestemt område i bildet for å forbedre effektiviteten av generering i det dedikerte området.
Flere bruker-IDer
En av EasyPhotos høydepunkter er støtten til å generere flere bruker-IDer, og figuren under demonstrerer pipelineen av interferens-prosessen for flere bruker-IDer i EasyPhoto-rammeverket.

For å støtte generering av flere bruker-IDer, utfører EasyPhoto-rammeverket først ansiktsgjenkjenning på interferens-malen. Disse interferens-malene deles deretter inn i flere masker, hvor hver maske inneholder bare ett ansikt, og resten av bildet er maskert i hvitt, og dermed bryter ned genereringen av flere bruker-IDer til en enkel oppgave med å generere enkelt-bruker-IDer.
Konklusjon
I denne artikkelen har vi snakket om EasyPhoto, en ny WebUI-utvidelse som lar sluttbrukere generere AI-portretter og bilder. EasyPhoto WebUI-utvidelsen genererer AI-portretter ved hjelp av vilkårlige maler, og støtter forskjellige foto-stiler og flere modifikasjoner. I tillegg til å forbedre EasyPhotos funksjonalitet ytterligere, kan brukerne generere bilder ved hjelp av SDXL-modellen for mer tilfredsstillende, nøyaktige og varierte resultater. EasyPhoto-rammeverket bruker et stabilt diffusjons-basismodell sammen med en forhånds-trent LoRA-modell som produserer høykvalitets-bilde-utdata.
Interessert i bilde-generering? Vi tilbyr også en liste over de beste AI-portrett-generatorene og de beste AI-bilde-generatorene som er enkle å bruke og krever ingen teknisk ekspertise.












