AI-modellen en platforms

EasyPhoto: uw persoonlijke AI-fotogenerator

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web User Interface, of SD-WebUI, is een uitgebreid project voor Stable Diffusion-modellen dat de Gradio-bibliotheek gebruikt om een browserinterface te bieden. Vandaag gaan we het hebben over EasyPhoto, een innovatieve WebUI-plugin die eindgebruikers in staat stelt om AI-portretten en -afbeeldingen te genereren. De EasyPhoto WebUI-plugin maakt AI-portretten met behulp van verschillende sjablonen, ondersteunt verschillende fotostijlen en meerdere bewerkingen. Bovendien kunnen gebruikers, om de mogelijkheden van EasyPhoto verder te vergroten, afbeeldingen genereren met behulp van het SDXL-model voor meer bevredigende, nauwkeurige en gevarieerde resultaten. Laten we beginnen.

Een introductie tot EasyPhoto en Stable Diffusion

Het Stable Diffusion-framework is een populair en robuust diffusiegebaseerd generatieframework dat door ontwikkelaars wordt gebruikt om realistische afbeeldingen te genereren op basis van invoertekstbeschrijvingen. Dankzij zijn mogelijkheden heeft het Stable Diffusion-framework een breed scala aan toepassingen, waaronder image outpainting, image inpainting en image-to-image-vertaling. De Stable Diffusion Web UI, of SD-WebUI, is een van de meest populaire en bekende toepassingen van dit framework. Het heeft een browserinterface gebouwd op de Gradio-bibliotheek, waardoor een interactieve en gebruikersvriendelijke interface voor Stable Diffusion-modellen wordt geboden. Om de controle en gebruikersvriendelijkheid van afbeeldingengeneratie verder te verbeteren, integreert SD-WebUI verschillende Stable Diffusion-toepassingen.

Vanwege de gemakken die het SD-WebUI-framework biedt, hebben de ontwikkelaars van het EasyPhoto-framework besloten om het te maken als een webplugin in plaats van een volwaardige toepassing. In tegenstelling tot bestaande methoden die vaak last hebben van identiteitsverlies of onrealistische kenmerken in afbeeldingen introduceren, maakt het EasyPhoto-framework gebruik van de image-to-image-mogelijkheden van de Stable Diffusion-modellen om nauwkeurige en realistische afbeeldingen te produceren. Gebruikers kunnen het EasyPhoto-framework eenvoudig installeren als een extensie binnen de WebUI, waardoor de gebruikersvriendelijkheid en toegankelijkheid voor een bredere range van gebruikers wordt verbeterd. Het EasyPhoto-framework stelt gebruikers in staat om identiteitsgeleide, hoge kwaliteit en realistische AI-portretten te genereren die sterk lijken op de invoeridentiteit.

Eerst vraagt het EasyPhoto-framework gebruikers om hun digitale evenbeeld te maken door een paar afbeeldingen te uploaden om een face LoRA- of Low-Rank Adaptation-model online te trainen. De LoRA-bibliotheek fine-tuned de diffusiemodellen snel door gebruik te maken van low-rank adaptatietechnologie. Dit proces stelt het basismodel in staat om de ID-informatie van specifieke gebruikers te begrijpen. De getrainde modellen worden vervolgens samengevoegd en geïntegreerd in het baseline Stable Diffusion-model voor interferentie. Bovendien gebruikt het model tijdens het interferentieproces de stabiele diffusiemodellen om de gezichtsregio’s in het interferentiesjabloon opnieuw te schilderen, en worden de overeenkomsten tussen de invoer- en uitvoerafbeeldingen geverifieerd met behulp van de verschillende ControlNet-eenheden.

Het EasyPhoto-framework implementeert ook een tweestapsdiffusieproces om potentiële problemen zoals grensartefacten en identiteitsverlies aan te pakken, waardoor de gegenereerde afbeeldingen visuele inconsistenties minimaliseren en de identiteit van de gebruiker behouden. Bovendien is de interferentiepijplijn in het EasyPhoto-framework niet alleen beperkt tot het genereren van portretten, maar kan deze ook worden gebruikt om alles te genereren dat verband houdt met de ID van de gebruiker. Dit impliceert dat, zodra u het LoRA-model voor een bepaalde ID traint, u een breed scala aan AI-afbeeldingen kunt genereren, en het kan dus een breed scala aan toepassingen hebben, waaronder virtuele proefsessies.

Om samen te vatten, het EasyPhoto-framework

  1. Stelt een novatieve aanpak voor om het LoRA-model te trainen door meerdere LoRA-modellen te combineren om de gezichtsgetrouwheid van de gegenereerde afbeeldingen te behouden.
  2. Maakt gebruik van verschillende versterkingsleermethoden om de LoRA-modellen te optimaliseren voor gezichtsidentiteitsbeloningen, wat helpt bij het verbeteren van de overeenkomst tussen identiteiten tussen de trainingsafbeeldingen en de gegenereerde resultaten.
  3. Stelt een tweestaps inpaint-gebaseerd diffusieproces voor dat gericht is op het genereren van AI-foto’s met hoge esthetiek en gelijkenis.

EasyPhoto: architectuur en training

De volgende figuur toont het trainingsproces van het EasyPhoto AI-framework.

Zoals te zien is, vraagt het framework de gebruikers om de trainingsafbeeldingen in te voeren en voert het vervolgens gezichtsdetectie uit om de gezichtslocaties te detecteren. Zodra het framework het gezicht heeft gedetecteerd, knipt het de invoerafbeelding met een vooraf gedefinieerde specifieke verhouding, die uitsluitend op de gezichtsregio is gericht. Het framework implementeert vervolgens een huidverbeterings- en saliencydetectiemodel om een schone en duidelijke gezichtstrainingsafbeelding te verkrijgen. Deze twee modellen spelen een cruciale rol bij het verbeteren van de visuele kwaliteit van het gezicht en zorgen ervoor dat de achtergrondinformatie is verwijderd en de trainingsafbeelding voornamelijk het gezicht bevat. Ten slotte gebruikt het framework deze verwerkte afbeeldingen en invoerprompt om het LoRA-model te trainen en het zo uit te rusten met de mogelijkheid om gebruikerspecifieke gezichtskenmerken effectiever en nauwkeuriger te begrijpen.

Bovendien omvat het framework tijdens de trainingsfase een kritische validatiestap, waarin het framework de gezichts-ID-kloof tussen de gebruikersinvoerafbeelding en de verificatieafbeelding die is gegenereerd door het getrainde LoRA-model berekent. De validatiestap is een fundamenteel proces dat een sleutelrol speelt bij het bereiken van de fusie van de LoRA-modellen, waardoor het getrainde LoRA-framework uiteindelijk transformeert in een evenbeeld, of een nauwkeurige digitale weergave van de gebruiker. Bovendien wordt de verificatieafbeelding met de optimale gezichts-ID-score geselecteerd als de gezichts-ID-afbeelding en wordt deze gezichts-ID-afbeelding vervolgens gebruikt om de identiteitsovereenkomst van de interferentiegeneratie te verbeteren.

Verder, op basis van het ensembleproces, traint het framework de LoRA-modellen met waarschijnlijkheidschatting als het primaire doel, terwijl het behouden van de gezichtsidentiteitsovereenkomst het downstreamdoel is. Om dit probleem aan te pakken, maakt het EasyPhoto-framework gebruik van versterkingsleertechnieken om het downstreamdoel rechtstreeks te optimaliseren.Als resultaat vertonen de gezichtskenmerken die de LoRA-modellen leren een verbetering die leidt tot een verbeterde overeenkomst tussen de sjabloon gegenereerde resultaten en demonstreert het ook de generalisatie over sjablonen.

Interferentieproces

De volgende figuur toont het interferentieproces voor een individuele gebruikers-ID in het EasyPhoto-framework en is onderverdeeld in drie delen

  • Gezichtsvoorbewerking voor het verkrijgen van de ControlNet-referentie en de voorbewerkte invoerafbeelding.
  • Eerste diffusie die helpt bij het genereren van grove resultaten die op de gebruikersinvoer lijken.
  • Tweede diffusie die de grensartefacten corrigeert, waardoor de afbeeldingen nauwkeuriger en realistischer worden.

Voor de invoer neemt het framework een gezichts-ID-afbeelding (gegenereerd tijdens trainingsvalidatie met de optimale gezichts-ID-score) en een interferentiesjabloon. De uitvoer is een hooggedetailleerde, nauwkeurige en realistische portret van de gebruiker en lijkt sterk op de identiteit en unieke verschijning van de gebruiker op basis van het interferentiesjabloon. Laten we een gedetailleerde blik werpen op deze processen.

Gezichtsvoorbewerking

Een manier om een AI-portret te genereren op basis van een interferentiesjabloon zonder bewuste redenering is om het SD-model te gebruiken om de gezichtsregio in het interferentiesjabloon in te kleuren. Bovendien voegt het toevoegen van het ControlNet-framework aan het proces niet alleen de behoud van de gebruikersidentiteit, maar ook de overeenkomst tussen de gegenereerde afbeeldingen. Echter, het gebruik van ControlNet rechtstreeks voor regionale inkleuringsprocessen kan potentiële problemen introduceren die onder andere kunnen omvatten

  • Inconsistentie tussen de invoer en de gegenereerde afbeelding: Het is duidelijk dat de sleutelpunten in de sjabloonafbeelding niet compatibel zijn met de sleutelpunten in de gezichts-ID-afbeelding, waardoor het gebruik van ControlNet met de gezichts-ID-afbeelding als referentie kan leiden tot enkele inconsistenties in de uitvoer.
  • Defecten in de inkleuringsregio: Het maskeren van een regio en vervolgens inkleden met een nieuw gezicht kan leiden tot opvallende defecten, vooral langs de inkleuringsgrens, die niet alleen de authenticiteit van de gegenereerde afbeelding beïnvloeden, maar ook de realiteit van de afbeelding negatief beïnvloeden.
  • Identiteitsverlies door Control Net: Aangezien het trainingsproces het ControlNet-framework niet gebruikt, kan het gebruik van ControlNet tijdens de interferentiefase de mogelijkheid van het getrainde LoRA-model om de invoergebruikers-ID-identiteit te behouden, beïnvloeden.

Om de bovengenoemde problemen aan te pakken, stelt het EasyPhoto-framework drie procedures voor.

  • Align en plak: Door het gebruik van een gezichtsplakalgoritme, stelt het EasyPhoto-framework een oplossing voor om het probleem van mismatch tussen gezichtslandmarks tussen de gezichts-ID en het sjabloon aan te pakken. Eerst berekent het model de gezichtslandmarks van de gezichts-ID en de sjabloonafbeelding, waarna het model de affiene transformatiematrix bepaalt die zal worden gebruikt om de gezichtslandmarks van de sjabloonafbeelding uit te lijnen met de gezichts-ID-afbeelding. De resulterende afbeelding behoudt dezelfde landmarks van de gezichts-ID-afbeelding en lijkt ook op het sjabloon.
  • Gezichtsfusie: Gezichtsfusie is een novatieve aanpak die wordt gebruikt om de grensartefacten te corrigeren die het resultaat zijn van maskerinkleuringsprocessen, en het omvat de rectificatie van artefacten met behulp van het ControlNet-framework. De methode stelt het EasyPhoto-framework in staat om de behoud van harmonieuze randen te waarborgen en uiteindelijk de begeleiding van het proces van afbeeldingengeneratie. Het gezichtsfusiealgoritme fuseert verder de roop (ground truth gebruikersafbeeldingen) afbeelding en het sjabloon, waardoor de resulterende gefuseerde afbeelding betere stabilisatie van de randgrenzen vertoont, wat uiteindelijk leidt tot een verbeterde uitvoer tijdens de eerste diffusiefase.
  • ControlNet-geleide validatie: Aangezien de LoRA-modellen niet zijn getraind met het ControlNet-framework, kan het gebruik ervan tijdens het inferentieproces de mogelijkheid van het LoRA-model om de identiteiten te behouden, beïnvloeden. Om de generalisatiecapaciteiten van EasyPhoto te verbeteren, houdt het framework rekening met de invloed van het ControlNet-framework en integreert LoRA-modellen van verschillende stadia.

Eerste diffusie

De eerste diffusiefase gebruikt het sjabloonafbeelding om een afbeelding te genereren met een unieke ID die op de invoergebruikers-ID lijkt. De invoerafbeelding is een fusie van de gebruikersinvoerafbeelding en het sjabloon, terwijl de gekalibreerde gezichtsmasker de invoermasker is. Om de controle over afbeeldingengeneratie verder te vergroten, integreert het EasyPhoto-framework drie ControlNet-eenheden, waarvan de eerste ControlNet-eenheid zich richt op de controle van de gefuseerde afbeeldingen, de tweede ControlNet-eenheid de kleuren van de gefuseerde afbeelding controleert en de derde ControlNet-eenheid de openpose (real-time multi-person human pose control) van de vervangen afbeelding is, die niet alleen de gezichtsstructuur van het sjabloon bevat, maar ook de gezichtsidentiteit van de gebruiker.

Tweede diffusie

In de tweede diffusiefase worden de artefacten in de buurt van de grens van het gezicht verfijnd en fijngesteld, evenals de gebruikers de flexibiliteit bieden om een specifiek gebied in de afbeelding te maskeren in een poging om de effectiviteit van generatie in dat toegewezen gebied te verbeteren. In deze fase fuseert het framework de uitvoerafbeelding die is verkregen uit de eerste diffusiefase met de roop-afbeelding of het resultaat van de afbeelding van de gebruiker, waardoor de invoerafbeelding voor de tweede diffusiefase wordt gegenereerd. Over het algemeen speelt de tweede diffusiefase een cruciale rol bij het verbeteren van de algehele kwaliteit en details van de gegenereerde afbeelding.

Meerdere gebruikers-IDs

Een van de highlights van EasyPhoto is de ondersteuning voor het genereren van meerdere gebruikers-IDs, en de onderstaande figuur toont de pijplijn van het interferentieproces voor meerdere gebruikers-IDs in het EasyPhoto-framework.

Om ondersteuning te bieden voor meerdere gebruikers-ID-generatie, voert het EasyPhoto-framework eerst gezichtsdetectie uit op het interferentiesjabloon. Deze interferentiesjablonen worden vervolgens gesplitst in meerdere maskers, waarbij elk masker slechts één gezicht bevat en de rest van de afbeelding wit is gemaskeerd, waardoor de generatie van meerdere gebruikers-IDs wordt omgezet in een eenvoudige taak van het genereren van individuele gebruikers-IDs. Zodra het framework de gebruikers-ID-afbeeldingen heeft gegenereerd, worden deze afbeeldingen samengevoegd in het interferentiesjabloon, waardoor een naadloze integratie van de sjabloonafbeeldingen met de gegenereerde afbeeldingen wordt gefaciliteerd, wat uiteindelijk resulteert in een hoogwaardige afbeelding.

Experimenten en resultaten

Nu we een begrip hebben van het EasyPhoto-framework, is het tijd om de prestaties van het EasyPhoto-framework te onderzoeken.

De bovenstaande afbeelding is gegenereerd door de EasyPhoto-plugin en gebruikt een Style-gebaseerd SD-model voor de afbeeldingengeneratie. Zoals te zien is, zien de gegenereerde afbeeldingen er realistisch uit en zijn ze vrij nauwkeurig.

De bovenstaande afbeelding is gegenereerd door het EasyPhoto-framework met behulp van een Comic Style-gebaseerd SD-model. Zoals te zien is, zien de comic-foto’s en de realistische foto’s er vrij realistisch uit en lijken ze sterk op de invoerafbeelding op basis van de gebruikersprompt of -vereisten.

De onderstaande afbeelding is gegenereerd door het EasyPhoto-framework met behulp van een Multi-Person-sjabloon. Zoals duidelijk te zien is, zijn de gegenereerde afbeeldingen duidelijk, nauwkeurig en lijken ze op de oorspronkelijke afbeelding.

Met de hulp van EasyPhoto kunnen gebruikers nu een breed scala aan AI-portretten genereren, meerdere gebruikers-IDs genereren met behulp van bewaarde sjablonen of het SD-model gebruiken om interferentiesjablonen te genereren. De bovenstaande afbeeldingen demonstreren de mogelijkheid van het EasyPhoto-framework om diverse en hoogwaardige AI-afbeeldingen te produceren.

Conclusie

In dit artikel hebben we het over EasyPhoto gehad, een novatieve WebUI-plugin die eindgebruikers in staat stelt om AI-portretten en -afbeeldingen te genereren. De EasyPhoto WebUI-plugin genereert AI-portretten met behulp van willekeurige sjablonen en de huidige implicaties van de EasyPhoto WebUI ondersteunen verschillende fotostijlen en meerdere bewerkingen. Bovendien kunnen gebruikers, om de mogelijkheden van EasyPhoto verder te vergroten, afbeeldingen genereren met behulp van het SDXL-model om meer bevredigende, nauwkeurige en gevarieerde afbeeldingen te genereren. Het EasyPhoto-framework maakt gebruik van een stabiele diffusiebasismodel in combinatie met een vooraf getraind LoRA-model dat hoogwaardige afbeeldingsuitvoer produceert.

Geïnteresseerd in afbeeldingengeneratoren? We bieden ook een lijst van de Beste AI-portretgeneratoren en de Beste AI-afbeeldingengeneratoren die eenvoudig te gebruiken zijn en geen technische expertise vereisen.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.