AI-modeller och plattformar

EasyPhoto: Din personliga AI-fotogenererare

mm
Lägg till Unite.AI bland dina föredragna källor på Google
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web-användargränssnitt, eller SD-WebUI, är ett omfattande projekt för Stable Diffusion-modeller som använder Gradio-biblioteket för att tillhandahålla ett webbgränssnitt. Idag ska vi prata om EasyPhoto, en innovativ WebUI-plugin som möjliggör för slutanvändare att generera AI-porträtt och bilder. EasyPhoto WebUI-plugin skapar AI-porträtt med hjälp av olika mallar, som stöder olika fotostilar och flera modifieringar. Dessutom kan användare generera bilder med hjälp av SDXL-modellen för mer tillfredsställande, exakta och varierade resultat. Låt oss börja.

En introduktion till EasyPhoto och Stable Diffusion

Stable Diffusion-ramverket är ett populärt och robust diffusionsbaserat ramverk för generering som används av utvecklare för att generera realistiska bilder baserat på indata-textbeskrivningar. Tack vare dess förmågor har Stable Diffusion-ramverket en stor mängd tillämpningar, inklusive bildutökning, bildinpainting och bild-till-bild-översättning. Stable Diffusion Web UI, eller SD-WebUI, är en av de mest kända och populära tillämpningarna av detta ramverk. Det har ett webbgränssnitt byggt på Gradio-biblioteket, som tillhandahåller ett interaktivt och användarvänligt gränssnitt för Stable Diffusion-modeller. För att ytterligare förbättra kontrollen och användbarheten i bildgenerering integrerar SD-WebUI flera Stable Diffusion-applikationer.

På grund av den bekvämlighet som erbjuds av SD-WebUI-ramverket beslutade utvecklarna av EasyPhoto-ramverket att skapa det som en webbplugin istället för en fullständig applikation. I motsats till befintliga metoder som ofta lider av identitetsförlust eller introducerar orealistiska funktioner i bilder, utnyttjar EasyPhoto-ramverket bild-till-bild-förmågan hos Stable Diffusion-modellerna för att producera exakta och realistiska bilder. Användare kan enkelt installera EasyPhoto-ramverket som en tilläggsfunktion inom WebUI, vilket förbättrar användarvänligheten och tillgängligheten för en bredare användargrupp. EasyPhoto-ramverket tillåter användare att generera identitetsguider, högkvalitativa och realistiska AI-porträtt som nära liknar den inmatade identiteten.

Först ber EasyPhoto-ramverket användarna att skapa sin digitala doppelgängare genom att ladda upp några bilder för att träna en ansikts-LoRA eller Low-Rank Adaptation-modell online. LoRA-ramverket finjusterar snabbt diffusionsmodellerna med hjälp av låg-rank-adaptationsteknologi. Denna process möjliggör för basmodellen att förstå ID-informationen för specifika användare. De tränade modellerna kombineras sedan och integreras i den grundläggande Stable Diffusion-modellen för interferens. Dessutom, under interferensprocessen, använder modellen stabila diffusionsmodeller i ett försök att måla om ansiktsområdena i interferenstemplatet, och likheten mellan indata- och utdata-bilderna verifieras med hjälp av olika ControlNet-enheter.

EasyPhoto-ramverket använder också en tvåstegs diffusionsprocess för att hantera potentiella problem som gränsartefakter och identitetsförlust, vilket säkerställer att de genererade bilderna minimerar visuella inkonsekvenser samtidigt som användarens identitet behålls. Dessutom är interferenspipelinen i EasyPhoto-ramverket inte begränsad till att generera porträtt, utan kan också användas för att generera allt som är relaterat till användarens ID. Detta innebär att när du tränar LoRA-modellen för en specifik ID, kan du generera en mängd olika AI-bilder, och det kan ha en stor mängd tillämpningar, inklusive virtuella provningar.

För att sammanfatta, EasyPhoto-ramverket

  1. Föreslår en ny metod för att träna LoRA-modellen genom att kombinera flera LoRA-modeller för att behålla ansiktets trohet hos de genererade bilderna.
  2. Använder olika förstärkningsinlärningsmetoder för att optimera LoRA-modellerna för ansiktsidentitetsbelöningar som ytterligare hjälper till att förbättra likheten mellan identiteter mellan träningsbilderna och de genererade resultaten.
  3. Föreslår en dubbelstegs inpaint-baserad diffusionsprocess som syftar till att generera AI-foton med hög estetik och likhet.

EasyPhoto: Arkitektur och träning

Följande figur visar träningsprocessen för EasyPhoto AI-ramverket.

Som det kan ses, ber ramverket först användarna att mata in träningsbilderna och sedan utföra ansiktsdetektering för att upptäcka ansiktsplatserna. När ramverket har upptäckt ansiktet, beskär det inmatningsbilden med hjälp av ett fördefinierat specifikt förhållande som fokuserar enbart på ansiktsområdet. Ramverket använder sedan en hudförskönings- och en saliensdetekteringsmodell för att få en ren och tydlig ansiktsbild. Dessa två modeller spelar en avgörande roll för att förbättra den visuella kvaliteten på ansiktet och säkerställa att bakgrundsinformationen har tagits bort och att träningsbilden i huvudsak innehåller ansiktet. Slutligen använder ramverket dessa bearbetade bilder och inmatningsprompter för att träna LoRA-modellen, och därmed utrustar den med förmågan att förstå användarspecifika ansiktsdrag mer effektivt och exakt.

Dessutom, under träningsfasen, inkluderar ramverket ett kritiskt valideringssteg, där ramverket beräknar ansikts-ID-avståndet mellan användarens inmatade bild och den verifieringsbild som genererades av den tränade LoRA-modellen. Valideringssteget är en fundamental process som spelar en avgörande roll för att uppnå sammanslagningen av LoRA-modellerna, vilket slutligen säkerställer att den tränade LoRA-ramverket omvandlas till en doppelgängare, eller en exakt digital representation av användaren. Dessutom kommer den verifieringsbild som har den optimala ansikts-ID-poängen att väljas som ansikts-ID-bilden, och denna ansikts-ID-bild kommer sedan att användas för att förbättra identitetssimilariteten vid interferensgenerering.

Vi fortsätter, baserat på ensembleprocessen, tränar ramverket LoRA-modellerna med sannolikhetsuppskattning som det primära målet, medan bevarandet av ansiktsidentitetssimilaritet är det nedströmsmål. För att hantera detta problem använder EasyPhoto-ramverket förstärkningsinlärningstekniker för att optimera det nedströmsmål direkt. Som ett resultat visar de ansiktsdrag som LoRA-modellerna lär sig en förbättring som leder till en förbättrad likhet mellan mallgenererade resultat och också visar generalisering över mallar.

Interferensprocess

Följande figur visar interferensprocessen för en enskild användar-ID i EasyPhoto-ramverket och delas in i tre delar

  • Ansiktsförbehandling för att erhålla ControlNet-referensen och den förbehandlade inmatningsbilden.
  • Första diffusionen som hjälper till att generera grova resultat som liknar användarindata.
  • Andra diffusionen som fixar gränsartefakterna, vilket gör att bilderna blir mer exakta och verkar mer realistiska.

För indata tar ramverket en ansikts-ID-bild (genererad under träningsvalidering med den optimala ansikts-ID-poängen) och en interferenstemplate. Utdata är en högkvalitativ, exakt och realistisk porträtt av användaren och liknar nära identiteten och det unika utseendet på användaren baserat på interferenstemplate. Låt oss ta en närmare titt på dessa processer.

Ansiktsförbehandling

Ett sätt att generera ett AI-porträtt baserat på en interferenstemplate utan medveten resonemang är att använda SD-modellen för att måla om ansiktsområdet i interferenstemplate. Dessutom lägger ControlNet-ramverket till processen inte bara förbättrar bevarandet av användaridentitet, utan också förbättrar likheten mellan de genererade bilderna. Men att använda ControlNet direkt för regional målning kan introducera potentiella problem som kan inkludera

  • Inkonsekvens mellan indata och genererad bild: Det är uppenbart att nyckelpunkterna i templatebilden inte är kompatibla med nyckelpunkterna i ansikts-ID-bilden, varför användning av ControlNet med ansikts-ID-bilden som referens kan leda till vissa inkonsekvenser i utdata.
  • Defekter i målningsområdet: Att maskera ett område och sedan måla om det med ett nytt ansikte kan leda till märkbara defekter, särskilt längs målningsgränsen, som inte bara påverkar autenticiteten hos den genererade bilden utan också realismen i bilden.
  • Identitetsförlust genom Control Net: Eftersom träningsprocessen inte använder ControlNet-ramverket, kan användning av ControlNet under interferensfasen påverka förmågan hos den tränade LoRA-modellen att bevara användar-ID-identiteten.

För att hantera de problem som nämns ovan föreslår EasyPhoto-ramverket tre procedurer.

  • Klistra in och klistra: Genom att använda en ansiktsklistralgoritm syftar EasyPhoto-ramverket till att hantera problemet med mismatch mellan ansiktslandmärken mellan ansikts-ID och template. Först beräknar modellen ansiktslandmärkena för ansikts-ID och templatebilden, varefter modellen bestämmer den affina transformationsmatrisen som ska användas för att justera ansiktslandmärkena för templatebilden med ansikts-ID-bilden. Den resulterande bilden behåller samma landmärken som ansikts-ID-bilden och justeras också med templatebilden.
  • Ansiktsförening: Ansiktsförening är en ny metod som används för att korrigera gränsartefakter som är ett resultat av maskmålning, och det innefattar rättning av artefakter med hjälp av ControlNet-ramverket. Metoden tillåter EasyPhoto-ramverket att säkerställa bevarandet av harmoniska kanter och därmed vägleda processen för bildgenerering. Ansiktsföreningsalgoritmen fusionerar också roop-bilden (sant användarbild) och templatebilden, vilket gör att den resulterande fusionerade bilden visar bättre stabilisering av kantgränserna, vilket sedan leder till en förbättrad utdata under den första diffusionsfasen.
  • ControlNet-guidad validering: Eftersom LoRA-modellerna inte tränades med ControlNet-ramverket, kan användning av det under interferensfasen påverka förmågan hos LoRA-modellen att bevara identiteter. För att förbättra generaliseringsförmågan hos EasyPhoto-ramverket beaktar ramverket inflytandet från ControlNet-ramverket och integrerar LoRA-modeller från olika stadier.

Första diffusionen

Den första diffusionsfasen använder templatebilden för att generera en bild med en unik ID som liknar användarindata. Inmatningsbilden är en fusion av användarindatabilden och templatebilden, medan den justerade ansiktsmasken är inmatningsmasken. För att ytterligare öka kontrollen över bildgenerering integrerar EasyPhoto-ramverket tre ControlNet-enheter, där den första ControlNet-enheten fokuserar på kontrollen av de fusionerade bilderna, den andra ControlNet-enheten kontrollerar färgerna på de fusionerade bilderna och den sista ControlNet-enheten är openpose (real-tid multi-person mänsklig posekontroll) för den ersatta bilden som inte bara innehåller ansiktsstrukturen för templatebilden utan också ansiktsidentiteten för användaren.

Andra diffusionen

I den andra diffusionsfasen raffineras artefakterna nära ansiktsgränsen och finjusteras, samtidigt som användarna ges möjlighet att maskera ett specifikt område i bilden i ett försök att förbättra effektiviteten i generationen inom det dedikerade området. I denna fas fusionerar ramverket utdata-bilden som erhållits från den första diffusionsfasen med roop-bilden eller användarens bild, vilket genererar inmatningsbilden för den andra diffusionsfasen. Sammantaget spelar den andra diffusionsfasen en avgörande roll för att förbättra den övergripande kvaliteten och detaljerna i den genererade bilden.

Flera användar-ID

En av EasyPhotos höjdpunkter är stödet för att generera flera användar-ID, och figuren nedan visar pipelinen för interferensprocessen för flera användar-ID i EasyPhoto-ramverket.

För att ge stöd för generering av flera användar-ID delar EasyPhoto-ramverket först interferenstemplate i flera masker, där varje mask innehåller endast ett ansikte och resten av bilden maskeras i vitt, vilket bryter ner genereringen av flera användar-ID till en enkel uppgift att generera enskilda användar-ID. När ramverket har genererat användar-ID-bilderna, kombineras dessa bilder i interferenstemplate, vilket möjliggör en smidig integration av templatebilderna med de genererade bilderna, vilket slutligen resulterar i en högkvalitativ bild.

Experiment och resultat

Nu när vi har en förståelse för EasyPhoto-ramverket, är det dags för oss att utforska prestandan för EasyPhoto-ramverket.

Bilden ovan genereras av EasyPhoto-plugin och använder en Style-baserad SD-modell för bildgenerering. Som det kan observeras ser de genererade bilderna realistiska ut och är ganska exakta.

Bilden ovan genereras av EasyPhoto-ramverket med hjälp av en Comic Style-baserad SD-modell. Som det kan ses ser seriebilderna och de realistiska bilderna ganska realistiska ut och liknar nära indata-bilden baserat på användarprompter eller krav.

Bilden som lagts till nedan har genererats av EasyPhoto-ramverket med hjälp av en Multi-Person-mall. Som det kan ses är de genererade bilderna tydliga, exakta och liknar den ursprungliga bilden.

Med hjälp av EasyPhoto kan användare nu generera en mängd olika AI-porträtt, generera flera användar-ID med hjälp av bevarade mallar eller använda SD-modellen för att generera interferenstemplate. De tillagda bilderna visar förmågan hos EasyPhoto-ramverket att producera varierade och högkvalitativa AI-bilder.

Slutsats

I den här artikeln har vi talat om EasyPhoto, en ny WebUI-plugin som tillåter slutanvändare att generera AI-porträtt och bilder. EasyPhoto WebUI-plugin genererar AI-porträtt med hjälp av godtyckliga mallar, och de nuvarande implikationerna av EasyPhoto WebUI stöder olika fotostilar och flera modifieringar. Dessutom kan användare generera bilder med hjälp av SDXL-modellen för att generera mer tillfredsställande, exakta och varierade bilder. EasyPhoto-ramverket använder en stabil diffusionsbasmodell kombinerad med en förtränad LoRA-modell som producerar högkvalitativa bildutdata.

Intresserad av bildgenererare? Vi erbjuder också en lista över de bästa AI-headshot-genererarna och de bästa AI-bildgenererarna som är lätta att använda och kräver ingen teknisk expertis.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.