Modele și platforme AI
EasyPhoto: Generatorul Dvs. Personal de Fotografii cu Inteligență Artificială

Stable Diffusion Web User Interface, sau SD-WebUI, este un proiect cuprinzător pentru modelele Stable Diffusion care utilizează biblioteca Gradio pentru a oferi o interfață cu browserul. Astăzi, vom discuta despre EasyPhoto, un plugin inovator WebUI care permite utilizatorilor finali să genereze portrete și imagini cu inteligență artificială. Pluginul WebUI EasyPhoto creează portrete cu inteligență artificială utilizând diverse șabloane, susținând diferite stiluri de fotografie și multiple modificări. În plus, pentru a îmbunătăți și mai mult capacitățile EasyPhoto, utilizatorii pot genera imagini utilizând modelul SDXL pentru rezultate mai satisfăcătoare, precise și diverse. Să începem.
Introducere în EasyPhoto și Stable Diffusion
Framework-ul Stable Diffusion este un cadru popular și robust de generare bazat pe difuzie, utilizat de dezvoltatori pentru a genera imagini realiste pe baza descrierilor textuale de intrare. Datorită capacităților sale, framework-ul Stable Diffusion se mândrește cu o gamă largă de aplicații, incluzând picturarea imaginilor, umplerea imaginilor și traducerea imaginilor. Interfata Web UI a Stable Diffusion, sau SD-WebUI, se remarcă ca una dintre cele mai populare și cunoscute aplicații ale acestui cadru. Aceasta prezintă o interfață cu browserul construită pe biblioteca Gradio, oferind o interfață interactivă și ușor de utilizat pentru modelele Stable Diffusion. Pentru a îmbunătăți și mai mult controlul și utilizabilitatea în generarea imaginilor, SD-WebUI integrează numeroase aplicații Stable Diffusion.
Având în vedere conveniența oferită de framework-ul SD-WebUI, dezvoltatorii framework-ului EasyPhoto au decis să-l creeze ca plugin web în loc de o aplicație completă. În contrast cu metodele existente care suferă adesea de pierderea identității sau introduc caracteristici nerealiste în imagini, framework-ul EasyPhoto utilizează capacitățile de imagine-la-imagine ale modelelor Stable Diffusion pentru a produce imagini precise și realiste. Utilizatorii pot instala cu ușurință framework-ul EasyPhoto ca extensie în WebUI, îmbunătățind astfel utilizabilitatea și accesibilitatea pentru un spectru mai larg de utilizatori. Framework-ul EasyPhoto permite utilizatorilor să genereze portrete cu inteligență artificială ghidate de identitate, de înaltă calitate și realiste care seamănă îndeaproape cu identitatea de intrare.
Mai întâi, framework-ul EasyPhoto solicită utilizatorilor să-și creeze un al doilea eu digital prin încărcarea a câtorva imagini pentru a antrena un model LoRA sau Low-Rank Adaptation online. Framework-ul LoRA ajustează rapid modelele de difuzie prin utilizarea tehnologiei de adaptare de rang scăzut. Acest proces permite modelului de bază să înțeleagă informațiile de identitate ale utilizatorilor specifici. Modelele antrenate sunt apoi integrate și fuzionate în modelul de bază Stable Diffusion pentru interferență. În plus, în timpul procesului de interferență, modelul utilizează modele de difuzie stabilă în încercarea de a repicta regiunile faciale în șablonul de interferență, iar similaritatea dintre imaginea de intrare și imaginea de ieșire este verificată utilizând diverse unități ControlNet.
Framework-ul EasyPhoto utilizează, de asemenea, un proces de difuzie în două etape pentru a aborda potențialele probleme, cum ar fi artefactele de frontieră și pierderea identității, asigurând astfel că imaginile generate minimizează incoerențele vizuale, menținând în același timp identitatea utilizatorului. În plus, pipeline-ul de interferență din framework-ul EasyPhoto nu se limitează doar la generarea de portrete, ci poate fi utilizat și pentru a genera orice este legat de identitatea utilizatorului. Acest lucru implică faptul că, odată ce ați antrenat modelul LoRA pentru o anumită identitate, puteți genera o gamă largă de imagini cu inteligență artificială și, prin urmare, poate avea aplicații extinse, incluzând încercări virtuale.
În rezumat, framework-ul EasyPhoto
- Propune o abordare nouă pentru a antrena modelul LoRA prin integrarea mai multor modele LoRA pentru a menține fidelitatea facială a imaginilor generate.
- Utilizează diverse metode de învățare prin întărire pentru a optimiza modelele LoRA pentru recompense de identitate facială, ceea ce ajută la îmbunătățirea similarității identităților între imaginile de antrenament și rezultatele generate.
- Propune un proces de difuzie duală bazat pe umplerea golurilor, care are ca scop generarea de fotografii cu inteligență artificială de înaltă calitate și asemănare.
EasyPhoto: Arhitectură și Antrenament
Următoarea figură demonstrează procesul de antrenament al framework-ului EasyPhoto AI.

Așa cum se poate vedea, framework-ul solicită utilizatorilor să introducă imaginile de antrenament și apoi efectuează detectarea feței pentru a detecta locațiile feței. Odată ce framework-ul detectează fața, decupează imaginea de intrare utilizând un raport specific care se concentrează exclusiv pe regiunea facială. Framework-ul utilizează apoi un model de frumusețe a pielii și un model de detectare a salienței pentru a obține o imagine de antrenament curată și clară a feței. Aceste două modele joacă un rol crucial în îmbunătățirea calității vizuale a feței și asigură că informațiile din fundal au fost eliminate, iar imaginea de antrenament conține în principal fața. În final, framework-ul utilizează aceste imagini prelucrate și prompturile de intrare pentru a antrena modelul LoRA, dându-i astfel capacitatea de a înțelege caracteristicile faciale specifice ale utilizatorului mai eficient și mai precis.
În plus, în timpul fazei de antrenament, framework-ul include o etapă critică de validare, în care framework-ul calculează gap-ul de identitate facială între imaginea de intrare a utilizatorului și imaginea de verificare generată de modelul LoRA antrenat. Etapa de validare este un proces fundamental care joacă un rol cheie în realizarea fuziunii modelelor LoRA, asigurând în final că modelul LoRA antrenat se transformă într-un al doilea eu, sau o reprezentare digitală precisă a utilizatorului. În plus, imaginea de verificare care are scorul optim de identitate facială va fi selectată ca imagine de identitate facială, iar această imagine de identitate facială va fi utilizată pentru a îmbunătăți similaritatea identității în generarea interferenței.
Continuând, pe baza procesului de ansamblu, framework-ul antrenează modelele LoRA cu estimarea probabilității ca obiectiv principal, în timp ce păstrarea similarității identității faciale este obiectivul secundar. Pentru a aborda această problemă, framework-ul EasyPhoto utilizează tehnici de învățare prin întărire pentru a optimiza direct obiectivul secundar.Ca urmare, caracteristicile faciale pe care le învață modelele LoRA prezintă o îmbunătățire care duce la o similaritate îmbunătățită între rezultatele generate și șabloane, și demonstrează, de asemenea, generalizarea pe șabloane.
Procesul de Interferență
Următoarea figură demonstrează procesul de interferență pentru un ID de utilizator individual în framework-ul EasyPhoto și este împărțit în trei părți
- Preprocesarea Feței pentru a obține referința ControlNet și imaginea de intrare prelucrată.
- Prima Difuzie care ajută la generarea de rezultate grosiere care semănă cu intrarea utilizatorului.
- A Doua Difuzie care corectează artefactele de frontieră, făcând imaginile mai precise și mai realiste.

Pentru intrare, framework-ul ia o imagine de identitate facială (generată în timpul validării antrenamentului utilizând scorul optim de identitate facială) și un șablon de interferență. Ieșirea este un portret detaliat, precis și realist al utilizatorului, care semănă îndeaproape cu identitatea și aspectul unic al utilizatorului pe baza șablonului de inferență. Să aruncăm o privire detaliată asupra acestor procese.
Preprocesarea Feței
O modalitate de a genera un portret cu inteligență artificială pe baza unui șablon de interferență fără raționament conștient este de a utiliza modelul SD pentru a umple regiunea facială în șablonul de interferență. În plus, adăugarea framework-ului ControlNet la proces nu numai că îmbunătățește păstrarea identității utilizatorului, dar îmbunătățește și similaritatea dintre imaginile generate.
- Inconsistență între Imaginea de Intrare și Imaginea Generată: Este evident că punctele cheie din imaginea șablonului nu sunt compatibile cu punctele cheie din imaginea de identitate facială, ceea ce face ca utilizarea ControlNet cu imaginea de identitate facială ca referință să poată duce la unele incoerențe în ieșire.
- Defecte în Regiunea de Umplere: Mascarea unei regiuni și apoi umplerea acesteia cu o față nouă poate duce la defecte vizibile, în special de-a lungul marginii de umplere, ceea ce nu numai că afectează autenticitatea imaginii generate, dar afectează și realismul acesteia.
- Pierderea Identității prin ControlNet: Deoarece procesul de antrenament nu utilizează framework-ul ControlNet, utilizarea ControlNet în timpul fazei de interferență poate afecta capacitatea modelului LoRA antrenat de a păstra identitatea utilizatorului.
Pentru a aborda problemele menționate mai sus, framework-ul EasyPhoto propune trei proceduri.
- Lipire și Alipire: Prin utilizarea unui algoritm de lipire a feței, framework-ul EasyPhoto își propune să abordeze problema de nepotrivire între reperele faciale dintre imaginea de identitate facială și imaginea șablonului. Mai întâi, modelul calculează reperele faciale ale imaginii de identitate facială și ale imaginii șablonului, urmat de determinarea matricei de transformare afină care va fi utilizată pentru a alinia reperele faciale ale imaginii șablonului cu imaginea de identitate facială. Imaginea rezultată păstrează aceleași repere ale imaginii de identitate facială și se aliniază, de asemenea, cu imaginea șablonului.
- Fuziunea Feței: Fuziunea feței este o abordare nouă utilizată pentru a corecta artefactele de frontieră care sunt rezultatul mascării și umplerii. Aceasta implică rectificarea artefactelor utilizând framework-ul ControlNet. Metoda permite framework-ului EasyPhoto să asigure păstrarea marginilor armonioase și, în final, să ghideze procesul de generare a imaginii. Algoritmul de fuziune a feței fuzionează, de asemenea, imaginea roop (imaginea reală a utilizatorului) și șablonul, permițând imaginii rezultate să prezinte o stabilizare mai bună a marginilor, ceea ce duce la o ieșire îmbunătățită în timpul primei etape de difuzie.
- Validarea Ghidată de ControlNet: Deoarece modelele LoRA nu au fost antrenate utilizând framework-ul ControlNet, utilizarea acestuia în timpul procesului de inferență poate afecta capacitatea modelului LoRA de a păstra identitățile. Pentru a îmbunătăți capacitățile de generalizare ale EasyPhoto, framework-ul ia în considerare influența framework-ului ControlNet și incorporează modele LoRA din diferite etape.
Prima Difuzie
Prima etapă de difuzie utilizează imaginea șablonului pentru a genera o imagine cu o identitate unică care semănă cu identitatea utilizatorului de intrare. Imaginea de intrare este o fuziune a imaginii de intrare a utilizatorului și a imaginii șablonului, în timp ce masca facială calibrată este masca de intrare. Pentru a crește și mai mult controlul asupra generării imaginilor, framework-ul EasyPhoto integrează trei unități ControlNet, unde prima unitate ControlNet se concentrează pe controlul imaginilor fuzionate, a doua unitate ControlNet controlează culorile imaginii fuzionate, iar a treia unitate ControlNet este openpose (controlul poziției umane în timp real) a imaginii înlocuite, care conține atât structura facială a imaginii șablonului, cât și identitatea facială a utilizatorului.
A Doua Difuzie
În a doua etapă de difuzie, artefactele de lângă marginea feței sunt rafinate și ajustate, oferind utilizatorilor flexibilitatea de a masca o regiune specifică a imaginii pentru a îmbunătăți eficacitatea generării în acea zonă dedicată. În această etapă, framework-ul fuzionează imaginea de ieșire obținută din prima etapă de difuzie cu imaginea roop sau rezultatul imaginii utilizatorului, generând astfel imaginea de intrare pentru a doua etapă de difuzie. În general, a doua etapă de difuzie joacă un rol crucial în îmbunătățirea calității și detaliilor imaginii generate.
Identități Multiple de Utilizator
Una dintre caracteristicile EasyPhoto este suportul pentru generarea de identități multiple de utilizator, iar figura de mai jos demonstrează pipeline-ul procesului de interferență pentru identități multiple de utilizator în framework-ul EasyPhoto.

Pentru a oferi suport pentru generarea de identități multiple de utilizator, framework-ul EasyPhoto efectuează mai întâi detectarea feței pe șablonul de interferență. Aceste șabloane de interferență sunt apoi împărțite în multiple măști, fiecare mască conținând doar o față, iar restul imaginii este mascat în alb, astfel încât generarea de identități multiple de utilizator este transformată într-o sarcină simplă de generare a identităților individuale de utilizator. Odată ce framework-ul generează imaginile de identitate ale utilizatorului, acestea sunt integrate în șablonul de interferență, facilitând astfel o integrare fără probleme a șablonului de imagini cu imaginile generate, ceea ce duce în final la o imagine de înaltă calitate.
Experimente și Rezultate
Acum că am înțeles framework-ul EasyPhoto, este timpul să explorăm performanța framework-ului EasyPhoto.

Imaginea de mai sus este generată de pluginul EasyPhoto și utilizează un model SD bazat pe stil pentru generarea imaginilor. Așa cum se poate observa, imaginile generate par realiste și sunt foarte precise.

Imaginea adăugată mai sus este generată de framework-ul EasyPhoto utilizând un model SD bazat pe stil de benzi desenate. Așa cum se poate vedea, fotografiile de benzi desenate și fotografiile realiste par foarte realiste și semănă îndeaproape cu imaginea de intrare pe baza prompturilor sau cerințelor utilizatorului.
Imaginea adăugată mai jos a fost generată de framework-ul EasyPhoto utilizând un șablon cu multiple persoane. Așa cum se poate vedea clar, imaginile generate sunt clare, precise și semănă cu imaginea originală.

Cu ajutorul EasyPhoto, utilizatorii pot acum genera o gamă largă de portrete cu inteligență artificială, genera identități multiple de utilizator utilizând șabloane păstrate sau utiliza modelul SD pentru a genera șabloane de interferență. Imaginile adăugate mai sus demonstrează capacitatea framework-ului EasyPhoto de a produce imagini cu inteligență artificială diverse și de înaltă calitate.
Concluzie
În acest articol, am discutat despre EasyPhoto, un plugin WebUI inovator care permite utilizatorilor finali să genereze portrete și imagini cu inteligență artificială. Pluginul WebUI EasyPhoto generează portrete cu inteligență artificială utilizând șabloane arbitrare, iar implicațiile actuale ale pluginului WebUI EasyPhoto susțin diferite stiluri de fotografie și multiple modificări. În plus, pentru a îmbunătăți și mai mult capacitățile EasyPhoto, utilizatorii au flexibilitatea de a genera imagini utilizând modelul SDXL pentru a obține rezultate mai satisfăcătoare, precise și diverse. Framework-ul EasyPhoto utilizează un model de difuzie stabilă de bază cuplat cu un model LoRA preantrenat care produce ieșiri de imagine de înaltă calitate.
Interesați de generatori de imagini? De asemenea, oferim o listă a celor mai buni generatori de portrete cu inteligență artificială și a celor mai buni generatori de artă cu inteligență artificială care sunt ușor de utilizat și nu necesită expertiză tehnică.












