Modelli e piattaforme di IA
EasyPhoto: Il Tuo Generatore di Foto AI Personale

Stable Diffusion Web User Interface, o SD-WebUI, è un progetto comprensivo per i modelli Stable Diffusion che utilizza la libreria Gradio per fornire un’interfaccia del browser. Oggi, parleremo di EasyPhoto, un plugin innovativo per WebUI che consente agli utenti di generare ritratti e immagini AI. Il plugin WebUI EasyPhoto crea ritratti AI utilizzando vari template, supportando diversi stili di foto e molteplici modifiche. Inoltre, per potenziare ulteriormente le capacità di EasyPhoto, gli utenti possono generare immagini utilizzando il modello SDXL per risultati più soddisfacenti, precisi e diversificati. Iniziamo.
Introduzione a EasyPhoto e Stable Diffusion
Il framework Stable Diffusion è un framework di generazione basato sulla diffusione popolare e robusto utilizzato dagli sviluppatori per generare immagini realistiche in base a descrizioni di testo di input. Grazie alle sue capacità, il framework Stable Diffusion vanta una vasta gamma di applicazioni, tra cui l’estensione di immagini, la pittura di immagini e la traduzione di immagini. L’interfaccia utente web di Stable Diffusion, o SD-WebUI, si distingue come una delle applicazioni più popolari e conosciute di questo framework. Presenta un’interfaccia del browser costruita sulla libreria Gradio, fornendo un’interfaccia interattiva e facile da usare per i modelli Stable Diffusion. Per potenziare ulteriormente il controllo e l’usabilità nella generazione di immagini, SD-WebUI integra numerose applicazioni Stable Diffusion.
Grazie alla convenienza offerta dal framework SD-WebUI, gli sviluppatori del framework EasyPhoto hanno deciso di crearlo come plugin web anziché come un’applicazione completa. A differenza dei metodi esistenti che spesso soffrono di perdita di identità o introducono caratteristiche irrealistiche nelle immagini, il framework EasyPhoto sfrutta le capacità di immagine-per-immagine dei modelli Stable Diffusion per produrre immagini accurate e realistiche. Gli utenti possono facilmente installare il framework EasyPhoto come estensione all’interno di WebUI, potenziando l’usabilità e l’accessibilità per un’ampia gamma di utenti. Il framework EasyPhoto consente agli utenti di generare ritratti AI guidati dall’identità, di alta qualità e realistici che assomigliano da vicino all’identità di input.
Innanzitutto, il framework EasyPhoto chiede agli utenti di creare il loro doppio digitale caricando alcune immagini per addestrare un modello LoRA o Low-Rank Adaptation online. Il framework LoRA addestra rapidamente i modelli di diffusione utilizzando la tecnologia di adattamento a basso rango. Questo processo consente al modello di base di comprendere le informazioni di identità degli utenti specifici. I modelli addestrati vengono quindi fusi e integrati nel modello Stable Diffusion di base per l’interferenza. Inoltre, durante il processo di interferenza, il modello utilizza modelli di diffusione stabile per riprendere le aree facciali nel template di interferenza, e la somiglianza tra le immagini di input e di output viene verificata utilizzando le varie unità ControlNet.
Il framework EasyPhoto utilizza anche un processo di diffusione a due stadi per affrontare potenziali problemi come gli artifact di bordo e la perdita di identità, assicurando così che le immagini generate minimizzino le incoerenze visive mantenendo l’identità dell’utente. Inoltre, il pipeline di interferenza nel framework EasyPhoto non è limitato solo alla generazione di ritratti, ma può anche essere utilizzato per generare qualsiasi cosa sia legata all’ID dell’utente. Ciò significa che una volta addestrato il modello LoRA per un ID specifico, è possibile generare una vasta gamma di immagini AI, e quindi può avere applicazioni diffuse, tra cui prove virtuali.
Per riassumere, il framework EasyPhoto
- Propone un approccio innovativo per addestrare il modello LoRA incorporando più modelli LoRA per mantenere la fedeltà facciale delle immagini generate.
- Utilizza vari metodi di apprendimento per rinforzo per ottimizzare i modelli LoRA per ricompense di identità facciale che aiutano ulteriormente a migliorare la somiglianza delle identità tra le immagini di addestramento e i risultati generati.
- Propone un processo di diffusione a due stadi basato sull’inpainting che mira a generare foto AI con alta estetica e somiglianza.
EasyPhoto: Architettura e Addestramento
La figura seguente illustra il processo di addestramento del framework AI EasyPhoto.

Come si può vedere, il framework chiede agli utenti di immettere le immagini di addestramento e quindi esegue la rilevamento dei volti per rilevare le posizioni dei volti. Una volta rilevato il volto, il framework ritaglia l’immagine di input utilizzando un rapporto specifico predefinito che si concentra solo sull’area facciale. Il framework utilizza quindi un modello di bellezza della pelle e un modello di rilevamento della salienza per ottenere un’immagine di addestramento pulita e chiara. Questi due modelli svolgono un ruolo cruciale nel migliorare la qualità visiva del volto e assicurarsi che le informazioni di sfondo siano state rimosse e che l’immagine di addestramento contenga principalmente il volto. Infine, il framework utilizza queste immagini elaborate e le promesse di input per addestrare il modello LoRA, dotandolo così della capacità di comprendere meglio le caratteristiche facciali specifiche degli utenti.
Inoltre, durante la fase di addestramento, il framework include un passaggio di convalida critico, in cui il framework calcola il divario di identità del volto tra l’immagine di input dell’utente e l’immagine di verifica generata dal modello LoRA addestrato. Il passaggio di convalida è un processo fondamentale che svolge un ruolo chiave nel raggiungere la fusione dei modelli LoRA, assicurando infine che il modello LoRA addestrato si trasformi in un doppio, o in una rappresentazione digitale precisa dell’utente. Inoltre, l’immagine di verifica con il punteggio di identità del volto ottimale verrà selezionata come immagine di identità del volto e verrà utilizzata per migliorare la somiglianza dell’identità della generazione di interferenza.
Proseguendo, in base al processo di ensemble, il framework addestra i modelli LoRA con la stima della probabilità come obiettivo principale, mentre la conservazione della somiglianza dell’identità facciale è l’obiettivo a valle. Per affrontare questo problema, il framework EasyPhoto utilizza tecniche di apprendimento per rinforzo per ottimizzare direttamente l’obiettivo a valle. Di conseguenza, le caratteristiche facciali che i modelli LoRA apprendono mostrano un miglioramento che porta a una maggiore somiglianza tra i risultati del template generato e dimostra anche la generalizzazione tra i template.
Processo di Interferenza
La figura seguente illustra il processo di interferenza per un ID utente individuale nel framework EasyPhoto e si divide in tre parti
- Pre-elaborazione del Volto per ottenere il riferimento ControlNet e l’immagine di input pre-elaborata.
- Prima Diffusione che aiuta a generare risultati grezzi che assomigliano all’input dell’utente.
- Seconda Diffusione che fissa gli artifact di bordo, rendendo le immagini più accurate e realistiche.

Per l’input, il framework prende un’immagine di identità del volto (generata durante la convalida dell’addestramento utilizzando il punteggio di identità del volto ottimale) e un template di interferenza. L’output è un ritratto dettagliato, accurato e realistico dell’utente, che assomiglia da vicino all’identità e all’aspetto unico dell’utente in base al template di inferenza. Analizziamo questi processi in dettaglio.
Pre-elaborazione del Volto
Un modo per generare un ritratto AI in base a un template di interferenza senza ragionamento consapevole è utilizzare il modello SD per riprendere l’area facciale nel template di interferenza. Inoltre, aggiungendo il framework ControlNet al processo, non solo si migliora la conservazione dell’identità dell’utente, ma si migliora anche la somiglianza tra le immagini generate. Tuttavia, utilizzare ControlNet direttamente per l’inpainting regionale può introdurre potenziali problemi che possono includere
- Incoerenza tra l’Input e l’Immagine Generata: È evidente che i punti chiave nell’immagine del template non sono compatibili con i punti chiave nell’immagine di identità del volto, quindi utilizzare ControlNet con l’immagine di identità del volto come riferimento può portare a alcune incoerenze nel output.
- Defetti nell’Area di Inpainting: Mascherare un’area e poi riprenderla con un nuovo volto potrebbe portare a difetti evidenti, specialmente lungo il confine di inpainting che non solo impatterà sull’autenticità dell’immagine generata, ma influenzerà anche negativamente la realtà dell’immagine.
- Perdita di Identità per Control Net: Poiché il processo di addestramento non utilizza il framework ControlNet, utilizzarlo durante la fase di interferenza potrebbe influenzare la capacità dei modelli LoRA addestrati di conservare l’identità dell’utente.
Per affrontare i problemi menzionati sopra, il framework EasyPhoto propone tre procedure.
- Align e Incolla: Utilizzando un algoritmo di incolla del volto, il framework EasyPhoto mira a risolvere il problema di non corrispondenza tra i punti di riferimento del volto tra l’immagine di identità del volto e il template. Innanzitutto, il modello calcola i punti di riferimento del volto dell’immagine di identità del volto e dell’immagine del template, dopo di che il modello determina la matrice di trasformazione affine che verrà utilizzata per allineare i punti di riferimento del volto dell’immagine del template con l’immagine di identità del volto. L’immagine risultante mantiene gli stessi punti di riferimento dell’immagine di identità del volto e si allinea anche con l’immagine del template.
- Fusione del Volto: La fusione del volto è un approccio innovativo utilizzato per correggere gli artifact di bordo che sono il risultato dell’inpainting della maschera, e coinvolge la rettificazione degli artifact utilizzando il framework ControlNet. Il metodo consente al framework EasyPhoto di assicurare la conservazione di bordi armoniosi e quindi guidare il processo di generazione dell’immagine. L’algoritmo di fusione del volto fonde inoltre l’immagine roop (immagine dell’utente reale) e il template, consentendo all’immagine fusa risultante di esibire una migliore stabilizzazione dei confini dei bordi, che a sua volta porta a un output migliorato durante la prima fase di diffusione.
- Convalida guidata da ControlNet: Poiché i modelli LoRA non sono stati addestrati utilizzando il framework ControlNet, utilizzarlo durante il processo di interferenza potrebbe influenzare la capacità dei modelli LoRA di conservare le identità. Per migliorare le capacità di generalizzazione di EasyPhoto, il framework considera l’influenza del framework ControlNet e incorpora modelli LoRA da diverse fasi.
Prima Diffusione
La prima fase di diffusione utilizza l’immagine del template per generare un’immagine con un ID unico che assomiglia all’ID dell’utente di input. L’immagine di input è una fusione dell’immagine di input dell’utente e del template, mentre la maschera del volto calibrata è la maschera di input. Per aumentare ulteriormente il controllo sulla generazione dell’immagine, il framework EasyPhoto integra tre unità ControlNet, dove la prima unità ControlNet si concentra sul controllo delle immagini fuse, la seconda unità ControlNet controlla i colori dell’immagine fusa e l’ultima unità ControlNet è l’openpose (controllo della posizione dell’utente in tempo reale) dell’immagine sostituita che non contiene solo la struttura facciale dell’immagine del template, ma anche l’identità facciale dell’utente.
Seconda Diffusione
Nella seconda fase di diffusione, gli artifact vicino al bordo del volto vengono raffinati e perfezionati, fornendo agli utenti la flessibilità di mascherare un’area specifica nell’immagine per migliorare l’efficacia della generazione all’interno di quell’area dedicata. In questa fase, il framework fonde l’immagine di output ottenuta dalla prima fase di diffusione con l’immagine roop o il risultato dell’immagine dell’utente, generando così l’immagine di input per la seconda fase di diffusione. Nel complesso, la seconda fase di diffusione svolge un ruolo cruciale nel migliorare la qualità generale e i dettagli dell’immagine generata.
Multi ID Utente
Uno dei punti salienti di EasyPhoto è il suo supporto per la generazione di più ID utente, e la figura seguente illustra il pipeline del processo di interferenza per più ID utente nel framework EasyPhoto.

Per supportare la generazione di più ID utente, il framework EasyPhoto esegue innanzitutto la rilevamento dei volti sul template di interferenza. Questi template di interferenza vengono quindi divisi in numerose maschere, dove ogni maschera contiene solo un volto e il resto dell’immagine è mascherato in bianco, rompendo così la generazione di più ID utente in un compito semplice di generazione di singoli ID utente. Una volta che il framework genera le immagini dell’ID utente, queste immagini vengono fuse nel template di inferenza, facilitando così un’integrazione senza soluzione di continuità del template con le immagini generate, che alla fine produce un’immagine di alta qualità.
Esperimenti e Risultati
Ora che abbiamo una comprensione del framework EasyPhoto, è il momento di esplorare le prestazioni del framework EasyPhoto.

L’immagine sopra è generata dal plugin EasyPhoto e utilizza un modello SD basato su Style per la generazione dell’immagine. Come si può osservare, le immagini generate appaiono realistiche e sono abbastanza accurate.

L’immagine aggiunta sopra è generata dal framework EasyPhoto utilizzando un modello SD basato su Comic Style. Come si può vedere, le foto a fumetto e le foto realistiche appaiono abbastanza realistiche e assomigliano da vicino all’immagine di input in base alle promesse o ai requisiti dell’utente.
L’immagine aggiunta di seguito è stata generata dal framework EasyPhoto utilizzando un template Multi-Person. Come si può vedere chiaramente, le immagini generate sono chiare, accurate e assomigliano all’immagine originale.

Con l’aiuto di EasyPhoto, gli utenti possono ora generare una vasta gamma di ritratti AI, o generare più ID utente utilizzando template preservati, o utilizzare il modello SD per generare template di inferenza. Le immagini aggiunte sopra dimostrano la capacità del framework EasyPhoto nel produrre immagini AI diverse e di alta qualità.
Conclusione
In questo articolo, abbiamo parlato di EasyPhoto, un nuovo plugin WebUI che consente agli utenti finali di generare ritratti e immagini AI. Il plugin WebUI EasyPhoto genera ritratti AI utilizzando template arbitrari e le attuali implicazioni del plugin WebUI EasyPhoto supportano diversi stili di foto e molteplici modifiche. Inoltre, per potenziare ulteriormente le capacità di EasyPhoto, gli utenti hanno la flessibilità di generare immagini utilizzando il modello SDXL per generare immagini più soddisfacenti, accurate e diverse. Il framework EasyPhoto utilizza un modello di base di diffusione stabile accoppiato con un modello LoRA pre-addestrato che produce output di immagini di alta qualità.
Interessati ai generatori di immagini? Offriamo anche un elenco dei migliori generatori di ritratti AI e dei migliori generatori di immagini AI che sono facili da usare e non richiedono competenze tecniche.












