KI-Modelle und Plattformen

EasyPhoto: Ihr persönlicher AI-Foto-Generator

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Web-Benutzeroberfläche, oder SD-WebUI, ist ein umfassendes Projekt für Stable-Diffusion-Modelle, das die Gradio-Bibliothek nutzt, um eine Browser-Oberfläche bereitzustellen. Heute werden wir über EasyPhoto sprechen, ein innovatives WebUI-Plugin, das es Endbenutzern ermöglicht, AI-Porträts und Bilder zu generieren. Das EasyPhoto-WebUI-Plugin erstellt AI-Porträts mithilfe verschiedener Vorlagen, unterstützt verschiedene Foto-Stile und mehrere Modifikationen. Darüber hinaus können Benutzer, um die Fähigkeiten von EasyPhoto weiter zu verbessern, Bilder mithilfe des SDXL-Modells generieren, um noch befriedigendere, genauere und vielfältigere Ergebnisse zu erzielen. Lassen Sie uns beginnen.

Eine Einführung in EasyPhoto und Stable Diffusion

Das Stable-Diffusion-Framework ist ein beliebtes und robustes diffusion-basiertes Generierungs-Framework, das von Entwicklern verwendet wird, um realistische Bilder auf der Grundlage von Eingabe-Textbeschreibungen zu generieren. Dank seiner Fähigkeiten verfügt das Stable-Diffusion-Framework über eine breite Palette von Anwendungen, einschließlich Bildausmalung, Bildübermalung und Bild-zu-Bild-Übersetzung. Die Stable-Diffusion-Web-Oberfläche, oder SD-WebUI, ist eine der bekanntesten und beliebtesten Anwendungen dieses Frameworks. Sie verfügt über eine Browser-Oberfläche, die auf der Gradio-Bibliothek basiert und eine interaktive und benutzerfreundliche Oberfläche für Stable-Diffusion-Modelle bietet. Um die Kontrolle und Benutzerfreundlichkeit bei der Bildgenerierung weiter zu verbessern, integriert die SD-WebUI zahlreiche Stable-Diffusion-Anwendungen.

Aufgrund der Bequemlichkeit, die das SD-WebUI-Framework bietet, entschieden sich die Entwickler des EasyPhoto-Frameworks, es als Web-Plugin und nicht als eigenständige Anwendung zu erstellen. Im Gegensatz zu bestehenden Methoden, die oft unter Identitätsverlust oder der Einführung unrealistischer Merkmale in Bilder leiden, nutzt das EasyPhoto-Framework die Bild-zu-Bild-Fähigkeiten der Stable-Diffusion-Modelle, um genaue und realistische Bilder zu produzieren. Benutzer können das EasyPhoto-Framework leicht als Erweiterung innerhalb der WebUI installieren, wodurch die Benutzerfreundlichkeit und Zugänglichkeit für eine breitere Benutzergruppe verbessert wird. Das EasyPhoto-Framework ermöglicht es Benutzern, identitätsgeführte, hochwertige und realistische AI-Porträts zu generieren, die dem Eingabe-Identitätsmerkmal sehr ähnlich sind.

Zunächst fordert das EasyPhoto-Framework die Benutzer auf, ihr digitales Ebenbild zu erstellen, indem sie einige Bilder hochladen, um ein Gesichts-LoRA- oder Low-Rank-Adaptations-Modell online zu trainieren. Das LoRA-Framework feinjustiert die Diffusions-Modelle mithilfe der Low-Rank-Adaptationstechnologie. Dieser Prozess ermöglicht es dem Basis-Modell, die ID-Informationen bestimmter Benutzer zu verstehen. Die trainierten Modelle werden dann mit dem Baseline-Stable-Diffusion-Modell für Interferenzen kombiniert und integriert. Darüber hinaus verwendet das Modell während des Interferenzprozesses die stabilen Diffusions-Modelle, um die Gesichtsregionen im Interferenz-Template zu übermalen, und die Ähnlichkeit zwischen den Eingabe- und Ausgabebildern wird mithilfe der verschiedenen ControlNet-Einheiten überprüft.

Das EasyPhoto-Framework setzt auch einen zweistufigen Diffusionsprozess ein, um potenzielle Probleme wie Randartefakte und Identitätsverlust zu bekämpfen, um sicherzustellen, dass die generierten Bilder visuelle Inkonsistenzen minimieren, während die Identität des Benutzers erhalten bleibt. Darüber hinaus ist die Interferenz-Pipeline im EasyPhoto-Framework nicht nur auf die Erstellung von Porträts beschränkt, sondern kann auch zur Erstellung von allem verwendet werden, was mit der Benutzer-ID verbunden ist. Dies bedeutet, dass Sie, sobald Sie das LoRA-Modell für eine bestimmte ID trainiert haben, eine Vielzahl von AI-Bildern generieren können, und es somit weitreichende Anwendungen, einschließlich virtueller Anproben, haben kann.

Zusammenfassend lässt sich sagen, dass das EasyPhoto-Framework

  1. einen neuen Ansatz zur Trainierung des LoRA-Modells vorschlägt, indem es mehrere LoRA-Modelle kombiniert, um die Gesichtstreue der generierten Bilder zu erhalten.
  2. verschiedene Verstärkungslernmethoden verwendet, um die LoRA-Modelle für Gesichts-Identitätsbelohnungen zu optimieren, was dazu beiträgt, die Ähnlichkeit zwischen den Trainingsbildern und den generierten Ergebnissen zu verbessern.
  3. einen dualen, auf Inpainting basierenden Diffusionsprozess vorschlägt, der darauf abzielt, AI-Fotos mit hoher Ästhetik und Ähnlichkeit zu generieren.

EasyPhoto: Architektur und Training

Die folgende Abbildung zeigt den Trainingsprozess des EasyPhoto-AI-Frameworks.

Wie zu sehen ist, fordert das Framework die Benutzer zunächst auf, die Trainingsbilder einzugeben, und führt dann eine Gesichtserkennung durch, um die Gesichtspositionen zu erkennen. Sobald das Framework das Gesicht erkannt hat, beschneidet es das Eingabebild mithilfe eines vordefinierten bestimmten Verhältnisses, das sich ausschließlich auf die Gesichtsregion konzentriert. Das Framework setzt dann ein Haut-Schönheits- und ein Saliency-Erkennungsmodell ein, um ein sauberes und klares Gesichts-Trainingsbild zu erhalten. Diese beiden Modelle spielen eine entscheidende Rolle bei der Verbesserung der visuellen Qualität des Gesichts und stellen sicher, dass die Hintergrundinformationen entfernt wurden und das Trainingsbild hauptsächlich das Gesicht enthält. Schließlich verwendet das Framework diese verarbeiteten Bilder und Eingabe-Prompts, um das LoRA-Modell zu trainieren und es so mit der Fähigkeit auszustatten, benutzerspezifische Gesichtsmerkmale effektiver und genauer zu verstehen.

Darüber hinaus schließt das Framework während der Trainingsphase einen kritischen Validierungsschritt ein, bei dem das Framework die Gesichts-ID-Lücke zwischen dem Benutzereingabebild und dem Überprüfungsbild berechnet, das durch das trainierte LoRA-Modell generiert wurde. Der Validierungsschritt ist ein grundlegender Prozess, der eine entscheidende Rolle bei der Erreichung der Verschmelzung der LoRA-Modelle spielt und letztendlich sicherstellt, dass das trainierte LoRA-Framework in ein Ebenbild oder eine genaue digitale Darstellung des Benutzers transformiert wird. Darüber hinaus wird das Überprüfungsbild mit dem optimalen Gesichts-ID-Score als Gesichts-ID-Bild ausgewählt und dieses Gesichts-ID-Bild wird dann verwendet, um die Identitätsähnlichkeit der Interferenz-Generierung zu verbessern.

Weiterhin, basierend auf dem Ensemble-Prozess, trainiert das Framework die LoRA-Modelle mit der Wahrscheinlichkeitsschätzung als primäres Ziel, während die Erhaltung der Gesichts-Identitätsähnlichkeit das Downstream-Ziel ist. Um dieses Problem zu lösen, nutzt das EasyPhoto-Framework Verstärkungslern-Techniken, um das Downstream-Ziel direkt zu optimieren.Infolgedessen zeigen die Gesichtsmerkmale, die die LoRA-Modelle lernen, eine Verbesserung, die zu einer verbesserten Ähnlichkeit zwischen den generierten Ergebnissen und den Vorlagen führt und auch eine Generalisierung über Vorlagen demonstriert.

Interferenzprozess

Die folgende Abbildung zeigt den Interferenzprozess für eine einzelne Benutzer-ID im EasyPhoto-Framework und ist in drei Teile unterteilt

  • Gesichts-Vorverarbeitung zur Erstellung der ControlNet-Referenz und des vorverarbeiteten Eingabebildes.
  • Erste Diffusion, die dabei hilft, grobe Ergebnisse zu generieren, die dem Benutzereingabe ähneln.
  • Zweite Diffusion, die die Randartefakte behebt, wodurch die Bilder genauer und realistischer werden.

Für die Eingabe nimmt das Framework ein Gesichts-ID-Bild (während der Trainingsvalidierung mit dem optimalen Gesichts-ID-Score generiert) und ein Interferenz-Template. Die Ausgabe ist ein hochwertiges, genaues und realistisches Porträt des Benutzers, das der Identität und dem einzigartigen Aussehen des Benutzers auf der Grundlage des Infer-Templates sehr ähnlich ist. Lassen Sie uns einen detaillierten Blick auf diese Prozesse werfen.

Gesichts-Vorverarbeitung

Eine Möglichkeit, ein AI-Porträt auf der Grundlage eines Interferenz-Templates ohne bewusste Argumentation zu erstellen, besteht darin, das SD-Modell zu verwenden, um die Gesichtsregion im Interferenz-Template zu übermalen. Darüber hinaus trägt die Hinzufügung des ControlNet-Frameworks zum Prozess nicht nur zur Erhaltung der Benutzer-Identität bei, sondern auch zur Verbesserung der Ähnlichkeit zwischen den generierten Bildern.

  • Inkonsistenz zwischen dem Eingabe- und dem generierten Bild: Es ist offensichtlich, dass die Schlüsselpunkte im Template-Bild nicht mit den Schlüsselpunkten im Gesichts-ID-Bild kompatibel sind, was bedeutet, dass die Verwendung von ControlNet mit dem Gesichts-ID-Bild als Referenz zu Inkonsistenzen im Ausgabebild führen kann.
  • Defekte in der Übermalungsregion: Das Maskieren einer Region und deren anschließende Übermalung mit einem neuen Gesicht kann zu deutlichen Defekten führen, insbesondere entlang der Übermalungsgrenze, was nicht nur die Authentizität des generierten Bildes beeinträchtigt, sondern auch die Realistik des Bildes negativ beeinflusst.
  • Identitätsverlust durch Control Net: Da der Trainingsprozess das ControlNet-Framework nicht nutzt, kann die Verwendung von ControlNet während des Interferenzprozesses die Fähigkeit des trainierten LoRA-Modells beeinträchtigen, die Eingabe-Benutzer-ID-Identität zu erhalten.

Um die oben genannten Probleme zu lösen, schlägt das EasyPhoto-Framework drei Verfahren vor.

  • Ausrichten und Einsetzen: Durch die Verwendung eines Gesichts-Einsetz-Algorithmus zielt das EasyPhoto-Framework darauf ab, das Problem der Fehlpassung zwischen den Gesichts-Merkmalen zwischen dem Gesichts-ID und dem Template zu lösen. Zunächst berechnet das Modell die Gesichts-Merkmalen des Gesichts-ID und des Template-Bildes, woraufhin das Modell die affine Transformationsmatrix bestimmt, die verwendet wird, um die Gesichts-Merkmalen des Template-Bildes mit dem Gesichts-ID-Bild auszurichten. Das resultierende Bild behält die gleichen Merkmale des Gesichts-ID-Bildes und stimmt auch mit dem Template-Bild überein.
  • Gesichts-Fusion: Gesichts-Fusion ist ein neuer Ansatz, der zur Korrektur der Randartefakte verwendet wird, die durch Masken-Übermalung entstehen, und er beinhaltet die Rektifizierung von Artefakten mithilfe des ControlNet-Frameworks. Die Methode ermöglicht es dem EasyPhoto-Framework, die Erhaltung harmonischer Kanten zu gewährleisten und letztendlich den Bildgenerierungsprozess zu leiten. Der Gesichts-Fusions-Algorithmus fusioniert das Roop- (Ground-Truth-Benutzer-) Bild und das Template, wodurch das resultierende Bild eine bessere Stabilisierung der Kanten zeigt, was zu einer verbesserten Ausgabe während der ersten Diffusionsphase führt.
  • ControlNet-gesteuerte Validierung: Da die LoRA-Modelle nicht mit dem ControlNet-Framework trainiert wurden, kann die Verwendung von ControlNet während des Inferenzprozesses die Fähigkeit des LoRA-Modells beeinträchtigen, die Identitäten zu erhalten. Um die Generalisierungsfähigkeit von EasyPhoto zu verbessern, berücksichtigt das Framework den Einfluss des ControlNet-Frameworks und integriert LoRA-Modelle aus verschiedenen Stufen.

Erste Diffusion

Die erste Diffusionsphase verwendet das Template-Bild, um ein Bild mit einer einzigartigen ID zu generieren, die dem Eingabe-Benutzer-ID ähnelt. Das Eingabebild ist eine Fusion des Benutzereingabebildes und des Template-Bildes, während die justierte Gesichtsmaske die Eingabemaske ist. Um die Kontrolle über die Bildgenerierung weiter zu erhöhen, integriert das EasyPhoto-Framework drei ControlNet-Einheiten, wobei die erste ControlNet-Einheit die Kontrolle der fusionierten Bilder, die zweite ControlNet-Einheit die Farben der fusionierten Bilder und die dritte ControlNet-Einheit die OpenPose (Echtzeit-Mehrpersonen-Human-Pose-Kontrolle) des ersetzen Bildes steuert, das nicht nur die Gesichtsstruktur des Template-Bildes, sondern auch die Gesichts-Identität des Benutzers enthält.

Zweite Diffusion

In der zweiten Diffusionsphase werden die Artefakte in der Nähe der Gesichtsgrenze verfeinert und fein abgestimmt, wodurch den Benutzern die Flexibilität gegeben wird, eine bestimmte Region im Bild zu maskieren, um die Effektivität der Generierung in diesem spezifischen Bereich zu verbessern. In dieser Phase fusioniert das Framework das Ausgabebild, das aus der ersten Diffusionsphase erhalten wurde, mit dem Roop-Bild oder dem Ergebnis des Benutzerbildes, wodurch das Eingabebild für die zweite Diffusionsphase generiert wird. Insgesamt spielt die zweite Diffusionsphase eine entscheidende Rolle bei der Verbesserung der Gesamtkualität und der Details des generierten Bildes.

Mehrere Benutzer-IDs

Eine der herausragenden Eigenschaften von EasyPhoto ist die Unterstützung der Generierung mehrerer Benutzer-IDs, und die folgende Abbildung zeigt den Pipeline-Prozess der Interferenz für mehrere Benutzer-IDs im EasyPhoto-Framework.

Um die Unterstützung für die Generierung mehrerer Benutzer-IDs zu ermöglichen, führt das EasyPhoto-Framework zunächst eine Gesichtserkennung auf dem Interferenz-Template durch. Diese Interferenz-Template werden dann in mehrere Masken unterteilt, wobei jede Maske nur ein Gesicht enthält und der Rest des Bildes in Weiß maskiert ist, wodurch die Generierung mehrerer Benutzer-IDs in eine einfache Aufgabe der Generierung einzelner Benutzer-IDs aufgeteilt wird. Sobald das Framework die Benutzer-ID-Bilder generiert, werden diese Bilder in das Interferenz-Template integriert, wodurch eine nahtlose Integration der Template-Bilder mit den generierten Bildern ermöglicht wird, was letztendlich zu einem hochwertigen Bild führt.

Experimente und Ergebnisse

Jetzt, da wir das EasyPhoto-Framework verstehen, ist es Zeit, die Leistung des EasyPhoto-Frameworks zu erkunden.

Das obige Bild wird vom EasyPhoto-Plugin generiert und verwendet ein Style-basiertes SD-Modell für die Bildgenerierung. Wie zu sehen ist, sehen die generierten Bilder realistisch aus und sind sehr genau.

Das oben hinzugefügte Bild wird vom EasyPhoto-Framework unter Verwendung eines Comic-Style-basierten SD-Modells generiert. Wie zu sehen ist, sehen die Comic-Fotos und die realistischen Fotos sehr realistisch aus und ähneln dem Eingabebild auf der Grundlage der Benutzer-Prompts oder -Anforderungen.

Das hinzugefügte Bild wird vom EasyPhoto-Framework unter Verwendung eines Multi-Person-Template generiert. Wie zu sehen ist, sind die generierten Bilder klar, genau und dem Originalbild sehr ähnlich.

Mit Hilfe von EasyPhoto können Benutzer jetzt eine Vielzahl von AI-Porträts generieren, mehrere Benutzer-IDs unter Verwendung von erhaltenen Vorlagen generieren oder das SD-Modell verwenden, um Interferenz-Template zu generieren. Die oben hinzugefügten Bilder demonstrieren die Fähigkeit des EasyPhoto-Frameworks, vielfältige und hochwertige AI-Bilder zu produzieren.

Schlussfolgerung

In diesem Artikel haben wir über EasyPhoto gesprochen, ein neues WebUI-Plugin, das es Endbenutzern ermöglicht, AI-Porträts und Bilder zu generieren. Das EasyPhoto-WebUI-Plugin generiert AI-Porträts unter Verwendung von beliebigen Vorlagen und unterstützt verschiedene Foto-Stile und mehrere Modifikationen. Darüber hinaus können Benutzer, um die Fähigkeiten von EasyPhoto weiter zu verbessern, Bilder unter Verwendung des SDXL-Modells generieren, um noch befriedigendere, genauere und vielfältigere Ergebnisse zu erzielen. Das EasyPhoto-Framework nutzt ein stabiles Diffusions-Basismodell in Kombination mit einem vorgefertigten LoRA-Modell, das hochwertige Bildausgaben produziert.

Interessiert an Bildgeneratoren? Wir bieten auch eine Liste der Besten AI-Porträt-Generatoren und der Besten AI-Bild-Generatoren, die einfach zu verwenden sind und keine technischen Kenntnisse erfordern.

Ein Ingenieur von Beruf, ein Schriftsteller von Herzen. Kunal ist ein technischer Schriftsteller mit einer tiefen Liebe und einem tiefen Verständnis für KI und ML, der sich der Aufgabe widmet, komplexe Konzepte in diesen Bereichen durch seine ansprechenden und informativen Dokumentationen zu vereinfachen.