KI-Modelle und Plattformen
HochprÃĪzise semantische Bildbearbeitung mit EditGAN
Generative Adversarial Networks oder GANs haben in den letzten Monaten neue Anwendungen in der Bildbearbeitungsindustrie gefunden. EditGAN gewinnt in der AI/ML-Industrie an PopularitÃĪt, da es eine neuartige Methode fÞr hochprÃĪzise und hochwertige semantische Bildbearbeitung ist.
Wir werden uns mit dem EditGAN-Modell im Detail befassen und erklÃĪren, warum es ein Meilenstein in der semantischen Bildbearbeitungsindustrie sein kÃķnnte.
Lassen Sie uns beginnen. Bevor wir jedoch herausfinden, was EditGAN ist, ist es wichtig, die Bedeutung von EditGAN und warum es ein wichtiger Schritt nach vorne ist, zu verstehen.
Warum EditGAN?
Obwohl traditionelle GAN-Architekturen die AI-basierte Bildbearbeitungsindustrie erheblich vorangebracht haben, gibt es einige groÃe Herausforderungen bei der Erstellung einer GAN-Architektur von Grund auf.
- WÃĪhrend der Trainingsphase benÃķtigt eine GAN-Architektur eine groÃe Menge an gelabelten Daten mit semantischen Segmentierungsannotationen.
- Sie sind nur in der Lage, eine hohe Kontrolle zu bieten.
- Und oft interpolieren sie nur zwischen Bildern hin und her.
Es kann beobachtet werden, dass traditionelle GAN-Architekturen die Arbeit zwar erledigen, aber nicht effektiv fÞr eine breite EinsatzmÃķglichkeit sind. Die geringe Effizienz traditioneller GAN-Architekturen ist der Grund, warum EditGAN von NVIDIA (NVDA ) im Jahr 2022 vorgestellt wurde.
EditGAN ist vorgeschlagen, um eine effektive Methode fÞr hochprÃĪzise und hochwertige semantische Bildbearbeitung mit der FÃĪhigkeit zu bieten, Benutzern zu ermÃķglichen, Bilder durch Ãndern ihrer hochdetaillierten Segmentierungsmasken zu bearbeiten. Einer der GrÞnde, warum EditGAN eine skalierbare Methode fÞr Bildbearbeitungsaufgaben ist, liegt in seiner Architektur.
Das EditGAN-Modell basiert auf einem GAN-Rahmenwerk, das Bilder und ihre semantischen Segmentierungen gemeinsam modelliert und nur eine Handvoll gelabelter oder annotierter Trainingsdaten benÃķtigt. Die Entwickler von EditGAN haben versucht, ein Bild in den latenten Raum von GAN einzubetten, um das Bild effektiv durch bedingte latente Code-Optimierung gemÃĪà der Segmentierungsbearbeitung zu ÃĪndern. DarÞber hinaus versucht das Modell, âBearbeitungsvektorenâ im latenten Raum zu finden, die die Bearbeitungen realisieren.
Die Architektur des EditGAN-Rahmenwerks ermÃķglicht es dem Modell, eine beliebige Anzahl von Bearbeitungsvektoren zu erlernen, die dann direkt auf andere Bilder mit hoher Geschwindigkeit und Effizienz angewendet werden kÃķnnen. DarÞber hinaus zeigen experimentelle Ergebnisse, dass EditGAN Bilder mit einem noch nie dagewesenen Detailgrad bearbeiten kann, wÃĪhrend die BildqualitÃĪt maximal erhalten bleibt.
Um zusammenzufassen, warum wir EditGAN benÃķtigen, ist es das erste GAN-basierte Bildbearbeitungsframework, das
- Sehr hochprÃĪzise Bearbeitung bietet.
- Mit einer Handvoll gelabelter Daten arbeiten kann.
- Effektiv in Echtzeit-Szenarien eingesetzt werden kann.
- Komposition fÞr multiple Bearbeitungen gleichzeitig ermÃķglicht.
- Auf GAN-generierte, reale eingebettete und sogar auÃerhalb des Bereichs liegende Bilder funktioniert.
HochprÃĪzise semantische Bildbearbeitung mit EditGAN
StyleGAN2, ein State-of-the-Art-GAN-Rahmenwerk fÞr Bildsynthese, ist die primÃĪre Bildgenerierungskomponente von EditGAN. Das StyleGAN2-Rahmenwerk mappt latente Codes, die aus einer Menge multivariater Normalverteilung gezogen werden, und mappt sie in realistische Bilder.
StyleGAN2 ist ein tiefes generatives Modell, das trainiert wurde, um Bilder der hÃķchsten QualitÃĪt mÃķglich zu synthetisieren, zusammen mit einem semantischen VerstÃĪndnis der modellierten Bilder.
Segmentierungstraining und -inferenz
Das EditGAN-Modell bettet ein Bild in den latenten Raum von GAN mithilfe von Optimierung und einem Encoder ein, um eine Segmentierung auf einem neuen Bild durchzufÞhren und die Segmentierungsverzweigung zu trainieren. Das EditGAN-Rahmenwerk baut auf vorherigen Arbeiten auf und trainiert einen Encoder, um Bilder im latenten Raum einzubetten. Das primÃĪre Ziel hier ist, den Encoder mit Standard-Pixel-weise-L2- und LPIPS-Konstruktionsverlusten mithilfe von GAN- und Echtzeit-Trainingsdaten zu trainieren. DarÞber hinaus regularisiert das Modell den Encoder explizit mithilfe der latenten Codes, wenn es mit GAN-Beispielen arbeitet.
Infolgedessen bettet das Modell die annotierten Bilder aus der Datenbank, die mit semantischer Segmentierung beschriftet sind, in den latenten Raum ein und verwendet Kreuzentropieverlust, um die Segmentierungsverzweigung des Generators zu trainieren.
Verwendung von Segmentierungsbearbeitung, um Semantik im latenten Raum zu finden
Der primÃĪre Zweck von EditGAN ist es, die gemeinsame Verteilung von semantischen Segmentierungen und Bildern fÞr hochprÃĪzise Bildbearbeitung zu nutzen. Nehmen wir an, wir haben ein Bild x, das bearbeitet werden muss, so dass das Modell das Bild in den latenten Raum von EditGAN einbettet oder Beispiele aus dem Modell selbst verwendet. Die Segmentierungsverzweigung generiert dann y oder die entsprechende Segmentierung, hauptsÃĪchlich weil sowohl RGB-Bilder als auch Segmentierungen die gleichen latenten Codes w teilen. Entwickler kÃķnnen dann beliebige Markierungs- oder digitale Malwerkzeuge verwenden, um die Segmentierung zu ÃĪndern und sie manuell nach Bedarf zu bearbeiten.

Unterschiedliche Arten der Bearbeitung wÃĪhrend der Inferenz
Die im latenten Raum ermittelten Bearbeitungsvektoren kÃķnnen als semantisch bedeutsam beschrieben werden und sind oft von verschiedenen Attributen entkoppelt. Daher kann das Modell, um ein neues Bild zu bearbeiten, das Bild direkt in den latenten Raum einbetten und die gleichen Bearbeitungsoperationen durchfÞhren, die das Modell zuvor gelernt hat, ohne die Optimierung von vorne herein zu starten. Es wÃĪre sicher zu sagen, dass die Bearbeitungsvektoren, die das Modell lernt, die Optimierung amortisieren, die ursprÞnglich erforderlich war, um das Bild zu bearbeiten.
Es ist erwÃĪhnenswert, dass die Entwickler die Entkopplung noch nicht perfektioniert haben und die Bearbeitungsvektoren oft nicht die besten Ergebnisse liefern, wenn sie auf andere Bilder angewendet werden. Dieses Problem kann jedoch durch Entfernen von Bearbeitungsartefakten aus anderen Teilen des Bildes Þberwunden werden, indem einige zusÃĪtzliche Optimierungsschritte wÃĪhrend der Testzeit durchgefÞhrt werden.
Basierend auf unseren aktuellen Erkenntnissen kann das EditGAN-Rahmenwerk auf drei verschiedene Arten verwendet werden, um Bilder zu bearbeiten.
- Echtzeit-Bearbeitung mit Bearbeitungsvektoren
FÞr lokalisierte und entkoppelte Bilder bearbeitet das Modell die Bilder, indem es die zuvor gelernten Bearbeitungsvektoren mit verschiedenen Skalen anwendet und die Bilder mit interaktiven Raten manipuliert.
- Verwendung von selbstÞberwachter Refinierung fÞr vektorbasierte Bearbeitung
FÞr die Bearbeitung von lokalisierten Bildern, die nicht perfekt mit anderen Teilen des Bildes entkoppelt sind, initialisiert das Modell die Bearbeitung des Bildes mithilfe der zuvor gelernten Bearbeitungsvektoren und entfernt Bearbeitungsartefakte, indem es einige zusÃĪtzliche Optimierungsschritte wÃĪhrend der Testzeit durchfÞhrt.
- Optimierungsbasierte Bearbeitung
Um groÃe und bildspezifische Bearbeitungen durchzufÞhren, fÞhrt das Modell die Optimierung von vorne herein durch, da Bearbeitungsvektoren nicht verwendet werden kÃķnnen, um diese Arten von Ãbertragungen auf andere Bilder durchzufÞhren.
Implementierung
Das EditGAN-Rahmenwerk wird auf Bildern aus vier verschiedenen Kategorien ausgewertet: Autos, VÃķgel, Katzen und Gesichter. Die Segmentierungsverzweigung des Modells wird mithilfe von Bild-Masken-Paaren von 16, 30, 30, 16 als gelabelte Trainingsdaten fÞr Autos, VÃķgel, Katzen und Gesichter trainiert. Wenn das Bild ausschlieÃlich mithilfe von Optimierung oder wenn das Modell versucht, die Bearbeitungsvektoren zu erlernen, fÞhrt das Modell 100 Optimierungsschritte mithilfe des Adam-Optimierers durch.
FÞr die Katzen-, Auto- und GesichtsdatensÃĪtze verwendet das Modell reale Bilder aus dem Testdatensatz von DatasetGAN, die nicht zum Trainieren des GAN-Rahmenwerks verwendet wurden, um die Bearbeitungsfunktion durchzufÞhren. Diese Bilder werden direkt in den latenten Raum von EditGAN eingebettet, indem Optimierung und Kodierung verwendet werden. FÞr die Vogelkategorie wird die Bearbeitung auf GAN-generierten Bildern gezeigt.
Ergebnisse
Qualitative Ergebnisse
In-Domain-Ergebnisse

Das obige Bild zeigt die Leistung des EditGAN-Rahmenwerks, wenn es die zuvor gelernten Bearbeitungsvektoren auf neue Bilder anwendet und die Bilder mithilfe von 30 Optimierungsschritten verfeinert. Diese von EditGAN durchgefÞhrten Bearbeitungsoperationen sind fÞr alle Klassen entkoppelt und bewahren die GesamtbildqualitÃĪt.
Was erstaunlich ist, ist, dass das EditGAN-Rahmenwerk sehr hochprÃĪzise Bearbeitungen wie das Erweitern der Pupillen oder das Bearbeiten der Felgen in den Reifen eines Autos durchfÞhren kann. DarÞber hinaus kann EditGAN auch verwendet werden, um semantische Teile von Objekten zu bearbeiten, die nur wenige Pixel haben, oder um groÃe Ãnderungen an einem Bild vorzunehmen. Es ist erwÃĪhnenswert, dass die mehreren Bearbeitungsoperationen des EditGAN-Rahmenwerks in der Lage sind, manipulierte Bilder zu generieren, die nicht im GAN-Trainingsdatensatz vorkommen.
AuÃerhalb des Bereichs liegende Ergebnisse
Um die Leistung von EditGAN auÃerhalb des Bereichs zu bewerten, wurde das Rahmenwerk auf dem MetFaces-Datensatz getestet. Das EditGAN-Modell verwendet echte Gesichter aus dem Bereich, um Bearbeitungsvektoren zu erstellen. Das Modell bettet dann MetFaces-PortrÃĪts, die auÃerhalb des Bereichs liegen, mithilfe eines 100-Schritt-Optimierungsprozesses ein und wendet die Bearbeitungsvektoren mithilfe eines 30-Schritt-SelbstÞberwachungs-Verfeinerungsprozesses an. Die Ergebnisse kÃķnnen im folgenden Bild gesehen werden.

Quantitative Ergebnisse
Um die BildbearbeitungsfÃĪhigkeiten von EditGAN quantitativ zu messen, verwendet das Modell einen LÃĪchel-Bearbeitungs-Benchmark, der ursprÞnglich von MaskGAN eingefÞhrt wurde. Gesichter mit neutraler Ausdrucksweise werden durch lÃĪchelnde Gesichter ersetzt und die Leistung wird Þber drei Parameter gemessen.
- Semantische Korrektheit
Das Modell verwendet einen vorgefertigten LÃĪchel-Attribut-Klassifizierer, um zu messen, ob die Gesichter in den Bildern nach der Bearbeitung lÃĪchelnde Ausdrucksweise zeigen.
- Verteilungs-Image-QualitÃĪt
Kernel-Inception-Distanz oder KID und Frechet-Inception-Distanz oder FID werden zwischen dem CelebA-Testdatensatz und 400 bearbeiteten Testbildern berechnet.
- IdentitÃĪtsbewahrung
Die FÃĪhigkeit des Modells, die IdentitÃĪt der Subjekte bei der Bildbearbeitung zu bewahren, wird mithilfe eines vorgefertigten ArcFace-Feature-Extraktionsnetzwerks gemessen.

Die obige Tabelle vergleicht die Leistung des EditGAN-Rahmenwerks mit anderen Basismodellen im LÃĪchel-Bearbeitungs-Benchmark. Die Methode, die das EditGAN-Rahmenwerk verwendet, um solche hohen Ergebnisse zu liefern, wird Þber drei verschiedene Basismodelle verglichen:
- MaskGAN
MaskGAN verwendet nicht lÃĪchelnde Bilder zusammen mit ihren Segmentierungsmasken und einer Ziel-LÃĪchel-Segmentierungs-Maske als Eingabe. Es ist erwÃĪhnenswert, dass das MaskGAN-Rahmenwerk im Vergleich zu EditGAN eine groÃe Menge an annotierten Daten erfordert.
- Lokale Bearbeitung
EditGAN vergleicht auch seine Leistung mit lokaler Bearbeitung, einer Methode, die verwendet wird, um GAN-Features zu clustern, um lokale Bearbeitung durchzufÞhren, und die von Referenzbildern abhÃĪngt.
- InterFaceGAN
Ãhnlich wie EditGAN versucht InterFaceGAN, Bearbeitungsvektoren im latenten Raum des Modells zu finden. Allerdings verwendet das InterFaceGAN-Modell im Gegensatz zu EditGAN eine groÃe Menge an annotierten Daten, Hilfsattribut-Klassifizierern und hat keine feine BearbeitungsprÃĪzision.
- StyleGAN2-Destillation
Diese Methode schafft einen alternativen Ansatz, der keine echten Bild-Einbettungen erfordert, sondern stattdessen ein Bearbeitungsvektor-Modell verwendet, um ein Trainingsdatensatz zu erstellen.

EinschrÃĪnkungen
Da EditGAN auf dem GAN-Rahmenwerk basiert, hat es die gleichen EinschrÃĪnkungen wie jedes andere GAN-Modell: Es kann nur mit Bildern arbeiten, die von GAN modelliert werden kÃķnnen. Die EinschrÃĪnkung von EditGAN, nur mit GAN-modellierten Bildern zu arbeiten, ist der Hauptgrund, warum es schwierig ist, EditGAN in verschiedenen Szenarien einzusetzen. Es ist jedoch erwÃĪhnenswert, dass die hochprÃĪzisen Bearbeitungen von EditGAN leicht auf andere verschiedene Bilder Þbertragen werden kÃķnnen, indem Bearbeitungsvektoren verwendet werden.
Fazit
Einer der HauptgrÞnde, warum GAN kein Industriestandard in der Bildbearbeitung ist, liegt in seiner begrenzten PraktikabilitÃĪt. GAN-Rahmenwerke erfordern in der Regel eine groÃe Menge an annotierten Trainingsdaten und liefern oft keine hohe Effizienz und Genauigkeit.
EditGAN zielt darauf ab, die Probleme zu lÃķsen, die durch konventionelle GAN-Rahmenwerke aufgeworfen werden, und versucht, eine effektive Methode fÞr hochwertige und hochprÃĪzise semantische Bildbearbeitung zu sein. Die Ergebnisse haben bisher gezeigt, dass EditGAN tatsÃĪchlich das bietet, was es beansprucht, und bereits besser als einige der aktuellen Industriestandards und -modelle performt.












