KI-Modelle und Plattformen
InstantID: Zero-Shot-Identitätspräservierende Bildgenerierung in Sekunden
Die von künstlicher Intelligenz angetriebene Bildgenerierungstechnologie hat in den letzten Jahren eine bemerkenswerte Entwicklung erlebt, seitdem große Text-zu-Bild-Diffusionsmodelle wie DALL-E, GLIDE, Stable Diffusion, Imagen und mehr auf der Bildfläche erschienen sind. Trotz der Tatsache, dass Bildgenerierungs-AI-Modelle eine einzigartige Architektur und Trainingsmethoden haben, teilen sie alle ein gemeinsames Ziel: maßgeschneiderte und personalisierte Bildgenerierung, die darauf abzielt, Bilder mit konsistenter Charakter-ID, Subjekt und Stil auf der Grundlage von Referenzbildern zu erstellen. Aufgrund ihrer bemerkenswerten generativen Fähigkeiten haben moderne Bildgenerierungs-AI-Frameworks Anwendungen in Bereichen wie Bildanimation, virtueller Realität, E-Commerce, AI-Porträts und mehr gefunden. Allerdings teilen diese Frameworks trotz ihrer bemerkenswerten generativen Fähigkeiten ein gemeinsames Hindernis: die meisten von ihnen sind nicht in der Lage, maßgeschneiderte Bilder zu generieren, während sie die feinen Identitätsdetails von menschlichen Objekten erhalten.
Das Generieren von maßgeschneiderten Bildern, während die feinen Details erhalten werden, ist von entscheidender Bedeutung, insbesondere bei menschlichen Gesichtsidentitätsaufgaben, die einen hohen Standard an Fidelität und Detail erfordern und nuancierte Semantik im Vergleich zu allgemeinen Objektbildgenerierungsaufgaben, die sich primär auf grobe Texturen und Farben konzentrieren. Darüber hinaus haben personalisierte Bildsynthese-Frameworks in den letzten Jahren wie LoRA, DreamBooth, Textual Inversion und mehr erhebliche Fortschritte gemacht. Allerdings sind personalisierte Bildgenerierungs-AI-Modelle noch nicht perfekt für die Verwendung in realen Szenarien, da sie hohe Speicheranforderungen haben, mehrere Referenzbilder erfordern und oft einen langwierigen Feinabstimmungsprozess haben. Andererseits erfordern bestehende ID-Embedding-basierte Methoden nur eine einzelne Vorwärtsreferenz, aber sie entweder fehlen die Kompatibilität mit öffentlich verfügbaren vorgefertigten Modellen oder erfordern einen übermäßigen Feinabstimmungsprozess über zahlreiche Parameter oder sie scheitern daran, eine hohe Gesichtsfidelität zu erhalten.
Um diese Herausforderungen zu bewältigen und die Bildgenerierungsfähigkeiten weiter zu verbessern, werden wir in diesem Artikel über InstantID sprechen, ein Diffusionsmodell-basiertes Lösung für Bildgenerierung. InstantID ist ein Plug-and-Play-Modul, das Bildgenerierung und Personalisierung auf verschiedene Stile mit nur einem Referenzbild und auch hoher Fidelität ausführt. Das primäre Ziel dieses Artikels ist es, den Lesern ein umfassendes Verständnis der technischen Grundlagen und Komponenten des InstantID-Frameworks zu vermitteln, indem wir uns mit der Architektur des Modells, dem Trainingsprozess und den Anwendungsszenarien auseinandersetzen. Also los geht’s.
InstantID: Zero-Shot-Identitätspräservierende Bildgenerierung
Das Auftauchen von Text-zu-Bild-Diffusionsmodellen hat erheblich zur Weiterentwicklung der Bildgenerierungstechnologie beigetragen. Das primäre Ziel dieser Modelle ist maßgeschneiderte und personalisierte Bildgenerierung, und die Erstellung von Bildern mit konsistenter Subjekt-, Stil- und Charakter-ID unter Verwendung von einem oder mehreren Referenzbildern. Die Fähigkeit dieser Frameworks, konsistente Bilder zu erstellen, hat potenzielle Anwendungen in verschiedenen Branchen wie Bildanimation, AI-Porträtgenerierung, E-Commerce, virtueller und erweiterter Realität und vielem mehr geschaffen.
Allerdings trotz ihrer bemerkenswerten Fähigkeiten stehen diese Frameworks vor einer grundlegenden Herausforderung: sie haben oft Schwierigkeiten, maßgeschneiderte Bilder zu generieren, die die feinen Details von menschlichen Subjekten genau erhalten. Es ist erwähnenswert, dass das Generieren von maßgeschneiderten Bildern mit inhärenten Details eine schwierige Aufgabe ist, da menschliche Gesichtsidentität einen höheren Grad an Fidelität und Detail sowie fortgeschrittenere Semantik erfordert im Vergleich zu allgemeinen Objekten oder Stilen, die sich primär auf Farben oder grobe Texturen konzentrieren. Bestehende Text-zu-Bild-Modelle basieren auf detaillierten textuellen Beschreibungen und haben Schwierigkeiten, starke semantische Relevanz für maßgeschneiderte Bildgenerierung zu erreichen. Darüber hinaus fügen einige große vorgefertigte Text-zu-Bild-Frameworks räumliche Steuerungselemente hinzu, um die Steuerbarkeit zu verbessern, was eine feinkörnige strukturelle Steuerung unter Verwendung von Elementen wie Körperhaltungen, Tiefenmaps, Benutzerzeichnungen, semantischen Segmentierungskarten und mehr ermöglicht. Allerdings trotz dieser Ergänzungen und Verbesserungen sind diese Frameworks nur in der Lage, partielle Fidelität des generierten Bildes zum Referenzbild zu erreichen.
Um diese Hürden zu überwinden, konzentriert sich das InstantID-Framework auf instantane identitätspräservierende Bildsynthese und versucht, die Lücke zwischen Effizienz und hoher Fidelität zu schließen, indem es ein einfaches Plug-and-Play-Modul einführt, das es dem Framework ermöglicht, Bildpersonalisierung unter Verwendung von nur einem Gesichtsbild und gleichzeitig hoher Fidelität zu handhaben. Darüber hinaus implementiert das InstantID-Framework, um die Gesichtsidentität aus dem Referenzbild zu erhalten, einen neuen Gesichtsencoder, der die feinen Bild-details durch Hinzufügen von schwachen räumlichen und starken semantischen Bedingungen, die den Bildgenerierungsprozess durch Einbeziehung von textuellen Prompts, Landmark-Bild und Gesichtsbild leiten, beibehält.
Es gibt drei unterscheidende Merkmale, die das InstantID-Framework von bestehenden Text-zu-Bild-Generierungsframeworks unterscheiden.
- Kompatibilität und Pluggability: Anstatt auf die vollständigen Parameter des UNet-Frameworks zu trainieren, konzentriert sich das InstantID-Framework auf das Trainieren eines leichten Adapters. Als Ergebnis ist das InstantID-Framework kompatibel und pluggable mit bestehenden vorgefertigten Modellen.
- Feinabstimmungsfrei: Die Methodik des InstantID-Frameworks eliminiert die Notwendigkeit für Feinabstimmung, da es nur eine einzelne Vorwärtspropagation für die Inferenz benötigt, was das Modell sehr praktisch und wirtschaftlich für die Feinabstimmung macht.
- Überlegene Leistung: Das InstantID-Framework zeigt hohe Flexibilität und Fidelität, da es in der Lage ist, Spitzenleistungen mit nur einem Referenzbild zu erzielen, vergleichbar mit trainingsbasierten Methoden, die auf mehreren Referenzbildern basieren.
Insgesamt können die Beiträge des InstantID-Frameworks in den folgenden Punkten zusammengefasst werden.
- Das InstantID-Framework ist eine innovative, identitätspräservierende Anpassungsmethode für vorgefertigte Text-zu-Bild-Diffusionsmodelle mit dem Ziel, die Lücke zwischen Effizienz und Fidelität zu schließen.
- Das InstantID-Framework ist kompatibel und pluggable mit benutzerdefinierten feinabgestimmten Modellen unter Verwendung des gleichen Diffusionsmodells in seiner Architektur, was die Identitätspräservierung in vorgefertigten Modellen ohne zusätzliche Kosten ermöglicht.
InstantID: Methodik und Architektur
Wie bereits erwähnt, ist das InstantID-Framework ein effizienter, leichter Adapter, der vorgefertigte Text-zu-Bild-Diffusionsmodelle mit Identitätspräservierungsfähigkeiten ausstattet.
Die Architektur des InstantID-Frameworks basiert auf dem Stable-Diffusion-Modell, das für seine Fähigkeit bekannt ist, den Diffusionsprozess mit hoher Rechenleistung in einem niedrigdimensionalen latenten Raum anstelle von Pixelraum mit einem Autoencoder auszuführen. Für ein Eingabebild mappt der Encoder das Bild zunächst auf eine latente Darstellung mit Downsampling-Faktor und latenten Dimensionen. Darüber hinaus verwendet der Diffusionsprozess ein Denoising-UNet-Component, um normal verteiltes Rauschen mit noisy latent, Bedingung und aktuellem Zeitpunkt zu entfernen. Die Bedingung ist eine Einbettung von textuellen Prompts, die mit einem vorgefertigten CLIP-Text-Encoder-Component generiert werden.
Darüber hinaus verwendet das InstantID-Framework auch ein ControlNet-Component, das in der Lage ist, räumliche Steuerung zu einem vorgefertigten Diffusionsmodell als Bedingung hinzuzufügen, was über die traditionellen Fähigkeiten von textuellen Prompts hinausgeht. Das ControlNet-Component integriert die UNet-Architektur aus dem Stable-Diffusion-Framework unter Verwendung einer trainierten Replikation des UNet-Components. Die Replikation des UNet-Components weist keine Konvolutionslayer in den mittleren Blöcken und den Encoder-Blöcken auf. Trotz ihrer Ähnlichkeiten unterscheidet sich das ControlNet-Component von dem Stable-Diffusion-Modell; sie unterscheiden sich in dem letzten Residual-Element. Das ControlNet-Component kodiert räumliche Bedingungsinformationen wie Posen, Tiefenmaps, Skizzen und mehr, indem es die Residuen zu den UNet-Blöcken hinzufügt und diese Residuen dann in das ursprüngliche Netzwerk einbettet.
Das InstantID-Framework zieht auch Inspiration aus IP-Adapter oder Image-Prompt-Adapter, der einen neuen Ansatz zur Erreichung von Bild-Prompt-Fähigkeiten einführt, der parallel zu textuellen Prompts läuft, ohne dass die ursprünglichen Text-zu-Bild-Modelle modifiziert werden müssen. Das IP-Adapter-Component verwendet auch eine einzigartige dekoppelte Cross-Attention-Strategie, die zusätzliche Cross-Attention-Layer verwendet, um die Bildmerkmale einzubetten, während die anderen Parameter unverändert bleiben.
Methodik
Um Ihnen einen kurzen Überblick zu geben, zielt das InstantID-Framework darauf ab, maßgeschneiderte Bilder mit unterschiedlichen Stilen oder Posen unter Verwendung von nur einem Referenz-ID-Bild mit hoher Fidelität zu generieren. Die folgende Abbildung gibt einen kurzen Überblick über das InstantID-Framework.

Wie zu sehen ist, hat das InstantID-Framework drei wesentliche Komponenten:
- Eine ID-Embedding-Komponente, die robuste semantische Informationen der Gesichtszüge im Bild erfasst.
- Eine leichte adaptierte Modul mit einer dekoppelten Cross-Attention-Komponente, um die Verwendung von einem Bild als visuellem Prompt zu ermöglichen.
- Eine IdentityNet-Komponente, die die detaillierten Merkmale aus dem Referenzbild unter Verwendung von zusätzlicher räumlicher Steuerung kodiert.
ID-Embedding
Im Gegensatz zu bestehenden Methoden wie FaceStudio, PhotoMaker, IP-Adapter und mehr, die auf einem vorgefertigten CLIP-Bild-Encoder basieren, um visuelle Prompts zu extrahieren, konzentriert sich das InstantID-Framework auf verbesserte Fidelität und stärkere semantische Details in der Identitätspräservierungsaufgabe. Es ist erwähnenswert, dass die inhärenten Einschränkungen des CLIP-Components hauptsächlich in seinem Trainingsprozess auf schwach ausgerichteten Daten liegen, was bedeutet, dass die kodierten Merkmale des CLIP-Encoders hauptsächlich breite und mehrdeutige semantische Informationen wie Farben, Stil und Komposition erfassen. Obwohl diese Merkmale als allgemeine Ergänzung zu Text-Embeddings dienen können, sind sie nicht geeignet für präzise Identitätspräservierungsaufgaben, die starke Semantik und hohe Fidelität erfordern. Darüber hinaus hat die jüngste Forschung in Gesichtsrepräsentationsmodellen, insbesondere im Bereich der Gesichtserkennung, die Effizienz von Gesichtsrepräsentationen in komplexen Aufgaben wie Gesichtsrekonstruktion und -erkennung demonstriert. Aufbauend auf diesem Wissen zielt das InstantID-Framework darauf ab, ein vorgefertigtes Gesichtsmodell zu nutzen, um Gesichts-ID-Embeddings aus dem Referenzbild zu erkennen und zu extrahieren, um das Modell für die Bildgenerierung zu leiten.
Bild-Adapter
Die Fähigkeit von vorgefertigten Text-zu-Bild-Diffusionsmodellen in Bild-Prompt-Aufgaben verbessert die textuellen Prompts erheblich, insbesondere in Szenarien, die nicht ausreichend durch textuelle Prompts beschrieben werden können. Das InstantID-Framework verwendet eine Strategie, die der des IP-Adapter-Modells für Bild-Prompting ähnelt, die einen leichten adaptiven Modul mit einer dekoppelten Cross-Attention-Komponente einführt, um Bilder als Eingabe-Prompts zu unterstützen. Allerdings weicht das InstantID-Framework von den grob ausgerichteten CLIP-Embeddings ab, indem es ID-Embeddings als Bild-Prompts verwendet, um eine semantisch reiche und nuanciertere Prompt-Integration zu erreichen.
IdentityNet
Obwohl bestehende Methoden in der Lage sind, Bild-Prompts mit textuellen Prompts zu integrieren, argumentiert das InstantID-Framework, dass diese Methoden nur grobe Merkmale mit einem Grad an Integration verbessern, der für Identitätspräservierungs-Bildgenerierung unzureichend ist. Darüber hinaus neigt das Hinzufügen von Bild- und Text-Tokens in Cross-Attention-Layer direkt dazu, die Kontrolle der Text-Tokens zu schwächen, und ein Versuch, die Stärke der Bild-Tokens zu verbessern, könnte die Fähigkeiten der Text-Tokens bei Bearbeitungsaufgaben beeinträchtigen. Um diese Herausforderungen zu überwinden, wählt das InstantID-Framework ControlNet, eine alternative Feature-Embedding-Methode, die räumliche Informationen als Eingabe für die kontrollierbare Modul verwendet, um die Konsistenz mit den UNet-Einstellungen in den Diffusionsmodellen zu erhalten.
Das InstantID-Framework führt zwei Änderungen an der traditionellen ControlNet-Architektur durch: für bedingte Eingaben verwendet das InstantID-Framework 5 Gesichtspunkte anstelle von fein granulierten OpenPose-Gesichtspunkten. Zweitens verwendet das InstantID-Framework ID-Embeddings anstelle von textuellen Prompts als Bedingungen für die Cross-Attention-Layer in der ControlNet-Architektur.
Trainings- und Inferenzprozess
Während des Trainingsprozesses optimiert das InstantID-Framework die Parameter von IdentityNet und dem Bild-Adapter, während die Parameter des vorgefertigten Diffusionsmodells eingefroren werden. Die gesamte InstantID-Pipeline wird auf Bild-Text-Paaren trainiert, die menschliche Subjekte enthalten, und verwendet ein Trainingsziel, das dem des Stable-Diffusion-Frameworks ähnelt, mit Aufgaben-spezifischen Bild-Bedingungen. Der Höhepunkt der InstantID-Trainingsmethode ist die Trennung zwischen den Bild- und Text-Cross-Attention-Layern innerhalb des Bild-Prompt-Adapters, eine Wahl, die es dem InstantID-Framework ermöglicht, die Gewichte dieser Bild-Bedingungen flexibel und unabhängig anzupassen, um so einen gezielteren und kontrollierteren Inferenz- und Trainingsprozess zu gewährleisten.
InstantID: Experimente und Ergebnisse
Das InstantID-Framework implementiert das Stable-Diffusion-Modell und trainiert es auf LAION-Face, einer großen offenen Datenbank, die über 50 Millionen Bild-Text-Paare enthält. Darüber hinaus sammelt das InstantID-Framework über 10 Millionen menschliche Bilder, die automatisch mit dem BLIP2-Modell generiert werden, um die Bildgenerierungsqualität weiter zu verbessern. Das InstantID-Framework konzentriert sich primär auf Einzelpersonen-Bilder und verwendet ein vorgefertigtes Gesichtsmodell, um Gesichts-ID-Embeddings aus menschlichen Bildern zu erkennen und zu extrahieren, anstatt die geschnittenen Gesichtsdatensätze zu trainieren. Darüber hinaus werden während des Trainingsprozesses die vorgefertigten Text-zu-Bild-Modelle eingefroren, und nur die Parameter von IdentityNet und dem Bild-Adapter werden aktualisiert.
Bild-Generierung
Das InstantID-Modell verwendet eine leere Prompt, um den Bildgenerierungsprozess unter Verwendung von nur dem Referenzbild zu leiten, und die Ergebnisse ohne Prompts werden in der folgenden Abbildung demonstriert.

Die ‘leere Prompt’-Generierung, wie in der obigen Abbildung gezeigt, demonstriert die Fähigkeit des InstantID-Frameworks, reiche semantische Gesichtsmerkmale wie Identität, Alter und Ausdruck robust zu erhalten. Allerdings ist es erwähnenswert, dass die Verwendung von leeren Prompts möglicherweise nicht in der Lage ist, die Ergebnisse auf andere Semantiken wie Geschlecht genau zu replizieren. Darüber hinaus verwenden die Spalten 2 bis 4 in der obigen Abbildung ein Bild und eine Prompt, und wie zu sehen ist, zeigt das generierte Bild keine Verschlechterung der textuellen Steuerungsfähigkeiten und gewährleistet gleichzeitig Identitätskonsistenz. Schließlich verwenden die Spalten 5 bis 9 ein Bild, eine Prompt und räumliche Steuerung, was die Kompatibilität des Modells mit vorgefertigten räumlichen Steuerungsmodellen demonstriert, was es dem InstantID-Modell ermöglicht, räumliche Steuerungen unter Verwendung eines vorgefertigten ControlNet-Components flexibel einzuführen.

Es ist auch erwähnenswert, dass die Anzahl der Referenzbilder einen erheblichen Einfluss auf das generierte Bild hat, wie in der obigen Abbildung gezeigt. Obwohl das InstantID-Framework in der Lage ist, gute Ergebnisse mit nur einem Referenzbild zu erzielen, produzieren mehrere Referenzbilder ein Bild von besserer Qualität, da das InstantID-Framework den Durchschnittswert der ID-Embeddings als Bild-Prompt verwendet. Wenn man fortfährt, ist es wichtig, das InstantID-Framework mit bestehenden Methoden zu vergleichen, die personalisierte Bilder unter Verwendung von nur einem Referenzbild generieren. Die folgende Abbildung vergleicht die Ergebnisse, die vom InstantID-Framework und bestehenden Spitzenleistungsmodellen für die Generierung von maßgeschneiderten Bildern unter Verwendung von nur einem Referenzbild erzeugt werden.

Wie zu sehen ist, ist das InstantID-Framework in der Lage, Gesichtsmerkmale zu erhalten, dank der ID-Embedding, die reiche semantische Informationen wie Identität, Alter und Geschlecht enthält. Es kann gesagt werden, dass das InstantID-Framework bestehende Frameworks bei der Generierung von maßgeschneiderten Bildern übertrifft, da es in der Lage ist, menschliche Identität zu erhalten, während es gleichzeitig Steuerung und stilistische Flexibilität aufrechterhält.

Final Thoughts
In diesem Artikel haben wir über InstantID gesprochen, ein Diffusionsmodell-basiertes Lösung für Bildgenerierung. InstantID ist ein Plug-and-Play-Modul, das Bildgenerierung und Personalisierung auf verschiedene Stile mit nur einem Referenzbild und auch hoher Fidelität ausführt. Das InstantID-Framework konzentriert sich auf instantane identitätspräservierende Bildsynthese und versucht, die Lücke zwischen Effizienz und hoher Fidelität zu schließen, indem es ein einfaches Plug-and-Play-Modul einführt, das es dem Framework ermöglicht, Bildpersonalisierung unter Verwendung von nur einem Gesichtsbild und gleichzeitig hoher Fidelität zu handhaben.












