AI-modellen en platforms
InstantID: Zero-Shot Identity-Preserving Image Generation in Seconden
AI-gebaseerde beeldgeneratietechnologie heeft de afgelopen jaren een opmerkelijke groei doorgemaakt sinds grote tekst-naar-beeld-diffusiemodellen zoals DALL-E, GLIDE, Stable Diffusion, Imagen en meer op het toneel verschenen. Ondanks het feit dat beeldgeneratie-AI-modellen unieke architectuur en trainingsmethoden hebben, delen ze allemaal een gemeenschappelijk brandpunt: maatwerk en persoonlijke beeldgeneratie die ertoe strekt beelden te creëren met consistent karakter-ID, onderwerp en stijl op basis van referentiebeelden. Vanwege hun opmerkelijke generatieve mogelijkheden hebben moderne beeldgeneratie-AI-kaders toepassingen gevonden in gebieden zoals beeldanimatie, virtuele realiteit, e-commerce, AI-portretten en meer. Echter, ondanks hun opmerkelijke generatieve mogelijkheden, delen deze kaders allemaal een gemeenschappelijke hindernis, de meeste zijn niet in staat om maatwerkbeelden te genereren terwijl ze de delicate identiteitsdetails van menselijke objecten behouden.
Het genereren van maatwerkbeelden terwijl intrigerende details worden behouden, is van kritiek belang, vooral bij menselijke gezichtsidentiteitstaken die een hoge standaard van geloofwaardigheid en detail vereisen, en nuanceerde semantiek wanneer deze worden vergeleken met algemene objectbeeldgeneratietaken die zich voornamelijk richten op grofkorrelige texturen en kleuren. Bovendien hebben persoonlijke beeldsynthesekaders in recente jaren, zoals LoRA, DreamBooth, Textual Inversion en meer, aanzienlijke vooruitgang geboekt. Echter, persoonlijke beeldgeneratieve AI-modellen zijn nog niet perfect voor implementatie in real-world-scenario’s, omdat ze een hoge opslagvereiste hebben, meerdere referentiebeelden vereisen en vaak een langdurig fine-tuningsproces hebben. Aan de andere kant, hoewel bestaande ID-embedding-gebaseerde methoden slechts één enkele voorwaartse referentie vereisen, ontbreken ze aan compatibiliteit met openbaar beschikbare vooraf getrainde modellen, of vereisen ze een overmatig fine-tuningsproces over meerdere parameters, of falen ze om hoge gezichtsgeloofwaardigheid te behouden.
Om deze uitdagingen aan te pakken en de beeldgeneratiecapaciteiten verder te verbeteren, zullen we in dit artikel spreken over InstantID, een diffusiemodel-gebaseerde oplossing voor beeldgeneratie. InstantID is een plug-and-play-module die beeldgeneratie en personalisatie op een vaardige manier afhandelt over verschillende stijlen met slechts één referentiebeeld en zorgt ook voor hoge geloofwaardigheid. Het primaire doel van dit artikel is om onze lezers een grondige kennis te geven van de technische onderbouwing en componenten van het InstantID-kader, aangezien we een gedetailleerde blik zullen werpen op de architectuur van het model, het trainingsproces en de toepassingsmogelijkheden. Laten we dus beginnen.
InstantID: Zero-Shot Identity-Preserving Beeldgeneratie
De opkomst van tekst-naar-beeld-diffusiemodellen heeft aanzienlijk bijgedragen aan de vooruitgang van de beeldgeneratietechnologie. Het primaire doel van deze modellen is maatwerk en persoonlijke generatie, en het creëren van beelden met consistent onderwerp, stijl en karakter-ID met behulp van één of meerdere referentiebeelden. De mogelijkheid van deze kaders om consistente beelden te creëren, heeft potentieel toepassingen gecreëerd in verschillende industrieën, waaronder beeldanimatie, AI-portretgeneratie, e-commerce, virtuele en verbeterde realiteit, en meer.
Echter, ondanks hun opmerkelijke capaciteiten, staan deze kaders voor een fundamentele uitdaging: ze worstelen vaak met het genereren van maatwerkbeelden die de intrigerende details van menselijke onderwerpen nauwkeurig behouden. Het is de moeite waard om op te merken dat het genereren van maatwerkbeelden met intrinsieke details een moeilijke taak is, aangezien menselijke gezichtsidentiteit een hogere mate van geloofwaardigheid en detail vereist, evenals geavanceerdere semantiek wanneer deze wordt vergeleken met algemene objecten of stijlen die zich voornamelijk richten op kleuren of grofkorrelige texturen. Bestaande tekst-naar-beeld-modellen zijn afhankelijk van gedetailleerde tekstuele beschrijvingen en worstelen met het bereiken van sterke semantische relevantie voor maatwerkbeeldgeneratie. Bovendien voegen sommige grote vooraf getrainde tekst-naar-beeld-kaders spatiale controle-opties toe om de controleerbaarheid te verbeteren, waardoor fijne structuurbesturing mogelijk wordt met behulp van elementen zoals lichaamshoudingen, dieptekaarten, gebruikersgetekende schetsen, semantische segmentatiekaarten en meer. Echter, ondanks deze toevoegingen en verbeteringen, zijn deze kaders alleen in staat om gedeeltelijke geloofwaardigheid van het gegenereerde beeld tot het referentiebeeld te bereiken.
Om deze hindernissen te overwinnen, richt het InstantID-kader zich op instant identity-preserving beeldsynthese en probeert het de kloof tussen efficiëntie en hoge geloofwaardigheid te overbruggen door een eenvoudige plug-and-play-module in te voeren die het kader in staat stelt om beeldpersonalisatie te behandelen met behulp van slechts één gezichtsbeeld, terwijl het hoge geloofwaardigheid behoudt. Bovendien, om de gezichtsidentiteit van het referentiebeeld te behouden, voert het InstantID-kader een novum gezichtsencoder in dat de intrigerende beelddetails behoudt door zwakke spatiale en sterke semantische voorwaarden toe te voegen die de beeldgeneratieproces leiden door tekstuele prompts, landmarkbeelden en gezichtsbeelden te incorporeren.
Er zijn drie onderscheidende kenmerken die het InstantID-kader onderscheiden van bestaande tekst-naar-beeld-generatiekaders.
- Compatibiliteit en Pluggability: In plaats van training op volledige parameters van het UNet-kader, richt het InstantID-kader zich op training van een lichtgewicht adapter. Als gevolg hiervan is het InstantID-kader compatibel en pluggable met bestaande vooraf getrainde modellen.
- Tuning-Free: De methodologie van het InstantID-kader elimineert de behoefte aan fine-tuning, aangezien het slechts één enkele voorwaartse propagatie voor inferentie nodig heeft, waardoor het model zeer praktisch en economisch is voor fine-tuning.
- Superieure Prestatie: Het InstantID-kader toont hoge flexibiliteit en geloofwaardigheid, aangezien het in staat is om state-of-the-art-prestaties te leveren met behulp van slechts één referentiebeeld, vergelijkbaar met trainingsgebaseerde methoden die afhankelijk zijn van meerdere referentiebeelden.
Al met al kunnen de bijdragen van het InstantID-kader worden gecategoriseerd in de volgende punten.
- Het InstantID-kader is een innovatieve, ID-preserving adaptatiemethode voor vooraf getrainde tekst-naar-beeld-diffusiemodellen met als doel de kloof tussen efficiëntie en geloofwaardigheid te overbruggen.
- Het InstantID-kader is compatibel en pluggable met aangepaste vooraf getrainde modellen met behulp van hetzelfde diffusiemodel in de architectuur, waardoor ID-preserving in vooraf getrainde modellen mogelijk is zonder extra kosten.
InstantID: Methodologie en Architectuur
Zoals eerder vermeld, is het InstantID-kader een efficiënte lichtgewicht adapter die vooraf getrainde tekst-naar-beeld-diffusiemodellen voorziet van ID-preserving-capaciteiten zonder moeite.
Het gaat over de architectuur, het InstantID-kader is gebouwd op het Stable Diffusion-model, dat bekend staat om zijn vermogen om het diffusieproces uit te voeren met hoge computatiefficiëntie in een laagdimensionale latent ruimte in plaats van pixelruimte met een auto-encoder. Voor een invoerbeeld, kaart de encoder het beeld eerst naar een latent representatie met downsampling factor en latent dimensies. Bovendien, om een normaal verdeelde ruis met lawaaibepaalde latent, conditie en huidige tijdstap te denoiseren, past het diffusieproces een denoiser UNet-component toe. De conditie is een embedding van tekstuele prompts die zijn gegenereerd met behulp van een vooraf getrainde CLIP-tekstencoder-component.
Bovendien maakt het InstantID-kader ook gebruik van een ControlNet-component die in staat is om spatiale controle toe te voegen aan een vooraf getraind diffusiemodel als zijn conditie, waardoor het verder gaat dan de traditionele capaciteiten van tekstuele prompts. De ControlNet-component integreert ook de UNet-architectuur van het Stable Diffusion-kader met behulp van een getrainde replica van de UNet-component. De replica van de UNet-component heeft nul convolutionele lagen binnen de middelste blokken en de encoderblokken. Ondanks hun overeenkomsten, onderscheidt de ControlNet-component zich van het Stable Diffusion-model; ze verschillen in het laatste residu-item. De ControlNet-component codeert spatiale conditie-informatie zoals poses, dieptekaarten, schetsen en meer door de residuen toe te voegen aan de UNet-blok, en embedt deze residuen vervolgens in het oorspronkelijke netwerk.
Het InstantID-kader put ook inspiratie uit IP-Adapter of Image Prompt Adapter, die een novum benadering introduceert om beeldprompt-capaciteiten te bereiken die parallel lopen met tekstuele prompts zonder de originele tekst-naar-beeld-modellen te hoeven wijzigen. De IP-Adapter-component maakt ook gebruik van een unieke decoupled cross-attention-strategie die extra cross-attention-lagen gebruikt om de beeldfuncties te embedden, terwijl de andere parameters ongewijzigd blijven.
Methodologie
Om u een korte overzicht te geven, richt het InstantID-kader zich op het genereren van maatwerkbeelden met verschillende stijlen of poses met behulp van slechts één referentie-ID-beeld met hoge geloofwaardigheid. De volgende figuur geeft een overzicht van het InstantID-kader.

Zoals te zien is, heeft het InstantID-kader drie essentiële componenten:
- Een ID-embedding-component die robuuste semantische informatie van de gezichtskenmerken in het beeld vastlegt.
- Een lichtgewicht aangepaste module met een decoupled cross-attention-component om de gebruiker in staat te stellen een beeld als visuele prompt te gebruiken.
- Een IdentityNet-component die de gedetailleerde functies van het referentiebeeld codeert met behulp van extra spatiale controle.
ID Embedding
In tegenstelling tot bestaande methoden zoals FaceStudio, PhotoMaker, IP-Adapter en meer, die afhankelijk zijn van een vooraf getrainde CLIP-beeldencoder om visuele prompts te extraheren, richt het InstantID-kader zich op verbeterde geloofwaardigheid en sterke semantische details in de ID-preserving-taak. Het is de moeite waard om op te merken dat de inherente beperkingen van de CLIP-component voornamelijk liggen in het trainingsproces op zwak gealigneerde gegevens, wat betekent dat de geëncodeerde functies van de CLIP-encoder voornamelijk brede en vaage semantische informatie vastleggen, zoals kleuren, stijl en compositie. Hoewel deze functies kunnen dienen als algemene aanvulling op tekstembeddings, zijn ze niet geschikt voor precieze ID-preserving-taken die een sterke nadruk leggen op sterke semantiek en hoge geloofwaardigheid. Bovendien heeft recent onderzoek in gezichtsrepresentatiemodellen, met name in gezichtsherkenning, de efficiëntie van gezichtsrepresentatie aangetoond in complexe taken, waaronder gezichtsreconstructie en herkenning. Het InstantID-kader probeert een vooraf getraind gezichtsmodel te gebruiken om gezichts-ID-embeddings te detecteren en te extraheren uit het referentiebeeld, waardoor het model voor beeldgeneratie wordt geleid.
Image Adapter
De mogelijkheid van vooraf getrainde tekst-naar-beeld-diffusiemodellen in beeldprompt-taken verhoogt de tekstprompts aanzienlijk, vooral in scenario’s die niet adequaat door tekstprompts kunnen worden beschreven. Het InstantID-kader past een strategie toe die lijkt op die van de IP-Adapter-model voor beeldprompten, die een lichtgewicht adaptief module introduceert die is gekoppeld aan een decoupled cross-attention-component om beelden als invoerprompts te ondersteunen. Echter, in tegenstelling tot de grof-gealigneerde CLIP-embeddings, wijkt het InstantID-kader af door ID-embeddings te gebruiken als beeldprompts in een poging om een semantisch rijke en meer nuanceerde prompt-integratie te bereiken.
IdentityNet
Hoewel bestaande methoden in staat zijn om beeldprompts te integreren met tekstprompts, stelt het InstantID-kader dat deze methoden alleen grofkorrelige functies verhogen met een niveau van integratie dat onvoldoende is voor ID-preserving-beeldgeneratie. Bovendien kan het toevoegen van beeld- en teksttokens in cross-attention-lagen direct de controle over teksttokens verzwakken, en een poging om de sterkte van beeldtokens te verhogen kan leiden tot het verzwakken van de capaciteiten van teksttokens bij bewerkingsTaken. Om deze uitdagingen te overwinnen, kiest het InstantID-kader voor ControlNet, een alternatieve functie-embedding-methode die spatiale informatie als invoer voor de controleerbare module gebruikt, waardoor het consistent kan blijven met de UNet-instellingen in de diffusiemodellen.
Het InstantID-kader maakt twee wijzigingen in de traditionele ControlNet-architectuur: voor conditionele invoer, kiest het InstantID-kader voor 5 gezichtskenmerken in plaats van fijne OpenPose-gezichtskenmerken. Ten tweede gebruikt het InstantID-kader ID-embeddings in plaats van tekstprompts als condities voor de cross-attention-lagen in de ControlNet-architectuur.
Training en Inferentie
Tijdens de trainingsfase, optimaliseert het InstantID-kader de parameters van de IdentityNet en de Image Adapter, terwijl de parameters van het vooraf getrainde diffusiemodel worden bevroren. De gehele InstantID-pijplijn wordt getraind op beeld-tekst-paren die menselijke onderwerpen bevatten en maakt gebruik van een trainingsdoel dat vergelijkbaar is met dat van het stabiele diffusiekader met taakspecifieke beeldcondities. Het hoogtepunt van de InstantID-trainingsmethode is de scheiding tussen de beeld- en tekstcross-attention-lagen binnen de beeldprompt-adapter, een keuze die het InstantID-kader in staat stelt om de gewichten van deze beeldcondities flexibel en onafhankelijk aan te passen, waardoor een meer gerichte en gecontroleerde inferentie- en trainingsproces mogelijk wordt.
InstantID: Experimenten en Resultaten
Het InstantID-kader implementeert het Stable Diffusion en traint het op LAION-Face, een grote open-source dataset die bestaat uit meer dan 50 miljoen beeld-tekst-paren. Bovendien verzamelt het InstantID-kader meer dan 10 miljoen menselijke beelden met automatiseringen die automatisch zijn gegenereerd door het BLIP2-model om de beeldgeneratiekwaliteit verder te verbeteren. Het InstantID-kader richt zich voornamelijk op single-persoonsbeelden en maakt gebruik van een vooraf getraind gezichtsmodel om gezichts-ID-embeddings te detecteren en te extraheren uit menselijke beelden, en in plaats van training op gesneden gezichtsdatasets, traint het de oorspronkelijke menselijke beelden. Bovendien, tijdens de training, wordt het vooraf getrainde tekst-naar-beeld-model bevroren, en worden alleen de parameters van IdentityNet en Image Adapter bijgewerkt.
Beeld Alleen Generatie
Het InstantID-model gebruikt een lege prompt om de beeldgeneratieproces te leiden met behulp van slechts het referentiebeeld, en de resultaten zonder prompts worden gedemonstreerd in de volgende afbeelding.

‘Lege Prompt’-generatie, zoals gedemonstreerd in de bovenstaande afbeelding, toont de mogelijkheid van het InstantID-kader om rijke semantische gezichtskenmerken zoals identiteit, leeftijd en expressie robuust te behouden. Echter, het is de moeite waard om op te merken dat het gebruik van lege prompts mogelijk niet in staat is om resultaten te repliceren op andere semantiek zoals geslacht. Bovendien, in de bovenstaande afbeelding, gebruiken de kolommen 2 tot 4 een beeld en een prompt, en zoals te zien is, toont het gegenereerde beeld geen degradatie van tekstcontrole-capaciteiten, en zorgt het ook voor identiteitsconsistentie. Ten slotte gebruiken de kolommen 5 tot 9 een beeld, een prompt en spatiale controle, waardoor de compatibiliteit van het model met vooraf getrainde spatiale controlemodellen wordt gedemonstreerd, waardoor het InstantID-model in staat is om spatiale controles flexibel in te voeren met behulp van een vooraf getrainde ControlNet-component.

Het is ook de moeite waard om op te merken dat het aantal referentiebeelden een aanzienlijke invloed heeft op het gegenereerde beeld, zoals gedemonstreerd in de bovenstaande afbeelding. Hoewel het InstantID-kader in staat is om goede resultaten te leveren met behulp van één enkel referentiebeeld, produceren meerdere referentiebeelden een beter kwaliteitbeeld, aangezien het InstantID-kader de gemiddelde ID-embeddings als beeldprompt gebruikt. Verder, het is essentieel om het InstantID-kader te vergelijken met bestaande methoden die persoonlijke beelden genereren met behulp van één enkel referentiebeeld. De volgende figuur vergelijkt de resultaten gegenereerd door het InstantID-kader en bestaande state-of-the-art-modellen voor enkele referentiebeelden.

Zoals te zien is, is het InstantID-kader in staat om gezichtskenmerken te behouden dankzij ID-embedding die rijke semantische informatie bevat, zoals identiteit, leeftijd en geslacht. Het zou veilig zijn om te zeggen dat het InstantID-kader bestaande kaders overtreft in maatwerkbeeldgeneratie, aangezien het in staat is om menselijke identiteit te behouden terwijl het controle en stijlflexibiliteit behoudt.

Finale Gedachten
In dit artikel hebben we gesproken over InstantID, een diffusiemodel-gebaseerde oplossing voor beeldgeneratie. InstantID is een plug-and-play-module die beeldgeneratie en personalisatie op een vaardige manier afhandelt over verschillende stijlen met slechts één referentiebeeld en zorgt ook voor hoge geloofwaardigheid. Het InstantID-kader richt zich op instant identity-preserving beeldsynthese en probeert de kloof tussen efficiëntie en hoge geloofwaardigheid te overbruggen door een eenvoudige plug-and-play-module in te voeren die het kader in staat stelt om beeldpersonalisatie te behandelen met behulp van slechts één gezichtsbeeld, terwijl het hoge geloofwaardigheid behoudt.












