AI-modeller og plattformer
InstantID: Nullskudds identitet-bevarende bildegenerering
AI-drevet bildegenereringsteknologi har vært gjennom en betydelig vekst de siste årene, siden store tekst-til-bilde-diffusjonsmodeller som DALL-E, GLIDE, Stable Diffusion, Imagen og flere andre dukket opp på scenen. Selv om bildegenererings-AI-modellene har unik arkitektur og treningsmetoder, deler de alle et felles fokus: tilpasset og personlig bildegenerering som har som mål å lage bilder med konsistent karakter-ID, emne og stil basert på referansebilder. Takket være deres bemerkelsesverdige generative evner, har moderne bildegenererings-AI-rammeverk funnet anvendelser i felt som bildeanimasjon, virtuell virkelighet, e-handel, AI-portretter og mer. Men selv om de har bemerkelsverdige generative evner, deler disse rammeverkene alle en felles utfordring: de fleste av dem er ikke i stand til å generere tilpassede bilder samtidig som de bevareer de ømfintlige detaljene i menneskelige objekter.
Å generere tilpassede bilder samtidig som man bevareer intrikate detaljer, er av kritisk betydning, spesielt i menneskelige ansiktsidentitetsoppgaver som krever høy trofasthet og detalj, og nyanserte semantikk når sammenlignet med generelle objektbildegenereringsoppgaver som fokuserer primært på grove teksturer og farger. Videre har personlige bilde syntese-rammeverk i de siste årene, som LoRA, DreamBooth, Textual Inversion og mer, fremmet betydelig. Men personlige bildegenererings-AI-modeller er fortsatt ikke perfekte for utbredelse i virkelige scenarier, siden de har høye lagringskrav, de krever flere referansebilder, og de ofte har en langvarig finjusteringprosess. På den andre siden, selv om eksisterende ID-embedding-baserte metoder bare krever én enkelt fremover-referanse, mangler de enten kompatibilitet med offentlig tilgjengelige forhånds-trente modeller, eller de krever en overflodig finjusteringprosess over mange parametre, eller de mislykkes i å opprettholde høy ansikts-trofasthet.
For å møte disse utfordringene og ytterligere forbedre bildegenererings-evnene, vil vi i denne artikkelen snakke om InstantID, en diffusjonsmodell-basert løsning for bildegenerering. InstantID er en plug-and-play-modul som håndterer bildegenerering og personliggjøring dyktig over ulike stiler med bare ett enkelt referansebilde og sikrer høy trofasthet. Hovedmålet med denne artikkelen er å gi våre lesere en grundig forståelse av de tekniske underliggende komponentene og arkitekturen til InstantID-rammeverket, da vi vil se nærmere på modellens arkitektur, treningsprosess og anvendelsesscenarier. Så la oss komme i gang.
InstantID: Nullskudds identitet-bevarende bildegenerering
Oppkomsten av tekst-til-bilde-diffusjonsmodeller har bidratt betydelig til fremgangen i bildegenereringsteknologien. Hovedmålet med disse modellene er tilpasset og personlig generering, og å lage bilder med konsistent emne, stil og karakter-ID ved hjelp av ett eller flere referansebilder. Evnen til å lage konsistente bilder har skapt potensielle anvendelser i ulike industrier, inkludert bildeanimasjon, AI-portrettgenerering, e-handel, virtuell og forbedret virkelighet og mye mer.
Men selv om de har bemerkelsverdige evner, møter disse rammeverkene en grunnleggende utfordring: de sliter ofte med å generere tilpassede bilder som bevareer de ømfintlige detaljene i menneskelige objekter nøyaktig. Det er verdt å merke seg at å generere tilpassede bilder med intrikate detaljer er en vanskelig oppgave, siden menneskelige ansiktsidentitetsoppgaver krever en høyere grad av trofasthet og detalj sammenlignet med generelle objekter eller stiler som fokuserer primært på farger eller grove teksturer. Eksisterende tekst-til-bilde-modeller avhenger av detaljerte tekstbeskrivelser, og de sliter med å oppnå sterk semantisk relevans for tilpasset bildegenerering. Videre legger noen store forhånds-trente tekst-til-bilde-rammeverk til romlige kontrollmuligheter for å forbedre kontrollen, og muliggjør finmasket strukturell kontroll ved hjelp av elementer som kroppspose, dybdekart, bruker-tegnede skisser, semantisk segmenteringskart og mer. Men selv om disse tilleggene og forbedringene, er disse rammeverkene bare i stand til å oppnå delvis trofasthet av den genererte bildet i forhold til referansebildet.
For å overvinne disse hindrene, fokuserer InstantID-rammeverket på nullskudds identitet-bevarende bilde syntese, og forsøker å lukke gapet mellom effisiens og høy trofasthet ved å introdusere en enkel plug-and-play-modul som tillater rammeverket å håndtere bilde-personliggjøring ved hjelp av bare ett enkelt ansiktsbilde samtidig som det opprettholder høy trofasthet. Videre, for å bevare ansiktsidentiteten fra referansebildet, implementerer InstantID-rammeverket en ny ansikts-encoder som beholder de intrikate bilde-detaljene ved å legge til svake romlige og sterke semantiske betingelser som guider bildegenereringsprosessen ved å inkorporere tekstprompt, landemerkebilde og ansiktsbilde.
Det er tre distinkte egenskaper som skiller InstantID-rammeverket fra eksisterende tekst-til-bilde-genereringsrammeverk.
- Kompatibilitet og Plug-and-Play: I stedet for å trene på fullstendige parametre i UNet-rammeverket, fokuserer InstantID-rammeverket på å trene en lettvekt-adapter. Som et resultat er InstantID-rammeverket kompatibelt og plug-and-play med eksisterende forhånds-trente modeller.
- Finjustering-Fri: Metodologien til InstantID-rammeverket eliminerer behovet for finjustering, siden det bare krever én enkelt fremover-propagering for inferens, og gjør modellen høyt praktisk og økonomisk for finjustering.
- Overlegen Ytelse: InstantID-rammeverket demonstrerer høy fleksibilitet og trofasthet, siden det er i stand til å levere stat-of-the-art-ytelse ved hjelp av bare ett enkelt referansebilde, sammenlignet med treningsbaserte metoder som avhenger av flere referansebilder.
Samlet sett kan bidragene til InstantID-rammeverket kategoriseres i følgende punkter.
- InstantID-rammeverket er en innovativ, ID-bevarende tilpasningsmetode for forhånds-trente tekst-til-bilde-diffusjonsmodeller med målet å lukke gapet mellom effisiens og trofasthet.
- InstantID-rammeverket er kompatibelt og plug-and-play med tilpassede, forhånds-trente modeller som bruker samme diffusjonsmodell i sin arkitektur, og tillater ID-bevarende i forhånds-trente modeller uten ekstra kostnad.
InstantID: Metodologi og Arkitektur
Som nevnt tidligere er InstantID-rammeverket en effektiv, lettvekt-adapter som gir forhånds-trente tekst-til-bilde-diffusjonsmodeller med ID-bevarende evner uten problemer.
Når det gjelder arkitekturen, er InstantID-rammeverket bygget på toppen av Stable Diffusion-modellen, som er kjent for sin evne til å utføre diffusjonsprosessen med høy beregnings-effisiens i et lavt-dimensjonalt latent-rom i stedet for piksel-rom med en auto-encoder. For et inngangs-bilde, kartlegger encoderen først bildet til en latent-representasjon med ned-sampling-faktor og latent-dimensjoner. Videre, for å fjern-støy en normalt-distribuert støy med støy-forurensning latent, betingelse og nåværende tidssteg, bruker diffusjonsprosessen en fjern-støy-UNet-komponent. Betingelsen er en innkapsling av tekstprompt som er generert ved hjelp av en forhånds-trent CLIP-tekst-encoder-komponent.
Videre bruker InstantID-rammeverket også en ControlNet-komponent som er i stand til å legge til romlig kontroll til en forhånds-trent diffusjonsmodell som sin betingelse, og utvider langt utenfor de tradisjonelle evnene til tekstprompt. ControlNet-komponenten integrerer også UNet-arkitekturen fra Stable Diffusion-rammeverket ved hjelp av en trent replikasjon av UNet-komponenten. Replikasjonen av UNet-komponenten har null konvolusjonslag i midten og encoder-blokkene. Selv om de ligner hverandre, skiller ControlNet-komponenten seg fra Stable Diffusion-modellen; de begge forskjeller i den senere residuelle posten. ControlNet-komponenten koder romlig betingelsesinformasjon som poser, dybde-kart, skisser og mer ved å legge til residuen til UNet-blokken, og deretter innkapsler disse residuen i det opprinnelige nettverket.
InstantID-rammeverket trekker også inspirasjon fra IP-Adapter eller Image Prompt Adapter, som introduserer en ny tilnærming for å oppnå bilde-prompt-evner som kjører parallelt med tekstprompt uten å måtte modifisere de opprinnelige tekst-til-bilde-modellene. IP-Adapter-komponenten bruker også en unik dekoppelt kryss-oppmerksomhets-strategi som bruker ekstra kryss-oppmerksomhetslag for å innkapsle bilde-egenskapene samtidig som de andre parameterne forblir uendret.
Metodologi
For å gi deg en kort oversikt, har InstantID-rammeverket som mål å generere tilpassede bilder med ulike stiler eller poser ved hjelp av bare ett enkelt referanse-ID-bilde med høy trofasthet. Følgende figur gir en kort oversikt over InstantID-rammeverket.

Som det kan observeres, har InstantID-rammeverket tre essensielle komponenter:
- En ID-innkapslings-komponent som fanger robust semantisk informasjon om ansikts-egenskapene i bildet.
- En lettvekt-tilpasset modul med en dekoppelt kryss-oppmerksomhets-komponent for å muliggjøre bruk av et bilde som en visuell prompt.
- En IdentityNet-komponent som koder detaljerte egenskaper fra referanse-bildet ved hjelp av ekstra romlig kontroll.
ID-innkapsling
I motsetning til eksisterende metoder som FaceStudio, PhotoMaker, IP-Adapter og mer, som avhenger av en forhånds-trent CLIP-bilde-encoder for å trekke ut visuelle prompt, fokuserer InstantID-rammeverket på forbedret trofasthet og sterkere semantiske detaljer i ID-bevarende oppgaver. Det er verdt å merke seg at de innebygde begrensningene i CLIP-komponenten ligger primært i dens treningsprosess på svakt-justerte data, og at de innkapslede egenskapene til CLIP-encoderen primært fanger bred og tvetydig semantisk informasjon som farger, stil og komposisjon. Selv om disse egenskapene kan fungere som en generell supplement til tekst-innkapslinger, er de ikke egnet for presise ID-bevarende oppgaver som legger stor vekt på sterke semantikk og høy trofasthet. Videre har nyere forskning i ansikts-representasjonsmodeller, spesielt i ansikts-gjenkjennelse, demonstrert effektiviteten av ansikts-representasjon i komplekse oppgaver som ansikts-rekonstruksjon og -gjenkjennelse. Bygget på dette, forsøker InstantID-rammeverket å utnytte en forhånds-trent ansiktsmodell for å detektere og trekke ut ID-innkapslinger fra referanse-bildet, og guider bildegenereringsprosessen.
Bilde-adapter
Evnen til forhånds-trente tekst-til-bilde-diffusjonsmodeller i bilde-prompt-oppgaver forbedrer tekstpromptene betydelig, spesielt for scenarier som ikke kan beskrives tilstrekkelig av tekstpromptene. InstantID-rammeverket adopterer en strategi som ligner den som brukes av IP-Adapter-modellen for bilde-prompt, som introduserer en lettvekt-tilpasset modul parret med en dekoppelt kryss-oppmerksomhets-komponent for å støtte bilder som inndata-prompt. Men i motsetning til de grove-justerte CLIP-innkapslingene, avviker InstantID-rammeverket ved å bruke ID-innkapslinger som bilde-prompt i et forsøk på å oppnå en semantisk rik og mer nyansert prompt-integrasjon.
IdentityNet
Selv om eksisterende metoder er i stand til å integrere bilde-prompt med tekstprompt, argumenterer InstantID-rammeverket for at disse metodene bare forbedrer grove-graderte egenskaper med en integreringsnivå som er utilstrekkelig for ID-bevarende bildegenerering. Videre legger tillegg av bilde- og tekst-token i kryss-oppmerksomhetslag direkte til å svekke kontrollen av tekst-token, og et forsøk på å forbedre bilde-token-styrken kan resultere i å svekke evnene til tekst-token på redigeringsoppgaver. For å møte disse utfordringene, velger InstantID-rammeverket ControlNet, en alternativ egenskaps-innkapslingsmetode som bruker romlig informasjon som inndata for kontroll-modulen, og tillater det å opprettholde konsistens med UNet-innstillingene i diffusjonsmodellene.
InstantID-rammeverket gjør to endringer i den tradisjonelle ControlNet-arkitekturen: for betingelses-inndata, velger InstantID-rammeverket 5 ansikts-nøkkel-punkter i stedet for fine-grenede OpenPose-ansikts-nøkkel-punkter. For det andre, bruker InstantID-rammeverket ID-innkapslinger i stedet for tekstprompt som betingelser for kryss-oppmerksomhetslagene i ControlNet-arkitekturen.
Trenings- og Inferens
Under treningsfasen, optimaliserer InstantID-rammeverket parameterne til IdentityNet og Bilde-adapter, samtidig som det fryser parameterne til den forhånds-trente diffusjonsmodellen. Hele InstantID-pipeline er trent på bilde-tekst-par som viser menneskelige subjekter, og bruker et trenings-mål som ligner det som brukes i Stable Diffusion-rammeverket med oppgave-spesifikke bilde-betingelser. Høydepunktet i InstantID-treningsmetoden er separasjonen mellom bilde- og tekst-kryss-oppmerksomhetslagene i bilde-prompt-adapteren, et valg som tillater InstantID-rammeverket å justere vektene til disse bilde-betingelsene fleksibelt og uavhengig, og dermed sikrer en mer målrettet og kontrollert trenings- og inferens-prosess.
InstantID: Eksperimenter og Resultater
InstantID-rammeverket implementerer Stable Diffusion og trener det på LAION-Face, en stor åpen kilde-datasett som består av over 50 millioner bilde-tekst-par. Videre samler InstantID-rammeverket over 10 millioner menneske-bilder med automatiseringer som er generert automatisk av BLIP2-modellen for å ytterligere forbedre bildegenererings-kvaliteten. InstantID-rammeverket fokuserer primært på enkelt-person-bilder, og bruker en forhånds-trent ansiktsmodell for å detektere og trekke ut ansikts-ID-innkapslinger fra menneske-bilder, og i stedet for å trene på avkortede ansikts-datasett, trener det på de opprinnelige menneske-bildene. Videre, under treningsfasen, fryser InstantID-rammeverket den forhånds-trente tekst-til-bilde-modellen, og oppdaterer bare parameterne til IdentityNet og Bilde-adapter.
Bilde-kun Generering
InstantID-modellen bruker en tom prompt for å guide bildegenereringsprosessen ved hjelp av bare referanse-bildet, og resultater uten promptene vises i følgende bilde.

‘Tom Prompt’-generering, som vist i bildet over, demonstrerer evnen til InstantID-rammeverket til å opprettholde rike semantiske ansikts-egenskaper som identitet, alder og uttrykk robust. Men det er verdt å merke seg at å bruke tomme prompt kan ikke være i stand til å replikere resultater på andre semantikk som kjønn nøyaktig. Videre, i bildet over, bruker kolonnene 2 til 4 et bilde og en prompt, og som det kan sees, demonstrerer den genererte bildet ikke noen forringelse i tekst-kontroll-evner, og sikrer også identitets-konsistens. Til slutt, kolonnene 5 til 9 bruker et bilde, en prompt og romlig kontroll, og demonstrerer kompatibiliteten til modellen med forhånds-trente romlige kontroll-modeller, og tillater InstantID-modellen å introdusere romlige kontroller fleksibelt ved hjelp av en forhånds-trent ControlNet-komponent.

Det er også verdt å merke seg at antallet referanse-bilder har en betydelig innvirkning på den genererte bildet, som vist i bildet over. Selv om InstantID-rammeverket er i stand til å levere gode resultater ved hjelp av ett enkelt referanse-bilde, produserer flere referanse-bilder en bedre kvalitets-bilde, siden InstantID-rammeverket tar gjennomsnittet av ID-innkapslinger som bilde-prompt. Videre, det er essensielt å sammenligne InstantID-rammeverket med eksisterende metoder som genererer tilpassede bilder ved hjelp av ett enkelt referanse-bilde. Følgende figur sammenligner resultater generert av InstantID-rammeverket og eksisterende stat-of-the-art-modeller for enkelt-referanse-tilpasset bildegenerering.

Som det kan sees, er InstantID-rammeverket i stand til å bevare ansikts-egenskaper takket være ID-innkapslinger som inneholder rike semantiske informasjon, som identitet, alder og kjønn. Det vil være trygt å si at InstantID-rammeverket overgår eksisterende rammeverk i tilpasset bildegenerering, siden det er i stand til å bevare menneskelig identitet samtidig som det opprettholder kontroll og stilistisk fleksibilitet.

Slutt-tanker
I denne artikkelen har vi snakket om InstantID, en diffusjonsmodell-basert løsning for bildegenerering. InstantID er en plug-and-play-modul som håndterer bildegenerering og personliggjøring dyktig over ulike stiler med bare ett enkelt referanse-bilde og sikrer høy trofasthet. InstantID-rammeverket fokuserer på nullskudds identitet-bevarende bilde syntese, og forsøker å lukke gapet mellom effisiens og høy trofasthet ved å introdusere en enkel plug-and-play-modul som tillater rammeverket å håndtere bilde-personliggjøring ved hjelp av bare ett enkelt ansiktsbilde samtidig som det opprettholder høy trofasthet.












