AI-modeller og platforme
InstantID: Zero-Shot Identity-Preserving Billedegeneration på få sekunder
AI-drevet billedegenereringsteknologi har oplevet betydelig vækst i de seneste par år, siden store tekst-til-billede-diffusionsmodeller som DALL-E, GLIDE, Stable Diffusion, Imagen og mange flere kom på scenen. Trods det faktum, at billedegenererings-AI-modeller har unik arkitektur og træningsmetoder, deler de alle en fælles fokus: tilpasset og personlig billedegenerering, der sigter mod at skabe billeder med konsistent karakter-ID, emne og stil på basis af referencebilleder. Takket være deres bemærkelsesværdige generative evner, har moderne billedegenererings-AI-rammer fundet anvendelser i områder som billedeanimation, virtuel virkelighed, E-Commerce, AI-portrætter og mange flere. Men trods deres bemærkelsesværdige generative evner, deler disse rammer alle en fælles udfordring: de fleste af dem er ikke i stand til at generere tilpassede billeder, der bevarer de detaljerede identitetsdetaljer af menneskelige objekter.
At generere tilpassede billeder, der bevarer detaljerede detaljer, er af kritisk betydning, især i menneskelige ansigtsidentitetsopgaver, der kræver en høj standard for troværdighed og detaljer, og nuancerede semantik, når de sammenlignes med generelle objektbilledegenereringsopgaver, der koncentrerer sig primært om grove teksturer og farver. Desuden har personlige billede-syntese-rammer i de seneste år, som LoRA, DreamBooth, Textual Inversion og mange flere, udviklet sig betydeligt. Men personlige billede-genererings-AI-modeller er stadig ikke perfekte til implementering i virkelige scenarier, da de har en høj lagringskrav, de kræver multiple referencebilleder, og de ofte har en længere finjusteringsproces. På den anden side, selv om eksisterende ID-indlejring-baserede metoder kun kræver en enkelt fremadrettet reference, mangler de enten kompatibilitet med offentligt tilgængelige forudtrænede modeller, eller de kræver en overmåde finjusteringsproces på tværs af mange parametre, eller de fejler i at bevare høj ansigtstrohed.
For at imødekomme disse udfordringer og yderligere forbedre billedegenereringskapaciteter, vil vi i denne artikel tale om InstantID, en diffusionsmodel-baseret løsning til billedegenerering. InstantID er en plug-and-play-modul, der håndterer billedegenerering og personliggørelse dygtigt på tværs af forskellige stilarter med kun ét referencebillede og sikrer høj troværdighed. Det primære formål med denne artikel er at give vores læsere en dybtgående forståelse af de tekniske underliggende komponenter og arkitektur af InstantID-rammen, da vi vil have en detaljeret gennemgang af modellens arkitektur, træningsproces og anvendelsesscenarier. Så lad os komme i gang.
InstantID: Zero-Shot Identity-Preserving Billedegeneration
Opkomsten af tekst-til-billede-diffusionsmodeller har bidraget betydeligt til udviklingen af billedegenereringsteknologi. Det primære formål med disse modeller er tilpasset og personlig generering, og skabelse af billeder med konsistent emne, stil og karakter-ID ved hjælp af ét eller flere referencebilleder. Evnen af disse rammer til at skabe konsistente billeder har skabt potentielle anvendelser i forskellige industrier, herunder billedeanimation, AI-portrætgenerering, E-Commerce, virtuel og forstærket virkelighed og meget mere.
Men trods deres bemærkelsesværdige evner, står disse rammer over for en fundamental udfordring: de kæmper ofte med at generere tilpassede billeder, der bevarer de detaljerede detaljer af menneskelige objekter nøjagtigt. Det er værd at bemærke, at generering af tilpassede billeder med indre detaljer er en udfordrende opgave, da menneskeligt ansigt kræver en højere grad af troværdighed og detaljer samt mere avancerede semantik, når de sammenlignes med generelle objekter eller stilarter, der koncentrerer sig primært om farver eller grove teksturer. Eksisterende tekst-til-billede-modeller afhænger af detaljerede tekstbeskrivelser, og de kæmper med at opnå stærk semantisk relevans for tilpasset billedegenerering. Desuden tilføjer nogle store forudtrænede tekst-til-billede-rammer spatial kontrol til at forbedre kontrollen, hvilket faciliterer fin-granuleret strukturel kontrol ved hjælp af elementer som kropsstillinger, dybdekort, bruger-tegnede skitser, semantisk segmenteringskort og meget mere. Men trods disse tilføjelser og forbedringer, er disse rammer kun i stand til at opnå delvis troværdighed af det genererede billede i forhold til referencebilledet.
For at overvinde disse udfordringer, fokuserer InstantID-rammen på instant identitets-bevarende billede-syntese, og forsøger at brobygge mellem effektivitet og høj troværdighed ved at introducere en simpel plug-and-play-modul, der tillader rammen at håndtere billede-personliggørelse ved hjælp af kun ét ansigtbillede, mens den bevare høj troværdighed. Desuden tilføjer InstantID-rammen en ny face-encoder, der bevare de detaljerede billedetaljer ved at tilføje svage spatial og stærke semantiske betingelser, der guider billedegenereringsprocessen ved at inkorporere tekstuelle prompts, landmark-billeder og ansigtbilleder.
Der er tre karakteristika, der adskiller InstantID-rammen fra eksisterende tekst-til-billede-genereringsrammer.
- Kompatibilitet og Pluggability: I stedet for at træne på fulde parametre af UNet-rammen, fokuserer InstantID-rammen på at træne en letvægtsadapter. Dette gør InstantID-rammen kompatibel og pluggable med eksisterende forudtrænede modeller.
- Tuning-Fri: Metoden i InstantID-rammen eliminerer behovet for finjustering, da den kun kræver en enkelt fremadrettet propagation til inferens, hvilket gør modellen højst praktisk og økonomisk til finjustering.
- Overlegen Præstation: InstantID-rammen demonstrerer høj fleksibilitet og troværdighed, da den kan levere stat-of-the-art-præstation ved hjælp af kun ét referencebillede, sammenlignelig med træningsbaserede metoder, der afhænger af multiple referencebilleder.
Samlet set kan bidragene fra InstantID-rammen kategoriseres i følgende punkter.
- InstantID-rammen er en innovativ, ID-bevarende tilpasningsmetode for forudtrænede tekst-til-billede-diffusionsmodeller med det formål at brobygge mellem effektivitet og troværdighed.
- InstantID-rammen er kompatibel og pluggable med brugerdefinerede finjusterede modeller ved hjælp af samme diffusionsmodel i sin arkitektur, hvilket tillader ID-bevarelse i forudtrænede modeller uden ekstra omkostninger.
InstantID: Metodik og Arkitektur
Som nævnt tidligere er InstantID-rammen en effektiv letvægtsadapter, der giver forudtrænede tekst-til-billede-diffusionsmodeller ID-bevarende kapaciteter uden besvær.
Når det kommer til arkitektur, er InstantID-rammen bygget oven på Stable Diffusion-modellen, der er kendt for sin evne til at udføre diffusionsprocessen med høj beregnings-effektivitet i et lav-dimensionalt latent rum i stedet for pixel-rum med en auto-encoder. For et input-billede, mapper encoderen først billedet til en latent repræsentation med downsampling-faktor og latent-dimensioner. Desuden tilføjer diffusionsprocessen en støj-reducerings-UNet-komponent til at reducere en normalt fordelt støj med støj-latent, betingelse og nuværende tidssteg. Betingelsen er en indlejring af tekstuelle prompts, der genereres ved hjælp af en forudtrænet CLIP-tekst-encoder-komponent.
Desuden anvender InstantID-rammen også en ControlNet-komponent, der kan tilføje spatial kontrol til en forudtrænet diffusionsmodel som dens betingelse, hvilket går langt ud over de traditionelle muligheder for tekstuelle prompts. ControlNet-komponenten integrerer også UNet-arkitekturen fra Stable Diffusion-rammen ved hjælp af en trænet replika af UNet-komponenten. Replikaen af UNet-komponenten har nul convolution-lag i midterste blokke og encoder-blokke. Trods deres ligheder adskiller ControlNet-komponenten sig fra Stable Diffusion-modellen; de adskiller sig i den sidste residuelle post. ControlNet-komponenten kodificerer spatial betingelsesinformation som stillinger, dybdekort, skitser og mere ved at tilføje residualerne til UNet-blokken og derefter indlejre disse residualer i den originale netværk.
InstantID-rammen henter også inspiration fra IP-Adapter eller Image Prompt Adapter, der introducerer en ny tilgang til at opnå billedeprompt-kapaciteter, der kører parallelt med tekstuelle prompts uden at kræve at ændre de originale tekst-til-billede-modeller. IP-Adapter-komponenten anvender også en unik decoupled cross-attention-strategi, der bruger ekstra cross-attention-lag til at indlejre billedfunktionerne, mens de andre parametre forbliver uændrede.
Metodik
For at give en kort oversigt, sigter InstantID-rammen mod at generere tilpassede billeder med forskellige stilarter eller stillinger ved hjælp af kun ét reference-ID-billede med høj troværdighed. Følgende figur giver en kort oversigt over InstantID-rammen.

Som det kan ses, har InstantID-rammen tre essentielle komponenter:
- En ID-indlejring-komponent, der fanger robust semantisk information om ansigtstrækkene i billedet.
- En letvægtsadapter med en decoupled cross-attention-komponent til at faciliterer brugen af et billede som et visuelt prompt.
- En IdentityNet-komponent, der kodificerer de detaljerede funktioner fra referencebilledet ved hjælp af ekstra spatial kontrol.
ID Indlejring
I modsætning til eksisterende metoder som FaceStudio, PhotoMaker, IP-Adapter og mere, der afhænger af en forudtrænet CLIP-billede-encoder til at trække ud visuelle prompts, fokuserer InstantID-rammen på forbedret troværdighed og stærkere semantiske detaljer i ID-bevarelsesopgaven. Det er værd at bemærke, at de indre begrænsninger af CLIP-komponenten ligger primært i dens træningsproces på svagt alignet data, hvilket betyder, at de indlejrede funktioner af CLIP-encoderen primært fanger bred og tvetydig semantisk information som farver, stil og komposition. Selv om disse funktioner kan fungere som generel supplement til tekst-indlejring, er de ikke egnede til præcise ID-bevarelsesopgaver, der lægger stor vægt på stærk semantik og høj troværdighed. Desuden har ny forskning i ansigt-repræsentationsmodeller, især omkring ansigts-genkendelse, demonstreret effektiviteten af ansigt-repræsentation i komplekse opgaver, herunder ansigt-rekonstruktion og -genkendelse. Bygget på dette, sigter InstantID-rammen mod at udnytte en forudtrænet ansigt-model til at detektere og trække ansigt-ID-indlejring fra referencebilledet, hvilket guider modellen til billedegenerering.
Billedeadapter
Evnen af forudtrænede tekst-til-billede-diffusionsmodeller i billedprompt-opgaver forbedrer tekstuelle prompts betydeligt, især i scenarier, der ikke kan beskrives tilstrækkeligt af tekstuelle prompts. InstantID-rammen anvender en strategi, der ligner den, der anvendes af IP-Adapter-modellen til billedprompt, der introducerer en letvægtsadapter parret med en decoupled cross-attention-komponent til at understøtte billeder som input-prompts. Men i modsætning til de groft alignerede CLIP-indlejring, afviger InstantID-rammen ved at anvende ID-indlejring som billed-prompts i et forsøg på at opnå en semantisk rig og mere nuanceret prompt-integration.
IdentityNet
Selv om eksisterende metoder kan integrere billed-prompts med tekst-prompts, argumenterer InstantID-rammen for, at disse metoder kun forbedrer grove funktioner med et niveau af integration, der er utilstrækkeligt til ID-bevarende billedegenerering. Desuden tilføjer billed- og tekst-token i cross-attention-lag direkte tenderer til at svække kontrollen af tekst-token, og et forsøg på at forbedre billed-token-styrken kan resultere i at svække evnerne af tekst-token på redigering-opgaver. For at imødekomme disse udfordringer, vælger InstantID-rammen ControlNet, en alternativ funktion-indlejring-metode, der anvender spatial information som input til kontrollerbart modul, hvilket tillader den at bevare konsistens med UNet-indstillingerne i diffusionsmodellerne.
InstantID-rammen gør to ændringer til den traditionelle ControlNet-arkitektur: for betingelses-input, vælger InstantID-rammen 5 ansigt-nyresteder i stedet for fin-granulerede OpenPose-ansigt-nyresteder. For det andet anvender InstantID-rammen ID-indlejring i stedet for tekst-prompts som betingelser for cross-attention-lag i ControlNet-arkitekturen.
Træning og Inferens
Under træningsfasen optimerer InstantID-rammen parametrene af IdentityNet og Billedeadapter, mens den fryser parametrene af den forudtrænede diffusionsmodel. Hele InstantID-pipeline-trænes på billede-tekst-par, der omfatter menneskelige subjekter, og anvender et træningsmål, der ligner det, der anvendes i Stable Diffusion-rammen med opgave-specifikke billede-betingelser. Højdepunktet af InstantID-træningsmetoden er adskillelsen mellem billed- og tekst-cross-attention-lag i billedprompt-adapteren, et valg, der tillader InstantID-rammen at justere vægtningen af disse billed-betingelser fleksibelt og uafhængigt, hvilket sikrer en mere målrettet og kontrolleret inferens- og træningsproces.
InstantID: Eksperimenter og Resultater
InstantID-rammen implementerer Stable Diffusion og træner den på LAION-Face, en stor offentlig dataset, der består af over 50 millioner billede-tekst-par. Desuden samler InstantID-rammen over 10 millioner menneskelige billeder med automatiseret generering, genereret automatisk af BLIP2-modellen, for at yderligere forbedre billedegenereringskvaliteten. InstantID-rammen fokuserer primært på enkelt-person-billeder og anvender en forudtrænet ansigt-model til at detektere og trække ansigt-ID-indlejring fra menneskelige billeder, og i stedet for at træne de beskårne ansigt-datasets, træner den de originale menneskelige billeder. Desuden fryser InstantID-rammen den forudtrænede tekst-til-billede-model under træning og opdaterer kun parametrene af IdentityNet og Billedeadapter.
Billede Kun Generation
InstantID-modellen anvender en tom prompt til at guide billedegenereringsprocessen ved hjælp af kun referencebilledet, og resultaterne uden prompts demonstreres i følgende billede.

‘Tom Prompt’-generering, som demonstreret i ovenstående billede, demonstrerer evnen af InstantID-rammen til at bevare rig semantisk ansigt-funktioner som identitet, alder og udtryk robustt. Men det er værd at bemærke, at brugen af tomme prompts måske ikke kan replikere resultaterne på andre semantik som køn nøjagtigt. Desuden i ovenstående billede, bruger kolonnerne 2 til 4 et billede og en prompt, og som det kan ses, demonstrerer det genererede billede ingen nedgang i tekstkontrol-evner og sikrer også identitets-konsistens. Endelig bruger kolonnerne 5 til 9 et billede, en prompt og spatial kontrol, hvilket demonstrerer kompatibiliteten af modellen med forudtrænede spatial kontrol-modeller, der tillader InstantID-modellen at introducere spatial kontrol fleksibelt ved hjælp af en forudtrænet ControlNet-komponent.

Det er også værd at bemærke, at antallet af referencebilleder har en betydelig indvirkning på det genererede billede, som demonstreret i ovenstående billede. Selv om InstantID-rammen kan levere gode resultater ved hjælp af ét enkelt referencebillede, producerer multiple referencebilleder et bedre kvalitetsbillede, da InstantID-rammen tager gennemsnittet af ID-indlejring som billed-prompt. Herefter er det essentiel at sammenligne InstantID-rammen med eksisterende metoder, der genererer personlige billeder ved hjælp af ét enkelt referencebillede. Følgende figur sammenligner resultaterne genereret af InstantID-rammen og eksisterende state-of-the-art-modeller til enkelt-reference-tilpasset billedegenerering.

Som det kan ses, er InstantID-rammen i stand til at bevare ansigt-karakteristika takket være ID-indlejring, der indeholder rig semantisk information, såsom identitet, alder og køn. Det ville være sikret at sige, at InstantID-rammen overgår eksisterende rammer i tilpasset billedegenerering, da den kan bevare menneskelig identitet, mens den bevare kontrol og stilistisk fleksibilitet.

Endelige Tanker
I denne artikel har vi talt om InstantID, en diffusionsmodel-baseret løsning til billedegenerering. InstantID er en plug-and-play-modul, der håndterer billedegenerering og personliggørelse dygtigt på tværs af forskellige stilarter med kun ét referencebillede og sikrer høj troværdighed. InstantID-rammen fokuserer på instant identitets-bevarende billede-syntese og forsøger at brobygge mellem effektivitet og høj troværdighed ved at introducere en simpel plug-and-play-modul, der tillader rammen at håndtere billede-personliggørelse ved hjælp af kun ét ansigtbillede, mens den bevare høj troværdighed.












