AI-modeller och plattformar

InstantID: Nollskottsidentitetsskyddande bildgenerering på några sekunder

mm
Lägg till Unite.AI bland dina föredragna källor på Google

AI-drivna bildgenereringsteknologier har sett en anmärkningsvärd tillväxt under de senaste åren, sedan stora text-till-bild-diffusionsmodeller som DALL-E, GLIDE, Stable Diffusion, Imagen och fler kom in på scenen. Trots att bildgenererings-AI-modellerna har unika arkitekturer och träningsmetoder, delar de alla en gemensam fokuspunkt: anpassad och personlig bildgenerering som syftar till att skapa bilder med konsekvent karaktär-ID, ämne och stil baserat på referensbilder. På grund av deras anmärkningsvärda generativa förmågor har moderna bildgenererings-AI-ramverk funnit tillämpningar inom områden som bildanimation, virtuell verklighet, e-handel, AI-porträtt och mer. Men trots deras anmärkningsvärda generativa förmågor delar dessa ramverk alla en gemensam utmaning, de flesta av dem kan inte generera anpassade bilder samtidigt som de bevarar de ömtåliga identitetsdetaljerna hos mänskliga föremål.

Att generera anpassade bilder samtidigt som man bevarar intrikata detaljer är av yttersta vikt, särskilt i mänskliga ansiktsidentitetstester som kräver en hög standard av trohet och detalj, och nyanserad semantik när jämfört med allmänna föremålsbildgenereringstester som koncentrerar sig främst på grova texturer och färger. Dessutom har personliga bildsyntesramverk under de senaste åren, som LoRA, DreamBooth, Textual Inversion och fler, utvecklats avsevärt. Men personliga bildgenererings-AI-modeller är fortfarande inte perfekta för distribution i verkliga scenarier, eftersom de har höga lagringskrav, de kräver flera referensbilder och de ofta har en lång finjusteringsprocess. Å andra sidan, även om befintliga ID-inbäddningsbaserade metoder endast kräver en enda framåtriktad referens, saknar de antingen kompatibilitet med offentligt tillgängliga förtränade modeller, eller de kräver en överdriven finjusteringsprocess över många parametrar, eller de misslyckas med att upprätthålla hög ansiktsfidelitet.

För att tackla dessa utmaningar och ytterligare förbättra bildgenereringsförmågorna, kommer vi i den här artikeln att prata om InstantID, en diffusionsmodellbaserad lösning för bildgenerering. InstantID är en plug-and-play-modul som hanterar bildgenerering och personanpassning skickligt över olika stilar med endast en referensbild och säkerställer också hög fidelitet. Det primära syftet med den här artikeln är att ge våra läsare en grundlig förståelse för de tekniska underbyggnaderna och komponenterna i InstantID-ramverket, eftersom vi kommer att ha en detaljerad titt på modellens arkitektur, träningsprocess och tillämpningsscenarier. Så låt oss komma igång.

InstantID: Nollskottsidentitetsskyddande bildgenerering


Uppkomsten av text-till-bild-diffusionsmodeller har bidragit avsevärt till utvecklingen av bildgenereringsteknologi. Det primära syftet med dessa modeller är anpassad och personlig generation, och skapande av bilder med konsekvent ämne, stil och karaktär-ID med hjälp av en eller flera referensbilder. Förmågan hos dessa ramverk att skapa konsekventa bilder har skapat potentialtillämpningar inom olika branscher, inklusive bildanimation, AI-porträttgenerering, e-handel, virtuell och förstärkt verklighet och mycket mer.

Men trots deras anmärkningsvärda förmågor, står dessa ramverk inför en grundläggande utmaning: de har ofta svårt att generera anpassade bilder som bevarar de intrikata detaljerna hos mänskliga föremål exakt. Det är värt att notera att generering av anpassade bilder med inbyggda detaljer är en utmanande uppgift, eftersom mänsklig ansiktsidentitet kräver en högre grad av trohet och detalj, tillsammans med mer avancerad semantik, när jämfört med allmänna föremål eller stilar som fokuserar främst på färger eller grova texturer. Befintliga text-till-bild-modeller är beroende av detaljerade textbeskrivningar och de kämpar med att uppnå stark semantisk relevans för anpassad bildgenerering. Dessutom lägger vissa stora förtränade text-till-bild-ramverk till spatiala kontrollfunktioner för att förbättra kontrollen, vilket möjliggör finare strukturförvaltning med hjälp av element som kroppsställningar, djupkartor, användarskapade skisser, semantisk segmenteringskartor och mer. Men trots dessa tillägg och förbättringar, kan dessa ramverk endast uppnå partiell fidelitet av den genererade bilden till referensbilden.

För att övervinna dessa hinder, fokuserar InstantID-ramverket på omedelbar identitetsskyddande bildsyntes och försöker att överbrygga gapet mellan effektivitet och hög fidelitet genom att införa en enkel plug-and-play-modul som tillåter ramverket att hantera bildpersonanpassning med endast en ansiktsbild samtidigt som det upprätthåller hög fidelitet. Dessutom, för att bevara ansiktsidentiteten från referensbilden, implementerar InstantID-ramverket en ny ansiktskodare som bevarar de intrikata bildinformationerna genom att lägga till svaga spatiala och starka semantiska villkor som vägleder bildgenereringsprocessen genom att inkorporera textprompts, landmärkesbilder och ansiktsbilder.

Det finns tre distinkta funktioner som skiljer InstantID-ramverket från befintliga text-till-bild-genereringsramverk.

  • Kompatibilitet och plug-and-play: Istället för att träna på fulla parametrar av UNet-ramverket, fokuserar InstantID-ramverket på att träna en lättviktig adapter. Som ett resultat är InstantID-ramverket kompatibelt och plug-and-play med befintliga förtränade modeller.
  • Finjusteringsfri: Metoden i InstantID-ramverket eliminerar behovet av finjustering, eftersom den endast kräver en enda framåtriktad spridning för inferens, vilket gör modellen högt praktisk och ekonomisk för finjustering.
  • Överlägsen prestanda: InstantID-ramverket demonstrerar hög flexibilitet och fidelitet, eftersom det kan leverera toppmodellprestanda med hjälp av endast en referensbild, jämförbart med träningsbaserade metoder som förlitar sig på flera referensbilder.

Sammanfattningsvis kan bidragen från InstantID-ramverket kategoriseras i följande punkter.

  1. InstantID-ramverket är en innovativ, ID-bevarande anpassningsmetod för förtränade text-till-bild-diffusionsmodeller med syftet att överbrygga gapet mellan effektivitet och fidelitet.
  2. InstantID-ramverket är kompatibelt och plug-and-play med anpassade finjusterade modeller som använder samma diffusionsmodell i sin arkitektur, vilket möjliggör ID-bevarande i förtränade modeller utan någon extra kostnad.

InstantID: Metodik och arkitektur

Som nämnts tidigare är InstantID-ramverket en effektiv lättviktig adapter som utrustar förtränade text-till-bild-diffusionsmodeller med ID-bevarandeegenskaper utan ansträngning.

När det gäller arkitekturen är InstantID-ramverket byggt ovanpå Stable Diffusion-modellen, som är känd för sin förmåga att utföra diffusionsprocessen med hög beräknings-effektivitet i ett lågdimensionellt latentspace istället för pixelläge med en autoencoder. För en ingångsbild, kartlägger encodern först bilden till en latent representation med ned sampel-faktor och latent-dimensioner. Dessutom, för att avlägsna en normalt fördelad brus med brusig latent, villkor och nuvarande tidssteg, antar diffusionsprocessen en avlägsnande UNet-komponent. Villkoret är en inbäddning av textprompts som genereras med hjälp av en förtränad CLIP-textencoder-komponent.

Dessutom använder InstantID-ramverket också en ControlNet-komponent som kan lägga till spatial kontroll till en förtränad diffusionsmodell som dess villkor, utökar sig långt bortom de traditionella förmågorna hos textprompts. ControlNet-komponenten integrerar också UNet-arkitekturen från Stable Diffusion-ramverket med hjälp av en tränad replik av UNet-komponenten. Repliken av UNet-komponenten har noll konvolutionslager inom mittenblocken och encodblocken. Trots deras likheter, skiljer sig ControlNet-komponenten från Stable Diffusion-modellen; de båda skiljer sig i den senare residualposten. ControlNet-komponenten kodar spatial villkorsinformation som poser, djupkartor, skisser och mer genom att lägga till residualerna till UNet-blocket, och sedan inbäddar dessa residualer i det ursprungliga nätverket.

InstantID-ramverket hämtar också inspiration från IP-Adapter eller Image Prompt Adapter som introducerar en ny metod för att uppnå bildpromptförmåga som körs parallellt med textprompts utan att behöva modifiera de ursprungliga text-till-bild-modellerna. IP-Adapter-komponenten använder också en unik avkopplad cross-attention-strategi som använder ytterligare cross-attention-lager för att inbädda bildfunktionerna medan de andra parametrarna förblir oförändrade.

Metodik

För att ge er en kort översikt, syftar InstantID-ramverket till att generera anpassade bilder med olika stilar eller poser med hjälp av endast en referens-ID-bild med hög fidelitet. Följande figur ger en kort översikt av InstantID-ramverket.

Som det kan observeras, har InstantID-ramverket tre essentiella komponenter:

  1. En ID-inbäddningskomponent som fångar robust semantisk information om ansiktsfunktionerna i bilden.
  2. En lättviktig anpassad modul med en avkopplad cross-attention-komponent för att underlätta användningen av en bild som en visuell prompt.
  3. En IdentityNet-komponent som kodar detaljerade funktioner från referensbilden med hjälp av ytterligare spatial kontroll.

ID-inbäddning

Till skillnad från befintliga metoder som FaceStudio, PhotoMaker, IP-Adapter och fler som förlitar sig på en förtränad CLIP-bildencoder för att extrahera visuella prompts, fokuserar InstantID-ramverket på förbättrad fidelitet och starkare semantiska detaljer i ID-bevarandet. Det är värt att notera att de inbyggda begränsningarna i CLIP-komponenten ligger främst i dess träningsprocess på svagt anpassade data, vilket innebär att de inbäddade funktionerna i CLIP-encodern främst fångar breda och tvetydiga semantiska information som färger, stil och komposition. Även om dessa funktioner kan fungera som allmänna tillägg till textinbäddningar, är de inte lämpliga för precisa ID-bevarandetester som lägger stor vikt vid stark semantik och hög fidelitet. Dessutom har nylig forskning inom ansiktsrepresentationsmodeller, särskilt inom ansiktsigenkänning, visat effektiviteten i ansiktsrepresentation i komplexa uppgifter, inklusive ansiktsrekonstruktion och igenkänning. Utifrån detta syftar InstantID-ramverket till att utnyttja en förtränad ansiktsmodell för att upptäcka och extrahera ID-inbäddningar från referensbilden, vilket vägleder modellen för bildgenerering.

Bildadapter

Förmågan hos förtränade text-till-bild-diffusionsmodeller i bildpromptuppgifter förbättrar textpromptarna avsevärt, särskilt i scenarier som inte kan beskrivas tillräckligt av textpromptarna. InstantID-ramverket antar en strategi som liknar den som används av IP-Adapter-modellen för bildpromptning, som introducerar en lättviktig anpassad modul parat med en avkopplad cross-attention-komponent för att stödja bilder som indata-prompts. Men till skillnad från de grovt anpassade CLIP-inbäddningarna, avviker InstantID-ramverket genom att använda ID-inbäddningar som bildpromptar i ett försök att uppnå en semantiskt rik och mer nyanserad promptintegration.

IdentityNet

Även om befintliga metoder kan integrera bildpromptar med textpromptar, hävdar InstantID-ramverket att dessa metoder endast förbättrar grova funktioner med en nivå av integration som är otillräcklig för ID-bevarande bildgenerering. Dessutom tenderar att lägga till bild- och texttoken i cross-attention-lager direkt att försvaga kontrollen av texttoken, och ett försök att förbättra bildtokenens styrka kan resultera i att försvaga texttokenens förmåga att redigera uppgifter. För att motverka dessa utmaningar, väljer InstantID-ramverket ControlNet, en alternativ funktionell inbäddningsmetod som använder spatial information som indata för den kontrollerbara modulen, vilket tillåter den att upprätthålla konsekvens med UNet-inställningarna i diffusionsmodellerna.

InstantID-ramverket gör två ändringar i den traditionella ControlNet-arkitekturen: för villkorsindata, väljer InstantID-ramverket 5 ansiktspunkter istället för fina, detaljerade OpenPose-ansiktspunkter. För det andra, använder InstantID-ramverket ID-inbäddningar istället för textpromptar som villkor för cross-attention-lagren i ControlNet-arkitekturen.

Träning och inferens

Under träningsfasen, optimerar InstantID-ramverket parametrarna för IdentityNet och Bildadaptern medan den fryser parametrarna för den förtränade diffusionsmodellen. Hela InstantID-pipelinen tränas på bild-text-par som visar mänskliga föremål och använder ett träningsmål som liknar det som används i Stable Diffusion-ramverket med uppgiftsspecifika bildvillkor. Huvuddraget i InstantID-träningsmetoden är separationen mellan bild- och text-cross-attention-lagren inom bildpromptadaptern, ett val som tillåter InstantID-ramverket att justera vikterna för dessa bildvillkor flexibelt och oberoende, vilket säkerställer en mer riktad och kontrollerad tränings- och inferensprocess.

InstantID: Experiment och resultat

InstantID-ramverket implementerar Stable Diffusion och tränar det på LAION-Face, en stor öppen källkodsdatamängd som består av över 50 miljoner bild-text-par. Dessutom samlar InstantID-ramverket in över 10 miljoner mänskliga bilder med automatiserade genereringar som genereras automatiskt av BLIP2-modellen för att ytterligare förbättra bildgenereringskvaliteten. InstantID-ramverket fokuserar främst på enpersonbilder och använder en förtränad ansiktsmodell för att upptäcka och extrahera ID-inbäddningar från mänskliga bilder, och istället för att träna på beskurna ansiktsdatamängder, tränar den ursprungliga mänskliga bilderna. Dessutom, under träningsprocessen, fryser InstantID-ramverket den förtränade text-till-bild-modellen och uppdaterar endast parametrarna för IdentityNet och Bildadapter.

Bildendast generering

InstantID-modellen använder en tom prompt för att vägleda bildgenereringsprocessen med endast referensbilden, och resultaten utan promptarna visas i följande bild.

“Tom prompt”-generering, som visas i ovanstående bild, visar InstantID-ramverkets förmåga att bevara rika semantiska ansiktsfunktioner som identitet, ålder och uttryck robust. Men det är värt att notera att användning av tomma promptar kanske inte kan replikera resultaten på andra semantik som kön exakt. Dessutom, i ovanstående bild, använder kolumnerna 2 till 4 en bild och en prompt, och som det kan ses, visar den genererade bilden ingen försämring av textkontrollförmågorna och säkerställer också identitetskonsekvens. Slutligen, kolumnerna 5 till 9 använder en bild, en prompt och spatial kontroll, vilket visar ramverkets kompatibilitet med förtränade spatiala kontrollmodeller, vilket tillåter InstantID-modellen att flexibelt introducera spatiala kontroller med hjälp av en förtränad ControlNet-komponent.

Det är också värt att notera att antalet referensbilder har en betydande inverkan på den genererade bilden, som visas i ovanstående bild. Även om InstantID-ramverket kan leverera bra resultat med endast en referensbild, producerar flera referensbilder en bättre kvalitetsbild, eftersom InstantID-ramverket tar medelvärdet av ID-inbäddningar som bildprompt. Vidare, är det viktigt att jämföra InstantID-ramverket med tidigare metoder som genererar personliga bilder med en enda referensbild. Följande figur jämför resultaten som genereras av InstantID-ramverket och befintliga toppmodeller för anpassad bildgenerering med en enda referens.

Som det kan ses, kan InstantID-ramverket bevara ansiktsfunktioner tack vare att ID-inbäddningarna innebär rik semantisk information, såsom identitet, ålder och kön. Det vore säkert att säga att InstantID-ramverket överträffar befintliga ramverk i anpassad bildgenerering, eftersom det kan bevara mänsklig identitet samtidigt som det upprätthåller kontroll och stilistisk flexibilitet.

Slutliga tankar

I den här artikeln har vi pratat om InstantID, en diffusionsmodellbaserad lösning för bildgenerering. InstantID är en plug-and-play-modul som hanterar bildgenerering och personanpassning skickligt över olika stilar med endast en referensbild och säkerställer också hög fidelitet. InstantID-ramverket fokuserar på omedelbar identitetsskyddande bildsyntes och försöker att överbrygga gapet mellan effektivitet och hög fidelitet genom att införa en enkel plug-and-play-modul som tillåter ramverket att hantera bildpersonanpassning med endast en ansiktsbild samtidigt som det upprätthåller hög fidelitet.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.