AI-modeller og platforme
InstantStyle: Stilbevarelse i Tekst til Billede Generation
I de seneste par år har justeringsbaserede diffusionsmodeller demonstreret bemærkelsesværdig fremgang på tværs af en bred vifte af billedpersonalisering og tilpasningsopgaver. Men på trods af deres potentiale, står nuværende justeringsbaserede diffusionsmodeller over for en række komplekse udfordringer i produktion og generering af stil-konsistente billeder, og der kan være tre årsager til dette. Først er begrebet stil stadig ikke defineret og bestemt, og omfatter en kombination af elementer, herunder atmosfære, struktur, design, materiale, farve og meget mere. Anden, inversion-baserede metoder er tilbøjelige til stil-degradering, hvilket resulterer i hyppig tab af fine-grænset detaljer. Endelig kræver adapter-baserede tilgange hyppig vægtjustering for hver referencebillede for at opretholde en balance mellem tekstkontrol og stilintensitet.
Desuden er det primære mål for de fleste stiloverførselsmetoder eller stilbilledegenerering at bruge referencebilledet og anvende dets specifikke stil fra en given undermængde eller referencebillede til et målbillede. Men det er den brede mængde af attributter af stil, der gør jobbet svært for forskere at samle stiliserede datasæt, repræsentere stil korrekt og evaluere overførselssuccesen. Tidligere har modeller og rammer, der beskæftiger sig med finjusteringsbaseret diffusionsproces, finjusteret datasættet af billeder, der deler en fælles stil, en proces, der både er tidskrævende og med begrænset generaliserbarhed i virkelige opgaver, da det er svært at samle en undermængde af billeder, der deler den samme eller næsten identiske stil.
I denne artikel vil vi tale om InstantStyle, en ramme, der er designet til at tackle de problemer, som nuværende justeringsbaserede diffusionsmodeller står over for i billedgenerering og tilpasning. Vi vil tale om de to nøglestrategier, der er implementeret i InstantStyle-rammen:
- En simpel, men effektiv tilgang til at afkoble stil og indhold fra referencebilleder inden for funktionrummet, forudsat, at funktioner inden for det samme funktionrum kan enten lægges til eller trækkes fra hinanden.
- At forhindre stil-lækage ved at injicere referencebilledets funktioner eksklusivt i stil-specifikke blokke og bevidst undgå behovet for at bruge besværlige vægte til finjustering, ofte karakteriseret af mere parameter-tung design.
Denne artikel har til formål at dække InstantStyle-rammen i dybden og vi udforsker mekanismen, metodologien, arkitekturen i rammen sammen med dens sammenligning med tilstands kunst rammer. Vi vil også tale om, hvordan InstantStyle-rammen demonstrerer bemærkelsesværdige visuelle stiliseringsresultater og slår en optimal balance mellem kontrollen af tekstelementer og intensiteten af stil. Så lad os komme i gang.
InstantStyle: Stilbevarelse i Tekst til Billede Generation
Diffusionsbaserede tekst til billede generative AI-rammer har opnået bemærkelsesværdig succes på tværs af en bred vifte af tilpasnings- og personaliseringopgaver, især i konsistente billedegenereringsopgaver, herunder objektilpasning, billedbevarelse og stiloverførsel. Men på trods af den seneste succes og forbedring af ydelse, forbliver stiloverførsel en udfordrende opgave for forskere på grund af den udefinerede og ubestemte natur af stil, ofte inklusive en mængde af elementer, herunder atmosfære, struktur, design, materiale, farve og meget mere. Med det sagde, er det primære mål for stiliseret billedegenerering eller stiloverførsel at anvende den specifikke stil fra et givet referencebillede eller en referenceundermængde af billeder til et målbillede. Men den brede mængde af attributter af stil gør jobbet svært for forskere at samle stiliserede datasæt, repræsentere stil korrekt og evaluere overførselssuccesen. Tidligere har modeller og rammer, der beskæftiger sig med finjusteringsbaseret diffusionsproces, finjusteret datasættet af billeder, der deler en fælles stil, en proces, der både er tidskrævende og med begrænset generaliserbarhed i virkelige opgaver, da det er svært at samle en undermængde af billeder, der deler den samme eller næsten identiske stil.
Med de udfordringer, som den nuværende tilgang står over for, har forskere taget interesse i udvikling af finjusteringsmetoder til stiloverførsel eller stiliseret billedegenerering, og disse rammer kan deles i to forskellige grupper:
- Adapter-frie Tilgange: Adapter-frie tilgange og rammer udnytter kraften af selv-opmærksomhed inden for diffusionsprocessen, og ved at implementere en fælles opmærksomhedsoperation, kan disse modeller udtrække væsentlige funktioner, herunder nøgler og værdier fra et givet referencestilbillede direkte.
- Adapter-baserede Tilgange: Adapter-baserede tilgange og rammer på den anden side inkorporerer en letvægtsmodel, der er designet til at udtrække detaljerede billedrepræsentationer fra referencestilbillederne. Rammen integrerer derefter disse repræsentationer i diffusionsprocessen med cross-opmærksomheds-mekanismer. Det primære mål for integrationsprocessen er at guide genereringsprocessen og sikre, at det resulterende billede er i overensstemmelse med de ønskede stilistiske nuancer af referencebilledet.
Men på trods af løfterne, møder justeringsfrie metoder ofte nogle udfordringer. Først kræver adapter-fri tilgangen en udveksling af nøgler og værdier inden for selv-opmærksomheds-lagene og forudser nøgle- og værdimatrixerne, der er afledt fra referencestilbillederne. Når implementeret på naturlige billeder, kræver adapter-fri tilgangen inversion af billedet tilbage til latent støj ved hjælp af teknikker som DDIM eller Denoising Diffusion Implicit Models-inversion. Men brug af DDIM eller andre inversionstilgange kan resultere i tab af fine-grænset detaljer som farve og tekstur, hvilket kan mindske stilinformationen i de genererede billeder. Desuden er den ekstra proces, der introduceres af disse tilgange, en tidskrævende proces og kan udgøre betydelige ulemper i praktiske anvendelser. På den anden side ligger den primære udfordring for adapter-baserede metoder i at finde den rette balance mellem kontekst-lækage og stilintensitet. Indholdslækage opstår, når en øgning af stilintensiteten resulterer i fremkomsten af ikke-stil-elementer fra referencebilledet i det genererede output, med det primære punkt for sværheden ved at adskille stiler fra indhold inden for referencebilledet effektivt. For at adressere dette problem konstruerer nogle rammer parrede datasæt, der repræsenterer det samme objekt i forskellige stiler, hvilket faciliterer udtrækningen af indholdsrepræsentation og adskilte stiler. Men takket være den intrinsic ubestemte repræsentation af stil er opgaven med at oprette store parrede datasæt begrænset i forhold til diversiteten af stiler, den kan fange, og det er en ressourcekrævende proces.

For at tackle disse begrænsninger introduceres InstantStyle-rammen, der er en ny justeringsfri mekanisme baseret på eksisterende adapter-baserede metoder med evnen til at integrere sammen med andre opmærksomheds-baserede injektionsmetoder og opnå afkobling af indhold og stil effektivt. Desuden introducerer InstantStyle-rammen ikke blot én, men to effektive måder at fuldføre afkoblingen af stil og indhold, hvilket opnår bedre stil-migration uden at introducere ekstra metoder til afkobling eller opbygning af parrede datasæt.
Desuden har tidligere adapter-baserede rammer været anvendt bredt i CLIP-baserede metoder som billedfunktion-ekstraktor, og nogle rammer har udforsket muligheden for at implementere funktionafkobling inden for funktionrummet, og når sammenlignet med ubestemt stil-attribut, er det lettere at beskrive indholdet med tekst. Da billeder og tekst deler et funktionrum i CLIP-baserede metoder, kan en simpel subtraktionsoperation af kontekst-tekst-funktioner og billedfunktioner reducere indholdslækage betydeligt. Desuden findes der i de fleste diffusion-modeller en bestemt lag, der injicerer stilinformationen og opnår afkobling af indhold og stil ved at injicere billedfunktioner kun i bestemte stil-blokke. Ved at implementere disse to simple strategier kan InstantStyle-rammen løse indholdslækage-problemer, der mødes af de fleste eksisterende rammer, mens den opretholder styrken af stil.
For at samme op, anvender InstantStyle-rammen to simple, direkte, men effektive mekanismer til at opnå en effektiv adskillelse af indhold og stil fra referencebilleder. InstantStyle-rammen er en model-uafhængig og justeringsfri tilgang, der demonstrerer bemærkelsesværdig præstation i stiloverførselsopgaver med en enorm potentiale for nedstrøms-opgaver.
Instant-Style: Metodologi og Arkitektur
Som demonstreret af tidligere tilgange, findes der en balance i injiceringen af stil-betingelser i justeringsfrie diffusionsmodeller. Hvis intensiteten af billedbetingelsen er for høj, kan det resultere i indholdslækage, mens hvis intensiteten af billedbetingelsen falder for lavt, kan stilen ikke være tilstrækkelig tydelig. En væsentlig årsag til denne observation er, at i et billede, er stil og indhold sammenkoblet, og på grund af den intrinsic ubestemte stil-attribut, er det svært at adskille stil og hensigt. Som resultat heraf justeres omhyggelige vægte ofte for hvert referencebillede i et forsøg på at balancere tekstkontrol og stil-styrke. Desuden, for et givet input-referencebillede og dets tilsvarende tekstbeskrivelse i inversion-baserede metoder, anvendes inversionstilgange som DDIM over billedet for at få den inverse diffusions-traektorie, en proces, der approksimerer inversion-ligningen til at transformere et billede til en latent støj-repræsentation. Bygning på dette, og startende fra den inverse diffusions-traektorie sammen med en ny sæt af prompts, genererer disse metoder nye indhold med stil, der er i overensstemmelse med input.

Komment til metodologien, i stedet for at anvende komplekse strategier til at adskille indhold og stil fra billeder, tager Instant-Style-rammen den simpleste tilgang til at opnå lignende præstation. Når sammenlignet med ubestemt stil-attribut, kan indhold repræsenteres med naturlig tekst, hvilket giver Instant-Style-rammen mulighed for at anvende tekst-encoderen fra CLIP til at udtrække karakteristikkerne af indhold-teksten som kontekst-repræsentationer. Samtidig implementerer Instant-Style-rammen CLIP-billed-encoder til at udtrække funktionerne af referencebilledet. Ved at udnytte karakteriseringen af CLIP-global-funktioner og efterfølgende subtrahere indhold-tekst-funktionerne fra billedfunktionerne, kan Instant-Style-rammen adskille stil og indhold eksplitt.

Desuden er hvert lag inden for en dyb netværk ansvarlig for at fange forskellige semantiske informationer, og den væsentlige observation fra tidligere modeller er, at der findes to opmærksomheds-lag, der er ansvarlige for at håndtere stil. Specifikt er det blokke.0.attentions.1 og down.blokke.2.attentions.1 lagene, der er ansvarlige for at fange stil som farve, materiale, atmosfære og den rumlige layout-lag, der fanger struktur og komposition. Instant-Style-rammen anvender disse lag implicit til at udtrække stilinformation og forhindre indholdslækage uden at tabe stil-styrken. Strategien er simpel, men effektiv, da modellen har lokaliseret stil-blokke, der kan injicere billedfunktioner i disse blokke for at opnå ubesværet stil-overførsel. Desuden, da modellen reducerer antallet af parametre i adapteren, forbedres tekstkontrol-evnen i rammen, og mekanismen er også anvendelig på andre opmærksomheds-baserede funktion-injektionsmodeller til redigering og andre opgaver.

Instant-Style: Eksperimenter og Resultater
Instant-Style-rammen er implementeret på Stable Diffusion XL-rammen og anvender den almindelig anvendte forudtrænede IR-adapter som sin eksemplar til at validere sin metodologi og muter alle blokke undtagen stil-blokke for billedfunktioner. Instant-Style-modellen træner også IR-adapteren på 4 millioner store datasæt af tekst-billede-par fra scratch og opdaterer kun stil-blokke.
For at udføre dens generaliserings-evner og robusthed, udfører Instant-Style-rammen talrige stil-overførsels-eksperimenter med forskellige stiler på tværs af forskelligt indhold, og resultaterne kan observeres i følgende billeder. Givet et enkelt stil-referencebillede sammen med varierende prompts, leverer Instant-Style-rammen høj-kvalitets, konsistente stil-billede-generering.

Desuden, da modellen injicerer billedinformation kun i stil-blokke, kan den mindske indholdslækage-problemet betydeligt og derfor ikke udføre vægtjustering.

Herefter anvender Instant-Style-rammen også ControlNet-arkitekturen til at opnå billed-baseret stilisering med rumlig kontrol, og resultaterne demonstreres i følgende billede.

Når sammenlignet med tidligere tilstands kunst metoder, herunder StyleAlign, B-LoRA, Swapping Self Attention og IP-Adapter, demonstrerer Instant-Style-rammen de bedste visuelle effekter.

Endelige Tanker
I denne artikel har vi talt om Instant-Style, en generel ramme, der anvender to simple, men effektive strategier til at opnå en effektiv adskillelse af indhold og stil fra referencebilleder. InstantStyle-rammen er designet til at tackle de problemer, som nuværende justeringsbaserede diffusionsmodeller står over for i billedgenerering og tilpasning. Instant-Style-rammen implementerer to væsentlige strategier: En simpel, men effektiv tilgang til at afkoble stil og indhold fra referencebilleder inden for funktionrummet, forudsat, at funktioner inden for det samme funktionrum kan enten lægges til eller trækkes fra hinanden. For det andet, at forhindre stil-lækage ved at injicere referencebilledets funktioner eksklusivt i stil-specifikke blokke og bevidst undgå behovet for at bruge besværlige vægte til finjustering, ofte karakteriseret af mere parameter-tung design.












