AI-modeller og platforme
Konceptslidere: PrÃĶcis kontrol i diffusionmodeller med LoRA-tilpasninger
Takket vÃĶre deres evner er tekst-til-billede-diffusionsmodeller blevet utroligt populÃĶre i den kunstneriske fÃĶllesskab. Men nuvÃĶrende modeller, herunder state-of-the-art-rammer, kÃĶmper ofte med at fastholde kontrollen over visuelle koncepter og attributter i de genererede billeder, hvilket fÃļrer til utilfredsstillende outputs. De fleste modeller afhÃĶnger udelukkende af tekstprompt, hvilket stiller udfordringer i form af modulation af kontinuerte attributter som intensiteten af vejr, skarpheden af skygger, ansigtsudtryk eller alderen pÃĨ en person prÃĶcist. Dette gÃļr det svÃĶrt for slutbrugere at tilpasse billeder til at opfylde deres specifikke behov. Desuden, selvom disse generative rammer producerer hÃļjkvalitets- og realistiske billeder, er de udsat for forvrÃĶngninger som forvrÃĶngede ansigter eller manglende fingre.
For at overvinde disse begrÃĶnsninger har udviklere foreslÃĨet brugen af fortolkelige Konceptslidere. Disse slidere lover en stÃļrre kontrol for slutbrugere over visuelle attributter, hvilket forbedrer billedgenerering og redigering inden for diffusionsmodeller. Konceptslidere i diffusionsmodeller fungerer ved at identificere en parameterretning, der svarer til et enkelt koncept, mens de minimiserer indgreb i andre attributter. Rammen opretter disse slidere ved hjÃĶlp af eksempelbilleder eller en samling prompts, hvilket etablerer retninger for bÃĨde tekstuelle og visuelle koncepter.

Til sidst kan brugen af Konceptslidere i tekst-til-billede-diffusionsmodeller resultere i billedgenerering med minimal grad af indgreb og forbedret kontrol over det endelige output, samt Ãļget opfattet realisme uden at ÃĶndre indholdet af billederne, og dermed generere realistiske billeder. I denne artikel vil vi diskutere konceptet om at bruge Konceptslidere i tekst-til-billede-rammer i stÃļrre dybde og analysere, hvordan deres brug kan resultere i overlegen kvalitet af AI-genererede billeder.
En introduktion til Konceptslidere
Som tidligere nÃĶvnt kÃĶmper nuvÃĶrende tekst-til-billede-diffusionsrammer ofte med at fastholde kontrollen over visuelle koncepter og attributter i de genererede billeder, hvilket fÃļrer til utilfredsstillende resultater. Desuden finder mange af disse modeller det svÃĶrt at modulere kontinuerte attributter, hvilket yderligere bidrager til utilfredsstillende outputs. Konceptslidere kan hjÃĶlpe med at afhjÃĶlpe disse problemer, hvilket giver indholdsskabere og slutbrugere en forbedret kontrol over billedgenereringsprocessen og lÃļser udfordringerne, som nuvÃĶrende rammer stÃĨr over for.
De fleste nuvÃĶrende tekst-til-billede-diffusionsmodeller afhÃĶnger af direkte tekstprompt-modifikation til at kontrollere billedattributter. Selvom denne tilgang tillader billedgenerering, er den ikke optimal, da ÃĶndring af prompten kan dramatisk ÃĶndre billedets struktur. En anden tilgang, som disse rammer bruger, indebÃĶrer post-hoc-teknikker, som inverterer diffusionsprocessen og modificerer cross-attentions til at redigere visuelle koncepter. Men post-hoc-teknikker har begrÃĶnsninger, da de kun understÃļtter en begrÃĶnset mÃĶngde samtidige redigeringer og krÃĶver individuelle indgrebspassager for hvert nyt koncept. Desuden kan de introducere konceptuel indvikling, hvis de ikke er konstrueret omhyggeligt.
Til gengÃĶld tilbyder Konceptslidere en mere effektiv lÃļsning til billedgenerering. Disse letvÃĶgede, brugervenlige tilpasninger kan anvendes pÃĨ forudtrÃĶnede modeller, hvilket forbedrer kontrollen og prÃĶcisionen over Ãļnskede koncepter i en enkelt indgrebspassage med minimal indvikling. Konceptslidere giver ogsÃĨ mulighed for at redigere visuelle koncepter, som ikke er dÃĶkket af tekstbeskrivelser, en funktion, der adskiller dem fra tekstprompt-baserede redigeringsmetoder. Selvom billedbaserede tilpasningsmetoder kan effektivt tilfÃļje tokens for billedbaserede koncepter, er de svÃĶre at implementere til billedredigering. Konceptslidere giver slutbrugere mulighed for at give en lille mÃĶngde parrede billeder, der definerer et Ãļnsket koncept. Sliderne generaliserer herefter dette koncept og anvender det automatisk pÃĨ andre billeder, med det formÃĨl at forbedre realisme og fikse forvrÃĶngninger som i hÃĶnder.
Konceptslidere strÃĶber efter at lÃĶre fra og lÃļse problemer, der er fÃĶlles for fire generative AI- og diffusionsramme-koncepter: Billedredigering, vejledningsbaserede metoder, modelredigering og semantiske retninger.
Billedredigering
NuvÃĶrende AI-rammer fokuserer enten pÃĨ at bruge en betinget input til at guide billedets struktur eller manipulere cross-attentions af kildebilledet med dets mÃĨl-prompt til at aktivere enkelt billedredigering i tekst-til-billede-diffusionsrammer. Disse tilgange kan kun implementeres pÃĨ enkeltbilleder og krÃĶver latent basisoptimering for hvert billede som fÃļlge af den udviklende geometriske struktur over tidsintervallet pÃĨ tvÃĶrs af prompts.
Vejledningsbaserede metoder
Brugen af klassificator-frie vejledningsbaserede metoder har vist deres evne til at forbedre kvaliteten af de genererede billeder og Ãļge tekst-billede-alignment. Ved at inkorporere vejledningstermer under indgreb forbedrer metoden den begrÃĶnsede kompositionel arv, der er arvet fra diffusionsrammerne, og de kan bruges til at vejlede gennem usikre koncepter i diffusionsrammer.
Modelredigering
Brugen af Konceptslidere kan ogsÃĨ ses som en modelredigeringsmetode, der anvender en lav-rang-tilpasning til at udgive en enkelt semantisk attribut, der giver plads til kontinuerlig kontrol, der er i overensstemmelse med attributten. Fine-tuning-baserede tilpasningsmetoder bruges herefter til at tilpasse rammen til at tilfÃļje nye koncepter. Desuden foreslÃĨr Custom Diffusion-teknikken en mÃĨde at finjustere cross-attentions-lag til at inkorporere nye visuelle koncepter i forudtrÃĶnede diffusionsmodeller pÃĨ en modsat mÃĨde. Textual Diffusion-teknikken foreslÃĨr at optimere en indlejringsvÃĶrdi til at aktivere modelkapaciteter og introducere tekstuelle koncepter i rammen.
Semantisk retning i GANâer
Manipulation af semantiske attributter er en af de vigtigste egenskaber ved Generative Adversarial Networks, hvor latent rum-traektorier er fundet til at vÃĶre aligneret pÃĨ en selv-overvÃĨget mÃĨde. I diffusionsrammer findes disse latent rum-traektorier i midterlagene af U-Net-arkitekturen, og den primÃĶre retning af latent rum i diffusionsrammer fanger globale semantik. Konceptslidere trÃĶner lav-rang-under rum, der svarer til specifikke attributter direkte, og opnÃĨr prÃĶcise og lokaliserede redigeringsretninger ved at bruge tekst- eller billedpar til at optimere globale retninger.
Konceptslidere: Arkitektur og funktionsmÃĨde
Diffusionsmodeller og LoRA eller Lav-rang-tilpasninger
Diffusionsmodeller er essentielt en underklasse af generative AI-rammer, der opererer pÃĨ principperne om at syntetisere data ved at omvende en diffusionsproces. Den fremadgÃĨende diffusionsproces tilfÃļjer fÃļrst stÃļj til data, sÃĨ overgangen fra en organiseret tilstand til en komplet Gaussisk stÃļjtilstand. Det primÃĶre formÃĨl med diffusionsmodeller er at omvende diffusionsprocessen ved at gradvist rense billedet og prÃļve en tilfÃĶldig Gaussisk stÃļj til at generere et billede. I virkelige anvendelser er det primÃĶre formÃĨl med diffusionsrammer at forudsige den sande stÃļj, nÃĨr den komplette Gaussiske stÃļj indfÃļres som input med ekstra input som betingelser og tidsinterval.
LoRA eller Lav-rang-tilpasningsteknikken dekomponerer vÃĶgtopdateringer under finjustering til at aktivere en effektiv tilpasning af store forudtrÃĶnede rammer pÃĨ nedstrÃļmsopgaver. LoRA-teknikken dekomponerer vÃĶgtopdateringer for en forudtrÃĶnet models lag i forhold til bÃĨde input- og outputdimensioner og begrÃĶnser opdateringen til et lavdimensionalt under rum.
Konceptslidere
Det primÃĶre formÃĨl med Konceptslidere er at fungere som en tilgang til at finjustere LoRA-tilpasninger pÃĨ en diffusionsramme til at give en stÃļrre grad af kontrol over koncept-mÃĨlrettede billeder, og det samme demonstreres i fÃļlgende billede.

NÃĨr de er betinget af mÃĨlkoncepter, lÃĶrer Konceptslidere lav-rang-parameterretninger til enten at Ãļge eller mindske udtrykket af bestemte attributter. For en model og dets mÃĨlkoncept er det primÃĶre formÃĨl med Konceptslidere at opnÃĨ en forbedret model, der modificerer sandsynligheden for at forbedre attributter og undertrykke attributter for et billede, nÃĨr det er betinget af mÃĨlkonceptet for at Ãļge sandsynligheden for at forbedre attributter og mindske sandsynligheden for at undertrykke attributter. Ved hjÃĶlp af reparametrisering og Tweedies formel introducerer rammen en tidsvarierende stÃļjproces og udtrykker hver score som en rensningsforudsigelse. Desuden finjusterer disentanglement-objektivet modulerne i Konceptslidere, mens de forudtrÃĶnede vÃĶgte holdes konstante, og skalaerfaktoren, der introduceres under LoRA-formuleringen, modificeres under indgreb. Skalaerfaktoren giver ogsÃĨ mulighed for at justere styrken af redigeringen og gÃļr redigeringerne stÃĶrkere uden at genetrÃĶne rammen, som demonstreret i fÃļlgende billede.

Redigeringsmetoder, der tidligere blev brugt af rammer, muliggjorde stÃĶrkere redigeringer ved at genetrÃĶne rammen med Ãļget vejledning. Men skalaerfaktoren under indgreb producerer de samme redigeringsresultater uden at Ãļge genetrÃĶningsomkostningerne og tiden.
LÃĶring af visuelle koncepter
Konceptslidere er designet til at kontrollere visuelle koncepter, som tekstprompt ikke kan definere godt, og disse slidere udnytter smÃĨ datasÃĶt, der enten er parrede fÃļr eller efter, til at trÃĶne pÃĨ disse koncepter. Kontrasten mellem billedparrene giver slidere mulighed for at lÃĶre visuelle koncepter. Desuden optimerer Konceptslidernes trÃĶningsproces LoRA-komponenten, der er implementeret i bÃĨde fremad- og baglÃĶns retninger. Som fÃļlge heraf er LoRA-komponenten i overensstemmelse med retningen, der forÃĨrsager visuelle effekter i begge retninger.
Konceptslidere: Implementeringsresultater
For at analysere gevinsten i prÃĶstation har udviklere evaluaret brugen af Konceptslidere primÃĶrt pÃĨ Stable Diffusion XL, en hÃļjoplÃļsnings 1024-pixel-ramme med yderligere eksperimenter udfÃļrt pÃĨ Stable Diffusion v1.4-rammen med modellerne trÃĶnet i 500 epocher hver.
Tekstuelle Konceptslidere
For at evaluere prÃĶstationen af tekstuelle Konceptslidere er det valideret pÃĨ en samling af 30 tekstbaserede koncepter, og metoden er sammenlignet med to baseline, der bruger en standard tekstprompt for et fast antal tidsinterval og herefter starter komposition ved at tilfÃļje prompts til at styre billedet. Som det kan ses i fÃļlgende figur, resulterer brugen af Konceptslidere i konstant hÃļjere CLIP-score og en konstant reducering i LPIPS-scoren i forhold til den oprindelige ramme uden Konceptslidere.


Som det kan ses i ovenstÃĨende billede, giver brugen af Konceptslidere mulighed for prÃĶcis redigering af attributterne, der Ãļnskes under billedgenereringsprocessen, mens den samlede struktur af billedet opretholdes.
Visuelle Konceptslidere
Tekst-til-billede-diffusionsmodeller, der kun bruger tekstprompt, har ofte svÃĶrt ved at fastholde en hÃļjere grad af kontrol over visuelle attributter som ansigtsbehÃĨring eller Ãļjeformer. For at sikre bedre kontrol over granulÃĶre attributter udnytter Konceptslidere valgfri tekstvejledning parret med billedsÃĶt. Som det kan ses i figuren nedenfor, opretter Konceptslidere enkeltslidere for âÃļjestÃļrrelseâ og âÃļjenbrynformâ, der fanger de Ãļnskede transformationer ved hjÃĶlp af billedpar.

Resultaterne kan yderligere forbedres ved at give specifikke tekster, sÃĨ retningen fokuserer pÃĨ det faciale omrÃĨde, og opretter slidere med trinvis kontrol over det mÃĨlrettede attribut.
Komponering af slidere
En af de stÃļrste fordele ved at bruge Konceptslidere er deres komponerbarhed, der giver mulighed for at kombinere flere slidere for en forbedret kontrol i stedet for at fokusere pÃĨ et enkelt koncept ad gangen, hvilket kan tilskrives de lav-rang-slidere, der bruges i Konceptslidere. Desuden, da Konceptslidere er letvÃĶgede LoRA-tilpasninger, er de lette at dele, og de kan ogsÃĨ let overlades pÃĨ diffusionsmodeller. Brugere kan ogsÃĨ justere flere knapper samtidigt for at styre komplekse generationer ved at downloade interessante slidersÃĶt.

FÃļlgende billede demonstrerer kompositions mulighederne for konceptslidere, og flere slidere komponeres progressivt i hver rÃĶkke fra venstre til hÃļjre, hvilket giver mulighed for at traversere hÃļjdimensionale konceptrum med en forbedret kontrol over koncepterne.

Forbedring af billedkvalitet
Selvom state-of-the-art-tekst-til-billede-diffusionsrammer og store generative modeller som Stable Diffusion XL-modellen er i stand til at generere realistiske og hÃļjkvalitetsbilleder, lider de ofte under billedforvrÃĶngninger som uklare eller forvrÃĶngede objekter, selvom parametrene for disse state-of-the-art-rammer er udstyret med den latente evne til at generere hÃļjkvalitetsoutput med fÃĶrre generationer. Brugen af Konceptslidere kan resultere i generation af billeder med fÃĶrre forvrÃĶngninger ved at lÃĨse den sande kapacitet af disse modeller op ved at identificere lav-rang-parameterretninger.
Fixering af hÃĶnder
Generation af billeder med realistisk udseende hÃĶnder har altid vÃĶret en udfordring for diffusionsrammer, og brugen af Konceptslidere har den direkte kontrol over tendensen til at forvrÃĶnge hÃĶnder. FÃļlgende billede demonstrerer effekten af at bruge âfix hÃĶnderâ-Konceptslidere, der giver rammen mulighed for at generere billeder med mere realistisk udseende hÃĶnder.

Reparations-slidere
Brugen af Konceptslidere kan ikke kun resultere i generation af mere realistisk udseende hÃĶnder, men de har ogsÃĨ vist deres potentiale til at forbedre den samlede realisme af billederne, der genereres af rammen. Konceptslidere identificerer en enkelt lav-rang-parameterretning, der giver mulighed for at skifte billederne fra almindelige forvrÃĶngningsproblemer, og resultaterne demonstreres i fÃļlgende billede.

Afsluttende tanker
I denne artikel har vi talt om Konceptslidere, en enkel, men skalerbar ny paradigm, der giver mulighed for fortolkelig kontrol over genereret output i diffusionsmodeller. Brugen af Konceptslidere sigter mod at lÃļse problemerne, som nuvÃĶrende tekst-til-billede-diffusionsrammer stÃĨr over for, og som ofte resulterer i utilfredsstillende output. Desuden finder de fleste tekst-til-billede-diffusionsmodeller det svÃĶrt at modulere kontinuerte attributter i et billede, hvilket ofte resulterer i utilfredsstillende output. Brugen af Konceptslidere kan muligvis give tekst-til-billede-diffusionsrammer mulighed for at afhjÃĶlpe disse problemer og give indholdsskabere og slutbrugere en forbedret kontrol over billedgenereringsprocessen og lÃļse problemerne, som nuvÃĶrende rammer stÃĨr over for.












