AI-modeller og platforme
Konceptslidere: Præcis kontrol i diffusionmodeller med LoRA-tilpasninger
Takket være deres evner er tekst-til-billede-diffusionsmodeller blevet utroligt populære i den kunstneriske fællesskab. Men nuværende modeller, herunder state-of-the-art-rammer, kæmper ofte med at fastholde kontrollen over visuelle koncepter og attributter i de genererede billeder, hvilket fører til utilfredsstillende outputs. De fleste modeller afhænger udelukkende af tekstprompt, hvilket stiller udfordringer i form af modulation af kontinuerte attributter som intensiteten af vejr, skarpheden af skygger, ansigtsudtryk eller alderen på en person præcist. Dette gør det svært for slutbrugere at tilpasse billeder til at opfylde deres specifikke behov. Desuden, selvom disse generative rammer producerer højkvalitets- og realistiske billeder, er de udsat for forvrængninger som forvrængede ansigter eller manglende fingre.
For at overvinde disse begrænsninger har udviklere foreslået brugen af fortolkelige Konceptslidere. Disse slidere lover en større kontrol for slutbrugere over visuelle attributter, hvilket forbedrer billedgenerering og redigering inden for diffusionsmodeller. Konceptslidere i diffusionsmodeller fungerer ved at identificere en parameterretning, der svarer til et enkelt koncept, mens de minimiserer indgreb i andre attributter. Rammen opretter disse slidere ved hjælp af eksempelbilleder eller en samling prompts, hvilket etablerer retninger for både tekstuelle og visuelle koncepter.

Til sidst kan brugen af Konceptslidere i tekst-til-billede-diffusionsmodeller resultere i billedgenerering med minimal grad af indgreb og forbedret kontrol over det endelige output, samt øget opfattet realisme uden at ændre indholdet af billederne, og dermed generere realistiske billeder. I denne artikel vil vi diskutere konceptet om at bruge Konceptslidere i tekst-til-billede-rammer i større dybde og analysere, hvordan deres brug kan resultere i overlegen kvalitet af AI-genererede billeder.
En introduktion til Konceptslidere
Som tidligere nævnt kæmper nuværende tekst-til-billede-diffusionsrammer ofte med at fastholde kontrollen over visuelle koncepter og attributter i de genererede billeder, hvilket fører til utilfredsstillende resultater. Desuden finder mange af disse modeller det svært at modulere kontinuerte attributter, hvilket yderligere bidrager til utilfredsstillende outputs. Konceptslidere kan hjælpe med at afhjælpe disse problemer, hvilket giver indholdsskabere og slutbrugere en forbedret kontrol over billedgenereringsprocessen og løser udfordringerne, som nuværende rammer står over for.
De fleste nuværende tekst-til-billede-diffusionsmodeller afhænger af direkte tekstprompt-modifikation til at kontrollere billedattributter. Selvom denne tilgang tillader billedgenerering, er den ikke optimal, da ændring af prompten kan dramatisk ændre billedets struktur. En anden tilgang, som disse rammer bruger, indebærer post-hoc-teknikker, som inverterer diffusionsprocessen og modificerer cross-attentions til at redigere visuelle koncepter. Men post-hoc-teknikker har begrænsninger, da de kun understøtter en begrænset mængde samtidige redigeringer og kræver individuelle indgrebspassager for hvert nyt koncept. Desuden kan de introducere konceptuel indvikling, hvis de ikke er konstrueret omhyggeligt.
Til gengæld tilbyder Konceptslidere en mere effektiv løsning til billedgenerering. Disse letvægede, brugervenlige tilpasninger kan anvendes på forudtrænede modeller, hvilket forbedrer kontrollen og præcisionen over ønskede koncepter i en enkelt indgrebspassage med minimal indvikling. Konceptslidere giver også mulighed for at redigere visuelle koncepter, som ikke er dækket af tekstbeskrivelser, en funktion, der adskiller dem fra tekstprompt-baserede redigeringsmetoder. Selvom billedbaserede tilpasningsmetoder kan effektivt tilføje tokens for billedbaserede koncepter, er de svære at implementere til billedredigering. Konceptslidere giver slutbrugere mulighed for at give en lille mængde parrede billeder, der definerer et ønsket koncept. Sliderne generaliserer herefter dette koncept og anvender det automatisk på andre billeder, med det formål at forbedre realisme og fikse forvrængninger som i hænder.
Konceptslidere stræber efter at lære fra og løse problemer, der er fælles for fire generative AI- og diffusionsramme-koncepter: Billedredigering, vejledningsbaserede metoder, modelredigering og semantiske retninger.
Billedredigering
Nuværende AI-rammer fokuserer enten på at bruge en betinget input til at guide billedets struktur eller manipulere cross-attentions af kildebilledet med dets mål-prompt til at aktivere enkelt billedredigering i tekst-til-billede-diffusionsrammer. Disse tilgange kan kun implementeres på enkeltbilleder og kræver latent basisoptimering for hvert billede som følge af den udviklende geometriske struktur over tidsintervallet på tværs af prompts.
Vejledningsbaserede metoder
Brugen af klassificator-frie vejledningsbaserede metoder har vist deres evne til at forbedre kvaliteten af de genererede billeder og øge tekst-billede-alignment. Ved at inkorporere vejledningstermer under indgreb forbedrer metoden den begrænsede kompositionel arv, der er arvet fra diffusionsrammerne, og de kan bruges til at vejlede gennem usikre koncepter i diffusionsrammer.
Modelredigering
Brugen af Konceptslidere kan også ses som en modelredigeringsmetode, der anvender en lav-rang-tilpasning til at udgive en enkelt semantisk attribut, der giver plads til kontinuerlig kontrol, der er i overensstemmelse med attributten. Fine-tuning-baserede tilpasningsmetoder bruges herefter til at tilpasse rammen til at tilføje nye koncepter. Desuden foreslår Custom Diffusion-teknikken en måde at finjustere cross-attentions-lag til at inkorporere nye visuelle koncepter i forudtrænede diffusionsmodeller på en modsat måde. Textual Diffusion-teknikken foreslår at optimere en indlejringsværdi til at aktivere modelkapaciteter og introducere tekstuelle koncepter i rammen.
Semantisk retning i GAN’er
Manipulation af semantiske attributter er en af de vigtigste egenskaber ved Generative Adversarial Networks, hvor latent rum-traektorier er fundet til at være aligneret på en selv-overvåget måde. I diffusionsrammer findes disse latent rum-traektorier i midterlagene af U-Net-arkitekturen, og den primære retning af latent rum i diffusionsrammer fanger globale semantik. Konceptslidere træner lav-rang-under rum, der svarer til specifikke attributter direkte, og opnår præcise og lokaliserede redigeringsretninger ved at bruge tekst- eller billedpar til at optimere globale retninger.
Konceptslidere: Arkitektur og funktionsmåde
Diffusionsmodeller og LoRA eller Lav-rang-tilpasninger
Diffusionsmodeller er essentielt en underklasse af generative AI-rammer, der opererer på principperne om at syntetisere data ved at omvende en diffusionsproces. Den fremadgående diffusionsproces tilføjer først støj til data, så overgangen fra en organiseret tilstand til en komplet Gaussisk støjtilstand. Det primære formål med diffusionsmodeller er at omvende diffusionsprocessen ved at gradvist rense billedet og prøve en tilfældig Gaussisk støj til at generere et billede. I virkelige anvendelser er det primære formål med diffusionsrammer at forudsige den sande støj, når den komplette Gaussiske støj indføres som input med ekstra input som betingelser og tidsinterval.
LoRA eller Lav-rang-tilpasningsteknikken dekomponerer vægtopdateringer under finjustering til at aktivere en effektiv tilpasning af store forudtrænede rammer på nedstrømsopgaver. LoRA-teknikken dekomponerer vægtopdateringer for en forudtrænet models lag i forhold til både input- og outputdimensioner og begrænser opdateringen til et lavdimensionalt under rum.
Konceptslidere
Det primære formål med Konceptslidere er at fungere som en tilgang til at finjustere LoRA-tilpasninger på en diffusionsramme til at give en større grad af kontrol over koncept-målrettede billeder, og det samme demonstreres i følgende billede.

Når de er betinget af målkoncepter, lærer Konceptslidere lav-rang-parameterretninger til enten at øge eller mindske udtrykket af bestemte attributter. For en model og dets målkoncept er det primære formål med Konceptslidere at opnå en forbedret model, der modificerer sandsynligheden for at forbedre attributter og undertrykke attributter for et billede, når det er betinget af målkonceptet for at øge sandsynligheden for at forbedre attributter og mindske sandsynligheden for at undertrykke attributter. Ved hjælp af reparametrisering og Tweedies formel introducerer rammen en tidsvarierende støjproces og udtrykker hver score som en rensningsforudsigelse. Desuden finjusterer disentanglement-objektivet modulerne i Konceptslidere, mens de forudtrænede vægte holdes konstante, og skalaerfaktoren, der introduceres under LoRA-formuleringen, modificeres under indgreb. Skalaerfaktoren giver også mulighed for at justere styrken af redigeringen og gør redigeringerne stærkere uden at genetræne rammen, som demonstreret i følgende billede.

Redigeringsmetoder, der tidligere blev brugt af rammer, muliggjorde stærkere redigeringer ved at genetræne rammen med øget vejledning. Men skalaerfaktoren under indgreb producerer de samme redigeringsresultater uden at øge genetræningsomkostningerne og tiden.
Læring af visuelle koncepter
Konceptslidere er designet til at kontrollere visuelle koncepter, som tekstprompt ikke kan definere godt, og disse slidere udnytter små datasæt, der enten er parrede før eller efter, til at træne på disse koncepter. Kontrasten mellem billedparrene giver slidere mulighed for at lære visuelle koncepter. Desuden optimerer Konceptslidernes træningsproces LoRA-komponenten, der er implementeret i både fremad- og baglæns retninger. Som følge heraf er LoRA-komponenten i overensstemmelse med retningen, der forårsager visuelle effekter i begge retninger.
Konceptslidere: Implementeringsresultater
For at analysere gevinsten i præstation har udviklere evaluaret brugen af Konceptslidere primært på Stable Diffusion XL, en højopløsnings 1024-pixel-ramme med yderligere eksperimenter udført på Stable Diffusion v1.4-rammen med modellerne trænet i 500 epocher hver.
Tekstuelle Konceptslidere
For at evaluere præstationen af tekstuelle Konceptslidere er det valideret på en samling af 30 tekstbaserede koncepter, og metoden er sammenlignet med to baseline, der bruger en standard tekstprompt for et fast antal tidsinterval og herefter starter komposition ved at tilføje prompts til at styre billedet. Som det kan ses i følgende figur, resulterer brugen af Konceptslidere i konstant højere CLIP-score og en konstant reducering i LPIPS-scoren i forhold til den oprindelige ramme uden Konceptslidere.


Som det kan ses i ovenstående billede, giver brugen af Konceptslidere mulighed for præcis redigering af attributterne, der ønskes under billedgenereringsprocessen, mens den samlede struktur af billedet opretholdes.
Visuelle Konceptslidere
Tekst-til-billede-diffusionsmodeller, der kun bruger tekstprompt, har ofte svært ved at fastholde en højere grad af kontrol over visuelle attributter som ansigtsbehåring eller øjeformer. For at sikre bedre kontrol over granulære attributter udnytter Konceptslidere valgfri tekstvejledning parret med billedsæt. Som det kan ses i figuren nedenfor, opretter Konceptslidere enkeltslidere for “øjestørrelse” og “øjenbrynform”, der fanger de ønskede transformationer ved hjælp af billedpar.

Resultaterne kan yderligere forbedres ved at give specifikke tekster, så retningen fokuserer på det faciale område, og opretter slidere med trinvis kontrol over det målrettede attribut.
Komponering af slidere
En af de største fordele ved at bruge Konceptslidere er deres komponerbarhed, der giver mulighed for at kombinere flere slidere for en forbedret kontrol i stedet for at fokusere på et enkelt koncept ad gangen, hvilket kan tilskrives de lav-rang-slidere, der bruges i Konceptslidere. Desuden, da Konceptslidere er letvægede LoRA-tilpasninger, er de lette at dele, og de kan også let overlades på diffusionsmodeller. Brugere kan også justere flere knapper samtidigt for at styre komplekse generationer ved at downloade interessante slidersæt.

Følgende billede demonstrerer kompositions mulighederne for konceptslidere, og flere slidere komponeres progressivt i hver række fra venstre til højre, hvilket giver mulighed for at traversere højdimensionale konceptrum med en forbedret kontrol over koncepterne.

Forbedring af billedkvalitet
Selvom state-of-the-art-tekst-til-billede-diffusionsrammer og store generative modeller som Stable Diffusion XL-modellen er i stand til at generere realistiske og højkvalitetsbilleder, lider de ofte under billedforvrængninger som uklare eller forvrængede objekter, selvom parametrene for disse state-of-the-art-rammer er udstyret med den latente evne til at generere højkvalitetsoutput med færre generationer. Brugen af Konceptslidere kan resultere i generation af billeder med færre forvrængninger ved at låse den sande kapacitet af disse modeller op ved at identificere lav-rang-parameterretninger.
Fixering af hænder
Generation af billeder med realistisk udseende hænder har altid været en udfordring for diffusionsrammer, og brugen af Konceptslidere har den direkte kontrol over tendensen til at forvrænge hænder. Følgende billede demonstrerer effekten af at bruge “fix hænder”-Konceptslidere, der giver rammen mulighed for at generere billeder med mere realistisk udseende hænder.

Reparations-slidere
Brugen af Konceptslidere kan ikke kun resultere i generation af mere realistisk udseende hænder, men de har også vist deres potentiale til at forbedre den samlede realisme af billederne, der genereres af rammen. Konceptslidere identificerer en enkelt lav-rang-parameterretning, der giver mulighed for at skifte billederne fra almindelige forvrængningsproblemer, og resultaterne demonstreres i følgende billede.

Afsluttende tanker
I denne artikel har vi talt om Konceptslidere, en enkel, men skalerbar ny paradigm, der giver mulighed for fortolkelig kontrol over genereret output i diffusionsmodeller. Brugen af Konceptslidere sigter mod at løse problemerne, som nuværende tekst-til-billede-diffusionsrammer står over for, og som ofte resulterer i utilfredsstillende output. Desuden finder de fleste tekst-til-billede-diffusionsmodeller det svært at modulere kontinuerte attributter i et billede, hvilket ofte resulterer i utilfredsstillende output. Brugen af Konceptslidere kan muligvis give tekst-til-billede-diffusionsrammer mulighed for at afhjælpe disse problemer og give indholdsskabere og slutbrugere en forbedret kontrol over billedgenereringsprocessen og løse problemerne, som nuværende rammer står over for.










