AI-modellen en platforms

Concept Sliders: Precise Controle in Diffusiemodellen met LoRA-Adaptors

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Dankzij hun mogelijkheden zijn tekst-naar-afbeelding diffusiemodellen enorm populair geworden in de artistieke gemeenschap. Echter, huidige modellen, inclusief state-of-the-art-frameworks, hebben vaak moeite om controle te houden over de visuele concepten en attributen in gegenereerde afbeeldingen, waardoor onbevredigende resultaten ontstaan. De meeste modellen vertrouwen uitsluitend op tekstprompts, wat problemen oplevert bij het moduleren van continue attributen zoals de intensiteit van het weer, de scherpte van schaduwen, gezichtsuitdrukkingen of de leeftijd van een persoon. Dit maakt het moeilijk voor eindgebruikers om afbeeldingen aan te passen aan hun specifieke behoeften. Bovendien, hoewel deze generatieve frameworks hoge-kwaliteit en realistische afbeeldingen produceren, zijn ze gevoelig voor distorties zoals verwrongen gezichten of ontbrekende vingers.

Om deze beperkingen te overwinnen, hebben ontwikkelaars het gebruik van interpreteerbare Concept Sliders voorgesteld. Deze sliders beloven een grotere controle voor eindgebruikers over visuele attributen, waardoor de afbeeldingengeneratie en -bewerking binnen diffusiemodellen verbeterd wordt. Concept Sliders in diffusiemodellen werken door een parameter richting te identificeren die overeenkomt met een individueel concept, terwijl ze minimale interferentie met andere attributen veroorzaken. Het framework creëert deze sliders met behulp van voorbeeldafbeeldingen of een set prompts, waardoor richtingen voor zowel tekstuele als visuele concepten worden vastgesteld.

Uiteindelijk kan het gebruik van Concept Sliders in tekst-naar-afbeelding diffusiemodellen leiden tot afbeeldingengeneratie met een minimale mate van interferentie en een verhoogde controle over het eindresultaat, terwijl het ook de waargenomen realiteit verhoogt zonder de inhoud van de afbeeldingen te veranderen, en zo realistische afbeeldingen genereert. In dit artikel zullen we dieper ingaan op het concept van het gebruik van Concept Sliders in tekst-naar-afbeeldingframeworks en analyseren hoe hun gebruik kan leiden tot superieure kwaliteit AI-gegenereerde afbeeldingen.

Een Inleiding tot Concept Sliders

Zoals eerder vermeld, hebben huidige tekst-naar-afbeelding diffusieframeworks vaak moeite om controle te houden over visuele concepten en attributen in gegenereerde afbeeldingen, waardoor onbevredigende resultaten ontstaan. Bovendien hebben veel van deze modellen moeite om continue attributen te moduleren, wat bijdraagt aan onbevredigende resultaten. Concept Sliders kunnen helpen om deze problemen te mitigeren, waardoor content creators en eindgebruikers een verhoogde controle hebben over het afbeeldingengeneratieproces en uitdagingen aangaan die worden geconfronteerd door huidige frameworks.

De meeste huidige tekst-naar-afbeelding diffusiemodellen vertrouwen op directe tekstpromptmodificatie om afbeeldingattributen te controleren. Hoewel deze benadering afbeeldingengeneratie mogelijk maakt, is het niet optimaal, omdat het wijzigen van de prompt de structuur van de afbeelding drastisch kan veranderen. Een andere benadering die wordt gebruikt door deze frameworks, omvat Post-hoc-technieken, die de diffusieproces omkeren en cross-attentions modificeren om visuele concepten te bewerken. Echter, Post-hoc-technieken hebben beperkingen, omdat ze slechts een beperkt aantal gelijktijdige bewerkingen ondersteunen en individuele interferentiepasses voor elk nieuw concept vereisen. Bovendien kunnen ze conceptuele verstrengeling introduceren als ze niet zorgvuldig worden geëngineerd.

In tegenstelling tot Concept Sliders bieden een meer efficiënte oplossing voor afbeeldingengeneratie. Deze lichte, eenvoudig te gebruiken adaptors kunnen worden toegepast op vooraf getrainde modellen, waardoor controle en precisie over gewenste concepten in één interferentiepass met minimale verstrengeling worden verhoogd. Concept Sliders maken het ook mogelijk om visuele concepten te bewerken die niet door tekstuele beschrijvingen worden gedekt, een functie die ze onderscheidt van tekstprompt-gebaseerde bewerkingsmethoden. Hoewel beeldgebaseerde aanpassingsmethoden effectief tokens kunnen toevoegen voor beeldgebaseerde concepten, zijn ze moeilijk te implementeren voor afbeeldingsbewerking. Concept Sliders stellen eindgebruikers in staat om een kleine hoeveelheid gepaarde afbeeldingen te definiëren die een gewenst concept definiëren. De sliders generaliseren dan dit concept en passen het automatisch toe op andere afbeeldingen, met als doel de realiteit te verhogen en distorties zoals die in handen te corrigeren.

Concept Sliders streven ernaar om te leren van en problemen aan te pakken die gemeenschappelijk zijn aan vier generatieve AI- en diffusieframeworkconcepten: Afbeeldingsbewerking, Geleide methoden, Modelbewerking en Semantische richtingen.

Afbeeldingsbewerking

Huidige AI-frameworks focussen ofwel op het gebruik van een conditionele invoer om de afbeeldingsstructuur te leiden, ofwel manipuleren ze cross-attentions van de bronafbeelding met de doelprompt om single image editing in tekst-naar-afbeelding diffusieframeworks mogelijk te maken. Als gevolg hiervan kunnen deze benaderingen alleen op individuele afbeeldingen worden geïmplementeerd en vereisen ze ook latent basisoptimalisatie voor elke afbeelding als gevolg van de evolutie van de geometrische structuur over tijdstappen bij prompts.

Geleide methoden

Het gebruik van classifier-free geleide methoden heeft aangetoond dat ze de kwaliteit van de gegenereerde afbeeldingen kunnen verbeteren en de tekst-afbeeldingsuitlijning kunnen verhogen. Door geleidetermen tijdens interferentie op te nemen, verbetert de methode de beperkte compositie die door de diffusieframeworks wordt geërfd, en kan het worden gebruikt om door onveilige concepten in diffusieframeworks te leiden.

Modelbewerking

Het gebruik van Concept Sliders kan ook worden gezien als een modelbewerkingsmethode die een lage-rangadaptor gebruikt om één semantisch attribuut uit te voeren dat ruimte maakt voor continue controle die overeenkomt met het attribuut. Fijnaanpassingsgebaseerde aanpassingsmethoden worden dan gebruikt om het framework te personaliseren en nieuwe concepten toe te voegen. Bovendien stelt de Custom Diffusion-techniek een manier voor om cross-attentielagen te fijnaanpassen om nieuwe visuele concepten in vooraf getrainde diffusiemodellen op te nemen. Omgekeerd stelt de Textual Diffusion-techniek voor om een embedvector te optimaliseren om modelmogelijkheden te activeren en tekstuele concepten in het framework in te voeren.

Semantische richting in GANs

Manipulatie van semantische attributen is een van de belangrijkste kenmerken van Generatieve Adversarial Networks, waarbij de latent ruimte trajecten in een zelfsupervised manier zijn uitgelijnd. In diffusieframeworks bestaan deze latent ruimte trajecten in de middelste lagen van de U-Net-architectuur, en de primaire richting van de latent ruimte in diffusieframeworks vat globale semantiek samen. Concept Sliders trainen lage-rangsubruimtes die overeenkomen met speciale attributen rechtstreeks, en verkrijgen precieze en gelokaliseerde bewerkingsrichtingen door tekst- of beeldparen te gebruiken om globale richtingen te optimaliseren.

Concept Sliders: Architectuur en Werking

Diffusiemodellen en LoRA of Lage-rangadaptors

Diffusiemodellen zijn in wezen een subclass van generatieve AI-frameworks die werken op het principe van het synthetiseren van gegevens door een diffusieproces om te keren. Het voorwaartse diffusieproces voegt eerst ruis toe aan de gegevens, waardoor de overgang van een georganiseerde staat naar een complete Gaussian-ruisstaat plaatsvindt. Het primaire doel van diffusiemodellen is om het diffusieproces om te keren door de afbeelding langzaam te ontroeren en een willekeurige Gaussian-ruis te bemonsteren om een afbeelding te genereren. In real-world toepassingen is het primaire doel van diffusieframeworks om de werkelijke ruis te voorspellen wanneer de complete Gaussian-ruis als invoer wordt gevoerd met extra invoer zoals conditie en tijdstap.

De LoRA- of lage-rangadaptor-techniek decomponeert gewichtsupdates tijdens fijnaanpassen om een efficiënte aanpassing van grote vooraf getrainde frameworks op downstream-taken mogelijk te maken. De LoRA-techniek decomponeert gewichtsupdates voor een vooraf getraind model-laag met betrekking tot zowel de invoer- als de uitvoerdimensies, en beperkt de update tot een lage-dimensionale subspace.

Concept Sliders

Het primaire doel van Concept Sliders is om te dienen als een benadering om LoRA-adaptors op een diffusieframework te fijnaanpassen om een grotere mate van controle over conceptgerichte afbeeldingen mogelijk te maken, en hetzelfde wordt gedemonstreerd in de volgende afbeelding.

Wanneer ze worden geconditioneerd op doelconcepten, leren Concept Sliders lage-rangparameter richtingen om de expressie van specifieke attributen te verhogen of te verlagen. Voor een model en zijn doelconcept is het primaire doel van Concept Sliders om een verbeterd model te verkrijgen dat de waarschijnlijkheid van het verhogen en onderdrukken van attributen voor een afbeelding wanneer het wordt geconditioneerd op het doelconcept verhoogt, en de waarschijnlijkheid van het onderdrukken van attributen verlaagt. Met behulp van reparameterisatie en Tweedie’s formule introduceert het framework een tijdsafhankelijk ruisproces, en drukt elk score uit als een ontroeringsvoorspelling. Bovendien finetuned de disentanglementobjectief de modules in Concept Sliders terwijl de vooraf getrainde gewichten constant blijven, en de schaalfactor die tijdens de LoRA-formulering wordt geïntroduceerd, wordt gewijzigd tijdens interferentie. De schaalfactor maakt het ook mogelijk om de sterkte van de bewerking aan te passen, en maakt de bewerkingen sterker zonder het framework opnieuw te trainen, zoals wordt gedemonstreerd in de volgende afbeelding.

Bewerkingsmethoden die eerder door frameworks werden gebruikt, maakten sterke bewerkingen mogelijk door het framework opnieuw te trainen met verhoogde geleiding. Echter, het schalen van de schaalfactor tijdens interferentie produceert hetzelfde bewerkingsresultaat zonder de opleidingskosten te verhogen, en tijd.

Visuele Concepten Leren

Concept Sliders zijn ontworpen om visuele concepten te controleren die tekstprompts niet goed kunnen definiëren, en deze sliders gebruiken kleine datasets die zijn gepaard voordat of nadat ze worden getraind op deze concepten. De contrast tussen de beeldparen stelt sliders in staat om visuele concepten te leren. Bovendien optimaliseert het trainingsproces van Concept Sliders de LoRA-component die is geïmplementeerd in zowel de voorwaartse als de achterwaartse richtingen. Als gevolg hiervan komt de LoRA-component overeen met de richting die de visuele effecten in beide richtingen veroorzaakt.

Concept Sliders: Implementatie Resultaten

Om de prestatieverbetering te analyseren, hebben ontwikkelaars het gebruik van Concept Sliders voornamelijk geëvalueerd op de Stable Diffusion XL, een high-resolution 1024-pixel framework met extra experimenten uitgevoerd op de Stable Diffusion v1.4 framework met de modellen die zijn getraind voor 500 epochs elk.

Tekstuele Concept Sliders

Om de prestatie van tekstuele Concept Sliders te evalueren, is het gevalideerd op een set van 30 tekstgebaseerde concepten, en de methode is vergeleken met twee baseline die gebruikmaken van een standaardtekstprompt voor een vast aantal tijdstappen, en vervolgens compositie starten door prompts toe te voegen om de afbeelding te sturen. Zoals te zien is in de volgende figuur, leidt het gebruik van Concept Sliders tot constant hogere CLIP-scores en een constante reductie in de LPIPS-score in vergelijking met het oorspronkelijke framework zonder Concept Sliders.

Zoals te zien is in de bovenstaande afbeelding, maakt het gebruik van Concept Sliders precieze bewerking van de attributen mogelijk die tijdens het afbeeldingengeneratieproces gewenst zijn, terwijl de algehele structuur van de afbeelding behouden blijft.

Visuele Concept Sliders

Tekst-naar-afbeelding diffusiemodellen die alleen tekstprompts gebruiken, hebben vaak moeite om een hogere mate van controle te houden over visuele attributen zoals gezichtsbeharing of oogvormen. Om een betere controle over granulaire attributen te garanderen, gebruiken Concept Sliders optionele tekstgeleiding in combinatie met beeld datasets. Zoals te zien is in de onderstaande figuur, creëren Concept Sliders individuele sliders voor “ooggrootte” en “wenkbrauwvorm” die de gewenste transformaties vastleggen met behulp van beeldparen.

De resultaten kunnen verder worden verfijnd door specifieke teksten te bieden, zodat de richting zich op dat gezichtsgebied richt en sliders creëert met stapsgewijze controle over het gerichte attribuut.

Componeren van Sliders

Een van de belangrijkste voordelen van het gebruik van Concept Sliders is hun componabiliteit, die gebruikers in staat stelt om meerdere sliders te combineren voor een verhoogde mate van controle in plaats van zich te concentreren op één concept tegelijk, wat kan worden toegeschreven aan de lage-rangslidersrichtingen die in Concept Sliders worden gebruikt. Bovendien, aangezien Concept Sliders lichte LoRA-adaptors zijn, zijn ze gemakkelijk te delen en kunnen ze gemakkelijk worden overgelegd op diffusiemodellen. Gebruikers kunnen ook meerdere knoppen tegelijk aanpassen om complexe generaties te sturen door interessante slidersets te downloaden.

De volgende afbeelding toont de compositiemogelijkheden van conceptsliders, en meerdere sliders worden progressief samengesteld in elke rij van links naar rechts, waardoor een hogedimensionale conceptuele ruimte kan worden doorkruist met een verhoogde mate van controle over de concepten.

Beeldkwaliteit Verbeteren

Hoewel state-of-the-art tekst-naar-afbeelding diffusieframeworks en grote generatieve modellen zoals de Stable Diffusion XL-model in staat zijn om realistische en hoge-kwaliteit afbeeldingen te genereren, lijden ze vaak aan afbeeldingsdistorties zoals vage of verwrongen objecten, zelfs als de parameters van deze state-of-the-art-frameworks zijn uitgerust met de latentie om hoge-kwaliteit output te genereren met minder generaties. Het gebruik van Concept Sliders kan leiden tot het genereren van afbeeldingen met minder distorties door de ware mogelijkheden van deze modellen te ontgrendelen door lage-rangparameter richtingen te identificeren.

Handen Repareren

Het genereren van afbeeldingen met realistisch uitziende handen is altijd een obstakel geweest voor diffusieframeworks, en het gebruik van Concept Sliders heeft een directe controle over de neiging om handen te verstoren. De volgende afbeelding toont het effect van het gebruik van de “handen repareren” Concept Sliders, die het framework in staat stellen om afbeeldingen te genereren met meer realistisch uitziende handen.

Reparatiesliders

Het gebruik van Concept Sliders kan niet alleen leiden tot het genereren van meer realistisch uitziende handen, maar heeft ook zijn potentieel aangetoond om de algehele realiteit van de door het framework gegenereerde afbeeldingen te verbeteren. Concept Sliders identificeren ook één lage-rangparameter richting die de verschuiving in afbeeldingen van gemeenschappelijke distortieproblemen mogelijk maakt, en de resultaten worden getoond in de volgende afbeelding.

Slotgedachten

In dit artikel hebben we het over Concept Sliders, een eenvoudig maar schaalbaar nieuw paradigma dat interpreteerbare controle over gegenereerde output in diffusiemodellen mogelijk maakt. Het gebruik van Concept Sliders heeft als doel om de problemen op te lossen die worden geconfronteerd door de huidige tekst-naar-afbeelding diffusieframeworks die moeite hebben om de vereiste controle te houden over visuele concepten en attributen in de gegenereerde afbeelding, wat vaak leidt tot onbevredigende resultaten. Bovendien hebben de meeste tekst-naar-afbeelding diffusiemodellen moeite om continue attributen te moduleren, wat uiteindelijk vaak leidt tot onbevredigende resultaten. Het gebruik van Concept Sliders kan deze problemen mitigeren en content creators en eindgebruikers in staat stellen om een verhoogde mate van controle te hebben over het afbeeldingengeneratieproces en problemen op te lossen die worden geconfronteerd door huidige frameworks.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.