Andersons vinkel

Tre udfordringer foran Stable Diffusion

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Udgivelsen af stability.ai’s Stable Diffusion latent diffusion billedsynthesemodell for et par uger siden kan vÃĶre en af de mest betydningsfulde teknologiske afslÃļringer siden DeCSS i 1999; det er bestemt det stÃļrste begivenhed i AI-genereret billedmateriale siden deepfakes-koden blev kopieret over til GitHub og forket til, hvad der skulle blive DeepFaceLab og FaceSwap, samt realtids-streaming deepfake-software DeepFaceLive.

PÃĨ ÃĐt tidspunkt blev brugerirritation over indholdsbegrÃĶnsninger i DALL-E 2’s billedsynthesi-API sat til side, da det viste sig, at Stable Diffusions NSFW-filter kunne deaktiveres ved at ÃĶndre en enkelt linje kode. Pornocentriske Stable Diffusion-Reddit-grupper dukkede op nÃĶsten med det samme og blev hurtigt lukket ned, mens udvikler- og brugerlejren delte sig pÃĨ Discord i officielle og NSFW-samfund, og Twitter begyndte at blive fyldt op med fantastiske Stable Diffusion-kreationer.

I Ãļjeblikket synes hver dag at bringe nogle fantastiske innovationer fra udviklerne, der har adopteret systemet, med plugins og tredjeparts-tilfÃļjelser, der hastigt bliver skrevet til Krita, Photoshop, Cinema4D, Blender og mange andre applikationsplatforme.

I mellemtiden er promptcraft – den nu professionelle kunst af ‘AI-whispering’, som mÃĨske ender med at vÃĶre den kortest tÃĶnkelige karrierevalg siden ‘Filofax-binder’ – allerede blevet kommercialiseret, mens tidlig monetering af Stable Diffusion finder sted pÃĨ Patreon-niveauet, med sikkerhed for mere avancerede tilbud, der kommer, for dem, der ikke vil navigere Conda-baserede installationer af kildekoden eller de proskriptive NSFW-filtre i webbaserede implementationer.

Udviklingstakten og den frie fÃļlelse af udforskning fra brugerne sker i sÃĨdan en hvirvelvindende fart, at det er svÃĶrt at se langt frem. I virkeligheden ved vi ikke helt, hvad vi har at gÃļre med endnu, eller hvilke begrÃĶnsninger eller muligheder der kan vÃĶre.

Alligevel lad os kaste et blik pÃĨ tre af, hvad der mÃĨske er de mest interessante og udfordrende hindringer for den hurtigt dannede og hurtigt voksende Stable Diffusion-samfund at overvinde.

1: Optimering af flisebaserede rÃļrledninger

PrÃĶsenteret med begrÃĶnsede hardwareressourcer og hÃĨrde begrÃĶnsninger pÃĨ oplÃļsningen af trÃĶningsbilleder, synes det sandsynligt, at udviklerne vil finde lÃļsninger til at forbedre bÃĨde kvaliteten og oplÃļsningen af Stable Diffusions output. Mange af disse projekter er sat til at udnytte begrÃĶnsningerne i systemet, sÃĨsom dets native oplÃļsning pÃĨ kun 512×512 pixels.

Som altid er tilfÃĶldet med computer vision og billedsyntheseprojekter, blev Stable Diffusion trÃĶnet pÃĨ kvadratiske billedforhold, i dette tilfÃĶlde resampleret til 512×512, sÃĨledes at kildebillederne kunne regulariseres og vÃĶre i stand til at passe ind i begrÃĶnsningerne for de GPU’er, der trÃĶnede modellen.

Derfor “tÃĶnker” Stable Diffusion (hvis det overhovedet tÃĶnker) i 512×512-termer og bestemt i kvadratiske termer. Mange brugere, der i Ãļjeblikket udforsker begrÃĶnsningerne for systemet, rapporterer, at Stable Diffusion producerer de mest pÃĨlidelige og mindst fejlbehÃĶftede resultater ved denne ret begrÃĶnsede aspektforhold (se “adressering af ekstremiteter” nedenfor).

Flere implementationer har upscaling via RealESRGAN (og kan fikse dÃĨrligt renderede ansigter via GFPGAN), men flere brugere udvikler metoder til at splitte billeder op i 512x512px-sektioner og sy sammen billederne for at danne stÃļrre kompositbilleder.

Dette 1024x576-render, en oplÃļsning, der normalt er umulig i et enkelt Stable Diffusion-render, blev skabt ved at kopiere og indsÃĶtte attention.py Python-filen fra DoggettX-forken af Stable Diffusion (en version, der implementerer flisebaseret upscaling) i en anden fork. Kilde: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Dette 1024×576-render, en oplÃļsning, der normalt er umulig i et enkelt Stable Diffusion-render, blev skabt ved at kopiere og indsÃĶtte attention.py Python-filen fra DoggettX-forken af Stable Diffusion (en version, der implementerer flisebaseret upscaling) i en anden fork. Kilde: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/

Flise er en kraftfuld og relativt billig mÃĨde for Stable Diffusion at kunne producere hi-res-output, men algoritme-baseret flise-upscaling af denne type kan, hvis den mangler en slags bredere, hÃļjere niveau-attention-mekanisme, mÃĨske ikke leve op til de Ãļnskede standarder pÃĨ tvÃĶrs af en rÃĶkke indholdstyper.

2: LÃļsning af problemer med menneskelige lemmer

Stable Diffusion lever ikke op til sit navn, nÃĨr det kommer til at afbilde kompleksiteten af menneskelige ekstremiteter. HÃĶnder kan multiplicere tilfÃĶldigt, fingre kan samles, en tredje ben kan dukke op uden varsel, og eksisterende lemmer kan forsvinde uden spor. I sin forsvar kan Stable Diffusion dele problemet med sine stabile medspillere og sandsynligvis med DALL-E 2.

Uredigerede resultater fra DALL-E 2 og Stable Diffusion (1.4) ved udgangen af august 2022, begge viser problemer med lemmer. Prompt er 'En kvinde omfavner en mand'

Uredigerede resultater fra DALL-E 2 og Stable Diffusion (1.4) ved udgangen af august 2022, begge viser problemer med lemmer. Prompt er ‘En kvinde omfavner en mand’

Stable Diffusion-entusiaster, der hÃĨber, at den kommende 1.5-checkpoint (en mere intensivt trÃĶnet version af modellen med forbedrede parametre) ville lÃļse lem-konflikten, er sandsynligvis til at blive skuffede. Den nye model, der vil blive udgivet om cirka to uger, er i Ãļjeblikket blevet prÃĶsenteret pÃĨ det kommercielle stability.ai-portalen DreamStudio, hvor brugere kan sammenligne det nye output med render fra deres lokale eller andre 1.4-systemer:

3: Tilpasning

En af de mest spÃĶndende muligheder for fremtiden for Stable Diffusion er udsigten til, at brugere eller organisationer udvikler reviderede systemer; modifikationer, der tillader indhold uden for den forudtrÃĶnede LAION-kreds at blive integreret i systemet – idealisk uden den ustyrlige omkostning ved at trÃĶne hele modellen igen eller risikoen ved at trÃĶne i en stor mÃĶngde nyt indhold til en eksisterende, moden og kapabel model.

Ved analogi: Hvis to mindre begavede elever tilslutter sig en avanceret klasse pÃĨ tredive elever, vil de enten assimilere og holde trit, eller fejle som outliers; i begge tilfÃĶlde vil klassegennemsnittet sandsynligvis ikke blive pÃĨvirket. Hvis femten mindre begavede elever tilslutter sig, er klassegennemsnittet sandsynligvis til at lide under det.

LigesÃĨ kan den synergistiske og ret sÃĨrbare netvÃĶrk af relationer, der opbygges over lÃĶngere og dyre modeltrÃĶning, blive kompromitteret, i visse tilfÃĶlde efektivt Ãļdelagt, af for meget nyt indhold, hvilket sÃĶnker kvaliteten af modellens output generelt.

TilfÃĶldet for at gÃļre dette er primÃĶrt, hvor dit interesseomrÃĨde ligger i at fuldstÃĶndigt kapre modellens konceptuelle forstÃĨelse af relationer og ting og overtage det til eksklusiv produktion af indhold, der ligner det tilfÃļjede materiale.

SÃĨledes er trÃĶning af 500.000 Simpsons-rammer i en eksisterende Stable Diffusion-checkpoint sandsynligvis til at give dig en bedre Simpsons-simulator end den originale bygning kunne have tilbudt, under forudsÃĶtning af, at nok bredt semantiske relationer overlever processen (dvs. Homer Simpson spiser en hotdog, som kan krÃĶve materiale om hotdogs, der ikke var i dit tilfÃļjede materiale, men allerede fandtes i checkpointet), og under forudsÃĶtning af, at du ikke pludselig skal skifte fra Simpsons-indhold til at skabe fabulous landscape by Greg Rutkowski – fordi din post-trÃĶnet model har fÃĨet sin opmÃĶrksomhed kraftigt omdirigeret og ikke vil vÃĶre sÃĨ god til at gÃļre den slags ting som den var fÃļr.

Et bemÃĶrkelsesvÃĶrdigt eksempel pÃĨ dette er waifu-diffusion, der har succesfuldt post-trÃĶnet 56.000 anime-billeder i en fuldt trÃĶnet Stable Diffusion-checkpoint. Det er et hÃĨrdt prospekt for en hobbyist, da modellen krÃĶver en ÃļjenÃĨbnende minimum pÃĨ 30GB VRAM, langt ud over, hvad der sandsynligvis er tilgÃĶngeligt pÃĨ forbruger-niveauet i NVIDIA’s kommende 40XX-serie.

PÃĨ grund af disse begrÃĶnsninger kan vi mÃĨske vÃĶre nÃļdt til at vente lidt, fÃļr vi ser nogle af de mere avancerede tekstuelle inversionseksperimenter fra Stable Diffusion-entusiaster – og om denne tilgang kan ‘sÃĶtte dig i billedet’ pÃĨ en mÃĨde, der ser bedre ud end en Photoshop-klip-og-lim, samtidig med at den fastholder den forblÃļffende funktionalitet af de officielle checkpoints.

First published 6th september 2022.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]