Andersons vinkel
Tre utmaningar framfÃķr Stable Diffusion

SlÃĪppandet av stability.ai:s Stable Diffusion latent diffusion bildsynthesmodell fÃķr ett par veckor sedan kan vara en av de mest betydande tekniska avslÃķjandena sedan DeCSS 1999; det ÃĪr definitivt den stÃķrsta hÃĪndelsen inom AI-genererad bild sedan 2017 deepfakes-kod kopierades till GitHub och grenades till vad som skulle bli DeepFaceLab och FaceSwap, samt realtidsstrÃķmmande deepfake-mjukvara DeepFaceLive.
Med ett slag fÃķrsvann anvÃĪndarirritation Ãķver innehÃĨllsbegrÃĪnsningar i DALL-E 2:s bildsynthes-API, eftersom det visade sig att Stable Diffusions NSFW-filter kunde inaktiveras genom att ÃĪndra en endaste kodrad. Pornocentrerade Stable Diffusion-Reddit-grupper uppstod nÃĪstan omedelbart, och avskaffades lika snabbt, medan utvecklare och anvÃĪndare delade upp sig i Discord i officiella och NSFW-samhÃĪllen, och Twitter bÃķrjade fyllas med fantastiska Stable Diffusion-skapelser.
FÃķr tillfÃĪllet verkar varje dag bringa nÃĨgon otrolig innovation frÃĨn utvecklare som har antagit systemet, med tillÃĪgg och tredjeparts-tillÃĪgg som hastigt skrivs fÃķr Krita, Photoshop, Cinema4D, Blender och mÃĨnga andra applikationsplattformar.
Under tiden har promptcraft â den nu professionella konsten att âviska till AIâ, som kan bli den kortaste karriÃĪrvalmÃķjligheten sedan âFilofax-bindareâ â redan bÃķrjat kommersialiseras, medan tidig monetisering av Stable Diffusion sker pÃĨ Patreon-nivÃĨ, med sÃĪkerhet fÃķr mer avancerade erbjudanden som kommer, fÃķr de som inte vill navigera Conda-baserade installationer av kÃĪllkoden, eller de proskriptiva NSFW-filtrarna i webbaserade implementationer.
Utvecklingstakten och den fria kÃĪnslan av utforskning frÃĨn anvÃĪndare sker i sÃĨdan snabb takt att det ÃĪr svÃĨrt att se lÃĨngt framÃĨt. I princip vet vi inte riktigt vad vi har att gÃķra med ÃĪnnu, eller vad alla begrÃĪnsningar eller mÃķjligheter kan vara.
ÃndÃĨ, lÃĨt oss ta en titt pÃĨ tre av vad som kan vara de mest intressanta och utmanande hinder fÃķr den snabbt bildade och snabbt vÃĪxande Stable Diffusion-gemenskapen att mÃķta och, hoppas vi, Ãķvervinna.
1: Optimering av tile-baserade rÃķrledningar
NÃĪr de presenteras med begrÃĪnsade hÃĨrdvaruresurser och hÃĨrda grÃĪnser fÃķr upplÃķsningen av trÃĪningsbilder, verkar det troligt att utvecklare kommer att hitta lÃķsningar fÃķr att fÃķrbÃĪttra bÃĨde kvaliteten och upplÃķsningen av Stable Diffusions utdata. MÃĨnga av dessa projekt kommer att involvera att utnyttja begrÃĪnsningarna i systemet, som dess ursprungliga upplÃķsning pÃĨ endast 512Ã512 pixlar.
Som alltid ÃĪr fallet med datorseende och bildsynthes-initiativ, trÃĪnades Stable Diffusion pÃĨ kvadratiska fÃķrhÃĨllanden, i detta fall omproverade till 512Ã512, sÃĨ att kÃĪllbilderna kunde regulariseras och anpassas till begrÃĪnsningarna i GPU:erna som trÃĪnade modellen.
DÃĪrfÃķr âtÃĪnkerâ (om den tÃĪnker alls) Stable Diffusion i 512Ã512-termer, och definitivt i kvadratiska termer. MÃĨnga anvÃĪndare som fÃķr nÃĪrvarande provar grÃĪnserna fÃķr systemet rapporterar att Stable Diffusion producerar de mest tillfÃķrlitliga och minst glittriga resultaten vid denna ganska begrÃĪnsade aspektfÃķrhÃĨllande (se âadressering av extremiteterâ nedan).
Ãven om olika implementationer har uppskalning via RealESRGAN (och kan fixa dÃĨligt renderade ansikten via GFPGAN) utvecklar flera anvÃĪndare metoder fÃķr att dela upp bilder i 512x512px-sektioner och sy ihop bilderna fÃķr att bilda stÃķrre sammansatta verk.

Denna 1024Ã576-rendering, en upplÃķsning som vanligtvis ÃĪr omÃķjlig i en enda Stable Diffusion-rendering, skapades genom att kopiera och klistra in attention.py Python-filen frÃĨn DoggettX-grenen av Stable Diffusion (en version som implementerar tile-baserad uppskalning) till en annan gren. KÃĪlla: https://old.reddit.com/r/StableDiffusion/comments/x6yeam/1024x576_with_6gb_nice/
Ãven om vissa initiativ av detta slag anvÃĪnder ursprunglig kod eller andra bibliotek, kommer txt2imghd-porten av GOBIG (en lÃĪge i VRAM-hungriga ProgRockDiffusion) att tillhandahÃĨlla denna funktion till huvudgrenen snart. Medan txt2imghd ÃĪr en dedikerad port av GOBIG, involverar andra anstrÃĪngningar frÃĨn community-utvecklare olika implementationer av GOBIG.

En bekvÃĪmt abstrakt bild i den ursprungliga 512x512px-renderingen (vÃĪnster och andra frÃĨn vÃĪnster); uppskalad med ESGRAN, som nu ÃĪr mer eller mindre infÃķrd i alla Stable Diffusion-distributioner; och gavs âsÃĪrskild uppmÃĪrksamhetâ via en implementation av GOBIG, som producerar detaljer som, ÃĨtminstone inom ramen fÃķr bildsektionen, verkar bÃĪttre uppskalade. KÃĪlla: https://old.reddit.com/r/StableDiffusion/comments/x72460/stable_diffusion_gobig_txt2imghd_easy_mode_colab/
Denna typ av abstrakt exempel som visas ovan har mÃĨnga âlilla kungarikenâ av detaljer som passar denna solipsistiska tillvÃĪgagÃĨngssÃĪtt fÃķr uppskalning, men som kan krÃĪva mer utmanande koddrivna lÃķsningar fÃķr att producera icke-repetitiv, sammanhÃĪngande uppskalning som inte ser ut som om den satts samman frÃĨn mÃĨnga delar. Inte minst i fallet med mÃĪnskliga ansikten, dÃĪr vi ÃĪr ovanligt kÃĪnsliga fÃķr avvikelser eller âstÃķrandeâ artefakter. DÃĪrfÃķr kan ansikten sÃĨ smÃĨningom behÃķva en dedikerad lÃķsning.
Stable Diffusion har fÃķr nÃĪrvarande inget mekanism fÃķr att fokusera uppmÃĪrksamhet pÃĨ ansiktet under en rendering pÃĨ samma sÃĪtt som mÃĪnniskor prioriterar ansiktsinformation. Ãven om vissa utvecklare i Discord-samhÃĪllena ÃķvervÃĪger metoder fÃķr att implementera denna typ av âfÃķrbÃĪttrad uppmÃĪrksamhetâ, ÃĪr det fÃķr nÃĪrvarande mycket enklare att manuellt (och, sÃĨ smÃĨningom, automatiskt) fÃķrbÃĪttra ansiktet efter att den ursprungliga renderingen har ÃĪgt rum.
Ett mÃĪnskligt ansikte har en inre och fullstÃĪndig semantisk logik som inte kommer att hittas i en âtileâ av bottenhÃķrnet av (till exempel) en byggnad, och dÃĪrfÃķr ÃĪr det fÃķr nÃĪrvarande mÃķjligt att mycket effektivt âzooma inâ och ÃĨterge ett âskissartatâ ansikte i Stable Diffusions utdata.

VÃĪnster, Stable Diffusions ursprungliga fÃķrsÃķk med prompten âFull-length fÃĪrgfoto av Christina Hendricks som gÃĨr in i en trÃĨng plats, bÃĪr en regnrock; Canon50, Ãķgonkontakt, hÃķg detalj, hÃķg ansiktsdetaljâ. HÃķger, ett fÃķrbÃĪttrat ansikte som erhÃĨllits genom att mata in det suddiga och skissartade ansiktet frÃĨn den fÃķrsta renderingen tillbaka till Stable Diffusions fulla uppmÃĪrksamhet med hjÃĪlp av Img2Img (se animerade bilder nedan).
I avsaknad av en dedikerad Textual Inversion-lÃķsning (se nedan), kommer detta endast att fungera fÃķr kÃĪndisbilder dÃĪr personen i frÃĨga redan ÃĪr vÃĪl representerad i LAION-databasen som trÃĪnade Stable Diffusion. DÃĪrfÃķr kommer det att fungera pÃĨ personer som Tom Cruise, Brad Pitt, Jennifer Lawrence och en begrÃĪnsad mÃĪngd riktiga mediepersonligheter som finns i stora mÃĪngder av bilder i kÃĪlldata.

Genererar ett trovÃĪrdigt pressfoto med prompten âFull-length fÃĪrgfoto av Christina Hendricks som gÃĨr in i en trÃĨng plats, bÃĪr en regnrock; Canon50, Ãķgonkontakt, hÃķg detalj, hÃķg ansiktsdetaljâ.
FÃķr kÃĪndisar med lÃĨnga och bestÃĨende karriÃĪrer, kommer Stable Diffusion vanligtvis att generera en bild av personen vid en senare (dvs. ÃĪldre) ÃĨlder, och det kommer att vara nÃķdvÃĪndigt att lÃĪgga till prompt-tillÃĪgg som âungâ eller âunder ÃĨret [Ã R]â fÃķr att producera yngre utseende bilder.

Med en framtrÃĪdande, vÃĪl fotograferad och konsekvent karriÃĪr som strÃĪcker sig nÃĪstan 40 ÃĨr, ÃĪr skÃĨdespelerskan Jennifer Connelly en av de fÃĨ kÃĪndisar i LAION som tillÃĨter Stable Diffusion att representera ett urval av ÃĨldrar. KÃĪlla: prepack Stable Diffusion, lokal, v1.4 checkpoint; ÃĨldersrelaterade promptrar.
Detta beror till stor del pÃĨ spridningen av digital (snarare ÃĪn dyra, emulsionsbaserade) pressfotografering frÃĨn mitten av 2000-talet, och den senare tillvÃĪxten i volymen av bildutdata pÃĨ grund av Ãķkade bredbandshastigheter.

Den renderade bilden skickas vidare till Img2Img i Stable Diffusion, dÃĪr ett âfokusomrÃĨdeâ vÃĪljs, och en ny, maximalt stor rendering gÃķrs endast av det omrÃĨdet, vilket tillÃĨter Stable Diffusion att koncentrera alla tillgÃĪngliga resurser pÃĨ att ÃĨterskapa ansiktet.

Komponerar âhÃķg uppmÃĪrksamhetâ-ansiktet tillbaka till den ursprungliga renderingen. FÃķrutom ansikten, kommer denna process endast att fungera med entiteter som har en potentiell kÃĪnd, sammanhÃĪngande och integral utseende, sÃĨsom en del av den ursprungliga bilden som har ett distinkt fÃķremÃĨl, som en klocka eller en bil. Uppskalning av en sektion av â till exempel â en vÃĪgg kommer att leda till en mycket konstig utseende ÃĨtermonterad vÃĪgg, eftersom tile-renderingarna inte hade nÃĨgon bredare kontext fÃķr denna âpusselbitâ medan de renderades.
Vissa kÃĪndisar i databasen kommer âfÃķrfrusnaâ i tiden, antingen fÃķr att de dog tidigt (sÃĨsom Marilyn Monroe), eller steg upp till bara flyktig mainstream-popularitet, producerande en hÃķg volym av bilder under en begrÃĪnsad tid. AvlÃĪsning av Stable Diffusion ger troligen en sorts ânuvarandeâ popularitetsindex fÃķr moderna och ÃĪldre stjÃĪrnor. FÃķr vissa ÃĪldre och nuvarande kÃĪndisar, finns det inte tillrÃĪckligt med bilder i kÃĪlldata fÃķr att fÃĨ en mycket bra likhet, medan den bestÃĨende populariteten hos vissa lÃĨnglivade eller utdÃķda stjÃĪrnor sÃĪkerstÃĪller att deras rimliga likhet kan erhÃĨllas frÃĨn systemet.

Stable Diffusions renderingar avslÃķjar snabbt vilka kÃĪnda ansikten som ÃĪr vÃĪl representerade i trÃĪningsdata. Trots hennes enorma popularitet som en ÃĪldre tonÃĨring vid tidpunkten fÃķr skrivande, var Millie Bobby Brown yngre och mindre kÃĪnd nÃĪr LAION-kÃĪll-databaserna skrapades frÃĨn webben, vilket gÃķr det problematiskt att fÃĨ en hÃķgkvalitativ likhet med Stable Diffusion fÃķr tillfÃĪllet.
DÃĪr data ÃĪr tillgÃĪnglig, kan tile-baserade up-res-lÃķsningar i Stable Diffusion gÃĨ lÃĪngre ÃĪn att fokusera pÃĨ ansiktet: de kan potentiellt mÃķjliggÃķra ÃĪnnu mer exakta och detaljerade ansikten genom att bryta ner ansiktsdragen och vÃĪnda hela kraften av lokala GPU-resurser pÃĨ framtrÃĪdande funktioner individuellt, fÃķre ÃĨtermontering â en process som fÃķr nÃĪrvarande, igen, ÃĪr manuell.
Detta ÃĪr inte begrÃĪnsat till ansikten, men det ÃĪr begrÃĪnsat till delar av fÃķremÃĨl som ÃĪr minst lika fÃķrutsÃĪgbart placerade i den bredare kontexten av vÃĪrdobjektet, och som fÃķljer hÃķgnivÃĨ-inbÃĪddningar som man rimligen kan fÃķrvÃĪnta sig att hitta i en hyperskale-databas.
Den verkliga grÃĪnsen ÃĪr mÃĪngden tillgÃĪnglig referensdata i databasen, eftersom, till slut, djupt itererad detalj kommer att bli helt âhallucineradâ (dvs. fiktiv) och mindre autentisk.
SÃĨdana hÃķgnivÃĨ-granulÃĪra fÃķrstoringar fungerar i fallet med Jennifer Connelly, eftersom hon ÃĪr vÃĪl representerad Ãķver ett urval av ÃĨldrar i LAION-aesthetics (den primÃĪra undermÃĪngden av LAION 5B som Stable Diffusion anvÃĪnder), och generellt Ãķver LAION; i mÃĨnga andra fall skulle exaktheten lida av brist pÃĨ data, vilket skulle krÃĪva antingen finjustering (ytterligare utbildning, se âAnpassningâ nedan) eller Textual Inversion (se nedan).
Tiles ÃĪr ett kraftfullt och relativt billigt sÃĪtt fÃķr Stable Diffusion att kunna producera hÃķgupplÃķsta utdata, men algoritmisk tile-uppskalning av detta slag, om den saknar nÃĨgon form av bredare, hÃķgre nivÃĨ-uppmÃĪrksamhetsmekanism, kan komma att understiga de fÃķrvÃĪntade standarderna Ãķver ett urval av innehÃĨllstyper.
2: Att hantera problem med mÃĪnskliga lemmar
Stable Diffusion lever inte upp till sitt namn nÃĪr det gÃĪller att avbilda komplexiteten hos mÃĪnskliga extremiteter. HÃĪnder kan multipliceras slumpmÃĪssigt, fingrar koalescerar, en tredje ben dyker upp ofÃķrklarligt, och existerande lemmar fÃķrsvinner spÃĨrlÃķst. I sin fÃķrsvar, delar Stable Diffusion problemet med sina stabila medlemmar, och mestadels med DALL-E 2.

Oredigerade resultat frÃĨn DALL-E 2 och Stable Diffusion (1.4) i slutet av augusti 2022, bÃĨda visar problem med lemmar. Prompt ÃĪr âEn kvinna omfamnar en manâ
Stable Diffusion-entusiaster som hoppas att den kommande 1.5-checkpointen (en mer intensivt trÃĪnad version av modellen, med fÃķrbÃĪttrade parametrar) skulle lÃķsa lemm-konfusionen kommer troligen att bli besvikna. Den nya modellen, som kommer att slÃĪppas om ungefÃĪr tvÃĨ veckor, visas fÃķr nÃĪrvarande pÃĨ den kommersiella stability.ai-portalen DreamStudio, dÃĪr anvÃĪndare kan jÃĪmfÃķra den nya utdatan med renderingar frÃĨn deras lokala eller andra 1.4-system:

KÃĪlla: Lokal 1.4 prepack och https://beta.dreamstudio.ai/

KÃĪlla: Lokal 1.4 prepack och https://beta.dreamstudio.ai/

KÃĪlla: Lokal 1.4 prepack och https://beta.dreamstudio.ai/
Som ofta ÃĪr fallet, kan datakvalitet vara den primÃĪra bidragande orsaken.
De Ãķppna kÃĪll-databaserna som brÃĪnslar bildsynthes-system som Stable Diffusion och DALL-E 2 kan tillhandahÃĨlla mÃĨnga etiketter fÃķr bÃĨde enskilda mÃĪnniskor och inter-mÃĪnsklig handling. Dessa etiketter trÃĪnas in symbiotiskt med deras associerade bilder, eller segment av bilder.

Stable Diffusion-anvÃĪndare kan utforska koncepten som trÃĪnats in i modellen genom att frÃĨga LAION-aesthetics-databasen, en undermÃĪngd av den stÃķrre LAION 5B-databasen, som driver systemet. Bilderna ÃĪr ordnade inte efter deras alfabetiska etiketter, utan efter deras âestetiska poÃĪngâ. KÃĪlla: https://rom1504.github.io/clip-retrieval/
En bra hierarki av individuella etiketter och klasser som bidrar till avbildningen av en mÃĪnsklig arm skulle vara nÃĨgot som kropp>arm>hand>fingrar>[underdelar + tumme]> [fingralsegment]>Fingernaglar.

GranulÃĪr semantisk segmentering av handens delar. Ãven denna ovanligt detaljerade dekonstruktion lÃĪmnar varje âfingerâ som en ensam enhet, utan att ta hÃĪnsyn till de tre sektionerna av en finger och de tvÃĨ sektionerna av en tumme. KÃĪlla: https://athitsos.utasites.cloud/publications/rezaei_petra2021.pdf
I verkligheten ÃĪr det osannolikt att kÃĪllbilderna ÃĪr sÃĨ konsekvent annoterade Ãķver hela databasen, och ostrukturerade etiketteringsalgoritmer kommer troligen att sluta vid den hÃķgre nivÃĨn â till exempel âhandâ, och lÃĪmna de inre pixlarna (som tekniskt sett innehÃĨller âfingerâ-information) som en oetiketterad massa pixlar, frÃĨn vilka funktioner kommer att arbitrÃĪrt hÃĪrledas, och som kan manifestera sig i senare renderingar som en stÃķrande faktor.

Hur det borde vara (Ãķvre hÃķger, om inte Ãķvre skuren), och hur det tenderar att vara (nedre hÃķger), pÃĨ grund av begrÃĪnsade resurser fÃķr etikettering, eller arkitektonisk exploatering av sÃĨdana etiketter om de finns i databasen.
SÃĨledes, om en latent diffusionsmodell kommer sÃĨ lÃĨngt som att rendera en arm, kommer den nÃĪstan sÃĪkert att fÃķrsÃķka rendera en hand i slutet av den armen, eftersom arm>hand ÃĪr den minimala krÃĪvda hierarkin, ganska hÃķgt upp i vad arkitekturen vet om âmÃĪnsklig anatomiâ.
Efter det kan âfingrarâ vara den minsta grupperingen, ÃĪven om det finns 14 ytterligare finger/tumme-underdelar att ÃķvervÃĪga nÃĪr man avbildar mÃĪnskliga hÃĪnder.
Om denna teori hÃĨller, finns det ingen verklig lÃķsning, pÃĨ grund av den sektoriella bristen pÃĨ budget fÃķr manuell etikettering, och bristen pÃĨ tillrÃĪckligt effektiva algoritmer som kunde automatisera etikettering medan de producerar lÃĨga felrater. I effekt, kan modellen fÃķr nÃĪrvarande fÃķrlita sig pÃĨ mÃĪnsklig anatomisk konsekvens fÃķr att tÃĪcka Ãķver bristerna i databasen den trÃĪnades pÃĨ.
En mÃķjlig anledning till att den inte kan fÃķrlita sig pÃĨ detta, nyligen fÃķreslagen pÃĨ Stable Diffusion Discord, ÃĪr att modellen kan bli fÃķrvirrad Ãķver det korrekta antalet fingrar en (realistisk) mÃĪnsklig hand bÃķr ha, eftersom LAION-derivatdatabasen som driver den innehÃĨller tecknade figurer som kan ha fÃĪrre fingrar (vilket i sig ÃĪr en arbetsbesparande genvÃĪg).

TvÃĨ av de potentiella bovarna i âsaknad fingerâ-syndromet i Stable Diffusion och liknande modeller. Nedan, exempel pÃĨ tecknade hÃĪnder frÃĨn LAION-aesthetics-databasen som driver Stable Diffusion. KÃĪlla: https://www.youtube.com/watch?v=0QZFQ3gbd6I
Om detta ÃĪr sant, dÃĨ ÃĪr den enda uppenbara lÃķsningen att omtrÃĪna modellen, med undantag fÃķr icke-realistiskt mÃĪnskligt innehÃĨll, fÃķr att sÃĪkerstÃĪlla att ÃĪkta fall av utelÃĪmnande (dvs. amputerade personer) ÃĪr lÃĪmpligt etiketterade som undantag. FrÃĨn ett datakureringssynpunkt, skulle detta vara en ganska stor utmaning, sÃĪrskilt fÃķr resurs-svaga community-insatser.
Den andra tillvÃĪgagÃĨngssÃĪttet vore att tillÃĪmpa filter som utesluter sÃĨdant innehÃĨll (t.ex. âhand med tre/fem fingrarâ) frÃĨn att manifestera sig vid render-tid, pÃĨ samma sÃĪtt som OpenAI har, till viss del, filtrerat GPT-3 och DALL-E 2, sÃĨ att deras utdata kunde regleras utan att behÃķva omtrÃĪna kÃĪllmodellerna.

FÃķr Stable Diffusion, kan den semantiska distinktionen mellan fingrar och till och med lemmar bli fruktansvÃĪrt suddig, och pÃĨminner om 1980-talets âbody horrorâ-strÃĪng av skrÃĪckfilmer frÃĨn liknande David Cronenberg. KÃĪlla: https://old.reddit.com/r/StableDiffusion/comments/x6htf6/a_study_of_stable_diffusions_strange_relationship/
Det kan hÃĪvdas att det finns tvÃĨ ÃĨterstÃĨende vÃĪgar framÃĨt: att kasta mer data pÃĨ problemet, och att tillÃĪmpa tredjeparts-tolkande system som kan ingripa nÃĪr fysiska fel av den typ som beskrivs hÃĪr presenteras fÃķr slutanvÃĪndaren (ÃĨtminstone skulle den senare ge OpenAI en metod fÃķr att tillhandahÃĨlla ÃĨterbetalningar fÃķr âbody horrorâ-renderingar, om fÃķretaget var motiverat att gÃķra sÃĨ).
3: Anpassning
En av de mest spÃĪnnande mÃķjligheterna fÃķr framtiden fÃķr Stable Diffusion ÃĪr utsikten till att anvÃĪndare eller organisationer utvecklar reviderade system; modifieringar som tillÃĨter innehÃĨll utanfÃķr den fÃķrtrÃĪnade LAION-sfÃĪren att integreras i systemet â idealiskt utan den ohanterliga kostnaden fÃķr att trÃĪna hela modellen igen, eller risken som ÃĪr involverad nÃĪr man trÃĪnar en stor mÃĪngd nytt innehÃĨll till en befintlig, mogen och kapabel modell.
Genom analogi: om tvÃĨ mindre begÃĨvade studenter ansluter sig till en avancerad klass pÃĨ trettio studenter, kommer de antingen att assimileras och komma ikapp, eller misslyckas som utbrytare; i bÃĨda fallen kommer klassens genomsnittliga prestation troligen inte att pÃĨverkas. Om femton mindre begÃĨvade studenter ansluter sig, kommer dock klassens betygs kurva att troligen lida.
PÃĨ samma sÃĪtt kan den synergistiska och ganska ÃķmtÃĨliga nÃĪtverken av relationer som byggs upp under lÃĨngvarig och kostsam modelltrÃĪning komprometteras, i vissa fall effektivt fÃķrstÃķras, av alltfÃķr mycket ny data, vilket sÃĪnker modellens utdatakvalitet Ãķver hela linjen.
Fallet fÃķr att gÃķra detta ÃĪr primÃĪrt dÃĪr ditt intresse ligger i att helt kidnappa modellens konceptuella fÃķrstÃĨelse av relationer och saker, och anpassa den fÃķr exklusiv produktion av innehÃĨll som liknar det tillÃĪggsmaterial som du lade till.
SÃĨledes, att trÃĪna 500 000 Simpsons-rutor i en befintlig Stable Diffusion-checkpoint ÃĪr troligen, sÃĨ smÃĨningom, att fÃĨ en bÃĪttre Simpsons-simulator ÃĪn den ursprungliga byggnaden kunde ha erbjudit, under fÃķrutsÃĪttning att tillrÃĪckligt mÃĨnga breda semantiska relationer Ãķverlever processen (t.ex. Homer Simpson ÃĪter en hotdog, som kan krÃĪva material om hotdogs som inte fanns i ditt tillÃĪggsmaterial, men som redan fanns i checkpointen), och under fÃķrutsÃĪttning att du inte plÃķtsligt vill vÃĪxla frÃĨn Simpsons-innehÃĨll till att skapa fabulous landscape by Greg Rutkowski â eftersom din post-trÃĪnade modell har fÃĨtt sin uppmÃĪrksamhet massivt avled, och inte kommer att vara lika bra pÃĨ att gÃķra den typen av sak som den anvÃĪnde att vara.
En anmÃĪrkningsvÃĪrd exempel pÃĨ detta ÃĪr waifu-diffusion, som har lyckats post-trÃĪna 56 000 anime-bilder i en fÃĪrdigtrÃĪnad och trÃĪnad Stable Diffusion-checkpoint. Det ÃĪr ett tufft perspektiv fÃķr en hobbyist, eftersom modellen krÃĪver en Ãķgonblicksbild pÃĨ minst 30 GB VRAM, lÃĨngt bortom vad som troligen kommer att finnas tillgÃĪngligt pÃĨ konsumentnivÃĨn i Nvidias kommande 40XX-serieutgÃĨvor.

TrÃĪning av anpassat innehÃĨll i Stable Diffusion via waifu-diffusion: modellen tog tvÃĨ veckor av post-trÃĪning fÃķr att producera den hÃĪr nivÃĨn av illustration. De sex bilderna till vÃĪnster visar modellens framsteg, allteftersom trÃĪningen fortskred, i att skapa ÃĪmneskoherent utdata baserat pÃĨ de nya trÃĪningsdata. KÃĪlla: https://gigazine.net/gsc_news/en/20220121-how-waifu-labs-create/
En stor mÃĪngd anstrÃĪngning kan lÃĪggas pÃĨ sÃĨdana âgrenarâ av Stable Diffusion-checkpoints, endast fÃķr att bli hÃĪmmad av teknisk skuld. Utvecklare pÃĨ den officiella Discord-kanalen har redan indikerat att senare checkpoint-utgÃĨvor inte nÃķdvÃĪndigtvis kommer att vara bakÃĨtkompatibla, ÃĪven med prompt-logik som kan ha fungerat med en tidigare version, eftersom deras primÃĪra intresse ÃĪr att fÃĨ den bÃĪsta modellen mÃķjlig, snarare ÃĪn att stÃķdja ÃĪldre applikationer och processer.
DÃĪrfÃķr, om en fÃķretag eller person bestÃĪmmer sig fÃķr att grenra en checkpoint till en kommersiell produkt, har de i princip ingen ÃĨtervÃĪndo; deras version av modellen ÃĪr, vid den punkten, en âhard forkâ, och kommer inte att kunna dra nytta av uppstrÃķmsfÃķrdelar frÃĨn senare utgÃĨvor frÃĨn stability.ai â vilket ÃĪr ganska ett ÃĨtagande.
Den nuvarande, och stÃķrre, hoppet fÃķr anpassning av Stable Diffusion ÃĪr Textual Inversion, dÃĪr anvÃĪndaren trÃĪnar in ett litet antal CLIP-justerade bilder.

Ett samarbete mellan Tel Aviv University och NVIDIA, textual inversion tillÃĨter trÃĪnandet av diskreta och nya entiteter, utan att fÃķrstÃķra fÃķrmÃĨgan hos kÃĪllmodellen. KÃĪlla: https://textual-inversion.github.io/
Den primÃĪra uppenbara begrÃĪnsningen av textual inversion ÃĪr att ett mycket lÃĨgt antal bilder rekommenderas â sÃĨ fÃĨ som fem. Detta producerar i princip en begrÃĪnsad entitet som kan vara mer anvÃĪndbar fÃķr stilÃķverfÃķringsuppgifter snarare ÃĪn infÃķrandet av fotorealistiska fÃķremÃĨl.
Trots detta pÃĨgÃĨr experiment inom de olika Stable Diffusion Discords som anvÃĪnder ett mycket stÃķrre antal trÃĪningsbilder, och det ÃĨterstÃĨr att se hur produktiv metoden kan visa sig vara. Ã terigen krÃĪver tekniken en stor mÃĪngd VRAM, tid och tÃĨlamod.
PÃĨ grund av dessa begrÃĪnsande faktorer, kan vi behÃķva vÃĪnta en stund fÃķr att se nÃĨgra av de mer avancerade textual inversion-experimenten frÃĨn Stable Diffusion-entusiaster â och om detta tillvÃĪgagÃĨngssÃĪtt kan âsÃĪtta dig i bildenâ pÃĨ ett sÃĪtt som ser bÃĪttre ut ÃĪn en Photoshop-klipp och klistra, samtidigt som den behÃĨller den fÃķrbluffande funktionaliteten hos de officiella checkpointerna.
Â
Publicerad fÃķrsta gÃĨngen den 6 september 2022.













