Andersonin kulma
Miten Stable Diffusion Voisi Kehittyä Kuluttajatuotteeksi

Ironisesti, Stable Diffusion, uusi tekoälykuvansynteesirunko, joka on hurmannut maailman, ei olekaan vakaa eikä juuri “diffuusi” – ainakaan toistaiseksi.
Stable Diffusionin kokonaisvaltaiset ominaisuudet ovat jakautuneet muutaman kehittäjän jatkuvasti muuttuvien tarjontojen joukossa, joissa vaihdetaan viimeisintä tietoa ja teorioita erilaisissa keskustelufoorumeissa – ja suurimman osan näiden pakettien asennusohjeista on hyvin kaukana “plug and play” -ominaisuudesta.
Niiden sijaan ne vaativat usein komentorivin tai BAT-ohjelmointirajapinnan kautta asennusta GIT: n, Condan, Pythonin, Minicondan ja muiden kehitysrajoitteiden kautta – ohjelmistopaketteja, jotka ovat hyvin harvinaisia keskivertokuluttajien joukossa, ja joiden asennus on usein merkittynä vastuuvyöhykkeellä, joka on kompromittinut isäntäjärjestelmän.

Vain pieni osa vaiheista, jotka Stable Diffusionin vakaa asennus edellyttää. Monet jakelut vaativat myös tiettyjä Pythonin versioita, jotka voivat ristiriidassa olemassa olevien versioiden kanssa, jotka on asennettu käyttäjän laitteeseen – vaikka tämä voidaan välttää Docker-pohjaisilla asennuksilla ja tietynlaisten Conda-ympäristöjen avulla.
Viestiketjut sekä SFW- että NSFW Stable Diffusion -yhteisöissä ovat tulvassa vinkkejä ja temppuja, jotka liittyvät Python-skriptien hakkerointiin ja vakaiden asennusten parantamiseen, jotta voidaan parantaa toimivuutta tai ratkaista yleisiä riippuvuusvirheitä ja muita ongelmia.
Tämä jättää keskivertokuluttajan, joka on kiinnostunut luomaan upeita kuvia tekstipromptien avulla, melkein kokonaan rahoitettujen API-verkkorajapintojen armoille, joista suurin osa tarjoaa vain vähäisen määrän ilmaisia kuvien luontia ennen kuin niitä on ostettava.
Lisäksi lähes kaikki nämä verkkopohjaiset tarjontaa kieltäytyvät tuottamasta NSFW-sisältöä (joka voi liittyä ei-pornografisiin aiheisiin, kuten “sota”), joka erottaa Stable Diffusionin OpenAI:n DALL-E 2:n sensuroitujen palvelujen joukosta.
Photoshop Stable Diffusionille
Maailma odottaa kiinnostuneena Stable Diffusionin upeita, rohkeita tai ulottuvuuksellisia kuvia, jotka täyttävät päivittäin Twitterin #stablediffusion-merkinnän. Mitä laajempi maailma odottaa, on ‘Photoshop Stable Diffusionille’ – monialustainen asennettava sovellus, joka sisältää Stability.ai:n arkkitehtuurin parhaimmat ja voimakkaimmat ominaisuudet sekä kehittyvän SD-kehitysyhteisön älykkäät innovaatiot, ilman kelluvia komentorivin ikkunoita, epäselviä ja jatkuvasti muuttuvia asennus- ja päivitysruutuja tai puuttuvia ominaisuuksia.
Mitä meillä on tällä hetkellä, useimmissa kyvykkäimmistä asennuksista, on erilainen verkkosivu, joka on yhdistetty irtautuneeseen komentorivin ikkunaan, ja jonka URL-osoite on localhostin portti:

Kuten CLI-ohjattavissa synteesisovelluksissa, kuten FaceSwap ja BAT-pohjaisessa DeepFaceLabissa, Stable Diffusionin ‘prepack’ -asennus näyttää komentorivin juuret, ja käyttöliittymä on saatavilla localhostin portin kautta (ks. yllä oleva kuva), joka kommunikoi CLI-pohjaisen Stable Diffusion -toiminnallisuuden kanssa.
Epäilemättä tulee olemaan sujuvampi sovellus. Jo on useita Patreon-pohjaisia integroituja sovelluksia, jotka voidaan ladata, kuten GRisk ja NMKD (ks. alla oleva kuva) – mutta mikään niistä ei ole vielä integroinut koko valikoiman ominaisuuksia, joita joitakin edistyneempiä ja vähemmän saatavilla olevia Stable Diffusion -toteutuksia voidaan tarjota.

Aikaiset, Patreon-pohjaiset Stable Diffusion -paketit, kevyesti ‘sovelluksellistettu’. NMKD on ensimmäinen, joka integroi CLI-tulosteen suoraan GUI: hen.
Tutustumme siihen, miltä tällainen hiotun ja integroidun Stable Diffusion -toteutuksen pitäisi lopulta näyttää – ja minkälaisiin haasteisiin se saattaa joutua.
Oikeudelliset Huomioon Otettavat Seikat Täysin Rahoitetussa Kaupallisessa Stable Diffusion -Sovelluksessa
NSFW -Tekijä
Stable Diffusionin lähdekoodi on julkaistu erittäin myöntävällä lisenssillä, joka ei kiellä kaupallisia uudelleen toteutuksia ja johdannaisia, jotka perustuvat lähdekoodiin.
Lisäksi mainittujen Patreon-pohjaisien Stable Diffusion -rakennusten ja laajan sovellusliitännäisten määrän lisäksi, jotka kehitetään Figmaan, Kritaan, Photoshoopiin, GIMPiin ja Blenderiin (muiden joukossa), ei ole praktista syytä, miksi hyvin rahoitettu ohjelmistokehitystalo ei voisi kehittää paljon monipuolisempaa ja kykykkämpää Stable Diffusion -sovellusta. Markkinanäkökulmasta on joka syy uskoa, että useat tällaiset aloitteet ovat jo hyvin käynnissä.
Tässä kohdassa tällaiset pyrkimykset kohtaavat välittömästi dilemman siitä, sallivatko he, kuten useimmat Stable Diffusionin verkkorajapinnat, Stable Diffusionin alkuperäisen NSFW-suodattimen (koodin fragmentin) poistamisen.
‘Haudattu’ NSFW -Vaihtoehto
Vaikka Stability.ai:n avoimen lähdekoodin lisenssi Stable Diffusionille sisältää laajasti tulkittavissa olevan sovellusluettelon, johon se ei saa olla käytössä (jota voidaan tulkita sisältävän pornografisen sisällön ja deepfake -kuvia), ainoa tapa, jolla toimittaja voisi tehokkaasti estää tällaisen käytön, olisi kääntää NSFW-suodatin epäselvään suoritettavaan tiedostoon eikä Python-tiedostoon, tai muuten pakottaa tarkistussumman vertailun Python-tiedostoon tai DLL: ään, joka sisältää NSFW-ohjeen, jotta renderöintiä ei voi tehdä, jos käyttäjät muuttavat tämän asetuksen.
Tämä jättäisi sovelluksen ‘silmällä’ samalla tavalla, kuin DALL-E 2 on tällä hetkellä, vähentäen sen kaupallista vetovoimaa. Lisäksi, väistämättä, dekompiletut “väärennetty” versiot näistä komponenteista (joko alkuperäisistä Pythonin suoritusaikaisista elementeistä tai käännetyistä DLL-tiedostoista, kuten Topaz -linjan AI-kuvan parannustyökaluissa) tulisivat todennäköisesti esiin torrent / hakkeriyhteisössä, jotta nämä rajoitukset voidaan kiertää, yksinkertaisesti korvaamalla esteettömät elementit ja mitätöimällä kaikki tarkistussumman vaatimukset.
Lopulta toimittaja saattaa vain toistaa Stability.ai:n varoituksen väärinkäytöstä, joka on ominaista monille nykyisille Stable Diffusion -jakeluille.
Kuitenkin pienet avoimet lähdekoodin kehittäjät, jotka käyttävät tällaisia varoituksia, ovat paljon vähemmän alttiita tappioille verrattuna ohjelmistoyhtiöön, joka on investoinut merkittäviä määriä aikaa ja rahaa Stable Diffusionin tekemiseen täysin omistetuksi ja saataville – mikä kutsuu syvempää harkintaa.
Deepfake -Vastuu
Kuten aiemmin mainittiin, LAION-estetiikka -tietokanta, joka on osa 4,2 miljardia kuvaa, joihin Stable Diffusionin jatkuvat mallit on koulutettu, sisältää suuren määrän julkkisten kuvia, mikä mahdollistaa käyttäjille luoda tehokkaasti deepfake -kuvia, mukaan lukien deepfake -pornografiaa.

Aiheesta viimeisimmästä artikkelistani, neljä vaihetta Jennifer Connellyn urasta neljän vuosikymmenen ajan, johdettu Stable Diffusionista.
Tämä on erillinen ja kiistellympi asia kuin “abstraktin” pornografian tuottaminen (joka ei kuvaile “oikeita” ihmisiä, vaikka tällaiset kuvat johdetaan useista oikeista valokuvista koulutusmateriaalissa).
Koska yhä useammat Yhdysvaltain osavaltiot ja maat kehittävät tai ovat jo käyttöönottaneet lakeja deepfake -pornografian vastaisesti, Stable Diffusionin kyky luoda julkkisten pornografisia kuvia saattaa tarkoittaa, että kaupallinen sovellus, joka ei ole täysin sensuroitu (ts. joka voi tuottaa pornografista materiaalia), saattaa tarvita jollain tavoin suodattaa havaittuja julkkisten kasvoja.
Toinen tapa on tarjota sisäänrakennettu “musta lista” termejä, jotka eivät ole hyväksyttyjä käyttäjän ohjauksessa, liittyen julkkaiden nimiin ja fiktiivisiin hahmoihin, joita he voivat olla yhdistetty. Luultavasti tällaiset asetukset tarvitsisivat ottaa käyttöön useissa kielissä kuin vain englannissa, koska alkuperäinen data sisältää muita kieliä. Toinen lähestymistapa voisi olla sisällyttää julkkaiden tunnistusjärjestelmät, kuten Clarifai.
Ohjelmistotuottajien on ehkä tarpeen sisällyttää tällaisia menetelmiä, ehkä aluksi pois käytöstä, mikä auttaa estämään täysin itsenäisen Stable Diffusion -sovelluksen luomasta julkkaiden kasvoja, odotellessa uutta lainsäädäntöä, joka saattaa tehdä tämän toiminnallisuuden laittomaksi.
Uudelleen, kuitenkin, tällainen toiminnallisuus voisi väistämättä olla dekompileerattavissa ja käännetyissä kiinnostuneiden tahojen toimesta; kuitenkin ohjelmistotuottaja voisi, tässä tapauksessa, väittää, että tämä on tehokkaasti vastuuton vandalismi – niin kauan kuin tällaista kääntämistä ei tehdä liian helppoa.
Ominaisuudet, Joita Voisi Sisältää
Stable Diffusionin ydintoiminnallisuus kaikissa jakeluissaan olisi odotettavissa hyvin rahoitetusta kaupallisesta sovelluksesta. Nämä sisältävät kyvyn käyttää tekstipromptteja luomaan sopivia kuvia (teksti-kuvaksi); kyvyn käyttää luonnoksia tai muita kuvia ohjeina uusille luoduille kuville (kuva-kuvaksi); keinon säätää, kuinka “mielikuvituksellista” järjestelmää on ohjattu olemaan; tapa tasapainottaa renderöintiaikaa laadun kanssa; ja muita “perusominaisuuksia”, kuten valinnainen automaattinen kuvan/promptin arkistointi ja valinnainen päivittäinen skaalauksen kautta RealESRGAN: n avulla, ja vähintään perustavanlaatuinen “kasvojen korjaus” GFPGAN: n tai CodeFormer: n avulla.
Tämä on aika “perusasennus”. Tutustumme joitain edistyneemmistä ominaisuuksista, jotka parhaillaan kehitetään tai laajennetaan, jotka voisi sisällyttää täysimittaiseen “perinteiseen” Stable Diffusion -sovellukseen.
Stokastinen Jäädytys
Vaikka uudelleenkäytät siemenen aiemmasta onnistuneesta renderöinnistä, on hirvittävän vaikea saada Stable Diffusionin toistamaan tarkasti muodonmuutoksen, jos yksikin osa ohjauksesta tai alkuperäisestä kuvasta (tai molemmat) on muutettu seuraavassa renderöinnissä.
Tämä on ongelma, jos haluat käyttää EbSynthiä Stable Diffusionin muodonmuutosten asettamiseksi todelliseen videoon ajallisesti yhdenmukaisella tavalla – vaikka tämä tekniikka voi olla erittäin tehokas yksinkertaisissa pää-ja-olka -otoksissa:

Rajoitettu liike voi tehdä EbSynthistä tehokkaan välineen muuttaa Stable Diffusionin muodonmuutokset realistiseksi videoksi. Lähde: https://streamable.com/u0pgzd
EbSynth toimii extrapoloiden pienen valikoiman “muunneltuja” avainkehyksiä videoksi, joka on renderöity sarjaksi kuvatiedostoja (ja joka voidaan myöhemmin koota takaisin videoksi).

Tässä esimerkissä EbSynth -sivustolta on maalattu pieni määrä kehyksiä videosta taiteellisella tavalla. EbSynth käyttää näitä kehyksiä tyyliohjeina muokataksesi koko videon siten, että se vastaa maalattua tyyliä. Lähde: https://www.youtube.com/embed/eghGQtQhY38
Esimerkissä alla, jossa on lähes täysin liiketöntä (aidosta) vaaleatukkainen joogaa opettavaa naista vasemmalla, Stable Diffusionilla on edelleen vaikea ylläpitää johdonmukaista kasvoa, koska kolme muunneltavaa “avainkehystä” eivät ole täysin identtisiä, vaikka ne jakavat saman numeerisen siemenen.

Tässä, vaikka ohjaus ja siemen ovat samat kaikissa kolmessa muodonmuutoksessa, ja vain vähän muutoksia alkuperäisissä kehyksissä, lihasten koko ja muoto vaihtelevat, mutta ennen kaikkea kasvo on epäjohdonmukainen, joka haittaa ajallista yhdenmukaisuutta mahdollisessa EbSynth -renderöinnissä.
Vaikka SD / EbSynth -video alla on hyvin kekseliäs, jossa käyttäjän sormet muuttuvat (vastavuoroisesti) käveleväksi housuksi ja ankkuriksi, epäjohdonmukkuus housuissa edustaa ongelmaa, jota Stable Diffusionilla on ylläpitäessään johdonmukaisuutta eri avainkehyksissä, vaikka alkuperäiset kehykset ovat samanlaisia toisiinsa nähden ja siemen on johdonmukainen.

Miehen sormet muuttuvat käveleväksi mieheksi ja ankkuriksi EbSynthin kautta. Lähde: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/
Käyttäjä, joka loi tämän videon, kommentoi, että ankkurin muodonmuutos, joka on kiistatta tehokkaampi, vaati vain yhden muunnetun avainkehyksen, kun taas kävelevien housujen luominen edellytti 50 Stable Diffusion -kuvan renderöintiä, joissa on enemmän ajallista epäjohdonmukaisuutta. Käyttäjä huomautti myös, että se vaati viisi yritystä saavuttaa johdonmukaisuus kullekin 50 avainkehykselle.
Sen vuoksi olisi suuri etu todella kattavalle Stable Diffusion -sovellukselle tarjota toiminnallisuutta, joka säilyttää ominaisuuksia mahdollisimman hyvin avainkehyksissä.
Toinen mahdollisuus on, että sovellus sallii käyttäjän “jäädyttää” stokastisen koodauksen muodonmuutokselle, mikä voidaan tällä hetkellä saavuttaa vain muokkaamalla lähdekoodia manuaalisesti. Kuten alla oleva esimerkki osoittaa, tämä auttaa ajallista yhdenmukaisuutta, vaikka se ei ratkaise sitä täysin:

Yksi Reddit -käyttäjä muutti webcam -kuvaa eri kuuluisiin ihmisiin muuttamalla ei vain siementä (mitä mikä tahansa Stable Diffusionin toteutus voi tehdä), vaan varmistamalla, että stokastinen_koodaus() -parametri oli identtinen jokaisessa muodonmuutoksessa. Lähde: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/
Pilvipohjainen Tekstuaalinen Käännös
parempi ratkaisu saavuttamaan ajallisesti yhdenmukaiset hahmot ja objektit on “paistaa” ne tekstuaaliseen käännökseen – 5 KB:n tiedostoon, joka voidaan kouluttaa muutamassa tunnissa vain viidellä annotoidulla kuvalla, jota voidaan sitten kutsua erityisellä ‘*’ -ohjausmerkillä, mahdollistaen esimerkiksi uusien hahmojen ylläpitämisen kertomuksessa.

Kuvat, jotka liittyvät soveltuviin merkintöihin, voidaan muuttaa erillisiin entiteetteihin tekstuaalisen käännöksen kautta, ja kutsua ilman epäselvyyttä ja oikeassa asiayhteydessä ja tyylissä, erityisillä token -sanoilla. Lähde: https://huggingface.co/docs/diffusers/training/text_inversion
Texuaaliset käännökset ovat liitännäisiä tiedostoja hyvin suurelle ja täysin koulutetulle mallille, jonka Stable Diffusion käyttää, ja ne voidaan “liittää” kutsuvaan / ohjausprosessiin, jotta ne voivat osallistua mallin johdannaisiin kohtauksiin ja hyötyä mallin valtavasta tietopohjasta objekteista, tyyleistä, ympäristöistä ja vuorovaikutuksista.
Kuitenkin, vaikka tekstuaalinen käännös ei kestä kauan, se vaatii suuren määrän VRAM: ia; useiden nykyisten opaskirjojen mukaan, jonnekin 12, 20 ja jopa 40 GB: ään.
Koska useimmat satunnaiset käyttäjät eivät todennäköisesti ole kyseistä GPU -voimaa käytettävissään, pilvipalvelut ovat jo ilmestyneet, jotka käsittelevät toiminnon, mukaan lukien Hugging Facen versio. Vaikka on Google Colab -toteutukset, jotka voivat luoda tekstuaalisia käännöksiä Stable Diffusionille, vaadittu VRAM ja aikavaatimukset saattavat tehdä ne haasteellisiksi ilmaiseksi Colab -käyttäjille.
Täysin rahoitetun ja täysimittaisen Stable Diffusion -sovelluksen (asennetun) osalta on luonnollinen rahoitussuunnitelma siirtää tämä raskas tehtävä yrityksen pilvipalvelimille (olettaen, että Stable Diffusion -sovellus, joka on täynnä tällaista ei-ilmasta toiminnallisuutta, on todennäköisesti ilmestynyt useissa sovelluksissa, jotka tulevat ilmestymään tämän teknologian seuraavien 6-9 kuukauden aikana).
Lisäksi melko monimutkainen prosessi annotoiden ja muotoiltujen lähettämien kuvien ja tekstin automaatio voisi hyötyä automaatiosta integroidussa ympäristössä. Mahdollinen “riippuvuustekijä” luoda yksilöllisiä elementtejä, jotka voivat tutkia ja vuorovaikuttaa Stable Diffusionin laajoihin maailmoihin, näyttäisi potentiaalisesti pakolliselta sekä yleisille faneille että nuoremmille käyttäjille.
Joustava Ohjausmerkin Painotus
On olemassa useita nykyisiä toteutuksia, jotka sallivat käyttäjän antaa suuremman painoarvon pitkän teksti-ohjauksen osalle, mutta välineet vaihtelevat paljon näiden toteutusten välillä ja ovat usein kömpelöitä tai epäintuitiivisia.
Esimerkiksi erittäin suosittu Stable Diffusion -haara AUTOMATIC1111: ltä voidaan laskea tai korottaa ohjausmerkin arvo sulkemalla sen ympärille yksittäisiä sulkujaa (vähennys) tai neliäsulkeita (lisäpainotus).

Neliäsulkeet ja / tai sulkeet voivat muuttaa aamiaiseksi tällä Stable Diffusionin ohjausmerkin painotusversiossa, mutta se on kolesterolin painajainen kummallakin tavalla.
Muiden Stable Diffusionin toteutusten toteutuksissa käytetään huutomerkkejä korostamiseen, kun taas kaikkein joustavimmat sallivat käyttäjien määrittää painotukset kullekin sanalle ohjausmerkissä GUI: n kautta.
Järjestelmän pitäisi myös sallia negatiiviset ohjausmerkin painotukset – ei vain kauhu-faneille, vaan koska voi olla vähemmän häiritseviä ja enemmän opettavaisia mysteerejä Stable Diffusionin latenteissa tiloissa kuin mitä meidän rajoitettu kielenkäyttö voi kutsua.
Ulkoistus
Pian Stable Diffusionin sensaatiomaisen avoimen lähdekoodin jälkeen OpenAI yritti – suurelta osin turhaan – palauttaa osan DALL-E 2: n salamasta julkistamalla “ulkoistuksen”, joka sallii käyttäjän laajentaa kuvaa sen rajojen ulkopuolelle semanttisella logiikalla ja visuaalisella johdonmukaisuudella.
Luonnollisesti tämä on jo toteutettu eri muodoissa Stable Diffusionille, sekä Kritassa ja Kritan liitännäisessä, ja se pitäisi sisällyttää kattavaan, Photoshop-tyyliseen Stable Diffusion -versioon.

Laatutaulu voidaan laajentaa lähes äärettömästi, kunhan ohjaukset, olemassa oleva kuva ja semanttinen logiikka sallivat sen. Lähde: https://github.com/lkwq007/stablediffusion-infinity
Koska Stable Diffusion on koulutettu 512x512px: n kuvilla (ja useista muista syistä), se usein leikkaa ihmisten päät (tai muita olennaisia kehon osia) pois, vaikka ohjaus on selvästi osoittanut “pään korostusta” jne..

Tyypillisiä Stable Diffusionin “päätömistä”; mutta ulkoistus voisi palauttaa Georgeen kuvan.
Mikä tahansa ulkoistus toteutus, kuten yllä olevassa animaatiossa (joka perustuu yksinomaan Unix -kirjastoihin, mutta pitäisi olla kyettävä replikointiin Windowsilla), pitäisi olla työkaluksi “päätömiin” kuvien korjaamiseksi.
Tällä hetkellä useat käyttäjat laajentavat “päätömiin” kuvien kanvasyylä ylöspäin, täyttävät karkeasti pään alueen ja käyttävät img2img: ää viallisen renderöinnin täydentämiseksi.
Tehtävänmukainen Maskaus, Joka Ymmärtää Asiayhteyden
Maskaus voi olla hirvittävän epäonnistunut Stable Diffusionissa, riippuen haaran tai version mukaan. Usein, kun on mahdollista piirtää yhtenäinen maski, määritetty alue päätyy silti maalattuna sisällöllä, joka ei ota huomioon koko kuvan asiayhteyttä.
Eräänä kertana maskasin silmänvalkuaiset kasvokuvasta ja annoin ohjauksen ‘siniset silmät’ maskin täyttöönä – vain löytääkseni itseni katsomassa kahta ihmisen silmän leikkausta etäiseen kuvaan outomaailmasta. Arvaten, olin onnekas, että se ei ollut Frank Sinatra.
Semanttinen editointi on myös mahdollista tunnistamalla melun, joka rakensi kuvan alun perin, mikä mahdollistaa käyttäjälle osoittaa tiettyjä rakenteellisia elementtejä renderöinnissä ilman, että se häiritsee kuvan loput:

Muuttaminen yhtä elementtiä kuvassa ilman perinteistä maskausta ja ilman vaikuttamista lähellä olevaan sisältöön, tunnistamalla melun, joka loi kuvan alun perin, ja osoittamalla osia, jotka vaikuttivat kohdekenttään. Lähde: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/
Tämä menetelmä perustuu K-Diffusion -näytteeseen.
Semanttiset Suodattimet Fysiologisille Virheille
Kuten mainitsimme aiemmin, Stable Diffusion voi usein lisätä tai poistaa raajoja, suurelta osin johtuen tietojen ongelmista ja puutteista kuvien annotaatioissa, joilla se on koulutettu.

Kuten se lapsi, joka pisti kieltään ulos kouluryhmäkuvassa, Stable Diffusionin biologiset rikkomukset eivät aina ole heti ilmeisiä, ja sinun saattaa julkaista viimeisin AI -taide -mestaruutesi ennen kuin huomaat ylimääräiset kädet tai sulatut raajat.
On niin vaikea korjata nämä virheitä, että olisi hyödyllistä, jos täysimittainen Stable Diffusion -sovellus sisältäisi jonkinlaisen anatominen tunnistusjärjestelmän, joka käyttää semanttista segmentointia laskeakseen, sisältääkö tuleva kuva vakavia anatominen puutteita (kuten yllä olevassa kuvassa), ja hylkää sen uuden renderöinnin eduksi ennen sen esittämistä käyttäjälle.

Tietysti sinun saattaa haluta renderöidä jumalatar Kali, Tohtori Octopus tai jopa pelastaa vaikuttamattoman osan raajan vaivaamaa kuvaa, joten tämä ominaisuus pitäisi olla valinnainen kytkin.
Jos käyttäjät voisivat hyväksyä telemetrian, tällaiset virheet voisi välittää anonyymisti federatiivisen oppimisen kollektiivisessa ponnistelussa, joka voi auttaa tulevia malleja parantamaan ymmärrystään anatominen logiikasta.
LAION-Pohjainen Automaattinen Kasvojen Parannus
Kuten mainitsin aiemmassa katsauksessani kolmeen asiaan, joita Stable Diffusion voisi ratkaista tulevaisuudessa, ei pitäisi jättää yksin minkäänlaisen GFPGAN -version tehtäväksi “parantaa” renderöityjä kasvoja ensimmäisessä renderöinnissä.
GFPGANin “parannukset” ovat hirvittävän geneerisiä, usein heikentävät yksilön identiteettiä, jota kuvaillaan, ja toimivat yleensä vain kasvoilla, jotka ovat saaneet yhtä vähän prosessointiaikaa tai huomiota kuin mikä tahansa muu kuva.
Siksi ammattitason ohjelma Stable Diffusionille pitäisi pystyä tunnistamaan kasvoja (yleensä kevyellä kirjastolla, kuten YOLO: lla), soveltamaan saatavilla olevan GPU -voiman täysimääräisesti uudelleen renderöintiin ja joko sekoittaa parannetun kasvon alkuperäiseen täysimittaiseen renderöintiin tai tallentaa sen erikseen manuaaliseen uudelleen koostamiseen.
<img class="size-full wp-image-183853" src="https://www.unite.ai/wp-content/uploads/2022/09/Christina_Hendricks_Face_Improvement.gif" alt="Tapauksissa, joissa Stable Diffusion on koulutettu riittävällä määrällä kuvia julkkiksesta, on mahdollista kohdistaa koko GPU -kapasiteetin myöhemmän renderöinnin aikana ainoastaan renderöidyn kuvan kasvoihin, mikä on yleensä merkittävä parannus – ja toisin kuin GFPGAN, se perustuu LAION -koulutettuihin tietoihin eikä pelkästään renderöidyn kuvan pikseleihin.Tapauksissa, joissa Stable Diffusion on koulutettu riittävällä määrällä kuvia julkkiksesta, on mahdollista kohdistaa koko GPU -kapasiteetin myöhemmän renderöinnin aikana ainoastaan renderöidyn kuvan kasvoihin, mikä on yleensä merkittävä parannus – ja toisin kuin GFPGAN, se perustuu LAION -koulutettuihin tietoihin eikä pelkästään renderöidyn kuvan pikseleihin.Sovelluksen Sisäiset LAION -Haut
Koska käyttäjät alkoivat ymmärtää, että LAION -tietokannan hakeminen käsitteistä, ihmisistä ja teemoista voisi olla apu Stable Diffusionin paremman käytön, on luotu useita verkkopohjaisia LAION -selaimia, mukaan lukien haveibeentrained.com.

Haveibeentrained.com -hakutoiminto sallii käyttäjien tutkia kuvia, jotka voimittavat Stable Diffusionin, ja löytää, onko kohteita, ihmisiä tai ideoita, joita he haluavat kutsua järjestelmästä, todennäköisesti koulutettu siihen. Lähde: https://haveibeentrained.com/?search_text=bowl%20of%20fruit
Vaikka tällaiset verkkopohjaiset tietokannat usein paljastavat joitain merkintöjä, jotka liittyvät kuvien, generalisoinnin prosessi, joka tapahtuu mallin koulutuksen aikana, tekee siitä epätodennäköistä, että mikä tahansa kuva voidaan kutsua käyttämällä sen merkintää ohjausmerkkinä.
Lisäksi “stop -sanojen” poistaminen ja sanastoa lyhentävä ja lemmatisoiminen luonnollisen kielen prosessoinnissa tarkoittaa, että monet lauseet, jotka näkyvät, on jaettu tai poistettu ennen koulutusta Stable Diffusioniin.
Kuitenkin tapa, jolla esteettiset ryhmät sitoutuvat näissä käyttöliittymissä, voi opettaa loppukäyttäjälle paljon Stable Diffusionin logiikasta (tai “persoonallisuudesta”) ja olla apu paremman kuvan tuottamiseen.
Johtopäätös
On paljon muita ominaisuuksia, joita haluaisin nähdä täysimittaisessa paikallisessa Stable Diffusion -toteutuksessa, kuten CLIP-pohjainen kuvan analyysi, joka kääntää standardin Stable Diffusion -prosessin ja sallii käyttäjän kutsua lauseita ja sanoja, joita järjestelmä yhdistäisi luonnollisesti alkuperäiseen kuvaan tai renderöintiin.
Lisäksi todellinen tiilipohjainen skaalautuvuus olisi tervetullut lisäys, koska ESRGAN on melko tylsä väline. Onneksi suunnitelmat txt2imghd -toteutuksen integroimiseksi GOBIG: iin ovat nopeasti muuttamassa tätä todelliseksi kaikkien jakelujen osalla, ja se näyttää ilmeiseltä valinnalta pöytäkoneen iteroinnille.
Jotkut muut suositut pyynnöt Discord -yhteisöistä kiinnostavat minua vähemmän, kuten integroidut ohjausmerkki -sanastot ja sovellettavat luettelot taiteilijoista ja tyyleistä, vaikka sovelluksen sisäinen muistikirja tai mukautettava sanasto fraaseja näyttäisi loogiselta lisäykseltä.
Stable Diffusionin nykyiset rajoitukset ihmiskeskeisessä animaatiossa, vaikka CogVideo ja muut projektit ovat käynnistäneet sen, ovat edelleen erittäin alkuvaiheessa ja ovat ajan hermoja koskien aitoa ihmisen liikettä.
Stable Diffusion -video on tällä hetkellä tiukasti psykedeelinen, vaikka se saattaa olla paljon valoisampi lähitulevaisuudessa deepfake -nukkeena EbSynthin ja muiden suhteellisen uusien teksti-videoprojektien kautta (ja on arvollista mainita, että Runwayn viimeisimmässä mainosvideossa ei ole syntetisoituja tai “muunnettuja” ihmisiä).
Toinen arvokas toiminnallisuus olisi läpinäkyvä Photoshop -välilehti, joka on jo vakiintunut Cinema4D: n tekstuuri -editorissa, muissa samankaltaisissa toteutuksissa. Tällä voit helposti siirtää kuvia sovellusten välillä ja käyttää kunkin sovelluksen vahvuuksia.
Lopulta, ja ehkä tärkeimpänä, täysimittainen Stable Diffusion -ohjelma pitäisi pystyä vaihtamaan helposti eri versioihin (ts. malleja, jotka voimittavat järjestelmän) ja päivittämään mukautettuja tekstuaalisia käännöksiä, jotka toimivat aiemmin virallisten malliversioiden kanssa, mutta jotka saattavat olla rikkoontuneita myöhemmissä malliversioissa (kuten virallisen Discordin kehittäjät ovat maininneet, että se voi olla tapaus).
Ironisesti, organisaatio, joka on parhaiten asemoitunut luomaan tämän voimakkaan ja integroidun työkalujen joukon Stable Diffusionille, Adobe, on sitoutunut Content Authenticity Initiativeen niin voimakkaasti, että se saattaa näyttää taantumukselliselta PR -askarrukselta yritykselle – ellei se halua haitata Stable Diffusionin generatiivisia voimia yhtä perusteellisesti kuin OpenAI on tehnyt DALL-E 2: lle, ja asettaa sen sen sijaan luonnolliseksi kehityksenä sen huomattavista osuuksista valokuvauksessa.
Julkaistu ensimmäisen kerran 15. syyskuuta 2022.












