Andersonův úhel

Jak by se mohl Stable Diffusion vyvinout jako mainstreamový spotřebitelský produkt

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Ironicky, Stable Diffusion, nový rámec syntézy obrazů pomocí umělé inteligence, který zachvátil celý svět, není ani stabilní, ani skutečně „difúzní“ – alespoň zatím ne.

Plný rozsah schopností tohoto systému je rozložen napříč různou směsicí neustále se měnících nabídek od několika vývojářů, kteří si vyměňují nejnovější informace a teorie v různých diskusích na Discordu – a většina instalačních procedur pro balíčky, které vytvářejí nebo upravují, je velmi daleko od „plug and play“.

Spíše vyžadují instalaci přes příkazový řádek nebo soubory BAT prostřednictvím GIT, Conda, Python, Miniconda a dalších špičkových vývojových frameworků – softwarových balíčků, které jsou mezi běžnými spotřebiteli velmi vzácné, takže jejich instalace je často označena antivirovými a anti-malware programy jako důkaz kompromitovaného hostitelského systému.

Pouze malá část etap, které standardní instalace Stable Diffusion目前 vyžaduje. Mnoho distribucí také vyžaduje specifické verze Pythonu, které mohou být v konfliktu s již nainstalovanými verzemi na uživatelském počítači - ačkoli to lze obejít pomocí instalačních balíčků založených na Dockeru a do jisté míry pomocí prostředí Conda.

Pouze malá část etap, které standardní instalace Stable Diffusion目前 vyžaduje. Mnoho distribucí také vyžaduje specifické verze Pythonu, které mohou být v konfliktu s již nainstalovanými verzemi na uživatelském počítači – ačkoli to lze obejít pomocí instalačních balíčků založených na Dockeru a do jisté míry pomocí prostředí Conda.

Počet vláken v obou komunitách SFW a NSFW Stable Diffusion je zaplaven tipy a triky souvisejícími s hackováním skriptů Python a standardními instalačními procedurami, aby se umožnilo lepší funkčnost nebo aby se vyřešily časté chyby závislostí a další problémy.

To zanechává průměrného spotřebitele, který se zajímá o vytváření úžasných obrazů z textových podnětů, prakticky na milosti rostoucího počtu komerčních webových rozhraní API, z nichž většina nabízí minimální počet bezplatných generací obrazů před tím, než vyžaduje nákup tokenů.

Kromě toho téměř všechny tyto webové nabídky odmítají generovat NSFW obsah (který může souviset s nepornografickými tématy obecného zájmu, jako je „válka“), který odlišuje Stable Diffusion od cenzurovaných služeb OpenAI DALL-E 2.

‘Photoshop pro Stable Diffusion’

Širší svět se zjevně těší na ‘Photoshop pro Stable Diffusion’ – křížově platformní instalovatelnou aplikaci, která zahrnuje nejlepší a nejmocnější funkčnost architektury Stability.ai, jakož i různé geniální inovace vznikající komunity SD, bez plovoucích oken CLI, nezřetelných a neustále se měnících instalačních a aktualizačních procedur nebo chybějících funkcí.

Co目前 máme, je ve většině schopnějších instalací různě elegantní webová stránka s disembodied command-line oknem a jehož URL je localhost port:

Podobně jako CLI-driven syntéza aplikací, jako je FaceSwap a BAT-centric DeepFaceLab, 'prepack' instalace Stable Diffusion ukazuje své kořeny v příkazovém řádku, s rozhraním přístupným prostřednictvím localhost portu (viz horní část obrázku výše), který komunikuje se funkcemi Stable Diffusion založenými na CLI.

Podobně jako CLI-driven syntéza aplikací, jako je FaceSwap a BAT-centric DeepFaceLab, ‘prepack’ instalace Stable Diffusion ukazuje své kořeny v příkazovém řádku, s rozhraním přístupným prostřednictvím localhost portu (viz horní část obrázku výše), který komunikuje se funkcemi Stable Diffusion založenými na CLI.

Bez pochyby se brzy objeví více streamlinovaná aplikace. Již existuje několik aplikací založených na Patreonu, které lze stáhnout, jako je GRisk a NMKD (viz obrázek níže) – ale žádná z nich dosud nezahrnuje plný rozsah funkcí, které mohou nabízet některé pokročilejší a méně přístupné implementace Stable Diffusion.

Rané, Patreon-based balíčky Stable Diffusion, lehce „app-izované“. NMKD je první, který integruje výstup CLI přímo do GUI.

Rané, Patreon-based balíčky Stable Diffusion, lehce „app-izované“. NMKD je první, který integruje výstup CLI přímo do GUI.

Zkusme se podívat, jak by mohla vypadat více vyvinutá a integrovaná implementace tohoto úžasného open source zázraku – a jaké výzvy by mohla čelit.

Právní úvahy pro plně financovanou komerční aplikaci Stable Diffusion

Faktor NSFW

Zdrojový kód Stable Diffusion byl vydán pod velmi permissivní licencí, která nezakazuje komerční reimplementace a odvozená díla, která staví na zdrojovém kódu.

Kromě již zmíněných a rostoucího počtu Patreon-based verzí Stable Diffusion, jakož i rozsáhlého počtu aplikací pluginů, které se vyvíjejí pro Figma, Krita, Photoshop, GIMP a Blender (mezi jinými), neexistuje praktický důvod, proč by dobře financovaná softwarová společnost nemohla vyvinout daleko více sofistikovanou a schopnou aplikaci Stable Diffusion. Z hlediska trhu existuje každý důvod se domnívat, že několik takových iniciativ je již dobře rozpracováno.

Zde se tyto snahy okamžitě setkávají s dilematem, zda aplikace umožní nebo zakáže nativní NSFW filtr Stable Diffusion (který je fragmentem kódu), být vypnutý.

‘Zakopání’ přepínače NSFW

Ačkoli open source licence Stability.ai pro Stable Diffusion zahrnuje široce interpretabilní seznam aplikací, pro které se nesmí použít (arguably včetně pornografického obsahu a deepfakes), jediným způsobem, jak by výrobce mohl účinně zakázat takový použití, by bylo zkompilovat NSFW filtr do neprůhledného spustitelného souboru místo parametru v souboru Python, nebo vynutit srovnání kontrolního součtu na souboru Python nebo DLL, který obsahuje NSFW směrnici, aby se nemohly provádět renderings, pokud uživatelé změní toto nastavení.

To by ponechalo putativní aplikaci „osušenou“ podobně jako DALL-E 2目前 je, snižuje tak její komerční atraktivitu. Kromě toho by nevyhnutelně vyvinuly dekompirované „upravené“ verze těchto komponent (buď původních prvků běhu Pythonu nebo zkompilovaných souborů DLL, jako jsou nyní používány v řadě Topaz AI nástrojů pro vylepšení obrazu) se objevily v komunitě torrent/hacking, aby zrušily taková omezení, jednoduše nahrazující bránící prvky a negující požadavky na kontrolní součet.

Nakonec by výrobce mohl jednoduše zopakovat varování Stability.ai proti zneužití, které charakterizuje první běh mnoha současných distribucí Stable Diffusion.

Nicméně malé open source vývojáře, kteří目前 používají neformální prohlášení, mají málo co ztratit ve srovnání se softwarovou společností, která investovala významné množství času a peněz do vytvoření plně vybavené a přístupné aplikace Stable Diffusion – což si žádá hlubší úvahu.

Odpovědnost za deepfakes

Jak jsme nedávno poznamenali, databáze LAION-aesthetics, která je součástí 4,2 miliard obrazů, na kterých byly vyškoleny modely Stable Diffusion, obsahuje velké množství obrazů celebrit, umožňujících uživatelům efektivně vytvářet deepfakes, včetně deepfake porna s celebritami.

Ze našeho nedávného článku, čtyři fáze Jennifer Connelly za čtyři desetiletí její kariéry, odvozené ze Stable Diffusion.

Ze našeho nedávného článku, čtyři fáze Jennifer Connelly za čtyři desetiletí její kariéry, odvozené ze Stable Diffusion.

To je samostatný a více sporný problém než generování (obvykle) legálního „abstraktního“ porna, který nezobrazuje „reálné“ lidi (ačkoli takové obrázky jsou odvozeny z více reálných fotografií ve výcvikových materiálech).

Pokud se rostoucí počet států USA a zemí vyvíjí nebo zavedl zákony proti deepfake pornografii, schopnost Stable Diffusion vytvářet deepfakes s celebritami by mohla znamenat, že komerční aplikace, která není zcela cenzurovaná (tj. která může vytvářet pornografický materiál), by mohla potřebovat some schopnost filtrovat vnímané obličeje celebrit.

Jedním ze způsobů, jak toho dosáhnout, by bylo poskytnout vestavěný „černý seznam“ termínů, které nebudou akceptovány v uživatelském podnětu, vztahujících se k jménům celebrit a fiktivním postavám, s nimiž mohou být spojeny. Předpokladem by bylo, aby takové nastavení bylo zavedeno v více jazycích než pouze angličtině, protože původní data obsahují i další jazyky. Další přístup by mohl zahrnovat integraci systémů rozpoznávání celebrit, jako jsou ty, které vyvinula Clarifai.

Možná by bylo nutné, aby výrobci softwaru zahrnuli takové metody, perhaps inicializované ve výchozím stavu, aby pomohly zabránit plnohodnotné samostatné aplikaci Stable Diffusion generovat obličeje celebrit, dokud nebude vydána nová legislativa, která by mohla učinit takovou funkčnost nezákonnou.

Opětovně, nicméně, taková funkčnost by mohla být nevyhnutelně dekompirována a obrácena zainteresovanými stranami; nicméně by výrobce softwaru mohl v takovém případě tvrdit, že se jedná o účinnou sabotáž – pokud by taková reverzní inženýrství nebyla učiněna příliš snadnou.

Funkce, které by mohly být zahrnuty

Jádrové funkcionality v jakékoli distribuci Stable Diffusion by se očekávalo od jakékoli dobře financované komerční aplikace. Tyto zahrnují schopnost používat textové podněty pro generování vhodných obrazů (text-to-image); schopnost používat náčrtky nebo jiné obrázky jako vodítka pro nové generované obrázky (image-to-image); prostředky pro úpravu „imaginativnosti“ systému; způsob, jak vyvážit renderovací čas proti kvalitě; a další „základní“ funkce, jako je volitelné automatické archivování obrazů/podnětů a rutinní volitelné zvýšení rozlišení prostřednictvím RealESRGAN, a alespoň základní „oprava obličeje“ s GFPGAN nebo CodeFormer.

To je docela „vanilka“. Zkusme se podívat na některé pokročilejší funkce, které jsou目前 vyvíjeny nebo rozšiřovány, které by mohly být zahrnuty do plnohodnotné „tradiční“ aplikace Stable Diffusion.

Stochastické zmrazení

I když znovu použijete semeno z předchozí úspěšné renderace, je to strašně obtížné dostat Stable Diffusion, aby přesně opakoval transformaci, pokud jakákoli část podnětu nebo zdrojového obrázku (nebo obojí) je změněna pro následnou renderaci.

To je problém, pokud chcete použít EbSynth, aby vynutil transformace Stable Diffusion na reálném videu způsobem, který je časově kohorentní – ačkoli tato technika může být velmi účinná pro jednoduché záběry hlavy a ramen:

Omezený pohyb může učinit EbSynth účinným prostředkem pro transformaci transformací Stable Diffusion do realistického videa. Zdroj: https://streamable.com/u0pgzd

Omezený pohyb může učinit EbSynth účinným prostředkem pro transformaci transformací Stable Diffusion do realistického videa. Zdroj: https://streamable.com/u0pgzd

EbSynth funguje tak, že extrapoluje malou selekci „upravených“ klíčových snímků do videa, které bylo renderováno do série obrázkových souborů (a které lze později znovu sestavit do videa).

V tomto příkladu z webu EbSynth byly malé části snímků z videa namalovány umělecky. EbSynth používá tyto snímky jako vodítka pro úpravu celého videa tak, aby odpovídalo malovanému stylu. Zdroj: https://www.youtube.com/embed/eghGQtQhY38

V tomto příkladu z webu EbSynth byly malé části snímků z videa namalovány umělecky. EbSynth používá tyto snímky jako vodítka pro úpravu celého videa tak, aby odpovídalo malovanému stylu. Zdroj: https://www.youtube.com/embed/eghGQtQhY38

V následujícím příkladu, který zobrazuje téměř žádný pohyb od (reálné) blondýnky na levé straně, Stable Diffusion stále má potíže s udržením konzistentního obličeje, protože tři transformované snímky jako „klíčové snímky“ nejsou zcela identické, ačkoli všechny sdílejí stejná čísla semene.

Zde, i když je stejný podnět a semeno napříč všemi třemi transformacemi a velmi málo změn mezi zdrojovými snímky, svaly se liší ve velikosti a tvaru, ale důležitější je, že obličej je nekonzistentní, bránící časové konzistenci v potenciálním renderu EbSynth.

Zde, i když je stejný podnět a semeno napříč všemi třemi transformacemi a velmi málo změn mezi zdrojovými snímky, svaly se liší ve velikosti a tvaru, ale důležitější je, že obličej je nekonzistentní, bránící časové konzistenci v potenciálním renderu EbSynth.

Although the SD/EbSynth video below is very inventive, where the user’s fingers have been transformed into (respectively) a walking pair of trousered legs and a duck, the inconsistency of the trousers typify the problem that Stable Diffusion has in maintaining consistency across different keyframes, even when the source frames are similar to each other and the seed is consistent.

A man's fingers become a walking man and a duck, via Stable Diffusion and EbSynth. Source: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/

A man’s fingers become a walking man and a duck, via Stable Diffusion and EbSynth. Source: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/

The user who created this video commented that the duck transformation, arguably the more effective of the two, if less striking and original, required only a single transformed key-frame, whereas it was necessary to render 50 Stable Diffusion images in order to create the walking trousers, which exhibit more temporal inconsistency. The user also noted that it took five attempts to achieve consistency for each of the 50 keyframes.

Therefore it would be a great benefit for a truly comprehensive Stable Diffusion application to provide functionality that preserves characteristics to the maximum extent across keyframes.

One possibility is for the application to allow the user to ‘freeze’ the stochastic encode for the transformation on each frame, which can currently only be achieved by modifying the source code manually. As the example below shows, this aids temporal consistency, though it certainly does not solve it:

One Reddit user transformed webcam footage of himself into different famous people by not just persisting the seed (which any implementation of Stable Diffusion can do), but by ensuring that the stochastic_encode() parameter was identical in each transformation. This was accomplished by modifying the code, but could easily become a user-accessible switch. Clearly, however, it does not solve all the temporal issues. Source: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/

One Reddit user transformed webcam footage of himself into different famous people by not just persisting the seed (which any implementation of Stable Diffusion can do), but by ensuring that the stochastic_encode() parameter was identical in each transformation. This was accomplished by modifying the code, but could easily become a user-accessible switch. Clearly, however, it does not solve all the temporal issues. Source: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/

Cloud-Based Textual Inversion

A better solution for eliciting temporally consistent characters and objects is to ‘bake’ them into a Textual Inversion – a 5KB file that can be trained in a few hours based on just five annotated images, which can then be elicited by a special ‘*’ prompt, enabling, for instance, a persistent appearance of novel characters for inclusion in a narrative.

Images associated with apposite tags can be converted into discrete entities via Textual Inversion, and summoned up without ambiguity, and in the correct context and style, by special token words. Source: https://huggingface.co/docs/diffusers/training/text_inversion

Images associated with apposite tags can be converted into discrete entities via Textual Inversion, and summoned up without ambiguity, and in the correct context and style, by special token words. Source: https://huggingface.co/docs/diffusers/training/text_inversion

Textual Inversions are adjunct files to the very large and fully trained model that Stable Diffusion uses, and are effectively ‘slipstreamed’ into the eliciting/prompting process, so that they can participate in model-derived scenes, and benefit from the model’s enormous database of knowledge about objects, styles, environments and interactions.

However, though a Textual Inversion does not take long to train, it does require a high amount of VRAM; according to various current walkthroughs, somewhere between 12, 20 and even 40GB.

Since most casual users are unlikely to have that kind of GPU heft at their disposal, cloud services are already emerging that will handle the operation, including a Hugging Face version. Though there are Google Colab implementations that can create textual inversions for Stable Diffusion, the requisite VRAM and time requirements may make these challenging for free-tier Colab users.

For a potential full-blown and well-invested Stable Diffusion (installed) application, passing this heavy task through to the company’s cloud servers seems an obvious monetization strategy (assuming that a low or no-cost Stable Diffusion application is permeated with such non-free functionality, which seems likely in many possible applications that will emerge from this technology in the next 6-9 months).

Additionally, the rather complicated process of annotating and formatting the submitted images and text could benefit from automation in an integrated environment. The potential ‘addictive factor’ of creating unique elements that can explore and interact with the vast worlds of Stable Diffusion would seem potentially compulsive, both for general enthusiasts and younger users.

Versatile Prompt Weighting

There are many current implementations that allow the user to assign greater emphasis to a section of a long text prompt, but the instrumentality varies quite a lot between these, and is frequently clunky or unintuitive.

The very popular Stable Diffusion fork by AUTOMATIC1111, for instance, can lower or raise the value of a prompt word by enclosing it in single or multiple brackets (for de-emphasis) or square brackets for extra emphasis.

Square brackets and/or parentheses can transform your breakfast in this version of Stable Diffusion prompt weights, but it's a cholesterol nightmare either way.

Square brackets and/or parentheses can transform your breakfast in this version of Stable Diffusion prompt weights, but it’s a cholesterol nightmare either way.

Other iterations of Stable Diffusion use exclamation marks for emphasis, while the most versatile allow users to assign weights to each word in the prompt through the GUI.

The system should also allow for negative prompt weights – not just for horror fans, but because there may be less alarming and more edifying mysteries in Stable Diffusion’s latent space than our limited use of language can summon up.

Outpainting

Shortly after the sensational open-sourcing of Stable Diffusion, OpenAI tried – largely in vain – to recapture some of its DALL-E 2 thunder by announcing ‘outpainting’, which allows a user to extend an image beyond its boundaries with semantic logic and visual coherence.

Naturally, this has since been implemented in various forms for Stable Diffusion, as well as in Krita, and should certainly be included in a comprehensive, Photoshop-style version of Stable Diffusion.

Tile-based augmentation can extend a standard 512x512 render almost infinitely, so long as the prompts, existing image and semantic logic allow for it. Source: https://github.com/lkwq007/stablediffusion-infinity

Tile-based augmentation can extend a standard 512×512 render almost infinitely, so long as the prompts, existing image and semantic logic allow for it. Source: https://github.com/lkwq007/stablediffusion-infinity

Because Stable Diffusion is trained on 512x512px images (and for a variety of other reasons), it frequently cuts the heads (or other essential body parts) off of human subjects, even where the prompt clearly indicated ‘head emphasis’, etc..

Typical examples of Stable Diffusion 'decapitation'; but outpainting could put George back in the picture.

Typical examples of Stable Diffusion ‘decapitation’; but outpainting could put George back in the picture.

Any outpainting implementation of the type illustrated in the animated image above (which is based exclusively on Unix libraries, but should be capable of being replicated on Windows) should also be tooled as a one-click/prompt remedy for this.

Currently, a number of users extend the canvas of ‘decapitated’ depictions upwards, roughly fill the head area in, and use img2img to complete the botched render.

Účinné maskování, které rozumí kontextu

Maskování může být strašně hit-and-miss záležitostí ve Stable Diffusion, v závislosti na verzi nebo forkování. Často, kde je možné nakreslit koherentní masku, zadaná oblast nakonec skončí s obsahem, který nebere v úvahu celý kontext obrázku.

Jednou jsem maskoval rohovky očí na obrázku obličeje a poskytl podnět ‘modré oči’ jako maska inpaint – pouze abych zjistil, že se dívám skrz dvě vyříznuté lidské oči na vzdálený obrázek podivného vlka. Myslím, že jsem šťastný, že to nebyl Frank Sinatra.

Sémantické úpravy jsou také možné identifikací šumu, který vytvořil obrázek, což umožňuje uživateli adresovat konkrétní strukturální prvky v renderu bez interference s zbytkem obrázku:

Změna jednoho prvku v obrázku bez tradičního maskování a bez změny sousedního obsahu, identifikací šumu, který původně vytvořil obrázek a adresováním částí, které přispěly k cílové oblasti. Zdroj: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/

Změna jednoho prvku v obrázku bez tradičního maskování a bez změny sousedního obsahu, identifikací šumu, který původně vytvořil obrázek a adresováním částí, které přispěly k cílové oblasti. Zdroj: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/

Tato metoda je založena na K-Diffusion sampler.

Sémantické filtry pro fyziologické chyby

Jak jsme již zmínili, Stable Diffusion může často přidávat nebo odebírat končetiny, převážně kvůli problémům s daty a nedostatkům v anotacích, které doprovázejí obrázky, na kterých byl trénován.

Jako ten neposlušný kluk, který vystrčil jazyk na školní skupinové fotografii, biologické zločiny Stable Diffusion nejsou vždy okamžitě zřejmé, a můžete mít na Instagramu svou poslední mistrovskou práci AI, než si všimnete těch dalších rukou nebo roztavených končetin.

Jako ten neposlušný kluk, který vystrčil jazyk na školní skupinové fotografii, biologické zločiny Stable Diffusion nejsou vždy okamžitě zřejmé, a můžete mít na Instagramu svou poslední mistrovskou práci AI, než si všimnete těch dalších rukou nebo roztavených končetin.

Je tak obtížné opravit tyto druhy chyb, že by bylo užitečné, kdyby plnohodnotná aplikace Stable Diffusion obsahovala nějaký anatomický rozpoznávací systém, který by používal sémantické segmentace k výpočtu, zda příchozí obrázek obsahuje závažné anatomické nedostatky (jako na obrázku výše), a odmítl by ho ve prospěch nové renderace, než by ho představil uživateli.

Samozřejmě, že byste mohli chtít renderovat bohyni Kali, nebo Doktora Oktopuse, nebo dokonce zachránit nedotčenou část končetin postiženého obrázku, takže tato funkce by měla být volitelným přepínačem.

Pokud by uživatelé mohli tolerovat aspekt telemetrie, takové selhání by mohlo být anonymně přeneseno v kolektivním úsilí federativního učení, které by mohlo pomoci budoucím modelům zlepšit jejich pochopení anatomické logiky.

LAION-Based Automatic Enhancement

Jak jsem již poznamenal v předchozí analýze tří věcí, které by Stable Diffusion mohl v budoucnu řešit, neměl by být ponechán pouze na verzi GFPGAN, aby se pokusil „vylepšit“ renderované obličeje v prvním renderingu.

„Vylepšení“ GFPGAN jsou strašně obecná, často podkopávají identitu zobrazené osoby a fungují pouze na obličeji, které obdrželo stejné zpracování času a pozornosti jako jakákoli jiná část obrázku.

Proto by profesionální program pro Stable Diffusion měl být schopen rozpoznat obličej (s standardní a relativně lehkou knihovnou, jako je YOLO), aplikovat plnou váhu dostupné GPU síly pro pře-renderování a buď sloučit vylepšené obličej do původního renderu plného kontextu, nebo uložit jej samostatně pro manuální rekompozici. Currently, this is a fairly ‘hands on’ operation.

V případech, kdy Stable Diffusion byl trénován na dostatečném počtu obrazů celebrity, je možné zaměřit celou kapacitu GPU na následnou renderaci pouze obličeje renderovaného obrázku, což je obvykle významné zlepšení – a na rozdíl od GFPGAN, čerpá z informací z LAION-trénovaných dat, spíše než jednoduše upravuje renderované pixely.

V případech, kdy Stable Diffusion byl trénován na dostatečném počtu obrazů celebrity, je možné zaměřit celou kapacitu GPU na následnou renderaci pouze obličeje renderovaného obrázku, což je obvykle významné zlepšení – a na rozdíl od GFPGAN, čerpá z informací z LAION-trénovaných dat, spíše než jednoduše upravuje renderované pixely.

Vnitřní vyhledávání LAION

Od té doby, co uživatelé začali chápat, že vyhledávání v databázi LAION může být nápomocné pro lepší využití Stable Diffusion, byly vytvořeny online vyhledávače LAION, včetně haveibeentrained.com.

Funkce vyhledávání na haveibeentrained.com umožňuje uživatelům procházet obrázky, které pohánějí Stable Diffusion, a objevit, zda objekty, lidé nebo nápady, které by mohli chtít vyvolat ze systému, jsou pravděpodobně trénovány do něj. Takové systémy jsou také užitečné pro objevování sousedních entit, jako je způsob, jakým jsou celebrity seskupeny, nebo 'další nápad', který navazuje na aktuální.

Funkce vyhledávání na haveibeentrained.com umožňuje uživatelům procházet obrázky, které pohánějí Stable Diffusion, a objevit, zda objekty, lidé nebo nápady, které by mohli chtít vyvolat ze systému, jsou pravděpodobně trénovány do něj.

Although such web-based databases often reveal some of the tags that accompany the images, the process of generalization that takes place during model training means that it is unlikely that any particular image could be summoned up by using its tag as a prompt.

Additionally, the removal of ‘stop words’ and the practice of stemming and lemmatization in Natural Language Processing means that many of the phrases on display were split up or omitted before being trained into Stable Diffusion.

Nicméně, způsob, jakým estetické skupiny váží v těchto rozhraních, může naučit koncového uživatele mnoho o logice (nebo „osobnosti“) Stable Diffusion a prokázat pomoc při lepší produkci obrazů.

Závěr

Existuje mnoho dalších funkcí, které bych chtěl vidět v plné nativní desktopové implementaci Stable Diffusion, jako je nativní CLIP-based image analysis, která reverzuje standardní proces Stable Diffusion a umožňuje uživateli vyvolat fráze a slova, která systém přirozeně spojuje se zdrojovým obrázkem, nebo renderem.

Kromě toho by skutečné tile-based škálování bylo vítanou funkcí, protože ESRGAN je téměř tak hrubým nástrojem jako GFPGAN. Naštěstí plány na integraci txt2imghd implementace GOBIG jsou rychle činí realitou napříč distribucemi a zdá se to jako zjevná volba pro desktopovou iteraci.

Několik dalších populárních požadavků z komunit Discord mě méně zajímá, jako jsou integrované slovníky podnětů a použitelné seznamy umělců a stylů, ačkoli vnitřní poznámkový blok nebo přizpůsobitelný lexikon frází by se zdál logickým doplňkem.

Podobně, současné omezení lidské animace ve Stable Diffusion, ačkoli byla spuštěna CogVideo a dalšími projekty, zůstává neuvěřitelně zárodečné a závislé na výzkumu do temporálních priorit autentického lidského pohybu.

Prozatím je video Stable Diffusion přísně psychedelické, ačkoli může mít mnohem jasnější blízkou budoucnost v deepfake loutkářství, prostřednictvím EbSynth a dalších relativně nových text-to-video iniciativ (a je třeba poznamenat, že chybí syntetizované nebo „upravené“ lidé v posledním propagačním videu Runway).

Jedna další cenná funkčnost by byla transparentní Photoshop pass-through, který byl již zaveden v editoru textur Cinema4D, mezi jinými podobnými implementacemi. S touto funkcí můžete snadno přepínat obrázky mezi aplikacemi a používat každou aplikaci pro provedení transformací, které jsou její specialitou.

Nakonec, a možná nejdůležitěji, plnohodnotná desktopová aplikace Stable Diffusion by měla být schopna nejen snadno přepínat mezi kontrolními body (tj. verzemi základního modelu, který pohání systém), ale měla by být také schopna aktualizovat vlastní Textual Inversions, které fungovaly s předchozími oficiálními modelovými vydáními, ale které by mohly být jinak rozbité pozdějšími verzemi modelu (jak naznačili vývojáři na oficiálním Discordu).

Ironicky, organizace, která je ve velmi dobré pozici, aby vytvořila takovou mocnou a integrovanou matici nástrojů pro Stable Diffusion, Adobe, spojila se tak silně s Content Authenticity Initiative, že by se mohlo zdát, že by to byla regresivní PR chyba pro společnost – pokud by Stable Diffusion nebyl tak výrazně omezen, jako je OpenAI DALL-E 2, a pokud by nebyl prezentován jako přirozený vývoj jejich značných držeb v oblasti stock fotografie.

 

Poprvé publikováno 15. září 2022.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai