Prompt engineering
Zvládnutí umělé inteligence: Přehledný průvodce Midjourney a inženýrstvím promptů

Úvod do umělé inteligence MidJourney
Umělá inteligence rychle prolomila bariéry nemožného a nedávno vtrhla do oblasti umění, čímž ji zcela transformovala. Nyní již nemusíte být mistrem umění nebo odborníkem na Photoshop, abyste mohli oživit své představy. Stačí jednoduchý a jasně formulovaný prompt, díky Midjourney.
Vše začalo se zavedením průlomových technologií, jako jsou DALL-E, Midjourney a StableDiffusion, v roce 2022. Každá z těchto inovací přinesla na plátno generativní umělé inteligence svůj specifický styl, ale Midjourney zejména pokračuje ve své působivé cestě a dosahuje pozoruhodných úspěchů.
Midjourney je v současné době vedoucím generátorem high-resolution text-to-image AI na trhu a vyniká svou jedinečnou kombinací generování text-to-image, editace médií a eskalování, a přístupem k aktivní umělecké komunitě, vše za pouhých 10 dolarů měsíčně. Tento komplexní soubor funkcí představuje vzrušující plátno pro umělce, technické nadšence a odborníky na umělou inteligenci, kteří vytvářejí prostředí pro kreativitu a inovace.
Umělecký svět si toho určitě všímá, protože se generativní umělá inteligence na trhu s uměním očekává, že bude mít ohromující růst o 40,5 %. Midjourney je nezpochybnitelný ve vytváření nejrealističtějších a nejvyšších kvalitních vizuálů pomocí umělých inteligencí.
Efektivní inženýrství promptů jde za hranice pouhé tvorby; zahrnuje nejlepší postupy. Prompty by měly nabízet jasnost, být stručné, ale zároveň poskytovat umělým inteligencím dostatečnou orientaci, aniž by byly příliš předepsány. Kromě toho je třeba během návrhu zohlednit cílové publikum, přičemž se bere v úvahu řada proměnných, jako je věk, pohlaví a kulturní zázemí, mezi ostatními.
Jak MidJourney funguje?
Mid-Journey využívá dvě nové technologie strojového učení – velké jazykové a difuzní modely. Jazykový model, podobný chatbotům, jako je ChatGPT, pomáhá Mid-Journey při interpretaci významu vašich promptů a jejich převodu na vektory. Tento vektor pak řídí difuzní proces.
Vnitřní fungování Midjourney je značně neznámé. Přesto je zřejmé, že využívá generování text-to-image z dvou relativně nových technologií strojového učení: velkých jazykových modelů a difuzních modelů. První z nich je možná známá uživatelům platformy, jako je ChatGPT, a druhá je slibným doplňkem sektoru generování umělé inteligence. Celý systém se spoléhá na dataset CLIP pro školení, který lze nalézt na výzkumné stránce OpenAI.
Přes omezené informace je možné nakreslit široký obraz fungování Midjourney, konkrétně jeho difuzního modelu, nazvaného ‘Stable Diffusion’. Základní postup spočívá v transformaci textových promptů na obrázky různých stylů a obsahu. Tento sofistikovaný postup je dosažen pomocí difuzního modelu, generativního modelu, který propojuje závislosti mezi textovými vstupy a výstupy obrázků.
Difuzní modely jsou postaveny na základě metody denoisování difuze, přístupu ovlivněného termodynamikou nerovnováhy. Tato metoda systematicky rozebírá strukturu dat a později ji obnovuje. Tento přístup byl adaptován pro generování obrázků Ho a spol. v roce 2020, což vedlo ke vzniku difuzních modelů, které dnes vidíme.
Školení difuzních modelů zahrnuje dvě primární fáze. Zpočátku difuzní proces zahrnuje postupné přidávání náhodného šumu k vstupnímu obrázku, dokud se zcela nepřemění na šum. Tento proces je řízen pevnou Markovovou řetězcí, která konzistentně přidává gausovský šum přes několik po sobě jdoucích kroků.
Následně, v reverzní nebo rekonstrukční fázi, model obnovuje původní data ze stavu šumu, kterého bylo dosaženo během difuzního procesu. Tento proces je řízen Markovovou řetězcí s naučenými gausovskými přechody, což znamená, že predikce hustoty pravděpodobnosti v daném čase závisí pouze na stavu dosaženém v předchozím časovém kroku. Protože latentní ‘x1, …, xT’ sdílejí stejnou dimenzi jako data, difuzní modely se klasifikují jako modely latentních proměnných.
Náklady a předplatné Mid-Journey
Zatímco mnoho chatbotů, jako je ChatGPT a Bing Chat, nabízí téměř neomezené použití zdarma, scénář se liší pro generátory obrázků, jako je Mid-Journey. Kvůli značnému výpočetnímu výkonu, který je vyžadován, zejména z grafických procesorů (GPU) a využití video paměti pro proces denoisování, služba Mid-Journey má cenu.
Základní plán začíná na 10 dolarech měsíčně, poskytující přibližně 3,3 hodiny času GPU, dostatečné pro asi 200 generací obrázků. Existují však i vyšší plány, které nabízejí neomezené obrázky v režimu Relaxed, i když s delší čekací dobou.
Nastavení MidJourney
- Zahájení s MidJourney zahrnuje registraci na jejich oficiální webové stránce, přihlášení k odběru plánu a následné přesměrování na Discord.
- Jakmile najdete kanál Mid-Journey na Discordu, přejděte do sekce Newcomer Groups na levé straně. Odtud můžete sledovat, jak ostatní uživatelé vytvářejí prompty, naučit se mechaniku Mid-Journey a interagovat v živém prostředí.
- Po seznámení se s prostředím pozvěte robota do svého soukromého serveru, abyste mohli vytvářet obrázky bez rušení. Robot generuje čtyři náhledové obrázky na základě vašeho promptu, což vám umožňuje vybrat ten, který je nejblíže vaší původní ideji, a dále upravit obrázek.
Struktura promptu pro Midjourney
- Příkaz /imagine v kanálu Discordu uvnitř kanálu Midjourney generuje jedinečný obrázek z krátkého textového popisu (promptu).
- Chcete-li rekreovat specifický styl napříč různými obrázky, jednoduše zadejte URL obrázku spolu s vaším textovým promptem. Vaše nové, konzistentní výstupy budou kombinovat prvky z obou vašich zvolených obrázků a textu.
/imagine http://link-to-your-image –parameter1 –parameter2
Můžete vygenerovat odkaz na váš obrázek nahráním jej do kanálu Discord. Jakmile jej nahrajete, klikněte pravým tlačítkem myši na obrázek a vyberte ‘Kopírovat odkaz’.
Zde http://link-to-your-image a parametry jsou nepovinné. - Následně robot začne pracovat na vašem obrázku, což trvá přibližně minutu, aby nabídl čtyři alternativy. Tento proces zahrnuje použití robustních grafických procesorů (GPU) pro zpracování a interpretaci každého promptu.
- Sledujte své využití GPU pomocí příkazu /info. To vám umožňuje zkontrolovat zbývající ‘Fast Time’ a monitorovat dobu GPU vašeho předplatného.
Upscaling a úpravy obrázků
Pro jemnější obrázek použijte tlačítka ‘U’ pod obrázky, abyste mohli upscale vámi preferovaný obrázek. Můžete také použít tlačítka ‘V’, abyste provedli úpravy konkrétních obrázků. Pro další úpravy upscale obrázku použijte možnosti ‘Make variations’, ‘Light Upscale Redo’ a ‘Beta Upscale Redo’. Tlačítko ‘Web’ vám umožňuje zobrazit obrázek ve větším rozměru v samostatném okně.
Midjourney umožňuje upscaling obrázků na rozlišení 2048×2048 (čtverec) a 2720×1530 (širokoúhlý) prostřednictvím funkce beta upscale redo, s výchozím generovaným rozměrem mřížky 1024×1024 (čtverec) a 1456×816 (širokoúhlý). Každý obrázek lze dále vylepšit pomocí možností “U” upscale, které zlepšují konkrétní části obrázku.
Vezměte si prompt, který vytváří fantastické umělecké dílo s verzí V5.2 Midjourney.
/imagine Umění zobrazuje osamocený strom pod hvězdnou oblohou, s dítětem, které čte pod ním, v barvách uklidňující modré a teplé oranžové, inspirované štětcem francouzského impresionismu, perských miniatur, Bauhausovy jednoduchosti, evokující klasické ilustrace dětských pohádek, dosahující asymetrické harmonie, vyjádřené v okouzlujícím, folk/naivním stylu: –ar 15:19 –upbeta –q 2
Vytvoření vašeho prvního uměleckého díla Midjourney AI
- Vytvoření základní předlohy: Představte si sebe jako umělce. Začněte s jednoduchým, živým popisem obrázku, který chcete oživit. Načrtněte hlavní předmět, atmosféru nebo i drobné detaily, které chcete vtisknout. Použijte interpunkci, jako jsou čárky, závorky a spojovníky, abyste strukturalizovali své myšlenky. Pro lepší výsledky buďte explicitní ohledně kontextu a detailů vašeho designu. Prvky, jako je předmět (například Drak, vintage auto, Abraham Lincoln), médium (například digitální umění, kresba tužkou), prostředí (například vesmír, pod vodou, rušné město), osvětlení (například měkké, neonové, proti světlu), barva (například zemité tóny, barevné, tlumené), nálada (například melancholická, pohádková, pokojná) a kompozice (například krajina, close-up, širokoúhlý), mohou být kritické. Příklady:
- Idylický les zalitý sluncem, cesta vinoucí se do dálky
- Město, které nikdy nespí, s neonovými světly odrážejícími se od chodníků a rozmanitou davem
- Infuze stylu a klíčových slov: AI Midjourney je schopná ilustrovat obrázky v mnoha stylech, jako je abstraktní, surrealistický nebo realistický. Integrací stylu nebo souvisejících klíčových slov můžete nasměrovat AI, aby vytvořila obrázek, který odráží vaši vizi. Experimentujte s různými styly a klíčovými slovy, abyste objevili perfektní kombinaci. Příklady:
- Krajinná malba zobrazující poušť při úsvitu, zrcadlící styl Georgie O’Keeffe, s pastelovou paletou a organickými formami.
- Abstraktní rendering pokojného lesa, s geometrickými vzory tvořícími stromy a listí, inspirovaný kompozicemi Pieta Mondriana.
- Využití pokročilých nastavení: Představte si Midjourney jako vaši kreativní nástroj, plný pokročilých nastavení, která vám umožňují doladit generované obrázky. Je to jako držet kouzelnou hůlku, která vám umožňuje vyvolat ideální rovnováhu náhodnosti, stylizace a variace obrázků. Využijte svou kreativní sílu, experimentujícím s těmito nastaveními, dokud nenajdete tu pravou kombinaci, která rezonuje s vaší vizí. Příklady:
- Japonská zahrada s jezerem, odrážejícím sakuru – seed 22 –s 150 –c 40
- Kyberpunkové město, osvětlené neonovými světly – seed 88 –s 600 –c 60
- Podtržení prvků pomocí vah: Představte si váš obrázek jako symfonii, kde každý prvek přispívá k velkému souboru. Použijící notaci “::”, můžete určit důležitost různých prvků ve vašem obrázku, což vám umožňuje řídit pozornost. Příklady:
- [Elegantní pštros]::3 sedící na [wisteria stromu]::1 kvetoucím s barevnými květy
- [Majestátní slon]::2 koupající se v záři [západu slunce]::1 na savaně
- Midjourney je proces pokusů a omylů: Experimentování s různými prvky a funkcemi je nezbytné. Každá iterace vás přibližuje k obrázku, který jste si představovali oživit.
Parametry Mid-Journey
Model Midjourney funguje pomocí nastavitelných parametrů, které řídí výsledek procesu generování obrázků. Tyto parametry umožňují uživatelům upravit a přizpůsobit generované umění, doladit model, aby vytvořil výstupy, které dokonale vyhovují jejich cíli.
Níže jsou základní a pokročilé parametry, jejich funkce a způsob, jak je použít pro plné využití možností Midjourney:
- Poměr stran (–aspect nebo –ar): Tento parametr řídí poměr mezi šířkou a výškou generovaného obrázku. Například poměr 16:9 je ideální pro titulky YouTube, zatímco 1:1 produkuje čtvercový obrázek, který je skvělý pro Instagram.
- Chaos (–chaos): Tento parametr upravuje rozmanitost počáteční mřížky obrázku a pohybuje se v rozmezí 0 až 100. Vyšší hodnoty chaosu vám dají nepředvídatelné a jedinečné výsledky, zatímco nižší hodnoty zajistí konzistentnější výsledky.
- No (–no): Tento parametr vám pomáhá vyloučit konkrétní prvky nebo charakteristiky z generovaného obrázku. Například, pokud chcete obrázek bez červené barvy, můžete použít “–no red”.
- Kvalita (–quality nebo –q): Tento parametr upravuje čas potřebný pro generování obrázku. Vyšší kvalita vyžaduje více zpracování, ale poskytuje detailnější detaily. Tento parametr může nabývat hodnot 0,25, 0,5, 1 nebo 2.
- Seed (–seed): Tento parametr určuje počáteční vizuální šum, který slouží jako základ pro generovaný obrázek. Používání stejného čísla seedu se stejným promptem poskytne podobné výsledky. Přijímá celočíselné hodnoty v rozmezí 0–4294967295.
- Stop (–stop): S tímto parametrem můžete předčasně ukončit úlohu, což vede k méně detailním, ale potenciálně zajímavým výsledkům. Rozsah je 10-100. Například, pokud zadáte ‘–stop 50’, proces generování obrázku se zastaví na 50% dokončení, což může vést k méně detailnímu, možná abstraktnímu obrázku.
- Stylizace (–stylize nebo –s): Tento parametr řídí úroveň uměleckého zpracování generovaného obrázku. Nižší hodnoty stylizace poskytují výsledky bližší původnímu promptu, zatímco vyšší hodnoty vedou k abstraktnějším a umělecky interpretovaným výsledkům. Ve verzi 5 je výchozí hodnota 100, ale můžete ji nastavit v rozmezí 0-1000.
- Verze modelu: Můžete vybrat z různých verzí modelu Midjourney pomocí parametru –version nebo –v.
- Niji: Model specializovaný na anime-styl obrázky. Můžete k němu přistupovat pomocí parametru –niji.
- Highmi Definice: Pro abstraktní a krajinářské obrázky aktivuje parametr –hd ranou verzi modelu, která poskytuje větší, méně konzistentní obrázky.
- Testovací modely: Midjourney nabízí speciální modely pro specifické použití. Parametry –test a –testp aktivují standardní a fotografický testovací model.
- Upscaler: Algoritmus Midjourney začíná s nízko-rozlišením mřížky obrázku. Nabízí několik modelů upscalingu pro zlepšení velikosti a detailů obrázku.
- Uplight: Alternativní světelný upscaler (–uplight) poskytuje upscale obrázky, které jsou méně detailní, ale hladší.
- Upbeta: Parametr –upbeta vede k obrázkům se značně méně dodatečnými detaily, zůstávající blíže původní mřížce obrázku.
- Upanime: Upscaler –upanime je navržen speciálně pro práci s modelem Midjourney –niji.
- Hmotnost obrázku: Použijte –iw, aby upravili relativní hmotnost promptu obrázku vůči textu. Výchozí hodnota je 0,25.
- Sameseed: Parametr –sameseed zajišťuje, že všechny obrázky v počáteční mřížce používají stejný počáteční šum, vytvářející velmi podobné generované obrázky.
- Video: Midjourney může uložit progress video procesu generování počáteční mřížky obrázku pomocí parametru –video.
- Kreativní: S parametrem –creative poskytují testovací a testovací modely více variabilních a kreativních obrázků.
Midjourney pravidelně vydává aktualizace, aby vylepšil uživatelský zážitek, přičemž nejnovější verzí je verze 5.2, která byla spuštěna v červnu 2023. Přidáním –v 5.2 k vašemu promptu nebo výběrem jej prostřednictvím příkazu /settings můžete uživatelé získat přístup k tomuto pokročilému modelu. Verze 5.2 nabízí lepší detaily obrázků a lépe chápe prompty, což přináší jasnější barvy a vylepšené kompozice.
Pochopení autorských práv pro umělou inteligencí generované umělecké dílo
V březnu 2023 Úřad pro autorská práva Spojených států vyjasnil svůj postoj k autorským právům pro díla vytvořená umělou inteligencí. Zásady stanoví, že zatímco lidsky vytvořené prvky v uměleckých dílech AI (jako psané texty nebo jedinečné návrhy) mohou být chráněny, obrázky vytvořené umělou inteligencí samy o sobě nejsou způsobilé k autorským právům, v souladu s globálními normami, které stanoví, že pouze lidská tvorba je způsobilá k autorským právům.
V kontextu uměleckých děl AI není autorské právo přímočaré. Zatímco digitální umění obsahuje lidskou tvorbu, umělá inteligence generuje umělecká díla bez přímé lidské intervence, což komplikuje otázku autorství a vlastnictví. Podle Úřadu pro autorská práva Spojených států je počáteční vlastnictví uděleno autorovi díla – lidskému tvůrci. Nicméně, protože umělá inteligence nemůže být považována za autora, umělá inteligence generovaná umělecká díla postrádají jasnou vlastnictví.
Poslední pokyny Úřadu pro autorská práva Spojených států umožňují autorská práva pro umělá inteligence generovaná umělecká díla pouze tehdy, pokud obsahují dostatečnou lidskou tvorbu. Úroveň “dostatečné lidské tvorby” zůstává neurčená a závisí na stupni lidské účasti na tvorbě umělá inteligence generovaného uměleckého díla.
Zajímavě, Midjourney, platforma založená na umělých inteligencích pro tvorbu obrázků, zavedla své vlastní zásady pro práva použití. Uživatelé s bezplatnou zkušební verzí mohou používat obrázky pro nekomerční účely pod licencí Creative Commons Attribution-NonCommercial 4.0 International License (CC BY-NC 4.0), s řádným uznáním Midjourney. Placení předplatitelé mohou používat obrázky pro jakýkoli účel, včetně komerčních, pod Obecnými komerčními podmínkami. Tento vývoj v oblasti autorských práv představuje zajímavou dynamiku mezi umělou inteligencí a lidskou kreativitou.
Využití Midjourney pro dynamické návrhy UI a kreativní generaci log
Od návrhů intuitivních uživatelských rozhraní pro webové stránky nebo mobilní aplikace až po tvorbu jedinečných log a banerů, Midjourney poskytuje obsahovým tvůrcům řadu designových alternativ v řádu sekund.
Zde je, jak to funguje. Každý design začíná promptem, který slouží jako modrotisk pro umělou inteligenci, aby jej následovala. Předpokládejme, že navrhujete uživatelské rozhraní pro aplikaci online vzdělávání. Typický prompt by mohl být: “/imagine Online tutoring platform user interface, Dribbble, High Resolution, 4K, like khan academy”.
Počáteční výsledky nemusí být dokonale přesné. Například přidání “Adobe XD” do mixu může pomoci Midjourney přizpůsobit své návrhy, aby byly kompatibilní s Adobe XD. Optimalizovaný prompt by byl:
/imagine Online tutoring platform, user interface, Adobe XD, Dribbble, High Resolution, 4K, minimalist design
Textem inspirovaný loga nebo banery pomocí Midjourney
Pojďme prozkoumat, jak vytvořit banner s logem pro UNITE AI.
Nejdříve musíte mít jednoduchý obrázek textu, který chcete zobrazit. Můžete jej vytvořit pomocí libovolného grafického nástroje nebo textového editoru a nahrát jej do svého kanálu Discord.
Prompt pro vytvoření baneru je:
/imagine Letters: UNITE v futuristickém, AI-inspirovaném typografickém logu s písmeny UNITE –v 5 –ar 16:9
Vezměte si tyto ukázkové prompty pro více nápadů:
/imagine A lone musician performing a serene melody on a floating city at dusk, art nouveau style
/imagine A image of a future person working on a futuristic desk, surrounded by holographic screens and advanced technology. The person is wearing a sleek, silver jumpsuit and has virtual reality goggles on. The environment is filled with neon lights and floating holograms. The atmosphere is futuristic and high-tech, with a sense of excitement and innovation. The camera is a high-resolution digital camera, capturing every detail with precision. The artistic style is a blend of cyberpunk and minimalism, with a focus on clean lines and bold colors. The directors, cinematographers, photographers, fashion designers, cartoonists, and artists collaborating in this unique juxtaposition are Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki, and Kaws.
/imagine 1940s-style Barbie as a wartime nurse, in a vintage army hospital setting, tending to the wounded soldiers, in the style of classic Mattel illustrations, with the atmosphere of sepia-toned World War II photography 8k –v 5 –ar 16:9
/imagine Frame of a woman leaning against a cyberpunk, hoverbike, Japanese anime, sprawling cityscapes, 32k, intricate spaceport, fleeting, skyscraper panoramas, sleek
Závěrečné myšlenky: Navigace v světě umělé inteligence s Midjourney
Pamatujte, “Obrázek je worth tisíc slov”. Podrobný, barevný popis může fungovat zázraky. Ano, Midjourney není zdarma k použití. Přesto revolucionalizuje umělecký svět a rozšiřuje naše kreativní možnosti prostřednictvím své špičkové text-to-image technologie AI. S možností převést jednoduchý textový prompt na high-resolution obrázek, je to nástroj, který slibuje neomezené příležitosti, nejen pro umělce, ale také pro designéry UI/UX, technické nadšence a odborníky na umělou inteligenci.
Zde jsou některé důležité připomínky, které si pamatujte, když se vydáte na svou cestu s Midjourney:
- Naučte se základy promptu Midjourney: Použijte jasný, stručný a komplexní popis, který zahrnuje vaši vizi, aby AI mohla účinně navigovat. Připomeňte si, že je třeba zohlednit vaše publikum a neváhejte experimentovat s různými styly, náladami a kontexty.
- Využijte parametry: Zlepšete svůj kreativní zážitek tím, že budete využívat řadu pokročilých nastavení, které Midjourney nabízí. Od řízení poměru stran až po úpravu parametru chaosu pro jedinečné výsledky, každý detail lze přizpůsobit vašim preferencím.
- Přijměte iterativní proces: Vaše první umělá inteligence generovaná umělecká díla nemusí být dokonalá. Přijměte tento iterativní proces a naučte se, jak vylepšit a optimalizovat vaše prompty pro lepší výsledky.
- Pochopíte autorská práva: Zatímco sama umělá inteligence generovaná umělecká díla nejsou způsobilá k autorským právům, lidsky vytvořené prvky uvnitř nich mohou být chráněny.
V podstatě integrace umělých inteligencí do umění demokratizovala kreativitu a rozostřila hranice mezi lidsky vytvořenými a strojově vytvořenými mistrovskými díly. Jak budeme svědky pozoruhodného růstu generativní umělých inteligencí na trhu s uměním, je nepochybné, že revoluce umělých inteligencí v umění, vedená platformami jako Midjourney, je teprve na počátku.























