Prompt engineering

Mestre af AI-kunst: En koncis guide til Midjourney og prompt-teknik

mm
Føj Unite.AI til dine foretrukne kilder på Google
Midjourney Generated UNITE AI LOGO

Introduktion til MidJourney AI-genereret kunst

AI bryder hurtigt igennem barriererne for det umulige og har senest invaderet kunstens domæne, hvilket har ændret det helt. Nu behøver du ikke at være en mesterkunstner eller en ekspert i Photoshop for at bringe fantasierne til live. En simpel, velformuleret prompt er alt, du behøver, takket være Midjourney.

Det begyndte med introduktionen af banebrydende teknologier som DALL-E, Midjourney og StableDiffusion tilbage i 2022. Mens hver af disse innovationer tilførte deres eget præg til det generative AI-kunsts canvas, har Midjourney i særdeleshed fortsat sin fascinerende rejse og gjort bemærkelsesværdige skridt.

Midjourney er i øjeblikket den førende højopløsnings tekst-til-billede AI-genereringsplatform på markedet og står stærkt med sin unikke blanding af tekst-til-billede-generering, mediebearbejdning og opskalering samt aktiv kunstnerisk fællesskabsadgang, alt sammen fra 10 dollars om måneden. Denne omfattende samling af funktioner præsenterer et spændende canvas for kunstnere, teknologi-entusiaster og AI-fagfolk, der bygger en miljø for kreativitet og innovation.

Kunstverdenen lægger bestemt mærke til det, da generativ AI på kunstmarkedet forventes at opleve en imponerende vækst på 40,5% CAGR. Midjourney står ubesvaret i skabelsen af de mest realistiske og højkvalitetsvisualiseringer med AI.

Effektiv prompt-teknik går ud over blot skabelse; det omfatter bedste praksis. Prompts skal tilbyde klarhed og være koncise, men samtidig give AI nok vejledning uden overmål af præskription. Desuden skal målgruppen være under betragtning under design, hvor variabler som alder, køn og kulturel baggrund med mere tages i betragtning.

Hvordan fungerer MidJourney?

Mid-Journey udnytter to nye maskinlærings-teknologier – store sprog- og diffusionsmodeller. Sprogmodellen, ligesom AI-chatbots som ChatGPT, hjælper Mid-Journey med at fortolke betydningen af dine prompts og omdanne dem til vektorer. Denne vektor vejleder herefter diffusionsprocessen.

Midjourneys indre mekanismer er i høj grad ukendte. Alligevel er det tydeligt, at det anvender tekst-til-billede-generering fra to relativt nye maskinlærings-teknologier: store sprogmodeller og diffusionsmodeller. Den første er måske kendt for brugere af AI-platforme som ChatGPT, og den sidste er et lovende tilskud til AI-kunstgenereringssektoren. Hele systemet afhænger af CLIP-datasettet til træning, som kan findes på OpenAIs forskningsside.

Trods den begrænsede information er det muligt at skitsere et bredt billede af Midjourneys diffusionsmodel, passende kaldt ‘Stable Diffusion’. I virkeligheden er Stable Diffusion en open-source-model, der dygtigt transformerer tekstprompts til billeder af varierende stil og indhold. Denne sofistikerede procedure opnås gennem en diffusionsmodel, en generativ model, der brobygger afhængighederne mellem tekstuelle inputs og billedoutputs.

Diffusionsmodeller er bygget på grundlag af den støjende diffusionsmetode, en tilgang påvirket af ikke-ligevejts termodynamik. Denne metode demonterer systematisk datastrukturen og genskaber den herefter. Denne tilgang blev tilpasset til billedgenerering af Ho et al. i 2020, hvilket ledte til skabelsen af de diffusionsmodeller, vi ser i dag.

Træning af diffusionsmodeller involverer to primære faser. Initialt indebærer den fremadgående eller diffusionsprocessen den inkrementelle tilføjelse af tilfældig støj til inputbilledet, indtil det fuldstændigt forvandler sig til støj. Denne proces styres af en fast Markov-kæde, der konsekvent tilføjer Gaussisk støj på tværs af flere pågældende trin.

Midjourney arbejdsdemonstration

Herefter, i den inverse eller rekonstruktionsfase, genskaber modellen den oprindelige data fra den støjdominerede tilstand, der opnås i diffusionsprocessen. Denne proces drives af en Markov-kæde med lærte Gaussiske overgange, hvilket indebærer, at forudsigelsen af sandsynlighedsfordelingen på et given tidspunkt udelukkende afhænger af den tilstand, der opnås i det foregående tidspunkt. Da de latente ‘x1, …, xT’ deler samme dimensioner som data, klassificeres diffusionsmodeller som latente variabelmodeller.

Omkring Mid-Journeys omkostninger og abonnement

Mens mange chatbots som ChatGPT og Bing Chat tilbyder næsten ubegrænset brug gratis, er scenariet anderledes for billedgenereringsværktøjer som Mid-Journey. På grund af den betydelige beregningskraft, der kræves, især fra grafikprocessorerne (GPU’er) og videohukommelsesbrug til den støjende proces, kommer Mid-Journeys tjeneste med en prismærke.

Den grundlæggende plan starter fra 10 dollars om måneden og giver omkring 3,3 timers GPU-tid, hvilket er nok til cirka 200 billedgenereringer. Der er dog højere plansmuligheder, der tilbyder ubegrænsede billeder i afslappet tilstand, dog med længere ventetid.

Opsætning af din MidJourney

  1. At starte med MidJourney indebærer tilmelding på deres officielle website, abonnement på en plan og herefter omdirigering til Discord.
  2. Når du finder Mid-Journey-kanalen på Discord, navigér til Newcomer-grupperne på venstre side. Herfra kan du observere andre brugere, der skaber prompts, lære mekanismerne bag Mid-Journey og interagere i en travl miljø.
  3. Efter at have gjort dig fortrolig med miljøet kan du invitere bot’en til din private server for at skabe billeder uden forstyrrelser. Bot’en genererer fire forhåndsvisningsbilleder baseret på din prompt, hvilket giver dig mulighed for at vælge det nærmeste match til din oprindelige idé og herefter finjustere billedet.

Prompt-struktur for Midjourney

  1. Kommandoen /imagine i en Discord-kanal inde i Midjourney-kanalen genererer et unikt billede fra en kort tekstbeskrivelse (prompt).
  2. For at genskabe en bestemt stil på tværs af flere billeder skal du blot indsætte billed-URL’en sammen med din tekstprompt. Dine nye, konsistente outputs vil kombinere elementer fra både dit valgte billede og tekst.
    /imagine http://link-til-dit-billede <billedbeskrivelse> –parameter1 –parameter2
    Du kan generere en link til dit billede ved at uploade det til Discord-kanalen. Når det er uploadet, højreklik på billedet og vælg ‘Kopier link’.
    Her er http://link-til-dit-billede og parametre valgfrie.
  3. Herefter går bot’en i gang med dit billede og tager omkring et minut til at tilbyde fire alternativer. Denne proces indebærer brug af robuste grafikprocessorer (GPU’er) til at bearbejde og fortolke hver prompt.
  4. Hold øje med din GPU-brug ved at bruge /info-kommandoen. Den giver dig mulighed for at tjekke din ‘Hurtig tid tilbage’ og overvåge din abonnements GPU-tid.

/info prompt midjourney

Billede-opskalering og -ændringer

For et mere raffineret billede kan du bruge ‘U’-knapperne under billederne til at opskalere dit foretrukne valg. Du kan også bruge ‘V’-knapperne til at foretage ændringer i bestemte billeder. For yderligere ændringer i et opskaleret billede kan du bruge ‘Lav variationer’, ‘Lys opskalering genskab’ og ‘Beta opskalering genskab’-funktionerne. ‘Web’-knappen giver dig mulighed for at se billedet i en større størrelse i et separat vindue.

Midjourney tillader billed-opskalering til 2048×2048 (kvadratisk) og 2720×1530 (bredskærms)-opløsninger via dens beta-opskalering-genskab-funktion, med en standardgenereringsrasterstørrelse på 1024×1024 (kvadratisk) og 1456×816 (bredskærms). Hvert billede kan yderligere forbedres gennem “U”-opskaleringsoptionerne, der forbedrer bestemte dele af billedet.

Se dette prompt, der producerer fantastisk kunst med Midjourneys V5.2-version.

/imagine Kunstværk afbilder en enkelt træ under en stjernehimmel, med et barn, der læser under, i farverne blå og varm orange, inspireret af franske impressionistiske penselstrøg, persiske miniaturer, Bauhaus-enkelhed, der minder om klassiske børneeventyrillustrationer, opnår en asymmetrisk harmoni, udtrykt i en fortryllende, folk-/naiv: –ar 15:19 –upbeta –q 2

Midjourney Prompt Guide-eksempel

Oprettelse af din første Midjourney AI-kunst

  1. Skabelse af den grundlæggende skitse: Tænk på dig selv som en kunstner. Begynd med en enkel, levende beskrivelse af billedet, du ønsker at bringe til live. Skitsér hovedemnet, atmosfæren eller endda de små detaljer, du ønsker at indlejre. Brug tegn som kommaer, klammer og bindestreger til at strukturere dine tanker. For bedre resultater skal du være eksplicit omkring konteksten og detaljerne i din design. Elementer som emne (f.eks. Drage, vintagebil, Abraham Lincoln), medium (f.eks. digital kunst, blyantstreg), miljø (f.eks. verdensrum, under vand, travl by), lys (f.eks. blødt, neon, baglys), farve (f.eks. jordtoner, vibrerende, dæmpet), humør (f.eks. melankolsk, eventyrlig, fredfyldt) og komposition (f.eks. landskab, close-up, bredvinkel) kan være afgørende. Eksempler:
    • En idyllisk skov badet i sollys, en sti, der snoer sig ind i horisonten
    • En by, der aldrig sover, med neonlys, der reflekterer på fortovene, og en divers crowd, der myldrer omkring
  2. Indføring af stil og nøgleord: Midjourneys AI er i stand til at illustrere billeder i en mangfoldighed af stilarter, såsom abstrakt, surrealistisk eller realistisk. Ved at integrere en stil eller relaterede nøgleord kan du guide AI’en til at skabe et billede, der spejler din vision. Eksperimenter med forskellige stilarter og nøgleord for at opdage den perfekte blanding. Eksempler:
    • Et landskabsmaleri, der afbilder en ørken ved daggry, der spejler stilen hos Georgia O’Keeffe, med en pastel-farvepalet og organiske former.
    • En abstrakt gengivelse af en fredfyldt skov, med geometriske mønstre, der danner træer og løv, inspireret af Piet Mondrians kompositioner.
  3. Udnyttelse af avancerede indstillinger: Betragt Midjourney som dit kreative værktøj, fyldt med avancerede indstillinger, der giver dig mulighed for at finjustere dine genererede billeder. Det er som at have en magisk tryllestav, der giver dig mulighed for at fremkalde den ideelle balance mellem tilfældighed, stilisering og billedvariation. Udnyt dine kreative evner ved at eksperimentere med disse indstillinger, indtil du finder den perfekte blanding, der harmonerer med din vision. Eksempler:
    • En fredfyldt japansk have med en dam, der reflekterer kirsebærtræerne –seed 22 –s 150 –c 40
    • En dystopisk cyberpunk-by, oplyst af neonlys –seed 88 –s 600 –c 60
  4. Markering af elementer med vægte: Forestil dig dit billede som en symfoni, hvor hvert element bidrager til det store ensemble. Ved at bruge “::”notationen kan du diktere betydningen af forskellige elementer i dit billede, hvilket giver dig mulighed for at kontrollere spotlyset. Eksempler:
    • [En elegant pavel]::3 sad på en [visteriatræ]::1 i fuld blomst
    • [En majestætisk elefant]::2 badende i gløden af en [solnedgang]::1 på savannen
  5. Midjourney er en proces af prøvning og fejl: Eksperimentering med forskellige elementer og funktioner er nødvendigt. Hver iteration vil bringe dig tættere på billedet, du forestillede dig at bringe til live.

Mid-Journey parametre

Midjourneys model opererer med justerbare parametre, der kontrollerer billedgenereringsprocessens udfald. Disse parametre giver brugerne mulighed for at finjustere og tilpasse deres genererede kunst, hvilket giver dem mulighed for at skabe udfald, der passer perfekt til deres mål.

Herunder følger de grundlæggende og avancerede parametre, deres funktioner og hvordan du kan bruge dem til at fuldt ud udnytte Midjourneys muligheder:

  • Aspektforhold (–aspect eller –ar): Dette parameter kontrollerer forholdet mellem bredde og højde af det genererede billede. F.eks. er et forhold på 16:9 perfekt til YouTube-miniaturer, mens 1:1 producerer et kvadratisk billede, der er godt til Instagram.
  • Kaos (–chaos): Dette parameter justerer diversiteten af den initiale billedgrid og varierer fra 0 til 100. Højere kaosværdier giver dig uforudsigelige og unikke resultater, mens lavere værdier sikrer mere konsistente resultater.
  • Ingen (–no): Dette parameter hjælper dig med at eliminere bestemte elementer eller karakteristika fra det genererede billede. F.eks. hvis du ønsker et billede uden noget rødt, kan du bruge “–no rødt”.
  • Kvalitet (–quality eller –q): Dette indstilling justerer den tid, der kræves til at generere et billede. Højere kvalitet kræver mere proces tid, men giver intrikate detaljer. Dette parameter kan antage værdier på .25, .5, 1 eller 2.
  • Frø (–seed): Dette parameter bestemmer den visuelle støj, der bruges som grundlag for det genererede billede. Brug af samme frønummer med samme prompt giver lignende resultater. Det accepterer heltalsværdier mellem 0–4294967295.
  • Stop (–stop): Med dette parameter kan du afbryde en opgave for tidligt, hvilket giver mindre detaljerede, men muligvis interessante resultater. Området er 10-100. F.eks. hvis du specificerer ‘–stop 50’, vil billedgenereringsprocessen stoppe ved 50% færdiggørelse, hvilket giver et mindre detaljeret, muligvis abstrakt billede.
  • Stilisering (–stylize eller –s): Dette kontrollerer niveauet af kunstnerisk tilføjelse på det genererede billede. Lavere stilisering giver resultater, der er tættere på den oprindelige prompt, mens højere værdier giver mere abstrakte og kunstneriske fortolkninger. I v5 er standardværdien 100, men du kan sætte den til hvilket som helst værdi mellem 0-1000.
  • Modelversion: Du kan vælge mellem forskellige versioner af Midjourney-modellen ved at bruge –version eller –v-parametren.
  • Niji: En model specialiseret i anime-stil-billeder. Den kan aktiveres ved at bruge –niji-parametren.
  • Høj opløsning: Til abstrakte og landskabsbilleder aktiverer –hd-parametren en tidlig modelversion, der giver større, mindre konsistente billeder.
  • Testmodeller: Midjourney tilbyder særlige modeller til bestemte brugsområder. –test og –testp aktiverer standard- og fotofokuserede testmodeller, henholdsvis.
  • Opskalering: Midjourneys algoritme starter med et lavopløsningsbilledegrid. Den tilbyder flere opskalingsmodeller til at forbedre billedstørrelse og detaljer.
    • Uplight: En alternativ lysopskalering (–uplight) giver opskalerede billeder, der er mindre detaljerede, men glattere.
    • Upbeta: –upbeta-parametren giver billeder med væsentligt færre ekstra detaljer, og holder sig tættere til det originale gridbillede.
    • Upanime: –upanime-opskaleringen er specielt designet til at arbejde med –niji Midjourney-modellen.
  • Billedevægt: Brug –iw til at justere billedpromptvægten i forhold til tekstvægt. Standardværdien er 0,25.
  • Sameseed: –sameseed-parametren sikrer, at alle billeder i den initiale grid bruger samme startstøj, hvilket giver meget lignende genererede billeder.
  • Video: Midjourney kan gemme en fremgangsvideo af den initiale billedgridgenereringsproces ved at bruge –video-parametren.
  • Kreativ: Med –kreativ-parametren giver test- og testp-modellerne mere varierede og kreative billeder.

Midjourney udgiver konsekvent opdateringer for at forbedre brugeroplevelsen, med den seneste version 5.2, lanceret i juni 2023. Ved at tilføje –v 5.2 til din prompt eller vælge det via /settings-kommandoen kan brugere få adgang til denne avancerede model. Version 5.2 tilbyder overlegen billed detaljering og forstår prompts mere intuitivt, hvilket bringer lysere farver og forbedrede kompositioner.

Forståelse af ophavsret til AI-genereret kunstværk

Midjourney-billede af blanding af AI og ophavsretslove

I marts 2023 klargjorde det amerikanske ophavsrets kontor sin holdning til ophavsretten til AI-genererede værker. Politikken fastslår, at mens de menneskeskabte elementer i AI-kreationer (såsom skrifter eller unikke design) kan beskyttes, kvalificerer AI-producerede billeder sig ikke til ophavsret, i overensstemmelse med globale normer, der kun tillader menneskeskabte værker at være berettiget til ophavsretsbeskyttelse.

I sammenhæng med AI-kunst er ophavsret ikke ligetil. Mens digital kunst har den menneskeskabte kunstners input, er AI-genereret kunst skabt uden direkte menneskelig indgriben, hvilket komplicerer spørgsmålet om forfatterskab og ejerskab. Ifølge det amerikanske ophavsrets kontor gives den oprindelige ejerskab til værkets forfatter – en menneskelig skaber. Dog, da AI ikke kan betragtes som en forfatter, mangler AI-genereret kunst en klar ejer.

Den seneste vejledning fra det amerikanske ophavsrets kontor tillader ophavsret til AI-kunst kun, når den indeholder tilstrækkelig menneskeskabt forfatterskab. Niveauet af ’tilstrækkelig menneskeskabt forfatterskab’ er dog ikke defineret og afhænger af graden af menneskelig indgriben i skabelsen af AI-kunstværket.

Interessant nok har Midjourney, en AI-baseret platform til billedskabelse, etableret sine egne politikker for brugsrettigheder. Brugere af gratis prøveversion kan bruge billederne til ikke-kommercielle formål under Creative Commons Attribution-NonCommercial 4.0 International License (CC BY-NC 4.0), med korrekt kreditering til Midjourney. Dog kan betalende abonnenter bruge billederne til enhver formål, herunder kommercielle, under Almindelige Kommercielle Betingelser. Denne udvikling i ophavsretsrummet præsenterer en interessant dynamik mellem AI og menneskelig kreativitet.

Udnyttelse af Midjourney til dynamiske UI-designs og kreative logo-generering

Fra design af intuitive brugerflader til websteder eller mobile apps til skabelse af unikke logoer og banner, giver Midjourney indholdsskabere mulighed for at generere en række designalternativer inden for sekunder.

Sådan fungerer det. Hvert design begynder med en prompt, der fungerer som en skitse, som AI’en kan følge. Antag, du designer en brugerflade til en online-undervisningsplatformsapp. En typisk prompt kunne være: “/imagine Online-undervisningsplatforms brugerflade, Dribbble, høj opløsning, 4K, som khan academy”.

De første resultater kan måske ikke ramme plet helt. F.eks. kan tilføjelse af “Adobe XD” muligvis hjælpe Midjourney med at tilpasse sine designs til at være mere Adobe XD-kompatible. En optimeret prompt ville være:

/imagine Online-undervisningsplatform, brugerflade, Adobe XD, Dribbble, høj opløsning, 4K, minimalistisk design

Midjourney-billede af desktop-app UI/UX-design

 

Tekst-inspireret logo eller banner med Midjourney

Lad os se, hvordan du kan skabe en banner med et logo til UNITE AI.

Først skal du have et enkelt billede af den tekst, du ønsker at vise. Du kan skabe dette ved hjælp af et hvilket som helst grafisk designværktøj eller teksteditor og uploade det til din Discord-kanal.

eksempeltekst til UNITE-logo
Et enkelt billede af tekst brugt til at skabe UNITE-logo

Prompten til at skabe banneret er:

/imagine Bogstaver: <link til et enkelt billede af tekst til visning> UNITE i en fremtidig, AI-inspireret skrifttype logo med bogstaver UNITE –v 5 –ar 16:9

Midjourney Prompt Guide-funktionsskærm

Se disse eksempelprompts for mere inspiration:

/imagine En enkelt musiker, der spiller en fredfyldt melodi på en flydende bycykel ved solnedgang, art nouveau-stil

Midjourney Prompt Guide: Billede af indisk kunst

 

/imagine Et billede af en fremtidig person, der arbejder på en fremtidig skrivebord, omgivet af holografiske skærme og avanceret teknologi. Personen bærer en elegant, sølv jumpsuit og har virtual reality-briller på. Miljøet er fremtidigt og højteknologisk, med en følelse af spænding og innovation. Kameraet er et højopløsningsdigitalt kamera, der fanger hver enkelt detalje med præcision. Den kunstneriske stil er en blanding af cyberpunk og minimalisme, med fokus på rene linjer og klare farver. De instruktører, fotografere, fashiondesignere, tegneserietegnere og kunstnere, der samarbejder i denne unikke kombination, er Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki og Kaws.

Midjourney-prompt for en fremtidig person, der arbejder

/imagine 1940’er-stil Barbie som en krigssygeplejerske, i en vintage armehospital-miljø, der plejer de sårede soldater, i stilen af klassiske Mattel-illustrationer, med atmosfæren af sepia-tonede verdenskrigsfotografering 8k –v 5 –ar 16:9

Midjourney Prompt Guide: Billede af Barbie i unikke miljøer

/imagine Ramme af en kvinde, der læner sig mod en cyberpunk, hoverbike, japansk anime, udbredt bylandskab, 32k, intrikat rumhavn, flygtig, skyskrabers panoramer, elegant

Midjourney-billede af cyberpunk-stil pige

 

Afsluttende tanker: Navigation i AI-kunstverdenen med Midjourney

Husk, “Et billede er værd at tale mere end tusinde ord”. En detaljeret, levende beskrivelse kan virke vidunder. Ja, Midjourney er ikke gratis at bruge. Dog er det revolutionerende kunstverdenen og udvider vores kreative muligheder gennem sin avancerede tekst-til-billede AI-teknologi. Med evnen til at konvertere en simpel tekstprompt til et højopløsningsbillede er det et værktøj, der lover ubegrænsede muligheder, ikke kun for kunstnere, men også for UI/UX-designere, teknologi-entusiaster og AI-fagfolk.

Her er nogle væsentlige punkter at huske, når du påbegynder din Midjourney-eventyr:

  • Lær grundlæggende om Midjourney-prompt: Brug klare, koncise og omfattende beskrivelser, der indkapsler din vision, til at guide AI’en effektivt. Husk at overveje din målgruppe og vær ikke bange for at eksperimentere med forskellige stilarter, humør og kontekster.
  • Udnyt parametre: Forbedr din kreative oplevelse ved at udnytte de mange avancerede indstillinger, som Midjourney tilbyder. Fra kontrol af aspektforhold til justering af kaosparametre for unikke resultater kan hver enkelt detalje tilpasses til din foretrukne.
  • Acceptér den iterative proces: Dit første AI-genererede kunstværk kan måske ikke være perfekt. Acceptér denne iterative proces og lær at finjustere og optimere dine prompts for bedre resultater.
  • Forstå ophavsretsimplikationer: Mens AI-genererede kunstværker i sig selv ikke er berettiget til ophavsret, kan de menneskeskabte komponenter indenfor dem beskyttes.

I essensen har integrationen af AI i kunst demokratiseret kreativitet og udvisket grænserne mellem menneske- og maskinlavet mesterværk. Da vi fortsætter med at vidne til den bemærkelsesværdige vækst af generativ AI på kunstmarkedet, er det uafviseligt, at AI-kunst-revolutionen, ledet af platforme som Midjourney, er lige begyndt.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.