Prompt engineering

Mesteri i AI-kunst: En komprimert guide til Midjourney og promptingeniør

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Midjourney Generated UNITE AI LOGO

Introduksjon til MidJourney AI-generert kunst

AI bryter raskt gjennom barrierer av umulighet og har nylig invadert kunstens domene, og transformerer det fullstendig. Nå trenger du ikke å være en mesterkunstner eller en ekspert på Photoshop for å bringe fantasien din til live. En enkel, godt strukturert prompt er alt du trenger, takket være Midjourney.

Det begynte med introduksjonen av banebrytende teknologier som DALL-E, Midjourney og StableDiffusion i 2022. Mens hver av disse innovasjonene bragte sin unike touch til generativ AI, har Midjourney fortsatt sin fascinerende reise, og gjort bemerkelsesverdige skritt.

Midjourney er for tiden den ledende høyoppløselige tekst-til-bilde AI-generatoren på markedet, og det står tall med sin unike blanding av tekst-til-bilde generering, medie redigering og oppskalering, og aktiv kunstner samfunn tilgang, alt fra 10 dollar per måned. Dette omfattende sett med funksjoner presenterer en spennende canvas for kunstnere, teknologi entusiaster og AI profesjonelle, og bygger en miljø for kreativitet og innovasjon.

Kunstverdenen tar definitivt merke til, med generativ AI i kunstmarkedet projektert å være vitne til en imponerende vekst på 40,5% CAGR. Midjourney står uovertruffen i å lage de mest realistiske og høykvalitets visuelle bilder med AI.

Effektiv promptingeniør går langt utenfor bare skapelse; det omfatter beste praksis. Prompts bør gi klarhet, og være konsist, men gi AI-en nok veiledning uten å være for preskriptiv. Dessuten må målgruppen være med i designet, og ta hensyn til variabler som alder, kjønn og kulturell bakgrunn, blant annet.

Hvordan fungerer MidJourney?

Mid-Journey utnytter to nye maskinlærings teknologier – store språk og diffusjonsmodeller. Språkmodellen, lik AI-chatboter som ChatGPT, hjelper Mid-Journey med å tolke betydningen av dine prompts og konvertere dem til vektorer. Denne vektoren guider deretter diffusjonsprosessen.

Midjourneys indre mekanismer er stort sett ukjent. Likevel er det tydelig at det bruker tekst-til-bilde generering fra to relativt nye maskinlærings teknologier: store språkmodeller og diffusjonsmodeller. Den førstnevnte er kanskje kjent for brukere av AI-plattformer som ChatGPT, og den sistnevnte er en lovende tillegg til AI-kunst genereringssektoren. Hele systemet er avhengig av CLIP datasettet for trening, som kan finnes på OpenAIs forskningsside.

Til tross for begrensede informasjon, er det mulig å skisse en bred bildeskitse av Midjourneys diffusjonsmodell, kalt ‘Stable Diffusion’. I essensen er Stable Diffusion en åpen kildekode modell som dyktig transformerer tekstprompts til bilder av varierende stiler og innhold. Denne sofistikerte prosessen oppnås gjennom en diffusjonsmodell, en generativ modell som broer avhengighetene mellom tekstuelle inndata og bilde utdata.

Diffusjonsmodeller er bygget på grunnlag av Denoising Diffusion metoden, en tilnærming influert av ikke-likvid termodynamikk. Denne metoden demonterer systematisk strukturen av data og restaurerer den deretter. Denne tilnærmingen ble tilpasset for bilde generering av Ho et al. i 2020, og ledet til oppfinnelsen av diffusjonsmodellene vi ser i dag.

Trening av diffusjonsmodeller involverer to primære faser. Først, den fremover eller diffusjonsprosessen, innebærer inkrementell tilføyelse av tilfeldig støy til inndata bildet til det fullstendig forvandler seg til støy. Denne prosessen styres av en fast Markov-kjede, som konsistent tilføyer Gaussisk støy over flere påfølgende skritt.

Midjourney arbeidsdemonstrasjon

Deretter, i den omvendte eller rekonstruksjonsfasen, restaurerer modellen den opprinnelige data fra støydominert tilstand oppnådd i diffusjonsprosessen. Denne prosessen drives av en Markov-kjede med lært Gaussisk overgang, hvilket betyr at prediksjonen av sannsynlighets tetthet på et gitt tidspunkt er kun avhengig av tilstanden oppnådd i det foregående tidspunktet. Ettersom de latente ‘x1, …, xT’ deler samme dimensjonalitet som data, klassifiserer diffusjonsmodeller som latente variabelmodeller.

Kostnad og abonnement for Mid-Journey

Mens mange chatboter som ChatGPT og Bing Chat tilbyr nesten ubegrenset bruk gratis, er scenariet annerledes for bilde genereringer som Mid-Journey. På grunn av den betydelige datamaskinkraften som kreves, spesielt fra grafikkprosessorer og video minne bruken for denoising prosessen, kommer Mid-Journeys tjeneste med en prislapp.

Grundplanen starter fra 10 dollar per måned, og gir omtrent 3,3 timer med GPU-tid, nok for omtrent 200 bilde genereringer. Det finnes likevel høyere planer som tilbyr ubegrenset bilder i Relaxed modus, dog med en lengre ventetid.

Oppsett av din MidJourney

  1. Start med MidJourney ved å registrere deg på deres offisielle nettsted, abonnere på en plan, og deretter bli omdirigert til Discord.
  2. Når du finner Mid-Journey kanalen på Discord, naviger til Newcomer Groups på venstre side. Derfra kan du observere andre brukere som lager prompts, lære mekanismene til Mid-Journey, og interagere i en travelt miljø.
  3. Etter å ha kjent deg med miljøet, inviter boten til din private server for å lage bilder uten forstyrrelser. Boten genererer fire forhåndsvisningsbilder basert på din prompt, og lar deg velge det nærmeste matchet til din opprinnelige idé og deretter finjustere bildet.

Prompt struktur for Midjourney

  1. /imagine kommandoen i en Discord-kanal innenfor Midjourney-kanalen genererer et unikt bilde fra en kort tekstbeskrivelse (Prompt).
  2. For å gjenskape en bestemt stil over flere bilder, skriv bare inn bildelenken sammen med din tekstprompt. Dine nye, konsistente utdata vil kombinere elementer fra både ditt valgte bilde og tekst.
    /imagine http://link-til-ditt-bilde <bildbeskrivelse> –parameter1 –parameter2
    Du kan generere en lenke til ditt bilde ved å laste det opp til Discord-kanalen. Når du har lastet det opp, høyreklikk på bildet og velg ‘Kopier lenke’.
    Her http://link-til-ditt-bilde og parameterne er valgfrie.
  3. Deretter setter boten i gang på ditt bilde, og tar omtrent ett minutt å tilby fire alternativer. Denne prosessen involverer bruk av robuste grafikkprosessorer for å prosessere og tolke hver prompt.
  4. Hold øye på din GPU-bruken ved å bruke /info kommandoen. Den lar deg sjekke ‘Fast Time Remaining’ og overvåke din abonnements GPU-tid.

/info prompt midjourney

Bilde oppskalering og endringer

For et mer raffinert bilde, bruk ‘U’ knappene under bildene for å oppskalere ditt foretrukne valg. Du kan også bruke ‘V’ knappene til å gjøre justeringer på bestemte bilder. For ytterligere endringer i et oppskalert bilde, bruk ‘Lag variasjoner’, ‘Light Oppskalering Gjør om’, og ‘Beta Oppskalering Gjør om’ alternativene. ‘Web’ knappen lar deg se bildet i en større størrelse i et eget vindu.

Midjourney tillater bilde oppskalering til 2048×2048 (kvadratisk) og 2720×1530 (widescreen) oppløsninger via sin beta oppskalering gjør om funksjon, med en standard genereringsrutenett størrelse på 1024×1024 (kvadratisk) og 1456×816 (widescreen). Hvert bilde kan bli ytterligere forbedret gjennom “U” oppskalering alternativene, som forbedrer bestemte deler av bildet.

Se på denne prompten som produserer fantastisk kunst med Midjourneys V5.2 versjon.

/imagine Kunstverk som viser en ensom tre under en stjernehimmel, med et barn som leser under, i fargene av seren blå og varm oransje, inspirert av penselstrøkene til fransk impresjonisme, persiske miniatyrer, Bauhaus enkelhet, som fremkaller klassiske barne eventyr illustrasjoner, oppnår en asymmetrisk harmoni, uttrykt i en fortryllende, folk/naiv: –ar 15:19 –upbeta –q 2

Midjourney Prompt Guide eksempel

Opprettelse av din første Midjourney AI-kunst

  1. Utforming av den grunnleggende blåkopien: Tenk på deg selv som en kunstner. Begynn med en enkel, levende beskrivelse av bildet du ønsker å bringe til live. Skissér hovedemnet, atmosfæren eller selv de minste detaljene du ønsker å innlemme. Bruk punktum, klammer og bindestreker til å strukturere dine tanker. For bedre resultater, vær eksplisitt om din designs kontekst og detaljer. Elementer som emne (f.eks. Drage, vintage bil, Abraham Lincoln), medium (f.eks. digital kunst, blyant tegning), miljø (f.eks. verdensrom, under vann, travelt by), lys (f.eks. mykt, neon, baklys), farge (f.eks. jordtoner, vibrerende, dæmpet), humør (f.eks. melankolsk, fantasifullt, fredelig), og komposisjon (f.eks. landskap, nærbilde, vidvinkel) kan være avgjørende. Eksempler:
    • En idyllisk skog badet i sollys, en sti som slynger seg inn i fjernsynet
    • En by som aldri sover, med neon lys som reflekterer av fortauet og en mangfoldig folkemengde som myldrer omkring
  2. Innføring av stil og nøkkelord: Midjourneys AI er i stand til å illustrere bilder i en mengde stiler, som abstrakt, surrealistisk eller realistisk. Ved å integrere en stil eller relaterte nøkkelord, kan du guide AI-en til å lage et bilde som speiler din visjon. Eksperimenter med ulike stiler og nøkkelord for å finne den perfekte blandingen. Eksempler:
    • Et landskapsmaleri som viser en ørken ved daggry, som speiler stilen til Georgia O’Keeffe, med en pastell fargepalett og organiske former.
    • En abstrakt gjengivelse av en fredelig skog, med geometriske mønster som danner trær og løvverk, inspirert av Piet Mondrians komposisjoner.
  3. Utnytting av avanserte innstillinger: Tenk på Midjourney som ditt kreative verktøy, fullt av avanserte innstillinger som lar deg finjustere dine genererte bilder. Det er som å håndtere en magisk tryllestav, som lar deg konstruere den perfekte balansen av tilfeldighet, stilisering og bilde variasjon. Uttrykk din kreative kraft ved å eksperimentere med disse innstillingene til du finner den perfekte blandingen som resonnerer med din visjon. Eksempler:
    • En seren japansk hage med en dam som reflekterer kirsebærtrærne –seed 22 –s 150 –c 40
    • En dystopisk cyberpunk by, opplyst av neon lys –seed 88 –s 600 –c 60
  4. Highlighting av elementer med vekter: Visualiser ditt bilde som en symfoni, hvor hvert element bidrar til det store ensemblet. Ved å bruke “::” notasjonen, kan du diktere betydningen av ulike elementer i ditt bilde, og lar deg kontrollere søkelyset. Eksempler:
    • [En elegant pavn]::3 plassert på en [visteria tre]::1 som blomstrer med fargerike blomster
    • [En majestetisk elefant]::2 som bader i gløden av en [solnedgang]::1 på savannen
  5. Midjourney er en prosess av prøving og feiling: Eksperimentering med ulike elementer og funksjoner er nødvendig. Hver iterasjon vil bringe deg nærmere bildet du forestiller deg å bringe til live.

Mid-Journey parametre

Modellen til Midjourney opererer med justerbare parametre som kontrollerer resultatet av bilde genereringsprosessen. Disse parameterne lar brukerne justere og tilpasse sine genererte kunst, finjustere modellen til å lage utdata som passer perfekt til deres mål.

Under er de grunnleggende og avanserte parameterne, deres funksjoner og hvordan de kan brukes til å fullt utnytte Midjourneys kapasiteter:

  • Forhold (–aspect eller –ar): Denne parameteren kontrollerer forholdet mellom bredden og høyden av det genererte bildet. For eksempel er et forhold på 16:9 perfekt for YouTube miniaturer, mens 1:1 produserer et kvadratisk bilde som er godt for Instagram.
  • Kaos (–chaos): Denne parameteren justerer mangfoldet av den innledende bilde rutenettet og varierer fra 0 til 100. Høyere kaosverdier vil gi uforutsigbare og unike resultater, mens lavere verdier vil sikre mer konsistente resultater.
  • Nei (–no): Denne parameteren hjelper deg å eliminere bestemte elementer eller egenskaper fra det genererte bildet. For eksempel, hvis du ønsker et bilde uten noen rød, kan du bruke “–no rød”.
  • Kvalitet (–quality eller –q): Denne innstillingen justerer tiden det tar å generere et bilde. Høyere kvalitet krever mer prosesseringstid, men gir detaljerte detaljer. Denne parameteren kan ta på verdier av .25, .5, 1 eller 2.
  • Frø (–seed): Denne parameteren bestemmer den innledende visuelle støyen, som fungerer som en basis for det genererte bildet. Ved å bruke samme frønummer med samme prompt, vil du få lignende resultater. Den aksepterer heltallsverdier mellom 0–4294967295.
  • Stopp (–stop): Med denne parameteren kan du forhaste en jobb, og produsere mindre detaljerte, men potensielt interessante resultater. Området er 10-100. For eksempel, hvis du spesifiserer ‘–stop 50’, vil bildet genereringsprosessen stoppe på 50% fullføring, og produsere et mindre detaljert, muligens abstrakt bilde.
  • Stilisering (–stylize eller –s): Denne kontrollerer nivået av kunstnerisk anvendelse på det genererte bildet. Lavere stilisering verdier gir resultater som er nærmere den innledende prompten, mens høyere verdier resulterer i mer abstrakte og kunstneriske tolkninger. I v5 er standardverdien 100, men du kan sette den til hvilket som helst verdi mellom 0-1000.
  • Modellversjon: Du kan velge mellom ulike versjoner av Midjourney modellen ved å bruke –version eller –v parameteren.
  • Niji: En modell spesialisert i anime-stil bilder. Den kan aksesseres ved å bruke –niji parameteren.
  • Høyoppløst definisjon: For abstrakte og landskapsbilder, aktiverer –hd parameteren en tidlig modellversjon som produserer større, mindre konsistente bilder.
  • Testmodeller: Midjourney tilbyr spesiale modeller for bestemte brukstilfeller. –test og –testp aktiverer standard og fotografi-fokusert testmodellene, henholdsvis.
  • Oppskaler: Midjourney algoritmen starter med et lavoppløst bilde rutenett. Den tilbyr flere oppskalering modeller for å forbedre bilde størrelse og detalj.

Midjourney ruller kontinuerlig ut oppdateringer for å forbedre brukeropplevelsen, med den siste versjonen 5.2 lansert i juni 2023. Ved å legge til –v 5.2 til din prompt eller velge det gjennom /settings kommandoen, kan brukerne aksessere denne avanserte modellen. Versjon 5.2 tilbyr overlegen bilde detaljering og forstår prompts mer intuitivt, og bringer lysere farger og forbedrede komposisjoner.

Forståelse av opphavsrett for AI-generert kunstverk

Midjourney bilde av blanding av AI og opphavsrett lover

I mars 2023, klargjorde det amerikanske opphavsrettskontoret sin holdning til opphavsretten til AI-genererte verk. Politikken sier at mens de menneskeskapte elementene i AI-skapninger (som skrifter eller unike design) kan beskyttes, kvalifiserer AI-produserte bilder ikke for opphavsrett, i samsvar med globale normer som kun menneskeskapte verk er kvalifisert for opphavsrettsbeskyttelse.

I sammenheng med AI-kunst er opphavsrett ikke enkelt. Mens digital kunst har menneskelig kunstnerisk innsats, er AI-generert kunst skapt uten direkte menneskelig inngripen, noe som kompliserer spørsmålet om forfatterskap og eierskap. Ifølge det amerikanske opphavsrettskontoret, tildeles opphavsrett til verkets forfatter – en menneskelig skaper. Imidlertid, siden AI ikke kan anses som en forfatter, mangler AI-generert kunst tydelig eierskap.

Den siste retningslinjen fra det amerikanske opphavsrettskontoret tillater opphavsrett til AI-kunst bare når den inneholder tilstrekkelig menneskelig forfatterskap. Nivået av “tilstrekkelig menneskelig forfatterskap” er ikke definert og avhenger av graden av menneskelig inngripen i å skape AI-kunstverket.

Interessant nok har Midjourney, en AI-basert plattform for bilde generering, etablert sine egne retningslinjer for bruksrettigheter. Brukere av gratis prøveversjon kan bruke bildene for ikke-kommersielle formål under Creative Commons Attribution-NonCommercial 4.0 Internasjonal Lisens (CC BY-NC 4.0), med korrekt kreditering til Midjourney. Imidlertid kan betalende abonnenter bruke bildene til enhver formål, inkludert kommersielle, under Generelle Kommersielle Vilkår. Denne utviklingen i opphavsrettsrommet presenterer en interessant dynamikk mellom AI og menneskelig kreativitet.

Utnytting av Midjourney for dynamiske UI-design og kreative logo generering

Fra å designe intuitive UI-er for nettsider eller mobilapper til å lage unike logoer og banner, Midjourney gir kreatørene mulighet til å generere en rekke design alternativer innen sekunder.

Hvordan det fungerer. Hvert design begynner med en prompt, som fungerer som en blåkopi for AI-en å følge. Anta at du designer en UI for en nettbasert tutor app. En typisk prompt kan være: “/imagine Nettbasert tutor plattform brukergrensesnitt, Dribbble, Høy oppløsning, 4K, lik khan akademi”.

De innledende resultater kan ikke være perfekte. For eksempel, å legge til “Adobe XD” i blandingen kan hjelpe Midjourney til å tilpasse designene til å være mer Adobe XD-kompatible. En optimalisert prompt vil være:

/imagine Nettbasert tutor plattform, brukergrensesnitt, Adobe XD, Dribbble, Høy oppløsning, 4K, minimalistisk design

Midjourney bilde av Skrivebordsapp UI/UX design

 

Tekst-inspirert logo eller banner med Midjourney

La oss se hvordan du kan lage en banner med en logo for UNITE AI.

Først må du ha et enkelt bilde av teksten du ønsker å vise. Du kan lage dette ved å bruke en grafisk design verktøy eller teksteditor og laste det opp til din Discord-kanal.

eksempel tekst for UNITE LOGO
En enkel bilde av tekst brukt til å lage UNITE Logo

Prompten for å lage banneret er:

/imagine Bokstaver: <lenke til et enkelt bilde av tekst som skal vises> UNITE i en futuristisk, AI-inspirert typografi logo med bokstaver UNITE –v 5 –ar 16:9

Midjourney Prompt Guide funksjonsskjermbilde

Se på disse eksempel promptene for flere ideer:

/imagine En ensom musiker som fremfører en seren melodi på en flytende by på skumringen, art nouveau stil

Midjourney Prompt Guide: Bilde av indisk kunst

 

/imagine Et bilde av en fremtidig person som arbeider på en fremtidig skrivebord, omgitt av holografiske skjermer og avansert teknologi. Personen er iført en strømlinjeformet, sølv drakt og har virtuell reality briller på. Miljøet er fylt med neon lys og flytende hologrammer. Atmosfæren er fremtidig og høyteknologisk, med en følelse av spenning og innovasjon. Kameraet er et høyoppløst digitalt kamera, som fanger hver detalj med presisjon. Den kunstneriske stilen er en blanding av cyberpunk og minimalisme, med fokus på rene linjer og sterke farger. Regissørene, filmfotografene, fotografene, motedesignerne, tegneseriekunstnerne og kunstnerne som samarbeider i denne unike sammenstillingen er Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki og Kaws.

Midjourney prompt for en fremtidig person som arbeider

/imagine 1940-talls stil Barbie som en krigstid sykepleier, i en vintage armé sykehus setting, som pleier sårede soldater, i stilen til klassiske Mattel illustrasjoner, med atmosfæren til sepia-tonet andre verdenskrigs fotografi 8k –v 5 –ar 16:9

Midjourney Prompt Guide: Bilde av Barbie i unike settinger

/imagine Ramme av en kvinne som lener seg mot en cyberpunk, hoverbike, japansk anime, sprengende bylandskap, 32k, intrikat romstasjon, flyktig, skyskraper panoramautsikt, strømlinjeformet

Midjourney bilde av cyberpunk stil kvinne

 

Slutt tanker: Navigering i AI-kunst verden med Midjourney

Husk på at “Et bilde er verdt mer enn tusen ord”. En detaljert, levende beskrivelse kan gjøre underverker. Ja, Midjourney er ikke gratis å bruke. Likevel er det revolusjonerer kunstverdenen og utvider våre kreative muligheter gjennom sin state-of-the-art tekst-til-bilde AI-teknologi. Med evnen til å konvertere en enkel tekstprompt til et høyoppløst bilde, er det et verktøy som lover ubegrensede muligheter, ikke bare for kunstnere, men også for UI/UX designere, teknologi entusiaster og AI profesjonelle.

Her er noen viktige takeaways å huske på når du begynner din Midjourney eventyr:

  • Lær grunnleggende Midjourney prompt: Bruk klare, konsise og omfattende beskrivelser som innkapsler din visjon for å guide AI-en effektivt. Husk å vurdere din målgruppe, og vær ikke redd for å eksperimentere med ulike stiler, humør og kontekster.
  • Utnytt parameterne: Forbeder din kreative opplevelse ved å utnytte de mange avanserte innstillingene som Midjourney tilbyr. Fra å kontrollere forholdet til å justere kaos parameteren for unike resultater, kan hver detalj tilpasses til din preferanse.
  • Omfavne den iterative prosessen: Ditt første AI-genererte kunstverk kan ikke være perfekt. Omfavne denne iterative prosessen og lær å finjustere og optimalisere dine prompts for bedre resultater.
  • Forstå opphavsrettsimplikasjonene: Mens AI-genererte kunstverk i seg selv ikke kvalifiserer for opphavsrett, kan de menneskeskapte komponentene i dem beskyttes.

I essensen har integreringen av AI i kunst demokratisert kreativitet og utvisket grensene mellom menneskeskapt og maskin-generert mesterverk. Mens vi fortsatt vitner den imponerende veksten av generativ AI i kunstmarkedet, er det uimotståelig at AI-kunst revolusjonen, ledet av plattformer som Midjourney, er bare i begynnelsen.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.