Prompt engineering
Mästerskap i AI-konst: En koncis guide till Midjourney och promptteknik

Introduktion till MidJourney AI-genererad konst
AI bryter snabbt igenom gränserna för det omöjliga och har nyligen invaderat konstens domän, transformerande den helt. Nu behöver du inte vara en mästerkonstnär eller en expert på Photoshop för att förverkliga dina fantasiers skapelser. En enkel, välformulerad prompt är allt du behöver, tack vare Midjourney.
Det började med introduktionen av banbrytande teknologier som DALL-E, Midjourney och StableDiffusion år 2022. Medan var och en av dessa innovationer förde sin unika touch till generativ AI-konst, har Midjourney i synnerhet fortsatt sin fascinerande resa, görande betydande framsteg.
Midjourney är för närvarande den ledande högupplösta text-till-bild AI-genereraren på marknaden och står stark med sin unika kombination av text-till-bild generering, mediebearbetning och uppskalning, samt aktiv konstnärscommunity, allt från 10 dollar i månaden. Denna omfattande uppsättning funktioner presenterar en spännande canvas för konstnärer, teknikentusiaster och AI-proffs, byggande en miljö för kreativitet och innovation.
Konstvärlden tar definitivt notis, med generativ AI på konstmarknaden förväntad att uppleva en förbluffande tillväxt på 40,5% CAGR. Midjourney står obesegrat i att skapa de mest realistiska och högkvalitativa visuella verk med hjälp av AI.
Effektiv promptteknik går utöver skapandet; den omfattar bästa praxis. Prompts bör erbjuda tydlighet, vara koncisa, men ge AI tillräcklig vägledning utan överdriven preskription. Dessutom måste målgruppen beaktas under design, med hänsyn till variabler som ålder, kön och kulturell bakgrund, bland annat.
Hur fungerar MidJourney?
Mid-Journey använder två nya maskinlärningsteknologier – stora språk- och diffusionsmodeller. Språkmodellen, liknande AI-chattbotar som ChatGPT, hjälper Mid-Journey att tolka meningen med dina prompts och omvandla dem till vektorer. Denna vektor vägleder sedan diffusionsprocessen.
Midjourneys inre funktioner är till stor del inte offentliggjorda. Trots detta är det uppenbart att det använder text-till-bild generering från två relativt nya maskinlärningsteknologier: stora språkmodeller och diffusionsmodeller. Den förra är kanske bekant för användare av AI-plattformar som ChatGPT, och den senare är ett lovande tillskott till AI-konstgenereringssektorn. Hela systemet förlitar sig på CLIP-datamängden för träning, som kan hittas på OpenAIs forskningssida.
Trots den begränsade informationen är det möjligt att skissa en bred bild av Midjourneys diffusionsmodell, passande benämnd ‘Stable Diffusion’. I princip är Stable Diffusion en öppen källkodsmodell som skickligt transformerar textprompts till bilder av varierande stilar och innehåll. Denna sofistikerade procedur uppnås genom en diffusionsmodell, en generativ modell som brottar beroenden mellan textuella indata och bildutdata.
Diffusionsmodeller byggs på grunden av den avdämpande diffusionsmetoden, en tillvägagångssätt som påverkas av icke-jämvikts termodynamik. Denna metod demonterar systematiskt datans struktur och återställer den senare. Denna tillvägagångssätt anpassades för bildgenerering av Ho et al. år 2020, vilket ledde till födelsen av de diffusionsmodeller vi ser idag.
Träning av diffusionsmodeller involverar två primära faser. Initialt, den främre eller diffusionsprocessen, innefattar den successiva tilläggen av slumpmässig brus till indata-bilden tills den fullständigt förvandlas till brus. Denna process styrs av en fast Markov-kedja, som konsekvent lägger till Gaussiskt brus över flera på varandra följande steg.
Sedan, i den omvända eller rekonstruktionsfasen, återställer modellen den ursprungliga datan från brusdominerad tillstånd uppnådd under diffusionsprocessen. Denna process drivs av en Markov-kedja med lärd Gaussisk övergång, vilket innebär att förutsägelsen av sannolikhetsdensitet vid en given tidpunkt enbart beror på tillståndet uppnått i föregående tidpunkt. Eftersom de latenta ‘x1, …, xT’ delar samma dimensioner som datan, klassificerar diffusionsmodeller som latenta variabelmodeller.
Kostnad och prenumeration för Mid-Journey
Medan många chattbotar som ChatGPT och Bing Chat erbjuder nästan obegränsad användning gratis, skiljer sig scenariot för bildgenereringsverktyg som Mid-Journey. På grund av den betydande beräkningskraft som krävs, särskilt från grafikprocessorer (GPU) och video-minnesanvändning för avdämpningsprocessen, kommer Mid-Journeys tjänst med en prislapp.
Basplanen startar från 10 dollar i månaden, vilket ger cirka 3,3 timmars GPU-tid, tillräckligt för ungefär 200 bildgenereringar. Det finns dock högre planer som erbjuder obegränsade bilder i Relaxed-läge, men med en längre väntetid.
Konfigurera din MidJourney
- Att börja med MidJourney innebär att registrera dig på deras officiella webbplats, prenumerera på en plan och sedan bli omdirigerad till Discord.
- När du hittar Mid-Journey-kanalen på Discord, navigera till Newcomer Groups på vänster sida. Där kan du observera andra användare som skapar prompts, lära dig mekanismerna i Mid-Journey och interagera i en livlig miljö.
- Efter att du har bekantat dig med miljön, bjud in boten till din privata server för att skapa bilder ostört. Boten genererar fyra förhandsgranskningsbilder baserat på din prompt, vilket låter dig välja den närmaste matchningen till din ursprungliga idé och ytterligare förfinar bilden.
Prompt-struktur för Midjourney
- Kommandot /imagine i en Discord-kanal inom Midjourney-kanalen genererar en unik bild från en kort textbeskrivning (Prompt).
- För att återskapa en specifik stil över olika bilder, mata in bild-URL bredvid din textprompt. Dina nya, konsekventa utdata kommer att kombinera element från både din valda bild och text.
/imagine http://länk-till-din-bild –parameter1 –parameter2
Du kan generera en länk till din bild genom att ladda upp den till Discord-kanalen. När den är uppladdad, högerklicka på bilden och välj ‘Kopiera länk’.
Här http://länk-till-din-bild och parametrar är valfria. - Sedan får boten i Midjourney jobbet att arbeta med din bild, vilket tar ungefär en minut för att erbjuda fyra alternativ. Denna process innefattar användning av robusta grafikprocessorer (GPU) för att bearbeta och tolka varje prompt.
- Håll koll på din GPU-användning med kommandot /info. Det låter dig kontrollera din ‘Fast Time Remaining’ och övervaka din prenumerations GPU-tid.
Bilduppskalning och ändringar
För en mer raffinerad bild, använd knapparna “U” under bilderna för att uppskala din föredragna val. Du kan också använda knapparna “V” för att göra justeringar i specifika bilder. För ytterligare ändringar i en uppskalad bild, använd alternativen “Skapa variationer”, “Ljus uppskalning omgjord” och “Beta uppskalning omgjord”. Knappen “Web” låter dig visa bilden i en större storlek i ett separat fönster.
Midjourney tillåter bilduppskalning till 2048×2048 (kvadratisk) och 2720×1530 (vidskärm) upplösningar via dess beta-uppskalningsfunktion, med en standardgenereringsrutnätstorlek på 1024×1024 (kvadratisk) och 1456×816 (vidskärm). Varje bild kan ytterligare förbättras genom “U” uppskalningsalternativen, som förbättrar specifika delar av bilden.
Titta på denna prompt som producerar fantastisk konst med Midjourneys V5.2-version.
/imagine Konstverk som skildrar en ensam träd under en stjärnbelyst himmel, med ett barn som läser under, i färgerna från seren blå och varm orange, inspirerad av franska impressionismens penseldrag, persiska miniatyrer, Bauhaus enkelhet, påminnande om klassiska barnsagobilder, uppnående en asymmetrisk harmoni, uttryckt i en förtrollande, folk/naiv: –ar 15:19 –upbeta –q 2
Skapa din första Midjourney AI-konst
- Skapa den grundläggande skissen: Tänk dig själv som en konstnär. Börja med en enkel, livfull beskrivning av bilden du vill förverkliga. Rita upp huvudämnet, atmosfären eller till och med de minsta detaljerna du vill infoga. Använd punktation som komma, parentes och bindestreck för att strukturera dina tankar. För bättre resultat, var tydlig med din designs sammanhang och detaljer. Element som subjekt (t.ex. Drak, vintagebil, Abraham Lincoln), medium (t.ex. digital konst, blyertsteckning), miljö (t.ex. yttre rymden, under vatten, livlig stad), belysning (t.ex. mjuk, neon, motljus), färg (t.ex. jordtoner, vibrerande, dämpad), humör (t.ex. melankolisk, nyckfull, fridfull) och komposition (t.ex. landskap, närbild, vidvinkel) kan vara avgörande. Exempel:
- En idyllisk skog badad i solsken, en stig som slingrar sig in i fjärran
- En stad som aldrig sover, med neonlys som reflekteras från trottoarerna och en mångfaldig folkmassa som rör sig
- Inför stil och nyckelord: Midjourneys AI kan illustrera bilder i en mängd olika stilar, som abstrakt, surrealistisk eller realistisk. Genom att integrera en stil eller relaterade nyckelord kan du vägleda AI att skapa en bild som speglar din vision. Experimentera med olika stilar och nyckelord för att upptäcka den perfekta blandningen. Exempel:
- En landskapsmålning som skildrar en öken vid gryningen, speglar stilen hos Georgia O’Keeffe, med en pastellfärgpalett och organiska former.
- En abstrakt rendering av en fridfull skog, med geometriska mönster som bildar träd och lövverk, inspirerad av Piet Mondrians kompositioner.
- Använd avancerade inställningar: Se Midjourney som din kreativa verktygslåda, full av avancerade inställningar som låter dig finjustera dina genererade bilder. Det är som att hantera en magisk stav, som gör att du kan frammana den perfekta balansen mellan slumpmässighet, stilisering och bildvariation. Släpp loss din kreativa kraft genom att experimentera med dessa inställningar tills du hittar den perfekta blandningen som resoneras med din vision. Exempel:
- En fridfull japansk trädgård med en damm som reflekterar körsbärsträden –seed 22 –s 150 –c 40
- En dystopisk cyberpunk-stad, upplyst av neonlys –seed 88 –s 600 –c 60
- Belysa element med vikter: Visualisera din bild som en symfoni, där varje element bidrar till den stora ensemble. Med “::” notationen kan du diktera betydelsen av olika element i din bild, vilket låter dig kontrollera strålkastaren. Exempel:
- [En elegant påfågel]::3 sittande på en [visteriaträd]::1 som blommar med vibranta blommor
- [En majestätisk elefant]::2 som badar i glöden av en [solnedgång]::1 på savannen
- Midjourney är en process av trial and error: Experimentera med olika element och funktioner är nödvändigt. Varje iteration kommer att bringa dig närmare den bild du föreställde dig att förverkliga.
Mid-Journey parametrar
Midjourneys modell fungerar med justerbara parametrar som kontrollerar resultatet av bildgenereringsprocessen. Dessa parametrar låter användare justera och anpassa sin genererade konst, finjustera modellen för att skapa utdata som perfekt passar deras mål.
Här är de grundläggande och avancerade parametrarna, deras funktioner och hur man använder dem för att fullt utnyttja Midjourneys förmågor:
- Aspect Ratio (–aspect eller –ar): Denna parameter kontrollerar förhållandet mellan bredd och höjd på den genererade bilden. Till exempel är ett förhållande på 16:9 perfekt för YouTube-miniatyrbilder, medan 1:1 producerar en kvadratisk bild som är bra för Instagram.
- Chaos (–chaos): Denna parameter justerar diversiteten i den initiala bildrutnätet och sträcker sig från 0 till 100. Högre kaosvärden kommer att ge dig oförutsägbara och unika resultat, medan lägre värden kommer att säkerställa mer konsekventa resultat.
- No (–no): Denna parameter hjälper dig att eliminera specifika element eller egenskaper från den genererade bilden. Till exempel, om du vill ha en bild utan något rött, kan du använda “–no rött”.
- Quality (–quality eller –q): Denna inställning justerar den tid som krävs för att generera en bild. Högre kvalitet kräver mer bearbetningstid men ger detaljerade detaljer. Denna parameter kan anta värden på 0,25, 0,5, 1 eller 2.
- Seed (–seed): Denna parameter bestämmer den initiala visuella bruset, som fungerar som en bas för den genererade bilden. Användning av samma seed-nummer med samma prompt kommer att ge liknande utdata. Den accepterar heltalsvärden mellan 0–4294967295.
- Stop (–stop): Med denna parameter kan du förkorta en uppgift, vilket resulterar i mindre detaljerade men potentiellt intressanta utdata. Området är 10-100. Till exempel, om du anger ‘–stop 50’, kommer bildgenereringsprocessen att avbrytas vid 50% färdigställande, vilket resulterar i en mindre detaljerad, möjligen abstrakt bild.
- Stylize (–stylize eller –s): Denna kontrollerar nivån av konstnärlig tillämpning på den genererade bilden. Lägre stiliseringsvärden ger resultat som är närmare den ursprungliga prompten, medan högre värden resulterar i mer abstrakta och konstnärliga tolkningar. I v5 är standardvärdet 100, men du kan ställa in det var som helst mellan 0-1000.
- Modellversion: Du kan välja mellan olika versioner av Midjourney-modellen med hjälp av –version eller –v parametern.
- Niji: En modell specialiserad på anime-inspirerade bilder. Den kan aktiveras med –niji parametern.
- Highmi Definition: För abstrakta och landskapsbilder aktiverar –hd parametern en tidig modellversion som ger större, mindre konsekventa bilder.
- Testmodeller: Midjourney erbjuder specialmodeller för specifika användningsfall. –test och –testp aktiverar standard- och fotografiinriktade testmodeller, respectively.
- Uppskalare: Midjourneys algoritm börjar med ett lågupplöst bildrutnät. Den erbjuder flera uppskalningsmodeller för att förbättra bildstorlek och detalj.
Midjourney rullar kontinuerligt ut uppdateringar för att förbättra användarupplevelsen, med den senaste versionen 5.2 lanserad i juni 2023. Genom att lägga till –v 5.2 till din prompt eller välja den via /settings-kommandot kan användare komma åt denna avancerade modell. Version 5.2 erbjuder överlägsen bildinformation och förstår prompts mer intuitivt, vilket bringar ljusare färger och förbättrade kompositioner.
Att förstå upphovsrätt för AI-genererade konstverk
I mars 2023 klargjorde USA:s upphovsrättskontor sin ståndpunkt i fråga om upphovsrätten för AI-genererade verk. Policyn fastställer att medan de mänskliga komponenterna i AI-skapelser (som skrifter eller unika design) kan skyddas, kvalificerar sig inte AI-producerade bilder för upphovsrätt, i enlighet med globala normer som endast mänskliga skapelser är berättigade till upphovsrättsligt skydd.
I sammanhanget med AI-konst är upphovsrätt inte enkel. Medan digital konst har mänskliga konstnärens bidrag, skapas AI-genererad konst utan direkt mänsklig inblandning, vilket komplicerar frågan om upphov och ägande. Enligt USA:s upphovsrättskontor ges initialt äganderätt till verkets författare – en mänsklig skapare. Men eftersom AI inte kan anses vara en författare, saknar AI-genererad konst tydligt ägande.
Den senaste vägledningen från USA:s upphovsrättskontor tillåter upphovsrätt för AI-konst endast när den innehåller tillräckligt mänskligt författarskap. Nivån på “tillräckligt mänskligt författarskap” förblir odefinierad och beror på graden av mänsklig inblandning i skapandet av AI-konstverket.
Intressant nog har Midjourney, en AI-baserad plattform för bildskapande, etablerat sina egna policys för användningsrättigheter. Användare av gratis provversion kan använda bilderna för icke-kommersiella ändamål under Creative Commons Attribution-NonCommercial 4.0 International License (CC BY-NC 4.0), med korrekt kredit till Midjourney. Betalande prenumeranter kan dock använda bilderna för alla ändamål, inklusive kommersiella, under Allmänna kommersiella villkor. Denna utveckling i upphovsrättsområdet presenterar en intressant dynamik mellan AI och mänsklig kreativitet.
Använda Midjourney för dynamiska UI-design och kreativ logotypgenerering
Från design av intuitiva användargränssnitt för webbplatser eller mobilappar till skapande av unika logotyper och banner, Midjourney ger kreatörer möjlighet att generera en mängd olika designalternativ inom sekunder.
Här är hur det fungerar. Varje design börjar med en prompt, som fungerar som en ritning för AI att följa. Anta att du designar ett användargränssnitt för en online-tutorplattform. En typisk prompt kan vara: “/imagine Online-tutorplattformens användargränssnitt, Dribbble, hög upplösning, 4K, som Khan Academy”.
Initiala resultat kan kanske inte vara perfekta. Till exempel kan tillägg av “Adobe XD” i mixen hjälpa Midjourney att anpassa sina design till att vara mer Adobe XD-kompatibla. En optimerad prompt skulle vara:
/imagine Online-tutorplattform, användargränssnitt, Adobe XD, Dribbble, hög upplösning, 4K, minimalistisk design
Textinspirerad logotyp eller banner med Midjourney
Låt oss undersöka hur man skapar en banner med en logotyp för UNITE AI.
Först behöver du ha en enkel bild av den text du vill visa. Du kan skapa detta med hjälp av något grafiskt designverktyg eller textredigerare och ladda upp det till din Discord-kanal.
Prompten för att skapa bannern är:
/imagine Bokstäver: UNITE i en futuristisk, AI-inspirerad typsnittslogotyp med bokstäver UNITE –v 5 –ar 16:9
Titta på dessa exempelpromptar för fler idéer:
/imagine En ensam musiker som spelar en fridfull melodi på en flytande stad i skymningen, konst i art nouveau-stil
/imagine En bild av en person som arbetar på ett framtida skrivbord, omgiven av holografiska skärmar och avancerad teknik. Personen bär en slank, silverfärgad overall och har virtuell verklighetshjälpmedel på. Miljön är fylld med neonlys och flytande hologram. Atmosfären är framtida och högteknologisk, med en känsla av spänning och innovation. Kameran är en högupplöst digital kamera som fångar varje detalj med precision. Den konstnärliga stilen är en blandning av cyberpunk och minimalism, med fokus på rena linjer och starka färger. Regissörerna, cinematografiska fotograferna, fotograferna, modedesignerna, serieskaparna och konstnärerna som samarbetar i denna unika kombination är Christopher Nolan, Roger Deakins, Annie Leibovitz, Virgil Abloh, Hayao Miyazaki och Kaws.
/imagine 1940-tals Barbie som en krigssjuksköterska, i en vintage armésjukhusmiljö, som tar hand om de sårade soldaterna, i stilen av klassiska Mattel-illustrationer, med atmosfären av sepia-tonad andra världskrigsfotografering 8k –v 5 –ar 16:9
/imagine Ramen av en kvinna som lutar sig mot en cyberpunk, svävande motorcykel, japansk anime, vidsträckta stadslandskap, 32k, intrikat rymdhamn, flyktig, skyskrapepanorama, slank
Slutliga tankar: Navigera i AI-konstvärlden med Midjourney
Kom ihåg, “En bild är värd mer än tusen ord”. En detaljerad, livfull beskrivning kan fungera underverk. Ja, Midjourney är inte gratis att använda. Men det revolutionerar konstvärlden och utvidgar våra kreativa möjligheter genom sin toppmoderna text-till-bild AI-teknik. Med förmågan att omvandla en enkel textprompt till en högupplöst bild, är det ett verktyg som lovar obegränsade möjligheter, inte bara för konstnärer, utan också för UI/UX-designers, teknikentusiaster och AI-proffs.
Här är några viktiga punkter att komma ihåg när du börjar din Midjourney-äventyr:
- Lär dig grunderna i Midjourney-prompt: Använd tydliga, koncisa och omfattande beskrivningar som omfattar din vision för att vägleda AI effektivt. Kom ihåg att överväga din målgrupp och tveka inte att experimentera med olika stilar, humör och sammanhang.
- Använd parametrar: Förbättra din kreativa upplevelse genom att utnyttja den mängd avancerade inställningar som Midjourney erbjuder. Från att kontrollera förhållandet till att justera kaosparametern för unika resultat, kan varje detalj anpassas till din smak.
- Acceptera den iterativa processen: Din första AI-genererade konst kan inte vara perfekt. Acceptera denna iterativa process och lära dig att förbättra och optimera dina prompts för bättre resultat.
- Förstå upphovsrättsimplikationerna: Medan AI-genererade konstverk i sig inte är berättigade till upphovsrätt, kan de mänskliga komponenterna inom dem skyddas.
I korthet, integrationen av AI i konst har demokratiserat kreativitet och suddat ut gränserna mellan mänskliga och maskinproducerade mästerverk. Medan vi fortsätter att vittna om den anmärkningsvärda tillväxten av generativ AI på konstmarknaden, är det obestridligt att AI-konstrevolutionen, ledd av plattformar som Midjourney, är bara i början.























