Prompt engineering
En nærmere kig på OpenAIs DALL-E 3

I verden af generativ AI er det vigtigt at følge med i de seneste udviklinger. Og når det kommer til at generere billeder, var Stable Diffusion og Midjourney de platforme, alle talte om – indtil nu.
OpenAI, som er støttet af tech-giganten Microsoft (MSFT ), introducerede DALL-E 3 den 20. september 2023.
DALL-E 3 handler ikke kun om at skabe billeder, men om at bringe dine idéer til live, præcis som du forestillede dig dem. Og det bedste er, at det er hurtigt, rigtig hurtigt. Du har en idé, du giver den til DALL-E 3, og bang, dit billede er klar.
Så i denne artikel vil vi dykke dybt ind i, hvad DALL-E 3 er. Vi vil tale om, hvordan det fungerer, hvad der adskiller det fra resten, og hvorfor det måske er det værktøj, du ikke vidste, du havde brug for. Uanset om du er designer, kunstner eller bare nogen med mange cool idéer, vil du ønske at blive hængende her. Lad os komme i gang.
Hvad er nyt med DALL-E 3 er, at det får kontekst meget bedre end DALL-E 2. Tidligere versioner kunne have overset nogle detaljer eller ignoreret nogle detaljer her og der, men DALL-E 3 er på punkt. Det fanger de eksakte detaljer af, hvad du beder om, og giver dig et billede, der er tættere på, hvad du forestillede dig.
Det coolste er, at DALL-E 3 og ChatGPT nu er integreret sammen. De arbejder sammen for at hjælpe med at finpudse dine idéer. Du skyder en koncept, ChatGPT hjælper med at finpudse prompten, og DALL-E 3 bringer det til live. Hvis du ikke er tilfreds med billedet, kan du bede ChatGPT om at justere prompten og få DALL-E 3 til at prøve igen. For en månedlig pris på 20 $ får du adgang til GPT-4, DALL-E 3 og mange andre cool funktioner.
Microsofts Bing Chat fik fingre i DALL-E 3, før OpenAIs ChatGPT gjorde, og nu er det ikke kun de store virksomheder, men alle, der kan lege med det gratis. Integrationen i Bing Chat og Bing Image Creator gør det meget lettere at bruge for alle.
I de sidste 3 år har vision AI oplevet opkomsten af diffusion-modeller, der har taget et betydeligt skridt fremad, især i billedgenerering. Før diffusion-modellerne var Generative Adversarial Networks (GANs) den teknologi, der blev brugt til at generere realistiske billeder.
GANs havde dog deres egne udfordringer, herunder behovet for store mængder data og beregningskraft, hvilket ofte gjorde dem svære at håndtere.
Diffusion-modellerne opstod herefter som en mere stabil og effektiv alternativ til GANs. I modsætning til GANs opererer diffusion-modeller ved at tilføje støj til data, så det bliver uklart, indtil kun tilfældighed er tilbage. De arbejder derefter baglæns for at omvende denne proces, så de kan genskabe meningsfulde data fra støjen. Denne proces har vist sig at være effektiv og mindre ressourcekrævende, hvilket har gjort diffusion-modellerne til et hot emne i AI-fællesskabet.
Det egentlige vendepunkt kom omkring 2020, med en række innovative artikler og introduktionen af OpenAIs CLIP-teknologi, der betydeligt udvidede diffusion-modellerens evner. Dette gjorde diffusion-modellerne exceptionelt gode til tekst-til-billede-syntese, så de kunne generere realistiske billeder fra tekstbeskrivelser. Disse gennembrud var ikke kun i billedgenerering, men også i felter som musikkomposition og biomedicinsk forskning.
I dag er diffusion-modellerne ikke kun et emne for akademisk interesse, men bliver også brugt i praktiske, virkelige scenarier.
En af de kritiske fremskridt i dette felt har været udviklingen af generative modeller, med sampling-baserede tilgange som autoregressiv generativ modeling og diffusion-processer, der har ført an. De har forvandlet tekst-til-billede-modeller, hvilket har ført til dramatiske forbedringer af ydelsen. Ved at bryde billedgenerering ned i diskrete trin er disse modeller blevet mere håndterbare og lettere for neurale netværk at lære.
Samtidig har brugen af selv-attention-lag playede en afgørende rolle. Disse lag, stablet sammen, har hjulpet med at generere billeder uden implicit rumlig bias, et almindeligt problem med convolutioner. Denne skift har tilladt tekst-til-billede-modeller at skala og forbedre sig pålideligt, takket være de velkendte skalaegenskaber af transformatorer.
Trods disse fremskridt forbliver kontrollen over billedgenerering en udfordring. Problemer som prompt-følgen, hvor modellen måske ikke følger input-teksten tæt, har været almindelige. For at løse dette er nye tilgange som caption-forbedring blevet foreslået, med det formål at forbedre kvaliteten af tekst- og billedpar i træningsdata.
Caption-forbedring indebærer at generere bedre kvalitets-underskrifter for billeder, hvilket igen hjælper med at træne mere præcise tekst-til-billede-modeller. Dette opnås gennem en robust billed-underskrift, der producerer detaljerede og præcise beskrivelser af billeder. Ved at træne på disse forbedrede underskrifter har DALL-E 3 opnået bemærkelsesværdige resultater, der ligner fotografier og kunstværker produceret af mennesker.
Konceptet med at træne på syntetisk data er ikke nyt. Men den unikke bidrag her er i skabelsen af et nyt, deskriptivt billed-underskriftssystem. Impacten af at bruge syntetiske underskrifter til træning af generative modeller har været betydelig, hvilket har ført til forbedringer i modellens evne til at følge prompter præcist.
Gennem multiple evalueringer og sammenligninger med tidligere modeller som DALL-E 2 og Stable Diffusion XL har DALL-E 3 demonstreret overlegen ydelse, især i opgaver relateret til prompt-følgen.
Brugen af automatiserede evalueringer og benchmarks har givet klare beviser for dens evner, hvilket har fastsat dens position som en state-of-the-art tekst-til-billede-generator.
DALL-E 3 tilbyder en mere logisk og raffineret tilgang til at skabe visuelle effekter. Mens du scroller, vil du bemærke, hvordan DALL-E skaber hvert billede, med en blanding af præcision og fantasi, der resonerer med den givne prompt.
I modsætning til sin forgænger udmærker denne opgraderede version sig ved at arrangerer objekter naturligt inden for en scene og afbilder menneskelige træk præcist, ned til det korrekte antal fingre på en hånd. Forbedringerne strækker sig til finere detaljer og er nu tilgængelige i højere opløsning, hvilket sikrer en mere realistisk og professionel output.
Tekst-renderingsfunktionerne har også set betydelige forbedringer. Hvor tidligere versioner af DALL-E producerede nonsens-tekst, kan DALL-E 3 nu generere læselige og professionelt styled bogstaver (nogle gange) og endda rene logos på occasion.
Modellens forståelse af komplekse og nuancerede billedanmodninger er blevet betydeligt forbedret. DALL-E 3 kan nu følge detaljerede beskrivelser præcist, selv i scenarier med multiple elementer og specifikke instruktioner, hvilket demonstrerer dens evne til at producere koherente og velkomponerede billeder. Lad os udforske nogle prompter og det respektive output, vi fik:
“Design emballagen til en række af økologiske teer. Inkluder plads til produktets navn og beskrivelse.”
“Oprett en web-banner, der annoncerer en sommer-udsalg på udendørs-møbler. Billedet skal have en strand-scene med forskellige stykker udendørs-møbler og tekst, der annoncerer ‘Huge Summer Savings!'”
“En vintage rejseplakat af Paris med bold og stylized tekst, der siger ‘Visit Paris’ i bunden.”
DALL-E 3 har også vist sig at være i stand til at generere billeder af historiske figurer i moderne sammenhænge, såsom Cleopatra eller Leonardo da Vinci, der bruger moderne teknologi som smartphones eller bærbare computere.
OpenAI har taget betydelige skridt for at filtrere eksplisit indhold fra DALL-E 3’s træningsdata, med det formål at reducere bias og forbedre modellens output. Dette inkluderer anvendelsen af specifikke filtre for følsomme indholdskategorier og en revision af grænseværdier for bredere filtre. Mitigations-stakken inkluderer også flere lag af sikkerhedsforanstaltninger, såsom afvisningsmekanismer i ChatGPT for følsomme emner, prompt-input-klassificatorer for at forhindre politik-overtrædelser, blocklister for bestemte indholdskategorier og transformationer for at sikre, at prompter er i overensstemmelse med retningslinjerne.
Trods dens fremskridt har DALL-E 3 begrænsninger i forståelsen af rumlige relationer, rendering af lange tekster præcist og generering af specifikke billeder. OpenAI anerkender disse udfordringer og arbejder på forbedringer til fremtidige versioner.
DALL-E 3, den seneste version, vil blive tilgængelig i faser, startende med bestemte kundegrupper og senere udvidende til forskningslab og API-tjenester. En gratis offentlig udgivelsesdato er dog ikke bekræftet endnu.
OpenAI sætter virkelig en ny standard i feltet af AI med DALL-E 3, der ubesværet kombinerer komplekse tekniske evner og brugervenlige grænseflader. Integrationen af DALL-E 3 i bredt anvendte platforme som Bing afspejler en skift fra specialiserede anvendelser til bredere, mere tilgængelige former for underholdning og nytte.
Det virkelige spil-forandrer i de kommende år vil sandsynligvis være balancen mellem innovation og bruger-empowerment. Virksomheder, der trives, vil være dem, der ikke kun presser grænserne for, hvad AI kan opnå, men også giver brugerne den autonomi og kontrol, de ønsker. OpenAI, med sin tilgang til etisk AI, navigerer denne vej omhyggeligt. Målet er klart: at skabe AI-værktøjer, der ikke kun er kraftfulde, men også troværdige og inklusive, således at fordelene ved AI er tilgængelige for alle.












