Prompt engineering

Een nadere blik op OpenAI’s DALL-E 3

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
DALL·E 3

In de wereld van Generatieve AI is het bijhouden van de laatste ontwikkelingen de naam van het spel. En als het gaat om het genereren van afbeeldingen, waren Stable Diffusion en Midjourney de platformen waar iedereen over sprak – tot nu toe.

OpenAI, gesteund door de technologiegigant Microsoft (MSFT ), introduceerde DALL·E 3 op 20 september 2023.

DALL-E 3 gaat niet alleen over het creëren van afbeeldingen; het gaat over het tot leven brengen van uw ideeën, precies zoals u ze zich had voorgesteld. En het beste deel? Het is snel, echt snel. U hebt een idee, u voert het in bij DALL-E 3, en klaar, uw afbeelding is klaar.

Dus, in dit artikel, gaan we diep in op wat DALL-E 3 is. We zullen praten over hoe het werkt, wat het onderscheidt van de rest, en waarom het misschien wel het instrument is dat u nodig had. Of u nu een ontwerper, een kunstenaar of iemand met veel leuke ideeën bent, u zult hier voor willen blijven. Laten we beginnen.

Wat nieuw is met DALL·E 3 is dat het context veel beter begrijpt dan DALL·E 2. Eerdere versies konden sommige details missen of een paar details hier en daar negeren, maar DALL·E 3 is op punt. Het pikt de exacte details van wat u vraagt op, waardoor u een afbeelding krijgt die dichter bij uw verbeelding ligt.

Het coolste deel? DALL·E 3 en ChatGPT zijn nu geïntegreerd. Ze werken samen om uw ideeën te verfijnen. U schiet een concept, ChatGPT helpt bij het fine-tunen van de prompt, en DALL·E 3 brengt het tot leven. Als u niet van de afbeelding houdt, kunt u ChatGPT vragen om de prompt aan te passen en DALL·E 3 opnieuw te proberen. Voor een maandelijkse vergoeding van 20$ krijgt u toegang tot GPT-4, DALL·E 3 en veel andere leuke functies.

Microsoft’s Bing Chat kreeg zijn handen op DALL·E 3 zelfs voordat OpenAI’s ChatGPT dat deed, en nu is het niet alleen de grote ondernemingen, maar iedereen die ermee kan spelen voor niets. De integratie in Bing Chat en Bing Image Creator maakt het veel gemakkelijker voor iedereen om te gebruiken.

De opkomst van diffusiemodellen

In de afgelopen drie jaar heeft de visuele AI een significante stap voorwaarts gezet met de opkomst van diffusiemodellen, vooral in afbeeldingengeneratie. Voordat diffusiemodellen bestonden, waren Generatieve Adversarial Networks (GAN’s) de technologie voor het genereren van realistische afbeeldingen.

GANs

GANs

Ze hadden echter hun eigen uitdagingen, waaronder de behoefte aan enorme hoeveelheden data en rekenkracht, wat het vaak moeilijk maakte om ermee te werken.

Enter diffusiemodellen. Ze zijn opgekomen als een meer stabiele en efficiënte alternatief voor GAN’s. In tegenstelling tot GAN’s, werken diffusiemodellen door ruis toe te voegen aan data, waardoor deze wordt verduisterd totdat er alleen nog maar willekeur overblijft. Vervolgens werken ze achteruit om dit proces om te keren, waardoor ze zinvolle data uit de ruis reconstrueren. Dit proces heeft zichzelf bewezen als effectief en minder bron-intensief, waardoor diffusiemodellen een hot topic zijn in de AI-gemeenschap.

Het echte keerpunt kwam rond 2020, met een reeks innovatieve papers en de introductie van OpenAI’s CLIPtechnologie, die de mogelijkheden van diffusiemodellen aanzienlijk heeft verbeterd. Dit heeft diffusiemodellen uitzonderlijk goed gemaakt in tekst-naar-afbeelding-synthese, waardoor ze realistische afbeeldingen uit tekstuele beschrijvingen kunnen genereren. Deze doorbraken waren niet alleen in afbeeldingengeneratie, maar ook in gebieden zoals muzieksamenstelling en biomedisch onderzoek.

Vandaag de dag zijn diffusiemodellen niet alleen een onderwerp van academische interesse, maar worden ze ook in praktische, echte scenario’s gebruikt.

Generatieve modellering en self-attention lagen: DALL-E 3

Een van de belangrijkste vooruitgangen in dit veld is de evolutie van generatieve modellering, met steekproef-gebaseerde benaderingen zoals autoregressieve generatieve modellering en diffusieprocessen die de weg banen. Ze hebben tekst-naar-afbeeldingmodellen getransformeerd, wat heeft geleid tot aanzienlijke prestatieverbeteringen. Door afbeeldingengeneratie op te breken in discrete stappen, zijn deze modellen tractabeler en gemakkelijker voor neurale netwerken om te leren.

In parallel, heeft het gebruik van self-attention lagen een cruciale rol gespeeld. Deze lagen, gestapeld, hebben geholpen bij het genereren van afbeeldingen zonder de noodzaak van impliciete ruimtelijke vooroordelen, een veelvoorkomend probleem met convoluties. Deze verschuiving heeft tekst-naar-afbeeldingmodellen in staat gesteld om schaalbaar en betrouwbaar te verbeteren, dankzij de goed begrepen schaalbaarheids eigenschappen van transformatoren.

Uitdagingen en oplossingen in afbeeldingengeneratie

Ondanks deze vooruitgang, blijft controle in afbeeldingengeneratie een uitdaging. Problemen zoals promptvolging, waarbij het model mogelijk niet nauwkeurig de invoerTekst volgt, zijn talrijk. Om dit aan te pakken, zijn nieuwe benaderingen zoals captionverbetering voorgesteld, gericht op het verbeteren van de kwaliteit van tekst- en afbeeldingparen in trainingsdatasets.

Captionverbetering: een nieuwe benadering

Captionverbetering houdt in dat er betere kwaliteitscaptions voor afbeeldingen worden gegenereerd, waardoor meer accurate tekst-naar-afbeeldingmodellen kunnen worden getraind. Dit wordt bereikt door een robuuste afbeeldingcaptioner die gedetailleerde en nauwkeurige beschrijvingen van afbeeldingen produceert. Door op deze verbeterde captions te trainen, heeft DALL-E 3 opmerkelijke resultaten behaald, die sterk lijken op foto’s en kunstwerken gemaakt door mensen.

Trainen op synthetische data

Het concept van trainen op synthetische data is niet nieuw. Echter, de unieke bijdrage hier is in de creatie van een novum, beschrijvend beeldcaptioneringssysteem. De impact van het gebruik van synthetische captions voor het trainen van generatieve modellen is aanzienlijk, wat heeft geleid tot verbeteringen in de mogelijkheid van het model om prompts nauwkeurig te volgen.

Evaluatie van DALL-E 3

Door meerdere evaluaties en vergelijkingen met eerdere modellen zoals DALL-E 2 en Stable Diffusion XL, heeft DALL-E 3 een superieure prestatie laten zien, vooral in taken die verband houden met promptvolging.

Vergelijking van tekst-naar-afbeeldingmodellen op verschillende evaluaties

Vergelijking van tekst-naar-afbeeldingmodellen op verschillende evaluaties

Het gebruik van geautomatiseerde evaluaties en benchmarks heeft duidelijk bewijs van zijn capaciteiten geleverd, waardoor zijn positie als state-of-the-art tekst-naar-afbeeldinggenerator is versterkt.

DALL-E 3 prompts en mogelijkheden

DALL-E 3 biedt een meer logische en verfijnde benadering van het creëren van visuals. Terwijl u doorbladert, zult u merken hoe DALL-E elke afbeelding creëert, met een mengeling van nauwkeurigheid en verbeelding die overeenkomt met de gegeven prompt.

In tegenstelling tot zijn voorganger, blinkt deze verbeterde versie uit in het arrangeren van objecten op een natuurlijke manier binnen een scène en het nauwkeurig weergeven van menselijke kenmerken, tot en met het correcte aantal vingers op een hand. De verbeteringen strekken zich uit tot fijnere details en zijn nu beschikbaar in een hogere resolutie, waardoor een meer realistische en professionele output wordt gegarandeerd.

De tekstrenderingmogelijkheden zijn ook aanzienlijk verbeterd. Waar eerdere versies van DALL-E onleesbare tekst produceerden, kan DALL-E 3 nu leesbare en professioneel gestileerde lettertypen genereren (soms), en zelfs schone logo’s af en toe.

Het model’s begrip van complexe en nuanceuze afbeeldingsaanvragen is aanzienlijk verbeterd. DALL-E 3 kan nu nauwkeurig gedetailleerde beschrijvingen volgen, zelfs in scenario’s met meerdere elementen en specifieke instructies, waardoor het in staat is om samenhangende en goed samengestelde afbeeldingen te produceren. Laten we enkele prompts en de respectievelijke output bekijken:

Ontwerp de verpakking voor een lijn van biologische thee. Voeg ruimte toe voor de productnaam en beschrijving.

DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts (Opmerking: het linkerposter heeft een verkeerde spelling)

Maak een webbanner voor een zomerverkoop van outdoormeubilair. De afbeelding moet een strandsetting hebben met verschillende stukken outdoormeubilair en tekst die 'Huge Summer Savings!' aankondigt.

DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts

Een vintage reisposter van Parijs met dikke en gestileerde tekst die 'Bezoek Parijs' onderaan zegt.

DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts (Opmerking: beide posters hebben verkeerde spellingsfouten)

Genereer een afbeelding van een beroemde historische figuur, zoals Cleopatra of Leonardo da Vinci, in een hedendaagse setting, met moderne technologie zoals smartphones of laptops.
DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts

Een drukke scène van het Diwali-feest in India, met families die lampen aansteken, vuurwerk in de lucht en traditionele snoepjes en decoraties.
DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts

Genereer een afbeelding van een beroemde historische figuur, zoals Cleopatra of Leonardo da Vinci, in een hedendaagse setting, met moderne technologie zoals smartphones of laptops.
DALL-E 3 afbeeldingen op basis van tekstprompts

DALL-E 3 afbeeldingen op basis van tekstprompts

Beperkingen en risico’s van DALL-E 3

OpenAI heeft significante stappen genomen om expliciete inhoud uit de trainingsdata van DALL-E 3 te filteren, met als doel om vooroordelen te verminderen en de output van het model te verbeteren. Dit omvat het toepassen van specifieke filters voor gevoelige inhoudscategorieën en het herzien van drempels voor bredere filters. De mitigatiestack omvat ook meerdere lagen van beveiligingsmaatregelen, zoals weigeringsmechanismen in ChatGPT voor gevoelige onderwerpen, prompt-inputclassificatoren om beleidsschendingen te voorkomen, blocklists voor specifieke inhoudscategorieën en transformaties om ervoor te zorgen dat prompts overeenkomen met richtlijnen.

Ondanks zijn vooruitgang, heeft DALL-E 3 beperkingen in het begrijpen van ruimtelijke relaties, het weergeven van lange tekst en het genereren van specifieke beelden. OpenAI erkent deze uitdagingen en werkt aan verbeteringen voor toekomstige versies.

Het bedrijf werkt ook aan manieren om AI-gegenereerde afbeeldingen van die gemaakt door mensen te onderscheiden, wat een weerspiegeling is van hun toewijding aan transparantie en verantwoordelijk AI-gebruik.

DALL·E 3

DALL·E 3

DALL-E 3, de laatste versie, zal beschikbaar zijn in fasen, beginnend met specifieke klantengroepen en later uitbreidend naar onderzoeksinstellingen en API-diensten. Echter, een vrij te gebruiken publicatiedatum is nog niet bevestigd.

OpenAI zet een nieuwe standaard in het veld van AI met DALL-E 3, door complexe technische capaciteiten en gebruikersvriendelijke interfaces naadloos te integreren. De integratie van DALL-E 3 in breed gebruikt platforms zoals Bing weerspiegelt een verschuiving van gespecialiseerde toepassingen naar bredere, toegankelijkere vormen van entertainment en nut.

De echte game-changer in de komende jaren zal waarschijnlijk de balans zijn tussen innovatie en gebruikersbevoegdheid. Bedrijven die succesvol zijn, zullen niet alleen de grenzen van wat AI kan bereiken, verleggen, maar ook gebruikers de autonomie en controle bieden die ze verlangen. OpenAI, met zijn toewijding aan ethische AI, navigeert deze weg zorgvuldig. Het doel is duidelijk: het creëren van AI-instrumenten die niet alleen krachtig zijn, maar ook betrouwbaar en inclusief, waardoor de voordelen van AI voor iedereen toegankelijk zijn.

Ik heb de afgelopen vijf jaar doorgebracht met het onderdompelen van mezelf in de fascinerende wereld van Machine Learning en Deep Learning. Mijn passie en expertise hebben me geleid om bij te dragen aan meer dan 50 diverse software-engineeringprojecten, met een bijzondere focus op AI/ML. Mijn voortdurende nieuwsgierigheid heeft me ook aangetrokken tot Natural Language Processing, een vakgebied dat ik graag verder wil verkennen.