Andersons vinkel

Er DALL-E 2 kun “limning sammen af ting” uden at forstå deres relationer?

mm
Føj Unite.AI til dine foretrukne kilder på Google

En ny forskningsrapport fra Harvard University antyder, at OpenAI’s tekst-til-billede-rammeværk DALL-E 2 har bemærkelsesværdige vanskeligheder med at genskabe selv infant-niveau relationer mellem de elementer, det komponerer til syntetiserede fotos, på trods af den imponerende sofistikerede udgang i meget af dens output.

Forskerne gennemførte en brugerundersøgelse med 169 crowdsourced deltagere, der blev præsenteret for DALL-E 2-billeder baseret på de mest grundlæggende menneskelige principper for relationssæmiotik, sammen med tekstpromptene, der havde skabt dem. Da de blev bedt om at sige, om promptene og billederne var relaterede, var mindre end 22% af billederne opfattet som relevante for deres tilhørende prompter, i forhold til de meget simple relationer, som DALL-E 2 blev bedt om at visualisere.

Et skærmbillede fra de forsøg, der blev gennemført til den nye rapport. Deltagerne blev bedt om at vælge alle billederne, der matchede prompten. Trods advarslen nederst på grænsefladen var billederne, ukendt for deltagere, faktisk genereret fra den viste tilhørende prompt. Kilde: https://arxiv.org/pdf/2208.00005.pdf

Et skærmbillede fra de forsøg, der blev gennemført til den nye rapport. Deltagerne blev bedt om at vælge alle billederne, der matchede prompten. Kilde: https://arxiv.org/pdf/2208.00005.pdf

Resultaterne antyder også, at DALL-E’s åbenlyse evne til at kombinere forskellige elementer kan aftage, når disse elementer bliver mindre sandsynlige for at have fundet sted i den reelle træningsdata, der driver systemet.

For eksempel fik billeder for prompten “barn rører en skål” en 87% enighedsrate (dvs. deltagere klikkede på de fleste billeder som værende relevante for prompten), hvorimod lignende fotorealistiske billeder af “en abe rører en leguan” opnåede kun 11% enighed:

DALL-E kæmper med at afbilde den usandsynlige begivenhed 'en abe rører en leguan', sandsynligvis fordi det er sjældent, mere sandsynligt ikke-eksisterende, i træningsmængden.

DALL-E kæmper med at afbilde den usandsynlige begivenhed ‘en abe rører en leguan’, sandsynligvis fordi det er sjældent, mere sandsynligt ikke-eksisterende, i træningsmængden.

I det andet eksempel får DALL-E 2 ofte skalaen og endda arten forkert, sandsynligvis på grund af en mangel på reelle billeder, der afbilder denne begivenhed. I modsætning hertil er det rimeligt at forvente et stort antal træningsfotos relateret til børn og mad, og at denne underdomæne/klassen er veludviklet.

DALL-E’s vanskeligheder med at kombinere vidt forskellige billed-elementer antyder, at offentligheden i øjeblikket er så betaget af systemets fotorealistiske og bredt fortolkende evner, at de ikke har udviklet en kritisk øje for tilfælde, hvor systemet har effektivt bare “limet” ét element skarpt på et andet, som i disse eksempler fra den officielle DALL-E 2-side:

Klip-og-lim-syntese, fra de officielle eksempler for DALL-E 2. Kilde: https://openai.com/dall-e-2/

Klip-og-lim-syntese, fra de officielle eksempler for DALL-E 2. Kilde: https://openai.com/dall-e-2/

Den nye rapport siger*:

‘Relationel forståelse er en grundlæggende komponent af menneskelig intelligens, der manifesterer sig tidligt i udviklingen og beregnes hurtigt og automatisk i perception.

‘DALL-E 2’s vanskeligheder med selv grundlæggende rumlige relationer (såsom in, on, under) antyder, at hvad det har lært, har det ikke lært de former for repræsentationer, der tillader mennesker at så fleksibelt og robustt strukturere verden.

‘En direkte tolkning af denne vanskelighed er, at systemer som DALL-E 2 ikke endnu har relationel komposition.

Forfatterne foreslår, at tekst-guidede billed-genereringssystemer som DALL-E-serien kunne drage fordel af at udnytte algoritmer, der er fælles for robotteknologi, der modellerer identiteter og relationer samtidigt, på grund af behovet for agenten at faktisk interagere med miljøet i stedet for blot at fabrikere en blanding af forskellige elementer.

En sådan tilgang, kaldet CLIPort, bruger den samme CLIP-mekanisme, der fungerer som en kvalitetsvurderingsenhed i DALL-E 2:

CLIPort, en samarbejdsprojekt fra 2021 mellem University of Washington og NVIDIA, bruger CLIP i en kontekst, så praktisk, at systemerne, der er trænet på det, nødvendigvis må udvikle en forståelse af fysiske relationer, en motivator, der er fraværende i DALL-E 2 og lignende 'fantastiske' billed-syntese-rammeværker. Kilde: https://arxiv.org/pdf/2109.12098.pdf

CLIPort, en samarbejdsprojekt fra 2021 mellem University of Washington og NVIDIA, bruger CLIP i en kontekst, så praktisk, at systemerne, der er trænet på det, nødvendigvis må udvikle en forståelse af fysiske relationer, en motivator, der er fraværende i DALL-E 2 og lignende ‘fantastiske’ billed-syntese-rammeværker. Kilde: https://arxiv.org/pdf/2109.12098.pdf

Forfatterne foreslår yderligere ‘en anden plausibel opgradering’ kunne være for billed-syntese-systemers arkitektur, såsom DALL-E, at inkorporere multiplikative effekter i en enkelt beregningslag, hvilket tillader beregningen af relationer på en måde, der er inspireret af informationsbehandlingskapaciteterne i biologiske systemer.

Den nye rapport er titlen Testing Relational Understanding in Text-Guided Image Generation og kommer fra Colin Conwell og Tomer D. Ullman på Harvards psykologiske afdeling.

Beyond Early Criticism

Kommentarer til den “sleight of hand” bag DALL-E 2’s realisme og integritet, bemærker forfatterne tidligere arbejder, der har fundet mangler i DALL-E-lignende generative billed-systemer.

I juni dette år bemærkede UoC Berkeley vanskelighederne DALL-E har med at håndtere reflekser og skygger; samme måned undersøgte en studie fra Korea ‘uniqueness’ og originalitet af DALL-E 2-lignende output med en kritisk øje; en præliminær analyse af DALL-E 2-billeder, kort efter lanceringen, fra NYU og University of Texas, fandt forskellige problemer med komposition og andre væsentlige faktorer i DALL-E 2-billeder; og sidste måned et fælles arbejde mellem University of Illinois og MIT tilbød forslag til arkitektoniske forbedringer til sådanne systemer i forhold til komposition.

Forskerne bemærker yderligere, at DALL-E-luminaerer som Aditya Ramesh har indrømmet rammeværkets problemer med binding, relativ størrelse, tekst og andre udfordringer.

Udviklerne bag Google’s rivaliserende billed-syntese-system Imagen har også foreslået DrawBench, et nyt sammenligningssystem, der vurderer billed-nøjagtighed på tværs af rammeværker med forskellige metrikker.

I stedet foreslår forfatterne, at en bedre resultater kunne opnås ved at sætte menneskelig vurdering – i stedet for intern, algoritmisk metrik – op imod de resulterende billeder for at fastslå, hvor svaghederne ligger, og hvad der kan gøres for at mindske dem.

The Study

Til dette formål baserer det nye projekt sin tilgang på psykologiske principper og søger at trække sig tilbage fra den nuværende bølge af interesse i prompt-engineering (hvilket i virkeligheden er en indrømmelse af DALL-E 2’s eller lignende systemers mangler), for at undersøge og potentielt adressere begrænsningerne, der gør sådanne “workarounds” nødvendige.

Rapporten siger:

‘Det nuværende arbejde fokuserer på en samling af 15 grundlæggende relationer, der tidligere er blevet beskrevet, undersøgt eller foreslået i den kognitive, udviklingsmæssige eller lingvistiske litteratur. Samlingen indeholder både grundlæggende rumlige relationer (f.eks. ’X på Y’) og mere abstrakte agens-relationer (f.eks. ’X hjælper Y’).

‘Promptene er bevidst simple, uden attribut-kompleksitet eller uddybning. Det vil sige, at i stedet for en prompt som ’en æsel og en blæksprutte spiller et spil. Æslet holder i en snor på den ene ende, blæksprutten holder fast på den anden. Æslet holder snoren i munden. En kat springer over snoren’, bruger vi ’en æske på en kniv’.

‘Enkelheden fanger stadig en bred vifte af relationer fra forskellige underdomæner af menneskelig psykologi og gør potentiel model-fejl mere slående og specifik.’

For deres studie rekrutterede forfatterne 169 deltagere fra Prolific, alle beliggende i USA, med en gennemsnitsalder på 33 og 59% kvindelige.

Deltagerne blev præsenteret for 18 billeder organiseret i en 3×6-grid med prompten øverst og en advarsel nederst, der angav, at alle, nogle eller ingen af billederne kunne være genereret fra den viste prompt, og blev derefter bedt om at vælge billederne, de mente var relaterede på den måde.

Billederne, der blev præsenteret for personerne, var baseret på lingvistisk, udviklingsmæssig og kognitiv litteratur og bestod af en samling af otte fysiske og syv ‘agens-relationer’ (det vil blive klart om et øjeblik).

Fysiske relationer
in, på, under, dækker, nær, skjult af, hænger over, og bundet til.

Agens-relationer
skyder, trækker, rører, rammer, spark, hjælper, og hindrer.

Alle disse relationer blev draget fra de tidligere nævnte ikke-CS-felter.

Tolv enheder blev således afledt til brug i promptene, med seks objekter og seks agenter:

Objekter
kasse, cylinder, tæppe, skål, tekop, og kniv.

Agenter
menneske, kvinde, barn, robot, abe, og leguan.

(Forskerne indrømmer, at inklusionen af leguanen, ikke en hovedbestanddel af tør sociologisk eller psykologisk forskning, var ‘en behandling’)

For hver relation blev fem forskellige prompter oprettet ved at tilfældigt udvælge to enheder fem gange, hvilket resulterede i 75 samlede prompter, som hver især blev indsendt til DALL-E 2, og for hver af disse blev de oprindelige 18 billeder brugt, uden variationer eller anden chancen.

Results

Rapporten siger*:

‘Deltagerne rapporterede i gennemsnit en lav enighedsgrad mellem DALL-E 2’s billeder og promptene, der blev brugt til at generere dem, med en gennemsnit på 22,2% [18,3, 26,6] på tværs af de 75 forskellige prompter.

‘Agens-prompter, med en gennemsnit på 28,4% [22,8, 34,2] på tværs af 35 prompter, genererede en højere enighed end fysiske prompter, med en gennemsnit på 16,9% [11,9, 23,0] på tværs af 40 prompter.’

Resultater fra studiet. Punkter i sort angiver alle prompter, med hver punkt som en enkelt prompt, og farven deler op efter, om prompt-emnet var agens eller fysisk (dvs. et objekt).

Resultater fra studiet. Punkter i sort angiver alle prompter, med hver punkt som en enkelt prompt, og farven deler op efter, om prompt-emnet var agens eller fysisk (dvs. et objekt).

For at sammenligne forskellen mellem menneskelig og algoritmisk perception af billederne, kørte forskerne deres billeder gennem OpenAI’s open source ViT-L/14 CLIP-baseret rammeværk. Ved at gennemsnitte scorene fandt de en ‘moderat relation’ mellem de to sæt resultater, hvilket måske er overraskende, når man betænker, i hvilken udstrækning CLIP selv hjælper med at generere billederne.

Resultater af CLIP (ViT-L/14) sammenligning mod menneskelige svar.

Resultater af CLIP (ViT-L/14) sammenligning mod menneskelige svar.

Forskerne foreslår, at andre mekanismer inden for arkitekturen, måske kombineret med en tilfældig overvægt (eller mangel) af data i træningsmængden, kan forklare, hvordan CLIP kan genkende DALL-E’s begrænsninger uden at kunne gøre noget ved det i alle tilfælde.

Forfatterne konkluderer, at DALL-E 2 kun har en forestillet evne til at genskabe billeder, der inkorporerer relationel forståelse, en grundlæggende aspekt af menneskelig intelligens, der udvikler sig tidligt hos os.

‘Forestillingen om, at systemer som DALL-E 2 ikke har komposition, kan komme som en overraskelse for enhver, der har set DALL-E 2’s slående rimelige svar på prompter som ’en tegning af et baby-daikon-røddike i en tutu, der går en poodle’. Prompter som disse genererer ofte en rimelig approximation af en kompositionel koncept, med alle dele af prompten til stede og til stede på de rigtige steder.

‘Komposition er dog ikke kun evnen til at lime ting sammen – selv ting, man måske aldrig har set sammen før. Komposition kræver en forståelse af reglerne, der binder ting sammen. Relationer er sådanne regler.’

Man Bites T-Rex

Opinion Da OpenAI åbner op for et større antal brugere efter dens nylige beta-monetarisering af DALL-E 2, og da man nu skal betale for de fleste generationer, kan DALL-E 2’s begrænsninger i relationel forståelse blive mere åbenlyse, da hver “fejlet” forsøg har en finansielle vægt, og refunderinger ikke er tilgængelige.

De af os, der fik en invitation lidt tidligere, har haft tid (og indtil for nylig mere tid til at lege med systemet) til at observere nogle af “relation-fejlene”, som DALL-E 2 kan udgive.

For eksempel er det for en Jurassic Park-fan meget svært at få en dinosaur til at forfølge en person i DALL-E 2, selvom konceptet “forfølge” ikke synes at være i DALL-E 2’s censur-system, og selvom den lange historie af dinosaur-film skulle give rigeligt med trænings-eksempler (i hvert fald i form af trailers og publicity-shots) til denne ellers umulige møde mellem arter.

Et typisk DALL-E 2-svar på prompten 'Et farvefoto af en T-Rex, der forfølger en mand ned ad en vej'. Kilde: DALL-E 2

Et typisk DALL-E 2-svar på prompten ‘Et farvefoto af en T-Rex, der forfølger en mand ned ad en vej’. Kilde: DALL-E 2

Jeg har fundet, at billederne ovenfor er typiske for variationer på ‘[dinosaur] forfølger [en person]’-prompt-design, og at ingen mængde uddybning i prompten kan få T-Rex’en til at følge med. I det første og andet billede er manden (mere eller mindre) forfølger T-Rex’en; i det tredje nærmer han sig den med en nonchalant ligegyldighed over for sikkerheden; og i det sidste billede ser han ud til at jogge parallelt med det store dyr. Over omkring 10-15 forsøg på dette tema har jeg fundet, at dinosaurerne er lige så “afledt”.

Det kan være, at den eneste træningsdata, DALL-E 2 kunne få adgang til, var i retningen af ‘mand kæmper mod dinosaur’, fra publicity-shots for ældre film som One Million Years B.C. (1966), og at Jeff Goldblums berømte flugt fra kongen af rovdyr blot er en outlier i den lille mængde data.

 

* Min konvertering af forfatternes inline-citationer til hyperlinks.

Først udgivet 4. august 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai