Andersons vinkel

DALL-E 2’s Unikke Løsning til Dobbeltbetydninger

mm
Føj Unite.AI til dine foretrukne kilder på Google

Enhver, der har lært italiensk, lærer tidligt at være opmærksom på konteksten, når de beskriver en kost, fordi det italienske ord for denne hverdagslige huslige genstand har en ekstremt NSFW andet betydning som verb*. Selvom vi lærer tidligt at adskille den semantiske kortlægning og (passende) anvendelighed af ord med multiple betydninger, er dette ikke en færdighed, der let kan overføres til hyperskala-billede-syntese-systemer som DALL-E 2 og Stable Diffusion, fordi de afhænger af OpenAI’s Contrastive Language-Image Pre-training (CLIP)-modul, som behandler objekter og deres egenskaber mere løst (men som dog vinder mere og mere ground i den latente diffusion-billede- og video-syntese-rum).

Studiet af denne mangel, en ny forsknings-samarbejde fra Bar-Ilan University og Allen Institute for Artificial Intelligence tilbyder en omfattende undersøgelse af, i hvilken udstrækning DALL-E 2 er tilbøjelig til sådanne semantiske fejl:

Dobbeltbetydninger opdelt i multiple objekter i DALL-E 2 – selvom enhver latent diffusions-system kan producere sådanne eksempler. I det øverste højre billede ændrer fjernelse af 'guld' i prompten fiskens art, mens i tilfældet med 'zebra-overgang' er det nødvendigt at udtrykkeligt angive vejens overflade for at fjerne den duplikerede association. Kilde: https://export.arxiv.org/pdf/2210.10606

Dobbeltbetydninger opdelt i multiple fortolkninger i DALL-E 2 – selvom enhver latent diffusions-system kan producere sådanne eksempler. I det øverste højre billede ændrer fjernelse af ‘guld’ i prompten fiskens art, mens i tilfældet med ‘zebra-overgang’ er det nødvendigt at udtrykkeligt angive vejens overflade for at fjerne den duplikerede association. Kilde: https://export.arxiv.org/pdf/2210.10606

Forfatterne har fundet, at denne tendens til at fortolke ord og fraser dobbelt ikke kun er almindelig for alle CLIP-styrede diffusions-modeller, men at det bliver værre, jo mere data modellerne trænes på. I artiklen hedder det, at ‘reducerede’ versioner af tekst-til-billede-modeller, herunder DALL-E Mini (nu Craiyon), producerer disse fejl meget sjældnere, og at Stable Diffusion også fejler mindre – selvom det ofte skyldes, at den slet ikke følger prompten, hvilket er en anden type fejl.

Den simple prompt 'date' tvinger DALL-E 2 til at aktivere to af de flere betydninger af ordet, mens ordet 'fan' også deles i to af dens semantiske kortlægninger, og i det tredje billede omdanner frasen 'cone' pålideligt den ellers uspecificerede mad i prompten til is, der er forbundet med 'cone'.

Den simple prompt ‘date’ tvinger DALL-E 2 til at aktivere to af de flere betydninger af ordet, mens ordet ‘fan’ også deles i to af dens semantiske kortlægninger, og i det tredje billede omdanner frasen ‘cone’ pålideligt den ellers uspecificerede mad i prompten til is, der er forbundet med ‘cone’.

Forklaring af, hvordan vi udfører effektive leksikale adskillelser, hedder artiklen:

‘Mens symboler – samt sætningsstrukturer – kan være tvetydige, er denne tvetydighed allerede løst, når en fortolkning er konstrueret. For eksempel kan symbolet bat i en flyvende bat fortolkes som enten en træpind eller et dyr, men vores mulige fortolkninger af sætningen er enten en flyvende træpind eller et flyvende dyr, men aldrig begge på samme tid. Når ordet bat er blevet brugt i fortolkningen til at betegne et objekt (for eksempel en træpind), kan det ikke genbruges til at betegne et andet objekt (et dyr) i samme fortolkning.’

DALL-E 2, observerer artiklen, er ikke begrænset på denne måde:

'En flagermus flyver over et baseball-stadion' – det første billede er fra artiklen, de andre tre er erhvervet ved blot at indsætte samme prompt i DALL-E 2.

‘En flagermus flyver over et baseball-stadion’ – det første billede er fra artiklen, de andre tre er erhvervet ved blot at indsætte samme prompt i DALL-E 2.

Dette egenskab er blevet navngivet ressource-sensitivitet.

Artiklen identificerer tre aberrante adfærdsmønstre, som DALL-E 2 udviser: at et ord eller en frase kan fortolkes og effektivt deles i to distinkte enheder, hvilket renderer et objekt eller koncept for hvert i samme scene; at et ord kan fortolkes som en modificator for to forskellige enheder (se ‘guldfisk’ og andre eksempler ovenfor); og at et ord kan fortolkes samtidigt som både en modificator og en alternativ enhed – illustreret ved prompten ‘en sæl åbner et brev’:

'En sæl åbner et brev' – det første illustration er fra artiklen, de næste tre, identiske reproduktioner fra DALL-E 2. De fotorealistiske eksempler nedenfor havde den ekstra tekst 'foto, Canon50, 85mm, F5.6, prisvindende foto'.

‘En sæl åbner et brev’ – det første illustration er fra artiklen, de næste tre, identiske reproduktioner fra DALL-E 2. De fotorealistiske eksempler nedenfor havde den ekstra tekst ‘foto, Canon50, 85mm, F5.6, prisvindende foto’.

Forfatterne identificerer to fejltyper for diffusions-modeller i denne henseende: at resultaterne af bruger-prompts med sans-ambiguøse ord ofte vil udvise den konkrete ord sammen med en manifestation af konceptet; og koncept-lækage, hvor egenskaberne af et objekt ‘lækker’ ind i et andet rendereret objekt.

‘Taget sammen, giver fænomenerne, vi undersøger, bevis for begrænsninger i den lingvistiske evne af DALLE-2 og åbner veje for fremtidig forskning, der ville afsløre, om disse begrænsninger skyldes problemer med tekst-kodningen, den generative model eller begge.

Ved at bruge 17 ord, der vil få DALL-E 2 til at dele inputtet i multiple outputs, observerede forfatterne, at homonym-duplikation forekom i over 80% af 216 billeder, der blev renderet.

Forskerne brugte stimuli-kontrol-par til at undersøge, i hvilken udstrækning specifik og åbenbart over-specifik sprog er nødvendigt for at stoppe disse duplikationer. For enhed-til-egenskabs-testerne blev 10 sådanne par oprettet, og forfatterne bemærker, at stimuli-prompts provokerer den fælles egenskab i 92,5% af tilfældene, hvorimod kontrol-prompten kun fremkalder den i 6,6% af tilfældene.

‘[For at] demonstrere, overvej en zebra og en vej, her er zebra en enhed, men det modificerer vej, og DALLE-2 konstant genererer overgangs-steder, muligvis på grund af zebra-stribernes lighed med en overgang. Og i overensstemmelse med vores formodning, specificerer kontrollen en zebra og en grus-vej en type vej, der typisk ikke har overgangs-steder, og faktisk indeholder alle vores kontrol-prøver for denne prompt ingen overgangs-steder.’

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai