Andersons vinkel
DALL-E 2’s Unike Løsning for Dobbelte Betydninger

Alle som har lært italiensk, lærer tidlig å være oppmerksom på konteksten når de beskriver en børste, fordi det italienske ordet for dette hverdagslige huslige gjenstanden har en ekstremt upassende annen betydning som verb*. Selv om vi lærer tidlig å skille mellom semantisk kartlegging og (passende) anvendelighet av ord med flere betydninger, er dette ikke en ferdighet som er lett å overføre til hyperskala-bilde-syntese-systemer som DALL-E 2 og Stable Diffusion, fordi de avhenger av OpenAI’s Contrastive Language-Image Pre-training (CLIP)-modul, som behandler objekter og deres egenskaper mer løst (men som er i ferd med å vinne mer terreng i den latente diffusjons-bilde- og video-syntese-rommet.
Studiet av denne mangelen, en ny forsknings-samarbeid fra Bar-Ilan University og Allen Institute for Artificial Intelligence, tilbyr en omfattende studie av i hvilken utstrekning DALL-E 2 er utsatt for slike semantiske feil:

Dobbelte betydninger delt ut i flere tolkninger i DALL-E 2 – selv om noen latent diffusjonssystem kan produsere slike eksempler. I øvre høyre bilde, fjerner man ‘gull’ fra prompten, endrer man fiskens art, mens i tilfelle ‘zebra-overgang’, er det nødvendig å uttrykke veioverflaten eksplisitt for å fjerne den dupliserte assosiasjonen. Kilde: https://export.arxiv.org/pdf/2210.10606
Forfatterne har funnet ut at denne tendensen til å dobbelt-tolke ord og fraser synes ikke bare å være vanlig for alle CLIP-guidede diffusjonsmodeller, men at den blir verre når modellene er trent på større og større mengder data. Artikkelen påpeker at ‘reduserte’ versjoner av tekst-til-bilde-modeller, inkludert DALL-E Mini (nå Craiyon), produserer disse feilene langt mindre ofte, og at Stable Diffusion også feiler mindre – selv om bare fordi den ofte ikke følger prompten i det hele tatt, hvilket er en annen type feil.

Den enkle prompten ‘dato’ tvinger DALL-E 2 til å innkalle to av de flere betydningene av ordet, mens ordet ‘vifte’ også deles i to av sine semantiske kartlegginger, og i tredje bilde, setter frasen ‘kjegle’ pålitelig den ellers uspesifiserte maten i prompten til iskrem, som er assosiert med ‘kjegle’.
Forklaringen av hvordan vi utfører effektive leksikalske separasjoner, sier artikkelen:
‘Mens symboler – samt setningsstrukturer – kan være tvetydige, etter at en tolkning er konstruert, er denne tvetydigheten allerede løst. For eksempel, mens symbolet bat i en flyvende flaggermus kan tolkes som enten en trepinne eller et dyr, er våre mulige tolkninger av setningen enten en flyvende trepinne eller et flyvende dyr, men aldri begge på samme tid. Når ordet bat har blitt brukt i tolkningen til å angi et objekt (for eksempel en trepinne), kan det ikke brukes igjen til å angi et annet objekt (et dyr) i samme tolkning.’
DALL-E 2, observerer artikkelen, er ikke begrenset på denne måten:

‘En flaggermus flyr over et baseball-stadion’ – det første bildet er fra artikkelen, de tre andre er hentet fra å mate samme prompt inn i DALL-E 2.
Dette egenskapen har blitt navngitt ressurs-sensitivitet.
Artikkelen identifiserer tre avvikende atferder vist av DALL-E 2: at et ord eller en frase kan bli tolket og effektivt delt i to distinkte enheter, og rendre et objekt eller konsept for hver i samme scene; at et ord kan bli tolket som en modifikator av to forskjellige enheter (se ‘guldfisk’ og andre eksempler ovenfor); og at et ord kan bli tolket samtidig som både en modifikator og en alternativ enhet – eksemplifisert av prompten ‘en selfj er åpner en brev’:

‘En selfj er åpner en brev’ – det første bildet er fra artikkelen, de tre andre, identiske reproduksjoner fra DALL-E 2. De fotorealistiske eksemplene nedenfor hadde ekstra tekst ‘foto, Canon50, 85mm, F5.6, prisvinnende foto’.
Forfatterne identifiserer to feilmoduser for diffusjonsmodeller i denne sammenhengen: at resultater av bruker-prompter med sans-ambigue ord ofte vil vise den konkretiserte ordet sammen med noen manifestasjon av konseptet; og konsept-lekkasje, hvor egenskapene til et objekt ‘lekker’ inn i et annet rendret objekt.
‘Tatt sammen, fenomenene vi undersøker, gir bevis for begrensninger i den lingvistiske evnen til DALLE-2 og åpner opp veier for fremtidig forskning som ville avdekke om disse stammer fra problemer med tekst-koding, generativ modell eller begge.’
Ved å bruke 17 ord som vil få DALL-E 2 til å dele inndataet i flere utdata, observerte forfatterne at homonym-duplisering skjedde i over 80% av 216 renderede bilder.
Forskerne brukte stimuli-kontroll-par til å undersøke i hvilken utstrekning spesifikt og arguabelig over-spesifisert språk er nødvendig for å stoppe disse dupliseringene. For enhet-til-egenskaps-testene, ble 10 slike par skapt, og forfatterne påpeker at stimuli-promptene provoserer den felles egenskapen i 92,5% av tilfellene, mens kontroll-prompten bare utløser den i 6,6% av tilfellene.
‘[For] å demonstrere, vurdér en sebra og en gate, her er sebra en enhet, men den modifiserer gate, og DALLE-2 konstant genererer overganger, muligens på grunn av sebra-stripens likhet med en overgang. Og i linje med vår antagelse, spesifiserer kontrollen en sebra og en grusgate en type gate som vanligvis ikke har overganger, og faktisk, alle våre kontroll-eksempler for denne prompten inneholder ingen overgang.’













