Andersons vinkel
DALL-E 2:s unika lösning för dubbla betydelser

Den som har lärt sig italienska lär sig tidigt att uppmärksamma sammanhanget när man beskriver en borste, eftersom det italienska ordet för denna vardagliga hushållsartikel har en extremt NSFW andra betydelse som verb*. Även om vi lär oss tidigt att skilja på semantisk kartläggning och (lämplig) tillämpbarhet av ord med flera betydelser, är detta inte en färdighet som är lätt att föra över till hyperskala-bildsynthesystem som DALL-E 2 och Stable Diffusion, eftersom de förlitar sig på OpenAI:s Contrastive Language-Image Pre-training (CLIP) -modul, som behandlar objekt och deras egenskaper ganska mycket mer löst (men som är på väg att vinna alltmer mark i den latenta diffusionsbilden och videosyntesutrymmet).
Genom att studera denna brist, presenterar en ny forskningssamarbete från Bar-Ilan University och Allen Institute for Artificial Intelligence en omfattande studie om hur DALL-E 2 är benägen till sådana semantiska fel:

Dubbla betydelser delas upp i flera tolkningar i DALL-E 2 – även om vilket som helst latentsystem kan producera sådana exempel. I den övre högra bilden ändrar borttagning av ‘guld’ i prompten fiskens art, medan i fallet med ‘zebraövergång’ är det nödvändigt att uttryckligen ange vägytan för att ta bort den duplicerade associationen. Källa: https://export.arxiv.org/pdf/2210.10606
Författarna har funnit att denna tendens att dubbeltyda ord och fraser inte bara är gemensam för alla CLIP-styrda diffusionsmodeller, utan att den också förvärras när modellerna tränas på allt större mängder data. I artikeln påpekas att “reducerade” versioner av text-till-bild-modeller, inklusive DALL-E Mini (nu Craiyon), genererar dessa typer av fel mycket mindre ofta, och att Stable Diffusion också felar mindre – men bara för att den ofta inte följer prompten alls, vilket är en annan typ av fel.

Den enkla prompten ‘datum’ tvingar DALL-E 2 att åberopa två av de flera betydelserna av ordet, medan ordet ‘fläkt’ också delas upp i två av dess semantiska kartläggningar, och i den tredje bilden förvandlar frasen ‘kon’ tillförlitligt den ostrukturerade maten i prompten till glass, som är associerad med ‘kon’.
Genom att förklara hur vi utför effektiva lexikala separeringar, påpekar artikeln:
‘Medan symboler – liksom meningsstrukturer – kan vara tvetydiga, är denna tvetydighet redan löst när en tolkning har konstruerats. Till exempel, medan symbolen “fladdermus” i en flygande fladdermus kan tolkas antingen som en träklubba eller ett djur, är våra möjliga tolkningar av meningen antingen en flygande träklubba eller ett flygande djur, men aldrig båda samtidigt. När ordet “fladdermus” har använts i tolkningen för att beteckna ett objekt (t.ex. en träklubba), kan det inte återanvändas för att beteckna ett annat objekt (ett djur) i samma tolkning.’
DALL-E 2, observerar artikeln, är inte begränsad på detta sätt:

‘En fladdermus flyger över en basebollstadion’ – den första bilden är från artikeln, de tre andra erhållna från att enbart mata in samma prompt i DALL-E 2.
Denna egenskap har döpts resurskänslighet.
Författarna identifierar tre avvikande beteenden som DALL-E 2 uppvisar: att ett ord eller en fras kan tolkas och effektivt delas upp i två distinkta enheter, vilket återger ett objekt eller begrepp för var och en i samma scen; att ett ord kan tolkas som en modifierare av två olika enheter (se exempel som “guldfisk” och andra ovan); och att ett ord kan tolkas samtidigt som både en modifierare och en alternativ enhet – exemplifierat av prompten ‘en sälar öppnar ett brev’:

‘En sälar öppnar ett brev’ – den första illustrationen är från artikeln, de tre intilliggande, identiska reproduktioner från DALL-E 2. De fotorealistiska exemplen nedan hade extra texten ‘foto, Canon50, 85mm, F5.6, prisbelönt foto’.
Författarna identifierar två felmoder för diffusionsmodeller i detta avseende: att resultaten av användarprompter med betydelseambigua ord ofta kommer att visa den konkretiserade ordet tillsammans med någon manifestation av begreppet; och begreppsläckage, där egenskaperna hos ett objekt “läcker” in i ett annat återgivet objekt.
‘Tagna tillsammans, ger de fenomen vi undersöker bevis för begränsningar i den lingvistiska förmågan hos DALLE-2 och öppnar vägar för framtida forskning som skulle avslöja om dessa begränsningar beror på problem med textkodningen, den generativa modellen eller båda. Mer allmänt, kan den föreslagna metoden utvidgas till andra scenarier där avkodningsprocessen används för att avslöja den induktiva förkastningen och bristerna i text-till-bild-modeller.’
Genom att använda 17 ord som kommer att få DALL-E 2 att dela inmatningen i flera utdata, observerade författarna att homonym -duplicering inträffade i över 80% av 216 återgivna bilder.
Forskarna använde stimuli-kontrollpar för att undersöka i vilken utsträckning specifik och eventuellt överspecifik språk är nödvändig för att stoppa dessa dubbleringar. För enhet-till-egenskaps-testerna skapades 10 sådana par, och författarna påpekar att stimuli-prompterna framkallar den delade egenskapen i 92,5% av fallen, medan kontrollprompten endast framkallar den i 6,6% av fallen.
‘[För] att demonstrera, överväg en zebra och en gata, här är zebra en enhet, men den modifierar gatan, och DALLE-2 genererar konstant övergångar, möjligen på grund av zebra-rändernas likhet med en övergång. Och i linje med vår gissning, specificerar kontrollen en zebra och en grusgata en typ av gata som vanligtvis inte har övergångar, och faktiskt, alla våra kontrollprover för denna prompt innehåller inte en övergång.’













