Andersons hoek

DALL-E 2’s Unieke Oplossing voor Dubbele Betekenissen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Iedereen die Italiaans heeft geleerd, leert al snel om aandacht te besteden aan de context wanneer hij een bezem beschrijft, omdat het Italiaanse woord voor dit alledaagse huishoudelijke artikel een extreem NSFW tweede betekenis als werkwoord* heeft. Hoewel we al snel leren om de semantische mapping en (apposite) toepasbaarheid van woorden met meerdere betekenissen te ontrafelen, is dit geen vaardigheid die gemakkelijk kan worden overgedragen aan hyperschaalbeeldsynthesesystemen zoals DALL-E 2 en Stable Diffusion, omdat ze afhankelijk zijn van OpenAI’s Contrastive Language-Image Pre-training (CLIP) module, die objecten en hun eigenschappen wat losser behandelt (maar die terrein wint in de latent diffusiebeeld- en videosyntheseruimte).

Door deze tekortkoming te bestuderen, biedt een nieuwe onderzoeks samenwerking van de Bar-Ilan Universiteit en het Allen Institute for Artificial Intelligence een uitgebreide studie naar de mate waarin DALL-E 2 geneigd is tot dergelijke semantische fouten:

Dubbele betekenissen gesplitst in meerdere objecten in DALL-E 2 – hoewel elk latent diffusiesysteem dergelijke voorbeelden kan produceren. In de bovenste rechterafbeelding verandert het verwijderen van 'goud' in de prompt de soort vis, terwijl in het geval van de 'zebra-oversteek' het noodzakelijk is om de wegoppervlak expliciet te vermelden om de gedupliceerde associatie te verwijderen. Bron: https://export.arxiv.org/pdf/2210.10606

Dubbele betekenissen gesplitst in meerdere interpretaties in DALL-E 2 – hoewel elk latent diffusiesysteem dergelijke voorbeelden kan produceren. In de bovenste rechterafbeelding verandert het verwijderen van ‘goud’ in de prompt de soort vis, terwijl in het geval van de ‘zebra-oversteek’ het noodzakelijk is om de wegoppervlak expliciet te vermelden om de gedupliceerde associatie te verwijderen. Bron: https://export.arxiv.org/pdf/2210.10606

De auteurs hebben ontdekt dat deze neiging om woorden en zinnen te dubbel interpreteren niet alleen algemeen is voor alle CLIP-geleide diffusiemodellen, maar dat het erger wordt naarmate de modellen zijn getraind op grotere hoeveelheden gegevens. Het artikel vermeldt dat ‘verminderde’ versies van tekst-naar-afbeeldingsmodellen, waaronder DALL-E Mini (nu Craiyon), deze soort fouten veel minder vaak produceren, en dat Stable Diffusion ook minder vaak fouten maakt – maar alleen omdat het vaak de prompt niet volgt, wat een andere soort fout is.

De eenvoudige prompt 'datum' dwingt DALL-E 2 om twee van de verschillende betekenissen van het woord op te roepen, terwijl het woord 'fan' ook in twee van zijn semantische mappingen splitst, en in de derde afbeelding verandert de zin 'kegel' de ongespecificeerde voedsel in de prompt betrouwbaar in ijs, dat geassocieerd is met 'kegel'.

De eenvoudige prompt ‘datum’ dwingt DALL-E 2 om twee van de verschillende betekenissen van het woord op te roepen, terwijl het woord ‘fan’ ook in twee van zijn semantische mappingen splitst, en in de derde afbeelding verandert de zin ‘kegel’ de ongespecificeerde voedsel in de prompt betrouwbaar in ijs, dat geassocieerd is met ‘kegel’.

Door uit te leggen hoe we efficiënte lexicaal scheidingen uitvoeren, vermeldt het artikel:

‘Terwijl symbolen – evenals zinsstructuren – ambigu kunnen zijn, is deze ambiguïteit al opgelost zodra een interpretatie is geconstrueerd. Bijvoorbeeld, terwijl het symbool “vleermuis” in een vliegende vleermuis kan worden geïnterpreteerd als een houten stok of een dier, zijn onze mogelijke interpretaties van de zin ofwel een vliegende houten stok of een vliegend dier, maar nooit beide tegelijk. Zodra het woord “vleermuis” is gebruikt in de interpretatie om een object (bijvoorbeeld een houten stok) aan te duiden, kan het niet opnieuw worden gebruikt om een ander object (een dier) in dezelfde interpretatie aan te duiden.’

DALL-E 2, merkt het artikel op, is niet op deze manier beperkt:

'Een vleermuis vliegt over een honkbalstadion' – de eerste afbeelding is uit het artikel, de andere drie zijn verkregen door simpelweg dezelfde prompt in DALL-E 2 in te voeren.

‘Een vleermuis vliegt over een honkbalstadion’ – de eerste afbeelding is uit het artikel, de andere drie zijn verkregen door simpelweg dezelfde prompt in DALL-E 2 in te voeren.

Deze eigenschap is genoemd resourcegevoeligheid.

Het artikel identificeert drie abnormale gedragingen die door DALL-E 2 worden vertoond: dat een woord of zin kan worden geïnterpreteerd en effectief gesplitst in twee afzonderlijke entiteiten, waardoor een object of concept voor elk in hetzelfde tafereel wordt weergegeven; dat een woord kan worden geïnterpreteerd als een modificator van twee verschillende entiteiten (zie de ‘goudvis’ en andere voorbeelden hierboven); en dat een woord kan worden geïnterpreteerd als zowel een modificator als een alternatieve entiteit – zoals wordt geïllustreerd door de prompt ‘een zeehond opent een brief’:

'Een zeehond opent een brief' – de eerste illustratie is uit het artikel, de aangrenzende drie zijn identieke reproducties van DALL-E 2. De fotorealistische voorbeelden hieronder hadden de extra tekst 'foto, Canon50, 85mm, F5.6, award-winning foto'.

‘Een zeehond opent een brief’ – de eerste illustratie is uit het artikel, de aangrenzende drie zijn identieke reproducties van DALL-E 2. De fotorealistische voorbeelden hieronder hadden de extra tekst ‘foto, Canon50, 85mm, F5.6, award-winning foto’.

De auteurs identificeren twee foutmodi voor diffusiemodellen in dit opzicht: dat de resultaten van gebruikersprompts met zinambigue woorden vaak de geconcretiseerde woorden samen met enige manifestatie van het concept zullen vertonen; en conceptlekkage, waarbij de eigenschappen van een object ‘lekken’ in een ander weergegeven object.

‘Samen genomen, bieden de fenomenen die we onderzoeken bewijs voor beperkingen in de linguïstische capaciteit van DALLE-2 en openen wegen voor toekomstig onderzoek dat zou kunnen ontdekken of deze beperkingen voortkomen uit problemen met de tekstcodering, het generatieve model of beide. Meer in het algemeen kan de voorgestelde aanpak worden uitgebreid naar andere scenario’s waarin het decodingsproces wordt gebruikt om de inductieve voorkeur en de tekortkomingen van tekst-naar-afbeeldingsmodellen te onthullen.’

Door 17 woorden te gebruiken die DALL-E 2 zullen dwingen om de invoer te splitsen in meerdere uitvoer, hebben de auteurs waargenomen dat homoniem duplicatie plaatsvond in meer dan 80% van 216 gegenereerde afbeeldingen.

De onderzoekers gebruikten stimuli-controle paren om de mate te onderzoeken waarin specifieke en overduidelijk taal noodzakelijk is om deze duplicaties te voorkomen. Voor de entiteit-tot-eigenschap tests werden 10 dergelijke paren gemaakt, en de auteurs merken op dat de stimuli-prompts de gedeelde eigenschap in 92,5% van de gevallen oproepen, terwijl de controleprompt deze alleen in 6,6% van de gevallen oproept.

‘[Om] te demonstreren, overweeg een zebra en een straat, hier is zebra een entiteit, maar het modificeert straat, en DALLE-2 genereert onstant oversteekplaatsen, mogelijk vanwege de gelijkenis van de zebra-strepen met een oversteekplaats. En in overeenstemming met onze veronderstelling, specificeert de controle een zebra en een grindweg een type straat dat typisch geen oversteekplaatsen heeft, en inderdaad, alle van onze controlesamples voor deze prompt bevatten geen oversteekplaats.’

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai