Andersons hoek
De ‘onzin-taal’ die beeldsynthesemoderatiesystemen kan omzeilen

Nieuw onderzoek van de Columbia University suggereert dat de beveiligingsmaatregelen die voorkomen dat beeldsynthesemodellen zoals DALL-E 2, Imagen en Parti schadelijke of controversiële beelden kunnen produceren, kwetsbaar zijn voor een soort adversarial attack die ‘verzonnen’ woorden gebruikt.
De auteur heeft twee benaderingen ontwikkeld die de inhoudsmoderatiemaatregelen in een beeldsynthesesysteem mogelijk kunnen omzeilen, en heeft ontdekt dat ze opvallend robuust zijn, zelfs over verschillende architectuurtypen heen, wat aangeeft dat de zwakte meer is dan alleen systeemgebonden en mogelijk te maken heeft met enkele van de meest fundamentele principes van tekst-naar-beeldsynthese.
De eerste, en sterkste, van de twee wordt macaronic prompting genoemd. De term ‘macaronic’ verwijst oorspronkelijk naar een mengeling van meerdere talen, zoals te vinden in Esperanto of Unwinese. Misschien het meest cultureel verspreide voorbeeld zou Urdu-Engels zijn, een type ‘code-mixing’ dat in Pakistan veel voorkomt, waarin Engelse zelfstandige naamwoorden en Urdu-suffixen vrijelijk worden gemengd.
In sommige van de bovengenoemde voorbeelden zijn delen van betekenisvolle woorden aan elkaar geplakt, met Engels als ‘scaffold’. Andere voorbeelden in het artikel gebruiken meerdere talen over een enkele prompt heen.
Het systeem zal op semantisch betekenisvolle wijze reageren vanwege het relatieve gebrek aan curatie in de webbronnen waarop het systeem is getraind. Dergelijke bronnen zullen vaak complete multilinguale labels bevatten (d.w.z. van datasets die niet specifiek zijn ontworpen voor een beeldsynthesetaak), en elk ingeslikt woord, in welke taal dan ook, zal een ‘token’ worden; maar evenzo zullen delen van die woorden ‘subwoorden’ of fractionele tokens worden. In Natural Language Processing (NLP) helpt dit soort ‘stemming’ om de etymologie van langere afgeleide woorden te onderscheiden die kunnen ontstaan tijdens transformatiebewerkingen, maar creëert ook een enorme lexicaal ‘Lego-set’ dat ‘creatieve’ prompting kan benutten.
In de tweede benadering, genaamd evocatieve prompting, zijn sommige van de samengevoegde woorden vergelijkbaar in toon met de meer jeugdige strand van ‘schoolboy Latin’ zoals gedemonstreerd in Monty Python’s Life of Brian (1979).
De auteur stelt:
‘ Een voor de hand liggende zorg met deze methode is de omzeiling van inhoudsfilters op basis van zwarte lijstprompts. In principe kan macaronic prompting een gemakkelijke en ogenschijnlijk betrouwbare manier bieden om dergelijke filters te omzeilen om schadelijke, offensieve, illegale of anderszins gevoelige inhoud te genereren, inclusief gewelddadige, haatdragende, racistische, seksistische of pornografische beelden, en misschien beelden die inbreuk maken op intellectueel eigendom of afbeeldingen van echte personen.
Het artikel is getiteld Adversarial Attacks on Image Generation With Made-Up Words en komt van Raphaël Millière van de Columbia University.
Cryptische taal in DALL-E 2
Het is eerder voorgesteld dat de onzin die DALL-E 2 produceert wanneer het probeert geschreven taal weer te geven, in zichzelf een ‘verborgen vocabulaire’ kan zijn. Echter, eerdere onderzoek naar deze mysterieuze taal heeft geen manier geboden om nonce-strings te ontwikkelen die specifieke beelden kunnen oproepen.
Van de eerdere werkzaamheden zegt het artikel:
‘[Het] biedt geen betrouwbare methode om nonce-strings te vinden die specifieke beelden oproepen. De meeste van de nonsens-tekst die door DALL-E 2 in beelden is opgenomen, lijkt niet betrouwbaar geassocieerd te zijn met specifieke visuele concepten wanneer deze worden overgeschreven en als prompt worden gebruikt. Dit beperkt de haalbaarheid van deze benadering als manier om de moderatie van schadelijke of offensieve inhoud te omzeilen; als zodanig is het geen bijzonder zorgwekkend risico voor het misbruik van tekst-geleide beeldgeneratiemodellen.’
In plaats daarvan worden de twee methoden van de auteur uitgelegd als middelen waarmee nonsens specifieke en betekenisvolle beelden kan oproepen terwijl het conventionele etiquette dat nu ontwikkelt tot prompt-engineering omzeilt.
Lingua Franca
Het artikel merkt ook op dat verschillende van dergelijke voorbeelden even goed werken, of tenminste zeer vergelijkbaar, over zowel DALL-E 2 als DALL-E Mini (nu Craiyon), en dat dit verrassend is, aangezien DALL-E 2 een diffusiemodel is en DALL-E Mini niet; de twee systemen zijn getraind op verschillende datasets; en DALL-E Mini gebruikt een BART-tokenizer in plaats van de CLIP-tokenizer die door DALL-E 2 wordt gebruikt.
Evocatieve prompting
De ‘evocatieve prompting’-benadering in het artikel is afhankelijk van het ‘opwekken’ van een bredere reactie van het systeem met woorden die niet strikt zijn gebaseerd op subwoorden of sub-tokens of gedeeltelijk gedeelde labels.
Een type evocatieve prompting is pseudolatin, dat onder andere kan worden gebruikt om beelden van fictieve medicijnen te genereren, zelfs zonder specificatie dat DALL-E 2 het concept van ‘medicijn’ moet oproepen:
Evocatieve prompting werkt ook bijzonder goed met nonsensuele prompts die in het algemeen verband houden met mogelijke geografische locaties en werkt redelijk betrouwbaar over de verschillende architectuurtypen van DALL-E 2 en DALL-E Mini heen:
Het artikel concludeert:
‘Terwijl verschillende eigenschappen van deze modellen – waaronder grootte, architectuur, tokenisatieprocedure en trainingsdata – hun kwetsbaarheid voor tekst-gebaseerde adversarial attacks kunnen beïnvloeden, suggereren de voorlopige bewijzen die in dit werk worden besproken dat sommige van deze aanvallen mogelijk toch redelijk betrouwbaar over modellen heen werken.’
Arguably de grootste obstakel voor echte experimenten rond deze methoden is het risico om te worden gemarkeerd en geblokkeerd door het host-systeem. DALL-E 2 vereist een geassocieerd telefoonnummer voor elk gebruikersaccount, waardoor het aantal ‘burner-accounts’ dat waarschijnlijk nodig zou zijn om de grenzen van dit soort lexicaal hacken echt te testen, beperkt is, in termen van het omzeilen van de bestaande moderatiemethoden. Op dit moment is de primaire beveiliging van DALL-E 2 de volatiliteit van toegang.
Eerst gepubliceerd op 9 augustus 2022.












