Andersons vinkel
‘Det nonsenssprog’, der kunne undergrave billedsynthesemoderationssystemer

Nyt forskning fra Columbia University antyder, at de sikkerhedsforanstaltninger, der forhindrer billedsynthesemodeller som DALL-E 2, Imagen og Parti i at kunne producere skadelig eller kontroversiel billedmateriale, er sårbare over for en form for adversarial angreb, der involverer ‘opdigtede’ ord.
Forfatteren har udviklet to tilgange, der potentielt kan omgå indholdsmoderationsmålene i et billedsynthesesystem, og har fundet, at de er bemærkelsesværdigt robuste, selv på tværs af forskellige arkitekturer, hvilket indikerer, at svagheden er mere end bare systemisk og kan være forbundet med nogle af de grundlæggende principper for tekst-til-billede-synthese.
Den første og stærkeste af de to tilgange kaldes macaronic prompting. Begrebet ‘macaronic’ refererer oprindeligt til en blanding af multiple sprog, som findes i Esperanto eller Unwinese. Måske det mest kulturelt udbredte eksempel ville være Urdu-Engelsk, en type ‘kodeblanding’ almindelig i Pakistan, der ret frit blandet engelske substantiver og urdu-suffixer.
I nogle af de ovenstående eksempler er dele af meningsfulde ord blevet limet sammen, med engelsk som ‘scaffold’. Andre eksempler i artiklen bruger multiple sprog på tværs af en enkelt prompt.
Systemet vil reagere på en semantisk meningsfuld måde på grund af den relative mangel på kuratering i de webkilder, som systemet er trænet på. Sådanne kilder vil ofte have ankommet komplet med multilinguale mærker (dvs. fra datasæt ikke specifikt designede til en billedsynthesopgave), og hvert ord, der indtages, uanset sprog, vil blive et ‘token’; men ligeså vil dele af disse ord blive ‘subwords’ eller fraktionelle tokens. I naturlig sprogbehandling (NLP) hjælper denne form for ‘stamning’ med at skelne etymologien af længere afledte ord, der kan opstå i transformationer, men det skaber også en massiv leksikalsk ‘Lego-sæt’, som ‘kreativ’ prompting kan udnytte.

Monolinguale portmanteau-ord er også effektive til at få billeder gennem indirekte eller non-prosaisk sprog, med meget lignende resultater ofte kan opnås på tværs af forskellige arkitekturer, såsom DALL-E 2 og DALL-E Mini (Craiyon).
I den anden type tilgang, kaldet evocative prompting, ligner nogle af de sammensatte ord i tone med den mere juvenile strand af ‘skolelatin’ demonstreret i Monty Pythons Life of Brian (1979).
Forfatteren siger:
‘En åbenlys bekymring ved denne metode er omgåelsen af indholdsfiltre baseret på sortlistede prompts. I princippet kunne macaronic prompting give en let og tilsyneladende pålidelig måde at omgå sådanne filtre for at generere skadelig, krænkende, ulovlig eller anden følsom indhold, herunder voldelige, hadefulde, racistiske, sexistiske eller pornografiske billeder, og måske billeder, der krænker ophavsret eller afbilder virkelige personer. ‘
‘Virksomheder, der tilbyder billedgenerering som en tjeneste, har lagt stor omhu i at forhindre generering af sådanne outputs i overensstemmelse med deres indholdspolitik. Følgelig bør macaronic prompting undersøges systematisk som en trussel mod de sikkerhedsprotokoller, der bruges til kommerciel billedgenerering.’
Forfatteren foreslår en række foranstaltninger mod denne sårbarhed, nogle af hvilke han indrømmer kan være over-restruktive.
Den første mulige løsning er den dyreste: at kuratere kildebillederne mere omhyggeligt, med mere menneskelig og mindre algorithmisk tilsyn. Men artiklen indrømmer, at dette ikke ville forhindre billedsynthesesystemet i at skabe en krænkende kombination af to billedkoncepter, der i sig selv potentielt er uskyldige.
For det andet foreslår artiklen, at billedsynthesesystemer kunne køre deres faktiske output gennem et filtersystem, der indfanger eventuelle problematiske associationer, før de præsenteres for brugeren. Det er muligt, at DALL-E 2 i forvejen opererer et sådant filter, selv om OpenAI ikke har afsløret, hvordan DALL-E 2’s indholdsmoderation fungerer.
Endelig overvejer forfatteren muligheden for en ‘ordliste-hvidliste’, der kun ville tillade godkendte og godkendte ord at hente og rendre koncepter, men indrømmer, at dette kunne repræsentere en excessivt streng begrænsning af systemets nytte.
Selv om forskeren kun eksperimenterede med fem sprog (engelsk, tysk, fransk, spansk og italiensk) i opbygningen af prompt-samlinger, mener han, at denne form for ‘adversarial angreb’ kunne blive endnu mere ‘kryptisk’ og svær at afværge ved at udvide antallet af sprog, da hyperskalemodeller som DALL-E 2 er trænet på multiple sprog (fordi det er lettere at bruge let filtreret eller ‘rå’ input end at overveje den enorme omkostning ved at kuratere det, og fordi den ekstra dimensionering sandsynligvis vil tilføje systemets nytte).
Artiklen hedder Adversarial Attacks on Image Generation With Made-Up Words og kommer fra Raphaël Millière på Columbia University.
Kryptisk sprog i DALL-E 2
Det er blevet forslagt før, at nonsensen, som DALL-E 2 producerer, når den forsøger at afbilde skrevet sprog, i sig selv kan være et ‘skjult vocabularium’. Men den tidligere forskning i dette mystiske sprog har ikke tilbudt nogen måde at udvikle nonce-strings, der kan tilkalde specifikke billeder.
Af den tidligere forskning siger artiklen:
‘[Den] tilbyder ikke en pålidelig metode til at finde nonce-strings, der fremkalder specifikke billeder. Det meste af nonsens-teksten, der er inkluderet af DALL-E 2 i billeder, synes ikke at være pålideligt associeret med specifikke visuelle koncepter, når de transkriberes og bruges som prompt. Dette begrænser anvendeligheden af denne tilgang som en måde at omgå modereringen af skadelig eller krænkende indhold på; som sådan er det ikke en særlig bekymrende risiko for misbrug af tekst-styret billedgenerering.’
I stedet er forfatterens to metoder udviklet som måder, hvorpå nonsens kan fremkalde relateret og meningsfuldt billede, mens det omgår den konventionelle etikette, der nu udvikler sig til prompt-teknik.
Ved eksempel overvejer forfatteren ordet for ‘fugle’ på de fem sprog, der er omfattet af artiklen: Vögel på tysk, uccelli på italiensk, oiseaux på fransk og pájaros på spansk.
Med byte-pair-encoding (BPE) tokenisering, der bruges af DALL-E 2’s implementation af CLIP, der er integreret i DALL-E 2, bliver ordene tokeniseret til ukomplet engelsk, og kan ‘kreativt kombineres’ for at danne nonce-ord, der synes at være nonsens for os, men beholder deres samlede mening for DALL-E 2, hvilket tillader systemet at udtrykke den opfattede hensigt:
I ovenstående eksempel er to af ‘fremmede’ ord for fugl limet sammen i en nonsens-streng. Takket være den fraktionelle vægt af sub-ordene, beholdes meningen.
Forfatteren understreger, at meningsfulde resultater også kan opnås uden at overholde grænserne for subword-segmentering, sandsynligvis fordi DALL-E 2 (den primære studie i artiklen) har generaliseret tilstrækkeligt til at lade grænserne for sub-ordene blive uklare uden at ødelægge deres mening.
For yderligere at demonstrere de udviklede tilgange tilbyder artiklen eksempler på macaronic prompting på tværs af forskellige domæner, ved hjælp af listen over token-ord illustreret nedenfor (med nonsens-hybridiserede ord til højre).
Forfatteren siger, at følgende eksempler fra DALL-E 2 ikke er ‘cherry-picked’:
Lingua Franca
Artiklen observerer også, at flere sådanne eksempler fungerer lige så godt, eller i hvert fald meget lignende, på både DALL-E 2 og DALL-E Mini (nu Craiyon), og at dette er overraskende, da DALL-E 2 er en diffusionsmodel og DALL-E Mini ikke er; de to systemer er trænet på forskellige datasæt; og DALL-E Mini bruger en BART tokenizer i stedet for CLIP-tokenizeren, der er favoriseret af DALL-E 2.

Forbløffende lignende resultater fra DALL-E Mini sammenlignet med det foregående billede, der viste resultater fra samme ‘nonsens’-input fra DALL-E 2.
Som vist i det første af billederne ovenfor kan macaronic prompting også samles i syntaktisk gyldige sætninger for at generere mere komplekse scener. Men dette kræver brug af engelsk som ‘scaffold’ til at samle koncepterne, hvilket gør proceduren mere sandsynlig til at blive indfanget af standardcensorsystemer i et billedsyntheseramme.
Artiklen observerer, at leksikalsk hybridisering, ‘limning’ af ord sammen for at fremkalde relateret indhold fra et billedsynthesesystem, også kan opnås på ét sprog, ved brug af portmanteau-ord.
Evocative Prompting
Den ‘evocative prompting’-tilgang, der er fremhævet i artiklen, afhænger af at ‘fremkalde’ en bredere respons fra systemet med ord, der ikke strengt er baseret på sub-ord eller sub-tokens eller delvist delt mærker.
En type evocative prompting er pseudolatin, der kan, blandt andet, generere billeder af fiktive mediciner, selv uden nogen specifikation om, at DALL-E 2 skal hente konceptet ‘medicin’:
Evocative prompting fungerer også særligt godt med nonsens-prompts, der relaterer bredt til mulige geografiske placeringer, og fungerer ret pålideligt på tværs af de forskellige arkitekturer af DALL-E 2 og DALL-E Mini:

De ord, der bruges til disse prompts til DALL-E 2 og DALL-E Mini, er præget af virkelige navne, men er i sig selv ren nonsens. Alligevel har systemerne ‘fanget atmosfæren’ af ordene.
Der synes at være en overlap mellem macaronic og evocative prompting. Artiklen siger:
‘Det synes, at forskelle i træningsdata, modelstørrelse og modelarkitektur kan få forskellige modeller til at parse prompts som voiscellpajaraux og eidelucertlagarzard på enten “macaronic” eller “evocative” vis, selv når disse modeller er bevist for at være responsive til begge prompting-metoder.’
Artiklen slutter:
‘Selv om forskellige egenskaber ved disse modeller – herunder størrelse, arkitektur, tokenisering [procedure] og træningsdata – kan påvirke deres sårbarhed over for tekst-baserede adversarial angreb, tyder foreløbige beviser diskuteret i dette arbejde på, at nogle af disse angreb alligevel kan fungere nogenlunde pålideligt på tværs af modeller.’
Det kan måske siges, at den største hindring for sand eksperimentation omkring disse metoder er risikoen for at blive fanget og bandlyst af værtsystemet. DALL-E 2 kræver en tilknyttet telefonnummer for hver bruger-konto, hvilket begrænser antallet af ‘burner-konti’, der sandsynligvis ville være nødvendige for at sandt teste grænserne for denne form for leksikalsk hacking, i forhold til at undergrave de eksisterende moderationsmetoder. For nuværende er DALL-E 2’s primære sikkerhedsforanstaltning stadig volatiliteten af adgangen.
Først udgivet 9. august 2022.


















