Andersons vinkel

‘Meningsløs språk’ som kan undergrave bildesynthese-modereringssystemer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
DALL-E 2: 'a man in a state of exaspenttausacion' . https://labs.openai.com/s/PHCrZh2i5FC2N814U8pbxuug

Nye forskninger fra Columbia universitet antyder at sikkerhetstiltakene som forhindrer bildesynthese-modeller som DALL-E 2, Imagen og Parti fra å produsere skadelig eller kontroversiell bilde, er sårbare for en type adversarial angrep som innebærer ‘oppdiktet’ ord.

Forfatteren har utviklet to metoder som potensielt kan override innholdsmodereringsmålene i et bildesynthesesystem, og har funnet ut at de er usedvanlig robuste, selv over forskjellige arkitekturer, noe som indikerer at svakheten er mer enn bare systemisk, og kan være knyttet til noen av de grunnleggende prinsippene for tekst-til-bilde-synthese.

Den første, og den sterkeste av de to, kalles macaronic prompting. Begrepet ‘macaronic’ opprinnelig refererer til en blanding av flere språk, som finnes i Esperanto eller Unwinese. Kanskje det mest kultur-diffuserte eksempelet ville være Urdu-Engelsk, en type ‘kode-blanding’ som er vanlig i Pakistan, som ganske fritt blander engelske substantiver og urdu-suffikser.

Komposisjonell macaronic prompting i DALL-E 2. Kilde: https://arxiv.org/pdf/2208.04135.pdf

Komposisjonell macaronic prompting i DALL-E 2. Kilde: https://arxiv.org/pdf/2208.04135.pdf

I noen av de ovennevnte eksemplene, er deler av meningsfulle ord limt sammen, ved å bruke engelsk som en ‘skjelett’. Andre eksempler i papiret bruker flere språk over en enkelt prompt.

Systemet vil reagere på en semantisk meningsfull måte på grunn av den relative mangelen på kurasjon i nett-kildene som systemet ble trent på. Slike kilder vil ofte ha ankommet komplett med flerspråklige merker (dvs. fra datasett som ikke er spesifikt designet for en bildesynthese-oppgave), og hvert ord som inntas, uansett språk, vil bli et ‘token’; men likeledes vil deler av disse ordene bli ‘subwords’ eller fraksjonelle token. I naturlig språkbehandling (NLP) hjelper denne type ‘stamming’ å skille ut etymologien til lengre avledede ord som kan oppstå i transformasjonsoperasjoner, men skaper også et massivt leksikalsk ‘Lego-sett’ som ‘kreativ’ prompting kan utnytte.

Monolingvale portmanteau-ord er også effektive i å hente bilder gjennom indirekte eller ikke-prosaisk språk.

Monolingvale portmanteau-ord er også effektive i å hente bilder gjennom indirekte eller ikke-prosaisk språk, med svært lignende resultater ofte tilgjengelig over forskjellige arkitekturer, som DALL-E 2 og DALL-E Mini (Craiyon).

I den andre tilnærmingen, kalt evocative prompting, er noen av de konjugerte ordene lignende i tone til den mer juvenile delen av ‘skolegutt-latin’ demonstrert i Monty Python’s Life of Brian (1979).

Det er ingen spøk – faux-latin ofte lykkes i å fremkalle en meningsfull respons fra DALL-E 2.

Det er ingen spøk – faux-latin ofte lykkes i å fremkalle en meningsfull respons fra DALL-E 2.

Forfatteren sier:

‘En åpenbar bekymring med denne metoden er omgåelsen av innholdsfiltre basert på svartelistede promter. I prinsippet kunne macaronic prompting gi en enkel og tilsynelatende pålitelig måte å omgå slike filtre for å generere skadelig, støtende, ulovlig eller annen sensitiv innhold, inkludert voldelige, hatefulle, rasistiske, sexistiske eller pornografiske bilder, og kanskje bilder som krenker immaterielle rettigheter eller avbilder virkelige personer.

‘Selskaper som tilbyr bilde-generering som en tjeneste, har lagt ned mye omsorg i å forhindre generering av slike utdata i henhold til deres innholdspolitikk. Derfor bør macaronic prompting undersøkes systematisk som en trussel mot sikkerhetsprotokollene som brukes for kommersiell bilde-generering.’

Forfatteren foreslår en rekke midler mot denne sårbarheten, noen av dem han innrømmer kan være over-restruktive.

Det første mulige løsningen er det dyreste: å kurere kilde-bildene mer nøye, med mer menneskelig og mindre algoritmisk tilsyn. Imidlertid innrømmer papiret at dette ikke ville forhindre bildesynthese-systemet fra å skape en støtende kombinasjon av to bilde-konsepter som i seg selv er potensielt harmløse.

For det andre, foreslår papiret at bildesynthese-systemer kunne kjøre deres faktiske utdata gjennom et filter-system, og fange eventuelle problematiske assosiasjoner før de blir servert til brukeren. Det er mulig at DALL-E 2 opererer et slikt filter, selv om OpenAI ikke har avslørt eksakt hvordan DALL-E 2’s innholdsmoderering fungerer.

Til slutt, vurderer forfatteren muligheten av en ‘ord- hvitliste’, som bare ville tillate godkjente og approberte ord å hente og rendre konsepter, men innrømmer at dette kunne representere en ekstremt streng begrensning av systemets nytte.

Selv om forskeren bare eksperimenterte med fem språk (engelsk, tysk, fransk, spansk og italiensk) i å lage prompt-sammensetninger, tror han at denne type ‘adversarial angrep’ kunne bli enda mer ‘kryptisk’ og vanskelig å avverge ved å utvide antallet språk, gitt at hyperskale-modeller som DALL-E 2 er trent på flere språk (fordi det er lettere å bruke lett-filtrert eller ‘rå’ innputt enn å vurdere den enorme utgift av å kurere det, og fordi den ekstra dimensjonaliteten sannsynligvis vil øke systemets nytte).

Papiret heiter Adversarial angrep på bilde-generering med oppdiktet ord, og kommer fra Raphaël Millière ved Columbia University.

Kryptisk språk i DALL-E 2

Det har vært foreslått tidligere at nonsens som DALL-E 2 produserer når den prøver å avbilde skrevet språk, kan i seg selv være en ‘skjult vokabular’. Imidlertid har tidligere forskning om dette mystiske språket ikke tilbudt noen måte å utvikle nonce-ord som kan fremkalle bestemt bilde-innhold.

Av tidligere arbeid, sier papiret:

‘[Det] tilbyr ikke en pålitelig metode for å finne nonce-ord som fremkaller bestemt bilde-innhold. De fleste nonsens-teksten som er inkludert i DALL-E 2’s bilder, ser ikke ut til å være pålitelig assosiert med bestemte visuelle konsepter når de blir transkribert og brukt som en prompt. Dette begrenser muligheten for denne tilnærmingen som en måte å omgå moderering av skadelig eller støtende innhold; som sådan, er det ikke en spesielt bekymringsverdig risiko for misbruk av tekst-guidet bilde-generering-modeller.’

I stedet er forfatterens to metoder utviklet som måter å fremkalle nonsens som kan fremkalle relatert og meningsfullt bilde-innhold, samtidig som de omgår konvensjonell etikette som nå utvikler seg til prompt-ingeniørkunst.

Ved hjelp av eksempel, vurderer forfatteren ordet for ‘fugler’ i de fem språkene som er innenfor papirets omfang: Vögel på tysk, uccelli på italiensk, oiseaux på fransk, og pájaros på spansk.

Med byte-pair-koding (BPE) tokenisering brukt av implementeringen av CLIP som er integret i DALL-E 2, blir ordene tokenisert til uakkentert engelsk, og kan ‘kreativt kombineres’ for å danne nonce-ord som ser ut til å være nonsens for oss, men beholder sin limt-sammen mening for DALL-E 2, og tillater systemet å uttrykke den oppfattede intensjonen:

I ovennevnte eksempel, er to av ‘fremmede’ ord for fugl limt sammen til et nonsens-streng. Takk til den fraksjonelle vekten av sub-ord, blir meningen beholdt.

Forfatteren understreker at meningsfulle resultater også kan oppnås uten å holde seg til grensene for sub-ord-segmentering, antagelig fordi DALL-E 2 (hovedstudien i papiret) har generalisert godt nok til å la grensene for sub-ordene bli utydelige uten å ødelegge deres mening.

For å demonstrere de utviklede tilnærmingene ytterligere, tilbyr papiret eksempler på macaronic prompting over forskjellige domener, ved hjelp av listen over token-ord illustrert nedenfor (med nonsens-hybridiserte ord på høyre side).

Forfatteren sier at følgende eksempler fra DALL-E 2 ikke er ‘cherry-picked’:

Lingua Franca

Papiret observerer også at flere slike eksempler fungerer like godt, eller i hvert fall svært lignende, over både DALL-E 2 og DALL-E Mini (nå Craiyon), og at dette er overraskende, siden DALL-E 2 er en diffusjonsmodell og DALL-E Mini ikke er; de to systemene er trent på forskjellige datasett; og DALL-E Mini bruker en BART tokenisering i stedet for CLIP-tokeniseringen som favoriseres av DALL-E 2.

Merkbart like resultater fra DALL-E Mini, sammenlignet med det forrige bildet, som viste resultater fra samme 'nonsens'-inndata fra DALL-E 2.

Merkbart like resultater fra DALL-E Mini, sammenlignet med det forrige bildet, som viste resultater fra samme ‘nonsens’-inndata fra DALL-E 2.

Som vist i det første av bildene ovenfor, kan macaronic prompting også samles inn i syntaktisk lydige setninger for å generere mer komplekse scener. Imidlertid krever dette å bruke engelsk som en ‘skjelett’ for å samle konseptene, og gjør prosessen mer sannsynlig å bli interceptert av standard-sensor-systemer i et bildesynthesesystem.

Papiret observerer at leksikalsk hybridisering, ‘liming sammen’ av ord for å fremkalle relatert innhold fra et bildesynthesesystem, også kan oppnås i ett enkelt språk, ved å bruke portmanteau-ord.

Evocative Prompting

Den ‘evocative prompting’-tilnærmingen i papiret avhenger av å ‘evokere’ en bredere respons fra systemet med ord som ikke strengt er basert på sub-ord eller sub-token eller delvis delt merking.

En type evocative prompting er pseudolatin, som kan, blant annet, generere bilder av fiktive medisiner, selv uten noen spesifikasjon om at DALL-E 2 skal hente konseptet ‘medisin’:

Evocative prompting fungerer også spesielt godt med nonsens-prompt som relaterer bredt til mulige geografiske lokasjoner, og fungerer ganske pålitelig over forskjellige arkitekturer av DALL-E 2 og DALL-E Mini:

Ordene brukt for disse promptene til DALL-E 2 og DALL-E Mini er redolent av virkelige navn, men er i seg selv fullstendig nonsens. Likevel har systemene 'plukket opp atmosfæren' av ordene.

Ordene brukt for disse promptene til DALL-E 2 og DALL-E Mini er redolent av virkelige navn, men er i seg selv fullstendig nonsens. Likevel har systemene ‘plukket opp atmosfæren’ av ordene.

Det ser ut til å være en overgang mellom macaronic og evocative prompting. Papiret sier:

‘Det ser ut til at forskjeller i treningdata, modell-størrelse og modell-arkitektur kan føre til at forskjellige modeller parser promter som voiscellpajaraux og eidelucertlagarzard på enten “macaronic” eller “evocative” måte, selv når disse modellene er bevist å være responsive til begge prompting-metoder.’

Papiret konkluderer:

‘Selv om forskjellige egenskaper ved disse modellene – inkludert størrelse, arkitektur, tokenisering [prosedyre] og treningdata – kan påvirke deres sårbarhet for tekst-basert adversarial angrep, tyder preliminær bevis diskutert i dette arbeidet på at noen av disse angrepene likevel kan fungere ganske pålitelig over modeller.’

Det største hindret for ekte eksperimentering rundt disse metodene er risikoen for å bli flagget og bannlyst av verts-systemet. DALL-E 2 krever en tilknyttet telefonnummer for hver brukerkonto, og begrenser antallet ‘burner-kontoer’ som ville være nødvendig for å virkelig teste grensene for denne type leksikalsk hacking, i forhold til å undergrave eksisterende modereringsmetoder. For øyeblikket er DALL-E 2’s primære sikkerhetstiltak fortsatt volatilitet av tilgang.

 

Publisert første gang 9. august 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai