Andersons vinkel
‘Meningslöst språk’ som kan kringgå bildsynthesmodereringssystem

Ny forskning från Columbia University tyder på att skyddsåtgärderna som förhindrar att bildsynthesmodeller som DALL-E 2, Imagen och Parti kan producera skadliga eller kontroversiella bilder är känsliga för en typ av adversarial attack som involverar “uppfunna” ord.
Författaren har utvecklat två metoder som potentiellt kan åsidosätta innehållsmoderingsåtgärderna i ett bildsynthesystem och har funnit att de är anmärkningsvärt robusta även över olika arkitekturer, vilket tyder på att svagheten är mer än bara systemisk och kan bero på några av de mest grundläggande principerna för text-till-bild-syntes.
Den första och starkaste metoden kallas macaronic prompting. Termen “macaronic” hänvisar ursprungligen till en blandning av flera språk, som finns i Esperanto eller Unwinese. Kanske det mest kulturellt spridda exemplet skulle vara Urdu-Engelska, en typ av “kodmixning” som är vanlig i Pakistan, som ganska fritt blandar engelska substantiv och urdu-suffix.
I några av ovanstående exempel har delar av meningsfulla ord limmats ihop, med engelska som “ställning”. Andra exempel i artikeln använder flera språk över en enda prompt.
Systemet kommer att svara på ett semantiskt meningsfullt sätt på grund av den relativa bristen på kurering i webbkällorna som systemet tränades på. Sådana källor kommer ofta att ha anlänt komplett med flerspråkiga etiketter (dvs. från dataset som inte specifikt är utformade för en bildsyntesuppgift), och varje ord som intagits, oavsett språk, kommer att bli en “token”; men likaså kommer delar av dessa ord att bli “subwords” eller fraktionella token. I naturlig språkbehandling (NLP) hjälper denna typ av “stamning” till att skilja på etymologin för längre härledda ord som kan uppstå i transformationsoperationer, men skapar också en enorm lexikal “Lego-uppsättning” som “kreativ” prompting kan utnyttja.

Monolinguala portmanteauord är också effektiva för att erhålla bilder genom indirekt eller icke-prosaiskt språk, med mycket liknande resultat som ofta kan erhållas över olika arkitekturer, såsom DALL-E 2 och DALL-E Mini (Craiyon).
I den andra typen av metod, kallad evocative prompting, är några av de sammansatta orden liknande i ton till den mer yngre strängen av “skolpojkslatin” demonstrerad i Monty Pythons Life of Brian (1979).

Det är ingen skämt – falskt latin lyckas ofta med att framkalla en meningsfull respons från DALL-E 2.
Författaren påpekar:
‘En uppenbar oro med denna metod är kringgåendet av innehållsfilter baserade på svarta listor. I princip kunde macaronic prompting tillhandahålla ett enkelt och tydligen tillförlitligt sätt att kringgå sådana filter för att generera skadliga, stötande, olagliga eller annan känslig innehåll, inklusive våldsamma, hatiska, rasistiska, sexistiska eller pornografiska bilder, och kanske bilder som kränker immateriella rättigheter eller avbildar verkliga personer.
‘Företag som erbjuder bildgenerering som en tjänst har lagt ner stor omsorg på att förhindra generering av sådana utdata i enlighet med deras innehållspolicy. Följaktligen bör macaronic prompting undersökas systematiskt som ett hot mot säkerhetsprotokollen som används för kommersiell bildgenerering.’
Författaren föreslår ett antal lösningar mot denna sårbarhet, några av vilka han medger kan vara överrestriktiva.
Den första möjliga lösningen är den dyraste: att kurera källträningsbilderna mer noggrant, med mer mänsklig och mindre algoritmisk tillsyn. Men artikeln medger att detta inte skulle förhindra att bildsyntesystemet skapar en stötande konjunktion mellan två bildkoncept som i sig själva potentiellt är ofarliga.
Som andra möjlighet föreslår artikeln att bildsyntesystem kan köra sin faktiska utdata genom ett filtersystem, som fångar upp eventuella problematiska associationer innan de visas för användaren. Det är möjligt att DALL-E 2 för närvarande använder ett sådant filter, även om OpenAI inte har avslöjat exakt hur DALL-E 2:s innehållsmoderering fungerar.
Slutligen överväger författaren möjligheten av en “ordlista vitlista”, som endast tillåter granskade och godkända ord att hämta och återge begrepp, men medger att detta kunde representera en alltför sträng begränsning av systemets användbarhet.
Även om forskaren endast experimenterade med fem språk (engelska, tyska, franska, spanska och italienska) vid skapandet av prompt-sammansättningar, tror han att denna typ av “adversarial attack” kunde bli ännu mer “kryptisk” och svår att avvärja genom att utöka antalet språk, med tanke på att hyperskalemodeller som DALL-E 2 tränas på flera språk (enbart för att det är lättare att använda lättfilterade eller “råa” indata än att överväga den enorma kostnaden för att kurera dem, och för att den extra dimensionen sannolikt kommer att lägga till systemets användbarhet).
Artikeln heter Adversarial Attacks on Image Generation With Made-Up Words och kommer från Raphaël Millière vid Columbia University.
Kryptiskt språk i DALL-E 2
Det har föreslagits tidigare att nonsens som DALL-E 2 producerar när den försöker avbilda skriven text i sig kan vara ett ‘dolt lexikon’. Men tidigare forskning om detta mystiska språk har inte erbjudit något sätt att utveckla nonce-strängar som kan framkalla specifik bild.
Av tidigare arbete säger artikeln:
‘[Det] erbjuder inte en tillförlitlig metod för att hitta nonce-strängar som framkallar specifik bild. De flesta av nonsens-texten som ingår i DALL-E 2:s bilder verkar inte vara tillförlitligt associerade med specifika visuella begrepp när de transkriberas och används som en prompt. Detta begränsar användbarheten av denna metod som ett sätt att kringgå modereringen av skadligt eller stötande innehåll; som sådan är det inte en särskilt oroande risk för missbruk av textstyrd bildgenerering.’
I stället utvecklas författarens två metoder som medel för att nonsens kan framkalla relaterad och meningsfull bildsamtidigt som det kringgår den konventionella etiketten som nu utvecklas till promptteknik.
Till exempel överväger författaren ordet för “fåglar” på de fem språk som omfattas av artikeln: Vögel på tyska, uccelli på italienska, oiseaux på franska, och pájaros på spanska.
Med byte-par-encoding (BPE) tokenisering som används av DALL-E 2:s implementation av CLIP som integreras i DALL-E 2, tokeniseras orden till icke-betonad engelska, och kan “kreativt kombineras” för att bilda nonce-ord som verkar vara nonsens för oss, men behåller den limmade ihop meningen för DALL-E 2, vilket tillåter systemet att uttrycka den uppfattade avsikten:
I ovanstående exempel är två av “främmande” orden för fågel limmade ihop till en nonsenssträng. Tack vare den fraktionella vikten av suborden behålls meningen.
Författaren betonar att meningsfulla resultat också kan erhållas utan att följa gränserna för subord-segmentering, antagligen för att DALL-E 2 (den primära studien i artikeln) har generaliserat tillräckligt bra för att låta gränserna för suborden suddas ut utan att förstöra deras mening.
För att ytterligare demonstrera de utvecklade metoderna erbjuder artikeln exempel på macaronic prompting över olika domäner, med hjälp av listan över token-ord som visas nedan (med nonsens-hybridiserade ord längst till höger).
Författaren påpekar att följande exempel från DALL-E 2 inte är “cherry-picked”:
Lingua Franca
Artikeln observerar också att flera sådana exempel fungerar lika bra, eller åtminstone mycket liknande, över både DALL-E 2 och DALL-E Mini (nu Craiyon), och att detta är förvånande, eftersom DALL-E 2 är en diffusionsmodell och DALL-E Mini inte är; de två systemen tränas på olika dataset; och DALL-E Mini använder en BART tokenisator istället för CLIP-tokenisatorn som favoriseras av DALL-E 2.

Anmärkningsvärt liknande resultat från DALL-E Mini, jämfört med den tidigare bilden, som visade resultat från samma ‘nonsens’ indata från DALL-E 2.
Som visas i den första av bilderna ovan kan macaronic prompting också sättas samman i syntaktiskt korrekta meningar för att generera mer komplexa scener. Men detta kräver att engelska används som “ställning” för att sammanfoga koncepten, vilket gör proceduren mer benägen att avlyssnas av standardcensorsystem i en bildsyntesram.
Artikeln observerar att lexikal hybridisering, “limmande” av ord för att framkalla relaterat innehåll från ett bildsyntesystem, också kan åstadkommas på ett enda språk, genom användning av portmanteauord.
Evocativ prompting
“Evocativ prompting”-metoden i artikeln beror på att “framkalla” en bredare respons från systemet med ord som inte strikt baseras på subord, subtoken eller delat etiketter.
En typ av evocativ prompting är pseudolatin, som kan, bland annat, generera bilder av fiktiva läkemedel, även utan någon specifikation att DALL-E 2 ska hämta begreppet “läkemedel”:
Evocativ prompting fungerar också särskilt bra med nonsensprompts som relaterar till möjliga geografiska platser och fungerar ganska tillförlitligt över olika arkitekturer av DALL-E 2 och DALL-E Mini:

De ord som används för dessa prompts till DALL-E 2 och DALL-E Mini påminner om riktiga namn, men är i sig själva fullständigt nonsens. Trots detta har systemen ‘fångat upp atmosfären’ av orden.
Det verkar finnas någon överlappning mellan macaronic och evocativ prompting. Artikeln påpekar:
‘Det verkar som att skillnader i träningsdata, modellstorlek och modellarkitektur kan orsaka att olika modeller tolkar prompts som voiscellpajaraux och eidelucertlagarzard antingen på “macaronic” eller “evocative” sätt, även när dessa modeller bevisats vara responsiva för båda promptmetoderna.’
Artikeln slutsats:
‘Medan olika egenskaper hos dessa modeller – inklusive storlek, arkitektur, tokenisering och träningsdata – kan påverka deras sårbarhet för textbaserade adversarial attacker, tyder preliminär bevis som diskuteras i detta arbete på att vissa av dessa attacker kan fungera ganska tillförlitligt över modeller.’
Det största hindret för verkligt experiment kring dessa metoder är risken för att bli flaggad och bannlyst av värdsystemet. DALL-E 2 kräver ett associerat telefonnummer för varje användarkonto, vilket begränsar antalet “bränna-konton” som sannolikt skulle behövas för att verkligen testa gränserna för denna typ av lexikal hacking, i termer av att kringgå de befintliga modereringsmetoderna. För närvarande är DALL-E 2:s primära säkerhetsåtgärd fortfarande volatiliteten i åtkomsten.
Publicerad första gången den 9 augusti 2022.

















