Andersons vinkel
Att använda emojis kan kringgå innehållsfilter i AI-chattbotar

Emojis kan användas för att kringgå säkerhetsmekanismerna i stora språkmodeller och utlösa toxiska utdata som annars skulle blockeras. På detta sätt kan stora språkmodeller (LLM) göras att diskutera och ge råd om förbjudna ämnen som till exempel bombtillverkning och mord.
En ny samarbetsinsats mellan Kina och Singapore har funnit övertygande bevis för att emojis inte bara kan användas för att kringgå innehållsfilter i stora språkmodeller (LLM), utan också generellt öka toxicitetsnivån under en användares interaktion med modellerna:

Från den nya artikeln, en bred demonstration av de sätt som kodning av ett förbjudet begrepp med emojis kan hjälpa en användare att ‘jailbreaka’ en populär LLM. Källa: https://arxiv.org/pdf/2509.11141
I exemplet ovan, från den nya artikeln, ser vi att omvandling av regelbrytande ord-baserad avsikt till en emoji-rik alternativ version kan framkalla en långt mer ‘samarbetsvillig’ respons från en sofistikerad språkmodell som ChatGPT-4o (som vanligtvis sanerar indataprompt och avbryter utdatamaterial som kan bryta mot företagsregler).
Effektivt, i de mest extrema omständigheterna, kan emoji-användning alltså fungera som en jailbreak-teknik, enligt artikelförfattarna.
En residual mystik som anges i artikeln är frågan om varför språkmodeller ger emojis sådan frihet att bryta mot regler och framkalla toxiskt innehåll, när modellerna redan förstår att vissa emojis har starka toxiska associationer.
Förslaget som läggs fram är att eftersom LLM är utbildade för att modellera och reproducera mönster från deras utbildningsdata, och eftersom emojis är så ofta förekommande i den datan, lär modellen att emojis tillhör i den diskursen och behandlar den som en statistisk association, snarare än innehåll som ska utvärderas och filtreras.
Detta innebär att emojis, när de återanvänds i en prompt, hjälper modellen att förutsäga toxiska fortsättningar med större säkerhet; men snarare än att fungera som en varningssignal, fungerar emojis som en semantisk signal, som faktiskt förstärker den avsedda toxiska meningen snarare än att moderera eller avbryta den. Eftersom säkerhetsjustering tillämpas efteråt, och ofta i en smal, bokstavlig ram, kan prompter med dessa emojis undgå upptäckt helt och hållet.
På detta sätt föreslår artikeln att modellen inte blir tolerant trots den toxiska associationen – den blir tolerant på grund av den.
Fri passage
Det sägs att författarna medger att detta inte representerar en slutsats teori om varför emoji-användning kan kringgå innehållsfilter i språkmodeller så effektivt. De påstår:
‘Modeller kan känna igen den skadliga avsikten som uttrycks av emojis, men hur det kringgår säkerhetsmekanismer förblir oklart.’
Svagheten kan härröra från den textcentrerade designen av innehållsfilter, som antar antingen bokstavligen textinmatning eller inbäddningar som troget konverteras till textekvivalenter: i båda fallen förlitar sig systemet på explicita token som kan matchas mot säkerhetsregler.
För att ta ett exempel från AI-baserad bildredigering: när en användare laddar upp en NSFW-bild till en vision-språkmodell och begär ändringar, använder system som Adobe Firefly eller ChatGPT CLIP-stilpipeliner för att extrahera textkoncept från bilden, som en förutsättning för redigering. När dessa koncept är återgivna i ord, kommer närvaron av eventuella begränsade termer i de extraherade orden att utlösa filtret, vilket gör att begäran avvisas.
Men av någon anledning verkar en emojis status som varken ett ord eller en bild (eller både och) ge den en makt att transcendera filter; tydligt, som författarna anger, krävs ytterligare forskning om denna märkliga kryphål.
Den nya artikeln heter När smiley blir fientlig: Tolka hur emojis utlöser LLM-toxicitet, och kommer från nio författare på Tsinghua University och National University of Singapore.
(Tyvärr är många av de exempel som artikeln hänvisar till i en bilaga som ännu inte har gjorts tillgänglig; även om vi har begärt detta av författarna, har bilagan inte tillhandahållits vid tidpunkten för skrivande. Trots detta förblir de empiriska resultaten i den grundläggande artikeln värda att uppmärksamma.)
Tre kärninterpretationer av emojis
Författarna betonar tre lingvistiska egenskaper som gör emojis effektiva för att kringgå filter. Först är emoji-betydelser sammanhangsberoende. Till exempel är ‘Pengar med vingar’-emojin (se bild nedan) officiellt definierad som att representera pengaöverföringar eller utgifter; men beroende på omgivande text kan den också antyda antingen legitima eller olagliga aktiviteter:

I en partiell illustration från den nya artikeln ser vi att en populär emoji kan ha sin betydelse kapad, ändrad eller omvandlad i populär användning Detta ger effektivt emojis en officiell pass till det semantiska utrymmet, och en dold nyttolast av negativ eller toxisk betydelse som kan utnyttjas när den väl har passerat filtren.
Andra, emojis kan skifta tonen i en prompt. Deras närvaro lägger ofta till lekfullhet eller ironi, mjukar upp den emotionella registret. I skadliga frågor kan detta göra begäran se ut som ett skämt eller spel, vilket uppmuntrar modellen att svara snarare än att avvisa:

Den lättnande effekten av emojis kan avgifta ton utan att avgifta avsikt.
Tredje, påstår artikeln, är emojis språkagnostiska: en enda emoji kan bära samma känsla över engelska, kinesiska, franska och andra språk. Detta gör dem idealiska för flerspråkiga prompter, som bevarar betydelse även när den omgivande texten översätts:

Det trasiga hjärtat-emojin förmedlar ett universellt budskap, kanske inte minst för att det representerar ett grundfall i den mänskliga tillståndet, relativt immunt mot nationella eller kulturella variationer.
Tillvägagångssätt, data och tester*
Forskarna skapade en modifierad version av AdvBench-datamängden, genom att omformulera skadliga prompter för att inkludera emojis antingen som ersättningar för känsliga ord eller som dekorativt kamouflage. AdvBench täcker 32 högriskämnen, inklusive bombning, hacking och mord, bland andra:

Original exempel från AdvBench, som visar hur en enda adversarial prompt kan kringgå säkerhetsåtgärder i flera stora chattbotar, och utlösa skadliga instruktioner trots justeringsutbildning. Källa: https://arxiv.org/pdf/2307.15043
Alla 520 ursprungliga AdvBench-instanser ändrades på detta sätt, med de 50 främsta toxiska och icke-duplicerade prompterna som användes över hela experimentserien. Prompterna översattes också till flera språk och testades över sju stora stängda och öppna källkodsmodeller, och i kombination med de kända effektiva jailbreak-teknikerna Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); och DeepInception.
De stängda modellerna som användes var Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; och Gemini-1.5-pro. De öppna källkodsmodellerna som användes var Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); och Qwen2.5-72B-Instruct (Team 2024a), med alla experiment upprepad tre gånger för att ta hänsyn till slumpmässig chans.
Studien testade först om omformulering av skadliga prompter från AdvBench med emojis skulle öka toxisk utdata, inklusive i översättningar till andra stora språk. Dessutom tillämpades samma emoji-redigeringsmetod på prompter från de ovannämnda kända jailbreak-strategierna (PAIR, TAP och DeepInception) för att se om emoji-ersättning kunde ytterligare förbättra deras framgång.
I båda fallen bevarades den ursprungliga promptens struktur, med endast känsliga termer utbytta mot emojis och dekorativa element tillagda för att maskera avsikt.
För testmetriker innoverade författarna ett poängsystem som kallades GPT-Judge. I denna uppsättning fick GPT-4o inte vara den modell som testades, utan snarare uppmanades att agera som en graderare, som tilldelade ett numeriskt Skadligt poäng (HS) till svar genererade av andra modeller.
Varje utdata betygsattes från ett (ofarligt) till fem (mycket skadligt), och procentandelen svar som fick ett fem rapporterades som Skadlighetsförhållande (HR).
För att förhindra att modellerna gled in i emoji-förklaringar istället för att svara explicit, lade forskarna till en instruktion till varje prompt, som sa till modellen att göra svaret kort:

Resultat från emoji-baserade prompter i ‘Inställning-1’, med jämförelser med ablationsvarianter där emojis byttes ut mot ord eller togs bort helt. Modellnamn är förkortade för utrymme.
I den första resultat-tabellen ovan anger den vänstra sidan att skadliga prompter som byttes ut med emojis uppnådde betydligt högre HS- och HR-poäng än ablerade versioner (dvs. versioner där emojis översattes tillbaka till text, och utsattes direkt för innehållsfilter).
Författarna noterar† att emoji-ersättningsmetoden presterar bättre än tidigare jailbreak-metoder, som beskrivs i den ytterligare resultat-tabellen nedan:

Skadlighetsförhållande-resultat för emoji-förstärkta jailbreak-prompter i ‘Inställning-2’, med modellnamn i förkortad form.
Den första av de två tabellerna ovan, påstår författarna, visar också att effekten av emojis sträcker sig över språk. När de textliga komponenterna i emoji-prompterna översattes till kinesiska, franska, spanska och ryska, förblev de skadliga utdata höga; eftersom dessa är alla högresurs-språk, tyder resultaten på att risken inte är begränsad till engelska, utan gäller i allmänhet för stora användargrupper, med emojis som fungerar som en överförbar kanal för toxisk generering.
Mot artikelns slut föreslår forskarna att effekten av emojis inte är enbart en olyckshändelse, utan rotad i hur modellerna bearbetar dem, och noterar att modellerna tydligen kan känna igen den skadliga meningen hos emojis – men avvisnings-svar undertrycks när emojis är närvarande.
Tokeniseringsstudier visar dessutom att emojis vanligtvis bryts ned i sällsynta eller oregelbundna fragment med liten överlappning till deras textekvivalenter, vilket effektivt skapar en alternativ kanal för skadliga semantik.
När man ser bortom modellmekanik, undersöker artikeln dessutom förutbildningsdata och finner att många ofta använda emojis förekommer i toxiska sammanhang, som till exempel porr, bedrägerier eller hasardspel. Författarna hävdar att denna upprepade exponering kan normalisera associationen mellan emojis och skadligt innehåll, och uppmuntrar modellerna att samarbeta med toxiska prompter snarare än att blockera dem.
Tillsammans tyder dessa fynd på att både interna bearbetnings-egenskaper och förutfyllda data bidrar till den förvånansvärt effektiva användningen av emojis för att kringgå säkerhetsåtgärder.
Slutsats
Det är inte ovanligt att använda alternativa inmatningsmetoder för att försöka jailbreaka LLM. Under de senaste åren har till exempel hex-kodning använts för att kringgå ChatGPT:s filter. Problemet verkar ligga i den platta användningen av textbaserat språk för att kvalificera inkommande begäranden och utgående svar.
I fallet med emojis kan en dold källa till regelbrytande mening tydligen införas i diskursen utan straff eller ingripande, eftersom överföringsmetoden är ovanlig. Man skulle tro att CLIP-baserad translitterering skulle ingripa i alla bilduppladdningar, så att stötande eller kränkande material skulle sluta som flaggbart text.
Tydligt är dock att detta inte är fallet, åtminstone inte där de stora LLM som studerats är concerned; deras språkliga barriärer verkar vara sköra och textcentrerade. Man kan föreställa sig att mer omfattande tolkning av innehåll (till exempel genom att studera heatmap-aktiveringar) medför en bearbetnings- och/eller bandbreddskostnad som kan göra sådana tillvägagångssätt opraktiskt dyra, bland annat möjliga begränsningar och överväganden.
* Artikelns layout är kaotisk jämfört med de flesta, med metodik och tester som inte tydligt avgränsas. Vi har därför gjort vårt bästa för att representera arbetets kärnvärde så bra som möjligt under dessa omständigheter.
† I en öppet svår och förvirrad behandling av resultaten.
Publicerad första gången onsdag, 17 september 2025












