Andersons vinkel

Emojier kan brukes til å unngå innholdssensur i AI-chatbots

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Emojier kan brukes til å unngå sikkerhetsmekanismene i store språkmodeller, og utløse giftige utdata som ellers ville bli blokkert. Ved denne metoden kan LLM-er bli overtalt til å diskutere og gi råd om forbudte emner som bombmaking og mord.

 

Et nytt samarbeid mellom Kina og Singapore har funnet overbevisende bevis for at emojier kan brukes ikke bare til å unngå innholdssensur i store språkmodeller (LLM-er), men også generelt øke nivået av giftighet under en brukers interaksjon med modellene:

Fra den nye artikkelen, en bred demonstrasjon av måtene emojier kan brukes til å 'jailbreak' en populær LLM. Kilde: https://arxiv.org/pdf/2509.11141

Fra den nye artikkelen, en bred demonstrasjon av måtene emojier kan brukes til å ‘jailbreak’ en populær LLM. Kilde: https://arxiv.org/pdf/2509.11141

I eksempelet ovenfor, fra den nye artikkelen, ser vi at transformasjon av regelbrytende ord-basert intensjon til en emoji-rik alternativ versjon kan utløse en mye mer ‘samarbeidende’ respons fra en sofistikert språkmodell som ChatGPT-4o (som vanligvis saniterer innputt-prompter og avbryter utgangsmateriale som kan bryte selskapsregler).

Effektivt, i de mest ekstreme omstendighetene, kan emoji-bruk derfor fungere som en jailbreak-teknikk, ifølge forfatterne av den nye artikkelen.

En residual mysterium som er uttalt i artikkelen er spørsmålet om hvorfor språkmodeller gir emojier så mye frihet til å bryte regler og utløse giftig innhold, når modellene allerede forstår at visse emojier har sterkt giftige assosiasjoner.

Forslaget som fremføres er at fordi LLM-er er trent til å modellere og reproducere mønster fra deres treningsdata, og fordi emojier er så ofte funnet i den dataen, lærer modellen at emojien tilhører i den diskursen, og behandler den som en statistisk assosiasjon, i stedet for innhold som skal vurderes og filtreres.

Dette betyr at emojien, når den brukes på nytt i en prompt, hjelper modellen til å forutsi giftige fortsettelse mer selvbevisst; men i stedet for å fungere som en rød flagg, fungerer emojien som en semantisk cue, som faktisk forsterker den giftige meningen i stedet for å moderere eller avbryte den. Siden sikkerhetsjustering blir brukt etterpå, og ofte i en smal, bokstavelig ramme, kan prompter med disse emojiene derfor unngå oppdagelse helt og holdent.

I denne måten foreslår artikkelen at modellen ikke blir tolerant tross den giftige assosiasjonen – den blir tolerant fordi den.

Fri pass

Det er sagt, at forfatterne innrømmer at dette ikke representerer en konklusiv teori om hvorfor emoji-bruk kan være så effektivt til å unngå innholdssensur i språkmodeller. De uttaler:

‘Modeller kan gjenkjenne den skadelige intensjonen uttrykt av emojier, men hvordan det unngår sikkerhetsmekanismene er uklart.’

Svakheten kan stamme fra den tekst-sentriske designen av innholdssensur, som antar enten bokstavelig tekst-innputt eller innkapslinger som trofast konvertert til tekst-ekvivalenter: i begge tilfeller avhenger systemet av eksplisitte token som kan matche mot sikkerhetsregler.

Til å illustrere med et eksempel fra AI-basert bilde-redigering: når en bruker laster opp et NSFW-bilde til en visjon-språkmodell og ber om modifikasjoner, bruker systemer som Adobe Firefly eller ChatGPT CLIP-stil pipelines til å trekke ut tekstlige konsepter fra bildet, som en forutsetning for redigering. Når disse konseptene er gjort om til ord, vil tilstedeværelsen av noen begrensede termer i disse uttrukne ordene utløse filteret, og føre til at forespørselen blir avvist.

Likevel, for noen grunn, synes emojiens status som hverken et ord eller et bilde (eller både og) å gi den en makt til å transcendere filtrering; tydeligvis, som forfatterne indikerer, er videre forskning i denne merkelige løkken nødvendig.

Den nye artikkelen heter Når Smiley blir fiendtlig: Tolking av hvordan emojier utløser LLM-ers giftighet, og kommer fra ni forfattere på Tsinghua University og National University of Singapore.

(Uheldigvis er mange av eksemplene artikkelen henviser til i et appendix som ennå ikke er tilgjengelig; selv om vi har bedt forfatterne om dette, har appendix ikke blitt levert på skrivestid. Likevel er de empiriske resultater i hovedartikkelen fortsatt verdige å merke seg.)

Tre kjerne-emoji-tolkninger

Forfatterne fremhever tre lingvistiske trekk som gjør emojier effektive til å unngå filtre. Først og fremst er emoji-betydninger kontekst-avhengige. For eksempel er ‘Penger med vinger’-emojien (se bildet nedenfor) offisielt definert som representasjon av pengeroverføringer eller utgifter; men avhengig av omgivende tekst, kan den også implisere enten legitim eller ulovlig aktivitet:

I en delvis illustrasjon fra den nye artikkelen, ser vi at en populær emoji kan få sin mening kapret, endret eller undergravd i populær bruk Dette gir effektivt emojien en offisiell passasje til den semantiske rommet, og en skjult last av negativ eller giftig mening som kan utnyttes når den er forbi filterne.

I en delvis illustrasjon fra den nye artikkelen, ser vi at en populær emoji kan få sin mening kapret, endret eller undergravd i populær bruk Dette gir effektivt emojien en offisiell passasje til den semantiske rommet, og en skjult last av negativ eller giftig mening som kan utnyttes når den er forbi filterne.

For det andre kan emojier skifte tonen i en prompt. Deres tilstedeværelse legger ofte til spill eller ironi, og mykner den emosjonelle registret. I skadelige forespørsler kan dette gjøre forespørselen til å se ut som en spøk eller spill, og oppmuntre modellen til å svare i stedet for å avvise:

Den lettende effekten av emojier kan desinfisere tone uten å desinfisere intensjon.

Den lettende effekten av emojier kan desinfisere tone uten å desinfisere intensjon.

For det tredje hevder artikkelen at emojier er språk-uavhengige: en enkelt emoji kan bære samme mening på flere språk. Dette gjør dem ideelle for flerspråklige forespørsler, og bevarer mening selv når den omgivende teksten er oversatt:

Det knuste hjerte-emojien overbringer en universell melding, kanskje ikke minst fordi den representerer en basis-sak i den menneskelige tilstanden, relativt immun mot nasjonale eller kulturelle variasjoner.

Det knuste hjerte-emojien overbringer en universell melding, kanskje ikke minst fordi den representerer en basis-sak i den menneskelige tilstanden, relativt immun mot nasjonale eller kulturelle variasjoner.

Tilnærming, data og tester*

Forskerne skapte en modifisert versjon av AdvBench-datasetten, og omskrev skadelige forespørsler til å inkludere emojier enten som erstatninger for sensitive ord eller som dekorativ kamuflasje. AdvBench dekker 32 høy-risiko-emner, inkludert bombing, hacking og mord, blant andre:

Opprinnelige eksempler fra AdvBench, som viser hvordan en enkelt adversarial forespørsel kan unngå sikkerhetsmekanismene i flere store chatbots, og utløse skadelige instruksjoner til tross for justerings-trening. Kilde: https://arxiv.org/pdf/2307.15043

Opprinnelige eksempler fra AdvBench, som viser hvordan en enkelt adversarial forespørsel kan unngå sikkerhetsmekanismene i flere store chatbots, og utløse skadelige instruksjoner til tross for justerings-trening. Kilde: https://arxiv.org/pdf/2307.15043

Alle 520 opprinnelige AdvBench-eksempler ble endret på denne måten, med de 50 øverste giftige og ikke-duplikate forespørsler brukt over hele rekken av eksperimenter. Forespørsler ble også oversatt til flere språk og testet over syv store lukkede og åpne kilde-modeller, og i kombinasjon med de kjente effektive jailbreak-teknikkene Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); og DeepInception.

Lukkede kilde-modeller som ble brukt var Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; og Gemini-1.5-pro. Åpne kilde-modeller som ble brukt var Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); og Qwen2.5-72B-Instruct (Team 2024a), med alle eksperimenter gjentatt tre ganger for å regne med tilfeldige sjanser.

Studien testet først om omskriving av skadelige forespørsler fra AdvBench ved hjelp av emojier ville øke giftig utgang, inkludert i oversettelser til andre store språk. I tillegg ble den samme emoji-redigeringsmetoden brukt til forespørsler fra de ovennevnte kjente jailbreak-strategier (PAIR, TAP og DeepInception) for å se om emoji-erstatning kunne forbedre deres suksess.

I begge tilfeller ble strukturen til de opprinnelige forespørsler bevart, med bare sensitive termer byttet ut med emojier og dekorative elementer lagt til for å kamuflere intensjon.

For test-metrikker innførte forfatterne et poengsystem kalt GPT-Judge. I denne oppsettet ble GPT-4o ikke modellen som ble testet, men i stedet ble bedt om å fungere som en grader, og tildelt et numerisk Skadelig Score (HS) til svar generert av andre modeller.

Hvert utgangspunkt ble vurdert fra en (harmless) til fem (ekstremt skadelig), og prosentandelen av svar som mottok en fem ble rapportert som Skadelighetsforhold (HR).

For å forhindre at modellene gled inn i emoji-forklaringer i stedet for å svare eksplisitt, la forskerne til en instruksjon til hver forespørsel, som sa at modellen skulle gjøre svaret kort:

Resultater fra emoji-baserte forespørsler i 'Setting-1', med sammenligninger med ablasjonsvarianter hvor emojier ble erstattet med ord, eller fjernet helt. Modellnavn er forkortet for plass.

Resultater fra emoji-baserte forespørsler i ‘Setting-1’, med sammenligninger med ablasjonsvarianter hvor emojier ble erstattet med ord, eller fjernet helt.

I den første resultattabellen ovenfor, indikerer venstre side at skadelige forespørsler erstattet med emojier oppnådde merkbart høyere HS- og HR-poeng enn ablasjonsvarianter (dvs. varianter hvor emojien ble oversatt tilbake til tekst, og dermed ble utsatt for innholdssensur).

Forfatterne bemerker† at emoji-erstattingsmetoden overgår tidligere jailbreak-metoder, som er oppført i den tilleggsresultattabellen nedenfor:

Skadelighetsforhold-resultater for emoji-augmenterte jailbreak-forespørsler i 'Setting-2', med modellnavn vist i forkortet form.

Skadelighetsforhold-resultater for emoji-augmenterte jailbreak-forespørsler i ‘Setting-2’, med modellnavn vist i forkortet form.

Den første av de to tabellene ovenfor, bemerker forfatterne, indikerer også at effekten av emojier bærer over språk. Når de tekstlige komponentene av emoji-forespørsler ble oversatt til kinesisk, fransk, spansk og russisk, forblev de skadelige utgangene høye; fordi disse er alle høy-resurs-språk, antyder resultater at risikoen ikke er begrenset til engelsk, men gjelder bredt for store brukergrupper, med emojier som fungerer som en overførbar kanal for giftig generering.

Mot slutten av artikkelen foreslår forskerne at effekten av emojier ikke bare er tilfeldig, men rotet i måten modellene prosesserer dem på, og bemerker at modellene kan tydeligvis gjenkjenne den skadelige meningen av emojier – men avvisnings-responsene blir undertrykt når emojier er til stede.

Tokeniseringstudier indikerer videre at emojier vanligvis brytes ned i sjeldne eller uregelmessige fragmenter med liten overlap til deres tekstlige ekvivalenter, og skaper effektivt en alternativ kanal for skadelig semantikk.

Ved å se bort fra modell-mekanikken, undersøker artikkelen også forhånds-treningsdata, og finner at mange ofte brukte emojier opptrer i skadelige sammenhenger som pornografi, svindel eller gambling. Forfatterne argumenterer for at denne gjentatte eksponeringen kan normalisere assosiasjonen mellom emojier og skadelig innhold, og oppmuntre modellene til å samarbeide med skadelige forespørsler i stedet for å blokkere dem.

Sammen antyder disse funnene at både interne prosesserings-feil og forvrengt forhånds-treningsdata bidrar til den overraskende effektiviteten av emojier i å unngå sikkerhetsmekanismene.

Konklusjon

Det er ikke uvanlig å bruke alternative inndata-metoder for å forsøke å jailbreak LLM-er. For eksempel har heksadesimal-koding blitt brukt til å unngå ChatGPT-s filter. Problemet synes å ligge i den flate bruken av tekst-basert språk til å kvalifisere inngående forespørsler og utgående svar.

I tilfelle emojier kan en skjult kilde av regel-brytende mening tydeligvis bli introdusert i diskursen uten straff eller inngripen, fordi overføringsmetoden er uvanlig. En kunne tenke at CLIP-basert translitterasjon ville gripe inn i alle bilde-opplastinger, så at offensivt eller krenkende materiale ville ende opp som flaggbart tekst.

Tydeligvis er dette ikke tilfelle, i alle fall hvor de store LLM-ene som ble studert er bekymret; deres språklige barrierer synes å være sprø og tekst-sentriske. En kan forestille seg at mer omfattende tolkning av innhold (for eksempel ved å studere heatmap-aktiveringer) bærer en prosess- og/eller båndbredde-kostnad som kan gjøre slike tilnærminger upraktisk dyre, blant andre mulige begrensninger og overveielser.

 

* Layouten av denne artikkelen er kaotisk sammenlignet med de fleste, med metode og tester ikke tydelig avgrenset. Vi har derfor gjort vårt beste for å representere kjerneverdien av arbeidet så godt som mulig under disse omstendighetene.

† I en åpenbart nesten uigjennomtrengelig og forvirret behandling av resultater.

Først publisert onsdag, 17. september 2025

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai