Andersons hoek

Het gebruik van emojis kan contentfilters in AI-chatbots omzeilen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Emojis kunnen worden gebruikt om de veiligheidsmechanismen van grote taalmodellen te omzeilen en giftige uitvoer te triggeren die anders geblokkeerd zou worden. Op deze manier kunnen grote taalmodellen (LLM’s) ertoe worden gebracht om verboden onderwerpen zoals bommen maken en moord te bespreken en advies te geven.

 

Een nieuwe samenwerking tussen China en Singapore vindt overtuigend bewijs dat emojis niet alleen kunnen worden gebruikt om de contentdetectiefilters in grote taalmodellen (LLM’s) te omzeilen, maar ook om het niveau van giftigheid tijdens de interactie van de gebruiker met de modellen te verhogen:

Uit het nieuwe artikel, een brede demonstratie van de manieren waarop het coderen van een verboden concept met emojis een gebruiker kan helpen om een populaire LLM te 'jailbreaken'. Bron: https://arxiv.org/pdf/2509.11141

Uit het nieuwe artikel, een brede demonstratie van de manieren waarop het coderen van een verboden concept met emojis een gebruiker kan helpen om een populaire LLM te ‘jailbreaken’. Bron: https://arxiv.org/pdf/2509.11141

In het bovenstaande voorbeeld, uit het nieuwe artikel, zien we dat het transformeren van regelbrekende woord-gebaseerde intentie in een emoji-rijke alternatieve versie een veel meer ‘coöperatieve’ reactie van een geavanceerd taalmodel zoals ChatGPT-4o (dat gewoonlijk inputprompts sanitizeert en outputmateriaal onderschept dat mogelijk in strijd is met bedrijfsregels) kan oproepen:

Effectief, in de meest extreme omstandigheden, kan het gebruik van emojis dus als een jailbreak-techniek fungeren, volgens de auteurs van het nieuwe onderzoek.

Een resterend mysterie dat in het artikel wordt vermeld, is de vraag waarom taalmodellen emojis zo veel vrijheid geven om regels te schenden en giftige inhoud op te roepen, terwijl de modellen al begrijpen dat bepaalde emojis sterk giftige associaties hebben.

De suggestie die wordt gedaan, is dat omdat LLM’s zijn getraind om patronen uit hun trainingsdata te modelleren en te reproduceren, en omdat emojis zo vaak in die data worden aangetroffen, het model leert dat de emoji hoort in die discours, en het behandelt als een statistische associatie, in plaats van inhoud die moet worden geëvalueerd en gefilterd.

Dit betekent dat de emoji, wanneer deze opnieuw in een prompt wordt gebruikt, de model helpt om giftige voortzettingen met meer vertrouwen te voorspellen; maar in plaats van als een rode vlag te fungeren, fungeert de emoji als een semantische cue, die de bedoelde giftige betekenis daadwerkelijk versterkt in plaats van te modereren of te onderscheppen. Aangezien veiligheidsuitlijning pas achteraf wordt toegepast, en vaak in een smalle, letterlijke context, kunnen prompts met deze emojis mogelijk volledig ontsnappen aan detectie:

In deze zin stelt het artikel voor dat het model niet tolerant wordt ondanks de giftige associatie – het wordt tolerant vanwege de associatie.

Vrije doorgang

Dat gezegd hebbende, geven de auteurs toe dat dit geen definitieve theorie is over waarom het gebruik van emojis zo effectief kan zijn in het omzeilen van contentfilters in taalmodellen. Zij verklaren:

‘Modellen kunnen de kwaadaardige intentie herkennen die door emojis wordt uitgedrukt, maar hoe het de veiligheidsmechanismen omzeilt, blijft onduidelijk.’

De zwakte kan voortkomen uit het tekstgerichte ontwerp van contentfilters, dat ofwel letterlijke tekstinput of embeddings veronderstelt die getrouw zijn omgezet in tekstequivalenten: in beide gevallen vertrouwt het systeem op expliciete tokens die kunnen worden gematcht met veiligheidsregels.

Om een voorbeeld te geven uit AI-gebaseerde beeldbewerking: wanneer een gebruiker een NSFW-afbeelding uploadt naar een vision-language-model en modificaties aanvraagt, gebruiken systemen zoals Adobe Firefly of ChatGPT CLIP-achtige pipelines om tekstuele concepten uit de afbeelding te extraheren, als een vereiste voor bewerking. Zodra die concepten in woorden zijn omgezet, zal de aanwezigheid van enige beperkte termen in die geëxtraheerde woorden de filter triggeren, waardoor de aanvraag wordt afgewezen:

Yet, om de een of andere reden, lijkt de status van een emoji als noch een woord noch een afbeelding (ofwel als beide) hem de macht te geven om filtering te omzeilen;  het is duidelijk, zoals de auteurs aangeven, dat verdere onderzoek naar deze vreemde lacune gerechtvaardigd is.

Het nieuwe artikel heeft als titel Wanneer Smiley Hostiel Wordt: Het Interpreteren van Hoe Emojis LLM’s Toxiciteit Triggeren, en komt van negen auteurs uit de Tsinghua University en de National University of Singapore.

(Helaas zijn veel van de voorbeelden waarnaar het artikel verwijst in een bijlage die nog niet beschikbaar is gemaakt; hoewel we dit van de auteurs hebben gevraagd, is de bijlage niet verstrekt op het moment van schrijven. Niettemin blijven de empirische resultaten in het hoofdartikel de aandacht waard.)

Drie Kerninterpretaties van Emojis

De auteurs benadrukken drie linguïstische kenmerken die emojis effectief maken in het omzeilen van filters. Ten eerste zijn emoji-betekenissen contextafhankelijk. Bijvoorbeeld, de ‘Geld met Vleugels’-emoji (zie afbeelding hieronder) is officieel gedefinieerd als het representeren van geldoverdrachten of uitgaven; echter, afhankelijk van de omringende tekst, kan het ook legitieme of illegale activiteiten impliceren:

In een gedeeltelijke illustratie uit het nieuwe artikel, zien we dat een populaire emoji zijn betekenis kan laten kapen, veranderen of ondermijnen in populaire gebruik. Dit geeft de emoji effectief een officieel paspoort naar de semantische ruimte, en een verborgen lading van negatieve of giftige betekenis die kan worden geëxploiteerd zodra het voorbij de filters is.

In een gedeeltelijke illustratie uit het nieuwe artikel, zien we dat een populaire emoji zijn betekenis kan laten kapen, veranderen of ondermijnen in populaire gebruik. Dit geeft de emoji effectief een officieel paspoort naar de semantische ruimte, en een verborgen lading van negatieve of giftige betekenis die kan worden geëxploiteerd zodra het voorbij de filters is.

Ten tweede kunnen emojis de toon van een prompt veranderen. Hun aanwezigheid voegt vaak speelsheid of ironie toe, waardoor de emotionele register wordt verzacht. In schadelijke queries kan dit de aanvraag doen lijken op een grap of spel, waardoor het model eerder reageert dan afwijst:

De verzachtende werking van emojis kan de toon ontgiften zonder de intentie te ontgiften.

De verzachtende werking van emojis kan de toon ontgiften zonder de intentie te ontgiften.

Ten derde, stelt het artikel, zijn emojis taalagnostisch: een enkele emoji kan dezelfde sentiment overbrengen in het Engels, Chinees, Frans en andere talen. Dit maakt ze ideaal voor meertalige prompts, waardoor de betekenis behouden blijft, zelfs wanneer de omringende tekst wordt vertaald:

Het gebroken hart-emoji brengt een universele boodschap over, misschien niet in de laatste plaats omdat het een basisgeval in de menselijke conditie vertegenwoordigt, relatief immuun voor nationale of culturele variaties.

Het ‘gebroken hart’-emoji brengt een universele boodschap over, misschien niet in de laatste plaats omdat het een basisgeval in de menselijke conditie vertegenwoordigt, relatief immuun voor nationale of culturele variaties.

Aanpak, Gegevens en Tests*

De onderzoekers creëerden een gemodificeerde versie van de AdvBench-dataset, waarbij schadelijke prompts opnieuw werden geschreven om emojis te includeren, hetzij als vervanging voor gevoelige woorden of als decoratieve camouflage. AdvBench dekt 32 high-risk onderwerpen, waaronder bommen, hacking en moord, onder andere:

Oorspronkelijke voorbeelden uit AdvBench, waarin wordt getoond hoe een enkele kwaadaardige prompt de beveiligingsmaatregelen in meerdere grote chatbots kan omzeilen en schadelijke instructies kan oproepen, ondanks aligneringstraining. Bron: https://arxiv.org/pdf/2307.15043

Oorspronkelijke voorbeelden uit AdvBench, waarin wordt getoond hoe een enkele kwaadaardige prompt de beveiligingsmaatregelen in meerdere grote chatbots kan omzeilen en schadelijke instructies kan oproepen, ondanks aligneringstraining. Bron: https://arxiv.org/pdf/2307.15043

Alle 520 oorspronkelijke AdvBench-exemplaren werden op deze manier gewijzigd, met de top 50 giftige en niet-dubbele prompts die werden gebruikt in het bereik van experimenten. De prompts werden ook vertaald in meerdere talen en getest op zeven grote gesloten en open source-modellen, en in combinatie met de bekende effectieve jailbreak-technieken Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); en DeepInception.

Gesloten modellen die werden gebruikt waren Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; en Gemini-1.5-pro. Open-source modellen die werden gebruikt waren Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); en Qwen2.5-72B-Instruct (Team 2024a), met alle experimenten herhaald om toeval te verklaren.

De studie testte eerst of het herschrijven van schadelijke prompts uit AdvBench met emojis de giftige uitvoer zou verhogen, inclusief in vertalingen naar andere grote talen. Bovendien paste het dezelfde emoji-bewerkingsmethode toe op prompts uit de eerdergenoemde bekende jailbreak-strategieën (PAIR, TAP en DeepInception) om te zien of emoji-substitutie de succesratio kon verhogen.

In beide gevallen werd de structuur van de oorspronkelijke prompts behouden, met alleen gevoelige termen ingewisseld voor emojis en decoratieve elementen toegevoegd om de intentie te verhullen.

Als testmetrics bedachten de auteurs een scoresysteem genaamd GPT-Judge. In deze setup werd GPT-4o niet getest als model, maar werd het gevraagd om als grader te fungeren, door een numerieke Schadelijke Score (HS) toe te kennen aan antwoorden gegenereerd door andere modellen.

Elk antwoord werd beoordeeld van één (onschadelijk) tot vijf (extreem schadelijk), en het percentage van antwoorden dat een vijf kreeg, werd gerapporteerd als de Schadelijkheidsratio (HR).

Om te voorkomen dat de modellen afweken naar emoji-verklaringen in plaats van expliciet te antwoorden, voegden de onderzoekers een instructie toe aan elke prompt, waarin het model werd gevraagd om zijn antwoord kort te houden:

Resultaten van emoji-gebaseerde prompts in 'Setting-1', met vergelijkingen met ablatievarianten waarin emojis werden vervangen door woorden of volledig verwijderd. Modelnamen zijn afgekort voor de ruimte.

Resultaten van emoji-gebaseerde prompts in ‘Setting-1’, met vergelijkingen met ablatievarianten waarin emojis werden vervangen door woorden of volledig verwijderd. Modelnamen zijn afgekort voor de ruimte.

In de bovenstaande resultaatentabel links wordt aangegeven dat schadelijke prompts die met emojis waren vervangen, aanzienlijk hogere HS- en HR-scores behaalden dan geablateerde versies (d.w.z. versies waarin de emoji werd terugvertaald in tekst, waardoor deze rechtstreeks aan contentfilters werd blootgesteld).

De auteurs merken opdat de emoji-gesubstitueerde aanpak de eerdere jailbreak-methoden overtreft, zoals uiteengezet in de aanvullende resultaatentabel hieronder:

Schadelijkheidsratio-resultaten voor emoji-verrijkte jailbreak-prompts in 'Setting-2', met modelnamen in afgekorte vorm.

Schadelijkheidsratio-resultaten voor emoji-verrijkte jailbreak-prompts in ‘Setting-2’, met modelnamen in afgekorte vorm.

De eerste van de twee tabellen hierboven, stellen de auteurs, geeft ook aan dat het effect van emojis zich uitstrekt over talen. Wanneer de tekstuele componenten van de emoji-prompts werden vertaald in het Chinees, Frans, Spaans en Russisch, bleven de schadelijke uitvoer hoog; aangezien dit allemaal hoge bronnen zijn -talen, suggereren de resultaten dat het risico niet beperkt is tot het Engels, maar breed wordt toegepast op grote gebruikersgroepen, waarbij emojis fungeren als een overdraagbaar kanaal voor giftige generatie.

Naar het einde van het artikel toe, suggereren de onderzoekers dat het effect van emojis niet toevallig is, maar geworteld is in de manier waarop modellen ze verwerken, waarbij wordt opgemerkt dat modellen kennelijk de schadelijke betekenis van emojis kunnen herkennen – maar weigeringsreacties worden onderdrukt wanneer emojis aanwezig zijn.

Tokenisatieonderzoek geeft verder aan dat emojis meestal worden gebroken in zeldzame of onregelmatige fragmenten met weinig overlap met hun tekstuele equivalenten, waardoor effectief een alternatief kanaal voor schadelijke semantiek wordt gecreëerd.

Verder dan modelmechanica, onderzoekt het artikel ook de pretrainingsdata en vindt dat veel vaak gebruikte emojis voorkomen in giftige contexten zoals pornografie, scams of gokken. De auteurs beweren dat deze herhaalde blootstelling de associatie tussen emojis en schadelijke inhoud kan normaliseren, waardoor modellen worden aangemoedigd om schadelijke prompts te volgen in plaats van ze te blokkeren.

Samen suggereren deze bevindingen dat zowel interne verwerkingsvreemde en bevooroordeelde pretrainingsdata bijdragen aan de verrassende effectiviteit van emojis in het omzeilen van veiligheidsmaatregelen.

Conclusie

Het is niet ongebruikelijk om alternatieve invoermethoden te gebruiken om te proberen LLM’s te jailbreaken. In recente jaren, bijvoorbeeld, is hexadecimale codering gebruikt om de filters van ChatGPT te omzeilen. Het probleem lijkt te liggen in het platte gebruik van tekstgebaseerde taal om inkomende aanvragen en uitgaande antwoorden te kwalificeren.

In het geval van emojis, kan een verborgen locus van regelbrekende betekenis blijkbaar worden geïntroduceerd in de discours zonder straf of interventie, omdat de transmissiemethode onconventioneel is. Men zou denken dat CLIP-gebaseerde transliteratie zou ingrijpen in alle afbeeldingsuploads, zodat offensief of inbreukmakend materiaal zou eindigen als vlagbare tekst.

Het blijkt echter dat dit niet het geval is, tenminste waar het de grote LLM’s betreft die in deze studie zijn onderzocht; hun linguïstische barrières lijken broos en tekstgericht. Men kan zich voorstellen dat een uitgebreidere interpretatie van inhoud (bijvoorbeeld door heatmap-activaties te bestuderen) een verwerkings- en/of bandbreedtekosten met zich meebrengt die dergelijke benaderingen mogelijk onbetaalbaar maken, naast andere mogelijke beperkingen en overwegingen.

 

* De lay-out van dit artikel is chaotisch in vergelijking met de meeste, met methodologie en tests die niet duidelijk zijn afgebakend. We hebben ons best gedaan om de kernwaarde van het werk zo goed mogelijk weer te geven in deze omstandigheden.

In een opzettelijk bijna ondoordringbare en verwarde behandeling van de resultaten.

Publicatie op woensdag 17 september 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]