Andersonâun AÃ§ÄąsÄą
Emojilerin İçerik Filtrelerini AtlatmasÄą

Emojiler, bÞyÞk dil modellerinin gÞvenlik mekanizmalarÄąnÄą atlatmak ve normalde engellenen zehirli Ã§ÄąktÄąlarÄą tetiklemek için kullanÄąlabilir. Bu Åekilde, LLMâler yasaklÄą konular hakkÄąnda tartÄąÅma yapabilir ve tavsiye verebilir.
Â
Ãin ve Singapur arasÄąndaki yeni bir iÅbirliÄi, emojilerin bÞyÞk dil modellerindeki içerik algÄąlama filtrelerini atlatmak için kullanÄąlabileceÄini ve genel olarak modellerle etkileÅim sÄąrasÄąnda zehirli içeriÄin seviyesini artÄąrabileceÄini gÃķsteren gÞçlÞ kanÄątlar sunuyor.

Yeni makaleden, bir popÞler LLMâyi âjailbreakâ etmek için yasaklÄą bir kavramÄą emojilerle kodlamanÄąn yollarÄąnÄąn geniÅ bir gÃķsterimi. Kaynak: https://arxiv.org/pdf/2509.11141
YukarÄądaki Ãķrnekte, yeni makaleden, kural ihlal eden sÃķzcÞk tabanlÄą niyeti emojilerle dolu bir alternatif versiyona dÃķnÞÅtÞrmenin, bir dizi geliÅmiÅ dil modelinden daha fazla âiÅbirlikçiâ bir yanÄąt elde edilebileceÄini gÃķrÞyoruz.
AslÄąnda, en aÅÄąrÄą durumlarda, emoji kullanÄąmÄą bir jailbreak tekniÄi olarak iÅlev gÃķrebilir, makalenin yazarlarÄąna gÃķre.
Makalede belirtilen bir kalÄąntÄą gizem, dil modellerinin neden emojilere kurallarÄą ihlal etme ve zehirli içerik elde etme konusunda bÃķyle bir serbestlik tanÄądÄąÄÄą sorusudur.
Ãnerilen aÃ§Äąklama, LLMâlerin eÄitim verilerini modellemek ve yeniden Þretmek için eÄitildiÄi ve emojilerin bu verilere sÄąkça bulunduÄu için modelin emojinin bu konuÅmada ait olduÄunu ÃķÄrendiÄi ve istatistiksel bir iliÅki olarak ele aldÄąÄÄąnÄą, içerik olarak deÄerlendirilip filtrelenecek bir Åey olarak deÄil.
Bu, emojinin, bir.promt tekrarlandÄąÄÄąnda, modelin zehirli devamÄąnÄą daha emin bir Åekilde tahmin etmesini saÄlar, ancak kÄąrmÄązÄą bayrak olarak deÄil, anlamsal ipucu olarak iÅlev gÃķrÞr ve aslÄąnda zehirli anlamÄą moderasyon veya engelleme yerine gÞçlendirir. GÞvenlik hizalamasÄą sonra uygulanÄąr ve genellikle dar, literal bir çerçevede, bu tÞr emojili promtler possibly tamamen kaÃ§ÄąnÄąlmaz.
Bu Åekilde, makale, modelin zehirli iliÅkilendirme nedeniyle deÄil, onun sayesinde toleranslÄą hale geldiÄini Ãķnerir.
Ãcretsiz GeçiÅ
Bununla birlikte, yazarlar, bu durumun, emojilerin içerik filtrelerini atlatabilmesinin nedeninin kesin bir teorisi olmadÄąÄÄąnÄą kabul ediyorlar. ÅunlarÄą belirtiyorlar:
âModeller, emojilerle ifade edilen kÃķtÞ niyeti tanÄąyabilir, ancak nasÄąl gÞvenlik mekanizmalarÄąnÄą atlattÄąklarÄą belirsiz kalÄąyor.â
ZayÄąflÄąk, içerik filtrelerinin metin merkezli tasarÄąmÄąndan kaynaklanabilir, bu da literal metin giriÅi veya gÃķmmelerin metin eÅdeÄerlerine sadÄąk bir Åekilde dÃķnÞÅtÞrÞlmesini varsayar: her iki durumda da, sistem, gÞvenlik kurallarÄąna karÅÄą eÅleÅtirilebilecek aÃ§Äąk tokenlere dayanÄąr.
AI tabanlÄą gÃķrÞntÞ dÞzenleme ÃķrneÄinden hareketle, bir kullanÄącÄą NSFW resmini bir gÃķrÞntÞleme-dil modeline yÞklediÄinde ve deÄiÅiklikler talep ettiÄinde, sistemler gibi Adobe Firefly veya ChatGPT, CLIP tarzÄą boru hatlarÄą kullanÄąr. gÃķrÞntÞden metinsel kavramlarÄą Ã§Äąkarmak için, dÞzenleme için bir Ãķn koÅul olarak.
Ancak, emojilerin, ne bir kelime ne de bir resim (veya her ikisi) olarak statÞsÞnÞn, onlarÄą filtrelemeyi aÅma yeteneÄi vermesi dikkat çekicidir; yazarlar, bu garip aÃ§ÄąÄÄąn daha fazla araÅtÄąrÄąlmasÄąnÄą Ãķneriyor.
Yeni makale, When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMsâ Toxicity olarak adlandÄąrÄąlmÄąÅ ve Tsinghua Ãniversitesi ve Singapur Ulusal Ãniversitesiânden dokuz yazar tarafÄąndan hazÄąrlanmÄąÅtÄąr.
(Maalesef, makaleye atÄąfta bulunulan birçok Ãķrnek, henÞz eriÅilemeyen bir ekte yer alÄąyor; yazarlardan bunu talep etmemize raÄmen, ek yazÄąyaæķå sunulmamÄąÅtÄąr. Bununla birlikte, temel makaledeki empirik sonuçlaräŧ ÄÃĄng dikkat deÄerdir.)
Ãç Temel Emoji Yorumu
Yazarlar, emojilerin filtreleri atlatabilmesini saÄlayan Þç dilbilimsel ÃķzelliÄi vurguluyor. İlk olarak, emoji anlamlarÄą baÄlam baÄÄąmlÄą. ÃrneÄin, âPara ile Kanatlarâ emojisi resmi olarak para transferleri veya harcamalarÄą temsil eder, ancak çevreleyen metne baÄlÄą olarak meÅru veya yasadÄąÅÄą faaliyetleri de ima edebilir:

Yeni makaleden, bir popÞler emojinin anlamÄąnÄąn nasÄąl popÞler kullanÄąmda gasp edildiÄini, deÄiÅtirildiÄini veya dÃķnÞÅtÞrÞldÞÄÞnÞ gÃķsteren bir kÄąsmi gÃķsterim. Bu, emojiye resmi bir pasaport verir ve filtreden geçtikten sonra kullanÄąlabilen negatif veya zehirli bir anlam yÞkÞ taÅÄąr.
İkincisi, emojiler bir ton deÄiÅikliÄi saÄlayabilir. VarlÄąklarÄą genellikle bir promtun duygusal registerini yumuÅatabilir veya oyuna dÃķnÞÅtÞrebilir. ZararlÄą sorgulamalarda, bu, talebi bir Åaka veya oyun gibi gÃķstererek modelin reddetmek yerine yanÄąt vermesini teÅvik edebilir:

Emojilerin tonu yumuÅatma etkisi.
ÃçÞncÞsÞ, makale, emojilerin dil baÄÄąmsÄąz olduÄunu iddia ediyor: tek bir emoji, İngilizce, Ãince, FransÄązca ve diÄer dillerde aynÄą duyguyu taÅÄąyabilir. Bu, onlarÄą çok dilli promtlar için ideal kÄąlar ve çevrilmiÅ metinlerde anlamÄą korur:

KÄąrÄąk kalp emojisi, ulusal veya kÞltÞrel varyasyonlardan nispeten baÄÄąÅÄąk olan insan durumunun temel bir vakasÄąnÄą temsil ettiÄi için evrensel bir mesaj iletir.
YaklaÅÄąm, Veri ve Testler*
AraÅtÄąrmacÄąlar, AdvBench veri setinin deÄiÅtirilmiÅ bir sÞrÞmÞnÞ oluÅturdular, zararlÄą promtlarÄą emojilerle yeniden yazdÄąlar ve bunlarÄą duyarlÄą kelimelerin yerine koydular veya kÄąlÄąk deÄiÅtirme olarak eklediler. AdvBench, bombalama, hacking ve cinayet dahil olmak Þzere 32 yÞksek riskli konuyu kapsar:

Orijinal AdvBench Ãķrnekleri, birçok bÞyÞk sohbet botunda gÞvenlik Ãķnlemlerini atlatan ve hizalanmÄąÅ eÄitim raÄmen zararlÄą talimatlar Þreten tek bir karÅÄąt promt gÃķsteren.
TÞm 520 orijinal AdvBench ÃķrneÄi bu Åekilde deÄiÅtirildi ve en Þst 50 toksik ve tekrarsÄąz promt, deneylerin tamamÄąnda kullanÄąldÄą. Promtler ayrÄąca birçok dile tercÞme edildi ve yedi bÞyÞk kapalÄą ve aÃ§Äąk kaynaklÄą modelde test edildi ve bilinen etkili jailbreak teknikleriyle birlikte Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); ve DeepInception ile birlikte.
KapalÄą kaynaklÄą modeller arasÄąnda Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; ve Gemini-1.5-pro bulunuyordu. AÃ§Äąk kaynaklÄą modeller arasÄąnda Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); ve Qwen2.5-72B-Instruct (Team 2024a) vardÄą, tÞm deneyler Þç kez tekrarlandÄą.
ÃalÄąÅma, ilk olarak, AdvBenchâten zararlÄą promtleri emojilerle yeniden yazmanÄąn, toksik Ã§ÄąktÄąlarÄą artÄąrÄąp artÄąrmadÄąÄÄąnÄą test etti, ayrÄąca bu emojilerin bilinen jailbreak stratejileriyle birleÅtirilmesinin bu stratejilerin baÅarÄąsÄąnÄą artÄąrÄąp artÄąrmadÄąÄÄąnÄą inceledi.
Her iki durumda da, orijinal promtlarÄąn yapÄąsÄą korunmuÅ, sadece duyarlÄą terimler emojilerle deÄiÅtirilmiÅ ve kÄąlÄąk deÄiÅtirme olarak sÞslemeler eklenmiÅtir.
Test metriÄi olarak, yazarlar GPT-Judge adlÄą bir puanlama sistemi geliÅtirdiler. Bu kurulumda, GPT-4o test edilen model deÄil, diÄer modeller tarafÄąndan Þretilen yanÄątlara ZararlÄą Skor (HS) atayan bir Hakem olarak gÃķrev yaptÄą.
Her Ã§ÄąktÄą, 1 (zararsÄąz) ile 5 (oldukça zararlÄą) arasÄąnda bir puan aldÄą ve 5 alan yanÄątlarÄąn yÞzdesi ZararlÄąlÄąk OranÄą (HR) olarak raporlandÄą.
Modellerin emojilere iliÅkin aÃ§Äąklamalara kaydolmasÄąnÄą Ãķnlemek için, araÅtÄąrmacÄąlar her promta, modelin yanÄątÄąnÄą kÄąsa tutmasÄąnÄą talim eden bir talimat ekledi:

Emojili promtlerin âAyar-1âindeki sonuçlar, emojilerin kelimeye veya tamamen kaldÄąrÄąlmasÄąna karÅÄąlÄąk gelen soyut varyantlarla karÅÄąlaÅtÄąrÄąldÄą. Model isimleri alan için kÄąsaltÄąldÄą.
YukarÄądaki ilk sonuç tablosunda, tablonun sol tarafÄą, emojilerle deÄiÅtirilmiÅ zararlÄą promtlerin, emojileri metne çeviren veya tamamen kaldÄąran soyut varyantlara kÄąyasla Ãķnemli ÃķlçÞde daha yÞksek HS ve HR puanlarÄą elde ettiÄini gÃķsteriyor.
Yazarlar, emojilerle deÄiÅtirilmiÅ yaklaÅÄąmÄąn, Ãķnceki jailbreak yÃķntemlerini aÅtÄąÄÄąnÄą belirtiyorlar, aÅaÄÄądaki ek sonuç tablosunda aÃ§Äąklanan:

Emojili jailbreak promtlerinin âAyar-2âindeki ZararlÄąlÄąk OranÄą sonuçlarÄą, model isimleri kÄąsaltÄąlmÄąÅ olarak gÃķsteriliyor.
YukarÄąda gÃķsterilen ilk tablo, yazarlara gÃķre, emojilerin etkisinin diller arasÄą taÅÄądÄąÄÄąnÄą da gÃķsteriyor. Metinsel bileÅenler emojili promtlerin Ãince, FransÄązca, İspanyolca ve Rusçaâya tercÞme edildiÄinde, zararlÄą Ã§ÄąktÄąlar yÞksek kaldÄą; bu, riskin yalnÄązca İngilizceyle sÄąnÄąrlÄą olmadÄąÄÄąnÄą, bÞyÞk kullanÄącÄą gruplarÄąna geniÅlediÄini ve emojilerin zehirli Þretim için taÅÄąnabilir bir kanal iÅlevi gÃķrdÞÄÞnÞ gÃķsteriyor.
ÃalÄąÅmanÄąn sonunda, araÅtÄąrmacÄąlar, emojilerin etkisinin simplemente kazara deÄil, modellerin onlarÄą iÅleme Åeklinin temellerinde yattÄąÄÄąnÄą Ãķne sÞrÞyorlar, not ediyorlar ki modeller emojilerin zararlÄą anlamlarÄąnÄą tanÄąyabiliyor, ancak emojiler mevcut olduÄunda reddetme yanÄątlarÄą bastÄąrÄąlÄąyor.
TokenleÅtirme çalÄąÅmalarÄą, emojilerin genellikle nadir veya dÞzensiz parçalara bÃķlÞndÞÄÞnÞ ve metinsel eÅdeÄerleriyle little ÃķrtÞÅme olduÄunu gÃķsteriyor, bÃķylece zararlÄą anlamlar için alternatif bir kanal oluÅturuyor.
Model mekaniklerinin Ãķtesine bakÄąldÄąÄÄąnda, makale, Ãķn eÄitim verilerini inceliyor ve sÄąk kullanÄąlan emojilerin manyetik, dolandÄąrÄącÄąlÄąk veya kumar gibi zehirli baÄlamlarda ortaya Ã§ÄąktÄąÄÄąnÄą buluyor. Yazarlar, bu tekrar eden maruz kalmanÄąn, emojilerle zararlÄą içerik arasÄąndaki iliÅkiyi normalleÅtirebileceÄini ve modellerin zehirli promtlara uymasÄąnÄą teÅvik edebileceÄini savunuyorlar.
Birlikte, bu bulgular, hem modelin dahili iÅleme kusurlarÄąnÄąn hem de ÃķnyÞklenen verilerin ÃķnyargÄąlÄą olmasÄąnÄąn, emojilerin gÞvenlik Ãķnlemlerini atlatabilmesinde etkili olduÄunu gÃķsteriyor.
Sonuç
LLMâleri jailbreak etmeye çalÄąÅmak için alternatif girdi yÃķntemlerini kullanmak alÄąÅÄąlmadÄąk bir durum deÄildir. Son yÄąllarda, ÃķrneÄin, onaltÄąlÄąk kodlama, ChatGPTânin filtrelerini atlatmak için kullanÄąlmÄąÅtÄąr. Sorun, gelen istekleri ve giden yanÄątlarÄą nitelendirmek için metin tabanlÄą dilin dÞz kullanÄąmÄąnda yatÄąyor gibi gÃķrÞnÞyor.
Emojiler durumunda, kurallarÄą ihlal eden bir anlamÄąn gizli bir merkezi olarak konuÅmaya sokulabilir ve ceza veya mÞdahale olmadan, çÞnkÞ iletim yÃķntemi alÄąÅÄąlmadÄąk.
ÅÞphesiz, CLIP tabanlÄą transliterasyon tÞm gÃķrÞntÞ yÞklemelerinde mÞdahale edecektir, bÃķylece saldÄąrÄą veya ihlal içeriÄi metin olarak bayraklandÄąrÄąlacaktÄąr.
AÃ§ÄąkçasÄą, bu, bÞyÞk LLMâler için geçerli deÄil; dilsel bariyerleri metin merkezli ve kÄąrÄąlgan gÃķrÞnÞyor. Daha geniÅ içerik yorumunun, ÃķrneÄin ÄąsÄą haritasÄą aktivasyonlarÄąnÄą incelemenin, iÅleme ve/veya bant geniÅliÄi maliyeti getirebileceÄi ve diÄer olasÄą sÄąnÄąrlamalar ve dikkate almalar olabilir.
Â
* ÃalÄąÅmanÄąn dÞzeni çoÄu çalÄąÅmadan daha kaotik, metodoloji ve testler net bir Åekilde belirlenmedi. DolayÄąsÄąyla, bu koÅullarda çalÄąÅmanÄąn temel deÄerini temsil etmek için elimizden gelenin en iyisini yaptÄąk.
â Kabul edilemez derecede anlaÅÄąlmaz ve karÄąÅÄąk bir sonuç iÅleminde.
ÃarÅamba, 17 EylÞl 2025âte ilk kez yayÄąmlandÄą.












