Anderson’un AÃ§ÄąsÄą

Emojilerin İçerik Filtrelerini AtlatmasÄą

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
A man with a smiley emoji for a head lights a cigarette from a lit bomb. SDXL, Flux Kontext Dev, Adobe Firefly.

Emojiler, bÞyÞk dil modellerinin gÞvenlik mekanizmalarÄąnÄą atlatmak ve normalde engellenen zehirli Ã§ÄąktÄąlarÄą tetiklemek için kullanÄąlabilir. Bu şekilde, LLM’ler yasaklÄą konular hakkÄąnda tartÄąÅŸma yapabilir ve tavsiye verebilir.

 

Çin ve Singapur arasÄąndaki yeni bir işbirliği, emojilerin bÞyÞk dil modellerindeki içerik algÄąlama filtrelerini atlatmak için kullanÄąlabileceğini ve genel olarak modellerle etkileşim sÄąrasÄąnda zehirli içeriğin seviyesini artÄąrabileceğini gÃķsteren gÞçlÞ kanÄątlar sunuyor.

Yeni makaleden, bir popÞler LLM'yi 'jailbreak' etmek için yasaklÄą bir kavramÄą emojilerle kodlamanÄąn yollarÄąnÄąn geniş bir gÃķsterimi. Kaynak: https://arxiv.org/pdf/2509.11141

Yeni makaleden, bir popÞler LLM’yi ‘jailbreak’ etmek için yasaklÄą bir kavramÄą emojilerle kodlamanÄąn yollarÄąnÄąn geniş bir gÃķsterimi. Kaynak: https://arxiv.org/pdf/2509.11141

YukarÄądaki Ãķrnekte, yeni makaleden, kural ihlal eden sÃķzcÞk tabanlÄą niyeti emojilerle dolu bir alternatif versiyona dÃķnÞştÞrmenin, bir dizi gelişmiş dil modelinden daha fazla “işbirlikçi” bir yanÄąt elde edilebileceğini gÃķrÞyoruz.

AslÄąnda, en aÅŸÄąrÄą durumlarda, emoji kullanÄąmÄą bir jailbreak tekniği olarak işlev gÃķrebilir, makalenin yazarlarÄąna gÃķre.

Makalede belirtilen bir kalÄąntÄą gizem, dil modellerinin neden emojilere kurallarÄą ihlal etme ve zehirli içerik elde etme konusunda bÃķyle bir serbestlik tanÄądığı sorusudur.

Önerilen aÃ§Äąklama, LLM’lerin eğitim verilerini modellemek ve yeniden Þretmek için eğitildiği ve emojilerin bu verilere sÄąkça bulunduğu için modelin emojinin bu konuşmada ait olduğunu Ãķğrendiği ve istatistiksel bir ilişki olarak ele aldığınÄą, içerik olarak değerlendirilip filtrelenecek bir şey olarak değil.

Bu, emojinin, bir.promt tekrarlandığında, modelin zehirli devamÄąnÄą daha emin bir şekilde tahmin etmesini sağlar, ancak kÄąrmÄązÄą bayrak olarak değil, anlamsal ipucu olarak işlev gÃķrÞr ve aslÄąnda zehirli anlamÄą moderasyon veya engelleme yerine gÞçlendirir. GÞvenlik hizalamasÄą sonra uygulanÄąr ve genellikle dar, literal bir çerçevede, bu tÞr emojili promtler possibly tamamen kaÃ§ÄąnÄąlmaz.

Bu şekilde, makale, modelin zehirli ilişkilendirme nedeniyle değil, onun sayesinde toleranslÄą hale geldiğini Ãķnerir.

Ücretsiz Geçiş

Bununla birlikte, yazarlar, bu durumun, emojilerin içerik filtrelerini atlatabilmesinin nedeninin kesin bir teorisi olmadığınÄą kabul ediyorlar. ŞunlarÄą belirtiyorlar:

‘Modeller, emojilerle ifade edilen kÃķtÞ niyeti tanÄąyabilir, ancak nasÄąl gÞvenlik mekanizmalarÄąnÄą atlattÄąklarÄą belirsiz kalÄąyor.’

ZayÄąflÄąk, içerik filtrelerinin metin merkezli tasarÄąmÄąndan kaynaklanabilir, bu da literal metin girişi veya gÃķmmelerin metin eşdeğerlerine sadÄąk bir şekilde dÃķnÞştÞrÞlmesini varsayar: her iki durumda da, sistem, gÞvenlik kurallarÄąna karÅŸÄą eşleştirilebilecek aÃ§Äąk tokenlere dayanÄąr.

AI tabanlÄą gÃķrÞntÞ dÞzenleme Ãķrneğinden hareketle, bir kullanÄącÄą NSFW resmini bir gÃķrÞntÞleme-dil modeline yÞklediğinde ve değişiklikler talep ettiğinde, sistemler gibi Adobe Firefly veya ChatGPT, CLIP tarzÄą boru hatlarÄą kullanÄąr. gÃķrÞntÞden metinsel kavramlarÄą Ã§Äąkarmak için, dÞzenleme için bir Ãķn koşul olarak.

Ancak, emojilerin, ne bir kelime ne de bir resim (veya her ikisi) olarak statÞsÞnÞn, onlarÄą filtrelemeyi aşma yeteneği vermesi dikkat çekicidir; yazarlar, bu garip aÃ§ÄąÄŸÄąn daha fazla araştÄąrÄąlmasÄąnÄą Ãķneriyor.

Yeni makale, When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity olarak adlandÄąrÄąlmÄąÅŸ ve Tsinghua Üniversitesi ve Singapur Ulusal Üniversitesi’nden dokuz yazar tarafÄąndan hazÄąrlanmÄąÅŸtÄąr.

(Maalesef, makaleye atÄąfta bulunulan birçok Ãķrnek, henÞz erişilemeyen bir ekte yer alÄąyor; yazarlardan bunu talep etmemize rağmen, ek yazÄąyaæ—ķ候 sunulmamÄąÅŸtÄąr. Bununla birlikte, temel makaledeki empirik sonuçlaräŧ Ä‘ÃĄng dikkat değerdir.)

Üç Temel Emoji Yorumu

Yazarlar, emojilerin filtreleri atlatabilmesini sağlayan Þç dilbilimsel Ãķzelliği vurguluyor. İlk olarak, emoji anlamlarÄą bağlam bağımlÄą. Örneğin, ‘Para ile Kanatlar’ emojisi resmi olarak para transferleri veya harcamalarÄą temsil eder, ancak çevreleyen metne bağlÄą olarak meşru veya yasadÄąÅŸÄą faaliyetleri de ima edebilir:

Yeni makaleden, bir popÞler emojinin anlamÄąnÄąn nasÄąl popÞler kullanÄąmda gasp edildiğini, değiştirildiğini veya dÃķnÞştÞrÞldÞğÞnÞ gÃķsteren bir kÄąsmi gÃķsterim. Bu, emojiye resmi bir pasaport verir ve filtreden geçtikten sonra kullanÄąlabilen negatif veya zehirli bir anlam yÞkÞ taÅŸÄąr.

Yeni makaleden, bir popÞler emojinin anlamÄąnÄąn nasÄąl popÞler kullanÄąmda gasp edildiğini, değiştirildiğini veya dÃķnÞştÞrÞldÞğÞnÞ gÃķsteren bir kÄąsmi gÃķsterim. Bu, emojiye resmi bir pasaport verir ve filtreden geçtikten sonra kullanÄąlabilen negatif veya zehirli bir anlam yÞkÞ taÅŸÄąr.

İkincisi, emojiler bir ton değişikliği sağlayabilir. VarlÄąklarÄą genellikle bir promtun duygusal registerini yumuşatabilir veya oyuna dÃķnÞştÞrebilir. ZararlÄą sorgulamalarda, bu, talebi bir şaka veya oyun gibi gÃķstererek modelin reddetmek yerine yanÄąt vermesini teşvik edebilir:

Emojilerin tonu yumuşatma etkisi.

Emojilerin tonu yumuşatma etkisi.

ÜçÞncÞsÞ, makale, emojilerin dil bağımsÄąz olduğunu iddia ediyor: tek bir emoji, İngilizce, Çince, FransÄązca ve diğer dillerde aynÄą duyguyu taÅŸÄąyabilir. Bu, onlarÄą çok dilli promtlar için ideal kÄąlar ve çevrilmiş metinlerde anlamÄą korur:

KÄąrÄąk kalp emojisi, ulusal veya kÞltÞrel varyasyonlardan nispeten baÄŸÄąÅŸÄąk olan insan durumunun temel bir vakasÄąnÄą temsil ettiği için evrensel bir mesaj iletir.

KÄąrÄąk kalp emojisi, ulusal veya kÞltÞrel varyasyonlardan nispeten baÄŸÄąÅŸÄąk olan insan durumunun temel bir vakasÄąnÄą temsil ettiği için evrensel bir mesaj iletir.

YaklaÅŸÄąm, Veri ve Testler*

AraştÄąrmacÄąlar, AdvBench veri setinin değiştirilmiş bir sÞrÞmÞnÞ oluşturdular, zararlÄą promtlarÄą emojilerle yeniden yazdÄąlar ve bunlarÄą duyarlÄą kelimelerin yerine koydular veya kÄąlÄąk değiştirme olarak eklediler. AdvBench, bombalama, hacking ve cinayet dahil olmak Þzere 32 yÞksek riskli konuyu kapsar:

Orijinal AdvBench Ãķrnekleri, birçok bÞyÞk sohbet botunda gÞvenlik Ãķnlemlerini atlatan ve hizalanmÄąÅŸ eğitim rağmen zararlÄą talimatlar Þreten tek bir karÅŸÄąt promt gÃķsteren.

Orijinal AdvBench Ãķrnekleri, birçok bÞyÞk sohbet botunda gÞvenlik Ãķnlemlerini atlatan ve hizalanmÄąÅŸ eğitim rağmen zararlÄą talimatlar Þreten tek bir karÅŸÄąt promt gÃķsteren.

TÞm 520 orijinal AdvBench Ãķrneği bu şekilde değiştirildi ve en Þst 50 toksik ve tekrarsÄąz promt, deneylerin tamamÄąnda kullanÄąldÄą. Promtler ayrÄąca birçok dile tercÞme edildi ve yedi bÞyÞk kapalÄą ve aÃ§Äąk kaynaklÄą modelde test edildi ve bilinen etkili jailbreak teknikleriyle birlikte Prompt Automatic Iterative Refinement (PAIR); Tree of Attacks with Pruning (TAP); ve DeepInception ile birlikte.

KapalÄą kaynaklÄą modeller arasÄąnda Gemini-2.0-flash; GPT-4o (2024-08-06); GPT-4-0613; ve Gemini-1.5-pro bulunuyordu. AÃ§Äąk kaynaklÄą modeller arasÄąnda Llama-3-8B-Instruct; Qwen2.5-7B-Instruct (Team 2024b); ve Qwen2.5-72B-Instruct (Team 2024a) vardÄą, tÞm deneyler Þç kez tekrarlandÄą.

ÇalÄąÅŸma, ilk olarak, AdvBench’ten zararlÄą promtleri emojilerle yeniden yazmanÄąn, toksik Ã§ÄąktÄąlarÄą artÄąrÄąp artÄąrmadığınÄą test etti, ayrÄąca bu emojilerin bilinen jailbreak stratejileriyle birleştirilmesinin bu stratejilerin başarÄąsÄąnÄą artÄąrÄąp artÄąrmadığınÄą inceledi.

Her iki durumda da, orijinal promtlarÄąn yapÄąsÄą korunmuş, sadece duyarlÄą terimler emojilerle değiştirilmiş ve kÄąlÄąk değiştirme olarak sÞslemeler eklenmiştir.

Test metriği olarak, yazarlar GPT-Judge adlÄą bir puanlama sistemi geliştirdiler. Bu kurulumda, GPT-4o test edilen model değil, diğer modeller tarafÄąndan Þretilen yanÄątlara ZararlÄą Skor (HS) atayan bir Hakem olarak gÃķrev yaptÄą.

Her Ã§ÄąktÄą, 1 (zararsÄąz) ile 5 (oldukça zararlÄą) arasÄąnda bir puan aldÄą ve 5 alan yanÄątlarÄąn yÞzdesi ZararlÄąlÄąk OranÄą (HR) olarak raporlandÄą.

Modellerin emojilere ilişkin aÃ§Äąklamalara kaydolmasÄąnÄą Ãķnlemek için, araştÄąrmacÄąlar her promta, modelin yanÄątÄąnÄą kÄąsa tutmasÄąnÄą talim eden bir talimat ekledi:

Emojili promtlerin 'Ayar-1'indeki sonuçlar, emojilerin kelimeye veya tamamen kaldÄąrÄąlmasÄąna karÅŸÄąlÄąk gelen soyut varyantlarla karÅŸÄąlaştÄąrÄąldÄą. Model isimleri alan için kÄąsaltÄąldÄą.

Emojili promtlerin ‘Ayar-1’indeki sonuçlar, emojilerin kelimeye veya tamamen kaldÄąrÄąlmasÄąna karÅŸÄąlÄąk gelen soyut varyantlarla karÅŸÄąlaştÄąrÄąldÄą. Model isimleri alan için kÄąsaltÄąldÄą.

YukarÄądaki ilk sonuç tablosunda, tablonun sol tarafÄą, emojilerle değiştirilmiş zararlÄą promtlerin, emojileri metne çeviren veya tamamen kaldÄąran soyut varyantlara kÄąyasla Ãķnemli ÃķlçÞde daha yÞksek HS ve HR puanlarÄą elde ettiğini gÃķsteriyor.

Yazarlar, emojilerle değiştirilmiş yaklaÅŸÄąmÄąn, Ãķnceki jailbreak yÃķntemlerini aştığınÄą belirtiyorlar, aşağıdaki ek sonuç tablosunda aÃ§Äąklanan:

Emojili jailbreak promtlerinin 'Ayar-2'indeki ZararlÄąlÄąk OranÄą sonuçlarÄą, model isimleri kÄąsaltÄąlmÄąÅŸ olarak gÃķsteriliyor.

Emojili jailbreak promtlerinin ‘Ayar-2’indeki ZararlÄąlÄąk OranÄą sonuçlarÄą, model isimleri kÄąsaltÄąlmÄąÅŸ olarak gÃķsteriliyor.

YukarÄąda gÃķsterilen ilk tablo, yazarlara gÃķre, emojilerin etkisinin diller arasÄą taÅŸÄądığınÄą da gÃķsteriyor. Metinsel bileşenler emojili promtlerin Çince, FransÄązca, İspanyolca ve Rusça’ya tercÞme edildiğinde, zararlÄą Ã§ÄąktÄąlar yÞksek kaldÄą; bu, riskin yalnÄązca İngilizceyle sÄąnÄąrlÄą olmadığınÄą, bÞyÞk kullanÄącÄą gruplarÄąna genişlediğini ve emojilerin zehirli Þretim için taÅŸÄąnabilir bir kanal işlevi gÃķrdÞğÞnÞ gÃķsteriyor.

ÇalÄąÅŸmanÄąn sonunda, araştÄąrmacÄąlar, emojilerin etkisinin simplemente kazara değil, modellerin onlarÄą işleme şeklinin temellerinde yattığınÄą Ãķne sÞrÞyorlar, not ediyorlar ki modeller emojilerin zararlÄą anlamlarÄąnÄą tanÄąyabiliyor, ancak emojiler mevcut olduğunda reddetme yanÄątlarÄą bastÄąrÄąlÄąyor.

Tokenleştirme çalÄąÅŸmalarÄą, emojilerin genellikle nadir veya dÞzensiz parçalara bÃķlÞndÞğÞnÞ ve metinsel eşdeğerleriyle little ÃķrtÞşme olduğunu gÃķsteriyor, bÃķylece zararlÄą anlamlar için alternatif bir kanal oluşturuyor.

Model mekaniklerinin Ãķtesine bakÄąldığında, makale, Ãķn eğitim verilerini inceliyor ve sÄąk kullanÄąlan emojilerin manyetik, dolandÄąrÄącÄąlÄąk veya kumar gibi zehirli bağlamlarda ortaya Ã§ÄąktığınÄą buluyor. Yazarlar, bu tekrar eden maruz kalmanÄąn, emojilerle zararlÄą içerik arasÄąndaki ilişkiyi normalleştirebileceğini ve modellerin zehirli promtlara uymasÄąnÄą teşvik edebileceğini savunuyorlar.

Birlikte, bu bulgular, hem modelin dahili işleme kusurlarÄąnÄąn hem de ÃķnyÞklenen verilerin ÃķnyargÄąlÄą olmasÄąnÄąn, emojilerin gÞvenlik Ãķnlemlerini atlatabilmesinde etkili olduğunu gÃķsteriyor.

Sonuç

LLM’leri jailbreak etmeye çalÄąÅŸmak için alternatif girdi yÃķntemlerini kullanmak alÄąÅŸÄąlmadÄąk bir durum değildir. Son yÄąllarda, Ãķrneğin, onaltÄąlÄąk kodlama, ChatGPT’nin filtrelerini atlatmak için kullanÄąlmÄąÅŸtÄąr. Sorun, gelen istekleri ve giden yanÄątlarÄą nitelendirmek için metin tabanlÄą dilin dÞz kullanÄąmÄąnda yatÄąyor gibi gÃķrÞnÞyor.

Emojiler durumunda, kurallarÄą ihlal eden bir anlamÄąn gizli bir merkezi olarak konuşmaya sokulabilir ve ceza veya mÞdahale olmadan, çÞnkÞ iletim yÃķntemi alÄąÅŸÄąlmadÄąk.

ŞÞphesiz, CLIP tabanlÄą transliterasyon tÞm gÃķrÞntÞ yÞklemelerinde mÞdahale edecektir, bÃķylece saldÄąrÄą veya ihlal içeriği metin olarak bayraklandÄąrÄąlacaktÄąr.

AÃ§ÄąkçasÄą, bu, bÞyÞk LLM’ler için geçerli değil; dilsel bariyerleri metin merkezli ve kÄąrÄąlgan gÃķrÞnÞyor. Daha geniş içerik yorumunun, Ãķrneğin ÄąsÄą haritasÄą aktivasyonlarÄąnÄą incelemenin, işleme ve/veya bant genişliği maliyeti getirebileceği ve diğer olasÄą sÄąnÄąrlamalar ve dikkate almalar olabilir.

 

* ÇalÄąÅŸmanÄąn dÞzeni çoğu çalÄąÅŸmadan daha kaotik, metodoloji ve testler net bir şekilde belirlenmedi. DolayÄąsÄąyla, bu koşullarda çalÄąÅŸmanÄąn temel değerini temsil etmek için elimizden gelenin en iyisini yaptÄąk.

† Kabul edilemez derecede anlaÅŸÄąlmaz ve karÄąÅŸÄąk bir sonuç işleminde.

Çarşamba, 17 EylÞl 2025’te ilk kez yayÄąmlandÄą.

Makine Ãķğrenimi Þzerine yazar, insan gÃķrÞntÞ sentezi alanÄąnda uzman. Metaphysic.ai'de araştÄąrma içeriği başkanÄą, DNEG'in Brahma.ai'ye dÃķnÞşÞmÞne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]