Anderson’un Açısı
Kolay Yeniden Düzenleme, Gemini ve Claude İçin Bile AI Güvenlik Açıklarını Oluşturur

AI güvenlik testlerinin ‘açık’ tetikleyici kelimelere dayanmakta olduğu tespit edildi; kolay yeniden düzenlemeyle, ‘makul derecede güvenli’ olarak etiketlenen modeller aniden başarısız oluyor ve saldırılar %98 oranında başarılı oluyor.
ABD’den yeni bir kurumsal araştırma, çeşitli Büyük Dil Modellerinin (LLM) iyi güvenlik rekorunun anlamsız olabileceği sonucuna vardı – çünkü güvenliklerini belirlemek için kullanılan veri setleri ve referanslar ‘açık’ dille dolu.
Sorgulanan iki veri seti, bu sitede çeşitli makale incelemelerinde yer alan HarmBench ve AdvBench‘tir:
![HarmBench ve AdvBench makalelerinden, provokatif örnekler - ancak yeni makale, bu örneklerin aslında gerçek dünya örneklerinde de kötü niyeti kolayca ortaya koyduğunu ve sonuç olarak (muhtemelen) kazara sonuçların 'manipülasyonuna' yol açabileceğini iddia ediyor. Kaynaklar - HarmBench [https://arxiv.org/pdf/2402.04249] ve AdvBench [https://arxiv.org/pdf/2307.15043]](https://www.unite.ai/wp-content/uploads/2026/02/harmbench-and-advbench-examples.jpg)
HarmBench ve AdvBench makalelerinden, provokatif örnekler – ancak yeni makale, bu örneklerin aslında gerçek dünya senaryolarında da kötü niyeti ‘iletişime’ geçirerek, sonuç olarak (muhtemelen) kazara sonuçların ‘manipülasyonuna’ yol açabileceğini iddia ediyor. Kaynaklar: HarmBench ve AdvBench.
Gösterilen örnekler, her bir benchmark için ilgili makalelerden alınmıştır ve prensipleri açıklamak için kasıtlı olarak basittir. Ancak yeni araştırma, bu koleksiyonların aslında ‘kolay hedeflere’ odaklandığını ve bu nedenle etkili referanslar olmayabileceğini ve test edilen LLM’lerin güvenlik yetenekleri için gerçek sonuçların bildirilenden önemli ölçüde daha düşük olabileceğini iddia ediyor.
Araştırmacılar, iki veri setinin Niteliğini ve mimarisini incelemek için, her iki korpusdan da kelime bulutları oluşturdular ve hangi kelimelerin ve kısa cümlelerin koleksiyonları domine ettiğini ortaya çıkardılar:

Birleşik AdvBench ve HarmBench veri setlerindeki en sık görülen 40 unigram, bigram ve trigram gösteren kelime bulutları. Doğrudan olumsuz veya duyarlı anlamlara sahip terimler kırmızı, bağlamsal tetikleyiciler turuncu ve daha yüksek düzeyde tetikleyiciler oluşturan nötr kelimeler yeşille vurgulanmıştır. ‘Without getting caught’ ve ‘step-by-step instructions’ gibi açık ifadelerin yoğunluğu, iki benchmark’ın açık ipuçlarına güvendiğini öne sürer.
Yazarlar, bir, iki ve üç kelimelik en sık görülen gramların, kötü niyeti açıklamak için inanılmaz derecede açık olduğunu ve bu tür dilin gerçek dünya saldırılarında kullanıldığından farklı olduğunu belirtiyorlar.
Bu ‘tetikleyici ipuçları’, güvenlik filtrelerini tetiklemeye ‘tasarlanmış’ gibi görünen, olumsuz veya duyarlı anlamlara sahip ifadelerdir. Bazıları doğuştan yüklenmişken, diğerleri yalnızca bağlam içinde yüklenir, örneğin ‘without getting caught’ ifadesi gibi, kötü niyeti açıkça gösterir.
Veri setlerindeki dengesizlik, kelime sayısının artmasıyla daha da belirgin hale gelir, açık olarak olumsuz veya duyarlı anlamlara sahip ifadelerin en sık görülen gramları domine ettiği görülür. Makale, bunları ‘tetikleyici ifadeler’ olarak tanımlar ve bu ifadelerle birlikte ‘tetikleyici kelimeler’, ‘tetikleyici ipuçları’ oluşturur.
Bazı ifadeler, zaten yüklenmiş terimleri uzatarak oluşturulur, örneğin ‘steal’ ifadesi ‘steal sensitive information’, ‘steal confidential information’ veya ‘steal personal information’ haline gelir; ve ‘commit’ ifadesi ‘commit suicide’, ‘commit insider trading’ veya ‘commit identity theft’ haline gelir – bunlar, polisin, mahkemelerin ve medyanın raporlama dilidir.
Diğerleri, yalnızca bağlam içinde endişe verici hale gelen nötr kelimelerden oluşur, örneğin ‘without getting caught’ ifadesi, içermediği halde kaçınmayı ima eder.
Yöntem
Araştırmacılar, iki benchmark datasının Niteliğini ve mimarisini incelemek için, her iki korpusdan da kelime bulutları oluşturdular ve hangi kelimelerin ve kısa cümlelerin koleksiyonları domine ettiğini ortaya çıkardılar:

Birleşik AdvBench ve HarmBench veri setlerindeki en sık görülen 40 unigram, bigram ve trigram gösteren kelime bulutları. Doğrudan olumsuz veya duyarlı anlamlara sahip terimler kırmızı, bağlamsal tetikleyiciler turuncu ve daha yüksek düzeyde tetikleyiciler oluşturan nötr kelimeler yeşille vurgulanmıştır. ‘Without getting caught’ ve ‘step-by-step instructions’ gibi açık ifadelerin yoğunluğu, iki benchmark’ın açık ipuçlarına güvendiğini öne sürer.
Yazarlar, bir, iki ve üç kelimelik en sık görülen gramların, kötü niyeti açıklamak için inanılmaz derecede açık olduğunu ve bu tür dilin gerçek dünya saldırılarında kullanıldığından farklı olduğunu belirtiyorlar.
Bu ‘tetikleyici ipuçları’, güvenlik filtrelerini tetiklemeye ‘tasarlanmış’ gibi görünen, olumsuz veya duyarlı anlamlara sahip ifadelerdir. Bazıları doğuştan yüklenmişken, diğerleri yalnızca bağlam içinde yüklenir, örneğin ‘without getting caught’ ifadesi gibi, kötü niyeti açıkça gösterir.
Veri setlerindeki dengesizlik, kelime sayısının artmasıyla daha da belirgin hale gelir, açık olarak olumsuz veya duyarlı anlamlara sahip ifadelerin en sık görülen gramları domine ettiği görülür. Makale, bunları ‘tetikleyici ifadeler’ olarak tanımlar ve bu ifadelerle birlikte ‘tetikleyici kelimeler’, ‘tetikleyici ipuçları’ oluşturur.
Bazı ifadeler, zaten yüklenmiş terimleri uzatarak oluşturulur, örneğin ‘steal’ ifadesi ‘steal sensitive information’, ‘steal confidential information’ veya ‘steal personal information’ haline gelir; ve ‘commit’ ifadesi ‘commit suicide’, ‘commit insider trading’ veya ‘commit identity theft’ haline gelir – bunlar, polisin, mahkemelerin ve medyanın raporlama dilidir.
Diğerleri, yalnızca bağlam içinde endişe verici hale gelen nötr kelimelerden oluşur, örneğin ‘without getting caught’ ifadesi, içermediği halde kaçınmayı ima eder.
Çiftleme
Yazarlar, iki benchmark datasının Niteliğini ve mimarisini incelemek için, her iki korpusdan da kelime bulutları oluşturdular ve hangi kelimelerin ve kısa cümlelerin koleksiyonları domine ettiğini ortaya çıkardılar:

Birleşik AdvBench ve HarmBench veri setlerindeki en sık görülen 40 unigram, bigram ve trigram gösteren kelime bulutları. Doğrudan olumsuz veya duyarlı anlamlara sahip terimler kırmızı, bağlamsal tetikleyiciler turuncu ve daha yüksek düzeyde tetikleyiciler oluşturan nötr kelimeler yeşille vurgulanmıştır. ‘Without getting caught’ ve ‘step-by-step instructions’ gibi açık ifadelerin yoğunluğu, iki benchmark’ın açık ipuçlarına güvendiğini öne sürer.
Yazarlar, bir, iki ve üç kelimelik en sık görülen gramların, kötü niyeti açıklamak için inanılmaz derecede açık olduğunu ve bu tür dilin gerçek dünya saldırılarında kullanıldığından farklı olduğunu belirtiyorlar.
Bu ‘tetikleyici ipuçları’, güvenlik filtrelerini tetiklemeye ‘tasarlanmış’ gibi görünen, olumsuz veya duyarlı anlamlara sahip ifadelerdir. Bazıları doğuştan yüklenmişken, diğerleri yalnızca bağlam içinde yüklenir, örneğin ‘without getting caught’ ifadesi gibi, kötü niyeti açıkça gösterir.
Veri setlerindeki dengesizlik, kelime sayısının artmasıyla daha da belirgin hale gelir, açık olarak olumsuz veya duyarlı anlamlara sahip ifadelerin en sık görülen gramları domine ettiği görülür. Makale, bunları ‘tetikleyici ifadeler’ olarak tanımlar ve bu ifadelerle birlikte ‘tetikleyici kelimeler’, ‘tetikleyici ipuçları’ oluşturur.
Bazı ifadeler, zaten yüklenmiş terimleri uzatarak oluşturulur, örneğin ‘steal’ ifadesi ‘steal sensitive information’, ‘steal confidential information’ veya ‘steal personal information’ haline gelir; ve ‘commit’ ifadesi ‘commit suicide’, ‘commit insider trading’ veya ‘commit identity theft’ haline gelir – bunlar, polisin, mahkemelerin ve medyanın raporlama dilidir.
Diğerleri, yalnızca bağlam içinde endişe verici hale gelen nötr kelimelerden oluşur, örneğin ‘without getting caught’ ifadesi, içermediği halde kaçınmayı ima eder.
Daha Fazla Yaklaşımlar ve Testler
Yazarlar, iki benchmark datasının Niteliğini ve mimarisini incelemek için, her iki korpusdan da kelime bulutları oluşturdular ve hangi kelimelerin ve kısa cümlelerin koleksiyonları domine ettiğini ortaya çıkardılar:

Birleşik AdvBench ve HarmBench veri setlerindeki en sık görülen 40 unigram, bigram ve trigram gösteren kelime bulutları. Doğrudan olumsuz veya duyarlı anlamlara sahip terimler kırmızı, bağlamsal tetikleyiciler turuncu ve daha yüksek düzeyde tetikleyiciler oluşturan nötr kelimeler yeşille vurgulanmıştır. ‘Without getting caught’ ve ‘step-by-step instructions’ gibi açık ifadelerin yoğunluğu, iki benchmark’ın açık ipuçlarına güvendiğini öne sürer.
Yazarlar, bir, iki ve üç kelimelik en sık görülen gramların, kötü niyeti açıklamak için inanılmaz derecede açık olduğunu ve bu tür dilin gerçek dünya saldırılarında kullanıldığından farklı olduğunu belirtiyorlar.
Bu ‘tetikleyici ipuçları’, güvenlik filtrelerini tetiklemeye ‘tasarlanmış’ gibi görünen, olumsuz veya duyarlı anlamlara sahip ifadelerdir. Bazıları doğuştan yüklenmişken, diğerleri yalnızca bağlam içinde yüklenir, örneğin ‘without getting caught’ ifadesi gibi, kötü niyeti açıkça gösterir.
Veri setlerindeki dengesizlik, kelime sayısının artmasıyla daha da belirgin hale gelir, açık olarak olumsuz veya duyarlı anlamlara sahip ifadelerin en sık görülen gramları domine ettiği görülür. Makale, bunları ‘tetikleyici ifadeler’ olarak tanımlar ve bu ifadelerle birlikte ‘tetikleyici kelimeler’, ‘tetikleyici ipuçları’ oluşturur.
Bazı ifadeler, zaten yüklenmiş terimleri uzatarak oluşturulur, örneğin ‘steal’ ifadesi ‘steal sensitive information’, ‘steal confidential information’ veya ‘steal personal information’ haline gelir; ve ‘commit’ ifadesi ‘commit suicide’, ‘commit insider trading’ veya ‘commit identity theft’ haline gelir – bunlar, polisin, mahkemelerin ve medyanın raporlama dilidir.
Diğerleri, yalnızca bağlam içinde endişe verici hale gelen nötr kelimelerden oluşur, örneğin ‘without getting caught’ ifadesi, içermediği halde kaçınmayı ima eder.
Sonuç
Dil ve bilgisayar vizyonu literatüründe (ve bunların kesiştiği yerlerde, örneğin VLM’lerde) ortak bir tema, güvenilir bir şekilde yasaklanmış içeriği üretmeye kandırıldıklarını veya istemeden üretirlerken anlamakta zorluk çekmektir.
Bu büyük ve daha az şeffaf model fabrikalarının arkasında, bu semantik yakalama alanlarını radikal bir şekilde sıkılaştırmak, ‘yasak olmayan’ üretimler üzerindeki performans düşüşleri veya içerik filtresinden kabul edilemez bir şekilde yanlış pozitif oranları gibi kabul edilemez yan etkileri getirebileceği varsayılabilir.
Eğitimli bir modelin temel doğası, herhangi bir alanda tüm eğitim verilerine herhangi bir sonuca kadar sürmektir; yerel olarak mevcut olan tek kısıtlamalar: a) eğitim verilerine tartışmalı materyali dahil etmemek (bu aynı zamanda bir lojistik sorun); veya b) eğitimden sonra istenmeyen içeriğe giden yolları ‘kesmek’ (bu processo explicit olarak geri döndürülebilir veya fine-tuning’in kazara bir sonucu olabilir).
* Yazarların inline alıntılarını hyperlinklerle değiştirdim. Vurgular yazarların değil.
† https://www.unite.ai/what-is-overfitting/
İlk olarak 23 Şubat 2026 Pazartesi günü yayımlandı












