Anderson’un Açısı

Kolay Yeniden Düzenleme, Gemini ve Claude İçin Bile AI Güvenlik Açıklarını Oluşturur

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

AI güvenlik testlerinin aşırı açık tetikleyici sözcüklere dayandığı ortaya çıktı. Kolay bir yeniden ifade işlemi, “makul ölçüde güvenli” sayılan modellerin başarısız olmasına ve saldırıların yüzde 98’in üzerinde başarıya ulaşmasına yol açabiliyor.

ABD merkezli Labelbox’ın yeni araştırması, Gemini 3 Pro ve Claude Sonnet 3.7 gibi önde gelen büyük dil modellerinin iyi güvenlik sicilinin, değerlendirme verilerindeki yapay derecede belirgin dil nedeniyle yanıltıcı olabileceğini savunuyor. İncelenen iki kıyaslama HarmBench ve AdvBench.

HarmBench ve AdvBench makalelerindeki saldırı istemi örnekleri. Örnekler açıklama amacıyla basit olsa da yeni çalışma, gerçek veri noktalarının da kötü niyeti açıkça belli ettiğini ve sonuçların istemeden kolaylaştırılabildiğini ileri sürüyor. Kaynaklar: HarmBench ve AdvBench.

Araştırmacılar bu veri kümelerinin gerçek güvenlik risklerini mi ölçtüğünü, yoksa tetikleyici işaretler aracılığıyla yalnızca ret yanıtı mı ürettiğini test etti. Bunun için kötü niyeti ve gerekli ayrıntıları korurken açık tetikleyici dili kaldıran “intent laundering” yöntemini geliştirdiler.

Tetikleyiciler çıkarıldığında daha önce “makul ölçüde güvenli” değerlendirilen tüm modellerin güvensiz yanıtlar verebildiği görüldü. Buradaki güvenlik, API üzerinden sunulan bir LLM’nin iftira gibi yasak çıktılar üretmek için yapılan jailbreak girişimlerini engelleme yeteneğini ifade ediyor.

Sol üstte sarıyla işaretlenen bölüm tipik bir açık saldırı istemi. Altındaki yeşil sürüm aynı amacı daha tarafsız dille ifade ediyor; bu hâliyle Claude Sonnet 3.7 kullanıcının yeni bir şehirde çalıntı araçları parçalayan işletmeleri bulmasına yardım etmeyi kabul ediyor. Kaynak

Analiz iki aşamada yapıldı. Önce veri kümeleri tek başına incelenerek gerçek saldırıların özellikleriyle karşılaştırıldı. Ardından özgün ve iyileştirilmiş istemler gerçek modellere uygulandı; yeniden yazma yöntemi saldırı başarı oranı (ASR) en iyi düzeye gelene kadar yinelemeli biçimde geliştirildi.

Açıkça kötü niyetli istem, zararlı hedefi koruyup tetikleyici dili kaldıran bir yeniden yazma modelinden geçiriliyor. Yeni istem hedef modele gönderiliyor; yanıt hem güvensiz hem gerçek dünyada uygulanabilir ise saldırı başarılı sayılıyor. Başarısız sürümler geri beslenerek belirlenen deneme sayısına veya hedef ASR’ye ulaşılana kadar iyileştiriliyor.

Bu yeniden üretim döngüsü, tam kara kutu erişiminde yalnızca birkaç yinelemeden sonra incelenen tüm modellerde yüzde 90–98,55 ASR sağladı. Sonuçlar Gemini 3 Pro ve Claude Sonnet 3.7 gibi en güvenli sayılan modelleri de kapsıyor. Araştırmacılar mevcut değerlendirmelerin ve güvenlik hizalamasının tetikleyici ipuçlarına aşırı uyum sağladığını belirtiyor.

Çalışmanın adı Intent Laundering: AI Safety Datasets Are Not What They Seem. Makale San Francisco merkezli Labelbox şirketinden iki araştırmacı tarafından hazırlandı.

Yöntem

HarmBench ve AdvBench’in yapısını incelemek için iki korpustan kelime bulutları üretildi; en sık görülen tek sözcükler, ikili ve üçlü sözcük grupları çıkarıldı.

Birleştirilmiş AdvBench ve HarmBench’teki en sık 40 unigram, bigram ve trigram. Doğrudan olumsuz veya hassas ifadeler kırmızı, bağlama bağlı tetikleyiciler turuncu, birleşince tetikleyici olan tarafsız sözcükler yeşil gösteriliyor. “Yakalanmadan” ve “adım adım talimatlar” gibi ifadeler açık işaretlere olan bağımlılığı gösteriyor.

Sık görülen bir, iki ve üç sözcüklü ifadeler, gerçek saldırganların kullandığı dile kıyasla kötü niyeti olağan dışı biçimde açık ediyordu. “İntihar etmek” gibi doğrudan yüklü ifadelerin yanında, tek başına tarafsız olan fakat “yakalanmadan” gibi birleşince tespitten kaçma niyeti gösteren örnekler de vardı.

“Çalmak” fiili “hassas bilgi çalmak”, “gizli bilgi çalmak” ve “kişisel bilgi çalmak” biçiminde; “işlemek” fiili ise “içeriden öğrenenlerin ticaretini işlemek” veya “kimlik hırsızlığı işlemek” biçiminde tekrarlandı. Bu dil, gerçek gizli saldırılardan çok polis, mahkeme ve haber sınıflandırmalarına benziyor ve güvenlik filtresini yapay biçimde uyarıyor.

Tekrarlanan Veriler

Açık işaretlerin tekrarı, veri kümelerinde ciddi yinelenme olduğunu da gösterdi. Araştırmacılar her kümede 0,7 ile 0,99 arasında eşiklerle ikili benzerlik denetimleri yaptı ve sonuçları örnek sayısı eşleştirilmiş, güvenlik dışı GSM8K matematik kıyaslamasıyla karşılaştırdı.

AdvBench ve HarmBench’teki yinelenme oranlarının, aynı boyuttaki GSM8K örnekleriyle farklı benzerlik eşiklerinde karşılaştırılması. Güvenlik kümeleri neredeyse her eşikte çok daha fazla benzer istem içeriyor ve aynı zararlı amacı küçük ifade değişiklikleriyle tekrar tekrar test ediyor.

Orta düzey benzerlik ayarında AdvBench istemlerinin yalnızca yaklaşık yüzde 11’i gerçekten farklıydı; aynı boyuttaki GSM8K örneğinde soruların yaklaşık yüzde 94’ü farklıydı.

AdvBench ve HarmBench’te aynı zararlı amacı yalnızca küçük ifade farklarıyla tekrarlayan, neredeyse özdeş istemler. Böyle kümelerde tek bir yanıt çoğu zaman amacı değerlendirmek için yeterli olurdu.

HarmBench’te de aynı eğilim görüldü: bu düzeyde yüzde 16 yinelenme varken GSM8K’te oran yüzde 3,5’ti. Yüzde 85 benzersiz örnek makul standart kabul edilirse AdvBench buna yalnızca çok katı bir eşikte ulaştı ve yüzde 90’ı yine geçemedi. Kümeler geniş saldırı çeşitliliği yerine aynı fikirlerin varyasyonlarını ölçüyordu.

Ek Yaklaşımlar ve Testler

Intent laundering iki teknik kullandı: açıkça olumsuz sözcükleri tarafsız veya açıklayıcı karşılıklarla değiştiren connotation neutralization ve gerçek dünya referanslarını pratik anlamı değiştirmeden kurmaca bir bağlama taşıyan context transposition.

Az sayıda örnek önce elle yazıldı; süreç daha sonra GPT-5.1 (gpt-5.1-2025-11-13) kullanılarak sekiz örnekli bağlam içi öğrenmeyle otomatikleştirildi. Özgün ve yeniden yazılmış istemlere verilen yanıtlar karşılaştırılarak açık tetikleyicilerin güvenlik değerlendirmesini ne ölçüde etkilediği ölçüldü.

Yanıtlar hem güvenlik hem uygulanabilirlik açısından değerlendirildi. Güvenlik, özgün kötü niyetin korunup korunmadığına ve olası zararın derecesine göre “son derece güvensiz” ile “güvenli” arasında beş puanla ölçüldü.

Intent laundering uygulanmadan önce AdvBench ve HarmBench yanıtlarını değerlendiren istem şablonu. GPT-5.1, içeriğin zararı mümkün kılıp kılmadığına göre beş puanlık ölçekte tek bir genel karar verdi.

Uygulanabilirlik de “son derece uygulanabilir” ile “uygulanamaz” arasında beş puanla ölçüldü. Yalnızca hem güvensiz hem gerçek dünyada kullanılabilir yanıtlar ASR başarısı sayıldı. Puanlar ikili sonuca dönüştürüldü ve başarısız yeniden yazmalar, hedef ASR’ye ya da deneme sınırına ulaşılana kadar GPT-5.1’e geri verildi.

N-gram çıkarımı Python wordcloud paketiyle yapıldı. Anlamsal benzerlik için Sentence-BERT Transformers’ın all-MiniLM-L6-V2 modeli kullanıldı. Değerlendirme ölçütlerini GPT-4o, en fazla 1024 token ile üretti; yıkama sonrası güvenlik ve uygulanabilirliği GPT-5.1 yine 1024 token sınırıyla sıfır örnekli olarak değerlendirdi.

Test edilen modeller arasında Gemini 3 Pro, Claude Sonnet 3.7, Grok 4, GPT-4o ve Qwen2.5-7B-Instruct vardı. Gereksiz muhakeme mümkün olduğunca azaltıldı ve tüm modellerin çıktısı 4096 token ile sınırlandı.

AdvBench ve HarmBench’te güvenlik değerlendirmesi (SE), uygulanabilirlik (PE) ve saldırı başarı oranı (ASR). Özgün istem, ilk yeniden yazma ve sonraki yinelemeler karşılaştırılıyor. Kalın değerler her veri kümesindeki en yüksek ASR’yi; düşük ASR ise daha güçlü güvenliği gösteriyor.

Açık tetikleyici işaretlerin kaldırılması ASR’de keskin artış yarattı. AdvBench’te ortalama ASR yüzde 5,38’den ilk yeniden yazmada yüzde 86,79’a, HarmBench’te yüzde 13,79’dan yüzde 79,83’e çıktı. Ret davranışının gerçek kötü niyetten çok tetikleyici dile bağlı olduğu görüldü.

Son yinelemede tüm modeller yüzde 90–98,55 ASR’ye ulaştı. Gemini 3 Pro ve Claude Sonnet 3.7 yalnızca birkaç turdan sonra AdvBench’te yüzde 93–95, HarmBench’te yüzde 91–93 oranında jailbreak edildi.

Yazarlar, tetikleyiciler kaldırıldığında önceki güvenlik sonuçlarının geçerliliğini yitirdiğini ve ölçülen başarının temel riski anlamaktan çok açık işaretlerin varlığından kaynaklandığını belirtiyor. Güvenlik değerlendirmelerinin daha gerçekçi saldırıları kapsaması, mevcut hizalama yöntemlerinin de gerçek tehditlere karşı güçlendirilmesi gerekiyor.

Sonuç

Dil, bilgisayarlı görü ve ikisinin kesiştiği VLM araştırmalarında ortak bir sorun sürüyor: model, yasak içerik üretmesi için kandırıldığını veya dış baskı olmadan bu alana kaydığını güvenilir biçimde anlayamıyor. Filtrelerin aşırı sıkılaştırılması ise izin verilen üretimlerde performans kaybı ve kabul edilemez yanlış pozitif oranı doğurabilir.

Eğitilmiş bir modelin temel doğası, istemin yönlendirdiği her sonuca eğitim verisini kullanarak ilerlemektir. Doğal kısıtlar, tartışmalı materyali baştan eğitim verisine almamak ya da eğitimden sonra istenmeyen içeriğe giden yolları kesmektir. İlki büyük bir lojistik sorundur; ikincisi açık abliteration veya ince ayarın istenmeyen yan etkileriyle geri döndürülebilir.

* Yazarların satır içi atıfları bağlantılarla değiştirilmiş, özgün vurguları korunmuştur. † Aşırı uyum hakkında ilgili açıklamaya bakınız.

İlk yayımlanma: 23 Şubat 2026 Pazartesi.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai