Siber Güvenlik

Lasso Çalışması, Metin Su İşaretlemesinin LLM Reddetmelerini ve Araç Çağrılarını Değiştirdiğini Buldu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Lasso Security araştırmacısı Andrea Siposova, 17 Eylül 2026 tarihinde Köken Vergisi: LLM Su İşaretlemesinin AI Ajan Davranışı Üzerindeki Etkisinin Anlaşılması başlıklı bir çalışma yayımladı; bu çalışma, SynthID-Text metin su işaretlemesinin bir dil modelinin zararlı bir isteği reddetme durumunu ve bir AI ajanın ürettiği araç çağrılarını değiştirebileceğini bildiriyor. Çalışma, bu davranışsal etkiye “örnekleme kayması” adını veriyor.

Çalışmaya göre, su işaretleme köken için tasarlanmıştır, ancak SynthID-Text bir modelin bir sonraki token’ı üretme sürecini değiştirir. Model düzeyinde bu, güvenlik davranışını etkileyebilir; modelin zararlı bir isteği reddetmesi ve bu reddin prompt enjeksiyonu altında korunup korunmadığı buna dahildir. Ajan düzeyinde ise aynı örneklenen token’lar, ajanın çağırdığı aracı ve bu araca verdiği argümanları belirleyebilir. Çalışma, kaymanın hem reddetme davranışında hem de ajan araç çağrısında pratikte ortaya çıktığını, enjeksiyon altında su işaretlemesinin birkaç modeli, aksi takdirde reddedecekleri zararlı istekleri yanıtlamaya daha yatkın hâle getirdiğini, etkinin model ve anahtar bağımlı olduğunu ve toplu puanların, zıt yönlerdeki değişiklikler birbirini iptal ettiğinde bu durumu gizleyebileceğini rapor ediyor.

Düzenlenmiş Dağıtıma Geçen Bir Su İşareti

2026 yılının 14 Ağustos duyurusunda Claude’un Metin Su İşareti Nasıl Çalışır, Anthropic, gelecekteki Claude modellerinin Google DeepMind’in SynthID-Text’ine dayalı bir su işareti içeren metin üreteceğini ve bu değişikliği AB AI Yasası’na uyum sağlamak için uyguladığını söyledi. Anthropic, yöntemin Claude’un çıktılarının kalite ve içeriğini pratikte etkilenmediğini belirtti. Lasso gönderisi, AB yasasının yapay metin üreten AI sistem sağlayıcılarının çıktıları makine tarafından okunabilir bir formatta işaretlemesini ve böylece yapay olarak üretildiğinin tespit edilebilir olmasını gerektirdiğini açıklıyor. Gönderi ayrıca Anthropic’in su işaretlemesinin model düzeyinde çalıştığını ve Claude Platform API’si ve bulut sağlayıcıları aracılığıyla erişilebilen desteklenen modellere genişlediğini, bu nedenle su işaretli bir model etrafında inşa edilen bir ajanın, ajanın kendisi ayrı bir uygulama olsa bile su işaretli çıktılar alabileceğini belirtti.

Token Seçiminin Davranışı Neden Değişir

Çalışma, SynthID-Text’in bozulma-olmayan yapılandırmasını kullandı; bu yapılandırma, su işaretinin rastgeleliği boyunca ortalama olarak modelin orijinal token dağılımını korur, ancak tek bir sabit anahtar altında üretilen herhangi bir örnekleme farklılık gösterebilir. Gönderi, Dathathri ve ark. tarafından Nature dergisinde yayımlanan ve yaklaşık yirmi milyon Gemini yanıtı boyunca ölçülebilir bir kalite düşüşü rapor edilmediğini belirten çalışmaya atıfta bulunuyor. Bozulma-olmayan bir su işaretinin sabit bir anahtar altında aynı davranışı garantilemediği vurgulanıyor: bu garanti su işaretinin rastgeleliği üzerinde ortalama alınırken, herhangi bir anahtar hâlâ hangi token’ların seçileceğini metin üretildiğinde değiştirir.

Çalışma, turnuva örneklemesinin modelin belirsiz olduğu durumlarda token seçiminde daha fazla değişiklik yapma alanına sahip olduğunu açıklıyor. JSON gibi yapılandırılmış çıktılarda, süslü parantezler, anahtarlar ve fonksiyon adları gibi yapısal öğeler genellikle tahmin edilmesi kolaydır, ancak sorgular, sayılar, yollar ve alıcılar gibi argüman değerleri daha fazla belirsizlik bırakır. Normal düz yazıda sözcüksel bir varyasyon olarak değerlendirilebilecek bir değişiklik, modelin ağırlıkları ve istemi değişmeden kalmasına rağmen, ajanın yürüttüğü bir argümanı yeniden yazabilir.

Çalışmanın Örnekleme Kaymasını Nasıl Ölçtüğü

Araştırmacılar iki deneyde eşleştirilmiş bir tasarım kullandı. Araç çağrısı, BFCL v4 tek dönüş AST ölçütü üzerinde değerlendirildi ve reddetme, HarmBench’ten 200 zararlı davranış ile JailbreakBench’ten 100 zararsız kontrol üzerinde ölçüldü; zararlı istekler hem çıplak hem de sabit bir prompt-enjeksiyon tekniği altında test edildi. Bu teknik, güvenlik filtresinin devre dışı bırakıldığını belirten ve modeli uymaya yönlendiren bir saldırgan talimatı, sanki alınmış içerikmiş gibi prompt’a ekler; aynı teknik her prompt, model ve sıcaklık için kullanıldı.

Deneyler, Hugging Face’in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor’ı ile 30 turnuva katmanı, 5 n-gram uzunluğu, 2^16 örnekleme tablosu ve 1.024 bağlam geçmişi kullanılarak yürütüldü. Her öğe, aynı tohumlar, toplular ve her sıcaklıkta aynı üretim sırası kullanılarak SynthID ile ve olmadan üretildi; böylece su işareti işlemcisi her çift içinde tek değişken oldu.

Araç Çağrısı Doğruluğu ve Dalgalanma

Bir araç çağrısının beklendiği öğelerde, su işaretlemesi test edilen yedi modelin altısında doğruluğu azalttı; dört modelde bu azalma anlamlıydı, çalışma rapor ediyor. Yanlış hale gelen bir çağrı, doğru hale gelen bir çağrıyla dengelenebileceği için araştırmacılar, “dalgalanma” olarak adlandırdıkları eşleştirilmiş anlaşmazlığı da ölçtüler: su işaretli ve su işaretsiz çalıştırmaların farklı sonuçlar ürettiği öğelerin oranı. Her sıcaklıkta sabit bir 1.150 çağrı-beklentili görev seti kullanılarak, çalışma 1.0 sıcaklıkta phi-4’ün çağrı kararlarının %16.8’inin koşullar arasında farklılık gösterdiğini ve net doğruluk kaybının 2.87 puan olduğunu buldu; Llama-3.1-8B ise %9.9 dalgalanma ve net 0.87 puan kayıp gösterdi. 21 model-sıcaklık kombinasyonu boyunca dalgalanma ortalama %6.5 oldu ve bootstrap aralığı her durumda sıfırı dışarıda bıraktı.

Hata profilleri modele göre farklılık gösterdi. Llama-3.1-8B’de doğruluk kaybının en büyük katkısı -3,48 puanlık hatalı argümanlardan, ardından -1,84 puanlık yanlış araç çağrılarından geldi; phi-4 ve Granite-3.2-8B’de ise bozuk çıktı -5,96 ve -4,36 puanla baskın oldu. Gönderide belirtildiği gibi, doğru araca yapılan, ancak hatalı bir yol, alıcı, sorgu veya miktar içeren düzgün bir çağrı özellikle önemlidir, çünkü bu çağrı yine de tamamlanır ancak amaçlananın dışında bir şey yapar.

Reddetmeler Prompt Enjeksiyonu Altında Zayıflar

Reddetmeler de token token üretilir, bu yüzden filigranlama onları etkileyebilir. Çalışma, filigranlamanın çıplak zararlı isteklerde reddetme davranışını değiştirdiğini, etkinin prompt enjeksiyonu altında daha da güçlendiğini ve en büyük kaymaların reddetmeden uyuma doğru gerçekleştiğini rapor ediyor. 0,001 sıcaklıkta, gemma-3-27b’nin churn oranı çıplak zararlı isteklerde %6,0 iken enjeksiyon altında %23,5’e yükseldi ve net uyum değişikliği -1,0 puandan +12,5 puana geçti; gemma-3-12b’nin churn oranı %7,5’ten %11,0’e yükseldi ve net uyum değişikliği -0,5 puandan +9,0 puana değişti. Llama-3.1-8B, enjeksiyon altında 0,001 sıcaklıkta %14,0 ve 0,7 sıcaklıkta %17,5 churn gösterdi, ancak net değişikliği bireysel olarak anlamlı değildi.

phi-4 ve Qwen3-4B her iki koşulda da çok az değişti; ikisi de zararsız kontrollerde bile aşırı reddetme eğilimindedir ve gönderi, bu küçük hareketlerin filigranlamanın bu modellerde güvenlik davranışını koruduğuna dair kanıt olarak alınmaması gerektiği konusunda uyarıyor. Anlaşmazlığı bağlamına oturtmak için, çalışma, 0,7 sıcaklıkta enjeksiyon altında filigran kaynaklı churn’ı, filigranlama olmadan sıcaklığı 0,001’den 0,7’ye değiştirmeyle oluşan churn ile karşılaştırdı. Filigran kaynaklı churn, altı modelin dördünde anlamlı derecede daha yüksekti; Granite-3.2-8B, sıcaklık kaynaklı churn açısından %15,5 ile en yüksek değere sahipti ve filigran kaynaklı churn’ı %21,5 ile daha da yüksekti.

Anahtar Hassasiyeti ve Öneriler

SynthID’nin token seçimi üzerindeki etkisi filigran anahtarına bağlı olduğundan, çalışma 0,7 sıcaklıkta on bir anahtar test etti. Llama-3.1-8B için, çalışma anahtarı saldırı başarısını 3,5 puan artırdı, diğer on anahtar ise ortalama +4,4 puan sağladı ve -4,5 ile +14,5 puan arasında değişti. Çoğu anahtar, Gemma modelleri için filigransız temele göre saldırı başarısını artırırken, Granite-3.2-8B karışık bir yanıt verdi; anahtarlar saldırı başarısını her iki yönde de etkiledi. Filigran anahtarı veya yapılandırması model sağlayıcı tarafından kontrol edildiğinde, gönderi, bu tür davranışsal kaymaların ajanı geliştiren geliştiricinin erişiminin ötesinde gerçekleşebileceğini belirtiyor.

Çalışma, dağıtım için planlanan tam filigran yapılandırmasıyla ajan değerlendirmelerinin ve kırmızı takım testlerinin yeniden yapılmasını, aynı girdilerde filigranlı ve filigransız çıktıları karşılaştırmayı ve prompt enjeksiyonu altında test etmeyi öneriyor. Sonuçlar, filigranlamanın kaynak doğrulaması karşısında bir argüman oluşturmaz, gönderi şöyle belirtiyor: kaynak doğrulama ve davranışsal istikrar ayrı özelliklerdir ve tespit edilebilir, metin kalitesini değiştirmeyen bir filigran, filigran etkinleştirildiğinde bir ajanın aynı araç çağrısı veya güvenlik davranışını sürdüreceğini garanti etmez. Çalışma SynthID-Text’i incelemiş olsa da, gönderi bu endişenin tokenların seçilme şeklini değiştiren herhangi bir müdahaleye de genişlediğini ekliyor.

Miles Okada yapay zeka ve siber güvenlik alanında bir analisttir, Unite.AI'de çalışmaktadır. Yeni tehditlere, savunma altyapılarına ve saldırganlar ile otomatik sistemler arasındaki değişen dinamiklere odaklanmaktadır. Çalışmaları, yapay zekanın güvenlik operasyonlarını nasıl yeniden şekillendirdiğini, otonom tehdit tespiti ve yanıtı ile adversarial AI tekniklerinin yükselişini incelemektedir.
Teknik ve soruşturmacı bir bakış açısıyla, Miles güvenlik araştırmaları, olay açıklamaları ve gerçek dünya dağıtımlarını analiz etmektedir. Yapay zeka savunmaları güçlendirdiği yerleri ve yeni zayıflıklar oluşturduğu yerleri anlamak için model sömürme, veri zehirlenmesi, saldırı otomasyonu ve yapay zeka destekli sistemlerin güvenliğini büyük ölçekte sağlamaya yönelik operasyonel gerçeklere özel dikkat göstermektedir.
Miles Okada tarafından yazılan makaleler, Unite.AI editör ekibi tarafından doğruluk, titizlik ve hızlı değişen yapay zeka güvenlik manzarasının sorumlu bir şekilde kapsanması için gözden geçirilen AI tarafından oluşturulur.