Anderson’un Açısı

Diller Gizliyi Saklayamaz

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

AI modelleri sırları saklayamaz. Onları açıklamaması söylenmesine rağmen, yazıları onları ele verir ve onları saklamak için daha çok çaba sarf etmek, sızıntıyı daha kolay tespit etmeye yol açar.

 

Bir şeyi kasıtlı olarak düşünmemek çok zordur. Bu durumun klasik bir örneği, 1960 İngiliz bilim kurgu gerilim filmi Village of the Damned‘nin sonunda gösterilir. Burada, kendini feda eden kahramanımız, telepatik güçleri sayesinde niyetini önceden keşfedebilecek düşman yabancı istilacıların yerleşim yerine bir bomba sokmuştur. Ancak, bombayı patlatmadan önce, düşüncelerini başka bir şeye yönlendirmek zorundadır; bomba değil de başka bir şey düşünmelidir:

Bu paradoks, bir şeyi düşünmemek için, onu bir şekilde dikkatinde tutmak zorunda olmandır; ve bu bilinen sendrom, çoğumuzun daha az dramatik bağlamlarda deneyimlediği bir şeydir.

Büyük Dil Modelleri (LLM’ler), temelleri dikkat mekanizmasına dayandığı için, bir kullanıcı yalnızca istedi diye bilgiyi bastırmakta benzer zorluk yaşar. Üstelik modeller giderek iş bilgi ağlarının merkezine yerleştirildiğinden, sır saklamaya yönelik bu saf yetersizlik birçok şirket için ciddi bir yükümlülük oluşturabilir.

Bu yılın başlarında, bir araştırma işbirliği, LLM’ler bağlamında bu zorluğu, Özel Durum Etkileşimli Görevler (PSIT’ler) olarak tanımladı ve test edilen OpenAI ve Alibaba modellerinin bu tür görevleri gerçekleştiremediğini buldu.

Söyleme…

Halihazırda, daha büyük modellerin daha fazla sızıntı yaptığı bilinmektedir, ancak yeni bir araştırma, ABD ve Kanada’dan, durumun state-of-the-art dil modelleri için geçerli olup olmadığını açıkça incelemiştir.

Çalışma, tüm modellerin bir şekilde gizli bir şeyi ele vermeye eğilimli olduğu sonucuna varır ve beş paragraflık (~450 kelimelik) denemeler ve hikayelerin, sızıntılar için yeterli bir alan sağladığını bulur.

Ayrıca, modellere bir sırrı saklamaları için daha çok ısrar edildiğinde, bu sırrı ifşa etme riski artar ve genellikle bir LLM, 20 ardışık denemede “gizli kelimeyi” ifşa edebilir:

Yeni makaleden: beş ön cephe modeli boyunca, uzun biçimli yazılar güvenilir bir şekilde gizli kavramları sızdırır, kısa şakalar değil; ve daha güçlü 'gizle' talimatları, çıktıları gizli palavra uzaklaştırır, ancak sinyali tersine çevirerek tespit edilebilir hale getirir.

Yeni makaleden: beş ön cephe modeli boyunca, uzun biçimli yazılar güvenilir bir şekilde gizli kavramları sızdırır, kısa şakalar değil; ve daha güçlü ‘gizle’ talimatları, çıktıları gizli kelime uzaklaştırır, ancak sinyali tersine çevirerek tespit edilebilir hale getirir. Kaynak

Bu görev, işletmelerin faaliyetleri için son derece ilgili bir görevdir, çünkü pazarlama ve halkla ilişkiler gibi çeşitli kanallar, iç raporlar gibi, bilgiyi seçici bir şekilde sunmak zorundadır.

Makaledeki bir örnek senaryo, gizli bilginin nasıl kasıtsız olarak ilgili olmayan çıktıları şekillendirebileceğini gösterir, bir LLM, şirketin mali istikrarsızlığını ifşa etmemesi talimatını alır, ancak yine de nakit sıkıntısı ve sermaye stresi ile ilgili cümlelere doğru kayar, okuyucunun gizli bağlamı çıkarmasına izin verir.

Makaledeki bir örnek senaryo, gizli bilginin nasıl kasıtsız olarak ilgili olmayan çıktıları şekillendirebileceğini gösterir, bir LLM, şirketin mali istikrarsızlığını ifşa etmemesi talimatını alır, ancak yine de nakit sıkıntısı ve sermaye stresi ile ilgili cümlelere doğru kayar, okuyucunun gizli bağlamı çıkarmasına izin verir.

Yazarlar şunları belirtir*:

‘Dil modelleri güvenilir bir şekilde bölümlere ayrılamaz. Bir gizli kelime, modelin yazısını şekillendirir ve başka bir model bu şekillendirmeyi tespit edebilir. Kelime her zaman bastırılır, ancak kavram bastırılmaz. Bu, yedi model, üç kelime kümesi, sistem istemi vs. kullanıcı istemi ve iki bağımsız çapraz-model tahminci boyunca geçerlidir […]

‘…Transformer’lerin yüksek sadakatle bilgiye erişimini sağlayan dikkat mekanizmasının, sırları saklamayı zorlaştırdığını düşünüyoruz. Bir LLM, bir kelimeyi ifşa etmemek için çabalasa bile, o kelimeye dikkat etmek zorundadır, bu da kazara sızıntıya yol açar.

‘Bir şeyi açıkça gizlemek için, bir insan düşünmelidir ve bir transformer dikkat etmelidir. İki kavramın model tarafından yaklaşık olarak eşit şekilde tercih edildiği durumlarda (örneğin, bir ofis işi veya orkestradaki ikinci keman hakkında bir hikaye yazmak), modelin karar verme süreci, ortaya çıkarmaya çalıştığı şeyden etkilenir.’

DeepSeek ve ChatGPT-5.4 modelleri, performanslarıyla istisnaiydi, ancak her ikisi de sızıntıya uğradı; GPT-5.4, bir kavramı kaçırmak için istendiğinde, bir testte %50’nin (yani, şansa göre) altında puan aldı.

Yazarlar, bu sendromu LLM’lerde sınırlı entropi bütçesi olarak tanımlar, burada modelin belirsizliği (bu durumda çok yardımcı olabilecek!), temelindeki rastgelelik eksikliği tarafından engellenir. Basitçe söylemek gerekirse, model, bir düşünceyi uzaklaştırmak için bir duvar veya bir baseball skoruna odaklanamaz. Yazarlar, modelin dikkatini başka bir kavram üzerinde yoğunlaştırmanın, ancak sorunu tamamen ortadan kaldırmadığını, ancak azaltabileceğini belirtir.

Çalışmanın en ilginç bulgularından biri, bu durumun, kontrol metni kullanıcı mesajlarında dahil edildiğinde, yani bir sistem istemi yerine, daha da kötüleşmesidir.

Diğer bir dikkat çekici nokta, bu eğilimin, daha küçük modellerde görülmediğinin doğrulanmasıdır (ancak bu, muhtemelen genel yeteneklerin azalmasıyla birlikte gelir).

Yeni makale, Gizli Bilgi Kaçırması: Dil Modeli Yazımında İstenmeyen Bilgi Kaçırması başlığını taşır ve Chicago Üniversitesi ve British Columbia Üniversitesi’nden iki yazar tarafından yazılmıştır.

Yöntem

Çalışma, öncelikle beş ön cephe modeli üzerinde yoğunlaşmaktadır: Claude Opus 4.6 ve Sonnet 4.6, Anthropic’ten; GPT-5.4, OpenAI’den; Llama 4 Maverick, Meta’dan; ve DeepSeek V3.2. Ek doğrulama testleri, xAI’nin Grok 4 ve Google’ın Gemini 2.5 Pro ile gerçekleştirildi. Ayrı ölçekleme deneylerinde ayrıca Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, Gemma 3 (4B, 12B ve 27B) parametreleriyle incelendi.

Daha örtük sızıntı biçimlerini ölçmek için araştırmacılar, psikofizik literatüründe standart bir ölçüt olan iki seçenekli zorunlu seçim (2AFC) testini kullandı. İkinci bir modele iki hikâye gösterildi ve belirli bir gizli kelime saklanırken hangisinin o kelimeden etkilenerek yazıldığını seçmesi istendi.

Rastgele tahmin yüzde 50 doğruluk üreteceğinden, bunun belirgin biçimde üzerindeki veya altındaki puanlar, yazıda hâlâ tespit edilebilir gizli anlamsal izler bulunduğunu gösterecekti.

İlk deneydeki yazar-tahminci düzeninde bir modele gizli bir kelime verildi ve bunu saklaması, onunla ilişkilerden etkin biçimde kaçınması veya dikkati yanıltıcı bir kavrama yöneltmesi istendi. Model farklı uzunluklarda hikâyeler, denemeler ve şakalar üretirken ikinci bir model ya gizli kelimeyi doğrudan bulmaya ya da farklı gizli istemlerin etkilediği metinleri ayırt etmeye çalıştı.

Beş koşul test edildi:

The five condition tested across the core models.

Çekirdek modellerde test edilen beş koşul.

Araştırmacılar dört yazı türünü test etti: ortalama yaklaşık 450 kelimelik beş ila sekiz paragraflı kısa hikâyeler; ortalama 12 kelimelik çok kısa şakalar; yaklaşık 450 kelimelik uzun kurulumlu şakalar; ve ortalama 380 kelimelik beş paragraflı denemeler.

Deneylerde üç kategoriye ayrılmış 15 gizli kelime kullanıldı. Somut nesneler şemsiye, deniz feneri, keman, kaktüs ve teleskop; soyut kavramlar adalet, sabır, entropi, nostalji ve özgürlük; tarafsız terimler ise parantez, salı, bakır, marj ve faturaydı.

Etkinin elle seçilen bu kelimelere bağlı olup olmadığını sınamak için deneyler ayrıca COCA derleminden rastgele seçilen 15 isimle ve test edilen her modelin bağımsız olarak seçtiği 15 ek kelimeyle tekrarlandı.

Ölçüm/Metrikler

İki test kullanıldı. Birinci testte, bir AI modeli, başka bir modelin ürettiği metni okudu ve 20 turda gizli kelimeyi tahmin etmeye çalıştı.

İkinci testte (2AFC), AI, iki metin gösterildi ve ya hangi metnin gizli bir kelimeyle etkilendiğini sordu, ya da hangisinin herhangi bir gizli kelime içerdiğini sordu. Rastgele tahminlerde %50’lik bir başarı oranı elde edileceği için, bu oranın üzerinde veya altında bir puan, gizli kavramın metinde hala tespit edilebilir olduğunu gösterecektir.

Araştırmacılar, her karşılaştırma için metinlerin sırasını değiştirerek tekrarladı ve sonunda her model için 420 ayrımcılık testi ve 450 tespit testi gerçekleştirdi.

Sonuçlar

Beş model, gizli kavramları %64 ile %79 arasında bir oranda tespit etti, gizli kelimelerin doğrudan metinlerde görünmemesine rağmen.

2AFC accuracy for stories with system-prompt secrets, where 50% signifies chance performance. 'Don't reveal' signifies that the model was told not to mention or hint at the word; 'actively hide', that it was told to avoid related associations; 'avoidance-aware', that the guesser should look for conspicuous absences; and 'free-response', that the exact word was named within 20 rounds. Stars mark above-chance results and daggers mark below-chance results, with nearly all significant findings surviving Bonferroni correction except DeepSeek under 'actively hide'; Grok and Gemini used slightly fewer trials because of API errors.

Sistem isteminde sır bulunan hikâyeler için 2AFC doğruluğu; yüzde 50 şans düzeyini gösterir. ‘Açıklama’ sözcüğü anmama, ‘etkin gizleme’ ilişkili çağrışımlardan kaçınma, ‘kaçınma farkındalığı’ belirgin yoklukları arama ve ‘serbest yanıt’ 20 tur içinde tam kelimeyi bulma koşuludur. İşaretler şansın üstü ve altındaki sonuçları gösterir; DeepSeek’in etkin gizleme koşulu dışında anlamlı bulguların neredeyse tamamı Bonferroni düzeltmesinden sonra da geçerlidir. Grok ve Gemini, API hataları nedeniyle biraz daha az denemede kullanıldı.

Model, GPT-5.4 ve Gemini 2.5 Pro, gizli fikirden kaçınmaya çalışırken, kaçınma modelinin kendisinin daha kolay tespit edilebilir olmasına yol açtı.

GPT-5.4’ün şansa göre daha düşük puanları, sistematik görünüyordu ve bazı gizli kelimeler çok güvenilir bir şekilde tespit edilirken, diğerleri neredeyse hiç tespit edilmedi.

Çoğu modelde, ‘Bu metin gizli bir kavram içeriyor mu?’ sorusunu kullanan testler, ‘Bu metin hangi gizli kavramı içeriyor?’ sorusunu kullanan testlere benzer sonuçlar verdi.

Ayrıca iki test yöntemi farklı sızıntı türlerini ölçtü: 2AFC testleri gizli bir temanın yazıda hâlâ algılanıp algılanamadığını, serbest yanıt testleri ise sızan ipuçlarının başka bir AI’ın tam gizli kelimeyi tahmin etmesine yetecek kadar güçlü olup olmadığını ölçtü.††

Yazarlar şu sonuca varıyor*:

‘Bulduğumuz şey, bir modelin bağlamında aktif olan bilginin, çıktısında tematik izler bırakabileceğidir. Sistem.prompt içeriği, zincir düşünme, alınan belgeler, kullanıcı tarafından sağlanan veriler – tüm bunlar, dışarıdan bir gözlemci tarafından tespit edilebilecek şekilde yaratıcı kararları etkileyebilir.

‘Sızıntının derecesi, üretim görevinin ne kadar açık uçlu olduğuna (kısa şakalar güvendedir, hikayeler değil) ve verilen ortamda bilginin ne kadar semantik olarak tanınıp tanınmadığına bağlı olacaktır (“violin” hikayelerde “cactus”tan daha fazla sızdırılacaktır”).

‘Ancak, semantik sızıntı görünüşe göre kaçınılmazdır, modeller bilginin gizli tutulmasına çalışsa bile.’

Sonuç

Yazarlar, sorunların bir kısmını, Transformer mimarisinin kendisinin temel ilkelerine bağlar. Tarih, bu son LLM sorunlarının, son eğitim koşullandırma (hizalama), sistem istemi’ları, filtreleri ve her geçen gün artan ikincil sistemlerin yardımıyla çözüleceğini gösterir.

Bu ikincil altyapının büyüdükçe, mevcut AI nesli, Jurassic Park gibi görünmeye başlar, burada temel değer teklifi, bir dizi kısıtlama ve uzlaşmayla birlikte gelir.

 

* Yazarların kendi vurgusu, gerekli durumlarda bana göre ayarlanmıştır (çünkü bir makale alıntısı zaten italiktir) ve yazarların satır içi alıntıları, bana göre hiperlinklere dönüştürülmüştür.

† Yazarlar, farklı model aileleri arasında ‘kendiliğinden seçilen’ kelimelerin görünüşte olasılık dışı bir şekilde örtüştüğünü gözlemlemektedir ve ‘Modeller benzer kelimere doğru yönelir: teleskop, özgürlük ve nostalji her biri 3+ modelin listesinde görünür’ demektedir. Ayrıca, model aileleri arasında ‘kısa şaka’ ortaya çıkması konusunda bir ortaklık olduğunu da not eder: ‘[Birkaç] model, 11 gizli kelime için ‘Neden bilim adamları atomlara güvenmez? Her şeyi uydururlar’ şakasını yazar. Kalan dört gizli kelime (kaktüs, entropi, nostalji, sabır) için aynı kütüphane şakası, Opus’un tüm 15 gizli kelime koşulu için de yazar—bunlar, temel koşulla aynı şakalardır.’

†† Makale, Arxiv standartlarına göre bile, tekrarlamaya ve ilgi çekici ana bulguları aşırı ayrıntı ve gösterilerle gömmeye eğilimlidir. Bu nedenle, okuyucuyu makaledeki ikincil deneylerin geri kalanına atıfta bulunmaya davet ediyorum.

İlk olarak 15 Mayıs 2026 Cuma günü yayımlanmıştır. Sentaks 16 Mayıs 2026 Cumartesi günü 16:05 EET’de düzeltilmiştir.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai