Anderson’un Açısı
Sansürlü AI Sohbet Modelleri Daha Fazla Hayal Görür, Araştırmalar Buluyor

Dil modellerindeki sansür, onların daha geniş bir düzeyde gerçeği raporlama yeteneklerini zayıflatabilir. Yeni bir araştırmaya göre, “güvenli olmayan” yanıtları engellemek için kullanılan aynı iç mekanizmalar, aynı zamanda gerçek bilgileri de bastırabilir, bu da modelleri daha güvenli hâle getirmeye yönelik çabaların, onları daha fazla hayal görmeye yol açarak geri tepebileceği anlamına gelir.
Yıllardır, geliştiriciler dil modellerini yalancılıktan uzaklaştırmaya çalışıyorlar. Modelleri daha doğru yapmaya yönelik çabalar, hayal power ve gerçek olaylara yönlendirmeye yönelik çalışmalar, literatürde güçlü ve yaygın bir akıma yol açmıştır.
Ancak, yeni bir Avustralya çalışması, modellere ne söyleyeceklerine daha sıkı kontrol uygulayarak, hizalama yöntemleri (güvenli olmayan değişimleri engelleyen eğitim teknikleri) modellerin doğru bir şekilde konuşmasını engelleyebilir.

Bir modelin gerçeklik doğruluğunu artırılması (‘Gerçeklik Artırma’ yukarıdaki şeklide), onun reddetme mekanizmalarını geçersiz kılabilir ve hayal power azaltma amacıyla yapılan düzenlemeler, güvenlik sınırını aşarak zararlı.promptları bypass etmesine izin verebilir, reddetme özelliklerinin dikkatli bir şekilde izole edilmediği sürece. Kaynak: https://arxiv.org/pdf/2510.07775
Araştırmaya göre, gerçek olayları hatırlama ile ilgili iç yollar, aynı zamanda reddetme davranışı için de sorumludur, yani zararlı veya hassas.promptlara cevap vermeyi engelleyen mekanizma. Hizalama prosedürleri reddetme sinyallerini çok agresif bir şekilde güçlendirdiğinde, bunlar gerçek olayları bastıran yollara da karışmaya başlar ve modelin zararlı davranışları reddetmesi ile geçerli bilgileri bastırmak arasında ayrım yapmasını zorlaştırır.
Çelişkili bir şekilde, modeller “hayır” demeye ne kadar iyi olursa, gerçeği söylemeye o kadar az yeteneklidir.
Yangın Konuları
Yukarıdaki resimde, merkezi konuların LLM sağlayıcıları için yasal sorumluluk kadar, kullanıcıya adil ve doğru sonuçlar sağlamakla ilgili olduğu görülüyor.
Örneğin, yukarıdaki ve aşağıdaki resimlerde kullanılan tartışmalı bir konu (ırka dayalı ceza istatistikleri) sorgulandığında, bir AI’nin akademik araştırmacılar ve istatistikçilerle konuşabileceği, ancak kötü niyetli kişilerin modeli jailbreak etmeye çalıştıklarında, kötüye kullanım amaçlı cevaplar üretilmesine izin vermemelidir.
Ancak, hizalanmış bir LLM, sorgulayıcıların karakterini bu şekilde tanımlayamadığından, dikkatli bir tavır takınır:

Hassas.promptlara verilen cevaplar, hizalama stratejilerine bağlı olarak farklılık gösterebilir. Güvenlik odaklı bir model sorguyu tamamen engellerken, gerçeklik odaklı bir model gerçek olaylar ile cevap verir, bu da bilgililiği artırır ancak bastırma davranışını zayıflatır. Bu, gerçeklik artırma düzenlemelerinin reddetme eşiğini düşürerek, modelleri zararlı niyetli.promptlara karşı daha savunmasız hâle getirebileceğini destekler.
Yan not olarak, yangın dili ile ilgili olarak, yeni makalenin bulguları, bir “uyarıcı” dil modelinin, bir “uyarıcı” dil modelinden daha az doğru ve daha az yararlı olabileceğini anlamaya yardımcı olabilir.
Makalenin kanıtları, bu iddianın kısmen doğru olduğunu, ancak bu durumun daha geniş sonuçları ile birlikte ele alınmasını sağlar:
sahte haberlerin yayılması ve modelin eğitim verilerinin yalnızca pahalı bir şekilde completely filtrelenebilmesi.
Garip Çift
Gözlemlenen sendromların arkasındaki mekanizmaları daha iyi anlamak için, araştırmacılar, bireysel dikkat başlıklarının aktivasyonlarını haritaladılar ve hayal power ile reddetme arasındaki özellikleri sık sık aynı bölgelerde bir arada bulunduğunu keşfettiler.
Onlar fine-tuning veya bu bölgeleri latent uzayda gerçeğe yakınlaştırmaya yönelik diğer yöntemlerin, yanlışlıkları azaltmak için kullanıldığını, ancak aynı zamanda sistemin güvenlik sınırlarını zayıflattığını buldular:
‘Gerçeklik artırmak genellikle reddetme davranışının zayıflamasının bedeli ile gelir. Analizimiz, modelde aynı zamanda hayal power ve reddetme bilgilerini kodlayan örtüşen bileşenler olduğunu, hizalama yöntemlerinin gerçeğe yakınlaşmayı istemeden bastırdığını ortaya koyuyor.’
‘Biz ayrıca, güvenli veri setlerinde fine-tuning yapılmasının, aynı nedenle, hizalamayı bozabileceğini inceleyeceğiz.’
Yazarların çözümü, SAE (ayrı activation desenlerini izole eden bir ağ) kullanarak bu iki fonksiyonu ayırmak ve gerçeğe yakınlaşırken güvenliği korumaktır, böylece modellerin hem daha güvenli hem de daha doğru olmasını sağlayan bir yol sunar.
Yeni makale, AI Hizalamasının Kazara Ticaret-Off’u: LLM’lerde Hayal Power Azaltma ve Güvenlik Dengesi başlığını taşır ve beş araştırmacı tarafından Deakin Üniversitesi ve bağımsız araştırma tarafından yapılmıştır.
Yöntem
Çalışmanın temel öncülü, gerçeğe yakınlaşmayı artırmak, modellerin zararlı.promptlara karşı savunmasızlığını artırıp artırmadığını ve her iki davranışın paylaşılan iç bileşenler üzerine dayanıp dayanmadığını araştırmaktır.
İki gerçeğe yakınlaşma yönteminin test edilmesi, yazarların, göreceğimiz gibi, gerçeğe yakınlaşma kazanımlarının tutarlı bir şekilde jailbreak savunmasızlığını artırdığını buldu.
Bu ticaret-off, dikkat başlıklarında gerçeğe yakınlaşma ve reddetme sinyallerini kodlayan paylaşılan yollardan kaynaklanmaktadır. Benign fine-tuning (güvenlik davranışını değiştirmeden faydayı artırmak amacıyla yapılan) bile, paylaşılan yolları değiştirerek güvenliği bozabilir.
Çalışma, üç temel kavramı tanımlar: gerçeklik, modelin mevcut bilgilerine dayanarak gerçeğe yakın cevaplar verme yeteneğini ifade eder; hayal power, modelin yanlış veya yanıltıcı bilgiler sunması, genellikle reddetme davranışı nedeniyle; ve reddetme davranışı, zararlı veya hassas.promptlara cevap vermeyi engelleyen mekanizmayı ifade eder.
Yazarlar, bu fonksiyonların sık sık karmaşık bir şekilde etkileşime girdiğini gözlemlediler:
‘Gerçeklik ve güvenlik genellikle ayrı olarak analiz edilir, ancak gerçek.promptlar sık sık hassas terimlerle birlikte gelir (örneğin, analiz, tespit veya eğitim) [Bu] durumlarda, güvenlik mekanizmaları aşırı ateşleyebilir – başka türlü doğru ve yararlı olan bilgileri bastırarak – ve böylece pratik gerçeğe yakınlaşmayı azaltır.’
‘Gerçeğe yakınlaşmayı artırmaya yönelik düzenlemelerin reddetme davranışını nasıl etkilediğini anlamak, gerçeğe yakınlaşmayı minimum, uygun bastırma ile başarmak için gereklidir.’

LoRA kullanarak bir koşullu LLM’yi daha ‘gerçeğe yakın’ bir duruma yönlendirebilen bir örnek.
Analiz, gerçeğe yakınlaşma artırma yöntemlerini, head-steering ve latent-direction mapping gibi, modelin iç hesabının kasıtlı değişiklikleri olarak ele alır.
Güç Direksiyonu
Soru, bu değişikliklerin reddetme davranışını etkileyip etkilemediğidir. Bunu test etmek için, çalışma, modelleri yalnızca TruthfulQA kullanarak gerçeğe yakınlaşma doğruluğunu değerlendirdi, aynı zamanda AdvBench ve StrongReject gibi zararlı.promptlara karşı güvenlik performansını değerlendirdi.
İki mevcut teknik, Inference-time intervention (ITI) ve TruthX, gerçeğe yakınlaşmayı artırır, ancak modeli daha önce reddettiği zararlı.promptlara cevap vermeye daha eğilimli hale getirir.
Hayal power davranışını doğrudan izole edip manipüle edebilmek için, yazarlar, LoRA modülünü LLaMA3-8B-Instruct kullanarak, TruthfulQA veri setinden yanlış cevaplar üzerinde eğittiler.
Bu, modeli hayal power veya gerçeğe yakınlaşma yönünde yönlendirebilen bir lineer vektör (yani, gerçeğe yakın ve hayal power cevapları arasındaki farkın grafiği) üretti.

Hayal power yönünde yönlendirme etkisi. TruthfulQA’da doğruluk, modeli hayal power yönünde daha da uzaklaştırdıkça artar, ancak AdvBench ve StrongReject’te saldırı başarısı oranı (daha düşük değer daha iyidir) keskin bir şekilde artar, gerçeğe yakınlaşma ve güvenlik arasındaki ticaret-off’u yansıtır.
Hayal power yönünde yönlendirme, gerçeğe yakınlaşma doğruluğunu bozarken, tersi yönde yönlendirme bunu iyileştirir ve zararlı.promptlara karşı güvenlik performansını değerlendirmek için bu tekniğin uygulanması, daha önce görülen bir deseni onaylar: gerçeğe yakınlaşma kazanımları, reddetme zayıflamasının bedeli ile gelir.
Yazarlar vurgular:
‘Bu, gerçeğe yakınlaşma ve güvenlik arasındaki ticaret-off’u güçlendirir: gerçeğe yakınlığı temsil eden tek bir lineer yön bile olsa, gerçeğe yakınlaşmayı artırmak, güvenlik hizalamasını zayıflatabilir.’
Veri ve Testler
Çalışma, önceki çalışmalara paralel olarak, gerçeğe yakınlaşmayı artırmak, modellerin zararlı.promptlara karşı savunmasızlığını artırıp artırmadığını ve her iki davranışın paylaşılan iç bileşenler üzerine dayanıp dayanmadığını araştırmayı amaçlar.
Yazarlar, reddetme özelliklerini hayal power özelliklerinden ayırmak için bir yöntem kullandılar, önce her iki davranışa katılan dikkat başlıklarını belirlediler, ardından SAE kullanarak yalnızca reddetme ile ilgili laten özellikleri çıkardılar.
Bu özellikler, korunan bir alt uzay tanımlar. Eğitim sırasında, gradient güncellemeleri, bu alt uzaya dokunmamak için değiştirilir, böylece model, hayal power’u azaltırken güvenlik hizalamasını bozmaz.
Yazarlar, CommonsenseQA veri setini kullanarak, altı ortak akıl yürütme challenge’inde (CSQA, HellaSwag, ARCchallenge, ARC Easy, WinoGrande ve SST-2) performanslarını değerlendirdiler.
Hedef modüller, öğrenme oranının 2×10⁻⁴, ağırlık çürümesi 0.01, bir eğitim dönemi ve toplu işleme boyutunun 2 olduğu AdamW optimizatörü ile LoRA kullanarak fine-tune edildi.
İki zararlı içerik benchmark’ü, AdvBench (500 örnek kullanıldı) ve StrongReject (300.prompt), güvenlik performansını değerlendirmek için kullanıldı. Çıkışlar, LlamaGuard3 tarafından “güvenli” veya “güvenli değil” olarak sınıflandırıldı.
Deneyler, LLaMA3-8B-Instruct ve Qwen2.5-Instruct üzerinde yapıldı.
Test edilen referanslar, SafeLoRA, SaLoRA, SAP ve vanilla süper gözetimli fine-tuning (SFT) idi. Tüm referanslar, varsayılan hiperparametreleriyle çalıştırıldı, 200.prompt ile HarmBench için, SafeLoRA hariç.
Doğruluk, birincil metrikti ve zararlı benchmark’ler için saldırı başarısı oranı (ASR), LlamaGuard3’ten alınan sonuçlar tarafından tanımlanan saldırı başarısı oranı idi.

LlaMA-3-8B-Instruct sonuçları, sütun en iyileri kalın olarak ve Qwen2.5 7B Instruct’un performansını, ortak akıl yürütme görevlerinde ve güvenlik benchmark’lerinde gösteren tablo.
Bu sonuçlardan, yazarlar şöyle der:
‘Cerrahi yaklaşımımız, güvenlik ve fayda arasında en iyi dengeyi sağlar: zararlı benchmark puanlarını önemli ölçüde düşürürken, fine-tuning doğruluğunu korur. Buna karşılık, SAP, SaLoRA ve SafeLoRA gibi yöntemler, ya zararlılığı artırır ya da faydayı bozar.’
‘Bunun temel nedeni, bu yöntemlerin, polisemanı [**] nedeniyle model performansını kısıtlayabilen güvenlik alt uzayının gradient’ine doğrudan çalışmasıdır.’
‘Vanilla fine-tuning (SFT) ile karşılaştırıldığında, yaklaşımımız, ortalama fine-tuning doğruluğunu %56,15’ten %75,09’a çıkararak, yaklaşık %19’luk bir kazanç sağlar.’
Yöntem, yazarlara göre:
‘Bu, gerçeğe yakınlaşma ve güvenlik arasındaki ticaret-off’u güçlendirir: gerçeğe yakınlığı temsil eden tek bir lineer yön bile olsa, gerçeğe yakınlaşmayı artırmak, güvenlik hizalamasını zayıflatabilir.’
‘Sonuçlarımız, reddetme özelliklerini fine-tuning sırasında korumakmanın önemini vurgular: reddetme alt uzayını izole ederek ve koruyarak, güvenlik hizalamasını bozmadan görev performansını koruyabiliriz.’
Son olarak, yazarlar, yaklaşımın, Circuit Break veri setinden 10% zararlı talimat eklenerek oluşturulan bir zehirlenmiş ortak akıl yürütme veri setinde fine-tune edilmesiyle, daha advers koşullarda da dayanıklılığını test ettiler.
Bu kasıtlı zehirlenmeye rağmen, yöntem, hem benign hem de zararlı değerlendirmelerde güçlü performansını korudu:

LLaMA3 8B Instruct’un, bir zehirlenmiş ortak akıl yürütme veri setinde fine-tune edilmesiyle elde edilen performans.
Yeni yaklaşım, SAP’den daha etkili bir şekilde ASR’yi azaltırken, aynı zamanda onun fayda kaybını önledi.
Sonuç
Bu makaleden en ilginç bulgu, reddetme ve hayal power gibi çelişkili unsurların eğitilmiş latent uzayda yer aldıkları gerçeğidir. LoRA ve SAE’leri kullanarak bu unsurları ayırmak yazarlar için cesaret verici ve ilginçtir, ancak bu, bir çapraz çözümdür ve daha derin mimari çözümlerinin, eğitim zamanını rather than sonraki düzeltmeleri ele alması umulmaktadır.
* Kalın biçimlendirmeyi gereksiz olarak atlıyorum.
** https://arxiv.org/abs/2210.01892
İlk olarak 10 Ekim 2025 Cuma günü yayımlandı.












