Anderson’un Açısı

AI’ye Bir Şey Yapmasını Söylemediğiniz Zaman, Bunu Daha Çok Yapma Olasılığı Var

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image depicting a robot fiddling with a padlocked door. Z-Image Turbo via Krita AI Diffusion.

ChatGPT’ye bir şey yapmamasını söylemek, aslında bunu yapmasını önermesini sağlayabilir ve bazı modeller hırsızlık veya aldatma gibi yasak eylemleri onaylayabilir.

 

Bence, Large Language Models (LLM) ile ilgili bir şeyi fark etmişsinizdir: belirli bir talimat verdiğinizde, yani bir şeyi yapmamasını söylediğinizde, bu modeller sadece talimatı görmezden gelmekle kalmaz, aynı zamanda yapmamasını söylediğiniz şeyi hemen gerçekleştirmeye çalışırlar – hatta bu, modelin karakterine aykırı olsa bile.

Bu, daha eski NLP modellerinin de bir özelliği olup, son yıllarda LLM’lerin negatif ifadeleme yetenekleri hakkında bir araştırma alanı ortaya çıkmıştır.

İnsanların karmaşık çift negatiflerin gizli anlamını takip etmesi zor olabilir, ancak LLM’ler bu konuda ek bir dezavantaja sahiptir. Aşağıdaki örnekte, ChatGPT’nin monotonicity reasoning yeteneği, 2023 tarihli bir makaleden alınmıştır:

ChatGPT'de monotonicity reasoning yeteneğinin başarısızlığı, 2023 tarihli makale 'Language models are not naysayers: An analysis of language models on negation benchmarks'inden alınmıştır. Kaynak - https://arxiv.org/pdf/2306.08189

ChatGPT’de monotonicity reasoning yeteneğinin başarısızlığı, 2023 tarihli makale ‘Language models are not naysayers: An analysis of language models on negation benchmarks’inden alınmıştır. Kaynak – https://arxiv.org/pdf/2306.08189

ChatGPT gibi kapalı modellerin iç işleyişi belirgin değildir, ancak ikinci cevap, ilk cevabın oluşturulmasında kullanılan mantığı yeniden kullanıyor gibi görünmektedir; ancak bu mantık, ikinci durumda geçerli değildir, çünkü adamın köpeğin dışında başka bir hayvanı olabilir.

Burada, ikinci sorunun sonucu, ilk sorunun çözümünden etkilenmiş gibi görünmektedir.

Benzer şekilde, bir yasak eylemin varlığını önermek, bu eylemi gerçekleştirmek için bir LLM tarafından kullanılabilir ve bu model, eylemi tanır ve işler, ancak negasyonu işlemez.

Bu, LLM’lerin kullanımını sınırlayan ciddi bir kısıtlamadır, çünkü dil modellerinin kritik uygulamalar için kullanıldığı alanlarda, tıpta, maliyede veya güvenlik gibi alanlarda, bu modellerin yasaklamaları içeren talimatları doğru bir şekilde yorumlaması önemlidir.

Hayır Demek, Evet Demek Demektir

Bu problem, ABD’den bir yeni makalede vurgulanmaktadır ve ticari modellerin (örneğin ChatGPT) ve açık kaynaklı modellerin (örneğin LLaMA) yasak talimatları takip edememe derecesini incelemektedir.

Araştırmacılar, 16 modeli 14 etik senaryoda test etmişler ve açık kaynaklı modellerin, basit negasyon (‘Şunu yapma’) altında %77 oranında ve karmaşık negasyon (‘Şunu yapma, eğer bu şuna yol açarsa’) altında %100 oranında yasak talimatları onayladıklarını bulmuşlardır.

Dil modellerinin müzakere etmesi gereken etik önerilerin örnekleri. Her durumda 'aksiyon', 'doğru cevap' değil, sadece LLM'nin gerçekleştirmesi veya gerçekleştirmemesi gereken eylemdir. Kaynak - https://arxiv.org/pdf/2601.21433

Dil modellerinin müzakere etmesi gereken etik önerilerin örnekleri. Her durumda ‘aksiyon’, ‘doğru cevap’ değil, sadece LLM’nin gerçekleştirmesi veya gerçekleştirmemesi gereken eylemdir. Kaynak – https://arxiv.org/pdf/2601.21433

Ticari modeller daha iyi performans gösterse de, sadece Gemini-3-Flash yeni Negation Sensitivity Index (NSI) ölçeğinde en yüksek puanı almıştır (Grok 4.1 ise yakın bir ikinci sırayı almıştır).

Yeni benchmark altında, test edilen tüm modeller tıbbi, mali, hukuki, askeri, ticari, eğitim ve bilim alanlarında kararlar verme konusunda yasaklanmıştır – bu da onları bu alanlarda kullanılmaz hale getirmektedir. İlerleme modelleri genellikle daha iyi performans gösterse de, bileşik negasyon içeren sorgularda bile başarısız olmuşlardır.

Araştırmacılar, açık kaynaklı LLM’lerin negatif sorguları işleme konusundaki zorluğuna dikkat çekerek, şunları söylemişlerdir:

‘Ticari modeller daha iyi performans gösterir, ancak yine de %19-128 arasında değişen oranlarda dalgalanmalar gösterir. Modeller arasındaki anlaşma, afirmatif sorgularda %74’ten negatif sorgularda %62’ye düşer ve mali senaryolar tıbbi senaryolardan iki kat daha kırılgandır […]’

‘Buluntular, mevcut hizalama tekniklerinin güvenli dağıtıma ulaşmadığını göstermektedir: “X yap” ve “X yapma” arasındaki farkı güvenilir bir şekilde ayırt edemeyen modeller, yüksek riskli bağlamlarda otomatik kararlar vermemelidir.’

Makale, bu tür hataların özellikle savunmasız bireyleri etkileyeceğini not etmektedir:

‘Alan ayarlaması salt teknik bir ayar değildir. Ayrıca eşitlik açısından da etkilidir.

‘Mali kırılganlık, ekonomik olarak savunmasız popülasyonların, örneğin kredi veya kredi için başvuruda bulunanların, negatif hatalara karşı daha yüksek risk altında olacağı anlamına gelir.’

Araştırmacılar, bu sorunun geleneksel hizalama tabanlı yaklaşımlar ile çözülemeyeceğini vurgulamaktadır, çünkü sorun LLM’lerin niyet analizi yeteneğinde derin bir başarısızlık içerir:

‘Bir model “kötü anahtar kelimeleri” reddedebilir, ancak taleplerin yapısal ifadelerini işlemede başarısız olabilir. Gerçek hizalama, sadece neyi değerlendirmeyi öğrenmekle kalmaz, aynı zamanda dil ifadelerini doğru bir şekilde analiz etmeyi de gerektirir.

‘Bu yetenek güvenilir olana kadar, “yapma” “yapma” demektir.’

İlginç bir şekilde, Gemini Flash tek “kazanan” olsa da, mevcut Çin LLM’leri bu soruna karşı çok daha az duyarlıdır.

Yeni makale, When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models adlı Kenyon College, Ohio’dan iki araştırmacı tarafından yazılmıştır.

Yöntem ve Veri

Araştırmacılar, LLM’leri test etmek için 14 etik senaryo geliştirmişlerdir:

LLM'leri zorlamak için tasarlanan 14 etik senaryo (orijinal PDF'den yeniden düzenlenmiştir).

LLM’leri zorlamak için tasarlanan 14 etik senaryo (orijinal PDF’den yeniden düzenlenmiştir).

‘ACTION AT STAKE’ sütunundaki içerikler, etkili ‘yap’ veya ‘yapma’ eylemlerini temsil eder; burada LLM’ler etik standartları hakkında değil, karmaşık sorguları ve yasakları kritik durumlar altında işleme yetenekleri hakkında sınanmaktadır.

Bu senaryoların ciddiyeti, yazarların bir parçası olarak sunulmuştur; LLM’ler, çok daha az nghiêm senaryolarda da aynı şekilde sınanabilirdi.

Çalışma için test edilen ABD ticari modelleri GPT-5.1; GPT-5.2; GPT-5-mini; Claude-Haiku-4.5; Claude-Sonnet-4.5; Gemini-3-Flash; Grok-4.1-non-reasoning; ve Grok-4.1-reasoning.

Test edilen Çin ticari modelleri DeepSeek-V3; GLM-4; Kimi-K2; ve Qwen3.

Kullanılan açık kaynaklı modeller LLaMA-3.2-1B; Gemma-3-4B; Granite-3.3-2B; ve Phi-4-mini-3.8B.

Her senaryo için dört farklı versiyon yazılmıştır: F0 eylemin yapılması gerektiğini belirtir; F1, yapılmaması gerektiğini; F2, amacı gerçekleştirmek için yasak eylemi gerçekleştirmeyi destekler; ve F3, amacı gerçekleştirmek için yasak eylemi gerçekleştirmeyi reddeder:

‘F0’da modellere “mağazayı soymalı mı?” sorusu sorulur. F1’de “mağazayı soymamalı mı?” sorusu sorulur. F2’de “kızını kurtarmak için mağazayı soymalı mı?” sorusu sorulur.’

‘F3’te “kızını kurtarmak için mağazayı soyması gerekiyorsa, onu kurtarmamalı mı?” sorusu sorulur. Kabul edilebilir gerçekler sabit kalır ve sadece polarite değişir.’

Yaklaşım, bir modelin negatif ifadelemeyi anladığı durumlarda, cevaplarının temiz bir şekilde değişmesi gerektiğini savunur. Yani, %60’ın “X yapmalı” (F0) yanıtını verdiyse, %40’ın “X yapmamalı” (F1) yanıtını vermesi gerekir – çünkü F1’i reddetmek, eylemi desteklemek anlamına gelir; ve rakamlar böyle bir şekilde eşleşmiyorsa, model negatif ifadelemeyi yanlış yorumlamaktadır.

Testler

Araştırmacılar, Cochran’s Q test ve Kruskal-Wallis H-test kullanarak, çerçevenin (anlamı korurken polarity değişimi) model cevaplarını nasıl etkilediğini ölçmüşlerdir. Yanlış pozitifleri ayarladıktan sonra, araştırmacılar, modelin cevabının, sadece nasıl sorulduğuna bağlı olarak %61,9 oranında değiştiğini bulmuşlardır – sogar anlamsal olarak aynı olan sorularda bile.

Araştırmacılar ayrıca, rastgeleliği (sıcaklığı) azaltmanın modelleri daha az kırılgan yapılıp yapılmadığını test etmişlerdir:

F0–F3 prompt tipleri için onay oranları, üç model kategorisi boyunca: Çin, ABD merkezli ve açık kaynaklı (OSS). F0, basit afirmatif çerçevelemeyi yansıtır, F1 doğrudan negasyonu tanıtır. F2 ve F3, gömülü hedeflerle bileşik negasyonu test eder. Değerler LPN-normalize edilmiştir ve modellerin çerçevelemeye göre nasıl değiştiğini gösterir, açık kaynaklı modeller negasyona karşı en güçlü duyarlılığı gösterir.

F0–F3 prompt tipleri için onay oranları, üç model kategorisi boyunca: Çin, ABD merkezli ve açık kaynaklı (OSS). F0, basit afirmatif çerçevelemeyi yansıtır, F1 doğrudan negasyonu tanıtır. F2 ve F3, gömülü hedeflerle bileşik negasyonu test eder. Değerler LPN-normalize edilmiştir ve modellerin çerçevelemeye göre nasıl değiştiğini gösterir, açık kaynaklı modeller negasyona karşı en güçlü duyarlılığı gösterir.

Basit afirmatif sorgularda (F0), tüm kategorilerden modeller, önerilen eylemler için orta düzeyde destek vermiştir, onay oranları %24 ile %37 arasında değişmiştir. Bu, senaryoların ahlaki ikilemler olarak tasarlandığı ve açık cevapların olmadığı için beklendiği gibiydi. Ancak araştırmacılar, negatif ifadelemenin bu dengenin bozulmasına neden olduğunu belirtmiştir:

‘Açık kaynaklı modeller, F0’da %24 onaydan F1’de %77 onaylara sıçrar. “X yapmamalı” dendiğinde, dörtte üç oranında yasak eylemi onaylarlar. Bileşik negasyon altında (F3), %100 onay oranına ulaşırlar, bu da negatif ifadeleme operatörünü tamamen işlemediklerini gösteren bir tavan etkisi yaratır.’

Açık kaynaklı modeller, en aşırı çerçeveleme etkilerini göstermiştir, onay oranları F0’dan F3’e %317 artmıştır – bu, çıktılarının nasıl sorulduğuna karşı çok duyarlı olduğunu gösterir. ABD ticari modelleri de büyük dalgalanmalar göstermiştir, onay oranları F0’dan F3’e iki katına çıkmıştır.

Çin ticari modelleri genel olarak daha稳dı, sadece %19’luk bir artış gösterdi ve diğer gruplardakine göre çok daha düşük bir artış gösterdi. Daha da önemlisi, negatif bir sorgu olduğunda onaylarını azaltan tek modeller onlardı, yani “yapmamalı” demenin “yap”ın tersi anlamına geldiğini anladılar:

Çerçeveleme türüne ve model kategorisine göre eylem onay oranları. Açık kaynaklı modeller (yeşil) güçlü çerçeveleme etkileri gösterir, F1'de %77 onay ve F3'te %100 onay oranlarına ulaşır. Sadece Çin modelleri (orta panel), basit negasyon eklendiğinde onayları azaltır, beklenildiği gibi. Hata çubukları %95 güven aralığını gösterir.

Çerçeveleme türüne ve model kategorisine göre eylem onay oranları. Açık kaynaklı modeller (yeşil) güçlü çerçeveleme etkileri gösterir, F1’de %77 onay ve F3’te %100 onay oranlarına ulaşır. Sadece Çin modelleri (orta panel), basit negasyon eklendiğinde onayları azaltır, beklenildiği gibi. Hata çubukları %95 güven aralığını gösterir.

Modeller, afirmatif sorgularda %74 oranında birbirleriyle anlaşırken, negatif sorgularda bu oran %62’ye düştü – bu, modellerin negatif ifadelemeyi tutarlı bir şekilde işlemediğini gösteren %12’lik bir düşüş:

Modeller arasındaki anlaşma, afirmatif sorgularda %73-75'ten negatif sorgularda %62'ye düştü. 11 puanlık fark, farklı eğitim kaynaklarının modellere negatif ifadelemeyi aynı şekilde öğretmediğini gösterir. Hata çubukları %95 güven aralığını gösterir.

Modeller arasındaki anlaşma, afirmatif sorgularda %73-75’ten negatif sorgularda %62’ye düştü. 11 puanlık fark, farklı eğitim kaynaklarının modellere negatif ifadelemeyi aynı şekilde öğretmediğini gösterir. Hata çubukları %95 güven aralığını gösterir.

Alan Farklılıkları

Araştırmacılar, bir modelin yargısının negasyon ile yeniden ifade edilen bir sorgu tarafından nasıl kolayca değiştirilebileceğini ölçmek için Negation Sensitivity Index (NSI) adlı bir ölçek geliştirmişlerdir – bu, bir modelin mantıksal olarak eşdeğer ancak negatif olarak ifade edilen sorulara zıt cevaplar verme eğilimini量ar.

Yüksek bir NSI puanı, bir modelin negatif olarak ifade edilen sorulara sık sık zıt cevaplar verdiğini gösterir, bu da yüzey dili yerine tutarlı akıl yürütme üzerine güvenirlik olduğunu gösterir.

NSI ölçütü, mantıksal olarak eşdeğer olan ancak negatif olarak ifade edilen sorularda modellerin zıt cevaplar verme eğilimini ölçmek için kullanılmıştır. Bu, büyük bir sorgu çiftleri kümesinde modellerin cevaplarının nasıl değiştiğini karşılaştırmak yoluyla yapılmıştır.

NSI ölçütü, alan duyarlılığı için de kullanılmıştır (yani, “mali” veya “askeri” gibi bir kategorinin, sonucun nasıl değiştiğini etkileyip etkilemediğini görmek için). İlginç bazı kontrastlar elde edilmiştir, bazı karar türleri diğerlerinden daha duyarlıdır.

Örneğin, ve mali sorguları, modellerin cevaplarını değiştirmeye karşı oldukça hassastı, NSI ölçeğinde %0,64 ila %0,65 arasında puan aldı. Tıbbi sorgular daha稳dı, ortalama %0,34 puan aldı:

Alanlara göre negasyon duyarlılık puanları, daha yüksek değerlerin modellerin negatif olarak ifade edilen sorulara zıt cevaplar verme olasılığını gösterir

Alanlara göre negasyon duyarlılık puanları, daha yüksek değerlerin modellerin negatif olarak ifade edilen sorulara zıt cevaplar verme olasılığını gösterir

Tıbbi alanın en az hata verdiğini ve mali alanın en çok hata verdiğini gözlemleyen araştırmacılar, şunları söylemişlerdir:

‘Neden böyle bir fark olabilir? Tıbbi kararlar, daha net bir eğitim sinyali nedeniyle daha az hata verebilir. Hipokrat ilkeleri, kurulan protokoller ve kapsamlı profesyonel literatür, model davranışını çerçeveleme değişikliklerine karşı sabit tutabilir.

‘Mali kararlar ise daha belirsiz ticaretler içerir ve daha az sosyal uzlaşı vardır, bu da modellerin yüzey ipuçlarına karşı daha duyarlı olmasına neden olur.’

Sorun, özellikle açık kaynaklı modellerde daha şiddetliydi, bunlar mali, iş ve askeri sorgularda %0,89’un üzerinde NSI puanlarına ulaştı. Ticari sistemler daha az kırılgandı, ancak still %0,20 ila %0,75 arasında değişen puanlara sahipti:

Model ve alana göre negasyon duyarlılık puanları, yeşil (sağlam, NSI = 0) ile kırmızı (kırılgan, NSI = 100) arasında değişen bir renk ölçeği kullanılarak gösterilir. Modeller kökenlerine göre gruplandırılmıştır, Çin sistemleri en üstte, ABD merkezli modeller ortada ve açık kaynaklı sistemler en alttadır. Duvarlılık, mali, iş ve askeri alanlarda en yüksektir, birçok model bu alanlarda yüksek NSI değerlerine sahiptir, mentre tıbbi ve eğitim alanları daha稳dır. Gemini-3-Flash, tüm kategorilerde sıfır puan alırken, açık kaynaklı modeller en hassas ayarlamalarda sık sık maksimum NSI değerine ulaşır.

Model ve alana göre negasyon duyarlılık puanları, yeşil (sağlam, NSI = 0) ile kırmızı (kırılgan, NSI = 100) arasında değişen bir renk ölçeği kullanılarak gösterilir. Modeller kökenlerine göre gruplandırılmıştır, Çin sistemleri en üstte, ABD merkezli modeller ortada ve açık kaynaklı sistemler en alttadır. Duvarlılık, mali, iş ve askeri alanlarda en yüksektir, birçok model bu alanlarda yüksek NSI değerlerine sahiptir, mentre tıbbi ve eğitim alanları daha稳dır. Gemini-3-Flash, tüm kategorilerde sıfır puan alırken, açık kaynaklı modeller en hassas ayarlamalarda sık sık maksimum NSI değerine ulaşır.

Araştırmacılar, açık kaynaklı modellerin bu alanda artan kırılganlığının, özellikle yerel olarak dağıtılan sistemleri kullanan savunmasız veya marjinal gruplar için orantısız riskler taşıyabileceğini not etmişlerdir:

‘Eğer bir kurum, bütçe nedenleriyle bir açık kaynaklı modeli dağıtırsa, yük, zaten ekonomik olarak zor koşullarda bulunan nüfuslar üzerinde yoğunlaşır. Buolamwini ve Gebru belgeledi gibi, yüz tanıma中的 accuracy farklılıkları, demografik çizgiler boyunca düştü.

‘Buluntularımız, alan çizgileri boyunca benzer bir farklılığı önermektedir, ekonomik olarak savunmasız popülasyonlar daha yüksek risk altındadır.’

Makale, sonuçlarını ve kapanış vakalarını kapsamlı bir şekilde sunmaktadır, ancak burada tüm sonuçları kapsamak için yeterli yer yoktur. Kapanış vakaları, negatif ifadelemeblind model cevaplarının son derece tavsiye edilmeyen eylemleri önermeye eğilimini göstermektedir, çünkü bunlar negatif ifadelemeyi yanlış yorumlarlar:

‘F0’da açık kaynaklı modeller, %52 oranında soygunu onaylar, bu, senaryonun ahlaki karmaşıklığı nedeniyle savunulabilir bir bölünmedir. F1’de (“soymamalı”) %100 onay verirler. Negatif yasak, yasak eylemin onaylanmasına yol açar.’

‘Ticari modeller daha karışık bir model gösterir, toplam onay %33’ten %70’e yükselir. Bazı ticari sistemler neredeyse tersine dönerken, diğerleri modest artışlar gösterir.

‘Önemli olarak, hiçbir kategori, negatif ifadelemenin doğru işlenmesini üretecek ayna görüntüsünü gerçekleştirmez.’

SONUÇ

Bu, son zamanlarda karşılaştığım en ilginç makalelerden biridir ve okuyucuların daha fazla araştırma yapmasını öneririm, çünkü burada tüm materyali sunmaya yeterli yer yoktur.

Belki de çalışmanın en ilginç yönü, LLM’leri kullanan kişilerin bu soruna sık sık rastlaması ve zamanla, LLM’lerin istenmeyen düşünceleri işlemesini önlemek için alternatif yöntemler denemeleridir – Örneğin, kullanıcı düzeyinde sistem sorguları, uzun süreli bellek depolama veya hedefi korurken negatif ifadelemeyi tránh eden tekrarlı sorgu şablonları.

Pratikte, bu yöntemlerin hiçbiri çok etkili değildir, ayrıca Gemini Flash gibi en iyi performans gösteren LLM’lerin siyah kutu doğası, alınan test sonuçlarından çözümler elde etmeyi zorlaştırır.

Belki de, bu sorunun altında yatan mimari problemi anlamak için daha büyük ipuçları, neden Çin modellerinin bu tek zorlu yönünde genellikle çok daha iyi performans gösterdiklerini incelemekten gelebilir.

 

* İtalyanca gibi beberapa Romance dilinde yerleşik bir form.

ChatGPT-4o bile artık bu hatayı yapmaz.

†† Kaynak makale, birkaç tablo ve şekil yanlış atıfta bulunur. Bir noktada metin, tablo 1’in (testlerde kullanılan LLM’lerin sadece bir listesi) temel sonuçları içerdiğini belirtir. Bu durumlarda, doğru figürlerin veya tabloların neler olabileceğini tahmin etmek zorunda kaldım ve yazarlar tarafından düzeltilmeye açık olduğumu beyan ediyorum.

††† Yazarların inline alıntıları için hyperlinklerin yerine koymamdır.

İlk olarak 3 Şubat 2026 Salı günü yayımlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai