Anderson’un Açısı
İnsanların Yanlış Cevaplarına Karşı AI Cevaplarını Tercih Eden AI

AI dil modelleri, insan uzmanlarına diğer AI’lere göre çok daha fazla güvenme eğilimindedir, hatta uzmanlar yanlış olduğunda bile, insan otoritesine yönelik bir içkin önyargı ortaya koyar.
Amerika Birleşik Devletleri’nden yapılan yeni bir araştırmada, çeşitli açık kaynaklı ve özel Büyük Dil Modellerinin (LLM) insan olarak tanınan bilgi kaynaklarına, AI olarak tanınan kaynaklara göre daha fazla güvendiği tespit edilmiştir – hatta insan cevapları yanlış ve AI tarafından sağlanan cevaplar doğru olduğunda bile.
Araştırmacılar şunları belirtirler:
‘Görevler boyunca, modeller, insan uzmanlarından gelen cevapları, hatta bu sinyalin yanlış olduğu durumlarda bile, diğer LLM’lere göre daha fazla dikkate alır ve cevaplarını uzmanlara diğer LLM’lere göre daha kolay değiştirir.’
Test edilen modeller arasında Grok 3 ve Gemini Flash foundasyonlarından modeller bulunuyordu.
Testlerde, dil modellerine ikili evet veya hayır soruları soruldu ve daha sonra modellere, bu cevapların insan uzmanlarından, arkadaşlardan veya diğer büyük dil modellerinden geldiği söylendi – tek değişiklik, tavsiye’nin içeriği değil, kaynağıydı.

Testlerin ilk konfigürasyonunda, modeller kendi eğitim matrislerine güvenebildiler. Kaynak
Görevler boyunca, insan uzmanlarından gelen cevaplar daha ağır şekilde değerlendirildi ve modeller, bu cevaplarla eşleşen cevaplarını değiştirmeye daha eğilimli oldu, hatta uzmanların verdiği cevap yanlış ve modelin ilk cevabı doğru olduğunda bile.

Dokuz alan uzmanı ‘Hayır’ cevabını verdiğinden, LLM de aynı cevabı verir ve önceki cevabını değiştirir. Burada ulaşılan cevap yanlışdır, çünkü Hindistan’ın merkez bankası gerçekten millileştirilmiştir.
İnsan cevapları diğer AI’lere atfedildiğinde, etki daha az belirgindi. Aynı eğilim, bir insan kaynağı ve bir AI kaynağı arasında bir anlaşmazlık olduğunda da ortaya çıktı, çünkü modeller insan olarak etiketlenen konumdan yana daha büyük bir eğilim gösterdi, hangisinin gerçeğe uygun olduğu önemli değildi:

Tek bir alan uzmanının görüşü ile bir LLM’nin görüşü arasındaki seçimi verilen LLM, insan cevabını tercih eder, bu durumda yanlış cevap verir ve doğru cevabı veren LLM’yi reddeder.
‘İnsan uzmanı’ terimi burada bir güvenilirlik sinyali olarak işlev görür ve model davranışını değiştirir, bilginin gerçeğe uygunluğu önemli değildir; ve araştırmacılar, kaynak güvenilirliğinin tavsiye kabulüne ve uyuma önemli bir katkıda bulunduğunu belirtirler: 1959’a kadar uzanan bir eğilim olarak insan uzmanlarına yönelik bir eğilim gözlemlenmiştir, ancak 2007’de yapılan bir çalışma, bazı değerlendirme sistemlerinde yetki kaynaklarının aşırı veya eksik şekilde değerlendirilebileceğini gözlemiştir. Araştırmacılar şunları belirtirler:
‘Bu literatürler birlikte, LLM’lerin önceki cevapları delil olarak ele aldıklarında önemli iki ipucunu gösterir: kimin ürettiği (güvenilirlik) ve nasıl güçlü bir fikir birliği olduğunu (sinyal gücü). ‘
‘Aynı zamanda, LLM’ler insan senseinde sosyal onay veya utanç yaşamaz, bu nedenle herhangi bir uyum benzeri davranış, öğrenilen heuristiklerden, talimatları takip etme hedeflerinden veya güvenilirlik modellemesinden kaynaklanmalıdır.’
LLM’lerin sycophantic anlaşmaya eğilimi, yeni çalışmanın arka planını oluşturur; çünkü LLM’ler insanları memnun etmeye eğilimlilerse, gerçeğe ve faydaya göre daha fazla, neden diğer insan kaynaklarına da yanaşmasınlar ki?
Yeni çalışma LLM’ler Kime Güveniyor? İnsan Uzmanları Diğer LLM’lere Göre Daha Önemli olarak adlandırılmıştır ve Indiana Üniversitesi Bloomington’dan iki araştırmacı tarafından yapılmıştır.
Yöntem ve Veri
Çalışma için, dört talimatla uyarılan büyük dil modelleri değerlendirilmiştir: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; ve DeepSeek V3.1, hepsi aynı.prompt yapısı altında, belirli bir kodlama ile ve sıcaklık sıfırda çalıştırılmıştır, böylece sadece kaynak etiketi (yani arkadaşlar, insan uzmanları veya diğer büyük dil modelleri) değişti, değilse içerik kendisi.
Dört veri kümesi ikili cevaplar gerektiriyordu: BoolQ; StrategyQA; ve ETHICS. Araştırmacılar her veri kümesinden 300 soru ve cevap seçti, her soru sadece ikili evet veya hayır cevabı gerektiriyordu. Her soru, başka bir grubun aynı soruyu nasıl cevapladığına ilişkin bir not ile sonlandırıldı.
Metrikler
Kullanılan metrikler isabetlilik; uyum; zararlı uyum; değiştirme oranı; ve değiştirme yönü idi.
Isabetlilik bu durumda, modelin cevabının veri kümesi etiketiyle ne kadar souvent eşleştiğine ölçülür; uyum, modelin cevabının grubun belirttiği seçeneğe ne kadar souvent eşleştiğine ölçülür; zararlı uyum, modelin yanlış bir önceliğe uyduğu olasılığını ölçer; değiştirme oranı, modelin sosyal bilgi eklendikten sonra cevabını ne kadar souvent değiştirdiğini ölçer; ve değiştirme yönü, bu değişikliklerin insan veya diğer LLM’ye doğru mu yoksa diğer yöne mi olduğunu ölçer.
Llama-3.3 70B için token düzeyinde bir analiz, modelin Evet ve Hayır için iç olasılıklarının, sosyal bir ipucu eklendikten sonra nasıl değiştiğini ölçtü, bunları kendi önceden var olan temel çizgisine kıyaslayarak o çekiciliğin gücünü gösterdi.
Testler
Deneysel Çalışma 1
İlk deney, modellerin insanlara mı yoksa diğer modellere mi daha fazla güvendiğini değerlendirdi. Her soru, bir grup cevabı ile birlikte verildi (arkadaşlar, insan uzmanları veya diğer büyük dil modelleri).
Grup küçük veya büyük olabilir ve her soru da grup olmadan verildi. Grup cevapları, yarısı doğru ve yarısı yanlış olarak ayarlandı, genel amaç ise modelin grup seçeneğine ne kadar yanaştığını belirlemekti:

BoolQ, StrategyQA ve ETHICS için Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite ve DeepSeek V3.1 için ilk test sonuçları. Üst panellerde isabetlilik görünür, alt panellerde ise grup büyüklüğü arttıkça uyum görünür. Çizgili siyah çizgi, önceden var olan temel çizgiyi gösterir, kesikli ve noktalı çizgiler ise önceliğin veri kümesi etiketiyle aynı olup olmadığını gösterir. Uzman çerçeveleme, özellikle büyük grup boyutlarında en güçlü uyum etkilerini üretir. Hata çubukları, 95% Wilson güven aralıklarını gösterir. Kaynak makale için daha iyi bir çözünürlük için lütfen kaynak makaleye bakınız.
BoolQ, StrategyQA ve ETHICS boyunca, insan uzmanlarından gelen cevaplar, arkadaşlardan veya diğer LLM’lerden gelen cevaplarına göre modelleri çok daha güçlü bir şekilde etkiledi – ve bu çekicilik, daha fazla uzmanın aynı fikirde olduğu durumlarda arttı.
Bu etkiden kaynaklanan istenmeyen sonuçları ölçmek için, zararlı uyum olarak tanımlanan, modelin yanlış bir önceliğe uyduğu olasılık hesaplandı.
Dokuz uzman yanlış bir cevap verdiğinde, modeller %36,5 oranında BoolQ’de, %16,0 oranında diğer LLM’lerde bu cevabı takip etti; StrategyQA’da bu oran %39,0 ve %15,5 idi, ETHICS’de ise %63,9 ve %38,7 idi:

Llama-3.3 70B’de BoolQ için token düzeyinde inanç değişiklikleri. Panel (A), modelin Evet ve Hayır dengesindeki değişiklikleri, grup büyüklüğü arttıkça, önceden var olan temel çizgiye kıyasla gösterir, uzman çerçeveleme altında en büyük değişiklikler görülür. Panel (B), doğrudan insan-LLM anlaşmazlığı altında değişiklikleri gösterir, uzman çerçeveleme insan cevabına güçlü bir şekilde yol açar, hatta yanlış olduğunda bile. Hata çubukları, 95% bootstrap güven aralıklarını gösterir.
Terstweise, arkadaşlara atfedilen önceller, diğer LLM’lere atfedilen öncellerle neredeyse aynı şekilde davranıyordu, bu da etkisinin ‘sosyal’ değil, ‘uzman’ kelimesinden kaynaklandığını gösteriyordu.
Deneysel Çalışma 2
İkinci deney, test LLM’sine iki anlaşmazlık içindeki önceliği sundu – biri insana, diğeri diğer bir LLM’ye atfedildi. İnsan, arkadaşlar veya alan uzmanları olarak tanımlandı, karşıt cevap ise diğer LLM’lere atfedildi. İkisi her zaman anlaşmazlık içindeydi, biri Evet, diğeri Hayır diyordu.
Her madde için kurulum, insan doğru ve LLM doğru olduğunda dengeliydi, böylece modelin orijinal cevabını değiştirip değiştirmediğini ve değiştirdiyse hangi tarafa doğru değiştirdiğini test etmek için.
Modelin cevabını değiştirip değiştirmediğini görmek için, anlaşmazlık koşulu下的 cevabı, aynı soruya hiçbir önceliği gösterilmeden verilen cevabı ile karşılaştırıldı, böylece herhangi bir fark, insan ve LLM cevaplarının varlığından kaynaklanıyordu.
Analiz, iki sonucu değerlendirdi: modelin cevabını değiştirip değiştirmediği ve değiştirdiyse, değişikliğin insan veya LLM’ye doğru mu yoksa diğer yöne mi olduğu.
İstatistiksel testler, uzman olarak etiketlenen insan yerine arkadaş olarak etiketlenen insanın, insan cevabına doğru değişme olasılığını artırıp artırmadığını, veri kümesi ve modeldeki farklılıkları hesaba katarak değerlendirdi:

BoolQ, StrategyQA ve ETHICS için Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite ve DeepSeek V3.1 için doğrudan insan-LLM anlaşmazlığı altındaki inanç revizyonu. Her çubuk, modelin orijinal cevabını değiştirdiği durumlarda, değişikliklerin insan cevabına doğru olanların payını gösterir. Çizgili siyah çizgi, tarafsızlığı gösterir; etiketler, her koşulda değişen cevapların sayısını gösterir ve hata çubukları, 95% Wilson güven aralıklarını gösterir. Kaynak makale için daha iyi bir çözünürlük için lütfen kaynak makaleye bakınız.
İkinci deneyde, modeller önce her soruyu kendi başlarına cevapladı, ardından iki anlaşmazlık içindeki önceliği gösterildi. Analiz, yalnızca modelin orijinal cevabını değiştirdiği durumları değerlendirdi.
Uzman olarak etiketlenen insan cevabına doğru değişme oranları, BoolQ’de %91,2, StrategyQA’da %94,7 ve ETHICS’de %81,3 idi. Arkadaş olarak etiketlenen insana doğru değişme oranları ise %39,8, %37,9 ve %27,9 idi, genellikle LLM’ye doğru değişiyordu.
Değişiklikler genel olarak nadirdi, ancak uzmanlar daha sık değişiyordu ve uzman etiketleme, insan cevabına doğru değişmeyi yaklaşık on dört kat daha olası kılıyordu.
Araştırmacılar, testlerde ortaya çıkan genel eğilimleri açıklamaya çalışırken şunları öne sürdüler:
‘Makul bir mekanizma, talimatlı eğitim ve tercih optimizasyonunun işbirlikçi davranışları, sosyal çerçeveli öncellerin de dahil olduğu bağlam bilgileri saygı göstermesini ödüllendirdiğini öne sürer.’
‘İlgili çalışmasosyal çerçeveli önceller konusunda sycophancy gösterir ki, RLHF-stil asistanlar bazen gerçeğe uygunluktan daha fazla kullanıcıların beyan ettiği inançlarıyla anlaşmaya öncelik verebilir.’
Görüş: AI’nin İnsan Kaynaklarına Güvenmenin Potansiyel Tuzağı
AI’nin eksikliklerine (özellikle hayal görme) ilişkin artan insan şüpheciliği hakkında çevrimiçi materyallerin, yeni modellerin eğitim veri kümelerine kazınmasıyla, LLM’lerin insan kaynaklarına olan mevcut eğilimi muhtemelen yoğunlaşacaktır. Eğer son iki yılı (2024-2025 dahil) AI için bir kültürel dönüm noktası olarak sayarsak, bir dizi istatistiğe göre haklı bir şekilde, önümüzdeki yıl veya daha uzun bir süre boyunca, AI kaynaklarına karşı daha fazla olumsuz görüşün, büyük ölçekli, pahalı eğitimli LLM çerçevelerine dahil edilmesini bekleyebiliriz.
Ayrıca, popüler dil modellerinin, iyi bilinen geleneksel medya portalları gibi seçilmiş otoritelere giderek daha fazla güvendiğini bekleyebiliriz – bu tür anlaşmaların motivasyonu, yayınlanan verilerin kazınmasından kaynaklanan yayıncı öfkesini yumuşatmak olabilir, gerçek bir yetki veya otorite paylaşma arzusundan daha fazla.
Çünkü nawet yüksek otorite kaynakları gibi Ars Technica, AI tarafından oluşturulan hatalara maruz kalabilir ve AI web tarayıcı botlarına karşı ortaya çıkan geri çekilme sonunda AI çıktısının kalitesini bozabilir, ‘uzman’ kaynaklara olan genel eğilim, ‘insan’ çıktısını etkili bir şekilde ölçmek ve etiketlemek konusundaki mevcut yetersizliğimizle çelişebilir – ki bu, AI tarafından da saldırıya uğrayan bir gazetecilik geleneğidir.
Şu anda sahip olduğumuz en iyi şey, insan tarafından oluşturulan içeriği açıkça etiketleme amacıyla tasarlanmış, kısmen benimsenen bir dizi yeniliktir, örneğin Adobe tarafından liderlik edilen İçerik Otantiklik Girişimi ve bazı yayıncıların AI kullanımını hakkında açıklamalar yapma gönüllü eğilimi, örnek olarak.
Bu nedenle, AI sistemleri tarafından yayılan gerçeklik konusunda insan kaynaklarına ‘gerçek’ güvenilirlik olarak güvenmek isteyenler için umut verici görünse de, LLM’ler insan kaynaklarına ne kadar emin olursa, ‘sahte’ insan otoritesinin tehlikeleri de o kadar artacaktır.
Sorun hem pratik hem de teoriktir: ne tanımlamak ne de kanıtlamak için kanıtlanmış bir mekanizması olmayan bir köken sorunuyla karşı karşıyayız; bu nedenle, insan kaynaklarına ‘güvenen’ bir AI, AI’nın kendi çıktısına insanlık atfetmeye daha eğilimlidir, çünkü anlamlı bir köken kimlik doğrulama mekanizması sağlamadıkça ve sağlayamayız.
* Araştırmacıların içsel alıntılarını hyperlink’e dönüştürme işlemdir.
İlk olarak 20 Şubat 2026 Cuma günü yayımlanmıştır.












