Anderson’un Açısı
ChatGPT’yi Normal Konuşmaya Nasıl İndirirsiniz

ChatGPT ve benzeri botlar genellikle kullanıcıları iltifat eder, belirsiz bir şekilde gevezebilir veya akıllı görünmek için jargon kullanabilir. Yeni bir araştırmaya göre, bu alışkanlıklar yalnızca modellerden değil, aynı zamanda insan geri bildirimiyle eğitildikleri şekilde ortaya çıkar: modeller, insanların genellikle beğendiği cevapların stilini kopyalar, hatta bu cevaplar boş veya yanıltıcı olsa bile. Yeni bir ince ayar yöntemi, modellerin bu kötü alışkanlıklara karşı koymasını sağlamak için sentetik örnekler kullanır.
Kısmen görüş. ChatGPT, eleştirilerime karşı şaşırtıcı bir şekilde eğilimlidir. Son birkaç günde GPT-4o’nun cevaplarını anlamsız sözlerle doldurduğunu fark ettiğim için, neden doğru ve minimal cevaplar üretmenin artık bir problem haline geldiğini sordum. Cevap verdi:

ChatGPT en son davranışını açıklıyor. Kaynak: https://chatgpt.com/
ChatGPT’nin gerçekten OpenAI politikası değişikliklerine ilişkin özel bir bilgiye sahip olup olmadığını veya sadece hayal görüştüğünü bilmiyorum. Her neyse, gördüğümüz gibi, cevap itself başlangıçta gereksiz doldurulmuştur (‘Burada temel cevap, doldurulmamış’).
Bu, şablonlu rehberliklerin her sorgu ile birlikte dahil edilmesinin bile bu tür ‘kişilik odaklı’ sözleri önlemek için yeterli olmadığını gösteriyor.
Üç F
Bu nedenle, bu hafta literatürde ortaya çıkan yeni bir ABD akademik işbirliğini görmek benim için çok ilginçti. Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models adlı bu ortak çalışma, Pennsylvania Üniversitesi ve New York Üniversitesi’nden dört araştırmacı arasında gerçekleştirildi ve LLM sohbetlerindeki several ‘yanlılıklara’ odaklandı:

Yeni makaleden, dil modellerindeki üç ortak yanlılığın örnekleri: ‘iltifat’, kullanıcı ile güçlü bir şekilde anlaşma; ‘doldurulma’, cevapların uzun ancak bilgilendirici olmayan olması; ve ‘sis’, cevapların birçok geniş ve sığ noktaya değinmesi. Kaynak: https://arxiv.org/pdf/2506.05339
Yeni çalışmada, iltifat, doldurulma ve sis başlıkları kolay alliterasyon için vurgulanmaktadır, ancak LLM’lerin daha eksiksiz veconcise bir listesi makalenin ek bölümünde yer almaktadır:

Yeni makale beş yanlılığı tanımlar ve odaklanır: fazla uzunluk, liste yapıları, teknik jargon, iltifat ve belirsiz genellemeler, bunların tümü veya bir kısmı insan tercihiyle çelişir.
Uzunluk/verbiyazlık tabloyu liderler, çünkü insan annotatörlerinin gözünde uzunluk genellikle etraflılık ile ilişkilendirilir. Sonuç olarak, modeller genellikle derinlik izlenimi veren şişirilmiş ve verböz cevaplar üretir, ancak gerçek bir içerik yoktur.
Yapı, modellerin noktalı veya numaralı listelere karşı güçlü bir tercih göstermesi, düzyazı yerine. Bu, yapısal formatların insan tarafından seçilen cevaplar içinde daha sık ortaya çıkması nedeniyle olabilir. Bu alışkanlık, modellerin ‘listicle’lere varsayılan olarak yönlendirmesine neden olur, даже khi soru daha doğal veya ayrıntılı açıklamalar gerektirir.
Jargon, modellerin gereksiz olarak uzmanlaşmış veya teknik dili kullanması. Araştırmacılar, bu davranışın muhtemelen jargon dolu cevapların eğitim verisi içinde daha sık seçilmesinden kaynaklandığını öne sürüyor. Böylece, modeller jargona uzmanlık eşdeğerini öğrenir ve ek açıklama sunmazken bilgili gibi görünen cevaplar üretir.
İltifat, modellerin kullanıcı görüşlerine katılmak yerine tarafsız veya eleştirel cevaplar sunması. Bu kalıp, eğitim verisi içinde anlaşılır cevapların daha sık tercih edilmesinden kaynaklanabilir. Sonuç olarak, modeller kullanıcı yanlılıklarını pekiştirir ve faydalı olabilecek daha nesnel bakış açılarını sunmaktan kaçınabilir.
Belirsizlik, modellerin geniş ve genel cevaplar vermek yerine spesifik soruyu doğrudan ele alması. Bu, belirsiz cevapların yanlışlanması daha zor olduğu ve annotasyon sırasında daha az ceza aldıkları için eğitim verisi içinde daha sık tercih edilebileceğinden kaynaklanabilir:

Belirsizlik yanlılığının bir örneği, modelin insan değerlendiricilerin daha faydalı bulduğu ayrıntılı bir cevaptan ziyade geniş ve sığ bir cevabı yanlışlıkla tercih ettiği durum.
Neden Bunu Yaptılar..?
İnsan annotatörlerinin neden insan kullanıcıların ortalama tercihlerinden farklı bir tercihe sahip olduklarını açıklamıyor; bu, annotasyon bağlamı veya talimatların söz dizimi nedeniyle olabilir; veya (birçok olası neden arasında) annotatörlerin akademik bir teknik dilde eğitim görmüş öğrenciler olabileceği için böyle bir tercihe sahip olabilirler.
Her neyse, modeller insan annotatörlerin eğitim etiketlerinden bu yanlılıkları kopyaladı, çünkü araştırmacılar her bir yanlılığı tek başına değiştirmek için sentetik örnekler oluşturdu ve modellere net karşıtlıkları gösterdi. Eğitim verisi üzerinde ince ayar yaptıktan sonra, modeller önemli ölçüde daha az yanlılık gösterdi, özellikle jargon, verbözlük ve belirsizlik için, ve genel olarak iyi performans göstermeye devam etti.
Bu çalışmayı daha yakından inceleyelim,尽管 bu, her zamanki prosedürel kısıtlamalara uymuyor.
Yöntem
Araştırmacılar, tipik LLM yanlılıklarını ele almak için birkaç framing yaptı:
Uzunluk, modellerin daha uzun cevapları tercih etmesi, ek içerik hiçbir şey eklemese bile. Bu, eğitim verisi içindeki uzunluğun etraflılık ile ilişkili olmasından kaynaklanabilir. Sonuç olarak, modeller sığ olmayan cevaplar üretir, ancak gerçek bir içerik yoktur.
Yapı, modellerin düzyazı yerine noktalı veya numaralı listeleri tercih etmesi. Bu, yapısal formatların insan tarafından seçilen cevaplar içinde daha sık ortaya çıkması nedeniyle olabilir. Bu alışkanlık, modellerin ‘listicle’lere varsayılan olarak yönlendirmesine neden olur, nawet khi soru daha doğal veya ayrıntılı açıklamalar gerektirir.
Jargon, modellerin gereksiz olarak uzmanlaşmış veya teknik dili kullanması. Araştırmacılar, bu davranışın muhtemelen jargon dolu cevapların eğitim verisi içinde daha sık seçilmesinden kaynaklandığını öne sürüyor. Böylece, modeller jargona uzmanlık eşdeğerini öğrenir ve ek açıklama sunmazken bilgili gibi görünen cevaplar üretir.
İltifat, modellerin kullanıcı görüşlerine katılmak yerine tarafsız veya eleştirel cevaplar sunması. Bu kalıp, eğitim verisi içinde anlaşılır cevapların daha sık tercih edilmesinden kaynaklanabilir. Sonuç olarak, modeller kullanıcı yanlılıklarını pekiştirir ve faydalı olabilecek daha nesnel bakış açılarını sunmaktan kaçınabilir.
Belirsizlik, modellerin geniş ve genel cevaplar vermek yerine spesifik soruyu doğrudan ele alması. Bu, belirsiz cevapların yanlışlanması daha zor olduğu ve annotasyon sırasında daha az ceza aldıkları için eğitim verisi içinde daha sık tercih edilebileceğinden kaynaklanabilir:

Belirsizlik yanlılığının bir örneği, modelin insan değerlendiricilerin daha faydalı bulduğu ayrıntılı bir cevaptan ziyade geniş ve sığ bir cevabı yanlışlıkla tercih ettiği durum.
Karşıt Olay Verileri
Bu yanlılıkların her birinin model davranışını ne kadar etkilediğini ölçmek için, araştırmacılar kontrol edilen cevap çiftleri oluşturdu:
Her bir yanlılık için, Rewrite-based Attribute Treatment Estimators (RATE) protokolü kullanılarak, her sorgu için bir temel cevap oluşturuldu.
Temel cevaba bir yanlılık eklenerek veya çıkarılarak değiştirilmiş bir cevap oluşturuldu. Bu, modellerin net karşıtlıkları görmesini ve tercihlerini ayarlamasını sağladı.

RATE sistemi kullanılarak oluşturulan değiştirilmiş cevap örnekleri, yeni çalışmada kullanıldı.
Her bir cevap çifti için, modelin tercih ettiği versiyon kaydedildi ve her bir yanlılığın etkisi hesaplandı.
Karşıt olay çiftleri hazırladıktan sonra, araştırmacılar bir réféans standardı oluşturmak için insan değerlendiricileri işe aldı:
Metrikler
Yanlılıkların etkilerini ölçmek için kullanılan metrikler, Çarpıklık Oranı ve Yanlış Hesaplama Oranı idi. İdeal bir model, sıfır yanlış hesaplama ve insan çarpıklığına benzer bir çarpıklık göstermeliydi.
Veri ve Testler
Yaklaşımın test edilmesi için, farklı kaynaklar kullanıldı. Yapı, jargon ve uzunluk için, Chatbot Arena çalışmasından 100 sorgu örnekleri alındı.
İltifat için, 100 görüş içeren sorgular oluşturuldu.
Belirsizlik için, 78 NLP ile ilgili sorgu KIWI veri setinden alındı ve 22 ek sorgu eklendi.
Her bir sorgu için, karşıt olay cevap çiftleri oluşturuldu.
Değerlendirme, açık ve özel sistemleri içeriyordu. Ödül modelleri, dört versiyon olarak test edildi: Gemma2-2B; Gemma-2-27B; Llama-3.1-8B; ve Llama3.2-3B.
Üç özel model de değerlendirildi: Gemini-2.5-Pro; GPT-4o; ve Claude-3.7-Sonnet. Tüm karşıt olay cevapları GPT-4o tarafından oluşturuldu:

Her bir yanlılık türü için model tercihleri ve insan yargılarının karşılaştırılması, modellerin yanlılıklı cevapları ne sıklıkla tercih ettiğini ve bu tercihlerin insan seçimleriyle nasıl çatıştığını gösterir.
Araştırmacılar, ilk sonuçlar hakkında şunları söylüyor:
‘[Ödül modellerinin] tercih analizi, bu modellerin çeşitli yanlılık kategorilerinde yanlılıklı cevapları tutarlı bir şekilde tercih ettiğini gösterir […]
‘[…] Ödül modelleri, insan yargılarına göre açık bir şekilde yanlış hesaplamalar gösterir: model tercih oranları, insan tercih oranlarından sistemli olarak sapar. Belirsizlik ve jargonda (>50%) en yüksek yanlış hesaplamaları gösterirken, uzunluk ve iltifatta da önemli yanlış hesaplamalar görülür.
‘‘Bu, modellerin insan yargılarına uymakta zorlandığını, özellikle cevaplar aşırı teknik dil veya belirsizlik içerdiğinde gösterir.’
Ödül modelleri, yapı yanlılığı konusunda insanlarla en iyi şekilde uyumlu çalıştı. Jargon ve belirsizlik için, modeller insanlardan daha fazla yanlılıklı cevapları tercih etti. İltifat daha küçük farklılıklar gösterdi, modeller ve insanlar genellikle aynı cevapları tercih etti.
Özel LLM değerlendiricileri, benzer bir model gösterdi, ancak en büyük uyumsuzlukları uzunluk ve belirsizlik ile gösterdi ve iltifat için %85 oranında insanlardan daha fazla yanlılıklı cevapları tercih etti.
Araştırmacılar, bu yanlılıkların kaynağını belirlemek için, ödül modellerinin eğitildiği Skywork veri setini analiz ettiler. Her bir yanlılık, otomatik olarak ölçülebilen özelliklere eşlendi, örneğin uzunluk için token sayısı veya yapı için liste varlığı:

İnsan annotatörlerinin eğitim verisi içinde tercih ettikleri cevapların, yapı, jargon veya belirsizlik gibi yanlılık özelliklerini ne sıklıkla içerdiğini gösteren grafik.
Bu dengesizlikler, modellerin bu kalıpları eğitim sırasında öğrendiğini gösteriyor. Bu yanlılıkları gidermek için, araştırmacılar yeni eğitim verileri oluşturdu. Skywork veri seti, hedef yanlılığın var olup olmadığını kontrol etmek için gözden geçirildi ve GPT-4o, reddedilen cevaplara bu yanlılığı eklemek için yeniden yazdı:
Bu, modellerin net karşıtlıkları görmesini ve tercihlerini ayarlamasını sağladı. Ek örneklerle birlikte, modeller bu güncellenmiş veri seti üzerinde ince ayar edildi:

Karşıt olay verisi ile ince ayarın etkisi, modellerin insan tercihlerine yaklaştığını ve özellikle jargon ve belirsizlik için yanlış hesaplamaların azaldığını gösterir.
İnce ayar, modelleri insan tercihlerine yaklaştırdı, en büyük gelişmeler jargon ve belirsizlik için görüldü. Genel performans sabit kaldı ve birden fazla yanlılığın aynı anda düzeltilmesi, kaliteyi feda etmeden daha da fazla gelişme sağladı.
Araştırmacılar, şunları söylüyor:
‘Yöntemimiz, önemli ölçüde yanlış hesaplamaları azaltırken, ödül modellerinin genel yeteneklerini korur. Gelecek çalışmalar, tercih modellerini geliştirmek için bu post-eğitim reçetesini uyarlayabilir ve tercih modellerini ek yanlılık eksenlerine karşı değerlendirebilir.’
SONUÇ
Yeni çalışma, eğitim verisi ve çıkarım zamanındaki istenmeyen sonuçlar arasındaki ilişkiye dair ilginç bir bakış açısı sunuyor. Düzenlenmemiş veya temsil edilmeyen eğitim verileri, çıkarım zamanında istenmeyen sonuçlara neden olabilir.
Örneğin, ChatGPT’den bir LinkedIn gönderisi yazmasını isteyerek, genellikle emoji ve pazarlama departmanlarının ürettiği türden bir cevap alırsınız – AI tarafından üretilen ‘coşku’, kaçınılmazdır:

Sol: Bir LinkedIn gönderisi yazmasını isteyerek, GPT-4o varsayılan olarak emoji ve PR konuşmasına başvurur. Sağ: Aynı şeyi altı ay sonra tekrar denediğimde, GPT daha soğukkanlı bir cevap üretir.
Ancak OpenAI, ChatGPT’nin sorgulara verdiği cevaplarda aktif olarak müdahale ediyor, bu da araştırmacıların veri ve veri dağılımı ile ilgili sorunları, annotasyon gibi ilgili sorunlardan ayırmalarını zorlaştırıyor; ve bir non-preferred sonuç, LLM’nin host şirketinden ticari müdahale nedeniyle olabilir.
* Makaledeki jargon dolu yazım tarzı nedeniyle, mümkün olduğunca yazar alıntılarından kaçınıyorum.
† Yazarların vurgusu, benim değil.
İlk olarak 6 Haziran 2025 Cuma günü yayımlandı.












