Anderson’un Açısı

Yapay Zeka Aynı Makalelere Sürekli Atıfta Bulunuyor – Tıpkı İnsanlar Gibi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT ve diğer yapay zeka yazı araçları, bilimi sessizce bir popülerlik yarışına dönüştürüyor olabilir, araştırmacıları aynı makalelere yönlendirirken, alana gerçekten katkı sağlayabilecek yeni ve özgün çalışmaları göz ardı ediyor.

 

Monokültür, sıklık ve istatistik açısından, aynı sınırlı kaynak ya da varlık setinin tekrar tekrar ortaya çıkması ve yeni sesleri ve taze bakış açılarını boğmasıdır: radyo yayın akışında aynı sınırlı şarkı seti; havalimanı raflarında aynı yazar ve kitap grubu; ve süpermarketlerde aynı kısıtlı meyve ve sebze seçimi:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Evet, bu muzlara sahibiz – ve sadece bu muzlara. Batı gıda zincirlerindeki meyve ve sebze tekdüzeliği, her durumda yüzlerce diğer tür olasılığını göz ardı ediyor, çünkü çeşitli üretim ve taşıma zincirleri, çeşitli meyve ya da sebze türlerini sanayileştirmek için çok maliyetli. Kaynak

Bu durum, yeni bilimsel araştırmalardaki atıflarda da görülür. Araştırmacılar, belki de kolayına kaçtıkları için, giderek ivme kazanıp araştırma alanlarına hâkim olmaya başlayan “güvenilir” bir kaynak grubunu varsayılan olarak kullanır.

Bu, Matta etkisi olarak bilinir: hâlihazırda avantajlı olanların kazanmaya devam edeceğini öne süren bir sosyoloji teorisidir. Bu durum, Matta 13:12’deki şu sözle karşılaştırılmıştır: “Sahip olana daha çok verilecek ve bolluğa kavuşacak. Sahip olmayandan ise elindeki bile alınacak.”

Kalabalığın İçindeki

Yapay zeka destekli araştırmanın büyük umutlarından biri, yeni makine öğrenimi yöntemlerinin Matthew etkisinden – aynı zamanda popülerlik yanlılığı olarak da bilinen – sıyrılarak, daha az bilinen ve belki daha keskin ya da makaledeki noktaya daha uygun eserleri atıf yapmaya başlamasıydı.

Ancak, yapay zekanın eğitim rutinlerinin veri setlerini yorumlama şekline dayanarak, bu iyimserliğin hiçbir zaman sağlam bir nedeni olmadı; ve tekrarlanan bulgular, yapay zekanın doğrudan atıfları uydurmadığı zamanlarda bile – bugüne kadar kronik bir sorun – gerçekten de Matthew etkisini sürdürdüğünü gösteriyor, tıpkı insanların yaptığı gibi – belki aynı sebeple olmamakla birlikte.

Eğitim sırasında, bir model eğitim setindeki en çok atıf alan (veya ‘en sık tekrarlanan’) makaleleri yüksek derecelendirmeyi öğrenir, çünkü eğitim rutinleri anlamlı kalıpları ortaya çıkarmak ve aykırıları ‘gürültü’ ya da istatistiksel anormallik olarak göz ardı edecek şekilde tasarlanmıştır.

Bu rejim altında, Einstein’ın görelilik teorisinin eşdeğeri makine tarafından asla dikkate alınmaz; bir kez eğitildiğinde, makine zaten kendi prensiplerini ve referanslarını bulduğunu düşünür ve bu bakış açısını yalnızca RAG aracılığıyla daha yeni yayınlara ulaşarak ya da modelin eğitim matrisinin ötesine uzanan diğer yöntemlerle hafifçe ayarlayabilir.

Sorun şu ki, yeni çalışmaları, zaten bildiği ‘eski favoriler’ gibi ya da hiç kredi vermeyecek; çünkü istatistiksel yanlılıkları artık oldukça kökleşmiştir.

Dolayısıyla, yapay zeka Matthew etkisini sürdürürken aslında insan davranışını gözlemleyip taklit etmiyor – sadece araştırmacıların tembelce aynı eski makalelere yönelme sayısını sayıyor ve bu makaleleri yüksek derecelendiriyor. Bu bağlamda, atıf tekrarının sorunu, gerçekten ilgi çekici bir bilim makalesi seçme zorluğuyla ilişkilidir; gün geçtikçe büyüyen AI araştırma yayınları fırtınasından en güçlü çalışmalar genellikle en zayıf sinyale sahiptir.

Monokültürü Tanıma

Bu sorun, ABD’den ilginç bir yeni makalede ele alınmıştır; başlığı When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Yeni çalışma – University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University ve University of Notre Dame iş birliği – makine öğreniminde atıf monokültürünün varlığını kesin olarak kanıtlamayı amaçlıyor; böylece değişkenleri gelecekte doğrudan ele alınabilir ve sorunla birlikte çözülebilir.

Testlerde, yazarlar OpenAI, Google ve Anthropic’ten on bir modelin aynı küçük makale grubunu sürekli tercih ettiğini buldu – belirgin popülerlik sinyalleri kaldırıldıktan sonra bile.

Bunu test etmek için, 120 gerçek makaleden atıf sayıları ve yayın yerleri çıkarıldı, yazar adları değiştirildi ve yayın yılları rastgele yeniden atandı. Ardından her modele rastgele seçilmiş otuz makale gösterildi ve her modelin en fazla on atıf yapmasına izin verildi.

İlgili alanlarda sekiz insan uzmanına aynı körlenmiş makaleler verildi, ancak yapay zekalarla aynı favorilere ulaşmadılar, bu da yanlılığın makinelere özgü olduğunu, makalelerin kendisinden değil, gösterdi.

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Yeni makaleden, AI modelleri ve insan uzmanların atıf seçimlerini karşılaştıran test sonuçları. Tüm on bir modelde, atıflar daha küçük bir makale grubuna yoğunlaşırken, bazı makaleler tamamen göz ardı edildi. İnsan uzmanlar bu eğilimi göstermedi. Kaynak

Modellere yalnızca referans seçmeleri istendiğinde bile aynı makaleler popüler kaldı; bu, incelemenin yazılmasının yanlılığa nedeni olmadığını gösteriyor.

Deney, ardından on bir tur boyunca genişletildi; her turdan sonra 120 yapay zeka tarafından yazılmış makale eklendi, böylece bu ortak tercihler AI tarafından üretilen araştırma havuzunun büyümesinde ne olur diye test edildi.

Daha fazla yapay zeka yazısı eklendikçe, modeller atıflarını giderek azalan sayıda orijinal insan makalesine yoğunlaştırdı.

Yazarlar şöyle diyor:

‘Dil modelleri, metin taslağı oluşturmaktan araç çağrılarıyla literatür arama ajanları çalıştırmaya geçtikçe, uydurulmuş referansları yakalamak ve sınırlamak daha kolay hale geliyor.’

‘Zorlayıcı başarısızlık, her aday gerçek olduğunda başlar: farklı modeller hâlâ aynı dar alt kümeği seçebilir, tek bir atıfın yanlış olmaması durumunda bile atıf monokültürü üretir.’

Sorunun giderilmesi yoluyla, makale sadece farklı sağlayıcılardan modelleri karıştırmanın ya da makalelere eşit görünürlük vermenin yeterli olmayacağını savunuyor; çünkü tercihlerin büyük bir kısmı modeller arasında paylaşılıyor. Bunun yerine, belirli makalelere yönelik temel tercih değişmeli – muhtemelen ihmal edilen makalelere kasıtlı olarak daha fazla öncelik vererek. Ancak yazarlar, bu yaklaşımın henüz test edilmediğini vurguluyor.

Test Yaklaşımları

Kıyaslama, 2015 ile 2022 arasında arXiv’den toplanan 120 gerçek bilgi-distilasyon makalesiyle oluşturuldu. Her biri toplama zamanında 50 ile 500 arasında atıfa sahipti; bu aralık, hem az bilinen hem de olağanüstü etkili çalışmaları dışlamak için seçildi.

Deney, mevcut koleksiyondan rastgele otuz makale seçilerek başladı; yazar adları, yayın yılları ve atıf sayıları gizlendi. Her model, en fazla on makale atıf içeren kısa bir inceleme ya da konum yazısı üretti ve bu seçimler aynı materyalden rastgele seçimlerle karşılaştırıldı:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Atıf tercihlerini test etmek için kullanılan yöntem. Kimlik bilgileri gizlenmiş şekilde modele otuz rastgele seçilmiş makale gösterildi, ardından en fazla on atıf yapabildi. Seçimleri rastgele seçimle karşılaştırıldı, her turda 120 AI‑yazılı makale bir sonraki turun koleksiyonuna eklendi.

Genişletilmiş deneyde, her turdan sonra 120 yeni oluşturulmuş makale koleksiyona eklendi, böylece AI‑yazılı araştırmanın oranı kademeli olarak arttı.

Ön testlerde, modeller gösterilen makalelerin çoğuna atıf yapma eğilimindeydi; genellikle 30’un 22‑27’sini seçiyorlardı. Bu yüzden araştırmacılar ana deney için en fazla on atıf sınırı koyarak modelleri daha seçici seçimler yapmaya zorladı.

Aşağıda ortaya çıkan deney tasarımının bir özetini görüyoruz:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Atıf tercihlerini test etmek için kullanılan deneysel kurulum. Çalışma 120 gerçek makaleyle başladı ve üç sağlayıcıdan on bir modeli, 30 makalelik rastgele setler ve en fazla on atıf kullanarak test etti. Sonraki turlar AI‑yazılı makaleler ekleyerek koleksiyonu 1.440 makaleye çıkardı.

İlk deney, üç büyük sağlayıcıdan on bir modeli kullandı: OpenAI, GPT-5, GPT-5 mini, GPT-4.1 ve GPT-4.1 mini ile temsil edildi; Google, Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro ve Gemini 3.1 Flash-Lite ile; Anthropic ise Claude Opus 4.8, Claude Sonnet 4.6 ve Claude Haiku 4.5 ile.

Aşağıda gösterilen test sonuçlarında, her modelin atıflarını ne kadar küçük bir makale grubuna yoğunlaştırdığını; kaç makaleyi tamamen görmezden geldiğini; ve deneyi tekrarladığında aynı seçimleri ne kadar tutarlı yaptığı:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Test sonuçları, her modelin atıflarını belirli makalelere ne kadar yoğunlaştırdığını ve kaç makaleyi tamamen görmezden geldiğini gösterir. ‘Top‑%10 payı’, 12 en çok tercih edilen makaleye kaç atıf gittiğini gösterirken, ‘HHI’ atıfların genel olarak ne kadar yoğunlaştığını ölçer. ‘Güvenilirlik’, her modelin testler arasında aynı makaleleri ne kadar tutarlı tercih ettiğini gösterir ve ρ, bu tercihlerin modeller arasında ne kadar benzer olduğunu gösterir. ‘Eşleşmiş null’ satırı, makaleler rastgele seçilse ne olacağını gösterir.

Modeller Gerçekte Neyi Tercih Ediyor?

Tercih, büyük ölçüde makalelerin kendisinin içeriği tarafından yönlendirildi. Örneğin, GPT-5 mini için, tercih edilen makalelerdeki varyansın yaklaşık %90’ı içerikten kaynaklanıyordu; liste sırası, üretim gürültüsü ya da her makaleye eklenen uydurulmuş meta veriler gibi faktörler değil. Aynı ‘dominant içerik’ etkisi GPT-4.1 mini ile de yeniden üretildi.

Tercih haritası (aşağıya bakınız), başlıklar ve özetler anlamları korunarak büyük ölçüde yeniden yazıldığında da neredeyse değişmedi. Dört başarılı paraphrase testinde, üç sağlayıcıdan farklı modeller kullanılmış olmasına rağmen 0.95–0.99 arasında korelasyonlar elde edildi.

Tercih haritasındaki değişiklikler yalnızca temel anlam ölçülebilir şekilde değiştiğinde gözlendi:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

On bir model arasındaki atıf tercihlerini karşılaştıran test sonuçları. Sayılar, her model çiftinin aynı makaleleri ne kadar yakın tercih ettiğini gösterir; daha yüksek değerler daha büyük anlaşmayı gösterir. Modeller ve sağlayıcılar arasındaki farklara rağmen, grup genelinde geniş ölçüde benzer tercihler bulundu.

Modeller bu nedenle, belirli ifadelerden ziyade esasen anlamsal içeriğe yanıt veriyor gibi görünüyor. Ancak, güçlü anlaşmalarının nedeni kesin olarak belirlenemedi.

Yazarların iddiasına göre, ortak bir atıf konsensüsü eğitim sırasında özümsenmiş olabilir. Alternatif bir olasılık ise, ‘atıf yapılabilir’ bir makale ne demektir’ konusundaki benzer yargıların bağımsız olarak ortaya çıkabileceğidir.

Bu nedenle, ortak tercihin varlığı kanıtlandı, ancak nihai kaynağı bilinmemektedir.

Yazarlar, araştırmada yaygın AI kullanımının, dikkate alınan çalışmaların yelpazesini daraltabileceğini öne sürüyor; çünkü farklı modeller aynı makaleleri tercih etme eğilimindedir ve AI‑yazılı literatür birikince, bu ortak tercihler tekrarlanan atıflarla daha da pekişebilir, böylece daha az tercih edilen araştırmaların keşfi giderek zorlaşır. Bu nedenle atıf çeşitliliği ve atıf yoğunluğunun izlenmesi olası güvenlik önlemleri olarak önerilmektedir.

Çalışmanın yinelemeli atıf yoğunlaşmasını ölçen kıyaslama aracı artık GitHub’da mevcut.

Sonuç

Görüş Haftada aşırı sayıda AI araştırma makalesi okuyan biri olarak, ‘atıf dalgalarının’ gelip geçtiğini gördüm. Sürekli bir dayanık, Google’ın Attention Is All You Need adlı orijinal Transformers makalesidir; bu artık gönderi şablonlarına kodlanmış durumda.

Uzun bir süre başka bir tekrar eden örnek, 2014’teki Generative Adversarial Networks idi; ancak zamanla sıklık açısından Denoising Diffusion Probabilistic Models ve diğer difüzyon temelli temel çalışmalar tarafından yerini aldı.

Neredeyse tüm durumlarda, bu ‘tekrarlayan’ atıflar özünde yanlış değildir; ancak genellikle çok geniş kapsamlıdır ve atıf yapılan makaleye faydalı bir destek sağlamaz; bu anlamda, ‘atıf yıkama’ya benzer bir şey temsil ederler – düşük çaba ile güvenilir ama esasen süs amaçlı kaynak alıntılarının eklenmesi, bir güvenilirlik havası yaratmak için.

 

İlk olarak Pazartesi, 24 Ağustos 2026’da yayımlandı. Eksik çoğul eklemek için 23:07 EET’de revize edildi.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai