Anderson’un Açısı
AI Modellerinin ‘Yaratıcı’ Çıktısı Sağlayıcılar Arasında Benzerleşiyor

Yeni bir araştırma, rakip şirketlerin AI modellerinin yaratıcı yanıtlarının giderek birbirine benzediğini ve bunun kullanıcıların karşılaştığı fikirlerin çeşitliliğini daraltabileceğini gösteriyor.
ABD’de yapılan yeni bir araştırma, önde gelen pek çok AI modelinin “yaratıcı” çıktılarının zaman içinde birbirine daha çok benzediğini ortaya koydu.
Duke Üniversitesi’nden araştırmacılar, 2023–2026 döneminde yayımlanan, 12 sağlayıcı ailesine ait 69 modeli test etti. Hem gerçek dünyadan açık uçlu sorularda hem de standart bir yaratıcılık testinde çıktı çeşitliliğinin istatistiksel olarak anlamlı biçimde azaldığını buldular. Bu, başlıca LLM sağlayıcılarının “yaratıcı” isteklere giderek daha benzer fikirlerle yanıt verebileceğine işaret ediyor.
Test edilen sağlayıcı aileleri Anthropic, Cohere, DeepSeek, Google, Meta, MiniMax, Mistral AI, Moonshot AI, OpenAI, Qwen, xAI ve Z.ai idi*:

Yeni makaleden: araştırmada kullanılan modellerin Mart 2023 ile Temmuz 2026 arasındaki yayımlanma tarihleri. Grafik, 12 AI sağlayıcısından 69 model sürümünü kapsıyor. Test edilen modellerin üç yıllık döneme nasıl dağıldığını ve bazı sağlayıcılarda sürüm sıklığının nasıl arttığını gösteriyor; yazarların hesaplamalarında bunu dikkate alması gerekiyor. Kaynak
Bu yeni makalenin yazarları şöyle diyor**:
“ Test ettiğimiz açık uçlu istemlere verilen LLM yanıtlarının zaman içinde giderek daha benzer hâle geldiğini görüyoruz.”
“Bu, LLM’lerin açık uçlu yanıt üretmeyi gerektiren görevlerde daha az yaratıcı hâle geldiğine işaret ediyor ve yaratıcı yardımcılar olarak uzun vadeli yararlarının dikkatle incelenmesini gerektiriyor.”
“Algoritmik tek kültür” yerleşik bir araştırma alanı hâline gelmiş olsa da yazarlar, AI tarafından üretilen yaratıcı çıktılardaki homojenleşme eğilimlerinin şimdiye kadar incelenmediğini savunuyor.
Bununla birlikte, bir süredir tekil örnekler bu yakınsamaya işaret ediyordu. Bunlar arasında Cornell Üniversitesi’nin Mayıs 2026 tarihli çalışmasındaanlatılan tuhaf durum da vardı: farklı LLM sağlayıcılarının “deniz feneri bekçileri” ve “Mara” ile “Elias” gibi belirli, dönemiyle uyuşmayan adlar konusunda ortaklaşan saplantılar sergilediği gösterilmişti:

Cornell Üniversitesi’nin mayıs ayındaki yeni makalesi, farklı LLM sağlayıcılarına “açık istemler” verildiğinde tuhaf benzerlikler ortaya çıktığını buldu. Ancak bu modelleri besleyen çeşitli eğitim verilerinde bunun nedenine ilişkin henüz bir ipucu görülmedi.
Yeni araştırma daha sistematik: yazarlar üç yıllık modelleri hem gerçek dünyadan yaratıcı istemlerle hem de gündelik nesneler için sıra dışı kullanım biçimleri isteyen klasik bir psikoloji testiyle değerlendirdi. Ardından modellerin yanıtlarının anlam bakımından ne kadar uzak olduğunu ölçerek bu uzaklıkların ardışık nesillerde azalıp azalmadığını izlediler.
Are LLMs becoming similarly creative? Evidence from three years of models başlıklı yeni çalışmanın yazarları şöyle diyor†:
“Bulgularımız ön nitelikte olsa da LLM’lerin yaratıcı ortaklar olarak uzun vadeli yararına ilişkin kaygılar doğuruyor. Modeller yaratıcı görevlerde iyi performans gösterse bile birbirine yaklaşan çıktılar, kullanıcıların karşılaştığı olasılıkların kapsamını ve bununla birlikte kendi düşüncelerinin genişliğini sınırlayabilir.
“Kompozisyon yazmak gibi yaratıcı görevlerde LLM kullanmak kişinin beyin etkinliğini azaltıyorsa, araştırmamızın işaret ettiği eğilim doğrultusunda giderek daha az yaratıcı LLM’ler kullanmak, LLM’lerin insan yaratıcılığı üzerindeki olumsuz etkilerini daha da kötüleştirebilir mi? Bu etkiler, söz konusu çalışmada ve diğer araştırmalarda gözlemlenmişti.”
LLM metin çıktılarının farklı özellikleri şimdiden internet mizahına malzeme oldu; bu yıl mayıs ayında bildirdiğimiz gibi, en az bir yazar da büyük modellerde ortak görülen “deniz feneri” takıntısını içeriyor gibi görünen bir kitabı kendi imkânlarıyla yayımladı.
Yayıncılar, bazı kitapları giderek daha fazla geri çekiyor; bu kitapların AI tarafından yazıldığından şüpheleniyorlar ya da AI desteğiyle üretildiğini düşünüyorlar. Bu ortamda yeni araştırma, öğrencilerin teslim ettiği akademik çalışmalar da dahil olmak üzere, görünürde insanlar tarafından yazılmış eserlerde daha fazla “olay örgüsü tesadüfü” görebileceğimize işaret ediyor.
Bu yakınsamanın kaynağı konusunda yazarlar, örtüşen eğitim verilerinin ve giderek birbirine benzeyen optimizasyon hedeflerinin modelleri, kavramlar ve anlamsal ilişkiler için benzer iç temsillere yöneltiyor olabileceğini öne sürüyor. Sonuçta daha benzer yanıtlar ortaya çıkıyor†:
“Bu homojenliğin hâlâ gelişmekte olan bir teknolojinin geçici yan ürünü mü, yoksa istatistiksel dil modellerinin kaçınılmaz —ve zamanla katlanarak artabilecek— bir özelliği mi olduğu henüz açık değil.”
“Her iki yönde de etkili olabilecek makul etkenler var. Giderek büyüyen bir akademik literatür, örtüşen verilerle eğitilen ve benzer hedefler doğrultusunda optimize edilen üretken modellerin kavramları ve anlamsal ilişkileri gitgide daha benzer biçimlerde düzenleyeceğini ve bunun benzer çıktılara yol açacağını gösteriyor.”
Bununla birlikte yazarlar, bir başka çalışmaya da atıfta bulunuyor. Bu çalışma, modeller geliştikçe yaratıcı çıktılar açısından yeniden ayrışıp kendilerine özgü, sınırları belirgin özellikler geliştirebileceğine işaret ediyor.
Yöntem
Araştırmacılar, AI modellerinin birbirine daha çok benzeyip benzemediğini izlemek için açık uçlu sorularla başladı ve birbirini izleyen model nesillerinin yanıtlarını derledi. Her yanıt, anlamını temsil eden sayısal bir gösterime dönüştürüldü. Böylece yanıtların birbirine ne kadar benzediğini ya da birbirinden ne kadar farklı olduğunu ölçmek mümkün oldu.
Regresyon analiziyle de yeni modeller yayımlandıkça bu farkların küçülüp küçülmediği belirlendi:

Yazarların, AI çıktılarının zaman içinde birbirine daha çok benzeyip benzemediğini ölçmek için kullandığı şema. Açık uçlu yaratıcı istemler farklı model ailelerine gönderildi. Yanıtlar, aralarındaki uzaklığın ölçülebilmesi için anlamlarına göre haritalandı; regresyon analiziyle bu uzaklıkların birbirini izleyen model nesillerinde nasıl değiştiği izlendi.
Yaratıcılığı farklı açılardan sınamak için iki istem kümesi seçildi. İlki, ıraksak düşünmeyi ölçen standart bir psikoloji testi olan Alternatif Kullanımlar Görevi (AUT) idi. Bu testte sıradan nesneler için alışılmadık kullanım biçimleri istenir. Çalışmada kullanılan nesneler arasında kitap, ayakkabı ve çekiç vardı. Testin sabit biçimi, farklı modellerin ürettiği fikirleri kontrollü şekilde karşılaştırmayı sağladı.
Diğer 100 istem ise Infinity-Chat100 koleksiyonundan derlendi. Dil modelleriyle gerçek dünyada yapılan konuşmalardan türetilen bu koleksiyon; içerik üretimi, problem çözme, beyin fırtınası ve fikir geliştirme gibi daha az kısıtlı yaratıcı görevleri kapsıyordu. Bu görevler, üretilecek yanıtlar ve benimsenecek yaklaşımlar açısından daha fazla serbestlik tanıyordu.
AUT ve Infinity-Chat100 istem kümelerinin tamamı daha sonra Mart 2023 ile Temmuz 2026 arasında yayımlanan modellere gönderildi. Kapsam, Anthropic, Google, Meta, OpenAI, DeepSeek ve Mistral AI sistemleri dahil 12 sağlayıcıydı. Tüm yanıtlar, OpenRouter API’si üzerinden aynı örnekleme ayarlarıyla toplandı. Temperature (yaratıcı yanıt verme serbestliği) ve top-p değerlerinin ikisi de 1 olarak ayarlandı.
Yeni nesillerin daha benzer yanıtlar üretip üretmediğini incelemek için modeller yayımlandıkları aya göre sıralandı.
Yayımlanma tarihleri eğitim verilerindeki, mimarideki veya eğitim sonrası süreçlerdeki değişiklikleri doğrudan göstermediğinden, yazarlar ortaya çıkan eğilimi zamanın geçmesinin tek başına yakınsamaya yol açtığının kanıtı olarak değil, model gelişimiyle ilişkili bir bulgu olarak ele aldı.
Ardından modellerin yanıtları, all-MiniLM-L6-v2 cümle dönüştürücüsü kullanılarak gömme temsillerine dönüştürüldü. Her yanıt bir sayısal vektör olarak temsil edildi. Bu sayede benzer anlamlara sahip yanıtlar benzer yönlerde konumlandırılabildi ve aralarındaki anlamsal uzaklık ölçülebildi.
AUT için, her nesneye yönelik önerilen tüm kullanımlar tek bir yanıt olarak ele alındı; böylece model başına on gömme temsili elde edildi. Infinity-Chat100 içinse her yanıt ayrı ayrı temsil edildi ve model başına 100 gömme temsili üretildi.
27 yayımlanma ayı dokuz zaman dilimine ayrıldı ve yalnızca farklı sağlayıcılara ait modeller karşılaştırıldı. Yanıtlar arasındaki anlamsal uzaklıklar her zaman dilimi içinde ölçüldü; daha küçük uzaklıklar daha fazla benzerlik anlamına geliyordu.
Daha fazla modele sahip sağlayıcıların sonuçlara hâkim olmasını önlemek için analiz, her sağlayıcıdan dengeli örneklemler alınarak 1.000 kez tekrarlandı.
Sonuçlar
Daha sonra bu uzaklıkların zaman içindeki değişimi doğrusal regresyonla izlendi. Sürekli negatif çıkan eğim, farklı sağlayıcılara ait modellerin birbirine daha çok benzediğini gösteriyordu:

Farklı AI sağlayıcılarının yaratıcı yanıtlarının zaman içinde daha çok benzeşip benzeşmediğini gösteren ilk test sonuçları. Hem Alternatif Kullanımlar Görevi hem de Infinity-Chat100 istemlerinde anlamsal uzaklıklar azaldı. Tekrarlanan dengeli örneklemelerde de sürekli negatif eğilimler görülmesi, model nesilleri boyunca benzerliğin arttığına işaret ediyor.
Yazarlar bu sonuçlarla ilgili olarak şunu vurguluyor:
“Hem AUT hem de Infinity-Chat yanıt kümelerinde, gözlem dönemi boyunca farklı sağlayıcıların çıktıları arasındaki uzaklıkların azaldığını görüyoruz.”
“Bu, LLM’lerin yaratıcı çıktılarının zaman içinde çeşitliliğinin azaldığına —veya homojenliğinin arttığına— işaret ediyor.”
Eski ve yeni modeller arasındaki fark en belirgin biçimde Alternatif Kullanımlar Görevi’nde ortaya çıktı. Farklı sağlayıcıların yanıtları arasındaki ortalama uzaklık, en eski modellerde yaklaşık 0,50 iken en yeni modellerde 0,40’ın altına düştü. Bu, yanıtların belirgin ölçüde birbirine benzediği anlamına geliyor. Aynı örüntü Infinity-Chat100’de de görüldü, ancak değişim daha küçüktü: ortalama uzaklık yaklaşık 0,34’ten 0,32’nin biraz üzerine indi.

Farklı AI sağlayıcılarının yanıtlarının zaman içinde ne hızla birbirine benzediğini ölçen test sonuçları. Alternatif Kullanımlar Görevi’nde modeller arasındaki farklar, Infinity-Chat’e kıyasla çok daha güçlü biçimde azaldı. Her iki sonuç da araştırmacıların tekrarlanan örnekleme testlerinde tutarlı kaldı.
Bulgu, dengeli yeniden örneklemenin 1.000 turunun tamamında da geçerliliğini korudu. Her durumda, yeni modellerin yanıtları eski modellerinkine göre birbirine daha yakındı. Bu azalmaların büyüklüğü ve araştırmacıların %95 güven aralıkları yukarıda gösteriliyor.
Makale bu konuda şöyle diyor:
“AUT’deki azalmanın büyüklüğü, görevin amacı düşünüldüğünde özellikle dikkat çekici. AUT, modellerden mümkün olduğunca özgün ve beklenmedik kullanım biçimleri üretmelerini isteyerek ıraksak düşünmeyi açıkça sınar; dolayısıyla çıktıların farklılaşmasının bekleneceği ortam tam da budur.”
Infinity-Chat sonuçları, aynı eğilimin çok daha geniş bir yaratıcı görev yelpazesinde de ortaya çıktığını gösteriyor. Bu kümedeki 100 istem, modellerden pek çok farklı türde açık uçlu yanıt üretmelerini istedi ve bu yanıtlar zaman içinde birbirine daha çok benzedi.
Değişim, Alternatif Kullanımlar Görevi’ndekinden daha küçüktü; ancak 2025 ve sonrasında yayımlanan modellerde daha belirgin hâle geldi. Yazarlar bunun, farklı AI sağlayıcılarının yaratıcı çıktılarının yalnızca belirli bir test türünde değil, genel olarak birbirine daha çok benzemeye başladığının erken bir işareti olabileceğini belirtiyor.
Sonuç
LLM ve VLM yakınsamasıyla ilgili sorunlar, giderek büyüyen ve süreklilik gösteren bir kaygı kaynağı olmayı sürdürüyor; hem araştırma topluluğunda hem de bu araştırmalardan doğan modellerin kullanıcıları arasında. Araştırmacıların erişebileceği ilk ve tek “saf” veri neslinin sonuna yaklaşıyoruz. Model sağlayıcılarının rakiplerinin verilerini ele geçirme kararlılığı da kaçınılmaz olarak yakınsama riski yaratıyor: veriler aynılaşırken sağlayıcıların model eğitimi ilkeleri de aynı olmasa bile birbirine benziyor.
Bu nedenle model ailelerinin yaratıcı çıktıları arasındaki artan benzerlikle mücadelede uzun tireleri değiştirmek kadar basit bir çözümün ortaya çıkması pek olası görünmüyor. Bunun yerine, benzer eserlerin daha kamusal ve utandırıcı biçimlerde açığa çıkması muhtemel.
* Modellerin tam listesi şöyledir: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; ve GLM-5.2
** Vurgular bana değil, yazarlara aittir.
† Yazarların metin içi atıflarını bağlantılara ben dönüştürdüm.
İlk yayımlanma tarihi: 21 Ağustos 2026 Cuma












