Anderson’un Açısı

AI Modellerinin ‘Yaratıcı’ Çıktısı Sağlayıcılar Arasında Benzerleşiyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Yeni bir araştırma, rakip şirketlerin AI modellerinin yaratıcı yanıtlarının giderek birbirine benzediğini ve bunun kullanıcıların karşılaştığı fikirlerin çeşitliliğini daraltabileceğini gösteriyor.

ABD’de yapılan yeni bir araştırma, önde gelen pek çok AI modelinin “yaratıcı” çıktılarının zaman içinde birbirine daha çok benzediğini ortaya koydu.

Duke Üniversitesi’nden araştırmacılar, 2023–2026 döneminde yayımlanan, 12 sağlayıcı ailesine ait 69 modeli test etti. Hem gerçek dünyadan açık uçlu sorularda hem de standart bir yaratıcılık testinde çıktı çeşitliliğinin istatistiksel olarak anlamlı biçimde azaldığını buldular. Bu, başlıca LLM sağlayıcılarının “yaratıcı” isteklere giderek daha benzer fikirlerle yanıt verebileceğine işaret ediyor.

Test edilen sağlayıcı aileleri Anthropic, Cohere, DeepSeek, Google, Meta, MiniMax, Mistral AI, Moonshot AI, OpenAI, Qwen, xAI ve Z.ai idi*:

From the new paper - model releases used in the study, from Mart 2023 to Temmuz 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Yeni makaleden: araştırmada kullanılan modellerin Mart 2023 ile Temmuz 2026 arasındaki yayımlanma tarihleri. Grafik, 12 AI sağlayıcısından 69 model sürümünü kapsıyor. Test edilen modellerin üç yıllık döneme nasıl dağıldığını ve bazı sağlayıcılarda sürüm sıklığının nasıl arttığını gösteriyor; yazarların hesaplamalarında bunu dikkate alması gerekiyor. Kaynak

Bu yeni makalenin yazarları şöyle diyor**:

“ Test ettiğimiz açık uçlu istemlere verilen LLM yanıtlarının zaman içinde giderek daha benzer hâle geldiğini görüyoruz.”

“Bu, LLM’lerin açık uçlu yanıt üretmeyi gerektiren görevlerde daha az yaratıcı hâle geldiğine işaret ediyor ve yaratıcı yardımcılar olarak uzun vadeli yararlarının dikkatle incelenmesini gerektiriyor.”

“Algoritmik tek kültür” yerleşik bir araştırma alanı hâline gelmiş olsa da yazarlar, AI tarafından üretilen yaratıcı çıktılardaki homojenleşme eğilimlerinin şimdiye kadar incelenmediğini savunuyor.

Bununla birlikte, bir süredir tekil örnekler bu yakınsamaya işaret ediyordu. Bunlar arasında Cornell Üniversitesi’nin Mayıs 2026 tarihli çalışmasındaanlatılan tuhaf durum da vardı: farklı LLM sağlayıcılarının “deniz feneri bekçileri” ve “Mara” ile “Elias” gibi belirli, dönemiyle uyuşmayan adlar konusunda ortaklaşan saplantılar sergilediği gösterilmişti:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

Cornell Üniversitesi’nin mayıs ayındaki yeni makalesi, farklı LLM sağlayıcılarına “açık istemler” verildiğinde tuhaf benzerlikler ortaya çıktığını buldu. Ancak bu modelleri besleyen çeşitli eğitim verilerinde bunun nedenine ilişkin henüz bir ipucu görülmedi.

Yeni araştırma daha sistematik: yazarlar üç yıllık modelleri hem gerçek dünyadan yaratıcı istemlerle hem de gündelik nesneler için sıra dışı kullanım biçimleri isteyen klasik bir psikoloji testiyle değerlendirdi. Ardından modellerin yanıtlarının anlam bakımından ne kadar uzak olduğunu ölçerek bu uzaklıkların ardışık nesillerde azalıp azalmadığını izlediler.

Are LLMs becoming similarly creative? Evidence from three years of models başlıklı yeni çalışmanın yazarları şöyle diyor†:

“Bulgularımız ön nitelikte olsa da LLM’lerin yaratıcı ortaklar olarak uzun vadeli yararına ilişkin kaygılar doğuruyor. Modeller yaratıcı görevlerde iyi performans gösterse bile birbirine yaklaşan çıktılar, kullanıcıların karşılaştığı olasılıkların kapsamını ve bununla birlikte kendi düşüncelerinin genişliğini sınırlayabilir.

“Kompozisyon yazmak gibi yaratıcı görevlerde LLM kullanmak kişinin beyin etkinliğini azaltıyorsa, araştırmamızın işaret ettiği eğilim doğrultusunda giderek daha az yaratıcı LLM’ler kullanmak, LLM’lerin insan yaratıcılığı üzerindeki olumsuz etkilerini daha da kötüleştirebilir mi? Bu etkiler, söz konusu çalışmada ve diğer araştırmalarda gözlemlenmişti.”

LLM metin çıktılarının farklı özellikleri şimdiden internet mizahına malzeme oldu; bu yıl mayıs ayında bildirdiğimiz gibi, en az bir yazar da büyük modellerde ortak görülen “deniz feneri” takıntısını içeriyor gibi görünen bir kitabı kendi imkânlarıyla yayımladı.

Yayıncılar, bazı kitapları giderek daha fazla geri çekiyor; bu kitapların AI tarafından yazıldığından şüpheleniyorlar ya da AI desteğiyle üretildiğini düşünüyorlar. Bu ortamda yeni araştırma, öğrencilerin teslim ettiği akademik çalışmalar da dahil olmak üzere, görünürde insanlar tarafından yazılmış eserlerde daha fazla “olay örgüsü tesadüfü” görebileceğimize işaret ediyor.

Bu yakınsamanın kaynağı konusunda yazarlar, örtüşen eğitim verilerinin ve giderek birbirine benzeyen optimizasyon hedeflerinin modelleri, kavramlar ve anlamsal ilişkiler için benzer iç temsillere yöneltiyor olabileceğini öne sürüyor. Sonuçta daha benzer yanıtlar ortaya çıkıyor†:

“Bu homojenliğin hâlâ gelişmekte olan bir teknolojinin geçici yan ürünü mü, yoksa istatistiksel dil modellerinin kaçınılmaz —ve zamanla katlanarak artabilecek— bir özelliği mi olduğu henüz açık değil.”

“Her iki yönde de etkili olabilecek makul etkenler var. Giderek büyüyen bir akademik literatür, örtüşen verilerle eğitilen ve benzer hedefler doğrultusunda optimize edilen üretken modellerin kavramları ve anlamsal ilişkileri gitgide daha benzer biçimlerde düzenleyeceğini ve bunun benzer çıktılara yol açacağını gösteriyor.”

Bununla birlikte yazarlar, bir başka çalışmaya da atıfta bulunuyor. Bu çalışma, modeller geliştikçe yaratıcı çıktılar açısından yeniden ayrışıp kendilerine özgü, sınırları belirgin özellikler geliştirebileceğine işaret ediyor.

Yöntem

Araştırmacılar, AI modellerinin birbirine daha çok benzeyip benzemediğini izlemek için açık uçlu sorularla başladı ve birbirini izleyen model nesillerinin yanıtlarını derledi. Her yanıt, anlamını temsil eden sayısal bir gösterime dönüştürüldü. Böylece yanıtların birbirine ne kadar benzediğini ya da birbirinden ne kadar farklı olduğunu ölçmek mümkün oldu.

Regresyon analiziyle de yeni modeller yayımlandıkça bu farkların küçülüp küçülmediği belirlendi:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Yazarların, AI çıktılarının zaman içinde birbirine daha çok benzeyip benzemediğini ölçmek için kullandığı şema. Açık uçlu yaratıcı istemler farklı model ailelerine gönderildi. Yanıtlar, aralarındaki uzaklığın ölçülebilmesi için anlamlarına göre haritalandı; regresyon analiziyle bu uzaklıkların birbirini izleyen model nesillerinde nasıl değiştiği izlendi.

Yaratıcılığı farklı açılardan sınamak için iki istem kümesi seçildi. İlki, ıraksak düşünmeyi ölçen standart bir psikoloji testi olan Alternatif Kullanımlar Görevi (AUT) idi. Bu testte sıradan nesneler için alışılmadık kullanım biçimleri istenir. Çalışmada kullanılan nesneler arasında kitap, ayakkabı ve çekiç vardı. Testin sabit biçimi, farklı modellerin ürettiği fikirleri kontrollü şekilde karşılaştırmayı sağladı.

Diğer 100 istem ise Infinity-Chat100 koleksiyonundan derlendi. Dil modelleriyle gerçek dünyada yapılan konuşmalardan türetilen bu koleksiyon; içerik üretimi, problem çözme, beyin fırtınası ve fikir geliştirme gibi daha az kısıtlı yaratıcı görevleri kapsıyordu. Bu görevler, üretilecek yanıtlar ve benimsenecek yaklaşımlar açısından daha fazla serbestlik tanıyordu.

AUT ve Infinity-Chat100 istem kümelerinin tamamı daha sonra Mart 2023 ile Temmuz 2026 arasında yayımlanan modellere gönderildi. Kapsam, Anthropic, Google, Meta, OpenAI, DeepSeek ve Mistral AI sistemleri dahil 12 sağlayıcıydı. Tüm yanıtlar, OpenRouter API’si üzerinden aynı örnekleme ayarlarıyla toplandı. Temperature (yaratıcı yanıt verme serbestliği) ve top-p değerlerinin ikisi de 1 olarak ayarlandı.

Yeni nesillerin daha benzer yanıtlar üretip üretmediğini incelemek için modeller yayımlandıkları aya göre sıralandı.

Yayımlanma tarihleri eğitim verilerindeki, mimarideki veya eğitim sonrası süreçlerdeki değişiklikleri doğrudan göstermediğinden, yazarlar ortaya çıkan eğilimi zamanın geçmesinin tek başına yakınsamaya yol açtığının kanıtı olarak değil, model gelişimiyle ilişkili bir bulgu olarak ele aldı.

Ardından modellerin yanıtları, all-MiniLM-L6-v2 cümle dönüştürücüsü kullanılarak gömme temsillerine dönüştürüldü. Her yanıt bir sayısal vektör olarak temsil edildi. Bu sayede benzer anlamlara sahip yanıtlar benzer yönlerde konumlandırılabildi ve aralarındaki anlamsal uzaklık ölçülebildi.

AUT için, her nesneye yönelik önerilen tüm kullanımlar tek bir yanıt olarak ele alındı; böylece model başına on gömme temsili elde edildi. Infinity-Chat100 içinse her yanıt ayrı ayrı temsil edildi ve model başına 100 gömme temsili üretildi.

27 yayımlanma ayı dokuz zaman dilimine ayrıldı ve yalnızca farklı sağlayıcılara ait modeller karşılaştırıldı. Yanıtlar arasındaki anlamsal uzaklıklar her zaman dilimi içinde ölçüldü; daha küçük uzaklıklar daha fazla benzerlik anlamına geliyordu.

Daha fazla modele sahip sağlayıcıların sonuçlara hâkim olmasını önlemek için analiz, her sağlayıcıdan dengeli örneklemler alınarak 1.000 kez tekrarlandı.

Sonuçlar

Daha sonra bu uzaklıkların zaman içindeki değişimi doğrusal regresyonla izlendi. Sürekli negatif çıkan eğim, farklı sağlayıcılara ait modellerin birbirine daha çok benzediğini gösteriyordu:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Farklı AI sağlayıcılarının yaratıcı yanıtlarının zaman içinde daha çok benzeşip benzeşmediğini gösteren ilk test sonuçları. Hem Alternatif Kullanımlar Görevi hem de Infinity-Chat100 istemlerinde anlamsal uzaklıklar azaldı. Tekrarlanan dengeli örneklemelerde de sürekli negatif eğilimler görülmesi, model nesilleri boyunca benzerliğin arttığına işaret ediyor.

Yazarlar bu sonuçlarla ilgili olarak şunu vurguluyor:

“Hem AUT hem de Infinity-Chat yanıt kümelerinde, gözlem dönemi boyunca farklı sağlayıcıların çıktıları arasındaki uzaklıkların azaldığını görüyoruz.”

“Bu, LLM’lerin yaratıcı çıktılarının zaman içinde çeşitliliğinin azaldığına —veya homojenliğinin arttığına— işaret ediyor.”

Eski ve yeni modeller arasındaki fark en belirgin biçimde Alternatif Kullanımlar Görevi’nde ortaya çıktı. Farklı sağlayıcıların yanıtları arasındaki ortalama uzaklık, en eski modellerde yaklaşık 0,50 iken en yeni modellerde 0,40’ın altına düştü. Bu, yanıtların belirgin ölçüde birbirine benzediği anlamına geliyor. Aynı örüntü Infinity-Chat100’de de görüldü, ancak değişim daha küçüktü: ortalama uzaklık yaklaşık 0,34’ten 0,32’nin biraz üzerine indi.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Farklı AI sağlayıcılarının yanıtlarının zaman içinde ne hızla birbirine benzediğini ölçen test sonuçları. Alternatif Kullanımlar Görevi’nde modeller arasındaki farklar, Infinity-Chat’e kıyasla çok daha güçlü biçimde azaldı. Her iki sonuç da araştırmacıların tekrarlanan örnekleme testlerinde tutarlı kaldı.

Bulgu, dengeli yeniden örneklemenin 1.000 turunun tamamında da geçerliliğini korudu. Her durumda, yeni modellerin yanıtları eski modellerinkine göre birbirine daha yakındı. Bu azalmaların büyüklüğü ve araştırmacıların %95 güven aralıkları yukarıda gösteriliyor.

Makale bu konuda şöyle diyor:

“AUT’deki azalmanın büyüklüğü, görevin amacı düşünüldüğünde özellikle dikkat çekici. AUT, modellerden mümkün olduğunca özgün ve beklenmedik kullanım biçimleri üretmelerini isteyerek ıraksak düşünmeyi açıkça sınar; dolayısıyla çıktıların farklılaşmasının bekleneceği ortam tam da budur.”

Infinity-Chat sonuçları, aynı eğilimin çok daha geniş bir yaratıcı görev yelpazesinde de ortaya çıktığını gösteriyor. Bu kümedeki 100 istem, modellerden pek çok farklı türde açık uçlu yanıt üretmelerini istedi ve bu yanıtlar zaman içinde birbirine daha çok benzedi.

Değişim, Alternatif Kullanımlar Görevi’ndekinden daha küçüktü; ancak 2025 ve sonrasında yayımlanan modellerde daha belirgin hâle geldi. Yazarlar bunun, farklı AI sağlayıcılarının yaratıcı çıktılarının yalnızca belirli bir test türünde değil, genel olarak birbirine daha çok benzemeye başladığının erken bir işareti olabileceğini belirtiyor.

Sonuç

LLM ve VLM yakınsamasıyla ilgili sorunlar, giderek büyüyen ve süreklilik gösteren bir kaygı kaynağı olmayı sürdürüyor; hem araştırma topluluğunda hem de bu araştırmalardan doğan modellerin kullanıcıları arasında. Araştırmacıların erişebileceği ilk ve tek “saf” veri neslinin sonuna yaklaşıyoruz. Model sağlayıcılarının rakiplerinin verilerini ele geçirme kararlılığı da kaçınılmaz olarak yakınsama riski yaratıyor: veriler aynılaşırken sağlayıcıların model eğitimi ilkeleri de aynı olmasa bile birbirine benziyor.

Bu nedenle model ailelerinin yaratıcı çıktıları arasındaki artan benzerlikle mücadelede uzun tireleri değiştirmek kadar basit bir çözümün ortaya çıkması pek olası görünmüyor. Bunun yerine, benzer eserlerin daha kamusal ve utandırıcı biçimlerde açığa çıkması muhtemel.

* Modellerin tam listesi şöyledir: Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; ve GLM-5.2

** Vurgular bana değil, yazarlara aittir.

† Yazarların metin içi atıflarını bağlantılara ben dönüştürdüm.

İlk yayımlanma tarihi: 21 Ağustos 2026 Cuma

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai