Sudut Anderson
Output ‘Kreatif’ Model AI Menjadi Semakin Mirip di Antara Penyedia

Penelitian baru menunjukkan bahwa model AI dari perusahaan pesaing semakin mirip dalam jawaban kreatif mereka, berpotensi mempersempit ragam ide yang ditemui pengguna.
Penelitian baru dari AS menemukan bahwa output ‘kreatif’ di berbagai model AI terkemuka menjadi semakin mirip seiring waktu.
Penulis, yang berasal dari Duke University, menguji 69 model dari 12 keluarga penyedia, mencakup rilis dari 2023 hingga 2026, dan menemukan penurunan signifikan secara statistik dalam keragaman output baik pada pertanyaan terbuka dunia nyata maupun pada tes kreativitas standar – menunjukkan bahwa ide‑ide serupa mungkin ditawarkan sebagai respons terhadap permintaan ‘kreatif’, semakin sering, di antara semua penyedia LLM utama.
Keluarga penyedia yang diuji meliputi Anthropic; Cohere; DeepSeek; Google; Meta; MiniMax; Mistral AI; Moonshot AI; OpenAI; Qwen; xAI; dan Z.ai*:

Dari makalah baru: rilis model yang digunakan dalam penelitian, dari Maret 2023 hingga Juli 2026. Grafik mencakup 69 versi model dari 12 penyedia AI, memperlihatkan persebarannya selama tiga tahun. Grafik juga menunjukkan bahwa beberapa penyedia semakin sering merilis model, hal yang harus diperhitungkan dalam analisis penulis. Sumber
Penulis makalah baru tersebut menyatakan**:
“Kami menemukan bahwa respons LLM terhadap prompt terbuka yang kami uji menjadi semakin mirip seiring waktu.
“Hal ini menunjukkan bahwa LLM menjadi kurang kreatif dalam tugas yang mengharuskan pembuatan respons terbuka, sehingga kegunaan jangka panjangnya sebagai asisten kreatif perlu ditelaah.”
Meskipun ‘monokultur algoritmik’ telah menjadi jalur studi yang mapan, pemeriksaan tren menuju homogenitas dalam output kreatif yang dihasilkan AI belum pernah dilakukan sebelumnya, demikian kata penulis.
Namun, insiden terisolasi telah menunjukkan konvergensi ini sejak lama, termasuk kasus aneh yang diuraikan dalam studi Mei 2026 dari Cornell University, di mana beragam penyedia LLM menunjukkan obsesi aneh yang bertabrakan tentang ‘penjaga mercusuar’, serta sekumpulan nama anachronistic, termasuk ‘Mara’ dan ‘Elias’:

Pada Mei, makalah baru dari Cornell University menemukan kemiripan yang tidak biasa di antara penyedia LLM ketika diberi prompt terbuka. Namun, beragam data pelatihan yang digunakan model-model tersebut belum memberikan petunjuk mengenai penyebabnya.
Studi baru lebih sistematis: penulis menguji tiga tahun model terhadap baik prompt kreatif dunia nyata maupun tes psikologi klasik yang meminta penggunaan tidak biasa untuk objek sehari‑hari. Mereka kemudian mengukur seberapa jauh jawaban model berbeda secara makna, melacak apakah jarak tersebut menyusut di antara generasi berurutan.
Penulis karya baru berjudul Are LLMs becoming similarly creative? Evidence from three years of models, menyatakan†:
“Temuan kami, meskipun masih awal, menimbulkan kekhawatiran mengenai kegunaan jangka panjang LLM sebagai mitra kreatif. Sekalipun model berkinerja baik pada tugas kreatif, keluaran yang semakin serupa dapat membatasi ragam kemungkinan yang dijumpai pengguna LLM, sekaligus keluasan pemikiran mereka sendiri.
“Jika penggunaan LLM untuk tugas kreatif seperti menulis esai menurunkan aktivitas otak seseorang, apakah penggunaan LLM yang semakin kurang kreatif—tren yang ditunjukkan penelitian kami—dapat makin memperburuk dampak LLM terhadap kreativitas manusia, sebagaimana diamati dalam penelitian ini dan berbagai penelitian lain?”
Sudah, beragam karakteristik output teks LLM menjadi bahan meme; dan, seperti yang kami laporkan pada Mei tahun ini, setidaknya satu penulis telah menerbitkan buku secara mandiri yang tampaknya menampilkan obsesi ‘mercusuar’ yang disebutkan sebelumnya pada model utama.
Jadi, dalam iklim di mana penerbit semakin banyak menarik kembali buku yang mereka curigai ditulis AI atau dibantu AI, penelitian baru tampaknya menunjukkan bahwa kita dapat mengharapkan pertumbuhan ‘kebetulan plot’ yang muncul dari karya yang tampak ditulis manusia, termasuk karya akademik yang diajukan mahasiswa.
Mengenai asal konvergensi ini, penulis berhipotesis bahwa data pelatihan yang tumpang tindih dan tujuan optimasi yang semakin serupa mungkin mendorong model menuju representasi internal konsep dan hubungan semantik yang sebanding – pada akhirnya menghasilkan jawaban yang lebih mirip†:
“Belum jelas apakah homogenitas ini merupakan dampak samping sementara dari teknologi yang masih berkembang atau sifat model bahasa statistik yang tidak terelakkan dan berpotensi semakin bertambah.”
“Ada faktor-faktor yang masuk akal untuk kedua kemungkinan tersebut. Semakin banyak penelitian akademik menunjukkan bahwa model generatif yang dilatih dengan data yang tumpang tindih dan dioptimalkan menuju tujuan serupa akan menyusun konsep serta hubungan semantik dengan cara yang semakin serupa sehingga menghasilkan keluaran yang mirip.”
Namun, penulis juga mengutip penelitian yang menunjukkan bahwa seiring model berkembang, mereka mungkin kembali menyimpang ke dalam set karakteristik yang terisolasi masing‑masing, terkait output kreatif.
Metode
Untuk melacak apakah model AI menjadi lebih mirip, peneliti memulai dengan pertanyaan terbuka, mengumpulkan jawaban dari generasi model berurutan. Setiap jawaban diubah menjadi representasi numerik maknanya, memungkinkan pengukuran seberapa mirip atau berbeda respons tersebut.
Analisis regresi kemudian digunakan untuk menentukan apakah perbedaan ini menyusut seiring rilis model yang lebih baru:

Skema penulis untuk mengukur apakah keluaran AI menjadi semakin mirip seiring waktu. Prompt kreatif terbuka dijalankan pada berbagai keluarga model. Jawabannya dipetakan berdasarkan makna untuk mengukur jarak di antaranya, lalu analisis regresi melacak perubahan jarak tersebut pada generasi model yang berurutan.
Dua set prompt dipilih untuk menguji kreativitas dari sudut berbeda. Pertama, Alternate Uses Task (AUT), tes psikologi standar untuk berpikir divergen, meminta penggunaan tidak konvensional untuk objek biasa, dengan studi menggunakan objek seperti buku, sepatu, dan palu. Format tetapnya menyediakan cara terkontrol untuk membandingkan ide yang dihasilkan oleh model yang berbeda.
Seratus prompt tambahan disaring dari Infinity-Chat100, kumpulan yang diambil dari percakapan dunia nyata dengan model bahasa. Prompt ini mencakup tugas kreatif yang kurang terbatas seperti menghasilkan konten, memecahkan masalah, brainstorming, dan ideasi; tugas yang memungkinkan kebebasan lebih besar dalam jawaban dan pendekatan.
Set lengkap prompt AUT dan Infinity-Chat100 kemudian dikirim ke model yang dirilis antara Maret 2023 dan Juli 2026, mencakup 12 penyedia dan sistem dari Anthropic, Google, Meta, OpenAI, DeepSeek, dan Mistral AI. Semua respons dikumpulkan melalui API OpenRouter dengan pengaturan sampling yang sama, dengan temperature (kebebasan berkreasi) dan top-p keduanya disetel ke satu.
Model diurutkan berdasarkan bulan rilis untuk memeriksa apakah generasi yang lebih baru menghasilkan jawaban yang lebih mirip.
Karena tanggal rilis tidak secara langsung mencerminkan perubahan data pelatihan, arsitektur, atau pasca‑pelatihan, penulis memperlakukan tren yang muncul sebagai asosiasi dengan pengembangan model, bukan bukti bahwa berlalunya waktu sendiri menyebabkan konvergensi.
Jawaban model kemudian diubah menjadi embedding menggunakan all-MiniLM-L6-v2 sentence‑transformer. Setiap respons direpresentasikan sebagai vektor numerik, memungkinkan jawaban dengan makna serupa ditempatkan pada arah yang serupa, dan jarak semantik mereka diukur.
Untuk AUT, semua penggunaan yang diusulkan untuk tiap objek diperlakukan sebagai satu respons, menghasilkan sepuluh embedding per model. Untuk Infinity-Chat100, setiap jawaban di‑embed secara terpisah, menghasilkan 100 embedding per model.
27 bulan rilis dikelompokkan menjadi sembilan periode waktu, dan hanya model dari penyedia yang berbeda yang dibandingkan. Jarak semantik antara jawaban mereka diukur dalam tiap periode, dengan jarak yang lebih kecil menunjukkan kemiripan yang lebih besar.
Untuk mencegah penyedia dengan lebih banyak model mendominasi hasil, analisis diulang 1.000 kali, menggunakan sampel seimbang dari tiap penyedia.
Hasil
Regresi linear kemudian digunakan untuk melacak perubahan jarak tersebut dari waktu ke waktu. Kemiringan negatif yang konsisten menunjukkan bahwa model dari penyedia berbeda menjadi semakin mirip:

Hasil pengujian awal menunjukkan apakah respons kreatif dari berbagai penyedia AI menjadi semakin mirip seiring waktu. Jarak semantik menurun untuk prompt Tugas Penggunaan Alternatif maupun Infinity-Chat100. Pengambilan sampel seimbang yang diulang menghasilkan tren negatif secara konsisten, yang menunjukkan meningkatnya kemiripan antargenerasi model.
Dari hasil ini penulis menekankan:
‘Untuk kedua set respons AUT dan Infinity‑Chat, kami mengamati penurunan jarak output antar‑penyedia selama periode observasi.
‘Ini menunjukkan penurunan keragaman—atau peningkatan homogenitas—output kreatif LLM seiring waktu.’
Perbedaan antara model lama dan baru paling jelas pada Alternate Uses Task. Jarak rata‑rata antara jawaban dari penyedia berbeda turun dari sekitar 0,50 pada model paling awal menjadi di bawah 0,40 pada model terbaru, yang berarti jawaban mereka menjadi jauh lebih mirip. Pola serupa ditemukan pada Infinity‑Chat100, meski perubahannya lebih kecil, dengan jarak rata‑rata turun dari sekitar 0,34 menjadi sedikit di atas 0,32.

Hasil pengujian yang mengukur seberapa cepat jawaban dari berbagai penyedia AI menjadi semakin mirip seiring waktu. Tugas Penggunaan Alternatif menunjukkan penurunan perbedaan antarmodel yang jauh lebih kuat daripada Infinity-Chat. Kedua hasil tetap konsisten dalam pengujian sampel berulang oleh peneliti.
Temuan ini juga bertahan dalam semua 1.000 putaran resampling seimbang. Dalam setiap kasus, model yang lebih baru menghasilkan jawaban yang lebih dekat satu sama lain dibandingkan model yang lebih lama. Besarnya penurunan ini, bersama interval kepercayaan 95 % peneliti, ditampilkan di atas.
Mengenai hal ini, makalah menyatakan:
‘Besarnya penurunan AUT sangat menonjol mengingat tujuan tugas tersebut. AUT secara eksplisit menguji berpikir divergen dengan menginstruksikan model menghasilkan penggunaan yang sesungguhnya orisinal dan tak terduga, menjadikannya konteks tepat di mana output diharapkan berbeda.’
Hasil Infinity‑Chat menunjukkan bahwa tren serupa juga muncul pada rentang tugas kreatif yang jauh lebih luas. Seratus promptnya meminta model menghasilkan banyak jenis jawaban terbuka, dan jawaban‑jawaban ini menjadi lebih mirip seiring waktu.
Perubahannya lebih kecil dibandingkan dengan Alternate Uses Task, namun menjadi lebih jelas pada model yang dirilis sejak 2025. Penulis menyarankan bahwa ini bisa menjadi tanda awal bahwa output kreatif dari penyedia AI yang berbeda menjadi lebih mirip secara umum, bukan hanya pada satu jenis tes tertentu.
Kesimpulan
Isu konvergensi LLM dan VLM merupakan sumber kekhawatiran yang terus berkembang di kalangan komunitas riset maupun konsumen model turunannya. Kami berada di penghujung generasi ‘murni’ pertama dan satu‑satunya data yang pernah dapat diakses oleh dunia riset; dan tekad penyedia model untuk menyerap data pesaing tak terelakkan menimbulkan konvergensi, karena data menjadi identik, dan prinsip pelatihan model serupa, bila tidak identik, di antara penyedia.
Oleh karena itu, tidak ada solusi sederhana seperti mengganti em‑dash yang kemungkinan akan muncul untuk melawan meningkatnya kemiripan output kreatif di antara keluarga model, dan kasus duplikasi justru kemungkinan akan terungkap secara lebih publik dan memalukan.
* Daftar lengkap model adalah Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; dan GLM-5.2
** Penekanan penulis, bukan saya.
† Konversi saya atas sitasi dalam teks penulis menjadi tautan hiperlink.
Pertama kali diterbitkan pada Jumat, 21 Agustus 2026












