Sudut Anderson
AI Mengutip Makalah yang Sama Berulang-ulang – Seperti Manusia

ChatGPT dan alat penulisan AI lainnya mungkin diam-diam mengubah ilmu pengetahuan menjadi kontes popularitas, berulang kali mengarahkan peneliti ke makalah yang sama sambil mengabaikan karya baru dan inovatif yang sebenarnya dapat memajukan bidang tersebut.
Monokultur, dalam hal frekuensi dan statistik, adalah ketika kumpulan sumber atau aset terbatas yang sama berulang-ulang, menenggelamkan suara baru dan pandangan segar: kumpulan lagu terbatas yang sama dalam penjadwalan radio; kelompok penulis dan buku yang sama di rak bandara; dan pilihan terbatas buah dan sayur di supermarket:

Ya, kami memiliki pisang ini – dan hanya pisang ini. Homogenitas buah dan sayur dalam rantai makanan Barat mengabaikan ratusan kemungkinan spesies lain dalam setiap kasus, karena rantai produksi dan transportasi yang beragam terlalu mahal untuk diindustrialisasi bagi jenis buah atau sayur yang beragam. Sumber
Hal ini juga terjadi pada sitasi yang muncul dalam penelitian ilmiah baru, di mana peneliti, mungkin dengan malas, beralih ke kumpulan sumber yang ‘andalan’ yang memperoleh momentum hingga mulai mendominasi cabang-cabang penelitian.
Ini dikenal sebagai Efek Matthew – sebuah teori sosiologis yang menyatakan bahwa yang berkuasa akan selalu diuntungkan; sindrom ini telah dibandingkan dengan janji dalam Matius 13:12, yang menyatakan ‘Siapa yang memiliki akan diberi lebih banyak, dan mereka akan memiliki kelimpahan. Siapa yang tidak memiliki, bahkan apa yang mereka miliki akan diambil dari mereka’.
Kelompok Populer
Salah satu harapan besar dari penelitian yang didukung AI adalah bahwa metode pembelajaran mesin baru dapat keluar dari Efek Matthew – yang juga dikenal sebagai bias popularitas – dan mulai mengutip karya yang kurang dikenal yang mungkin lebih tajam, atau lebih tepat dengan poin yang disampaikan dalam sebuah makalah.
Namun, berdasarkan cara rutinitas pelatihan AI menafsirkan dataset, tidak pernah ada alasan kuat untuk optimisme ini; dan telah berulang kali ditemukan bahwa ketika AI tidak menciptakan sitasi secara terang-terangan – sebuah masalah kronis hingga kini – ia memang memperpanjang Efek Matthew, sama seperti manusia – meskipun mungkin bukan karena alasan yang sama.
Selama pelatihan, sebuah model akan belajar memberi peringkat tinggi pada makalah yang paling banyak disitasi (atau yang paling sering diulang) dalam set pelatihan, karena rutinitas pelatihan dirancang untuk mengekstrak pola bermakna, dan untuk mengecualikan outlier sebagai ‘kebisingan’, atau anomali statistik.
Di bawah rezim ini, setara dengan teori relativitas Einstein tidak akan pernah mendapat perhatian dari mesin, yang, setelah dilatih, merasa bahwa ia sudah menemukan prinsip dan referensi, dan hanya dapat menyesuaikan sedikit dengan merujuk pada publikasi baru melalui RAG, atau dengan cara lain yang memperluas jangkauan model di luar matriks yang dilatih.
Masalahnya, ia tidak akan memberi penghargaan pada karya baru tersebut dengan cara yang sama seperti ‘favorit lama’ yang sudah dikenalnya, atau bahkan tidak sama sekali, karena bias statistiknya kini sudah sangat mengakar.
Dengan demikian AI sebenarnya tidak mengamati dan meniru perilaku manusia ketika memperpanjang Efek Matthew – ia hanya menghitung berapa kali peneliti secara malas beralih ke makalah lama yang sama, dan secara serupa memberi peringkat tinggi pada makalah tersebut. Dalam hal ini, masalah pengulangan sitasi terkait dengan tantangan memilih makalah ilmiah yang benar-benar menarik dari badai yang terus berkembang publikasi riset AI, di mana karya terkuat sering kali memiliki sinyal terlemah.
Mendiagnosis Monokultur
Masalah ini dibahas dalam sebuah makalah baru yang menarik dari AS berjudul When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Karya baru ini – kolaborasi antara University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University, dan University of Notre Dame – berupaya membuktikan secara tegas keberadaan monokultur sitasi dalam pembelajaran mesin, sehingga variabel-variabelnya dapat ditangani secara langsung di masa depan, bersama dengan masalah itu sendiri.
Dalam pengujian, penulis menemukan bahwa sebelas model dari OpenAI, Google, dan Anthropic berulang kali memfavoritkan kelompok kecil makalah yang sama – bahkan setelah sinyal popularitas yang jelas dihilangkan.
Untuk menguji ini, 120 makalah nyata dihilangkan jumlah sitasinya dan tempat publikasinya, sementara nama penulis diganti, dan tahun publikasi ditetapkan secara acak. Sekelompok tiga puluh makalah secara acak kemudian ditampilkan kepada masing-masing model, yang diizinkan untuk menyitir tidak lebih dari sepuluh.
Delapan pakar manusia di bidang terkait diberikan makalah yang sama tanpa identitas, namun tidak sepakat pada favorit yang sama dengan AI, menandakan bahwa bias tersebut spesifik pada model AI bukan pada makalah itu sendiri:

Dari makalah baru, hasil pengujian yang membandingkan pilihan sitasi oleh model AI dan pakar manusia. Pada semua sebelas model, sitasi terpusat pada kelompok makalah yang lebih kecil, sementara beberapa makalah secara berulang kali diabaikan sepenuhnya. Pakar manusia tidak menunjukkan kecenderungan tersebut. Sumber
Makalah yang sama tetap populer bahkan ketika model hanya diminta memilih referensi, menunjukkan bahwa menulis ulasan itu sendiri tidak menyebabkan bias.
Eksperimen kemudian diperluas selama sebelas putaran, dengan 120 makalah yang ditulis AI ditambahkan setelah setiap putaran, untuk menguji apa yang terjadi ketika preferensi bersama ini beroperasi dalam kumpulan riset yang dihasilkan AI yang terus bertambah.
Seiring bertambahnya makalah yang ditulis AI, model semakin memusatkan sitasinya pada jumlah makalah manusia asli yang semakin menyusut.
Para penulis menyatakan:
“Seiring peralihan model bahasa dari menyusun tulisan menjadi menjalankan agen penelusuran literatur dengan pemanggilan alat, referensi palsu semakin mudah dideteksi dan dibatasi.
“Kegagalan yang lebih sulit ditangani dimulai setelah semua kandidat referensi terbukti nyata: model yang berbeda mungkin tetap memilih kelompok kecil yang sama, sehingga menghasilkan monokultur sitasi meskipun tidak satu pun sitasinya keliru.”
Sebagai upaya perbaikan masalah, makalah berargumen bahwa sekadar mencampur model dari vendor berbeda atau memberi paparan yang setara pada makalah tidak akan cukup, karena banyak preferensi dibagi antar model. Sebaliknya, preferensi mendasar terhadap makalah tertentu perlu diubah – mungkin dengan sengaja memberi penekanan lebih pada makalah yang terabaikan. Namun, penulis menekankan bahwa pendekatan ini belum diuji.
Pendekatan Pengujian
Tolok ukur dibangun dari 120 makalah distilasi pengetahuan nyata yang dikumpulkan dari arXiv dan dipublikasikan antara 2015 dan 2022. Masing‑masing memiliki antara 50 hingga 500 sitasi pada saat pengumpulan, rentang yang dipilih untuk mengecualikan karya yang obscur maupun yang sangat berpengaruh.
Eksperimen dimulai dengan mengambil tiga puluh makalah secara acak dari koleksi yang tersedia, dengan nama penulis, tahun publikasi, dan jumlah sitasi disembunyikan. Setiap model menghasilkan ulasan singkat atau esai posisi yang menyitir tidak lebih dari sepuluh makalah, dan pilihan ini dibandingkan dengan seleksi acak dari materi yang sama:

Skema metode yang digunakan untuk menguji preferensi sitasi. Tiga puluh makalah yang dipilih secara acak ditampilkan kepada model dengan informasi identitas disembunyikan, kemudian model dapat menyitir hingga sepuluh. Pilihannya dibandingkan dengan seleksi acak, sementara setiap putaran menambahkan 120 makalah yang ditulis AI ke koleksi putaran berikutnya.
Dalam eksperimen yang diperluas, 120 makalah yang baru dihasilkan masuk ke koleksi setelah setiap putaran, secara bertahap meningkatkan proporsi riset yang ditulis AI.
Dalam pengujian pendahuluan, model cenderung menyitir sebagian besar makalah yang ditampilkan, biasanya memilih 22 hingga 27 dari 30. Peneliti kemudian menetapkan batas maksimum sepuluh sitasi untuk eksperimen utama, memaksa model membuat pilihan yang lebih selektif.
Di bawah ini kami melihat ringkasan desain eksperimen yang dihasilkan:

Pengaturan eksperimental yang digunakan untuk menguji preferensi sitasi. Studi dimulai dengan 120 makalah nyata dan menguji sebelas model dari tiga vendor, menggunakan set acak 30 makalah dengan maksimum sepuluh sitasi. Putaran selanjutnya menambahkan makalah yang dihasilkan AI, memperluas koleksi menjadi 1.440 makalah.
Eksperimen awal menggunakan sebelas model dari tiga penyedia utama: OpenAI diwakili oleh GPT-5, GPT-5 mini, GPT-4.1 dan GPT-4.1 mini; Google oleh Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro dan Gemini 3.1 Flash-Lite; serta Anthropic oleh Claude Opus 4.8, Claude Sonnet 4.6 dan Claude Haiku 4.5.
Dalam hasil pengujian yang ditampilkan di bawah, kami melihat seberapa banyak masing-masing model memusatkan sitasinya pada kelompok kecil makalah; berapa banyak makalah yang sepenuhnya diabaikan; dan seberapa konsisten model membuat pilihan yang sama ketika eksperimen diulang:

Hasil pengujian yang menunjukkan seberapa kuat masing-masing model memusatkan sitasinya pada makalah tertentu dan berapa banyak makalah yang sepenuhnya diabaikan. ‘Top-10% share’ menunjukkan berapa banyak sitasi yang menuju ke 12 makalah paling disukai, sementara ‘HHI’ mengukur seberapa terkonsentrasinya sitasi secara keseluruhan. ‘Reliability’ menunjukkan seberapa konsisten masing-masing model memfavoritkan makalah yang sama di seluruh pengujian, dan ρ menunjukkan seberapa mirip preferensi tersebut antar model. Baris ‘Matched null’ menunjukkan apa yang diharapkan jika makalah dipilih secara acak.
Apa yang Sebenarnya Difavoritkan oleh Model-Model?
Preferensi tersebut ternyata didominasi oleh isi makalah itu sendiri. Misalnya, untuk GPT-5 mini, sekitar 90% variasi dalam makalah yang difavoritkan dapat dikaitkan dengan isi, bukan faktor seperti urutan daftar, kebisingan generasi, atau metadata fiktif yang melekat pada setiap makalah. Efek ‘isi dominan’ yang sama juga direproduksi pada GPT-4.1 mini.
Peta preferensi (lihat di bawah) juga hampir tidak berubah ketika judul dan abstrak secara substansial ditulis ulang sementara maknanya dipertahankan. Dalam empat tes parafrase yang berhasil, korelasi 0,95–0,99 diperoleh, meskipun model berbeda dari tiga vendor digunakan untuk penulisan ulang.
Perubahan pada peta preferensi hanya terlihat ketika makna mendasar diubah secara signifikan:

Hasil pengujian yang membandingkan preferensi sitasi di antara sebelas model. Angka-angka menunjukkan seberapa dekat setiap pasangan model memfavoritkan makalah yang sama, dengan nilai lebih tinggi menunjukkan kesepakatan yang lebih besar. Meskipun ada perbedaan antara model dan vendor, preferensi secara luas serupa ditemukan di seluruh kelompok.
Model-model tersebut tampaknya merespons terutama pada konten semantik daripada pemilihan kata tertentu. Namun, alasan kesepakatan kuat mereka tidak dapat ditentukan secara pasti.
Mungkin, menurut penulis, konsensus sitasi umum telah terserap selama pelatihan. Kemungkinan alternatif adalah bahwa penilaian serupa tentang apa yang menjadi makalah ‘yang dapat disitasi’ dapat dicapai secara independen.
Dengan demikian keberadaan preferensi bersama telah dibuktikan, namun asal usul akhirnya masih belum diketahui.
Penulis menyarankan bahwa penggunaan AI secara luas dalam penelitian dapat mempersempit ragam karya yang mendapat perhatian, karena model yang berbeda cenderung memfavoritkan banyak makalah yang sama; dan seiring akumulasi literatur yang dihasilkan AI, preferensi bersama ini dapat semakin diperkuat melalui sitasi berulang, membuat riset yang kurang difavoritkan semakin sulit ditemukan. Oleh karena itu, keberagaman sitasi dan pemantauan konsentrasi sitasi diusulkan sebagai langkah pengaman yang mungkin.
Tolok ukur studi untuk konsentrasi sitasi berulang kini tersedia di GitHub.
Kesimpulan
Opini Sebagai seseorang yang membaca sejumlah besar makalah riset AI setiap minggu, saya telah menyaksikan ‘gelombang sitasi’ datang dan pergi. Salah satu pilar yang terus ada adalah Attention Is All You Need milik Google, makalah Transformers asli, yang kini pasti sudah menjadi bagian kode tetap dalam templat pengajuan.
Pelanggar berulang lainnya, selama waktu lama, adalah karya 2014 Generative Adversarial Networks, meskipun pada akhirnya frekuensinya digantikan oleh Denoising Diffusion Probabilistic Models dan studi berbasis difusi lainnya.
Dalam hampir semua kasus, sitasi ‘berulang’ ini tidak salah secara mutlak; namun mereka sering terlalu luas untuk menjadi dukungan yang berguna bagi makalah yang mengutipnya; dan dalam arti itu, mereka menyerupai ‘pencucian sitasi’ – penyertaan kutipan sumber yang ‘andal’ namun terutama dekoratif, untuk memberikan kesan kredibilitas dengan usaha minimal.
Terbit pertama pada Senin, 24 Agustus 2026. Diubah pada 23:07 EET untuk menambahkan bentuk jamak yang hilang.












