Sudut Anderson
Melawan AI Slop dalam Makalah Ilmiah

AI melakukan segala sesuatu secara skala besar, mulai dari web scraping tingkat serangan DOS hingga menghasilkan, atau memungkinkan, volume yang sangat besar pengajuan penelitian ilmiah sehingga hasilnya menjadi baik krisis logistik maupun krisis kualitas, karena rasio sinyal‑to‑noise terus menjadi tidak dapat dinavigasi.
Minggu lalu, server preprint arXiv mengumumkan bahwa mereka akan memberlakukan kebijakan pembatasan laju baru bagi pengirim, yang kini dibatasi maksimal dua pengajuan per bulan. Langkah ini diambil, menurut pengumuman tersebut, di tengah lonjakan tajam dalam tingkat pengajuan selama periode waktu singkat:

Pengajuan bulanan ke kategori cs.AI arXiv dari Januari 2024 hingga September 2026, menunjukkan peningkatan lebih dari enam kali lipat selama periode tersebut. Sumber
Posting blog Kat Boboris yang mengumumkan langkah tersebut, yang menarik komentar di Hacker News Kamis lalu, menyatakan bahwa arXiv menerima 40,363 pengajuan pada September 2026 – hampir dua kali lipat dari 20,569 yang diterima pada September 2024, dan lebih dari empat kali lipat dari 9,869 yang diterima pada September 2016.
Pengajuan bulan terakhir, menurut Boboris, juga menghasilkan hampir 9,000 tiket dukungan untuk staf dan moderator arXiv:
‘Moderator kami mengamati peningkatan makalah tipis dengan ruang lingkup sempit, serta makalah ‘salami’, di mana satu karya dipecah dan diajukan sebagai serangkaian makalah yang lebih kecil.
‘Ada juga peningkatan yang jelas dalam makalah padat yang ditulis AI. Alat AI memudahkan penulis untuk membanjiri arXiv dan repositori lain dengan makalah bernilai rendah ini.’
Sudah, pada Mei tahun ini, arXiv mengambil langkah dengan menerapkan larangan satu tahun untuk konten AI yang tidak terkontrol; dan pada Oktober tahun lalu, mereka memberi tahu pengirim makalah survei dan makalah posisi (keduanya dapat dihasilkan dengan usaha lebih sedikit dibandingkan studi akademik lengkap) bahwa mereka memerlukan dukungan sejawat agar dapat dipublikasikan di arXiv.
Untuk saat ini, pembatasan permintaan http yang sering menghalangi pada domain arXiv tidak terlalu terlihat, dan hanya dapat berharap bahwa RSS feed yang sangat berguna tetap bertahan dalam pengetatan berkelanjutan ini. Minggu lalu Reddit mengumumkan penghapusan total RSS feed yang lama ditakuti, yang akan berlangsung mulai pertengahan bulan depan. Namun, status nirlaba arXiv berarti ada sedikit modal serupa yang dapat diperoleh dengan mengarahkan pembaca ke kunjungan situs wajib, atau login yang dipaksakan – setidaknya, untuk saat ini.
Melawan Arus yang Meningkat
Menghadapi masalah yang parah dan semakin berkembang terkait dampak negatif penggunaan AI dalam penelitian ilmiah – terutama mengenai penelitian terkait AI, yang telah mengalahkan semua kategori lain, dan naik dari ketidaktahuan menjadi sebuah penanda politik dan ekonomi, belakangan ini – sebuah aliran penelitian muncul yang meneliti cara-cara untuk melawan penurunan kualitas pengajuan makalah terkait AI.
Yang terbaru untuk mengatasi masalah ini muncul dalam bentuk kolaborasi antara Universitas Nasional Seoul di Korea dan Universitas Minnesota di AS. Makalah, berjudul Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, mengusulkan pengukuran ‘scientific slop’ melalui kegagalan dalam hubungan antara klaim, bukti, sitasi, dan struktur makalah:

Dari makalah baru, ikhtisar pendekatan kerja terhadap ‘scientific slop’, menunjukkan bagaimana kegagalan dalam struktur, argumen, dan artefak pendukung dapat mengungkap kelemahan yang terlewat oleh detektor teks AI konvensional. Sumber
Berbeda dengan pendekatan sebelumnya, sistem baru ini melihat melampaui teks itu sendiri untuk menilai apakah klaim makalah didukung secara tepat oleh argumen, bukti, dan sitasinya. Penulis menyatakan*:
‘Setiap bagian makalah dapat tampak masuk akal secara terpisah, sehingga kerusakan semacam itu tidak terlihat oleh detektor tingkat token dan hanya dapat diidentifikasi atau diperbaiki pada tingkat keseluruhan makalah. Untuk mengukur dan mengurangi scientific slop, makalah ini menangani tiga tantangan.
‘Pertama, metrik tingkat token gagal menangkap bagaimana penalaran ilmiah terhubung di seluruh makalah. Bagian, klaim, sitasi, bukti, dan artefak masing-masing dapat tampak masuk akal sementara hubungan di antara mereka mengalami kerusakan. Kami berulang kali mengamati kegagalan semacam itu dalam makalah yang dihasilkan AI secara menyeluruh, dan reviewer ICLR sudah memberi penalti bahkan pada pengajuan yang ditulis manusia.
‘Kedua, deteksi pola-pola ini belum diukur. Set tes yang ada hanya memberi label pada teks, sehingga sejauh mana detektor, termasuk LLM yang membaca seluruh makalah, mengidentifikasi pola-pola ini belum pernah diukur.
‘Ketiga, pola-pola ini sulit diatasi secara andal. Sementara sinyal tingkat token dapat dihilangkan dengan memparafrasekan, memperbaiki pola-pola ini memerlukan pemulihan hubungan yang hilang tanpa mengubah ilmu dasar.’
Benchmark baru penulis, yang dinamai SciSlopBench, telah diwujudkan ke dalam SciSlopHarness, sebuah kerangka kerja yang dirancang untuk mendeteksi dan memperbaiki kegagalan dalam penalaran ilmiah sebuah makalah, sambil mempertahankan bukti ilmiah yang mendasarinya:

Contoh perbandingan bagian yang cacat dengan revisi yang dibuat oleh SciSlopHarness. Penambahan yang tidak didukung ditolak, sementara klaim diurutkan ulang atau ditulis ulang bila diperlukan untuk lebih mencerminkan bukti yang tersedia dalam makalah.
Benchmark SciSlopBench sendiri dibangun dari 390 makalah yang dihasilkan AI, masing-masing dipasangkan dengan makalah yang ditulis manusia yang membahas masalah riset serupa dan jenis kontribusi yang sama.
Dalam pengujian, SciSlopBench digunakan untuk membedakan antara 390 pasang makalah, dengan setiap pasangan terdiri dari makalah AI yang disebutkan di atas, dan makalah yang ditulis manusia yang cocok untuk masalah riset dan jenis kontribusi. Benchmark tersebut berhasil mengidentifikasi makalah AI dalam 85,9% perbandingan ini, secara signifikan melampaui detektor teks AI konvensional.
Penulis menyatakan:
‘Sementara revisi standar meninggalkan slop residual dan pemicu prompting yang sadar slop langsung memicu reward hacking, SciSlopHarness mengurangi kesenjangan AI–manusia yang tersisa sebesar 63% dibandingkan baseline revisi terkuat tanpa memerlukan target referensi manusia.
‘Secara keseluruhan, kami menunjukkan bahwa makalah ilmiah yang dihasilkan AI meninggalkan jejak fundamental dalam penalaran global mereka, dan bahwa mitigasi yang bertanggung jawab membutuhkan dasar bukti yang ketat daripada sekadar penyempurnaan prosa.’
Selain kontribusi yang dibuat oleh makalah itu sendiri, penulis telah mengoperasionalkan prinsip‑prinsip karya baru mereka dalam bentuk demo langsung di mana pengguna dapat mengirimkan makalah ilmiah untuk analisis jumlah AI slop yang terkandung.
Menariknya, makalah baru itu sendiri, yang dianalisis oleh demo, memperoleh skor slop ‘sedang’ sebesar 40/100†:

Makalah baru, yang dianalisis oleh algoritma sendiri, menandai area ‘slop’ yang diidentifikasi oleh proses baru penulis. Sumber
Pendekatan Metode dan Data
Kolaborasi 2025 Mengapa Slop Penting menggambarkan ‘kompetensi dangkal’ sebagai karakteristik utama AI slop, di mana kualitas yang tampak menyembunyikan kurangnya substansi. Karya baru ini menerapkan ide tersebut secara lebih spesifik pada makalah ilmiah, mendefinisikan ‘slop ilmiah’ sebagai kegagalan yang menyulitkan untuk mengikuti bagaimana sebuah studi diatur; bagaimana klaimnya didukung; dan bagaimana metode serta bukti dapat diperiksa, dengan kegagalan dikelompokkan menjadi struktur; argumen; dan artefak:

Aturan pengukuran untuk enam jenis slop ilmiah yang digunakan dalam benchmark. Tabel menunjukkan apa yang diperiksa untuk setiap ukuran, bagaimana skor dihitung, dan apa yang diwakili oleh skor maksimum 1, dengan skor yang lebih tinggi menunjukkan kegagalan yang lebih luas.
Enam ukuran slop ilmiah yang didefinisikan dalam makalah adalah referensi lintas bagian (apakah bagian-bagian merujuk secara bermakna ke materi di tempat lain dalam makalah); makro redundansi (apakah bagian selanjutnya mengulang materi sebelumnya); graf argumen (apakah klaim didukung secara tepat oleh penalaran sebelumnya); isolasi sitasi (apakah sitasi digunakan secara dangkal, tanpa menjelaskan bagaimana karya yang disitasi berhubungan dengan makalah atau satu sama lain); penjelasan gambar (apakah gambar metode benar-benar menjelaskan metode); dan kekosongan bukti (apakah hasil yang dilaporkan didukung oleh contoh konkret).
Benchmark tersebut dibangun dengan mempasangkan makalah yang dihasilkan AI dengan makalah yang ditulis manusia yang sebanding/ekivalen, dengan makalah AI dikurasi dari FARS dan kompetisi 2025 Agents4Science.
Untuk setiap makalah FARS yang dihasilkan mesin, peneliti mencari sitasinya untuk menemukan makalah yang ditulis manusia dengan tipe yang sama yang telah diterima di venue tingkat atas, dan kemudian memilih pasangan terdekat berdasarkan topik penelitian, menghasilkan 143 pasang. Makalah Agents4Science juga dipasangkan dengan rekan yang ditulis manusia, menghasilkan tambahan 247 pasang, sehingga benchmark menjadi total 390 pasang AI-manusia. Makalah-makalah tersebut mencakup ilmu kehidupan, sosial, dan alam, meskipun dataset ini sangat berat ke arah ilmu komputer.
Untuk metrik, kinerja dievaluasi menggunakan PairAcc, yang mengukur seberapa sering makalah manusia diperingkat di atas rekan AI-nya; dan AUROC, yang mengukur pemisahan keseluruhan antara makalah manusia dan AI pada berbagai ambang. Penulis juga melaporkan kinerja deteksi ketika tingkat positif palsu untuk makalah manusia tetap pada 5%.
Pengujian
Pengujian awal membandingkan SciSlop dengan detektor teks AI Binoculars; DetectGPT; dan NTS††, serta sistem tinjauan otomatis AI Scientist Reviewer dan CycleReviewer.
Untuk pengujian revisi selanjutnya, empat baseline digunakan: base prompting; Claude Code; reviewer-based refinement; dan slop-aware revision. Tiga pertama hanya menerima instruksi umum untuk memperbaiki makalah, sementara slop-aware revision juga diberikan definisi dan lokasi slop yang terdeteksi. Semua dibandingkan dengan SciSlopHarness di bawah kondisi revisi yang setara.
Untuk implementasi, detektor teks diberikan prosa makalah, sementara metode lain menerima sumber kode makalah dan, bila diperlukan, akses ke kodenya. Binoculars menggunakan Falcon-7B model dasar dan instruksi; DetectGPT menggunakan T5-3B untuk menghasilkan 100 perturbasi; AI Scientist menggunakan Qwen2.5-32B-Instruct; dan CycleReviewer menggunakan checkpoint 8B yang dirilis. Untuk makalah yang melebihi batas token 2.048 milik Falcon, jendela non‑overlapping dinilai secara terpisah dan dirata‑rata.
Hasil deteksi awal dirinci dalam dua tabel di bawah ini: SciSlop mencapai 85,9% PairAcc, dibandingkan dengan 68,7% untuk Binoculars dan 68,5% untuk reviewer otomatis terkuat, memotong tingkat kesalahan lebih dari setengah:

Hasil deteksi yang membandingkan SciSlop dengan detektor teks AI dan reviewer otomatis, bersama dengan hasil untuk enam ukuran slop individunya. SciSlop mencapai PairAcc keseluruhan tertinggi, sementara referensi lintas‑bagian memberikan hasil individu terkuat.
Referensi lintas‑bagian tampil sangat kuat secara mandiri, mencapai 90,5% PairAcc tanpa memerlukan model, dan mendeteksi 65% makalah yang dihasilkan AI pada tingkat positif palsu 5%, dibandingkan dengan 24% untuk Binoculars.
Penulis berargumen bahwa hasil ini menunjukkan bahwa hubungan antar bagian makalah memberikan sinyal AI yang lebih kuat dibandingkan deteksi tingkat teks konvensional pada dataset ini, sekaligus mengidentifikasi kelemahan spesifik yang kemudian dapat ditargetkan untuk revisi.
Hubungan antara slop ilmiah dan penilaian manusia terhadap kualitas makalah selanjutnya dianalisis. Seperti ditunjukkan di kolom pertama di bawah, slop yang lebih tinggi terkait dengan skor ICLR yang lebih rendah untuk penilaian keseluruhan, ketegasan, presentasi, dan kontribusi:

Perbandingan SciSlop dengan detektor teks AI dan reviewer otomatis terhadap hasil tinjauan ICLR. Panel kiri menunjukkan kemiripan AI terhadap skor tinjauan; tengah membandingkan dimensi tinjauan individu; kanan menunjukkan kinerja dalam membedakan makalah yang ditolak dan yang diterima selama sembilan tahun.
Makalah yang ditolak dan yang diterima juga dapat dibedakan di atas peluang acak selama semua sembilan tahun yang diperiksa, sementara detektor konvensional berada di bawah peluang acak pada sebagian besar perbandingan.
Slop ilmiah karenanya ditemukan mencerminkan kelemahan yang sudah dihukum oleh reviewer manusia, bukan hanya berfungsi sebagai sinyal kepenulisan AI.
Pengujian akhir memeriksa apakah SciSlopHarness dapat menghilangkan slop yang tersisa setelah revisi umum. Seperti ditunjukkan di bawah, harness selesai paling dekat dengan rata‑rata manusia pada semua enam ukuran, sementara revisi umum sering meninggalkan slop yang signifikan dan revisi slop‑aware kadang‑kadang berlebihan:

Hasil revisi yang membandingkan SciSlopHarness dengan empat metode dasar pada enam ukuran slop. Nilai yang lebih dekat ke nol lebih mendekati rata‑rata makalah manusia, dengan SciSlopHarness umumnya bergerak menuju level ini sementara revisi yang sadar slop sering melampauinya.
Setiap perubahan yang diusulkan diperiksa terhadap penalaran ilmiah makalah dan bukti pendukungnya, dengan edit yang tidak didukung ditolak. Pada enam ukuran, kesenjangan yang tersisa dari makalah yang ditulis manusia berkurang sebesar 63% dibandingkan Claude Code, baseline revisi terkuat.
Kesimpulan
Menarik, dalam proses menulis artikel ini, untuk mencatat tidak hanya betapa buruknya skor makalah ini di situs demo mereka sendiri, tetapi juga mengamati setidaknya satu contoh sitasi ‘malas’ atau ‘kosmetik’††, yang belakangan ini menjadi kutukan kecil namun semakin meningkat dalam makalah penelitian.
Dalam kasus seperti itu, di luar makalah khusus ini, para peneliti tampaknya mengandalkan pengetahuan mereka sendiri daripada terlibat secara bermakna dengan literatur yang ada. Namun, dibatasi oleh konvensi untuk ‘menunjukkan pekerjaan mereka’, sitasi sering disertakan dengan apa yang terasa seperti ketidaksabaran, bahkan rasa tidak hormat terhadap proses, dan sering tampak mengandalkan pembaca untuk menerima banyaknya referensi sebagai ‘lapisan’ asal usul yang cukup, meskipun tidak akan bertahan dari pemeriksaan yang berlebihan.
Arxiv sedang melawan industrialisasi pengajuan yang digerakkan AI; apakah akan ada batasan serupa pada keterlibatan langsung AI dalam penelitian, tanpa adanya bencana terkait dengan skala yang cukup, masih belum dapat dipastikan.
* Penekanan penulis, bukan saya – tetapi konversi saya bila perlu dari sitasi sebaris penulis menjadi tautan hiperteks.
† Para penulis tidak mengklaim tidak ada penggunaan AI dalam makalah mereka sendiri, dan merinci penggunaan tersebut.
†† Mungkin menarik bagi pembaca untuk mengetahui bahwa saya harus mencari tautan yang tepat sendiri untuk kerangka NTS, karena tautan yang disediakan penulis tidak relevan – salah satu metrik yang menjadi fokus SciSlop!
Pertama kali dipublikasikan Minggu, 4 Oktober 2026












