Anderson’un Açısı

Bilim Makalelerinde AI Slop’uyla Mücadele

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AI, ölçekli olarak her şeyi yapıyor; DOS saldırısı seviyesinde web kazımaden, bilimsel araştırma gönderilerinin bu kadar büyük hacimler üretmesine veya mümkün kılınmasına kadar, sonuç hem lojistik bir kriz hem de bir kalite krizi haline geliyor, çünkü sinyal‑gürültü oranı giderek yönlendirilemez bir hâle geliyor.

Geçen hafta, ön baskı sunucusu arXiv duyurdu ki göndericiler için yeni bir oran sınırlama politikası uygulamaya konulacak; artık ayda iki gönderimle sınırlı olacaklar. Açıklamaya göre, bu önlem kısa bir zaman diliminde gönderim oranlarındaki baş döndürücü artışa yanıt olarak alınmış:

Ocak 2024'ten Eylül 2026'ya kadar arXiv'in cs.AI kategorisine aylık gönderimler, dönem boyunca altı katın üzerinde bir artışı gösteriyor. Kaynak - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Ocak 2024’ten Eylül 2026’ya kadar arXiv’in cs.AI kategorisine aylık gönderimler, dönem boyunca altı katın üzerinde bir artışı gösteriyor. Kaynak

Kat Boboris’in hareketi duyuran blog gönderisi, geçen Perşembe Hacker News’te yorum aldı, arXiv’in Eylül 2026’da 40.363 gönderim aldığı; bu, Eylül 2024’te alınan 20.569’un neredeyse iki katı ve Eylül 2016’da alınan 9.869’un dört katından fazladır.

Boboris’in gözlemlediği en son ayın gönderimleri, aynı zamanda arXiv personeli ve moderatörleri için neredeyse 9.000 destek bileti oluşturdu:

‘Moderatörlerimiz, dar kapsamlı ince makalelerde ve bir çalışmanın bölünerek daha küçük makaleler seti olarak gönderildiği ‘salami’ makalelerde bir artış gözlemliyor.’

‘Yoğun, AI tarafından yazılmış makalelerde de belirgin bir artış var. AI araçları, yazarların arXiv ve diğer depoları bu düşük değerli makalelerle doldurmasını kolaylaştırıyor.’

Bu yıl Mayıs ayında, arXiv denetimsiz AI içeriği için bir bir yıllık yasak uygulamaya koymuştu; ve geçen yıl Ekim’de, anket makaleleri ve konum makaleleri (ikisi de tam bir akademik çalışmadan daha az çabayla üretilebilen) göndericilerine, arXiv’de yayınlanabilmek için akran desteği gerektirecek şeklinde bir uyarı yapmıştı.

Şimdilik, arXiv alanının sık sık engelleyici http istek sınırlaması çok belirgin değil ve çok faydalı RSS beslemelerinin bu süregelen geri çekilmeye rağmen ayakta kalmasını umabiliriz. Geçen hafta Reddit duyurdu uzun zamandan beri korkulan RSS beslemelerinin tamamen ortadan kaldırılacağını; bu, gelecek ayın ortasından itibaren gerçekleşecek. Ancak, arXiv’in kar amacı gütmeyen statüsü, zorunlu site ziyaretlerine yönlendirerek elde edilebilecek benzer sermaye çok azdır, ya da zorunlu oturum açmalar – en azından şimdilik.

Yükselen Dalgaya Karşı

AI kullanımının bilim araştırmalarındaki olumsuz etkisi etrafında ciddi ve artan sorunlar bulunurken – özellikle AI ile ilgili araştırmalar, gölgelemiş tüm diğer kategorileri ve gizlilikten çıkarak politik ve ekonomik bir gösterge haline gelmiştir – son zamanlarda, AI ile ilgili makale gönderimlerinin kalite düşüşüne karşı yollar araştıran bir araştırma dalı ortaya çıkmıştır.

Problemi ele alan en son çalışma, Güney Kore’nin Seul Ulusal Üniversitesi ile ABD’deki Minnesota Üniversitesi arasındaki iş birliği şeklinde geliyor. makale, Bilim mi Yoksa Saçma mı?: AI Tarafından Üretilen Makalelerde Bilimsel Saçmalığı Ölçme ve Azaltma başlıklı, bir makalenin iddiaları, kanıtları, atıfları ve yapısı arasındaki bağlantılardaki başarısızlıklar üzerinden ‘bilimsel saçmalığı’ ölçmeyi öneriyor:

Yeni makaleden, çalışmanın 'bilimsel saçmalık' yaklaşımının bir genel bakışı; yapıda, argümanda ve destekleyici artefaktlardaki başarısızlıkların geleneksel AI metin algılayıcıların kaçırdığı zayıflıkları nasıl ortaya koyabileceğini gösteriyor. Kaynak - https://arxiv.org/pdf/2610.00531

Yeni makaleden, çalışmanın ‘bilimsel saçmalık’ yaklaşımının bir genel bakışı; yapıda, argümanda ve destekleyici artefaktlardaki başarısızlıkların geleneksel AI metin algılayıcıların kaçırdığı zayıflıkları nasıl ortaya koyabileceğini gösteriyor. Kaynak

Önceki yaklaşımların aksine, yeni sistem metnin ötesine bakarak bir makalenin iddialarının argümanları, kanıtları ve atıflarıyla düzgün bir şekilde desteklenip desteklenmediğini değerlendirir. Yazarlar şu ifadeyi kullanıyor*:

‘Bir makalenin her bölümü izole edildiğinde makul görünebilir, bu yüzden bu tür bozulmalar token düzeyindeki algılayıcılar için görünmez ve yalnızca bütün makale seviyesinde tanımlanabilir veya onarılabilir. Bilimsel saçmalığı ölçmek ve azaltmak için bu makale üç zorluğu ele alıyor.’

‘İlk olarak, token düzeyindeki metrikler bilimsel akıl yürütmenin bir makale boyunca nasıl bağlandığını yakalayamaz. Bölümler, iddialar, atıflar, kanıtlar ve artefaktlar her biri makul görünebilirken, aralarındaki ilişkiler bozulabilir. Bu tür başarısızlıkları uçtan uca AI tarafından üretilen makalelerde tekrar tekrar gözlemliyoruz ve ICLR incelemecileri bunları insan tarafından yazılmış gönderilerde bile zaten cezalandırıyor.

‘İkinci, bu kalıpların tespiti ölçülmemiştir. Mevcut test setleri yalnızca metni etiketliyor, bu yüzden tüm makaleyi okuyan LLM’ler dahil detektörlerin bu kalıpları ne ölçüde tanımladığı hiç ölçülmemiştir.

‘Üçüncü, bu kalıplar güvenilir bir şekilde azaltılması zordur. Token‑seviyesi sinyaller parafraz yapılarak kaldırılabilir, bu kalıpları onarmak ise eksik ilişkileri, temel bilimi değiştirmeden yeniden tesis etmeyi gerektirir.

Yazarların yeni ölçütü, SciSlopBench olarak adlandırılan, SciSlopHarness içine entegre edilmiştir; bu, bir makalenin bilimsel akıl yürütmesindeki hataları tespit edip onarmak, aynı zamanda temel bilimsel kanıtları korumak üzere tasarlanmış bir çerçevedir:

SciSlopHarness tarafından yapılan revizyonlarla hatalı pasajların karşılaştırıldığı örnekler. Desteklenmeyen eklemeler reddedilir, iddialar ise gerek duyulduğunda kanıtları daha iyi yansıtacak şekilde yeniden sıralanır veya yeniden yazılır.

SciSlopHarness tarafından yapılan revizyonlarla hatalı pasajların karşılaştırıldığı örnekler. Desteklenmeyen eklemeler reddedilir, iddialar ise gerek duyulduğunda kanıtları daha iyi yansıtacak şekilde yeniden sıralanır veya yeniden yazılır.

SciSlopBench ölçütü, benzer bir araştırma problemi ve katkı türüne sahip insan tarafından yazılmış bir makaleyle eşleştirilen 390 AI‑tarafından üretilmiş makaleden oluşturulmuştur.

Testlerde, SciSlopBench 390 makale çiftini ayırt etmek için kullanıldı; her çift, yukarıda belirtilen AI‑tarafından üretilmiş makale ve araştırma problemi ve katkı türü açısından eşleşen bir insan‑yazısı makaleden oluşuyordu. Ölçüt, bu karşılaştırmaların %85,9’unda AI‑tarafından üretilen makaleyi doğru bir şekilde tanımlayarak geleneksel AI‑metin detektörlerinden çok daha üstün bir performans sergiledi.

Yazarlar şöyle diyor:

‘Standart revizyonlar artık slop bırakırken ve doğrudan slop‑farkındalıklı istemler ödül manipülasyonuna yol açarken, SciSlopHarness insan‑yapay boşluğunu en güçlü revizyon temeline göre %63 azaltıyor ve insan referans hedeflerine ihtiyaç duymuyor.

‘Genel olarak, AI‑tarafından üretilen bilimsel makaleler küresel akıl yürütmelerinde temel izler bırakıyor ve sorumlu hafifletmenin yalnızca metin iyileştirmesinden ziyade sıkı kanıta dayalı temellere dayanması gerektiğini gösteriyoruz.’

Makaleye yapılan katkıların yanı sıra, yazarlar yeni çalışmalarının ilkelerini, kullanıcıların bilimsel makaleleri göndererek içerdiği AI slop miktarını analiz edebilecekleri bir canlı demo şeklinde hayata geçirmiştir.

İlginç bir şekilde, demo tarafından analiz edilen yeni makale, ‘moderate’ slop skoru 40/100† puanında geliyor:

Yeni makale, kendi algoritmasıyla analiz edildiğinde, yazarların yeni süreciyle belirlenen 'slop' alanlarını işaretler. Kaynak: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Yeni makale, kendi algoritmasıyla analiz edildiğinde, yazarların yeni süreciyle belirlenen ‘slop’ alanlarını işaretler. Kaynak

Yöntem ve Veri Yaklaşımı

2025 iş birliği Why Slop Matters, AI slop’un tanımlayıcı özelliği olarak ‘yüzeysel yetkinlik’i tanımlamış; görünür kalite, öz eksikliğini gizliyormuş. Yeni çalışma bu kavramı daha spesifik olarak bilimsel makalelere uygulayarak ‘bilimsel slop’u, bir çalışmanın nasıl düzenlendiğini, iddialarının nasıl desteklendiğini ve yöntemlerinin ve kanıtlarının nasıl incelenebileceğini takip etmeyi zorlaştıran hatalar olarak tanımlıyor; bu hatalar yapı; argüman; ve artefakt olarak gruplanmaktadır:

Ölçüm kuralları, ölçütte kullanılan altı tür bilimsel slop için. Tablo, her ölçümde neyin incelendiğini, puanın nasıl hesaplandığını ve 1'lik maksimum puanın neyi temsil ettiğini gösterir; daha yüksek puanlar daha kapsamlı hataları gösterir.

Ölçüm kuralları, ölçütte kullanılan altı tür bilimsel slop için. Tablo, her ölçümde neyin incelendiğini, puanın nasıl hesaplandığını ve 1’lik maksimum puanın neyi temsil ettiğini gösterir; daha yüksek puanlar daha kapsamlı hataları gösterir.

Makalede tanımlanan altı bilimsel slop ölçütü şunlardır: bölüm‑arası referanslar (bölümlerin makaledeki diğer materyale anlamlı bir şekilde atıfta bulunup bulunmadığı); makro tekrarlama (daha sonraki bölümlerin önceki materyali tekrarlayıp tekrarlamadığı); argüman grafiği (iddiaların önceden yapılan akıl yürütme ile uygun şekilde desteklenip desteklenmediği); atıf izolasyonu (atıfların yüzeysel kullanılıp kullanılmadığı, atıf yapılan çalışmaların makaleyle ya da birbirleriyle nasıl ilişkili olduğu açıklanıp açıklanmadığı); şekil açıklaması (yöntem şekillerinin yöntemi gerçekten açıklayıp açıklamadığı); ve kanıt boşluğu (rapor edilen sonuçların somut örneklerle desteklenip desteklenmediği).

Ölçüt, AI‑tarafından üretilen makalelerin, FARS ve 2025 Agents4Science yarışmasından seçilen karşılaştırılabilir/ eşdeğer insan‑yazısı makalelerle eşleştirilmesiyle oluşturulmuştur.

Her makine tarafından oluşturulan FARS makalesi için, araştırmacılar atıflarını aynı türde, üst düzey bir dergide kabul edilmiş insan tarafından yazılmış bir makaleyle aradılar ve ardından araştırma konusuna göre en yakın eşleşmeyi seçerek 143 çift ürettiler. Agents4Science makaleleri de benzer şekilde insan yazımı karşılıklarıyla eşleştirildi, ek olarak 247 çift daha üretildi ve toplamda benchmark 390 AI‑insan çifti oldu. Makaleler yaşam, sosyal ve doğa bilimlerini kapsıyor, ancak veri seti bilgisayar bilimlerine ağırlıklı olarak eğilimlidir.

Metrikler için performans, insan makalesinin AI karşıtı üzerine ne sıklıkla sıralandığını ölçen PairAcc ve farklı eşiklerde insan ve AI makaleleri arasındaki genel ayrımı ölçen AUROC kullanılarak değerlendirildi. Yazarlar ayrıca insan makaleleri için yanlış pozitif oranı %5 olarak sabitlendiğinde tespit performansını rapor ediyor.

Testler

İlk testlerde SciSlop, AI‑metin algılayıcıları Binoculars; DetectGPT; ve NTS†† ile ve ayrıca otomatik inceleme sistemleri AI Scientist Reviewer ve CycleReviewer ile karşılaştırıldı.

Son revizyon testleri için dört temel çizgi kullanıldı: temel istemleme; Claude Code; inceleyici‑tabanlı iyileştirme; ve slop‑farkındalıklı revizyon. İlk üçüne yalnızca makaleyi iyileştirmek için genel talimatlar verilirken, slop‑farkındalıklı revizyona ayrıca tespit edilen slop’un tanımları ve konumları sağlandı. Hepsi, eşdeğer revizyon koşulları altında SciSlopHarness ile karşılaştırıldı.

Uygulama için, metin algılayıcılarına makalenin düz metni verilirken, diğer yöntemlere makale kaynağı ve gerektiğinde koduna erişim sağlandı. Binoculars Falcon-7B temel ve talimat modellerini kullandı; DetectGPT T5-3B kullanarak 100 bozulma üretti; AI Scientist Qwen2.5-32B-Instruct kullandı; ve CycleReviewer yayınladığı 8B kontrol noktasını kullandı. Falcon’un 2.048 token sınırını aşan makaleler için, örtüşmeyen pencereler ayrı ayrı puanlanıp ortalaması alındı.

İlk tespit sonuçları aşağıdaki iki tabloda ayrıntılı olarak verilmiştir: SciSlop %85.9 PairAcc elde ederken, Binoculars için %68.7 ve en güçlü otomatik inceleyici için %68.5 değerleriyle karşılaştırıldığında hata oranını yarıdan fazla azalttı:

SciSlop ile AI‑metin algılayıcıları ve otomatik inceleyicileri karşılaştıran tespit sonuçları, ayrıca altı bireysel slop ölçümü için sonuçlar. SciSlop en yüksek genel PairAcc değerine ulaşırken, kesit referansları en güçlü bireysel sonucu sunar.

Tespit sonuçları, SciSlop’u AI‑metin algılayıcıları ve otomatik inceleyicilerle karşılaştırarak, ayrıca altı bireysel slop ölçümü için sonuçları gösterir. SciSlop en yüksek genel PairAcc değerine ulaşırken, kesit referansları en güçlü bireysel sonucu sağlar.

Kesit referansları tek başına özellikle güçlü bir performans sergileyerek %90.5 PairAcc elde etti ve model gerektirmeden AI tarafından üretilen makalelerin %65’ini %5 yanlış pozitif oranında tespit etti; bu, Binoculars için %24 ile karşılaştırıldığında daha yüksektir.

Yazarlar, bu sonuçların makale içindeki ilişkilerin bu veri setinde geleneksel metin‑seviyesi tespitten daha güçlü bir AI üretim sinyali sağladığını ve ayrıca daha sonra revizyon için hedef alınabilecek belirli zayıflıkları ortaya çıkardığını savunuyor.

Bilimsel slop ile insan değerlendirmeleri arasındaki ilişki daha sonra incelendi. Aşağıdaki ilk sütunda gösterildiği gibi, daha yüksek slop, genel puanlama, sağlamlık, sunum ve katkı için daha düşük ICLR skorlarıyla ilişkilendirildi:

SciSlop’un AI‑metin algılayıcıları ve otomatik inceleyicileri ile ICLR inceleme sonuçları karşısındaki karşılaştırması. Sol panel AI benzerliğini inceleme puanlarıyla gösterirken; orta panel bireysel inceleme boyutlarını karşılaştırır; sağ panel ise dokuz yıl boyunca reddedilen ve kabul edilen makaleleri ayırt etmedeki performansı gösterir.

SciSlop’un AI‑metin algılayıcıları ve otomatik inceleyicileri ile ICLR inceleme sonuçları karşısındaki karşılaştırması. Sol panel AI benzerliğini inceleme puanlarıyla gösterirken; orta panel bireysel inceleme boyutlarını karşılaştırır; sağ panel ise dokuz yıl boyunca reddedilen ve kabul edilen makaleleri ayırt etmedeki performansı gösterir.

Reddedilen ve kabul edilen makaleler de incelenen dokuz yılın tamamında şansa göre daha iyi ayrıştırıldı, ancak geleneksel algılayıcılar çoğu karşılaştırmada şansın altında kaldı.

Bu nedenle bilimsel slop, yalnızca AI yazarlığının bir işareti olarak işlev görmekten ziyade, insan inceleyiciler tarafından zaten cezalandırılan zayıflıkları yansıttığı bulundu.

Son testler, SciSlopHarness’ın daha genel revizyon sonrası kalan slopu kaldırıp kaldıramadığını inceledi. Aşağıda gösterildiği gibi, harness altı ölçümde insan ortalamasına en yakın sonucu verirken, genel revizyon genellikle önemli miktarda slop bırakıyor ve doğrudan slop‑farkındalıklı revizyon bazen aşırı düzeltme yapıyordu:

SciSlopHarness ile dört temel yöntemin altı slop ölçümü üzerindeki revizyon sonuçları karşılaştırması. Sıfıra daha yakın değerler insan‑makale ortalamasına daha yakındır; SciSlopHarness genellikle bu seviyeye doğru ilerlerken, slop‑farkındalıklı revizyon sık sık bu seviyeyi aşmaktadır.

SciSlopHarness’i altı slop ölçüsü üzerinden dört temel yöntemle karşılaştıran revizyon sonuçları. Sıfıra daha yakın değerler, insan makalesi ortalamasına daha yakındır; SciSlopHarness genellikle bu seviyeye doğru ilerlerken, slop‑bilinçli revizyon sık sık bu seviyeyi aşmaktadır.

Önerilen her değişiklik, makalenin bilimsel gerekçesi ve destekleyici kanıtlarıyla karşılaştırıldı; desteklenmeyen düzenlemeler reddedildi. Altı ölçümde, insan‑yazılı makalelerle kalan fark, en güçlü revizyon temeli olan Claude Code ile karşılaştırıldığında %63 azaldı.

Sonuç

Bu parçayı yazarken, sadece bu makalenin kendi demo sitesinde ne kadar düşük puan aldığını not almak ilginçti; aynı zamanda araştırma makalelerinde son zamanlarda küçük ama artan bir lanet haline gelen en az bir ‘tembel’ ya da ‘kozmetik’ atıf örneği†† gözlemlemek de dikkat çekiciydi.

Bu tür durumlarda, bu belirli makalenin ötesinde, araştırmacılar mevcut literatürle anlamlı bir etkileşimde bulunmak yerine kendi bilgilerine dayanıyor gibi görünüyor. Ancak, ‘çalışmalarını gösterme’ geleneğiyle sınırlı olduklarından, atıflar genellikle sabırsızlık ya da sürece karşı bir küçümseme olarak algılanabilecek bir şekilde sunuluyor ve çoğu zaman okuyucunun çok sayıda referansı yeterli bir ‘kök’ olarak kabul etmesine dayanıyor; bu da aşırı incelemeler karşısında dayanamayacak bir durumdur.

Arxiv, AI destekli gönderim endüstrileşmesine karşı mücadele ediyor; yeterli ölçekli bir felaket olmadan, araştırmalarda AI’nın doğrudan katılımına benzer kısıtlamaların getirileceği ise henüz belli değil.

 

* Yazarların vurguları, benimkiler değil – ancak gerektiğinde yazarların satır içi atıflarını hiperlinklere dönüştürdüm.

† Yazarlar kendi makalelerinde sıfır AI kullanımı iddia etmiyor ve bu kullanımı ayrıntılandırıyor.

†† Okuyucuya ilginç gelebilir ki, yazarların sağladığı bağlantı ilgili olmadığı için NTS çerçevesi için doğru bir bağlantıyı kendim bulmak zorunda kaldım – bu da SciSlop’un odaklandığı ölçütlerden biri!

İlk yayın Pazar, 4 Ekim 2026

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai