Anderson’un Açısı

Bilimsel Edebiyata AI Tarafından Oluşturulan Dillerin Kirlenmesi Başlıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Fransa ve Rusya’dan araştırmacılar, GPT-3 gibi AI sürücüleri olasılıksal metin oluşturucularının ‘işkenceye uğramış dil’, var olmayan literatürün alıntıları ve kredisi verilmeyen görüntü yeniden kullanımını bilimsel literatürün yayımlanması için previously respectable kanallara soktuklarını gösteren bir çalışma yayınladılar.

Belki de en endişe verici olan şey, incelenen makalelerin aynı zamanda nesnel ve sistematik bir araştırma olarak sunulan bilimsel olarak yanlış veya tekrarlanamayan içeriğe sahip olmasıdır. Bu, generatif dil modellerinin yalnızca yazarların sınırlı İngilizce becerilerini güçlendirmek için değil, aynı zamanda araştırma ile ilgili zor işi yapmak için, genellikle de kötü bir şekilde, kullanıldığını gösteriyor.

Rapor, Toulouse Üniversitesi Bilgisayar Bilimi Bölümü’nden araştırmacılar ve Yandex araştırmacısı Tel Aviv Üniversitesi’ndeki Alexander Magazinov tarafından derlenmiştir.

Çalışma, özellikle Elsevier Dergisi Mikroişlemciler ve Mikrobilgisayarlar‘da görülen bilimsel yayınlardaki anlamsız AI tarafından oluşturulan dillerin büyümesiyle ilgileniyor.

Her Şey Bir İsimle Başlar

GPT-3 gibi otoregresif dil modelleri büyük miktarda veri üzerinde eğitilir ve bu verileri paraphrasing, özetleme, birleştirme ve yorumlama yeteneklerine sahip oluşturucu dil modellerine dönüştürmek üzere tasarlanır. Bu modeller, orijinal verilerin amacını korurken doğal konuşma ve yazma kalıplarını yeniden üretebilir.

Bu gibi çerçeveler, model eğitim aşamasında doğrudan ve “emilmemiş” orijinal verilerin tekrarını cezalandırılır, bu nedenle eşanlamlılar aramaya yönelirler, hatta iyi kurulmuş ifadeler için bile.

Araştırmacılar tarafından keşfedilen apparently AI tarafından oluşturulan veya yardım alınan bilimsel gönderiler, makine öğrenimi sektöründe bilinen ifadeler için yaratıcı eşanlamlıların başarısız girişimlerine dair olağanüstü sayıda örnek içerir:

derin sinir ağı: ‘derin sinir organizasyonu’
sanal sinir ağı: ‘(sahte | taklit) sinir organizasyonu’
cep telefonu ağı: ‘esnek organizasyon’
ağ saldırısı:organizasyon (pusu | saldırı)’
ağ bağlantısı: ‘organizasyon bağı’
büyük veri:(büyük | devasa | muazzam | dev) bilgi’
veri ambarı: ‘bilgi (depo | dağıtım merkezi)’
sanal zeka (AI): ‘(sahte | insan yapımı) bilinç’
yüksek performanslı hesaplama: ‘üstün hesap’
bulut/sis/sisli hesaplama: ‘puslu hesap’
grafik işlem birimi (GPU): ‘tasarım hazırlama birimi’
merkezi işlem birimi (CPU): ‘ana hazırlama birimi’
iş akışı motoru: ‘iş süreci motoru’
yüz tanıma: ‘yüz tanıma’
söz tanıma: ‘konuşma tanıma’
ortalama kare hata: ‘ortalama kare (hata | yanlış)’
ortalama mutlak hata: ‘ortalama (mutlak | en yüksek) (hata | yanlış)’
sinyal gürültü oranı: ‘(hareket | işaret | gösterge | sinyal) gürültü oranı’
genel parametreler: ‘küresel parametreler’
rastgele erişim: ‘(rastgele | düzensiz) erişim’
rastgele orman: ‘(rastgele | düzensiz) orman’
rastgele değer: ‘(rastgele | düzensiz) değer’
karınca kolonisi: ‘yeraltı böceği (bölge | eyalet | alan | bölge | yerleşim)’
karınca kolonisi: ‘yeraltı haşere (bölge | eyalet | alan | bölge | yerleşim)’
kalan enerji: ‘artan enerji’
kinetik enerji: ‘hareket enerjisi’
saflık Bayes: ‘(saflık | masumiyet | güven) Bayes’
kişisel dijital asistan (PDA): ‘kişisel bilgisayarlı işbirlikçi’

2021 Mayıs ayında araştırmacılar, bu tür bozulmuş, otomatik dili aramak için Dimensions akademik arama motorunu sorguladılar. Bu noktada, Mikroişlemciler ve Mikrobilgisayarlar dergisinin, bu tür yanlış paraphrasing’in en yüksek sayıda oluşumuna sahip olduğunu gözlemlediler.

Şu anda, hala ‘derin sinir ağı’ (‘derin sinir organizasyonu’) gibi anlamsız cümleler için bilimsel makalelere ulaşmak mümkün.

Dimensions'da 'derin sinir organizasyonu' ('derin sinir ağı') arama sonuçları. Kaynak: https://app.dimensions.ai/

Dimensions’da ‘derin sinir organizasyonu’ (‘derin sinir ağı’) arama sonuçları. Kaynak: https://app.dimensions.ai/

Mikroişlemciler dergisi 1976 yılında kuruldu ve iki yıl sonra Mikroişlemciler ve Mikrobilgisayarlar olarak yeniden adlandırıldı.

Anlamsız Dilin Büyümesi

Araştırmacılar, Şubat 2018’den Haziran 2021’e kadar bir dönemi incelediler ve son iki yıl içinde, özellikle son 6-8 ay içinde, gönderilerin hacminde keskin bir artış gözlemlediler.

Korelasyon mu, neden mi? Mikroişlemciler ve Mikrobilgisayarlar dergisine gönderilerin artışı, anlamsız metin ve eşanlamlıların growth ile çakışıyor gibi görünüyor. Kaynak: https://arxiv.org/pdf/2107.06751.pdf

Korelasyon mu, neden mi? Mikroişlemciler ve Mikrobilgisayarlar dergisine gönderilerin artışı, anlamsız metin ve eşanlamlıların growth ile çakışıyor gibi görünüyor. Kaynak: https://arxiv.org/pdf/2107.06751.pdf

Araştırmacıların topladığı son veri kümesi, Toulouse Üniversitesi’nin Elsevier aboneliği aracılığıyla elde edilen 1.078 tam uzunlukta makaleden oluşuyor.

Çin Bilim Makaleleri için Azalan Editöryal Denetim

Makale, 2021 yılında işaret edilen gönderiler için editöryal değerlendirme süresi radikal olarak kısalırken, 40 güne düşerek, peer review için standard sürenin altı katına düşüşünü gözlemliyor.

En fazla sayıda işaretli makale, Çin anakarasındaki bağlılıklara sahip yazarlardan geliyor: 30 günden az sürede kabul edilen 404 makalenin %97,5’i Çin ile ilgiliydi. Buna karşılık, editöryal sürecinin 40 günden fazla sürdüğü durumlarda (615 makale), Çin’e bağlı gönderiler bu kategoride yalnızca %9,5’ini temsil ediyordu – on katlı bir dengesizlik.

Rapor, işaretli makalelerin sızmasına, editöryal sürecin eksikliklerine ve artan sayıda gönderi karşısında olası kaynak eksikliğine atıfta bulunuyor.

Araştırmacılar, GPT tarzı generatif modellerin ve benzeri dil oluşturma çerçevelerinin, işaretli makalelerin çoğunda metin oluşturmak için kullanıldığını varsayıyorlar. Ancak, bir generatif modelin kaynaklarını soyutlaştırma şekli, bunu kanıtlamayı zorlaştırıyor ve ana kanıt, kötü ve gereksiz eşanlamlıların ortak sentido değerlendirmesinde ve gönderilerin mantıksal tutarlılığının titiz bir incelemesinde yatıyor.

Araştırmacılar ayrıca, bu anlamsız dalgaya katkıda bulunduğu düşünülen generatif dil modellerinin, yalnızca problemli metinleri oluşturmakla kalmayıp, aynı zamanda onları sistemli bir şekilde tanıyıp işaretleyebileceğini gözlemliyorlar. Çalışma, GPT-2 kullanarak böyle bir uygulamayı detaylandırıyor ve gelecekteki sistemler için problemli bilimsel gönderileri tanımlamak için bir çerçeve sunuyor.

Kirlenmiş gönderilerin oranı, incelendiği diğer dergilerle karşılaştırıldığında Elsevier dergisinde çok daha yüksek (%72,1 vs %13,6 maksimum).

Yalnızca Anlamsal Değil

Araştırmacılar, söz konusu dergilerin yalnızca yanlış dili kullanmadığını, aynı zamanda bilimsel olarak yanlış ifadeler içerdiğini vurguluyor. Bu, generatif dil modellerinin yalnızca katkıda bulunan bilim insanlarının sınırlı dil becerilerini güçlendirmek için değil, aynı zamanda makalelerin temel teoremlerini ve verilerini formüle etmek için kullanıldığını gösteriyor.

Diğer durumlarda, araştırmacılar, daha önceki ve daha iyi çalışmaları soyutlayarak ve ‘yeniden sentezleyerek’ veya ‘döndürerek’, ‘yayımla veya yok ol’ akademik araştırma kültürlerinin baskılarına yanıt olarak, ulusal AI araştırma sıralamalarını artırma baskısı altında, yeni akademik makaleler oluşturmak için GPT-3 tarzı sistemlerin kullanıldığını öne sürüyorlar.

Gönderilen bir makaledeki anlamsız içerik. Bu durumda, araştırmacılar metnin, bir EDN makalesinden ad hoc olarak türetilmiş olduğunu ve eşlik eden illüstrasyonun da without attribution olarak alınmış olduğunu buldular. Orijinal içeriğin yeniden yazılması o kadar aşırı ki anlamsız hale geliyor.

Gönderilen bir makaledeki anlamsız içerik. Bu durumda, araştırmacılar metnin, bir EDN makalesinden ad hoc olarak türetilmiş olduğunu ve eşlik eden illüstrasyonun da without attribution olarak alınmış olduğunu buldular.

Birkaç Elsevier makalesini analiz eden araştırmacılar, hiçbir anlam çıkarmayı başaramadıkları cümleler, var olmayan literatüre atıflar, formüllerde aslında görünmeyen değişkenlere ve teoremlere atıflar (dil temelli soyutlama veya ‘halüsinasyon’ gibi görünüyor); ve kaynakları belirtilmeden kullanılan resimler buldular (araştırmacılar bunları telif hakkı açısından değil, bilimsel rigor eksikliği olarak eleştiriyor).

Alıntı Başarısızlıkları

Bilimsel bir makaledeki argümanları desteklemek amacıyla yapılan alıntılar, birçok işaretli örnekte ‘kırık veya ilgili olmayan yayınlara’ yol açıyor.

Ayrıca, ‘ilgili çalışma’ atıfları sıklıkla araştırmacıların ‘halüsinasyon’ tarafından üretilmiş olabilecek yazarları içeriyor.

Dalgın Dikkat

Eğitimli dil modellerinin bir başka eksikliği, uzun bir konuşma boyunca odaklanmayı kaybetme eğiliminde olmalarıdır. Araştırmacılar, işaretli makalelerin genellikle bir konuyu başlangıçta girişte veya başka bir yerde getirip daha sonra asla geri dönmediğini buldular.

Ayrıca, bazı en kötü örneklerin, kaynak metinlerin bir dizi çeviri motoru aracılığıyla birçok kez geçirilmesiyle oluşabileceğini teorileştiriyorlar.

Kaynaklar ve Nedenler

Bu olgunun arkasında neyin yattığını anlamaya çalışırken, makale yazarları beberapa olasılık öneriyorlar: ‘paper mills’ contenundan kaynaklanan hataların çok erken bir aşamada tanıtıldığı, ‘article spinning’ araçlarının plajaryazıyı masklemek için kullanıldığı ve düzenli olarak yayımlama baskısının kaynakları kısıtlı araştırmacıların GPT-3 tarzı sistemleri kullanarak yeni akademik makaleler oluşturmasına veya tamamlaymasına yol açabileceği.

Araştırmacılar, akademik yayıncılığın bu alanında daha büyük bir denetim ve standartlar için bir çağrı ile sonuçlanıyorlar. Elsevier ve diğer yayıncılara daha katı ekranlama ve inceleme prosedürleri getirme çağrısında bulunuyorlar ve bu konuda mevcut standartları ve uygulamaları eleştiriyorlar. ‘Sentetik metinlerle aldatma, bilimsel literatürün bütünlüğünü tehdit ediyor’ diyorlar.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai