Anderson’un Açısı

Bilim Gazeteciliğinde Abartı Tespiti için NLP Yaklaşımı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Danimarka’dan araştırmacılar, gazetecilerin yeni bilimsel araştırma makalelerinin sonuçlarını abartılı bir şekilde sunmalarını ve raporlamalarını önlemek amacıyla bir “abartı tespiti” sistemi geliştirdiler. Çalışma, COVID-19’a ilişkin yeni yayınlanan araştırmaların haber kanallarında nasıl çarpıtıldığıyla ilgili sorunların boyutu nedeniyle yapıldı, ancak yazarlar, bu sistemin genel bilim haberleri sektörünün geniş bir bölümüne uygulanabileceğini kabul ediyor.

Makale, Kopenhag Üniversitesi’nden geliyor ve sorunların, yayınların orijinal araştırma bağlantılarını içermemesi eğiliminden kaynaklandığını belirtiyor – bu, orijinal makaleyi değiştirmeye ve yeniden raporlanan özeti “kaynak bilgi” olarak sunmaya çalışan giderek daha yaygın bir gazetecilik uygulaması.

Makaleden, bilimsel makalelerin abartılı bir şekilde sunulması.

Makaleden, bilimsel makalelerin abartılı bir şekilde sunulması. Kaynak: https://arxiv.org/pdf/2108.13493.pdf

Sorun, yalnızca dış gazetecilerin yeni makalelere tepkisiyle sınırlı değil, aynı zamanda üniversitelerin ve araştırma kurumlarının iç PR çabaları, haber ajanslarının dikkatini çekmeye yönelik tanıtım materyalleri ve gazetecilerin “ısırdığı” zaman ortaya çıkan faydalı referans bağlantılarını da içerebilir.

Araştırmacılar, Natural Language Processing (NLP) kullanarak bir dizi basın açıklaması ve özeti birleştiren yeni bir veri seti oluşturdular ve bilimsel abartının tespiti için “[daha gerçekçi bir görev formülasyonu]” geliştirdiklerini iddia ediyorlar. Araştırmacılar, çalışmanın kodunu ve verilerini GitHub‘da yakın zamanda yayınlamayı vaat ettiler.

Abartılı Haberlerin Önlenmesi

Bir dizi çalışma, son otuz yıl içinde bilimsel abartılı haberlerin sorununa dikkat çekti ve bu durumun yanlış bilgilendirmeye yol açabileceğini vurguladı. Geçmişteki Amerikan bilim sosyologu Dorothy Nelkin, 1987’de kitabında Bilimi Satmak: Basın Nasıl Bilim ve Teknolojiyi Haberleştiriyor bu konuya dikkat çekti; 2006 Embo raporu Başlıklarda Kötü Bilim daha çok bilim eğitimi almış gazetecilere ihtiyaç olduğunu vurguladı, tıpkı internetin geleneksel medyaya kritik bütçe baskısı getirdiği gibi.

Dahası, 2014’te British Medical Journal bu sorunu bir raporda ele aldı; ve 2019’da Wellcome Open Research’ten bir çalışma, bilimsel makalelerin abartılı sunmasının (hiçbir fayda sağlamadığını, yani ulaşım veya trafik açısından hiçbir yarar sağlamadığını) gösterdi.

Salgın, bu abartılı haberlerin olumsuz etkilerini kritik bir noktaya getirdi ve çeşitli bilgi platformları, Google Arama motoru sonuç sayfası ve Cornell Üniversitesi’nin Arxiv bilimsel makale indeksi, COVID ile ilgili görünen herhangi bir içeriğe otomatik olarak uyarı eklemeye başladı.

COVID ile ilgili aramalar ve içerik için değiştirilen arayüzler, Google arama sonuçları sayfasından ve Cornell Üniversitesi'nin etkili Arxiv bilimsel makale deposundan.

COVID ile ilgili aramalar ve içerik için değiştirilen arayüzler, Google arama sonuçları sayfasından ve Cornell Üniversitesi’nin etkili Arxiv bilimsel makale deposundan.

Önceki projeler, bilim makaleleri için abartı tespiti sistemleri oluşturmak amacıyla NLP’yi kullanmaya çalıştı, bunlar arasında 2019’da Hong Kong ve Çin’den araştırmacıların işbirliği ve Danimarka’dan 2017’de yapılan bir başka çalışma vardı.

Araştırmacılar, bu önceki çalışmaların PubMed ve EurekAlert’ten özetler ve basın açıklamalarından alınan iddiaların “güç” için etiketlenmiş veri setlerini geliştirdiklerini ve bunları görülmeyen verilerde “iddia gücü” tahmin etmek için makine öğrenimi modellerini eğitmek için kullandıklarını belirtiyorlar.

MT-PET

Yeni araştırma, bir basın açıklaması ve özeti birleşik bir veri varlığı olarak birleştirir ve ortaya çıkan veri setini MT-PET’de kullanır, bu da 2020’de sunulan Pattern Exploiting Training araştırmasının çok görevli bir versiyonudur.

Hiçbir mevcut veri seti görev için uygun bulunmadı ve ekip bu nedenle uzmanlar tarafından abartma eğilimlerine göre değerlendirilen basın açıklamaları ve ilgili özetlerinkine benzer cümlelerden oluşan yeni bir veri seti oluşturdu.

Araştırmacılar, desen-sözelleyici çiftleri otomatik olarak oluşturmak için PETAL adlı birkaç-shot metin sınıflandırma çerçevesini kullandılar ve sonra verilerde tekrarlayarak yaklaşık eşdeğer çiftler bulundu: abartı tespiti ve iddia gücü için.

‘Altın’ test verisi, önceki araştırmalardan geri kazanıldı ve 823 basın açıklaması ve özeti çiftinden oluşuyordu. Araştırmacılar, 2014 BMJ verisinin olası kullanımını reddettiler, çünkü bu paraphrased.

Bu süreç, abartı ve iddia gücü için etiketlenmiş 663 özeti ve basın açıklaması çiftinden oluşan bir veri seti elde edildi. Araştırmacılar, 100’ünü few-shot öğrenme eğitim verisi olarak rastgele örnekledi, 553 örneği ise test için ayırdı. Ayrıca, bir basın açıklaması veya özette ana sonucu temsil edip etmediğine göre sınıflandırılan 1.138 cümleden oluşan küçük bir eğitim seti oluşturuldu.

Test

Araştırmacılar, yaklaşımı üç yapılandırmada test etti: yalnızca etiketlenmiş verilerle tam olarak denetimli bir ayar; tek görevli bir PET senaryosu; ve ikincil bir görev olarak bir formülasyon ipliği ekleyen yeni MT-PET.

Araştırmacılar, MT-PET’nin test ortamlarında temel PET sonuçlarını iyileştirdiğini ve iddia gücünün tanımlamanın abartı tespiti için yumuşak etiketli eğitim verisi üretmeye yardımcı olduğunu buldu. Ancak makale, özellikle iddia gücü ile ilgili bazı testlerde, profesyoneller tarafından etiketlenmiş verilerin varlığının gelişmiş sonuçlarda bir faktör olabileceğini belirtiyor.

Buna rağmen, araştırmacılar MT-PET’nin “doğrudan neden-sonuç iddialarını daha zayıf iddialardan ayırt etmede ve kaynak ve hedef belgelerdeki ifadelerin bireysel iddia gücünü sınıflandırıp karşılaştırmada” yardımcı olduğunu kếtüllerine ekliyorlar.

Sonuç olarak, çalışma MT-PET’nin daha geniş bir bilim makaleleri yelpazesine (sağlık sektörünün dışında) uygulanabileceğini ve gazetecilerin bilim makaleleri hakkında daha iyi özetler üretmesine yardımcı olacak yeni araçların temelini oluşturabileceğini öne sürüyor (bu, belki de naif bir şekilde, gazetecilerin iddia gücünü bilgisizlikten dolayı abarttıklarını varsayar). Ayrıca, araştırmacıların karmaşık fikirleri açıklamak için daha net bir dil kullanmasına yardımcı olabilir. Ayrıca, makale şöyle diyor:

‘[bu] makalede rapor edilen öngörülü performans sonuçlarının, bilim gazetecileri tarafından yazılmış basın açıklamaları için olduğu ve daha güçlü bir şekilde bilim makalelerini basitleştiren basın açıklamaları için daha kötü sonuçlar beklenabileceği’

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai