Η γωνία του Anderson

Μια Προσέγγιση NLP για την Ανίχνευση Υπερβολής στη Επιστημονική Δημοσιογραφία

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές από τη Δανία έχουν αναπτύξει ένα σύστημα “ανίχνευσης υπερβολής” που έχει ως στόχο να μετριάσει τις επιπτώσεις της υπερβολικής αναφορά των επιστημονικών ερευνών από τους δημοσιογράφους όταν αναφέρουν και αναλύουν τις νέες επιστημονικές έρευνες. Το έργο αυτό έχει προκύψει λόγω του βαθμού στον οποίο οι νέες έρευνες για τον COVID-19 έχουν παραμορφωθεί στα κανάλια ενημέρωσης, αν και οι συγγραφείς παραδέχονται ότι είναι εφαρμόσιμο σε ένα ευρύ φάσμα του γενικού τομέα της επιστημονικής δημοσιογραφίας.

Το έγγραφο, με τίτλο Ημι-Επιβλεπόμενη Ανίχνευση Υπερβολής σε Δημόσιες Ανακοινώσεις Επιστημονικής Υγείας, προέρχεται από το Πανεπιστήμιο της Κοπεγχάγης και σημειώνει ότι το πρόβλημα εξαγριώνεται από την τάση των εκδόσεων να μην περιλαμβάνουν συνδέσμους πηγής προς την αρχική έρευνα – μια ολοένα και πιο συχνή δημοσιογραφική πρακτική που προσπαθεί να αντικαταστήσει την αρχική εργασία και να υποκαταστήσει την αναδημοσιευμένη περίληψη ως “γνώση πηγής” – ακόμη και όταν το έγγραφο είναι δημόσια διαθέσιμο.

Από το έγγραφο, μια τυπική εκδήλωση υπερβολής των επιστημονικών ερευνών. Πηγή: https://arxiv.org/pdf/2108.13493.pdf

Από το έγγραφο, μια τυπική εκδήλωση υπερβολής των επιστημονικών ερευνών. Πηγή: https://arxiv.org/pdf/2108.13493.pdf

Το πρόβλημα δεν περιορίζεται μόνο στην εξωτερική δημοσιογραφική αντίδραση σε νέες έρευνες, αλλά μπορεί να επεκταθεί σε άλλους τύπους περίληψης, συμπεριλαμβανομένων των εσωτερικών προσπαθειών δημοσίων σχέσεων των πανεπιστημίων και ερευνητικών ιδρυμάτων, των προωθητικών υλικών που στοχεύουν στην προώθηση της προσοχής των μέσων ενημέρωσης και των χρήσιμων αναφορών (και των πιθανών πυροβόλων για γύρους χρηματοδότησης) που συνοδεύουν όταν οι δημοσιογράφοι “δαγκώνουν”.

Το έργο αυτό αξιοποιεί την Προcessing Φυσικής Γλώσσας (NLP) ενάντια σε ένα νέο σύνολο δεδομένων από ζευγαρωμένες δημόσιες ανακοινώσεις και περίληψης, με τους ερευνητές να ισχυρίζονται ότι έχουν αναπτύξει “[μια] νέα, πιο ρεαλιστική διατύπωση εργασίας” για την ανίχνευση της επιστημονικής υπερβολής. Οι συγγραφείς έχουν υποσχεθεί να δημοσιεύσουν τον κώδικα και τα δεδομένα για το έργο στο GitHub σύντομα.

Αντιμετώπιση της Σενσασιοναλισμού

Μια σειρά από μελέτες έχουν αντιμετωπίσει το πρόβλημα του επιστημονικού σενσασιοναλισμού τα τελευταία τριάντα χρόνια περίπου, και έχουν επικεντρώσει την προσοχή στην παραπληροφόρηση που μπορεί να οδηγήσει. Η αμερικανίδα επιστημονική κοινωνιολόγος Dorothy Nelkin αντιμετώπισε το ζήτημα αξιοσημείωτα στο βιβλίο του 1987 Πώληση Επιστήμης: Πώς τα Μέσα Ενημέρωσης Καλύπτουν την Επιστήμη και την Τεχνολογία· η αναφορά Embo του 2006 Κακή Επιστήμη στις Επικεφαλίδες τόνισε την ανάγκη για περισσότερους επιστημονικά εκπαιδευμένους δημοσιογράφους, ακριβώς όπως το διαδίκτυο έφερε κρίσιμες πιέσεις προϋπολογισμού στα παραδοσιακά μέσα ενημέρωσης.

Επιπλέον, το 2014 το Βρετανικό Ιατρικό Περιοδικό έφερε το πρόβλημα στο επίκεντρο σε μια αναφορά· και μια μελέτη του 2019 από το Wellcome Open Research καθιέρωσε ότι η υπερβολή των επιστημονικών ερευνών δεν προσφέρει κανένα όφελος (σε όρους εμβέλειας ή κυκλοφορίας) στα μέσα ενημέρωσης και άλλα συστήματα αναφοράς που διεξάγουν αυτή την πρακτική.

Ωστόσο, η έλευση της πανδημίας έχει φέρει τις αρνητικές επιπτώσεις της υπερβολής σε κρίσιμο επίκεντρο, με eine σειρά από πλατφόρμες πληροφόρησης, συμπεριλαμβανομένης της σελίδας αποτελεσμάτων αναζήτησης του Google και του Arxiv του Πανεπιστημίου Κορνέλ, να προσθέτουν αυτόματα προειδοποιήσεις σε οποιοδήποτε περιεχόμενο που φαίνεται να ασχολείται με τον COVID.

Τροποποιημένες διεπαφές για αναζητήσεις και περιεχόμενο σχετικά με τον COVID, από τη σελίδα αποτελεσμάτων αναζήτησης του Google και από το επηρεστικό επιστημονικό αποθετήριο ερευνών Arxiv του Πανεπιστημίου Κορνέλ.

Τροποποιημένες διεπαφές για αναζητήσεις και περιεχόμενο σχετικά με τον COVID, από τη σελίδα αποτελεσμάτων αναζήτησης του Google και από το επηρεστικό επιστημονικό αποθετήριο ερευνών Arxiv του Πανεπιστημίου Κορνέλ.

Προηγούμενα έργα έχουν προσπαθήσει να δημιουργήσουν συστήματα ανίχνευσης υπερβολής για επιστημονικές έρευνες αξιοποιώντας την NLP, συμπεριλαμβανομένης μιας συνεργασίας μεταξύ ερευνητών από το Χονγκ Κονγκ και την Κίνα, και ενός άλλου (ασχετού) δανικού εγγράφου το 2017.

Οι ερευνητές της νέας εργασίας σημειώνουν ότι αυτές οι προηγούμενες προσπάθειες ανέπτυξαν συνόλους δεδομένων από αξιώματα από περίληψεις και ανακοινώσεις από το PubMed και το EurekAlert, που επισημαίνονται για “δύναμη”, και τα χρησιμοποίησαν για να εκπαιδεύσουν μοντέλα μηχανικής μάθησης για να προβλέψουν δύναμη αξιώματος σε μη είδη δεδομένα.

MT-PET

Η νέα έρευνα συνδυάζει μια δημόσια ανακοίνωση και μια περίληψη ως ένα συνδυασμένο οντότητα δεδομένων, και εκμεταλλεύεται το αποτέλεσμα του συνόλου δεδομένων σε MT-PET, μια πολλαπλή εργασία ικανή έκδοση της Έρευνας Εκμετάλλευσης Προτύπων που παρουσιάστηκε για πρώτη φορά το 2020 ως Εκμετάλλευση Ερωτήσεων Cloze για Few Shot Text Classification και Φυσική Γλώσσα, μια συνδυασμένη ερευνητική προσπάθεια από δύο γερμανικά ερευνητικά ιδρύματα.

Δεν βρέθηκε κανένα υπάρχον σύνολο δεδομένων να είναι κατάλληλο για την εργασία, και η ομάδα κατέληξε να δημιουργήσει ένα νέο σύνολο δεδομένων από ζευγαρωμένες προτάσεις από περίληψεις και σχετικές δημόσιες ανακοινώσεις, αξιολογημένες από “εξειδικευμένους” όρους της τάσης τους να υπερβάλλουν.

Οι ερευνητές χρησιμοποίησαν το πλαίσιο ταξινόμησης κειμένου few-shot PETAL ως μέρος μιας διαδικασίας για να αυτοματοποιήσουν την παραγωγή ζευγαρωμένων προτύπων-λεκτικών, και στη συνέχεια επαναλαμβάνοντας τη διαδικασία μέχρι να βρεθούν περίπου ισοδύναμα ζεύγη για δύο ποιότητες: ανίχνευση υπερβολής και δύναμη αξιώματος.

Τα “χρυσα” δεδομένα για δοκιμή ανακυκλώθηκαν από τις προηγούμενες ερευνητικές εργασίες, αποτελούμενα από 823 ζευγάρια περίληψεων και δημόσιων ανακοινώσεων. Οι ερευνητές απέρριψαν τη δυνατότητα χρήσης των δεδομένων του 2014 BMJ, поскольку είναι παραφρασμένα.

Αυτή η διαδικασία απέδωσε ένα σύνολο δεδομένων από 663 ζευγάρια περίληψης/δημόσιας ανακοίνωσης που επισημαίνονται για υπερβολή και δύναμη αξιώματος. Οι ερευνητές τυχαία δείγμασαν 100 από αυτά ως δεδομένα εκπαίδευσης few-shot, με 553 παραδείγματα που αποθηκεύτηκαν για δοκιμή. Επιπλέον, δημιουργήθηκε ένα μικρό σύνολο δεδομένων που αποτελείται από 1.138 προτάσεις, ταξινομημένες ως προς το αν αντιπροσωπεύουν την κύρια σύνοψη της περίληψης ή της δημόσιας ανακοίνωσης. Αυτά χρησιμοποιήθηκαν για να αναγνωρίσουν “προτάσεις σύνοψης” σε μη επισημασμένα ζευγάρια.

Δοκιμή

Οι ερευνητές δοκιμάσαν την προσέγγιση σε τρεις διαμορφώσεις: μια πλήρως εποπτευόμενη ρύθμιση με αποκλειστικά επισημασμένα δεδομένα· μια μονο-εργασία PET σενάριο· και στο νέο MT-PET, που προσθέτει einen δευτερεύοντα στόχο ως βοηθητική εργασία (καθώς ο στόχος του έργου είναι να εξετάσει δύο ξεχωριστές ποιότητες από ένα σύνολο δεδομένων με ζευγαρωμένα δεδομένα).

Οι ερευνητές βρήκαν ότι το MT-PET βελτίωσε τα βασικά αποτελέσματα του PET σε όλες τις δοκιμαστικές περιβάλλοντα, και βρήκαν ότι η αναγνώριση της δύναμης αξιώματος βοήθησε στην παραγωγή μαλακών επισημασμένων δεδομένων εκπαίδευσης για ανίχνευση υπερβολής. Ωστόσο, το έγγραφο σημειώνει ότι σε ορισμένες διαμορφώσεις μεταξύ eines σύνθετου πίνακα δοκιμών, ιδιαίτερα σε σχέση με τη δύναμη αξιώματος, η παρουσία επαγγελματικά επισημασμένων δεδομένων μπορεί να είναι ένας παράγοντας που συμβάλλει στα βελτιωμένα αποτελέσματα (σε σύγκριση με προηγούμενα ερευνητικά έργα που αντιμετωπίζουν αυτό το πρόβλημα). Αυτό θα μπορούσε να έχει επιπτώσεις στο βαθμό στον οποίο η διαδικασία μπορεί να αυτοματοποιηθεί, ανάλογα με την έμφαση δεδομένων της εργασίας.

Παρά ταύτα, οι ερευνητές καταλήγουν στο συμπέρασμα ότι το MT-PET ‘βοηθά στις πιο δύσκολες περιπτώσεις της αναγνώρισης και διαφοροποίησης των απευθείας αιτιακών αξιώματος από ασθενέστερα αξιώματα, και ότι η πιο αποτελεσματική προσέγγιση περιλαμβάνει την ταξινόμηση και τη σύγκριση της ατομικής δύναμης αξιώματος των προτάσεων από τα έγγραφα πηγής και προορισμού’.

Συμπερασματικά, η εργασία υποθέτει ότι το MT-PET δεν μόνο θα μπορούσε να εφαρμοστεί σε ένα ευρύτερο φάσμα επιστημονικών ερευνών (εκτός του τομέα της υγείας), αλλά θα μπορούσε επίσης να αποτελέσει τη βάση για νέα εργαλεία που θα βοηθούν τους δημοσιογράφους να παράγουν καλύτερες περιλήψεις επιστημονικών ερευνών (αν και αυτό, ίσως αφελώς, υποθέτει ότι οι δημοσιογράφοι υπερβάλλουν τη δύναμη αξιώματος через άγνοια), καθώς και να βοηθήσει την ερευνητική κοινότητα στην διατύπωση μιας πιο σαφούς χρήσης της γλώσσας για την εξήγηση σύνθετων ιδεών. Επιπλέον, το έγγραφο σημειώνει:

‘[πρέπει να σημειωθεί ότι τα αποτελέσματα της προβλεπτικής απόδοσης που αναφέρονται σε αυτό το έγγραφο είναι για δημόσιες ανακοινώσεις γραμμένες από επιστημονικούς δημοσιογράφους – θα μπορούσε κανείς να περιμένει χειρότερα αποτελέσματα για δημόσιες ανακοινώσεις που απλοποιούν περισσότερο τις επιστημονικές ανακοινώσεις.’

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai