Η γωνία του Anderson

Γεννήνοντας και Αναγνωρίζοντας Προπαγάνδα με Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Νέα έρευνα από τις Ηνωμένες Πολιτείες και το Катαρ προσφέρει ένα καινοτόμο μέσο για την αναγνώριση ψευδών ειδήσεων που έχουν γραφτεί με τον τρόπο που οι άνθρωποι πραγματικά γράφουν ψευδείς ειδήσεις – ενσωματώνοντας ανακριβείς δηλώσεις σε ένα κυρίως αληθινό контέκστ και χρησιμοποιώντας δημοφιλείς τεχνικές προπαγάνδας όπως εμφάνιση αρχών και φορτισμένη γλώσσα.

Το έργο έχει οδηγήσει στη δημιουργία ενός νέου συνόλου δεδομένων για την ανίχνευση ψευδών ειδήσεων που ονομάζεται PropaNews, το οποίο ενσωματώνει αυτές τις τεχνικές. Οι συγγραφείς του μελέτης έχουν διαπιστώσει ότι οι ανιχνευτές που εκπαιδεύονται στο νέο σύνολο δεδομένων είναι 7,3-12% πιο ακριβείς στην ανίχνευση ανθρωπογενών ψευδών ειδήσεων σε σύγκριση με προηγούμενες μεθόδους.

Από το νέο έγγραφο, παραδείγματα 'εμφάνισης αρχών' και 'φορτισμένης γλώσσας'. Πηγή: https://arxiv.org/pdf/2203.05386.pdf

Από το νέο έγγραφο, παραδείγματα ‘εμφάνισης αρχών’ και ‘φορτισμένης γλώσσας’. Πηγή: https://arxiv.org/pdf/2203.05386.pdf

Οι συγγραφείς ισχυρίζονται ότι, κατά τη γνώση τους, το έργο είναι το πρώτο που ενσωματώνει τεχνικές προπαγάνδας (αντί για απλή ανακρίβεια) σε παραδείγματα κειμένου που παράγονται από μηχανή για την τροφοδότηση ανιχνευτών ψευδών ειδήσεων.

Η πλειονότητα των πρόσφατων εργασιών σε αυτό το πεδίο, υποστηρίζουν, έχει μελετήσει την προκατάληψη ή έχει αναδιατυπώσει δεδομένα ‘προπαγάνδας’ στο контέκστ της προκατάληψης (αμφισβητούμενο λόγω του ότι η προκατάληψη έγινε ένα υψηλά χρηματοδοτούμενο τομέα της μηχανικής μάθησης στην εποχή μετά την Analytica).

Οι συγγραφείς δηλώνουν:

‘Σε αντίθεση, η δουλειά μας παράγει ψευδείς ειδήσεις ενσωματώνοντας τεχνικές προπαγάνδας και διατηρώντας την πλειονότητα των σωστών πληροφοριών. Έτσι, η προσέγγισή μας είναι πιο κατάλληλη για τη μελέτη της άμυνας ενάντια σε ανθρωπογενείς ψευδείς ειδήσεις.’

Επιπλέον, εικονογραφούν την αυξανόμενη επείγουσα ανάγκη για πιο εξελιγμένες τεχνικές ανίχνευσης προπαγάνδας*:

‘[Ανθρωπογενείς] ψευδείς ειδήσεις, οι οποίες συχνά χρησιμοποιούνται για να χειραγωγούν ορισμένες πληθυσμούς, είχαν καταστροφικές επιπτώσεις σε πολλά γεγονότα, όπως τις προεδρικές εκλογές των ΗΠΑ το 2016, το Brexit, την πανδημία του COVID-19 και την πρόσφατη επίθεση της Ρωσίας στην Ουκρανία. Έτσι, είμαστε σε επείγουσα ανάγκη για einen μηχανισμό άμυνας ενάντια σε ανθρωπογενείς ψευδείς ειδήσεις.’

Το έγγραφο έχει τον τίτλο Δημιουργώντας Ψευδείς Ειδήσεις για Πραγματικές Ψευδείς Ειδήσεις: Γεννήνοντας Δεδομένα Προπαγάνδας και προέρχεται από πέντε ερευνητές από το Πανεπιστήμιο του Ιλινόις Urbana-Champaign, το Πανεπιστήμιο Κολούμπια, το Πανεπιστήμιο Hamad Bin Khalifa στο Катαρ, το Πανεπιστήμιο του Ουάσινγκτον και το Ινστιτούτο Allen για την Μηχανική Μάθηση.

Ορίζοντας την Αλήθεια

Η πρόκληση της ποσοτικής αξιολόγησης της προπαγάνδας είναι σε μεγάλο βαθμό μια λογιστική πρόκληση: είναι πολύ ακριβό να雇ujete ανθρώπους για να αναγνωρίσουν και να ανα注ηθούν πραγματικά υλικά με χαρακτηριστικά προπαγάνδας για ένταξη σε ένα σύνολο δεδομένων, και πιθανότατα πολύ φθηνότερο να εξαγάγετε και να χρησιμοποιήσετε υψηλό επίπεδο χαρακτηριστικών που είναι πιθανό να δουλεύουν σε ‘αόρατα’, μελλοντικά δεδομένα.

Στη служία μιας πιο κλιμακωτής λύσης, οι ερευνητές αρχικά συγκέντρωσαν ανθρωπογενείς ψευδείς ειδήσεις από πηγές ειδήσεων που θεωρούνται χαμηλές σε фактиτική ακρίβεια, μέσω του ιστότοπου Media Bias Fact Check.

Βρήκαν ότι το 33% των άρθρων που μελετήθηκαν χρησιμοποιούσαν δόλιες τεχνικές προπαγάνδας, συμπεριλαμβανομένων ερωτημάτων που προκαλούν συναισθήματα, λογικών παραλλαγών και εμφάνισης αρχών. Ένα επιπλέον 55% των άρθρων περιείχαν ανακριβείς πληροφορίες μεικτές με ακριβείς πληροφορίες.

Γεννήνοντας Εμφάνιση Αρχών

Η εμφάνιση αρχών έχει δύο χρήσεις: την αναφορά ανακριβών δηλώσεων και την αναφορά完全 fictitious δηλώσεων. Η έρευνα εστιάζει στη δεύτερη περίπτωση.

Από το νέο έργο, η πλατφόρμα Natural Language Inference RoBERTa αναγνωρίζει δύο weitere παραδείγματα εμφάνισης αρχών και φορτισμένης γλώσσας.

Από το νέο έργο, η πλατφόρμα Natural Language Inference RoBERTa αναγνωρίζει δύο weitere παραδείγματα εμφάνισης αρχών και φορτισμένης γλώσσας.

Με στόχο τη δημιουργία μηχανικής προπαγάνδας για το νέο σύνολο δεδομένων, οι ερευνητές χρησιμοποίησαν την προ-εκπαιδευμένη αρχιτεκτονική seq2seq BART για να αναγνωρίσουν σημαντικές προτάσεις που θα μπορούσαν να τροποποιηθούν αργότερα σε προπαγάνδα.既然 δεν υπήρχε δημόσιο διαθέσιμο σύνολο δεδομένων σχετικό με αυτήν την εργασία, οι συγγραφείς χρησιμοποίησαν ένα μοντέλο εξαγωγικής περίληψης που προτάθηκε το 2019 για να εκτιμήσουν τη σαφήνεια της πρότασης.

Για ένα άρθρο από κάθε εφημερίδα που μελετήθηκε, οι ερευνητές αντικατέστησαν αυτές τις ‘σημαδεμένες’ προτάσεις με ψευδείς επιχειρήματα από ‘αρχές’ που προέρχονται τόσο από την υπηρεσία Wikidata Query Service όσο και από αρχές που αναφέρονται στα άρθρα (δηλαδή άτομα και/ή οργανώσεις).

Γεννήνοντας Φορτισμένη Γλώσσα

Φορτισμένη γλώσσα περιλαμβάνει λέξεις, συχνά συναισθηματικά επιθετικά και επιρρήματα (όπως στο παραπάνω εικονογραφημένο παράδειγμα), που περιέχουν έμφυτες αξιολογικές κρίσεις που είναι εμβυθισμένες στο контέκστ της παρουσίασης ενός γεγονότος.

Για να εξαγάγετε δεδομένα σχετικά με τη φορτισμένη γλώσσα, οι συγγραφείς χρησιμοποίησαν ένα σύνολο δεδομένων από μια μελέτη του 2019 που περιείχε 2.547 φορτισμένη γλώσσα περιπτώσεις.既然 δεν περιείχαν όλα τα παραδείγματα στη μελέτη του 2019 συναισθηματικά επιθετικά ή επιρρήματα, οι ερευνητές χρησιμοποίησαν SpaCy για να thực hiện ανάλυση εξάρτησης και Part of Speech (PoS) tagging, διατηρώντας μόνο τις κατάλληλες περιπτώσεις για ένταξη στο πλαίσιο.

Η διαδικασία φίλτρου οδήγησε σε 1.017 δείγματα έγκυρης φορτισμένης γλώσσας. Một άλλο παράδειγμα BART χρησιμοποιήθηκε για να μασκάρει και να αντικαταστήσει σημαντικές προτάσεις στο αρχικό έγγραφο με φορτισμένη γλώσσα.

Σύνολο Δεδομένων PropaNews

Μετά από ενδιάμεση εκπαίδευση μοντέλου που διεξήχθη στο σύνολο δεδομένων CNN/DM του 2015 από την Google Deep Mind και το Πανεπιστήμιο του Οξφόρδου, οι ερευνητές δημιούργησαν το σύνολο δεδομένων PropaNews, μετατρέποντας μη τριβές άρθρα από ‘αξιόπιστες’ πηγές όπως Η Νέα Υόρκη Τάιμς και Ο Φύλακας σε ‘τροποποιημένες’ εκδόσεις που περιέχουν κατασκευασμένη αλγοριθμική προπαγάνδα.

Το πείραμα μοντελοποιήθηκε σε μια μελέτη του 2013 από το Χановέρ, η οποία αυτόματα δημιούργησε χρονολογικές περίληψεις ιστοριών ειδήσεων σε 17 γεγονότα ειδήσεων και συνολικά 4.535 ιστορίες.

Η γεννημένη ψευδής πληροφορία υποβεβληθή στην 400 μοναδικών εργατών στο Amazon Mechanical Turk (AMT), που καλύπτουν 2000 ανθρώπινες εργασίες (HITs). μόνο τα άρθρα προπαγάνδας που θεωρήθηκαν ακριβή από τους εργαζόμενους περιλαμβάνονταν στην τελική έκδοση του PropaNews. Η διαιτησία για τις διαφωνίες αξιολογήθηκε με τη μέθοδο Worker Agreement With Aggregate (WAWA).

Η τελική έκδοση του PropaNews περιέχει 2.256 άρθρα, ισορροπημένα μεταξύ ψευδών και πραγματικών εξόδων, 30% των οποίων χρησιμοποιούν εμφάνιση αρχών, με ένα επιπλέον 30% που χρησιμοποιούν φορτισμένη γλώσσα. Το υπόλοιπο περιέχει απλά ανακριβείς πληροφορίες του τύπου που έχει κυρίως πλημμυρίσει προηγούμενα σύνολα δεδομένων σε αυτόν τον ερευνητικό τομέα.

Τα δεδομένα χωρίστηκαν σε 1.256:500:500 σε εκπαιδευτικές, δοκιμαστικές και επικύρωσης διανομές.

Σύνολο Δεδομένων HumanNews

Για να αξιολογήσουν την αποτελεσματικότητα των εκπαιδευμένων ρουτινών ανίχνευσης προπαγάνδας, οι ερευνητές συγκέντρωσαν 200 ανθρωπογενείς άρθρα ειδήσεων, συμπεριλαμβανομένων άρθρων που ανακρίβονται από το Politifact και δημοσιεύονται μεταξύ 2015-2020.

Αυτά τα δεδομένα επικεντρώθηκαν με επιπλέον ανακρίβειες άρθρα από μη αξιόπιστες πηγές ειδήσεων και το σύνολο των δεδομένων ελέγχθηκε από ένα μεταπτυχιακό φοιτητή της επιστήμης του υπολογιστή.

Το τελικό σύνολο δεδομένων, με τίτλο HumanNews, περιλαμβάνει επίσης 100 άρθρα από την Εφημερίδα του Λος Άντζελες.

Δοκιμές

Η διαδικασία ανίχνευσης ήταν αντιπαρατεθειμένη με προηγούμενες πλαισιακά σε δύο μορφές: PN-Silver, η οποία αγνοεί την επικύρωση του AMT, και PN-Gold, η οποία περιλαμβάνει την επικύρωση ως κριτήριο.

Ανταγωνιστικά πλαισιακά περιελάμβαναν την προσφορά του 2019 Grover-GEN, το 2020 Fact-GEN, και FakeEvent, όπου άρθρα από το PN-Silver αντικαθίστανται με έγγραφα που παράγονται από παλαιότερες μεθόδους.

Εκδοχές του Grover και του RoBERTa αποδείχθηκαν οι πιο αποτελεσματικές όταν εκπαιδεύτηκαν στο νέο σύνολο δεδομένων PropaNews, με τους ερευνητές να συμπεραίνουν ότι ‘οι ανιχνευτές που εκπαιδεύτηκαν στο PropaNews έχουν καλύτερη απόδοση στην αναγνώριση ανθρωπογενών ψευδών ειδήσεων σε σύγκριση με την εκπαίδευση σε άλλα σύνολα δεδομένων’.

Οι ερευνητές παρατηρούν επίσης ότι ακόμη και το ημι-ακρωτηριασμένο σύνολο δεδομένων PN-Silver υπερέχει των παλαιότερων μεθόδων σε άλλα σύνολα δεδομένων.

Εξαντλημένο;

Οι συγγραφείς επαναλαμβάνουν την έλλειψη ερευνών μέχρι σήμερα σχετικά με την αυτοματοποιημένη γεννήτηση και αναγνώριση προπαγάνδας-κεντρικών ψευδών ειδήσεων και προειδοποιούν ότι η χρήση μοντέλων που εκπαιδεύτηκαν σε δεδομένα πριν από κρίσιμα γεγονότα (όπως το COVID ή, αμφισβητούμενο, η τρέχουσα κατάσταση στην ανατολική Ευρώπη) δεν μπορεί να αναμενθεί να λειτουργήσει οπτιμαλιστικά:

‘Περίπου το 48% των ανακριβών ανθρωπογενών ψευδών ειδήσεων οφείλεται στην αδυναμία απόκτησης δυναμικής γνώσης από νέες πηγές ειδήσεων. Για παράδειγμα, τα άρθρα σχετικά με το COVID δημοσιεύονται συνήθως μετά το 2020, ενώ το ROBERTA προ-εκπαιδεύτηκε σε άρθρα ειδήσεων που κυκλοφόρησαν πριν από το 2019. Είναι πολύ δύσκολο για το ROBERTA να ανιχνεύσει ψευδείς ειδήσεις για τέτοια θέματα, εκτός εάν ο ανιχνευτής είναι εξοπλισμένος με τις ικανότητες απόκτησης δυναμικής γνώσης από άρθρα ειδήσεων.’

Οι συγγραφείς σημειώνουν επίσης ότι το RoBERTa επιτυγχάνει ακρίβεια 69,0% για την ανίχνευση ψευδών ειδήσεων όπου το υλικό δημοσιεύεται πριν από το 2019, αλλά πέφτει σε ακρίβεια 51,9% όταν εφαρμόζεται σε άρθρα ειδήσεων που δημοσιεύονται μετά από αυτή τη ημερομηνία.

Παλτερίσματα και Κοντέκστ

Αν και η μελέτη δεν αντιμετωπίζει άμεσα αυτό, είναι δυνατό ότι αυτό το είδος βαθιάς εμβάπτισης στη σημασιολογική επίδραση θα μπορούσε τελικά να αντιμετωπίσει πιο υπονόμευες αποδοτικότητες της γλώσσας, όπως παλτερίσματα – η αυτοεξυπηρετική και επιλεκτική χρήση αληθινών δηλώσεων για την απόκτηση ενός επιθυμητού αποτελέσματος που μπορεί να αντιταχθεί στο φαντασμένο πνεύμα και σκοπό της υποστηρικτικής απόδειξης που χρησιμοποιείται.

Μια σχετική και ελαφρώς πιο ανεπτυγμένη γραμμή ερευνών σε NLP, οπτική ανίχνευση και πολυμεσική έρευνα είναι η μελέτη του контέκστ ως एक προσάρτημα της σημασίας, όπου η επιλεκτική και αυτοεξυπηρετική ανακατανομή ή ανα-κοντεξουαλίωση αληθινών γεγονότων γίνεται ισοδύναμη με μια προσπάθεια να προκαλέσει μια διαφορετική αντίδραση από εκείνη που τα γεγονότα θα μπορούσαν να έχουν υπό κανονικές συνθήκες, εάν είχαν παρουσιαστεί σε μια πιο σαφή και γραμμική μορφή.

 

* Η μετατροπή των εσωτερικών αναφορών των συγγραφέων σε απευθείας συνδέσμους.

Πρώτη δημοσίευση 11ης Μαρτίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai