Η γωνία του Anderson
MIT: Μέτρηση της μεροληπτικής κάλυψης των μέσων ενημέρωσης με τη χρήση μηχανικής μάθησης

Μια μελέτη από το MIT έχει χρησιμοποιήσει τεχνικές μηχανικής μάθησης για να αναγνωρίσει μεροληπτική φράση σε περίπου 100 από τα μεγαλύτερα και πιο επιρροήσια μέσα ενημέρωσης στις ΗΠΑ και πέραν αυτών, συμπεριλαμβανομένων 83 από τις πιο επιρροήσιες εφημερίδες. Đây είναι μια έρευνα που δείχνει τον δρόμο προς αυτοματοποιημένα συστήματα που θα μπορούσαν να ταξινομήσουν αυτόματα το πολιτικό χαρακτήρα μιας έκδοσης και να δώσουν στους αναγνώστες μια βαθύτερη κατανόηση της ηθικής στάσης ενός μέσου ενημέρωσης σε θέματα που μπορεί να αισθανθούν με πάθος.
Το έργο επικεντρώνεται στον τρόπο με τον οποίο αντιμετωπίζονται τα θέματα με συγκεκριμένες φράσεις, όπως απώνυμος μετανάστης | παράνομος μετανάστης, έμβρυο | αβorted μωρό, διαδηλωτές | αναρχικοί.
Το πρότζεκτ χρησιμοποίησε τεχνικές επεξεργασίας φυσικής γλώσσας (NLP) για να εξαγάγει και να ταξινομήσει τέτοιες περιπτώσεις “φορτισμένης” γλώσσας (με την υπόθεση ότι φαινομενικά πιο “ουδέτερες” όροι επίσης αντιπροσωπεύουν μια πολιτική στάση) σε một ευρύ χάρτη που αποκαλύπτει μεροληπτική στάση αριστερά και δεξιά σε πάνω από τρία εκατομμύρια άρθρα από περίπου 100 μέσα ενημέρωσης, οδηγώντας σε einen πλοηγό χάρτη μεροληπτικής στάσης των εκδόσεων που εξετάζονται.
Το έγγραφο προέρχεται από τους Samantha D’Alonzo και Max Tegmark στο Τμήμα Φυσικής του MIT και παρατηρεί ότι μια σειρά από πρόσφατες πρωτοβουλίες γύρω από τον “ελέγχο των γεγονότων”, μετά από πολλά σκανδάλια “ψευδών ειδήσεων”, μπορεί να ερμηνευτεί ως δόλια και να υπηρετούν τα συμφέροντα συγκεκριμένων ενδιαφερόντων. Το πρότζεκτ έχει ως στόχο να παρέχει μια πιο δεδομενο-κεντρική προσέγγιση για τη μελέτη της χρήσης μεροληπτικής γλώσσας σε ένα υποτιθέμενο ουδέτερο περιβάλλον ειδήσεων.

Ένα φάσμα (λιтерάλ) αριστερά-δεξιά φράσεων, όπως προκύπτει από τη μελέτη. Πηγή: https://arxiv.org/pdf/2109.00024.pdf
Επεξεργασία NLP
Τα δεδομένα της μελέτης προέρχονται από την ανοιχτή πηγή Newspaper3K database και αποτελούνται από 3.078.624 άρθρα από 100 μέσα ενημέρωσης, συμπεριλαμβανομένων 83 εφημερίδων. Οι εφημερίδες επιλέχθηκαν με βάση την εμβέλειά τους, ενώ τα online μέσα ενημέρωσης περιλαμβάνουν άρθρα από τον ιστότοπο ανάλυσης στρατιωτικών ειδήσεων Defense One και Science.

Τα μέσα ενημέρωσης που χρησιμοποιήθηκαν στη μελέτη.
Το έγγραφο αναφέρει ότι ο κώδικας που κατέβηκε ήταν “ελάχιστα” προεπεξεργασμένος. Οι άμεσες παραθέσεις απομακρύνθηκαν, поскольку η μελέτη ενδιαφέρεται για τη γλώσσα που επιλέγουν οι δημοσιογράφοι (αν και οι επιλογές παραθέσεων είναι από μόνα τους ένα ενδιαφέρον πεδίο μελέτης).
Οι βρετανικές ορθογραφίες μετατράπηκαν σε αμερικανικές για να стандαρδοποιηθεί η βάση δεδομένων, όλα τα σημεία στίξης αφαιρέθηκαν και όλα τα ordinal αριθμούς επίσης αφαιρέθηκαν. Η αρχική προσωρινή κεφαλαιοποίηση μετατράπηκε σε μικρά γράμματα, αλλά όλες οι άλλες κεφαλαιοποιήσεις διατηρήθηκαν.
Οι πρώτες 100.000 πιο συχνές φράσεις αναγνωρίστηκαν και τελικά κατατάχθηκαν, καθαρίστηκαν και συνδυάστηκαν σε μια λίστα φράσεων. Όλες οι περιττές γλώσσες που μπορούσαν να αναγνωριστούν (όπως “Μοιράστε αυτή την δημοσίευση” και “η δημοσίευση αναπαράχθηκε”) αφαιρέθηκαν επίσης. Οι παραλλαγές σε ουσιαστικά ταυτόσημες φράσεις (π.χ. “μεγάλη τεχνολογία” και “Big Tech”, “κυβερνοασφάλεια” και “cyber security”) стандαρδοποιήθηκαν.
‘Nutpicking’
Η αρχική δοκιμή ήταν στο θέμα “Black lives matter” και ήταν σε θέση να διακρίνει μεροληπτική φράση και συναρπαστικές συνώνυμες σε όλα τα δεδομένα.

Γενικευμένα στοιχεία για άρθρα σχετικά με το Black Lives Matter (BLM). Βλέπουμε τους ανθρώπους που συμμετέχουν σε πολιτική δράση που χαρακτηρίζονται, κυριολεκτικά και μεταφορικά, από αριστερά προς τα δεξιά, ως διαδηλωτές, αναρχικοί και, στο πιο δεξιά άκρο του φάσματος, ως ‘ριώτες’. Οι εφημερίδες που προέρχονται από τη φράση αντιπροσωπεύονται στο δεξιό πάνελ.
Ενώ “διαδηλωτές” μετατοπίζονται από “αναρχικούς” σε “ριώτες” καθώς μετακινούμαστε κατά μήκος της πολιτικής στάσης του μέσου ενημέρωσης, το έγγραφο σημειώνει ότι η εξαγωγή και ανάλυση NLP εμποδίζεται από την πρακτική του “nutpicking” – όπου ένα μέσο ενημέρωσης θα αναφέρει μια φράση που θεωρείται έγκυρη από ένα διαφορετικό πολιτικό τμήμα της κοινωνίας και μπορεί (φαινομενικά) να βασιστεί στην ανάγνωση του να θεωρήσει τη φράση αρνητικά. Το έγγραφο αναφέρει “αποχαρακτηρισμό της αστυνομίας” ως ένα παράδειγμα.
Φυσικά, αυτό σημαίνει ότι μια “αριστερή” φράση εμφανίζεται σε ένα αλλιώς δεξιό περιβάλλον και αντιπροσωπεύει μια ασυνήθιστη πρόκληση για ένα σύστημα NLP που βασίζεται σε κωδικοποιημένες φράσεις για να ενεργεί ως δείκτες για πολιτικές στάσεις.
Τέτοιες φράσεις είναι “δι-τιμής”, ενώ ορισμένες άλλες φράσεις έχουν μια τόσο καθολικά αρνητική συνnotation (π.χ. “εμβρυοκτονία”) που αντιπροσωπεύονται πάντα ως αρνητικές σε μια σειρά από μέσα ενημέρωσης.
Η έρευνα αποκαλύπτει επίσης παρόμοιες χαρτογραφήσεις για “ζέστα” θέματα όπως η άμβλωση, η λογοκρισία της τεχνολογίας, η μετανάστευση στις ΗΠΑ και ο έλεγχος των όπλων.
Ασχολίες
Υπάρχουν ορισμένες αμφιλεγόμενα πολιτικές τάσεις στα μέσα ενημέρωσης που δεν χωρίζουν προβλέψιμα με αυτόν τον τρόπο, όπως το θέμα των στρατιωτικών δαπανών. Το έγγραφο βρήκε ότι η “αριστερή” CNN τελικά βρέθηκε δίπλα στη δεξιά National Review και Fox News σε αυτό το θέμα.
Γενικά, ωστόσο, η πολιτική στάση μπορεί να καθοριστεί από άλλες φράσεις, όπως η προτίμηση της φράσης “στρατιωτικο-βιομηχανικός комплекс” έναντι της πιο δεξιάς “αμυντική βιομηχανία”. Τα αποτελέσματα δείχνουν ότι η πρώτη χρησιμοποιείται από κριτικές Toward outlets όπως Canary και Αμερικανικό Συντηρητικό, ενώ η δεύτερη χρησιμοποιείται πιο συχνά από Fox και CNN.
Η έρευνα καθιερώνει πολλές άλλες προοδευτικές μετατοπίσεις από κριτικές Toward γλώσσας σε προ-καθιερωμένες γλώσσες, συμπεριλαμβανομένων των “shot dead” σε “the killing of”; “inmate felons” σε “incarcerated people”; και “oil producers” σε “big oil”.

Συναρπαστικές συνώνυμες με καθιερωμένη μεροληπτική στάση, από πάνω προς τα κάτω.
Η έρευνα αναγνωρίζει ότι τα μέσα ενημέρωσης θα “απομακρύνουν” από τη βασική πολιτική στάση τους, είτε σε γλωσσικό επίπεδο (όπως η χρήση δι-τιμών φράσεων), είτε για διάφορους άλλους λόγους. Για παράδειγμα, η σεβαστή δεξιά βρετανική έκδοση The Spectator, που ιδρύθηκε το 1828, συχνά και προεξέχοντα παρουσιάζει αριστερές σκέψεις που τρίβουν ενάντια στη γενική πολιτική ροή του ρεύματος περιεχομένου. Εάν αυτό γίνεται από μια αίσθηση αμερόληπτης αναφοράς ή για να προκαλέσει περιοδικά την κεντρική αναγνωστική τους σε traffic-γεννήτρια σχολιαστική θύελλα είναι ένα θέμα συλλογισμού – και δεν είναι ένα εύκολο ζήτημα για ένα σύστημα μηχανικής μάθησης που ψάχνει για σαφείς και συνεπείς δείκτες.
Αυτές οι συγκεκριμένες “ασχολίες” και η αμφίβολη χρήση “τσακισμένων” απόψεων μεταξύ ατομικών μέσων ενημέρωσης κάπως συγχέει τη χαρτογράφηση αριστερά-δεξιά που η έρευνα τελικά προσφέρει, παρέχοντας μια ευρεία ένδειξη πολιτικής συσχέτισης.

Κρυμμένη Σημασία
Αν και η ημερομηνία είναι 2 Σεπτεμβρίου και δημοσιεύθηκε στο τέλος Αυγούστου 2021, το έγγραφο έχει κερδίσει σχετικά λίγη προσοχή. Μερικώς αυτό μπορεί να οφείλεται στο ότι κρίσιμη έρευνα που στοχεύει στα κύρια μέσα ενημέρωσης είναι απίθανο να ληφθεί με ενθουσιασμό από αυτά; αλλά μπορεί επίσης να οφείλεται στην απροθυμία των συγγραφέων να παράγουν σαφείς και ανεπίσημες γραφικές παραστάσεις που να ταξινομήσουν πού βρίσκονται τα επιρροή και ισχυρά μέσα ενημέρωσης σε διάφορα θέματα, μαζί με συναθροισμένες τιμές που δείχνουν το βαθμό με τον οποίο μια έκδοση κλίνει προς τα αριστερά ή τα δεξιά. Στην ουσία, οι συγγραφείς φαίνεται να παίρνουν μέτρα για να μειώσουν την πιθανή incendiary επίδραση των αποτελεσμάτων.
Επίσης, τα εκτεταμένα δημοσιευμένα δεδομένα από το πρότζεκτ δείχνουν συχνότητες εμφάνισης λέξεων, αλλά φαίνεται να είναι ανώνυμα, καθιστώντας δύσκολο να ληφθεί μια σαφής εικόνα της μεροληπτικής στάσης των μέσων ενημέρωσης που μελετήθηκαν. Χωρίς να λειτουργήσει το πρότζεκτ με κάποιο τρόπο, αυτό αφήνει μόνο τα επιλεγμένα παραδείγματα που παρουσιάζονται στο έγγραφο.
Μετέπειτα μελέτες αυτού του είδους θα μπορούσαν πιθανότατα να είναι πιο χρήσιμες εάν λάμβαναν υπόψη τους όχι μόνο τη φράση που χρησιμοποιείται για τα θέματα, αλλά και εάν το θέμα καλύπτεται καθόλου,既然 η σιωπή μιλάει πολύ, και έχει μια ξεχωριστή πολιτική στάση που συχνά μιλάει για περισσότερα από τα απλά προϋπολογιστικά περιορισμοί ή άλλα πρακτικά ζητήματα που μπορεί να ενημερώσουν την επιλογή των ειδήσεων.
Παρά ταύτα, η μελέτη του MIT φαίνεται να είναι η μεγαλύτερη του είδους της μέχρι σήμερα και θα μπορούσε να διαμορφώσει το πλαίσιο για μελλοντικά συστήματα ταξινόμησης, και ακόμη και δευτερεύουσες τεχνολογίες όπως πρόσθετα για το πρόγραμμα περιήγησης που θα μπορούσαν να ενημερώσουν τους αναγνώστες για το πολιτικό χρώμα της έκδοσης που διαβάζουν.
Φούσκες, Μεροληπτική Στάση και Αντιδράσεις
Επιπλέον, θα πρέπει να ληφθεί υπόψη εάν τέτοια συστήματα θα οδηγούσαν στην ενίσχυση ενός από τα πιο αμφιλεγόμενα ζητήματα των αλγορίθμων συστάσεων – την τάση να οδηγούν τον θεατή σε περιβάλλοντα όπου δεν βλέπουν μια αντίθετη ή προκλητική άποψη, που είναι πιθανό να οδηγήσει στην περαιτέρω εδραίωση της στάσης του αναγνώστη σε κεντρικά ζητήματα.
Εάν ένα τέτοιο περιεχόμενο φούσκα είναι ένα “ασφαλές περιβάλλον”, ένα εμπόδιο στην πνευματική ανάπτυξη ή μια προστασία ενάντια σε μερική προπαγάνδα, είναι μια αξιολογική κρίση – ένα φιλοσοφικό ζήτημα που είναι δύσκολο να προσεγγιστεί από τη μηχανιστική, στατιστική άποψη των συστημάτων μηχανικής μάθησης.
Περαιτέρω, όπως η μελέτη του MIT έχει προσπαθήσει να αφήσει τα δεδομένα να ορίσουν τα αποτελέσματα, η ταξινόμηση της πολιτικής αξίας των φράσεων είναι αναπόφευκτα ένα είδος αξιολογικής κρίσης, και μια που δεν μπορεί εύκολα να ανθιστεί την ικανότητα της γλώσσας να ανακωδικοποιήσει τοξική ή αμφισβητούμενη περιεχόμενο σε νέες φράσεις που δεν είναι στο εγχειρίδιο, τους κανόνες του φόρουμ ή τη βάση δεδομένων εκπαίδευσης.
Εάν μια τέτοια κωδικοποίηση θα γίνει ενσωματωμένη σε δημοφιλή online συστήματα, φαίνεται πιθανό ότι μια συνεχής προσπάθεια να χαρτογραφηθεί η ηθική και πολιτική θερμοκρασία των μεγάλων μέσων ενημέρωσης θα μπορούσε να εξελιχθεί σε einen ψυχρό πόλεμο μεταξύ της ικανότητας του AI να αναγνωρίσει μεροληπτική στάση και την ικανότητα των εκδοτών να εκφράσουν την άποψή τους σε μια εξελισσόμενη ιδιολεκτική που σχεδιάζεται για να ξεπεράσει συνεχώς την κατανόηση της σημασιολογίας της μηχανικής μάθησης.
14/09/21 – 1.41 GMT+2 – Changed ‘100 newspapers’ to ‘100 news outlets’
4:58pm – Corrected paper citation to include Samantha D’Alonzo, and related corrections.












