Η γωνία του Anderson
Ένα AI-Driven Bias Checker για Άρθρα Ειδήσεων, Διαθέσιμο σε Python

Ερευνητές στον Καναδά, την Ινδία, την Κίνα και την Αυστραλία έχουν συνεργαστεί για να δημιουργήσουν ένα δωρεάν πακέτο Python που μπορεί να χρησιμοποιηθεί για να ανιχνεύσει και να αντικαταστήσει ‘αδική language’ σε κείμενα ειδήσεων.
Το σύστημα, με τίτλο Dbias, χρησιμοποιεί διάφορες τεχνολογίες μηχανικής μάθησης και βάσεις δεδομένων για να αναπτύξει einen τρι-σταδίου κυκλικό workflow που μπορεί να βελτιώσει biased text μέχρι να επιστρέψει μια μη-偏向μένη, ή τουλάχιστον πιο ουδέτερη εκδοχή.

Loaded language in a news snippet identified as ‘biased’ is transformed into a less incendiary version by Dbias. Source: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf
Το σύστημα αντιπροσωπεύει einen επαναχρησιμοποιήσιμο και αυτοτελή pipeline που μπορεί να εγκατασταθεί μέσω Pip από το Hugging Face, και να ενσωματωθεί σε υπάρχοντα projects ως συμπληρωματικό στάδιο, add-on, ή plugin.
Τον Απρίλιο, παρόμοια λειτουργικότητα που εφαρμόστηκε στα Google Docs υπέστη κριτική, όχι τουλάχιστον για την έλλειψη editability. Το Dbias, από την άλλη πλευρά, μπορεί να εκπαιδευτεί πιο επιλεκτικά σε οποιοδήποτε corpus ειδήσεων που ο τελικός χρήστης επιθυμεί, διατηρώντας την ικανότητα να αναπτύξει εξατομικευμένα οδηγίες δίκαιης μεταχείρισης.
Η κρίσιμη διαφορά είναι ότι η pipeline Dbias προορίζεται να μετατρέψει αυτόματα ‘loaded language’ (λέξεις που προσθέτουν ένα κρίσιμο επίπεδο στην επικοινωνία) σε ουδέτερη ή προzaic γλώσσα, αντί να εκπαιδεύσει τον χρήστη σε συνεχή βάση. Ουσιαστικά, ο τελικός χρήστης θα ορίσει εθικά φίλτρα και θα εκπαιδεύσει το σύστημα ανάλογα· στο Google Docs approach, το σύστημα είναι – επιχείρημα – που εκπαιδεύει τον χρήστη, με μονομερή τρόπο.

Conceptual architecture for the Dbias workflow.
Σύμφωνα με τους ερευνητές, το Dbias είναι το πρώτο πραγματικά ρυθμιζόμενο πακέτο ανίχνευσης bias, σε αντίθεση με τα off-the-shelf assembly projects που έχουν χαρακτηρίσει αυτόν τον υποτομέα της Natural Language Processing (NLP) μέχρι τώρα.
The new paper is titled Μια Προσέγγιση για την Εγγύηση της Δίκαιης Μεταχείρισης στα Άρθρα Ειδήσεων, και προέρχεται από συντελεστές στο Πανεπιστήμιο του Τορόντο, το Toronto Metropolitan University, την Environmental Resources Management στο Μπανγκαλόρ, την DeepBlue Academy of Sciences στην Κίνα, και το Πανεπιστήμιο του Σίδνεϋ.
Μέθοδος
Το πρώτο module στο Dbias είναι Bias Detection, το οποίο χρησιμοποιεί το DistilBERT package – μια υψηλά βελτιστοποιημένη εκδοχή του machine-intensive BERT της Google. Για το project, το DistilBERT ήταν fine-tuned στο Media Bias Annotation (MBIC) dataset.

Το MBIC αποτελείται από άρθρα ειδήσεων από διάφορες πηγές, συμπεριλαμβανομένων των Huffington Post, USA Today και MSNBC. Οι ερευνητές χρησιμοποιούν την επεκταμένη εκδοχή του dataset.
Αν και τα αρχικά δεδομένα είχαν ανατεθεί σε crowdsourced εργαζόμενους (μια μέθοδος που υπέστη κριτική στα τέλη του 2021), οι ερευνητές του νέου paper ήταν σε θέση να αναγνωρίσουν πρόσθετες μη-ετικετεμένες περιπτώσεις bias στο dataset, και τις πρόσθεσαν χειροκίνητα. Οι αναγνωρισμένες περιπτώσεις bias αφορούσαν φυλή, εκπαίδευση, εθνικότητα, γλώσσα, θρησκεία και φύλο.
Το επόμενο module, Bias Recognition, χρησιμοποιεί Named Entity Recognition (NER) για να αναγνωρίσει τις biased λέξεις από το input text. Το paper αναφέρει:
‘Για παράδειγμα, το άρθρο “Don’t buy the pseudo-scientific hype about tornadoes and climate change” έχει ταξινομηθεί ως biased από το προηγούμενο bias detection module, και το biased recognition module μπορεί τώρα να αναγνωρίσει την λέξη “pseudo-scientific hype” ως μια biased λέξη.’
NER δεν είναι ειδικά σχεδιασμένο για αυτήν την εργασία, αλλά έχει χρησιμοποιηθεί παλαιότερα για την ανίχνευση bias, ιδιαίτερα για ένα 2021 project από το Πανεπιστήμιο του Ντάραμ στο Ηνωμένο Βασίλειο.
Για αυτό το στάδιο, οι ερευνητές χρησιμοποιούν RoBERTa σε συνδυασμό με την SpaCy English Transformer NER pipeline.

Το επόμενο στάδιο, Bias Masking, περιλαμβάνει ένα καινούριο multiple-mask των biased λέξεων, το οποίο λειτουργεί ακολουθιακά σε περιπτώσεις πολλαπλών biased λέξεων.

Loaded language is replaced with pragmatic language in the third stage of Dbias. Note that ‘mouthing’ and ‘using’ equate to the same action, though the former is considered derisive.
Όπως απαιτείται, η ανατροφοδότηση από αυτό το στάδιο θα σταλεί πίσω στην αρχή της pipeline για περαιτέρω αξιολόγηση μέχρι να έχουν παραχθεί αρκετές κατάλληλες εναλλακτικές φράσεις ή λέξεις. Αυτό το στάδιο χρησιμοποιεί Masked Language Modeling (MLM) κατά μήκος γραμμών που καθορίζονται από μια 2021 συνεργασία που ηγήθηκε η Facebook Research.
Κανονικά, η MLM εργασία θα mask 15% των λέξεων τυχαία, αλλά η Dbias workflow αντίθετα λέει στη διαδικασία να πάρει τις biased λέξεις ως input.
Η αρχιτεκτονική υλοποιήθηκε και εκπαιδεύτηκε στο Google Colab Pro σε ένα NVIDIA P100 με 24GB VRAM σε ένα batch size 16, χρησιμοποιώντας μόνο δύο ετικέτες (biased και unbiased).
Δοκιμές
Οι ερευνητές δοκιμάζουν το Dbias ενάντια σε πέντε συγκρίσιμες προσεγγίσεις: LG-TFIDF με Logistic Regression και TfidfVectorizer (TFIDF) word embeddings; LG-ELMO; MLP-ELMO (ένα feed-forward artificial neural network που περιέχει ELMO embeddings); BERT; και RoBERTa.
Οι μετρήσεις που χρησιμοποιήθηκαν για τις δοκιμές ήταν ακρίβεια (ACC), precision (PREC), recall (Rec) και ένα F1 score.既然 οι ερευνητές δεν είχαν γνώση κανενός υπάρχοντος συστήματος που θα μπορούσε να εκτελέσει όλα τα τρία καθήκοντα σε μια seule pipeline, η άδεια δόθηκε για τα ανταγωνιστικά frameworks, αξιολογώντας μόνο τα primary tasks του Dbias – bias detection και recognition.

Results from the Dbias trials.
Το Dbias κατάφερε να ξεπεράσει τα αποτελέσματα από όλα τα ανταγωνιστικά frameworks, συμπεριλαμβανομένων εκείνων με ένα βαρύτερο footprint.
Το paper αναφέρει:
‘Το αποτέλεσμα δείχνει επίσης ότι τα deep neural embeddings, γενικά, μπορούν να ξεπεράσουν τις παραδοσιακές μεθόδους embeddings (π.χ. TFIDF) στην εργασία της ανίχνευσης bias. Αυτό είναι εμφανές από την καλύτερη απόδοση των deep neural network embeddings (π.χ. ELMO) σε σύγκριση με το TFIDF vectorization όταν χρησιμοποιούνται με LG.
‘Αυτό είναι πιθανό επειδή τα deep neural embeddings μπορούν να πιάσουν καλύτερα το контекστό των λέξεων στο κείμενο σε διάφορες περιπτώσεις. Τα deep neural embeddings και οι μεθόδους (MLP, BERT, RoBERTa) επίσης εκτελούν καλύτερα από τις παραδοσιακές μεθόδους ML (LG).’
Οι ερευνητές επίσης σημειώνουν ότι οι Transformer-based μεθόδους ξεπερνούν τις ανταγωνιστικές μεθόδους στην ανίχνευση bias.
Μια πρόσθετη δοκιμή περιελάμβανε μια σύγκριση μεταξύ Dbias και διάφορων εκδόσεων του SpaCy Core Web, συμπεριλαμβανομένων core-sm (small), core-md (medium), και core-lg (large). Το Dbias ήταν σε θέση να ξεπεράσει και σε αυτές τις δοκιμές:

Οι ερευνητές καταλήγουν στο συμπέρασμα ότι οι εργασίες ανίχνευσης bias γενικά δείχνουν καλύτερη ακρίβεια σε μεγαλύτερα και πιο ακριβά μοντέλα, λόγω – όπως υποθέτουν – της αυξημένης ποσότητας παραμέτρων και δεδομένων. Επίσης, σημειώνουν ότι η αποτελεσματικότητα των μελλοντικών εργασιών σε αυτόν τον τομέα θα εξαρτηθεί από μεγαλύτερες προσπάθειες για την ετικέτηση υψηλής ποιότητας datasets.
Το Δάσος και τα Δέντρα
Ελπίζουμε ότι αυτό το είδος project ανίχνευσης bias θα ενσωματωθεί τελικά σε πλαίσια ανίχνευσης bias που μπορούν να λάβουν μια λιγότερο μυωπική άποψη, και να λάβουν υπόψη ότι η επιλογή για την κάλυψη οποιασδήποτε ιστορίας είναι σε себе μια πράξη bias που είναι πιθανό να οδηγηθεί από περισσότερα από τα απλά στατιστικά δεδομένα προβολής.
Πρώτη δημοσίευση 14ης Ιουλίου 2022.












