Unghiul lui Anderson
Un verificator de bias bazat pe inteligență artificială pentru articole de știri, disponibil în Python

Cercetători din Canada, India, China și Australia au colaborat pentru a produce un pachet Python gratuit care poate fi utilizat eficient pentru a detecta și înlocui “limbajul injust” în articolele de știri.
Sistemul, intitulat Dbias, utilizează diverse tehnologii de învățare automată și baze de date pentru a dezvolta un flux de lucru circular în trei etape care poate rafina textul biasat până când returnează o versiune neutră sau mai puțin biasată.

Limbajul încărcat într-un articol de știri identificat ca ‘biasat’ este transformat într-o versiune mai puțin incendiară de Dbias. Sursă: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf
Sistemul reprezintă un flux de lucru reutilizabil și autoconținut care poate fi instalat prin Pip de la Hugging Face și integrat în proiecte existente ca o etapă suplimentară, add-on sau plugin.
În aprilie, o funcționalitate similară implementată în Google Docs a fost criticată, nu în ultimul rând pentru lipsa de editare. Dbias, pe de altă parte, poate fi antrenat mai selectiv pe orice corpus de știri pe care utilizatorul final o dorește, păstrând capacitatea de a dezvolta linii directoare de echitate personalizate.
Diferența critică este că fluxul de lucru Dbias este destinat să transforme automat “limbajul încărcat” (cuvinte care adaugă un strat critic comunicării factuale) în limbaj neutru sau prozaic, și nu să instruiască utilizatorul în mod continuu. Esențial, utilizatorul final va defini filtre etice și va antrena sistemul corespunzător; în abordarea Google Docs, sistemul este – în mod evident – antrenat de utilizator, într-un mod unilateral.

Arhitectură conceptuală pentru fluxul de lucru Dbias.
Conform cercetătorilor, Dbias este primul pachet de detectare a biasului cu adevărat configurabil, în contrast cu proiectele de asamblare off-the-shelf care au caracterizat acest subsector al Procesării Limbajului Natural (NLP) până în prezent.
Articolul nou se intitulează Abordarea pentru a asigura echitatea în articolele de știri și provine de la contribuitori de la Universitatea din Toronto, Universitatea Metropolitană Toronto, Environmental Resources Management din Bangalore, Academia DeepBlue de Științe din China și Universitatea din Sydney.
Metoda
Primul modul în Dbias este Detectarea biasului, care utilizează pachetul DistilBERT – o versiune foarte optimizată a BERT de la Google. Pentru proiect, DistilBERT a fost finisat pe setul de date Media Bias Annotation (MBIC).

MBIC constă în articole de știri din diverse surse media, inclusiv Huffington Post, USA Today și MSNBC. Cercetătorii au utilizat versiunea extinsă a setului de date.
Deși datele originale au fost annotate de lucrători crowdsourced (o metodă care a fost criticată la sfârșitul anului 2021), cercetătorii articolului nou au putut identifica instanțe suplimentare neanotate de bias în setul de date și le-au adăugat manual. Incidențele identificate de bias s-au referit la rasă, educație, etnie, limbă, religie și gen.
Următorul modul, Recunoașterea biasului, utilizează Recunoașterea Entităților Nume (NER) pentru a individualiza cuvinte biasate din textul de intrare. Articolul afirmă:
‘De exemplu, știrile “Nu cumpărați hype-ul pseudo-științific despre tornade și schimbări climatice” au fost clasificate ca biasate de modulul de detectare a biasului, și modulul de recunoaștere a biasului poate identifica termenul “hype pseudo-științific” ca un cuvânt biasat.’
NER nu este proiectat în mod special pentru această sarcină, dar a fost utilizat anterior pentru identificarea biasului, în special pentru un proiect din 2021 de la Universitatea Durham din Regatul Unit.
Pentru această etapă, cercetătorii au utilizat RoBERTa combinat cu pipeline-ul SpaCy English Transformer NER.

Următoarea etapă, Mascharea biasului, implică o mască multiplă a cuvintelor biasate identificate, care funcționează secvențial în cazul mai multor cuvinte biasate identificate.

Limbajul încărcat este înlocuit cu limbaj pragmatic în a treia etapă a Dbias. Notați că ‘mouthing’ și ‘using’ echivalează cu aceeași acțiune, deși primul este considerat peiorativ.
În mod necesar, feedback-ul din această etapă va fi trimis înapoi la începutul fluxului de lucru pentru o evaluare suplimentară până când un număr de frazări alternative sau cuvinte adecvate au fost generate. Această etapă utilizează Modelarea Limbajului Mascate (MLM) de-a lungul liniilor stabilite de o colaborare din 2021 condusă de Facebook Research.
Normal, sarcina MLM va masca 15% din cuvinte în mod aleator, dar fluxul de lucru Dbias spune procesului să ia cuvintele biasate identificate ca intrare.
Arhitectura a fost implementată și antrenată pe Google Colab Pro pe un NVIDIA P100 cu 24GB de VRAM la o dimensiune a lotului de 16, utilizând doar două etichete (biasat și nebiasat).
Testele
Cercetătorii au testat Dbias împotriva a cinci abordări comparabile: LG-TFIDF cu Regresie Logistică și TfidfVectorizer (TFIDF) încorporări de cuvinte; LG-ELMO; MLP-ELMO (o rețea neuronală artificială feed-forward care conține încorporări ELMO); BERT; și RoBERTa.
Metodele utilizate pentru testele au fost acuratețea (ACC), precizia (PREC), rechemarea (Rec) și un scor F1. Deoarece cercetătorii nu aveau cunoștințe despre vreun sistem care ar putea realiza toate cele trei sarcini într-un singur flux de lucru, s-a făcut o dispensă pentru cadrele concurente, prin evaluarea doar a sarcinilor principale ale Dbias – detectarea și recunoașterea biasului.

Rezultatele testelor Dbias.
Dbias a reușit să depășească rezultatele tuturor cadrului concurente, inclusiv cele cu o amprentă de procesare mai grea
Articolul afirmă:
‘Rezultatul arată, de asemenea, că încorporările neuronale profunde pot depăși metodele de încorporare tradiționale (de exemplu, TFIDF) în sarcina de clasificare a biasului. Acest lucru este demonstrat de performanța mai bună a încorporărilor neuronale profunde (de exemplu, ELMO) în comparație cu vectorizarea TFIDF atunci când se utilizează cu LG.
‘Acest lucru se datorează probabil faptului că încorporările neuronale profunde pot captura mai bine contextul cuvintelor în text în diferite contexte. Încorporările neuronale profunde și metodele neuronale profunde (MLP, BERT, RoBERTa) performează, de asemenea, mai bine decât metodele tradiționale de învățare automată (LG).’
Cercetătorii observă, de asemenea, că metodele bazate pe Transformer depășesc metodele concurente în detectarea biasului.
Un test suplimentar a implicat o comparație între Dbias și diverse variante ale SpaCy Core Web, inclusiv core-sm (mic), core-md (mediu) și core-lg (mare). Dbias a condus și în aceste teste:

Cercetătorii concluzionează observând că sarcinile de recunoaștere a biasului arată, în general, o acuratețe mai bună în modelele mai mari și mai scumpe, din cauza – speculează ei – numărului crescut de parametri și puncte de date. Ei observă, de asemenea, că eficacitatea lucrărilor viitoare în acest domeniu va depinde de eforturi mai mari pentru a annota seturi de date de înaltă calitate.
Pădurea și Copacii
Sperăm că acest tip de proiect de recunoaștere a biasului fin va fi în cele din urmă încorporat în cadre de căutare a biasului care pot lua o vedere mai puțin mioapă și care pot lua în considerare faptul că alegerea de a acoperi o anumită poveste este în sine un act de bias care este posibil condus de mai mult decât doar statistici de vizualizare raportate.
Publicat pentru prima dată pe 14 iulie 2022.












