Andersonin kulma
Tekoälypohjainen Harhan Tunnistin Uutisartikkeleille, Saatavilla Pythonissa

Tutkijat Kanadassa, Intiassa, Kiinassa ja Australiassa ovat yhteistyössä tuottaneet ilmaisen Python-paketin, jota voidaan käyttää tehokkaasti “epäoikeudenmukaisen kielen” havaitsemiseen ja korvaamiseen uutiskopioissa.
Järjestelmä, joka on nimeltään Dbias, käyttää erilaisia koneoppimisen teknologioita ja tietokantoja kehittääkseen kolmevaiheisen pyörivän työnkulun, joka voidaan jalostaa harhaisista teksteistä niin, että se palauttaa ei-harhaisen tai ainakin neutraalimmman version.

Latauksen kieli uutisnipissä, joka on tunnistettu “harhaiseksi”, muutetaan vähemmän tulenarkaksi Dbias-järjestelmällä. Lähde: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf
Järjestelmä edustaa uudelleenkäytettävää ja itsenään olevaa putkea, joka voidaan asentaa Pipin kautta Hugging Facen kautta ja integroida olemassa oleviin projekteihin täydentävänä vaiheena, lisäosana tai laajennuksena.
Huhtikuussa vastaavaa toiminnallisuutta, joka on toteutettu Google Docsissa käsiteltiin arvostelussa, etenkin sen muokkaamattomuuden vuoksi. Dbias-järjestelmässä on mahdollista kouluttaa se valitsemalla minkä tahansa uutiskokoelman, jolloin se voi kehittää mukautettuja reiluutta koskevia ohjeita.
Olennainen ero on, että Dbias-putki on tarkoitettu automaattiseen “latauksen kielen” (sanojen, jotka lisäävät kriittisen kerroksen faktatiedonvaihtoon) muuttamiseen neutraaliksi tai kuivaksi kieleksi, sen sijaan, että se opettaisi käyttäjää jatkuvasti. Käyttäjä määrittelee eettiset suodattimet ja kouluttaa järjestelmän sen mukaan; Google Docs -lähestymistavassa järjestelmä on – väittäen – kouluttamassa käyttäjää yksipuolisesti.

Käsitteellinen arkkitehtuuri Dbias-työnkululle.
Tutkijoiden mukaan Dbias on ensimmäinen todella konfiguroitavissa oleva harhan tunnistuspaketti, toisin kuin valmiiden kokoonpanohankkeiden, jotka ovat luonnehtineet tätä Natural Language Processing (NLP) -alaa tähän asti.
Uusi artikkeli on nimeltään Lähestymistapa Uutisartikkeleiden Reiluuden Varmentamiseksi, ja se tulee Toronton yliopistosta, Toronton metropolialueen yliopistosta, Bangaloresta, Kiinan DeepBlue Academy of Sciencesista ja Sydneyn yliopistosta.
Menetelmä
Dbias-järjestelmän ensimmäinen moduuli on Harhan Tunteminen, joka hyödyntää DistilBERT -pakettia – erittäin optimoitu versio Googleen koneoppimismallista BERT. Tämä projekti on hienosäädetty Media Bias Annotation (MBIC) -tietokannalla.

MBIC koostuu uutisartikkeleista monista eri medioista, mukaan lukien Huffington Post, USA Today ja MSNBC. Tutkijat käyttivät tietokannan laajennettua versiota.
Vaikka alkuperäinen data annotoitiin joukkorahoituksen avulla (menetelmä, joka tuli kritiikin kohteeksi loppuvuodesta 2021), tutkijat pystyivät tunnistamaan lisää merkintämättömiä harhan tapauksia tietokannassa ja liittivät ne manuaalisesti. Tunnetut harhan tapaukset liittyivät rotuun, koulutukseen, etnisyyteen, kieleen, uskontoon ja sukupuoleen.
Seuraava moduuli, Harhan Tunteminen, käyttää Named Entity Recognition (NER) -teknologiaa erottamaan harhaiset sanat syötetystä tekstistä. Artikkeli toteaa:
‘Esimerkiksi uutinen “Älä osta pseudo-tieteellistä hypeä tornadoista ja ilmastonmuutoksesta” on luokiteltu harhaiseksi edeltävällä harhan tunnistusmoduulilla, ja harhan tunnistusmoduuli voi nyt tunnistaa termin “pseudo-tieteellinen hype” harhaiseksi sanaksi.’
NER ei ole suunniteltu tätä tehtävää varten, mutta sitä on käytetty aikaisemmin harhan tunnistamiseen, erityisesti vuoden 2021 projektissa Durhamin yliopistosta Iso-Britanniassa.
Tässä vaiheessa tutkijat käyttivät RoBERTa -yhdessä SpaCy English Transformer NER -putken kanssa.

Seuraava vaihe, Harhan Peittäminen, käsittää uuden monimutkaisen useiden harhan sanojen peittämisen, joka toimii peräkkäin useiden tunnistettujen harhan sanojen tapauksissa.

Latauksen kieli korvataan pragmaattisella kielellä Dbias-järjestelmän kolmannessa vaiheessa. Huomaa, että ‘mouthing’ ja ‘using’ vastaavat samaa toimintaa, vaikka edellinen on derisoivaa.
Jos tarpeen, tämän vaiheen palautetta lähetetään takaisin putken alkuun arvioitavaksi uudelleen, kunnes sopivia vaihtoehtoisia fraaseja tai sanoja on luotu. Tämä vaihe käyttää Masked Language Modeling (MLM) -menetelmää, jota on kehitetty Facebookin tutkimusryhmän johtamassa yhteistyössä vuonna 2021.
Normaalisti MLM-tehtävä maskaa 15% sanoista satunnaisesti, mutta Dbias-työnkulku kertoo prosessille ottamaan tunnistetut harhaiset sanat syötteenä.
Arkkitehtuuri toteutettiin ja koulutettiin Google Colab Pro -ympäristössä NVIDIA P100 -laiteella, jossa on 24 GB VRAM ja 16 batch-kokoa, käyttäen vain kahta merkintää (harhainen ja ei-harhainen).
Testit
Tutkijat testasivat Dbias-järjestelmää viittä vastaavaa lähestymistapaa vastaan: LG-TFIDF:ää Logistisella Regressiolla ja TfidfVectorizer (TFIDF) -sanamalleilla; LG-ELMO; MLP-ELMO (syötteen eteenpäin kulkeva tekoälyverkko, joka sisältää ELMO-mallit); BERT; ja RoBERTa.
Testeissä käytettiin seuraavia mittareita: tarkkuus (ACC), täsmällisyys (PREC), palautus (Rec) ja F1-lukema. Koska tutkijat eivät olleet tietoisia mistään olemassa olevasta järjestelmästä, joka voisi suorittaa kaikki kolme tehtävää yhdessä putkessa, he tekivät poikkeuksen vertailujärjestelmille ja arvioivat ainoastaan Dbias-järjestelmän päätehtäviä – harhan tunnistamista ja tuntemista.

Dbias-kokeiden tulokset.
Dbias onnistui ylittämään tulokset kaikista vertailujärjestelmistä, mukaan lukien ne, joilla on raskaampi prosessointijalanjälki
Artikkeli toteaa:
‘Tulokset osoittavat myös, että syvät neuroniverkko- upotukset voivat yleensä suorittaa paremmin perinteisiä upotusmenetelmiä (esim. TFIDF) harhan luokittelutehtävässä. Tämä johtuu siitä, että syvät neuroniverkko-upotukset voivat paremmin havaita sanojen kontekstin eri tilanteissa. Syvät neuroniverkko-upotukset ja syvät neuroniverkkomenetelmät (MLP, BERT, RoBERTa) suorittavat myös paremmin kuin perinteinen ML-menetelmä (LG).’
‘Tämä johtunee siitä, että syvät neuroniverkko-upotukset voivat paremmin havaita sanojen kontekstin eri tilanteissa. Transformer-pohjaiset menetelmät suorittavat myös paremmin kuin vertailumenetelmät harhan tunnistamisessa.’
Tutkijat huomauttavat myös, että Transformer-pohjaiset menetelmät suorittavat paremmin kuin vertailumenetelmät harhan tunnistamisessa.
Lisäksi tehtiin vertailukoe Dbias-järjestelmän ja eri SpaCy Core Web -versioiden (core-sm, core-md, core-lg) välillä. Dbias johti myös näissä kokeissa:

Tutkijat päättelevät, että harhan tunnistustehtävät osoittavat yleensä paremman tarkkuuden suuremmilla ja kalliimmilla malleilla, johtuen todennäköisesti lisääntyneistä parametreista ja data-pisteistä. He huomauttavat myös, että tulevaisuuden työn tehokkuus tässä alalla riippuu suuremmista ponnistelusta korkealaatuisten tietokantojen annotoimiseksi.
Metsä ja Puut
Toivottavasti tämänkaltaiset hienot harhan tunnistusprojektien tulisi lopulta sisällyttää harhan etsintäkehyksiin, jotka voivat ottaa vähemmän myöpiän näkemyksen ja ottaa huomioon, että minkä tahansa tarinan kattaminen on itsessään harhan akti, joka on mahdollisesti ohjattu enemmän kuin vain ilmoitetuilla katselutilastoilla.
Julkaistu ensimmäisen kerran 14. heinäkuuta 2022.












