Andersonův úhel
AI poháněný kontrolor偏见 pro novinové články, dostupný v Pythonu

Výzkumníci v Kanadě, Indii, Číně a Austrálii spolupracovali na vytvoření volně dostupného balíčku Pythonu, který lze účinně použít k identifikaci a nahrazení “nespravedlivého jazyka” v novinových článcích.
Systém, nazvaný Dbias, využívá různé technologie strojového učení a databáze k vývoji třístupňového cyklického pracovního postupu, který lze použít k vylepšení předpojatého textu až do té míry, že vrátí nezávislý nebo alespoň více neutrální verzi.

Loaded language v novinovém článku identifikován jako ‘předpojatý’ je transformován do méně incendiární verze Dbias. Source: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf
Systém představuje opakovaně použitelnou a samostatnou pipeline, která lze nainstalovat pomocí Pip z Hugging Face a integrovat do stávajících projektů jako doplňkový stupeň, modul nebo plugin.
V dubnu podobná funkčnost implementovaná v Google Docs byla kritizována, zejména pro svou nedostatečnou editovatelnost. Dbias na druhé straně lze více selektivně trénovat na libovolném korpusu novin, které uživatel chce, a přitom zachovat schopnost vyvinout vlastní směrnice pro spravedlnost.
Kritický rozdíl spočívá v tom, že pipeline Dbias je navržen tak, aby automaticky transformoval “nabitý jazyk” (slova, která přidávají kritickou vrstvu k faktické komunikaci) na neutrální nebo prozaický jazyk, spíše než aby školil uživatele kontinuálně. Uživatel bude definovat etické filtry a trénovat systém podle toho; v přístupu Google Docs systém – zřejmě – školí uživatele, v jednostranném směru.

Konceptuální architektura pro workflow Dbias.
Podle výzkumníků je Dbias prvním skutečně konfigurovatelným balíčkem pro detekci předpojatosti, na rozdíl od projektů sestavených z předem připravených dílů, které charakterizovaly tuto sub-sektor přírodního zpracování jazyka (NLP) do současnosti.
Nová práce nese název Přístup k zajištění spravedlnosti v novinových článcích a pochází od přispěvatelů z University of Toronto, Toronto Metropolitan University, Environmental Resources Management v Bangaluru, DeepBlue Academy of Sciences v Číně a The University of Sydney.
Metoda
První modul v Dbias je Detekce předpojatosti, který využívá balíček DistilBERT – vysoce optimalizovanou verzi poměrně náročné BERT od Googlu. Pro tento projekt byl DistilBERT jemně naladěn na dataset MBIC (Media Bias Annotation).

MBIC se skládá z novinových článků z různých zdrojů, včetně Huffington Post, USA Today a MSNBC. Výzkumníci použili prodlouženou verzi datasetu.
Ačkoli původní data byla anotována pracovníky crowdsourcovanými (metodou, která byla kritizována na konci roku 2021), výzkumníci nové práce byli schopni identifikovat další neanotované případy předpojatosti v datasetu a ručně je přidali. Identifikované případy předpojatosti se týkaly rasy, vzdělávání, etnické příslušnosti, jazyka, náboženství a pohlaví.
Další modul, Rozpoznání předpojatosti, využívá Named Entity Recognition (NER) k identifikaci předpojatých slov z vstupního textu. Práce uvádí:
‘Například novinový článek “Nekupujte pseudo-vědeckou propagandu o tornádech a změně klimatu” byl klasifikován jako předpojatý předcházejícím modulem detekce předpojatosti a modul rozpoznání předpojatosti může nyní identifikovat termín “pseudo-vědecká propaganda” jako předpojaté slovo.’
NER není specificky navržen pro tuto úlohu, ale byl dříve použit pro identifikaci předpojatosti, zejména pro projekt z roku 2021 z Durham University ve Spojeném království.
Pro tuto fázi výzkumníci použili RoBERTa v kombinaci se SpaCy English Transformer NER pipeline.

Další fáze, Masking předpojatosti, zahrnuje novou více-masking identifikovaných předpojatých slov, která funguje sekvenčně v případech více identifikovaných předpojatých slov.

Loaded language je nahrazen pragmatičtějším jazykem ve třetí fázi Dbias. Poznámka: ‘mouthing’ a ‘using’ jsou považovány za stejné akce, i když první je považován za despektivní.
Je-li to nutné, zpětná vazba z této fáze bude odeslána zpět na začátek pipeline pro další vyhodnocení, dokud nebudou vygenerovány vhodné alternativní formulace nebo slova. Tato fáze využívá Masked Language Modeling (MLM) podle principů stanovených prací z roku 2021 vedené Facebook Research.
Obvykle by úloha MLM maskovala 15 % slov náhodně, ale workflow Dbias místo toho říká procesu, aby vzal identifikovaná předpojatá slova jako vstup.
Architektura byla implementována a trénována na Google Colab Pro na NVIDIA P100 s 24GB VRAM při velikosti batchu 16, pomocí pouze dvou štítků (předpojatý a neutrální).
Testy
Výzkumníci otestovali Dbias proti pěti srovnatelným přístupům: LG-TFIDF s Logistic Regression a TfidfVectorizer (TFIDF) word embeddings; LG-ELMO; MLP-ELMO (feed-forward umělá neuronová síť obsahující ELMO embeddings); BERT; a RoBERTa.
Metriky použité pro testy byly přesnost (ACC), přesnost (PREC), recall (Rec) a F1 skóre. Jelikož výzkumníci neměli žádné znalosti o existujícím systému, který by mohl splnit všechny tři úkoly v jediném pipeline, byla udělena výjimka pro soutěžící rámce, a to tak, že se vyhodnotily pouze primární úkoly Dbias – detekce a rozpoznání předpojatosti.

Výsledky testů Dbias.
Dbias se podařilo překonat výsledky ze všech soutěžících rámců, včetně těch s těžším procesním otiskem.
Práce uvádí:
‘Výsledek také ukazuje, že hluboké neuronové vložky obecně mohou překonat tradiční vložkové metody (například TFIDF) v úkolu klasifikace předpojatosti. To je ukázáno lepšími výsledky hlubokých neuronových vložek (tj. ELMO) ve srovnání s TFIDF vektorizací, když se používají s LG. ‘
‘To je pravděpodobně způsobeno tím, že hluboké neuronové vložky mohou lépe zachytit kontext slov v textu v různých kontextech. Hluboké neuronové vložky a hluboké neuronové metody (MLP, BERT, RoBERTa) také vykonávají lépe než tradiční ML metody (LG).’
Výzkumníci také poznamenávají, že transformátorové metody překonávají soutěžící metody v detekci předpojatosti.
Další test zahrnoval srovnání mezi Dbias a různými verzemi SpaCy Core Web, včetně core-sm (malé), core-md (střední) a core-lg (velké). Dbias byl schopen vést i v těchto testech:

Výzkumníci uzavírají tím, že úkoly rozpoznání předpojatosti obecně vykazují lepší přesnost u větších a dražších modelů, a to zřejmě kvůli zvýšenému počtu parametrů a datových bodů. Také poznamenávají, že účinnost budoucích prací v tomto oboru bude záviset na větších úsilích o anotaci vysoce kvalitních datasetů.
Les a stromy
Takovýto projekt jemné rozpoznání předpojatosti by se mohl jednoho dne stát součástí rámců pro hledání předpojatosti, které jsou schopny mít méně zúžený pohled a zohlednit, že výběr konkrétního příběhu je sám o sobě aktem předpojatosti, který může být ovlivněn více než jen hlášenými statistikami prohlížení. První publikováno 14. července 2022.












