Kąt Andersona
Narzędzie do sprawdzania tendencyjności artykułów prasowych z wykorzystaniem sztucznej inteligencji, dostępne w Pythonie

Naukowcy z Kanady, Indii, Chin i Australii współpracowali przy tworzeniu bezpłatnego pakietu Pythona, który może skutecznie wykrywać i zastępować “niesprawiedliwy język” w artykułach prasowych.
System, nazwany Dbias, wykorzystuje różne technologie sztucznej inteligencji i bazy danych do stworzenia trzystopniowego cyklicznego procesu, który może udoskonalić tendencję tekstu do momentu, gdy zwróci wersję bezstronną lub co najmniej bardziej neutralną.

Ładowany język w fragmencie artykułu prasowego zidentyfikowany jako ‘tendencja’ jest przekształcany w mniej zapalny przez Dbias. Źródło: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf
System reprezentuje wielokrotnie wykorzystywany i samodzielny proces, który może być zainstalowany za pomocą Pip z Hugging Face i zintegrowany z istniejącymi projektami jako dodatkowy etap, dodatek lub wtyczka.
W kwietniu podobna funkcjonalność zaimplementowana w Google Docs spotkała się z krytyką, nie tylko ze względu na brak edytowalności. Dbias, z drugiej strony, może być bardziej selektywnie szkolony na dowolnym korpusie wiadomości, który użytkownik końcowy sobie życzy, zachowując możliwość tworzenia niestandardowych wytycznych dotyczących uczciwości.
Kluczowa różnica polega na tym, że proces Dbias jest przeznaczony do automatycznego przekształcania “ładowanego języka” (słów, które dodają krytyczną warstwę do komunikacji faktów) w język neutralny lub prozaiczny, a nie do szkolenia użytkownika w sposób ciągły. Podstawowo, użytkownik końcowy zdefiniuje filtry etyczne i przeszkoli system odpowiednio; w podejściu Google Docs system jest – można powiedzieć – szkolony przez użytkownika w sposób jednokierunkowy.

Konceptualna architektura procesu Dbias.
Zdaniem naukowców, Dbias jest pierwszym prawdziwie konfigurowalnym pakietem do wykrywania tendencji, w przeciwieństwie do projektów zestawionych z gotowych części, które charakteryzowały ten podsektor przetwarzania języka naturalnego do tej pory.
Nowy artykuł nosi tytuł Podejście do zapewnienia uczciwości w artykułach prasowych i pochodzi od współpracowników z Uniwersytetu w Toronto, Uniwersytetu Metropolitalnego w Toronto, Environmental Resources Management w Bangalore, DeepBlue Academy of Sciences w Chinach i Uniwersytetu w Sydney.
Metoda
Pierwszym modułem w Dbias jest Wykrywanie tendencji, który wykorzystuje pakiet DistilBERT – wysoko zoptymalizowaną wersję dość wymagającego pod względem maszynowym pakietu BERT Google. Dla tego projektu DistilBERT został dostosowany do zestawu danych Media Bias Annotation (MBIC).

Zestaw MBIC składa się z artykułów prasowych z różnych źródeł medialnych, w tym Huffington Post, USA Today i MSNBC. Naukowcy wykorzystali rozszerzoną wersję zestawu danych.
Chociaż oryginalne dane były opatrzonych adnotacjami przez pracowników crowdsourcingowych (metodą, która była poddana krytyce pod koniec 2021 roku), naukowcy nowego artykułu byli w stanie zidentyfikować dodatkowe nieoznaczone przypadki tendencji w zestawie danych i ręcznie je dodać. Zidentyfikowane przypadki tendencji dotyczyły rasy, edukacji, etniczności, języka, religii i płci.
Następny moduł, Rozpoznawanie tendencji, wykorzystuje Named Entity Recognition (NER), aby wyodrębnić słowa tendencji z tekstu wejściowego. Artykuł stwierdza:
‘Na przykład, wiadomość „Nie kupuj pseudo-naukowej sensacji o tornadach i zmianie klimatu” została sklasyfikowana jako tendencja przez poprzedni moduł wykrywania tendencji, a moduł rozpoznawania tendencji może teraz zidentyfikować słowo „pseudo-naukowa sensacja” jako słowo tendencji.’
NER nie jest specjalnie zaprojektowany do tego zadania, ale został wykorzystany wcześniej do identyfikacji tendencji, szczególnie w projekcie z 2021 roku z Uniwersytetu w Durham w Wielkiej Brytanii.
Dla tego etapu naukowcy wykorzystali RoBERTa w połączeniu z potokiem NER SpaCy English Transformer.

Następny etap, Maska tendencji, obejmuje nową wielokrotną maskę słów tendencji, która działa sekwencyjnie w przypadku wielu zidentyfikowanych słów tendencji.

Ładowany język jest zastępowany językiem pragmatycznym w trzecim etapie Dbias.
W razie potrzeby, informacja zwrotna z tego etapu zostanie wysłana z powrotem na początek procesu do dalszej oceny, aż do momentu, gdy zostaną wygenerowane odpowiednie alternatywne sformułowania lub słowa. Ten etap wykorzystuje Masked Language Modeling (MLM) wzdłuż linii ustanowionych przez współpracę z 2021 roku pod przewodnictwem Facebook Research.
Zwykle zadanie MLM maskuje 15% słów losowo, ale proces Dbias mówi procesowi, aby przyjął zidentyfikowane słowa tendencji jako dane wejściowe.
Architektura została zaimplementowana i przeszkolona na Google Colab Pro na NVIDIA P100 z 24 GB pamięci VRAM przy rozmiarze partii 16, przy użyciu tylko dwóch etykiet (tendencja i bezstronna).
Testy
Naukowcy przetestowali Dbias przeciwko pięciu porównywalnym podejściom: LG-TFIDF z regresją logistyczną i TfidfVectorizer (TFIDF) osadzaniem słów; LG-ELMO; MLP-ELMO (sztuczna sieć neuronowa z osadzaniem ELMO); BERT; i RoBERTa.
Metryki użyte do testów to dokładność (ACC), precyzja (PREC), recall (Rec) i wynik F1. Ponieważ naukowcy nie mieli wiedzy o żadnym istniejącym systemie, który mógłby wykonać wszystkie trzy zadania w jednym procesie, zezwolono na odstępstwo od ramowych frameworków, oceniając tylko zadania podstawowe Dbias – wykrywanie i rozpoznawanie tendencji.

Wyniki testów Dbias.
Dbias przewyższył wyniki wszystkich frameworków porównawczych, w tym tych o większym śladzie obliczeniowym
Artykuł stwierdza:
‘Wynik również pokazuje, że głębokie osadzanie neuronowe może przewyższać tradycyjne metody osadzania (np. TFIDF) w zadaniu klasyfikacji tendencji. Jest to pokazane przez lepsze wyniki głębokiego osadzania neuronowego (tj. ELMO) w porównaniu z wektorowaniem TFIDF, gdy używany jest z LG.
‘Prawdopodobnie jest to spowodowane tym, że głębokie osadzanie neuronowe może lepiej uchwycić kontekst słów w tekście w różnych kontekstach. Głębokie osadzanie neuronowe i metody głębokiego uczenia się (MLP, BERT, RoBERTa) również wykonują lepiej niż tradycyjne metody uczenia maszynowego (LG).’
Naukowcy zauważają również, że metody oparte na transformatorach przewyższają metody porównawcze w wykrywaniu tendencji.
Dodatkowy test obejmował porównanie między Dbias a różnymi wariantami SpaCy Core Web, w tym core-sm (mały), core-md (średni) i core-lg (duży). Dbias prowadził również w tych testach:

Naukowcy kończą, obserwując, że zadania rozpoznawania tendencji ogólnie wykazują lepszą dokładność w większych i bardziej kosztownych modelach, co – jak spekulują – jest spowodowane zwiększoną liczbą parametrów i punktów danych. Zauważają również, że skuteczność przyszłej pracy w tym polu będzie zależała od większych wysiłków w celu adnotacji wysokiej jakości zestawów danych.
Las i drzewa
Miejmy nadzieję, że tego rodzaju projekt rozpoznawania tendencji zostanie w końcu włączony do ram tendencji, które są w stanie przyjąć mniej krótkowzroczne spojrzenie i wziąć pod uwagę, że wybranie do pokrycia jakiejkolwiek historii jest samym w sobie aktem tendencji, który jest potencjalnie napędzany przez więcej niż tylko statystyki oglądalności.
Pierwotnie opublikowane 14 lipca 2022.












