Kąt Andersona
MIT: Pomiar Zaangażowania Mediów w Głównych Wydaniach Prasowych z Użyciem Sztucznej Inteligencji

Badanie przeprowadzone przez MIT wykorzystuje techniki sztucznej inteligencji do identyfikacji tendencyjnego języka w około 100 największych i najbardziej wpływowych wydaniach prasowych w Stanach Zjednoczonych i poza nimi, w tym 83 najbardziej wpływowych publikacji prasowych. Jest to wysiłek badawczy, który pokazuje drogę do zautomatyzowanych systemów, które mogą potencjalnie sklasyfikować charakter polityczny publikacji i dać czytelnikom głębszy wgląd w postawę etyczną wydawnictwa w sprawach, które mogą im przychodzić z pasją.
Praca koncentruje się na sposobie, w jaki tematy są poruszane z wykorzystaniem określonego języka, takiego jak nieudokumentowany imigrant | nielegalny imigrant, płód | nienarodzone dziecko, demonstranci | anarchiści.
Projekt wykorzystał techniki Przetwarzania Języka Naturalnego (NLP) do wyodrębnienia i sklasyfikowania takich przypadków “naładowanego” języka (z założeniem, że pozornie bardziej “neutralne” terminy również reprezentują postawę polityczną) do szerokiej mapy, która ujawnia lewicową i prawicową tendencję w ponad trzech milionach artykułów z około 100 wydaniach prasowych, w wyniku czego powstaje nawigowalny krajobraz tendencji publikacji w question.
Artykuł pochodzi od Samantha D’Alonzo i Maxa Tegmarka z Wydziału Fizyki MIT, i stwierdza, że wiele ostatnich inicjatyw wokół “sprawdzania faktów” można interpretować jako nieuczciwe i służące interesom określonych grup. Projekt ma na celu dostarczenie bardziej opartego na danych podejścia do badania zastosowania tendencji i “wpływającego” języka w rzekomo neutralnym kontekście informacyjnym.

Spektrum (dosłownie) lewicowych fraz, pochodzących z badania. Źródło: https://arxiv.org/pdf/2109.00024.pdf
Przetwarzanie Języka Naturalnego
Dane źródłowe z badania pochodzą z otwartego źródła Newspaper3K, i składają się z 3 078 624 artykułów pochodzących z 100 źródeł informacji, w tym 83 gazet. Gazety zostały wybrane na podstawie ich zasięgu, a źródła informacji online obejmowały również artykuły z wojskowego serwisu analitycznego Defense One i Science.

Źródła wykorzystane w badaniu.
Artykuł podaje, że pobrany tekst został “minimalnie” przetworzony. Bezpośrednie cytaty zostały usunięte, ponieważ badanie jest zainteresowane językiem wybranym przez dziennikarzy (chociaż wybór cytatów jest sam w sobie interesującym polem badawczym).
Brytyjskie pisownie zostały zmienione na amerykańskie, aby standaryzować bazę danych, wszystkie znaki przestankowe zostały usunięte, a wszystkie, z wyjątkiem liczb porządkowych, również zostały usunięte. Początkowa wielkość liter została przekonwertowana na małe litery, ale wszystkie inne wielkości liter zostały zachowane.
Pierwsze 100 000 najczęstszych fraz zostało zidentyfikowanych i ostatecznie sklasyfikowanych, a następnie oczyszczonych i połączonych w listę fraz. Wszystkie redundancje językowe, które mogły być zidentyfikowane (takie jak “Udostępnij ten artykuł” i “artykuł ponownie opublikowany”) zostały również usunięte. Wariacje niemal identycznych fraz (tj. “wielki biznes” i “Big Biznes”, “bezpieczeństwo cybernetyczne” i “cyberbezpieczeństwo”) zostały standaryzowane.
‘Nutpicking’
Początkowy test dotyczył tematu “Życie czarnych ma znaczenie”, i był w stanie rozróżnić tendencję fraz i synonimy w danych.

Uogólnione składowe główne dla artykułów o Black Lives Matter (BLM). Widzimy ludzi biorących udział w działaniach obywatelskich, określanych dosłownie i w przenośni, od lewej do prawej, jako demonstranci, anarchiści i, na prawym krańcu spektrum, jako ‘rozrabiacy’. Gazety, które są źródłem fraz, są przedstawione w prawym panelu.
Podczas gdy “protestujący” przechodzą od “anarchistów” do “rozrabiaków”, gdy przesuwamy się wzdłuż politycznej postawy wydawnictwa, artykuł zauważa, że ekstrakcja i analiza NLP są utrudnione przez praktykę “nutpicking” – gdzie medium cytuje frazę, która jest uważana za ważną przez różne segmenty polityczne społeczeństwa, i może (pozornie) polegać na tym, że czytelnictwo postrzega tę frazę negatywnie. Artykuł podaje “rozbroić policję” jako przykład tego.
Oczywiście, oznacza to, że “lewicowa” fraza pojawia się w prawicowym kontekście, i stanowi niezwykłe wyzwanie dla systemu NLP, który polega na skodyfikowanych frazach, aby działać jako wskaźniki postaw politycznych.
Takie frazy są “dwuwartościowe”, podczas gdy pewne inne frazy mają powszechnie negatywne konotacje (tj. “infanticid”), które są zawsze reprezentowane jako negatywne w różnych wydaniach.
Badanie ujawnia również podobne mapy dla “gorących” tematów, takich jak aborcja, cenzura technologiczna, imigracja w Stanach Zjednoczonych i kontrola broni.
Hobby Horses
Istnieją pewne kontrowersyjne skłonności polityczne w mediach, które nie dzielą się przewidywalnie w ten sposób, takie jak temat wydatków wojskowych. Artykuł stwierdza, że “lewicowo” nastawiona CNN znalazła się obok prawicowej National Review i Fox News w tej sprawie.
W ogóle jednak postawę polityczną można określić za pomocą innych fraz, takich jak preferowanie frazy “military-industrial complex” zamiast bardziej prawicowej “przemysłu obronnego”. Wyniki pokazują, że pierwsza fraza jest używana przez wydawnictwa krytyczne wobec establishmentu, takie jak Canary i American Conservative, podczas gdy druga fraza jest używana częściej przez Fox i CNN.
Badanie ustanawia kilka innych postępów od języka krytycznego wobec establishmentu do języka pro-establishment, w tym gamę od “zastrzelonego” do bardziej biernego “zabójstwa”; “skazanych przestępców” do “uwięzionych ludzi”; i “producentów ropy” do “wielkiego biznesu ropy naftowej”.

Synonimy z tendencją establishmentu, od góry do dołu.
Badanie przyznaje, że wydawnictwa “odstępują” od swojej podstawowej postawy politycznej, albo na poziomie językowym (takim jak użycie fraz dwuwartościowych), albo z różnych innych powodów. Na przykład, szanowany prawicowy brytyjski periodyk The Spectator, założony w 1828 roku, często i wyraźnie prezentuje lewicowe artykuły, które szorują przeciwko ogólnej postawie politycznej swojego strumienia treści. Czy jest to robione z powodu bezstronnej relacji, czy aby okresowo podburzyć swoich czytelników w generujące ruch komentarzach, jest kwestią przypuszczeń – i nie jest łatwym przypadkiem dla systemu sztucznej inteligencji, który szuka wyraźnych i spójnych tokenów.
Te szczególne “hobby konie” i niejednoznaczne użycie “szokujących” punktów widzenia wśród poszczególnych organizacji medialnych nieco komplikują lewicowo-prawicową mapę, którą badanie ostatecznie oferuje, chociaż zapewniają one ogólne wskazanie afiliacji politycznej.

Ukryta Istotność
Chociaż opublikowany 2 września i opublikowany pod koniec sierpnia 2021 roku, artykuł zyskał stosunkowo niewielką uwagę. Częściowo może to być spowodowane tym, że krytyczne badania skierowane do głównych mediów nie są entuzjastycznie przyjmowane przez nie; ale może to być również spowodowane niechęcią autorów do tworzenia wyraźnych i nieambitnych wykresów, które stratyfikują, gdzie wpływowe i potężne publikacje medialne stoją w różnych sprawach, wraz z zagregowanymi wartościami, które wskazują, w jakim stopniu publikacja nachyla się w lewo lub w prawo. W efekcie autorzy zdają się podejmować starania, aby osłabić potencjalny wybuchowy efekt wyników.
Ponadto, obszerna opublikowana dane z projektu pokazują częstotliwość przypadków słów, ale zdają się być anonimizowane, co utrudnia uzyskanie wyraźnego obrazu tendencji medialnych w badanych publikacjach. Bez operacjonalizacji projektu pozostaje tylko wybrane przykłady przedstawione w artykule.
Późniejsze badania tego rodzaju mogłyby być bardziej przydatne, gdyby brały pod uwagę nie tylko frazy używane do tematów, ale również, czy temat został pokryty w ogóle, ponieważ milczenie mówi wiele, i ma ono samo w sobie odrębny charakter polityczny, który często mówi o więcej niż tylko ograniczeniach budżetowych lub innych czynnikach, które mogą informować selekcję wiadomości.
Jednakże, badanie MIT wydaje się być największym tego rodzaju dotąd i może stanowić ramy dla przyszłych systemów klasyfikacji, a nawet wtórnych technologii, takich jak wtyczki przeglądarki, które mogą ostrzegać czytelników o politycznym kolorze publikacji, którą aktualnie czytają.
Bąbelki, Tendencja i Odbicie
Ponadto, należałoby rozważyć, czy takie systemy musiałyby dalej komplikować jeden z najbardziej kontrowersyjnych aspektów systemów rekomendacji algorytmicznych – tendencję do prowadzenia widza do środowisk, w których nigdy nie widzi on sprzecznego lub wyzwania punktu widzenia, co może dalej umocnić stanowisko czytelnika w sprawach podstawowych.
Czy taka bąbelka treści jest “bezpiecznym środowiskiem”, przeszkodą dla rozwoju intelektualnego, czy ochroną przed częściową propagandą, jest osądem wartości – kwestią filozoficzną, której trudno podejść z mechanicznego, statystycznego punktu widzenia systemów sztucznej inteligencji.
Dalej, podobnie jak badanie MIT podjęło starania, aby pozwolić danym na określenie wyników, klasyfikacja wartości politycznej fraz jest nieuchronnie rodzajem osądu wartości, który nie może łatwo oprzeć się zdolności języka do przekodowania toksycznej lub kontrowersyjnej treści w nowe frazy, które nie są w podręczniku, regułach forum lub bazie danych szkoleniowej.
Jeśli takie skodyfikowanie zostanie wbudowane w popularne systemy online, wydaje się prawdopodobne, że ciągłe starania, aby mapować etyczny i polityczny temperaturę głównych wydaniach medialnych, mogą rozwinąć się w zimną wojnę między zdolnością sztucznej inteligencji do wykrywania tendencji a zdolnością wydawców do wyrażania swojego stanowiska w ewoluującym idiome, zaprojektowanym w celu rutynowego wyprzedzania zrozumienia semantyki przez sztuczną inteligencję.
14/09/21 – 1.41 GMT+2 – Zmieniono ‘100 gazet’ na ‘100 wydaniach medialnych’
4:58pm – Poprawiono cytowanie artykułu, aby uwzględnić Samantha D’Alonzo i powiązane poprawki.












