Kąt Andersona

MIT: Pomiar ZaangaÅžowania MediÃģw w GłÃģwnych Wydaniach Prasowych z UÅžyciem Sztucznej Inteligencji

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Badanie przeprowadzone przez MIT wykorzystuje techniki sztucznej inteligencji do identyfikacji tendencyjnego języka w około 100 największych i najbardziej wpływowych wydaniach prasowych w Stanach Zjednoczonych i poza nimi, w tym 83 najbardziej wpływowych publikacji prasowych. Jest to wysiłek badawczy, ktÃģry pokazuje drogę do zautomatyzowanych systemÃģw, ktÃģre mogą potencjalnie sklasyfikować charakter polityczny publikacji i dać czytelnikom głębszy wgląd w postawę etyczną wydawnictwa w sprawach, ktÃģre mogą im przychodzić z pasją.

Praca koncentruje się na sposobie, w jaki tematy są poruszane z wykorzystaniem określonego języka, takiego jak nieudokumentowany imigrant | nielegalny imigrant, płÃģd | nienarodzone dziecko, demonstranci | anarchiści.

Projekt wykorzystał techniki Przetwarzania Języka Naturalnego (NLP) do wyodrębnienia i sklasyfikowania takich przypadkÃģw “naładowanego” języka (z załoÅženiem, Åže pozornie bardziej “neutralne” terminy rÃģwnieÅž reprezentują postawę polityczną) do szerokiej mapy, ktÃģra ujawnia lewicową i prawicową tendencję w ponad trzech milionach artykułÃģw z około 100 wydaniach prasowych, w wyniku czego powstaje nawigowalny krajobraz tendencji publikacji w question.

Artykuł pochodzi od Samantha D’Alonzo i Maxa Tegmarka z Wydziału Fizyki MIT, i stwierdza, Åže wiele ostatnich inicjatyw wokÃģł “sprawdzania faktÃģw” moÅžna interpretować jako nieuczciwe i słuŞące interesom określonych grup. Projekt ma na celu dostarczenie bardziej opartego na danych podejścia do badania zastosowania tendencji i “wpływającego” języka w rzekomo neutralnym kontekście informacyjnym.

Spektrum (dosłownie) lewicowych fraz, pochodzących z badania. ÅđrÃģdło: https://arxiv.org/pdf/2109.00024.pdf

Spektrum (dosłownie) lewicowych fraz, pochodzących z badania. ÅđrÃģdło: https://arxiv.org/pdf/2109.00024.pdf

Przetwarzanie Języka Naturalnego

Dane ÅšrÃģdłowe z badania pochodzą z otwartego ÅšrÃģdła Newspaper3K, i składają się z 3 078 624 artykułÃģw pochodzących z 100 ÅšrÃģdeł informacji, w tym 83 gazet. Gazety zostały wybrane na podstawie ich zasięgu, a ÅšrÃģdła informacji online obejmowały rÃģwnieÅž artykuły z wojskowego serwisu analitycznego Defense One i Science.

ÅđrÃģdła wykorzystane w badaniu.

ÅđrÃģdła wykorzystane w badaniu.

Artykuł podaje, Åže pobrany tekst został “minimalnie” przetworzony. Bezpośrednie cytaty zostały usunięte, poniewaÅž badanie jest zainteresowane językiem wybranym przez dziennikarzy (chociaÅž wybÃģr cytatÃģw jest sam w sobie interesującym polem badawczym).

Brytyjskie pisownie zostały zmienione na amerykańskie, aby standaryzować bazę danych, wszystkie znaki przestankowe zostały usunięte, a wszystkie, z wyjątkiem liczb porządkowych, rÃģwnieÅž zostały usunięte. Początkowa wielkość liter została przekonwertowana na małe litery, ale wszystkie inne wielkości liter zostały zachowane.

Pierwsze 100 000 najczęstszych fraz zostało zidentyfikowanych i ostatecznie sklasyfikowanych, a następnie oczyszczonych i połączonych w listę fraz. Wszystkie redundancje językowe, ktÃģre mogły być zidentyfikowane (takie jak “Udostępnij ten artykuł” i “artykuł ponownie opublikowany”) zostały rÃģwnieÅž usunięte. Wariacje niemal identycznych fraz (tj. “wielki biznes” i “Big Biznes”, “bezpieczeństwo cybernetyczne” i “cyberbezpieczeństwo”) zostały standaryzowane.

‘Nutpicking’

Początkowy test dotyczył tematu “Åŧycie czarnych ma znaczenie”, i był w stanie rozrÃģÅžnić tendencję fraz i synonimy w danych.

UogÃģlnione składowe głÃģwne dla artykułÃģw o Black Lives Matter (BLM). Widzimy ludzi biorących udział w działaniach obywatelskich, określanych dosłownie i w przenośni, od lewej do prawej, jako demonstranci, anarchiści i, na prawym krańcu spektrum, jako 'rozrabiacy'. Gazety, ktÃģre są ÅšrÃģdłem fraz, są przedstawione w prawym panelu.

UogÃģlnione składowe głÃģwne dla artykułÃģw o Black Lives Matter (BLM). Widzimy ludzi biorących udział w działaniach obywatelskich, określanych dosłownie i w przenośni, od lewej do prawej, jako demonstranci, anarchiści i, na prawym krańcu spektrum, jako ‘rozrabiacy’. Gazety, ktÃģre są ÅšrÃģdłem fraz, są przedstawione w prawym panelu.

Podczas gdy “protestujący” przechodzą od “anarchistÃģw” do “rozrabiakÃģw”, gdy przesuwamy się wzdłuÅž politycznej postawy wydawnictwa, artykuł zauwaÅža, Åže ekstrakcja i analiza NLP są utrudnione przez praktykę “nutpicking” – gdzie medium cytuje frazę, ktÃģra jest uwaÅžana za waÅžną przez rÃģÅžne segmenty polityczne społeczeństwa, i moÅže (pozornie) polegać na tym, Åže czytelnictwo postrzega tę frazę negatywnie. Artykuł podaje “rozbroić policję” jako przykład tego.

Oczywiście, oznacza to, Åže “lewicowa” fraza pojawia się w prawicowym kontekście, i stanowi niezwykłe wyzwanie dla systemu NLP, ktÃģry polega na skodyfikowanych frazach, aby działać jako wskaÅšniki postaw politycznych.

Takie frazy są “dwuwartościowe”, podczas gdy pewne inne frazy mają powszechnie negatywne konotacje (tj. “infanticid”), ktÃģre są zawsze reprezentowane jako negatywne w rÃģÅžnych wydaniach.

Badanie ujawnia rÃģwnieÅž podobne mapy dla “gorących” tematÃģw, takich jak aborcja, cenzura technologiczna, imigracja w Stanach Zjednoczonych i kontrola broni.

Hobby Horses

Istnieją pewne kontrowersyjne skłonności polityczne w mediach, ktÃģre nie dzielą się przewidywalnie w ten sposÃģb, takie jak temat wydatkÃģw wojskowych. Artykuł stwierdza, Åže “lewicowo” nastawiona CNN znalazła się obok prawicowej National Review i Fox News w tej sprawie.

W ogÃģle jednak postawę polityczną moÅžna określić za pomocą innych fraz, takich jak preferowanie frazy “military-industrial complex” zamiast bardziej prawicowej “przemysłu obronnego”. Wyniki pokazują, Åže pierwsza fraza jest uÅžywana przez wydawnictwa krytyczne wobec establishmentu, takie jak Canary i American Conservative, podczas gdy druga fraza jest uÅžywana częściej przez Fox i CNN.

Badanie ustanawia kilka innych postępÃģw od języka krytycznego wobec establishmentu do języka pro-establishment, w tym gamę od “zastrzelonego” do bardziej biernego “zabÃģjstwa”; “skazanych przestępcÃģw” do “uwięzionych ludzi”; i “producentÃģw ropy” do “wielkiego biznesu ropy naftowej”.

Synonimy z tendencją establishmentu, od gÃģry do dołu.

Synonimy z tendencją establishmentu, od gÃģry do dołu.

Badanie przyznaje, Åže wydawnictwa “odstępują” od swojej podstawowej postawy politycznej, albo na poziomie językowym (takim jak uÅžycie fraz dwuwartościowych), albo z rÃģÅžnych innych powodÃģw. Na przykład, szanowany prawicowy brytyjski periodyk The Spectator, załoÅžony w 1828 roku, często i wyraÅšnie prezentuje lewicowe artykuły, ktÃģre szorują przeciwko ogÃģlnej postawie politycznej swojego strumienia treści. Czy jest to robione z powodu bezstronnej relacji, czy aby okresowo podburzyć swoich czytelnikÃģw w generujące ruch komentarzach, jest kwestią przypuszczeń – i nie jest łatwym przypadkiem dla systemu sztucznej inteligencji, ktÃģry szuka wyraÅšnych i spÃģjnych tokenÃģw.

Te szczegÃģlne “hobby konie” i niejednoznaczne uÅžycie “szokujących” punktÃģw widzenia wśrÃģd poszczegÃģlnych organizacji medialnych nieco komplikują lewicowo-prawicową mapę, ktÃģrą badanie ostatecznie oferuje, chociaÅž zapewniają one ogÃģlne wskazanie afiliacji politycznej.

Ukryta Istotność

ChociaÅž opublikowany 2 września i opublikowany pod koniec sierpnia 2021 roku, artykuł zyskał stosunkowo niewielką uwagę. Częściowo moÅže to być spowodowane tym, Åže krytyczne badania skierowane do głÃģwnych mediÃģw nie są entuzjastycznie przyjmowane przez nie; ale moÅže to być rÃģwnieÅž spowodowane niechęcią autorÃģw do tworzenia wyraÅšnych i nieambitnych wykresÃģw, ktÃģre stratyfikują, gdzie wpływowe i potęŞne publikacje medialne stoją w rÃģÅžnych sprawach, wraz z zagregowanymi wartościami, ktÃģre wskazują, w jakim stopniu publikacja nachyla się w lewo lub w prawo. W efekcie autorzy zdają się podejmować starania, aby osłabić potencjalny wybuchowy efekt wynikÃģw.

Ponadto, obszerna opublikowana dane z projektu pokazują częstotliwość przypadkÃģw słÃģw, ale zdają się być anonimizowane, co utrudnia uzyskanie wyraÅšnego obrazu tendencji medialnych w badanych publikacjach. Bez operacjonalizacji projektu pozostaje tylko wybrane przykłady przedstawione w artykule.

PÃģÅšniejsze badania tego rodzaju mogłyby być bardziej przydatne, gdyby brały pod uwagę nie tylko frazy uÅžywane do tematÃģw, ale rÃģwnieÅž, czy temat został pokryty w ogÃģle, poniewaÅž milczenie mÃģwi wiele, i ma ono samo w sobie odrębny charakter polityczny, ktÃģry często mÃģwi o więcej niÅž tylko ograniczeniach budÅžetowych lub innych czynnikach, ktÃģre mogą informować selekcję wiadomości.

JednakÅže, badanie MIT wydaje się być największym tego rodzaju dotąd i moÅže stanowić ramy dla przyszłych systemÃģw klasyfikacji, a nawet wtÃģrnych technologii, takich jak wtyczki przeglądarki, ktÃģre mogą ostrzegać czytelnikÃģw o politycznym kolorze publikacji, ktÃģrą aktualnie czytają.

Bąbelki, Tendencja i Odbicie

Ponadto, naleÅžałoby rozwaÅžyć, czy takie systemy musiałyby dalej komplikować jeden z najbardziej kontrowersyjnych aspektÃģw systemÃģw rekomendacji algorytmicznych – tendencję do prowadzenia widza do środowisk, w ktÃģrych nigdy nie widzi on sprzecznego lub wyzwania punktu widzenia, co moÅže dalej umocnić stanowisko czytelnika w sprawach podstawowych.

Czy taka bąbelka treści jest “bezpiecznym środowiskiem”, przeszkodą dla rozwoju intelektualnego, czy ochroną przed częściową propagandą, jest osądem wartości – kwestią filozoficzną, ktÃģrej trudno podejść z mechanicznego, statystycznego punktu widzenia systemÃģw sztucznej inteligencji.

Dalej, podobnie jak badanie MIT podjęło starania, aby pozwolić danym na określenie wynikÃģw, klasyfikacja wartości politycznej fraz jest nieuchronnie rodzajem osądu wartości, ktÃģry nie moÅže łatwo oprzeć się zdolności języka do przekodowania toksycznej lub kontrowersyjnej treści w nowe frazy, ktÃģre nie są w podręczniku, regułach forum lub bazie danych szkoleniowej.

Jeśli takie skodyfikowanie zostanie wbudowane w popularne systemy online, wydaje się prawdopodobne, Åže ciągłe starania, aby mapować etyczny i polityczny temperaturę głÃģwnych wydaniach medialnych, mogą rozwinąć się w zimną wojnę między zdolnością sztucznej inteligencji do wykrywania tendencji a zdolnością wydawcÃģw do wyraÅžania swojego stanowiska w ewoluującym idiome, zaprojektowanym w celu rutynowego wyprzedzania zrozumienia semantyki przez sztuczną inteligencję.

14/09/21 – 1.41 GMT+2 – Zmieniono ‘100 gazet’ na ‘100 wydaniach medialnych’
4:58pm – Poprawiono cytowanie artykułu, aby uwzględnić Samantha D’Alonzo i powiązane poprawki.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]