KÄ t Andersona
MIT: Pomiar ZaangaÅžowania MediÃģw w GÅÃģwnych Wydaniach Prasowych z UÅžyciem Sztucznej Inteligencji

Badanie przeprowadzone przez MIT wykorzystuje techniki sztucznej inteligencji do identyfikacji tendencyjnego jÄzyka w okoÅo 100 najwiÄkszych i najbardziej wpÅywowych wydaniach prasowych w Stanach Zjednoczonych i poza nimi, w tym 83 najbardziej wpÅywowych publikacji prasowych. Jest to wysiÅek badawczy, ktÃģry pokazuje drogÄ do zautomatyzowanych systemÃģw, ktÃģre mogÄ potencjalnie sklasyfikowaÄ charakter polityczny publikacji i daÄ czytelnikom gÅÄbszy wglÄ d w postawÄ etycznÄ wydawnictwa w sprawach, ktÃģre mogÄ im przychodziÄ z pasjÄ .
Praca koncentruje siÄ na sposobie, w jaki tematy sÄ poruszane z wykorzystaniem okreÅlonego jÄzyka, takiego jak nieudokumentowany imigrant | nielegalny imigrant, pÅÃģd | nienarodzone dziecko, demonstranci | anarchiÅci.
Projekt wykorzystaÅ techniki Przetwarzania JÄzyka Naturalnego (NLP) do wyodrÄbnienia i sklasyfikowania takich przypadkÃģw ânaÅadowanegoâ jÄzyka (z zaÅoÅženiem, Åže pozornie bardziej âneutralneâ terminy rÃģwnieÅž reprezentujÄ postawÄ politycznÄ ) do szerokiej mapy, ktÃģra ujawnia lewicowÄ i prawicowÄ tendencjÄ w ponad trzech milionach artykuÅÃģw z okoÅo 100 wydaniach prasowych, w wyniku czego powstaje nawigowalny krajobraz tendencji publikacji w question.
ArtykuÅ pochodzi od Samantha DâAlonzo i Maxa Tegmarka z WydziaÅu Fizyki MIT, i stwierdza, Åže wiele ostatnich inicjatyw wokÃģÅ âsprawdzania faktÃģwâ moÅžna interpretowaÄ jako nieuczciwe i sÅuÅžÄ ce interesom okreÅlonych grup. Projekt ma na celu dostarczenie bardziej opartego na danych podejÅcia do badania zastosowania tendencji i âwpÅywajÄ cegoâ jÄzyka w rzekomo neutralnym kontekÅcie informacyjnym.

Spektrum (dosÅownie) lewicowych fraz, pochodzÄ cych z badania. ÅđrÃģdÅo: https://arxiv.org/pdf/2109.00024.pdf
Przetwarzanie JÄzyka Naturalnego
Dane ÅšrÃģdÅowe z badania pochodzÄ z otwartego ÅšrÃģdÅa Newspaper3K, i skÅadajÄ siÄ z 3 078 624 artykuÅÃģw pochodzÄ cych z 100 ÅšrÃģdeÅ informacji, w tym 83 gazet. Gazety zostaÅy wybrane na podstawie ich zasiÄgu, a ÅšrÃģdÅa informacji online obejmowaÅy rÃģwnieÅž artykuÅy z wojskowego serwisu analitycznego Defense One i Science.

ÅđrÃģdÅa wykorzystane w badaniu.
ArtykuÅ podaje, Åže pobrany tekst zostaÅ âminimalnieâ przetworzony. BezpoÅrednie cytaty zostaÅy usuniÄte, poniewaÅž badanie jest zainteresowane jÄzykiem wybranym przez dziennikarzy (chociaÅž wybÃģr cytatÃģw jest sam w sobie interesujÄ cym polem badawczym).
Brytyjskie pisownie zostaÅy zmienione na amerykaÅskie, aby standaryzowaÄ bazÄ danych, wszystkie znaki przestankowe zostaÅy usuniÄte, a wszystkie, z wyjÄ tkiem liczb porzÄ dkowych, rÃģwnieÅž zostaÅy usuniÄte. PoczÄ tkowa wielkoÅÄ liter zostaÅa przekonwertowana na maÅe litery, ale wszystkie inne wielkoÅci liter zostaÅy zachowane.
Pierwsze 100 000 najczÄstszych fraz zostaÅo zidentyfikowanych i ostatecznie sklasyfikowanych, a nastÄpnie oczyszczonych i poÅÄ czonych w listÄ fraz. Wszystkie redundancje jÄzykowe, ktÃģre mogÅy byÄ zidentyfikowane (takie jak âUdostÄpnij ten artykuÅâ i âartykuÅ ponownie opublikowanyâ) zostaÅy rÃģwnieÅž usuniÄte. Wariacje niemal identycznych fraz (tj. âwielki biznesâ i âBig Biznesâ, âbezpieczeÅstwo cybernetyczneâ i âcyberbezpieczeÅstwoâ) zostaÅy standaryzowane.
âNutpickingâ
PoczÄ tkowy test dotyczyÅ tematu âÅŧycie czarnych ma znaczenieâ, i byÅ w stanie rozrÃģÅžniÄ tendencjÄ fraz i synonimy w danych.

UogÃģlnione skÅadowe gÅÃģwne dla artykuÅÃģw o Black Lives Matter (BLM). Widzimy ludzi biorÄ cych udziaÅ w dziaÅaniach obywatelskich, okreÅlanych dosÅownie i w przenoÅni, od lewej do prawej, jako demonstranci, anarchiÅci i, na prawym kraÅcu spektrum, jako ârozrabiacyâ. Gazety, ktÃģre sÄ ÅšrÃģdÅem fraz, sÄ przedstawione w prawym panelu.
Podczas gdy âprotestujÄ cyâ przechodzÄ od âanarchistÃģwâ do ârozrabiakÃģwâ, gdy przesuwamy siÄ wzdÅuÅž politycznej postawy wydawnictwa, artykuÅ zauwaÅža, Åže ekstrakcja i analiza NLP sÄ utrudnione przez praktykÄ ânutpickingâ â gdzie medium cytuje frazÄ, ktÃģra jest uwaÅžana za waÅžnÄ przez rÃģÅžne segmenty polityczne spoÅeczeÅstwa, i moÅže (pozornie) polegaÄ na tym, Åže czytelnictwo postrzega tÄ frazÄ negatywnie. ArtykuÅ podaje ârozbroiÄ policjÄâ jako przykÅad tego.
OczywiÅcie, oznacza to, Åže âlewicowaâ fraza pojawia siÄ w prawicowym kontekÅcie, i stanowi niezwykÅe wyzwanie dla systemu NLP, ktÃģry polega na skodyfikowanych frazach, aby dziaÅaÄ jako wskaÅšniki postaw politycznych.
Takie frazy sÄ âdwuwartoÅcioweâ, podczas gdy pewne inne frazy majÄ powszechnie negatywne konotacje (tj. âinfanticidâ), ktÃģre sÄ zawsze reprezentowane jako negatywne w rÃģÅžnych wydaniach.
Badanie ujawnia rÃģwnieÅž podobne mapy dla âgorÄ cychâ tematÃģw, takich jak aborcja, cenzura technologiczna, imigracja w Stanach Zjednoczonych i kontrola broni.
Hobby Horses
IstniejÄ pewne kontrowersyjne skÅonnoÅci polityczne w mediach, ktÃģre nie dzielÄ siÄ przewidywalnie w ten sposÃģb, takie jak temat wydatkÃģw wojskowych. ArtykuÅ stwierdza, Åže âlewicowoâ nastawiona CNN znalazÅa siÄ obok prawicowej National Review i Fox News w tej sprawie.
W ogÃģle jednak postawÄ politycznÄ moÅžna okreÅliÄ za pomocÄ innych fraz, takich jak preferowanie frazy âmilitary-industrial complexâ zamiast bardziej prawicowej âprzemysÅu obronnegoâ. Wyniki pokazujÄ , Åže pierwsza fraza jest uÅžywana przez wydawnictwa krytyczne wobec establishmentu, takie jak Canary i American Conservative, podczas gdy druga fraza jest uÅžywana czÄÅciej przez Fox i CNN.
Badanie ustanawia kilka innych postÄpÃģw od jÄzyka krytycznego wobec establishmentu do jÄzyka pro-establishment, w tym gamÄ od âzastrzelonegoâ do bardziej biernego âzabÃģjstwaâ; âskazanych przestÄpcÃģwâ do âuwiÄzionych ludziâ; i âproducentÃģw ropyâ do âwielkiego biznesu ropy naftowejâ.

Synonimy z tendencjÄ establishmentu, od gÃģry do doÅu.
Badanie przyznaje, Åže wydawnictwa âodstÄpujÄ â od swojej podstawowej postawy politycznej, albo na poziomie jÄzykowym (takim jak uÅžycie fraz dwuwartoÅciowych), albo z rÃģÅžnych innych powodÃģw. Na przykÅad, szanowany prawicowy brytyjski periodyk The Spectator, zaÅoÅžony w 1828 roku, czÄsto i wyraÅšnie prezentuje lewicowe artykuÅy, ktÃģre szorujÄ przeciwko ogÃģlnej postawie politycznej swojego strumienia treÅci. Czy jest to robione z powodu bezstronnej relacji, czy aby okresowo podburzyÄ swoich czytelnikÃģw w generujÄ ce ruch komentarzach, jest kwestiÄ przypuszczeÅ â i nie jest Åatwym przypadkiem dla systemu sztucznej inteligencji, ktÃģry szuka wyraÅšnych i spÃģjnych tokenÃģw.
Te szczegÃģlne âhobby konieâ i niejednoznaczne uÅžycie âszokujÄ cychâ punktÃģw widzenia wÅrÃģd poszczegÃģlnych organizacji medialnych nieco komplikujÄ lewicowo-prawicowÄ mapÄ, ktÃģrÄ badanie ostatecznie oferuje, chociaÅž zapewniajÄ one ogÃģlne wskazanie afiliacji politycznej.

Ukryta IstotnoÅÄ
ChociaÅž opublikowany 2 wrzeÅnia i opublikowany pod koniec sierpnia 2021 roku, artykuÅ zyskaÅ stosunkowo niewielkÄ uwagÄ. CzÄÅciowo moÅže to byÄ spowodowane tym, Åže krytyczne badania skierowane do gÅÃģwnych mediÃģw nie sÄ entuzjastycznie przyjmowane przez nie; ale moÅže to byÄ rÃģwnieÅž spowodowane niechÄciÄ autorÃģw do tworzenia wyraÅšnych i nieambitnych wykresÃģw, ktÃģre stratyfikujÄ , gdzie wpÅywowe i potÄÅžne publikacje medialne stojÄ w rÃģÅžnych sprawach, wraz z zagregowanymi wartoÅciami, ktÃģre wskazujÄ , w jakim stopniu publikacja nachyla siÄ w lewo lub w prawo. W efekcie autorzy zdajÄ siÄ podejmowaÄ starania, aby osÅabiÄ potencjalny wybuchowy efekt wynikÃģw.
Ponadto, obszerna opublikowana dane z projektu pokazujÄ czÄstotliwoÅÄ przypadkÃģw sÅÃģw, ale zdajÄ siÄ byÄ anonimizowane, co utrudnia uzyskanie wyraÅšnego obrazu tendencji medialnych w badanych publikacjach. Bez operacjonalizacji projektu pozostaje tylko wybrane przykÅady przedstawione w artykule.
PÃģÅšniejsze badania tego rodzaju mogÅyby byÄ bardziej przydatne, gdyby braÅy pod uwagÄ nie tylko frazy uÅžywane do tematÃģw, ale rÃģwnieÅž, czy temat zostaÅ pokryty w ogÃģle, poniewaÅž milczenie mÃģwi wiele, i ma ono samo w sobie odrÄbny charakter polityczny, ktÃģry czÄsto mÃģwi o wiÄcej niÅž tylko ograniczeniach budÅžetowych lub innych czynnikach, ktÃģre mogÄ informowaÄ selekcjÄ wiadomoÅci.
JednakÅže, badanie MIT wydaje siÄ byÄ najwiÄkszym tego rodzaju dotÄ d i moÅže stanowiÄ ramy dla przyszÅych systemÃģw klasyfikacji, a nawet wtÃģrnych technologii, takich jak wtyczki przeglÄ darki, ktÃģre mogÄ ostrzegaÄ czytelnikÃģw o politycznym kolorze publikacji, ktÃģrÄ aktualnie czytajÄ .
BÄ belki, Tendencja i Odbicie
Ponadto, naleÅžaÅoby rozwaÅžyÄ, czy takie systemy musiaÅyby dalej komplikowaÄ jeden z najbardziej kontrowersyjnych aspektÃģw systemÃģw rekomendacji algorytmicznych â tendencjÄ do prowadzenia widza do Årodowisk, w ktÃģrych nigdy nie widzi on sprzecznego lub wyzwania punktu widzenia, co moÅže dalej umocniÄ stanowisko czytelnika w sprawach podstawowych.
Czy taka bÄ belka treÅci jest âbezpiecznym Årodowiskiemâ, przeszkodÄ dla rozwoju intelektualnego, czy ochronÄ przed czÄÅciowÄ propagandÄ , jest osÄ dem wartoÅci â kwestiÄ filozoficznÄ , ktÃģrej trudno podejÅÄ z mechanicznego, statystycznego punktu widzenia systemÃģw sztucznej inteligencji.
Dalej, podobnie jak badanie MIT podjÄÅo starania, aby pozwoliÄ danym na okreÅlenie wynikÃģw, klasyfikacja wartoÅci politycznej fraz jest nieuchronnie rodzajem osÄ du wartoÅci, ktÃģry nie moÅže Åatwo oprzeÄ siÄ zdolnoÅci jÄzyka do przekodowania toksycznej lub kontrowersyjnej treÅci w nowe frazy, ktÃģre nie sÄ w podrÄczniku, reguÅach forum lub bazie danych szkoleniowej.
JeÅli takie skodyfikowanie zostanie wbudowane w popularne systemy online, wydaje siÄ prawdopodobne, Åže ciÄ gÅe starania, aby mapowaÄ etyczny i polityczny temperaturÄ gÅÃģwnych wydaniach medialnych, mogÄ rozwinÄ Ä siÄ w zimnÄ wojnÄ miÄdzy zdolnoÅciÄ sztucznej inteligencji do wykrywania tendencji a zdolnoÅciÄ wydawcÃģw do wyraÅžania swojego stanowiska w ewoluujÄ cym idiome, zaprojektowanym w celu rutynowego wyprzedzania zrozumienia semantyki przez sztucznÄ inteligencjÄ.
14/09/21 â 1.41 GMT+2 â Zmieniono â100 gazetâ na â100 wydaniach medialnychâ
4:58pm â Poprawiono cytowanie artykuÅu, aby uwzglÄdniÄ Samantha DâAlonzo i powiÄ
zane poprawki.












