Andersonův úhel

MIT: Měření mediální předpojatosti v hlavních zpravodajských kanálech pomocí strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Studie z MIT využila techniky strojového učení k identifikaci předpojatého jazyka v asi 100 největších a nejvlivnějších zpravodajských kanálech v USA a jinde, včetně 83 nejvlivnějších tištěných zpravodajských publikací. Jedná se o výzkumnou snahu, která ukazuje cestu k automatizovaným systémům, které by mohly potenciálně automaticky klasifikovat politický charakter publikace a poskytnout čtenářům hlubší vhled do etického postoje vydavatele k tématům, o kterých se mohou cítit vášnivě.

Práce se zaměřuje na způsob, jakým jsou témata řešena s konkrétním jazykem, jako je nezákonný imigrant | imigrant bez dokladů, plod | nenarozené dítě, demonstranti | anarchisté.

Projekt použil techniky zpracování přirozeného jazyka (NLP) k extrahování a klasifikaci takových instancí “nabitého” jazyka (na základě předpokladu, že zdánlivě neutrálnější termíny také reprezentují politický postoj) do široké mapy, která odhaluje levicovou a pravicovou předpojatost napříč více než třemi miliony článků z asi 100 zpravodajských kanálů, což vede k procházkové mapě předpojatosti uvedených publikací.

Článek pochází od Samantha D’Alonzo a Maxe Tegmarka z fyzikálního oddělení MIT a uvádí, že řada nedávných iniciativ kolem “ověřování faktů” v důsledku mnoha skandálů s “falešnými zprávami” může být interpretována jako neupřímná a sloužící zájmům určitých skupin. Projekt je navržen tak, aby poskytl více datově orientovaný přístup ke studiu použití předpojatosti a “ovlivňujícího” jazyka v údajně neutrálním zpravodajském kontextu.

Spektrum (doslova) levicových a pravicových frází, odvozené ze studie. Zdroj: https://arxiv.org/pdf/2109.00024.pdf

Spektrum (doslova) levicových a pravicových frází, odvozené ze studie. Zdroj: https://arxiv.org/pdf/2109.00024.pdf

Zpracování NLP

Zdrojová data ze studie pocházela z otevřené databáze Newspaper3K a tvořila 3 078 624 článků ze 100 zpravodajských zdrojů, včetně 83 novin. Noviny byly vybrány na základě jejich dosahu, zatímco online zpravodajské zdroje také zahrnovaly články z vojenské analytické stránky Defense One a Science.

Zdroje použité ve studii.

Zdroje použité ve studii.

Článek uvádí, že stažený text byl “minimálně” zpracován. Přímé citáty byly odstraněny, protože studie se zajímá o jazyk zvolený novináři (i když výběr citátů sám o sobě je zajímavým oborem studia).

Britská pravopisná varianta byla změněna na americkou, aby se standardizovala databáze, odstraněna byla všechna interpunkce a kromě řadových čísel byly odstraněny i ostatní čísla. Počáteční velká písmena byly převedena na malá, ale ostatní velká písmena byla zachována.

Prvních 100 000 nejčastějších frází bylo identifikováno a poté ohodnoceno, očištěno a sloučeno do seznamu frází. Všechny redundancies, které mohly být identifikovány (jako “Sdílejte tento článek” a “článek znovu publikován”), byly podobně odstraněny. Variace napříč prakticky identickými frázemi (tj. “velké technologie” a “Velké technologie”, “kybernetická bezpečnost” a “kybernetická bezpečnost”) byly standardizovány.

‘Nutpicking’

Původní test byl na téma “Životy černochů mají význam”, a byl schopen rozlišit frázovou předpojatost a valentní synonyma napříč daty.

Generalizované principy komponent pro články o Black Lives Matter (BLM). Vidíme lidi účastnící se občanské akce charakterizované, doslova a obrazně, zleva doprava, jako demonstranti, anarchisté a na nejpravější straně spektra jako 'povstalci'. Noviny, které původně použily frázi, jsou reprezentovány v pravém panelu.

Generalizované principy komponent pro články o Black Lives Matter (BLM). Vidíme lidi účastnící se občanské akce charakterizované, doslova a obrazně, zleva doprava, jako demonstranti, anarchisté a na nejpravější straně spektra jako ‘povstalci’. Noviny, které původně použily frázi, jsou reprezentovány v pravém panelu.

Zatímco “protestující” přecházejí z “anarchistů” na “povstalce”, jak se pohybujeme podél politického postoje vydavatele, článek uvádí, že NLP extrakce a analýza postoje je brzděna praxí “nutpickingu” – kdy médium cituje frázi, která je považována za platnou odlišnou politickou skupinou společnosti, a může (zdánlivě) spoléhat na to, že její čtenáři budou frázi považovat negativně. Článek cituje “defundovat policii” jako příklad toho.

Přirozeně to znamená, že “levicová” fráze se objevuje v jinak pravicovém kontextu, a představuje neobvyklou výzvu pro systém NLP, který se spoléhá na kódifikované fráze, aby fungovaly jako signifikanty pro politické postoje.

Takové fráze jsou “bi-valentní” [SIC], zatímco jisté jiné fráze mají tak univerzálně negativní konotaci (tj. “infanticida”), že jsou vždy reprezentovány jako negativní napříč řadou médií.

Výzkum také odhaluje podobné mapy pro “horká” témata, jako je potrat, cenzura technologií, imigrace do USA a kontrola zbraní.

Koníčky

Existují určitá kontroverzní politická zaměření v médiích, která se nedělí předvídatelně, jako je téma vojenského výdaje. Článek zjistil, že “levicově orientovaná” CNN skončila vedle pravicově orientovaného National Review a Fox News na tomto tématu.

Obecně však lze politický postoj určit pomocí jiných frází, jako je preference fráze “vojensko-průmyslový komplex” nad více pravicově orientovanou “obranou průmyslem”. Výsledky ukazují, že první je používána kritickými médii, jako je Canary a American Conservative, zatímco druhá je používána častěji Foxem a CNN.

Výzkum stanoví několik dalších progresí od kritiky establishmentu k pro-establishment jazyku, včetně přechodu od “zastřelen” k více pasivnímu “zabití”; “zločinci ve vězení” na “vězněné osoby”; a “producenti ropy” na “velké ropné společnosti”.

Valentní synonyma s předpojatostí establishmentu, shora dolů.

Valentní synonyma s předpojatostí establishmentu, shora dolů.

Výzkum uznává, že média budou “odklánět” od své základní politické pozice, buď na lingvistické úrovni (jako použití bi-valentních frází), nebo z různých jiných motivů. Například uctivá pravicová britská publikace The Spectator, založená v roce 1828, často a prominentně uvádí levicové myšlenkové články, které se dotýkají obecného politického toku jejího obsahu. Zda se to dělá z důvodu nestranného reportování nebo aby se pravidelně rozrušila její jádrová čtenářská základna do generování provozu, je věc dohadů – a není snadný případ pro systém strojového učení, který hledá jasná a konzistentní tokeny.

Tyto konkrétní “koníčky” a ambivalentní použití “šokujících” názorů mezi jednotlivými zpravodajskými organizacemi somewhat zmatou levicovo-pravicovou mapu, kterou výzkum nakonec nabízí, ačkoli poskytuje širokou indikaci politické afiliace.

Zadržená významnost

Ačkoli je článek datován 2. září a publikován na konci srpna 2021, získal relativně málo pozornosti. Částečně to může být proto, že kritický výzkum zaměřený na hlavní média je nepravděpodobně nadšeně přijat jimi; ale mohlo by to být také kvůli neochotě autorů produkovat jasnou a nezaměnitelnou grafiku, která by stratifikovala, kde vlivná a mocná média stojí na různých otázkách, spolu s agregovanými hodnotami, které by ukazovaly, do jaké míry se publikace naklonila doleva nebo doprava. Ve skutečnosti autoři zdají se, že se snaží potlačit potenciální závažný účinek výsledků.

Podobně, rozsáhlá publikovaná data z projektu ukazují frekvenční počty incidentů slov, ale zdají se být anonymizovány, což činí obtížným získat jasnou představu o médiích předpojatosti napříč studovanými publikacemi. Bez operacionalizace projektu nějakým způsobem, to zanechává pouze vybrané příklady prezentované v článku.

Další studie tohoto druhu by možná byly užitečnější, kdyby zvažovaly nejen frázi použité pro témata, ale zda téma bylo pokryto vůbec, protože ticho mluví hlasitě, a má v sobě distinktní politický charakter, který často mluví k více než jen rozpočtovým omezením nebo jiným praktickým faktorům, které mohou informovat výběr zpráv.

Nicméně, studie MIT se zdá být největší svého druhu do dneška a mohla by tvořit rámec pro budoucí klasifikační systémy a dokonce i sekundární technologie, jako jsou pluginy prohlížeče, které by mohly upozornit běžné čtenáře na politickou barvu publikace, kterou právě čtou.

Bubliny, předpojatost a zpětná vazba

Navíc, bylo by třeba zvážit, zda by takové systémy dále zhoršovaly jednu z nejkontroverznějších aspektů algoritmických doporučení – tendenci vést diváka do prostředí, kde nikdy neuvidí kontrastující nebo výzvoucí názor, což je pravděpodobně dále upevňuje postoje čtenáře na jádrové otázky.

Zda je takový obsahový bublin “bezpečným prostředím”, překážkou intelektuálního růstu nebo ochranou proti částečné propagandě, je hodnotový soud – filozofická otázka, která je obtížná k přístupu z mechanistické, statistické perspektivy systémů strojového učení.

Dále, stejně jako studie MIT se snažila nechat data definovat výsledky, klasifikace politické hodnoty frází je nevyhnutelně také druhem hodnotového soudu, a jeden, který nemůže snadno odolat schopnosti jazyka překódovat toxický nebo kontroverzní obsah do nových frází, které nejsou v příručce, fórových pravidlech nebo tréninkové databázi.

Pokud by se taková kódifikace stala součástí populárních online systémů, zdá se pravděpodobné, že neustálý úsilí mapovat etický a politický teplotu hlavních médií by se mohlo vyvinout v studenou válku mezi schopností AI rozpoznat předpojatost a schopností vydavatelů vyjádřit svůj postoj v rozvíjejícím se idiomu, který je navržen tak, aby pravidelně předčil pochopení sémantiky strojovým učením.

14/09/21 – 1.41 GMT+2 – Změněno ‘100 novin’ na ‘100 zpravodajských kanálů’
4:58pm – Opravena citace článku, aby zahrnovala Samantha D’Alonzo a související opravy.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai