Andersons vinkel

MIT: Mätning av mediebias i stora nyhetskällor med maskinlärande

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En studie från MIT har använt maskinlärandetekniker för att identifiera partiska uttryck över ungefär 100 av de största och mest inflytelserika nyhetskällorna i USA och utanför, inklusive 83 av de mest inflytelserika tryckta nyhetspublikationerna. Det är ett forskningsarbete som visar vägen mot automatiserade system som potentiellt kan auto-klassificera den politiska karaktären hos en publikation och ge läsarna en djupare insikt i den etiska ståndpunkten hos en källa på ämnen som de kan känna starkt för.

Arbetet fokuserar på hur ämnen behandlas med särskild formulering, såsom odokumenterad invandrare | olaglig invandrare, foster | ofödd baby, demonstranter | anarkister.

Projektet använde Natural Language Processing (NLP)-tekniker för att extrahera och klassificera sådana instanser av ‘laddad’ språk (med antagandet att tydligen mer ‘neutrala’ termer också representerar en politisk ståndpunkt) till en bred karta som avslöjar vänster- och högerlutande partiskhet över mer än tre miljoner artiklar från runt 100 nyhetskällor, vilket resulterar i en navigerbar partiskhetslandskap av de publikationer i fråga.

Den artikeln kommer från Samantha D’Alonzo och Max Tegmark vid MIT:s fysikavdelning och observerar att ett antal nyliga initiativ runt ‘faktakontroll’, i kölvattnet av flera ‘falska nyheter’-skandaler, kan tolkas som oärliga och tjäna särskilda intressen. Projektet syftar till att ge en mer datastyrd approach till att studera användningen av partiskhet och ‘påverkande’ språk i en påstått neutral nyhetskontext.

Ett spektrum av (bokstavligen) vänster-höger-fraser, som hämtats från studien. Källa: https://arxiv.org/pdf/2109.00024.pdf

Ett spektrum av (bokstavligen) vänster-höger-fraser, som hämtats från studien. Källa: https://arxiv.org/pdf/2109.00024.pdf

NLP-behandling

Källdatan från studien erhölls från den öppna källkoden Newspaper3K-databasen, och bestod av 3 078 624 artiklar erhållna från 100 medie-nyhetskällor, inklusive 83 tidningar. Tidningarna valdes utifrån deras räckvidd, medan online-medie-källor också inkluderade artiklar från den militära nyhetsanalys-sajten Defense One och Science.

De källor som användes i studien.

De källor som användes i studien.

Artikeln rapporterar att den nedladdade texten var ‘minimalt’ förbehandlad. Direkta citat eliminerades, eftersom studien är intresserad av det språk som valts av journalister (även om citatval är i sig ett intressant forskningsområde).

Brittiska stavningsformer ändrades till amerikanska för att standardisera databasen, all punktation togs bort och alla utom ordningsnummer också togs bort. Initial meningsskapande konverterades till gemener, men all annan versalbehandling behölls.

De första 100 000 vanligaste fraserna identifierades och slutligen rankades, rensades och sammanslogs till en fraslista. All redundant språk som kunde identifieras (såsom ‘Dela den här artikeln’ och ‘artikel återpublicerad’) togs också bort. Variationer över i princip identiska fraser (t.ex. ‘stor teknik’ och ‘Stor Teknik’, ‘cybersäkerhet’ och ‘cybersäkerhets’) standardiserades.

‘Nötning’

Den första testen var på ämnet ‘Svarta liv betyder något’, och kunde urskilja fraspartiskhet och valenta synonymer över datan.

Allmänna principkomponenter för artiklar om Black Lives Matter (BLM). Vi ser människor som deltar i civil handling karakteriserade, bokstavligen och figurativt vänster-höger, som demonstranter, anarkister och, i den högersta änden av spektrumet, som 'kravallmakare'. De tidningar som ursprungligen publicerade frasen representeras i högerpanelen.

Allmänna principkomponenter för artiklar om Black Lives Matter (BLM). Vi ser människor som deltar i civil handling karakteriserade, bokstavligen och figurativt vänster-höger, som demonstranter, anarkister och, i den högersta änden av spektrumet, som ‘kravallmakare’. De tidningar som ursprungligen publicerade frasen representeras i högerpanelen.

Medan ‘protestanter’ övergår från ‘anarkister’ till ‘kravallmakare’ när vi glider längs den politiska ståndpunkten hos källan i fråga, noterar artikeln att NLP-extraktionen och analysen hämmas av praktiken att ‘nöta’ – där en mediekälla citerar en fras som anses giltig av en skild politisk sektor av samhället, och kan (tydligen) lita på att dess läsarskara ser frasen negativt. Artikeln citerar ‘avskaffa polisen’ som ett exempel på detta.

Naturligtvis innebär detta att en ‘vänsterlutande’ fras dyker upp i en annan högerinriktad kontext, och representerar en ovanlig utmaning för ett NLP-system som förlitar sig på kodifierade fraser för att fungera som signifikatorer för politiska ståndpunkter.

Sådana fraser är ‘bivalenta’, medan vissa andra fraser har en så universellt negativ konnotation (t.ex. ‘barnamord’) att de alltid representeras som negativa över ett spektrum av källor.

Forskningen avslöjar också liknande kartor för ‘heta’ ämnen som abort, teknisk censur, USA:s invandring och vapenkontroll.

Hobbyhästar

Det finns vissa kontroversiella politiska lutningar i mediekällor som inte delar sig förutsägbart på detta sätt, såsom ämnet militära utgifter. Artikeln fann att ‘vänsterlutande’ CNN hamnade bredvid högerlutande National Review och Fox News på detta ämne.

Generellt sett kan dock den politiska ståndpunkten bestämmas av andra fraser, såsom att föredra frasen ‘militär-industriell komplex’ framför den mer högerlutande ‘försvarsindustri’. Resultaten visar att den förra används av etableringskritiska källor som Canary och Amerikansk konservativ, medan den senare används oftare av Fox och CNN.

Forskningen etablerar flera andra progressioner från etableringskritisk till pro-etableringsspråk, inklusive spektret från ‘skjuten till döds’ till den mer passiva ‘dödandet av’; ‘fångar som begått brott’ till ‘fängslade personer’; och ‘oljeproducenter’ till ‘stor olja’.

Valenta synonymer med etableringspartiskhet, topp till botten.

Valenta synonymer med etableringspartiskhet, topp till botten.

Forskningen erkänner att källor kommer att ‘svänga bort’ från sin grundläggande politiska ståndpunkt, antingen på ett språkligt plan (såsom användningen av bivalenta fraser), eller av olika andra motiv. Till exempel publicerar den ärevördiga högerinriktade brittiska publikationen The Spectator, etablerad 1828, ofta och framträdande vänsterinriktade tankeartiklar som gnider mot den allmänna politiska flödesriktningen i dess innehållsström. Om detta görs av omsorg om opartisk rapportering eller för att periodvis antända dess kärnläsarskara till trafikgenererande kommentarsstormar är en spekulation – och inte ett enkelt fall för ett maskinlärande system som letar efter tydliga och konsekventa token.

De här särskilda ‘hobbyhästarna’ och den tvetydiga användningen av ‘stötande’ perspektiv bland enskilda nyhetsorganisationer förvirrar något den vänster-höger-karta som forskningen slutligen erbjuder, men ger en bred indikation på politisk tillhörighet.

Undertryckt betydelse

Även om den är daterad den 2 september och publicerad i slutet av augusti 2021, har artikeln fått relativt liten uppmärksamhet. Delvis kan detta bero på att kritisk forskning riktad mot den etablerade mediebranschen inte sannolikt kommer att mottas entusiastiskt av den; men det kan också bero på författarnas ovilja att producera tydliga och entydiga grafer som stratifierar var inflytelserika och kraftfulla mediepublikationer står på olika frågor, tillsammans med aggregerade värden som indikerar i vilken utsträckning en publikation lutar åt vänster eller höger. I själva verket verkar författarna ta sig för att dämpa den potentiella kontroversiella effekten av resultaten.

Likaså visar den omfattande publicerade datan från projektet frekvensräkningar av incidenter av ord, men verkar vara anonymiserad, vilket gör det svårt att få en tydlig bild av mediepartiskhet över de studerade publikationerna. Utan att operationalisera projektet på något sätt, lämnar detta endast de utvalda exemplen som presenteras i artikeln.

Senare studier av detta slag skulle möjligtvis vara mer användbara om de också beaktade inte bara den formulering som används för ämnen, utan om ämnet täcktes alls, eftersom tystnad talar volymer, och har i sig en särskild politisk karaktär som ofta talar till mer än bara budgetbegränsningar eller andra praktiska faktorer som kan informera nyhetsurval.

Trots allt verkar den här MIT-studien vara den största av sitt slag hittills och kunde bilda ramen för framtida klassificeringssystem, och till och med sekundära teknologier som webbläsartillägg som kan varna läsare om den politiska färgen på den publikation de läser för tillfället.

Bubblor, partiskhet och motreaktion

Det skulle också behöva övervägas om sådana system skulle förvärra en av de mest kontroversiella aspekterna av algoritmiska rekommendationssystem – tendensen att leda en tittare in i miljöer där de aldrig ser en motsatt eller utmanande synvinkel, vilket sannolikt kommer att ytterligare befästa läsarens ståndpunkt i centrala frågor.

Om en sådan innehållsbubbla är en ‘säker miljö’, ett hinder för intellektuell tillväxt eller ett skydd mot partiell propaganda, är en värdering – en filosofisk fråga som är svår att närma sig från maskinlärande systemens mekanistiska, statistiska synvinkel.

Ytterligare, liksom den här MIT-studien har tagit sig för att låta datan definiera resultaten, är klassificeringen av den politiska värdet av fraser oundvikligen också en sorts värdering, och en som inte lätt kan motstå språkets förmåga att omkodifiera giftigt eller kontroversiellt innehåll till nya fraser som inte finns i handboken, forumreglerna eller utbildningsdatabasen.

Om en sådan kodifiering skulle bli inbäddad i populära onlinesystem, verkar det troligt att en fortlöpande ansträngning att kartlägga den etiska och politiska temperaturen hos stora nyhetskällor kunde utvecklas till ett kallt krig mellan AI:s förmåga att upptäcka partiskhet och utgivarnas förmåga att uttrycka sin ståndpunkt i en utvecklande idiom som rutinmässigt överträffar maskinlärandets förståelse av semantik.

14/09/21 – 1.41 GMT+2 – Ändrade ‘100 tidningar’ till ‘100 nyhetskällor’
4:58 pm – Rättade artikeln till att inkludera Samantha D’Alonzo, och relaterade korrigeringar.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai