Unghiul lui Anderson
MIT: Măsurarea prejudecăților mass-media în principalele surse de știri cu ajutorul învățării automate

O cercetare de la MIT a utilizat tehnici de învățare automată pentru a identifica frazele cu prejudecăți în aproximativ 100 dintre cele mai mari și mai influente surse de știri din SUA și dincolo de acestea, incluzând 83 dintre cele mai influente publicații tipărite. Este un efort de cercetare care arată drumul către sisteme automate care ar putea să clasifice în mod automat caracterul politic al unei publicații și să ofere cititorilor o perspectivă mai profundă asupra poziției etice a unei surse de știri pe subiecte pe care le pot considera importante.
Lucrarea se concentrează asupra modului în care subiectele sunt abordate cu fraze specifice, cum ar fi imigrant fără acte | imigrant ilegal, făt | copil nenăscut, manifestanți | anarhiști.
Proiectul a utilizat tehnici de Procesare a Limbajului Natural (NLP) pentru a extrage și a clasifica astfel de exemple de “limbaj încărcat” (pe baza ipotezei că termenii aparent mai “neutri” reprezintă și ei o poziție politică) într-o hartă largă care revelează prejudecățile de stânga și de dreapta în peste trei milioane de articole de la aproximativ 100 de surse de știri, rezultând o hartă navigabilă a peisajului prejudecăților al publicațiilor în cauză.
Articolul provine de la Samantha D’Alonzo și Max Tegmark de la Departamentul de Fizică al MIT și observă că o serie de inițiative recente privind “verificarea faptelor” pot fi interpretate ca fiind lipsite de sinceritate și servind intereselor particulare. Proiectul are scopul de a oferi o abordare mai bazată pe date pentru studiul utilizării prejudecăților și a “limbajului de influență” într-un context de știri aparent neutru.

Un spectru de fraze de la stânga la dreapta, obținut din studiu. Sursă: https://arxiv.org/pdf/2109.00024.pdf
Procesarea NLP
Datele sursă ale studiului au fost obținute din baza de date deschisă Newspaper3K și au cuprins 3.078.624 de articole obținute de la 100 de surse media, incluzând 83 de ziare. Ziarele au fost selectate pe baza numărului de cititori, în timp ce sursele media online au inclus articole de pe site-ul de analiză militară Defense One și Science.

Sursele utilizate în studiu.
Articolul raportează că textul descărcat a fost “minim” prelucrat. Citatele directe au fost eliminate, deoarece studiul se axează asupra limbajului ales de jurnaliști (deși selecția citatelor este în sine un domeniu de studiu interesant).
Ortografia britanică a fost schimbată în americană pentru a standardiza baza de date, toate punctuațiile au fost eliminate, iar toate numerele ordinale, cu excepția celor care nu au putut fi identificate, au fost de asemenea eliminate. Inițial, capitalizarea propozițiilor a fost convertită în litere mici, dar toate celelalte capitalizări au fost păstrate.
Primii 100.000 de fraze cele mai comune au fost identificați și, în cele din urmă, clasificați, curățați și fuzionați într-o listă de fraze. Toate limbajele redundante care au putut fi identificate (cum ar fi “Partajați acest articol” și “articol republicat”) au fost de asemenea șterse. Variantele peste fraze esențial identice (de exemplu, “tehnologie mare” și “Big Tech”, “securitate cibernetică” și “cyber security”) au fost standardizate.
‘Nutpicking’
Testul inițial a fost pe subiectul “Black lives matter” și a putut să distingă prejudecățile de fraze și sinonimele valorice de-a lungul datelor.
În timp ce “protestatarii” trec de la “anarhiști” la “huligani” pe măsură ce ne deplasăm de-a lungul poziției politice a sursei în cauză, articolul notează că extragerea și analiza NLP sunt împiedicate de practica “nutpicking” – unde o sursă media va cita o frază care este considerată valabilă de un segment politic diferit al societății și poate (aparent) să se bazeze pe faptul că cititorii săi o văd negativ. Articolul citează “dezfinanțarea poliției” ca exemplu.
În mod natural, acest lucru înseamnă că o frază “de stânga” apare într-un context în general de dreapta și reprezintă o provocare neobișnuită pentru un sistem NLP care se bazează pe fraze codificate pentru a acționa ca indicatori pentru poziții politice.
Asemenea fraze sunt “bi-valente”, în timp ce anumite alte fraze au o conotație negativă atât de universală (de exemplu, “infanticid”) încât sunt întotdeauna reprezentate ca negative într-o gamă de surse de știri.
Cercetarea revelează, de asemenea, hărți similare pentru subiecte “fierbinți” cum ar fi avortul, cenzura tehnologică, imigrația în SUA și controlul armelor.
Caii de bătaie
Există anumite înclinații politice controversate în sursele media care nu se împart predictibil în acest fel, cum ar fi subiectul cheltuielilor militare. Articolul a constatat că CNN “de stânga” s-a încheiat lângă National Review și Fox News de dreapta pe acest subiect.
În general, însă, poziția politică poate fi determinată de alte fraze, cum ar fi preferința pentru fraza “complex militar-industrial” în loc de “industrie de apărare” mai de dreapta. Rezultatele arată că prima este utilizată de surse critice la adresa establishment-ului, cum ar fi Canary și American Conservative, în timp ce a doua este utilizată mai des de Fox și CNN.
Cercetarea stabilește mai multe progresii de la limbaj critic la establishment la limbaj pro-establishment, incluzând gama de la “împușcat mortal” la “uciderea” mai pasivă; de la “infractori închiși” la “persoane închise”; și de la “producători de petrol” la “marea industrie a petrolului”.

Sinonime valorice cu prejudecăți ale establishment-ului, de sus în jos.
Cercetarea recunoaște că sursele de știri se vor “îndepărta” de poziția lor politică de bază, fie la nivel lingvistic (cum ar fi utilizarea frazelor bi-valente), fie din diverse alte motive. De exemplu, venerabila publicație de dreapta din Regatul Unit The Spectator, înființată în 1828, prezintă frecvent și în mod vizibil piese de gândire de stânga care se freacă de fluxul general al conținutului său, fie dintr-un sentiment de raportare imparțială, fie pentru a inflama periodic cititorii săi de bază în furtuni de comentarii care generează trafic.
Aceste “cai de bătaie” și utilizarea ambiguă a “punctelor de vedere zguduitoare” printre organizații media individuale confundă într-o oarecare măsură harta stânga-dreapta pe care o oferă cercetarea, oferind totuși o indicație generală a afilierii politice.

Semnificație reținută
Deși datat 2 septembrie și publicat la sfârșitul lunii august 2021, articolul a câștigat relativ puțină atenție. Parțial, acest lucru se poate datora faptului că cercetările critice îndreptate către mass-media mainstream sunt puțin probabil să fie primite cu entuziasm de aceasta; dar ar putea fi și din cauza reticenței autorilor de a produce grafice clare și neambigue care să stratifice unde se situează publicațiile media influente și puternice pe diverse subiecte, împreună cu valori agregate care să indice măsura în care o publicație se înclinează spre stânga sau spre dreapta. În esență, autorii par a se strădui să atenueze potențialul efect incendiar al rezultatelor.
De asemenea, datele extinse publicate din proiect arată numărători de frecvență ale incidentelor de cuvinte, dar par a fi anonimizate, făcând dificilă obținerea unei imagini clare a prejudecăților mass-media în rândul publicațiilor studiate. Fără a operaționaliza proiectul într-un fel, aceasta lasă doar exemplele selectate prezentate în articol.
Studii ulterioare de acest fel ar putea fi mai utile dacă ar lua în considerare nu numai frazele utilizate pentru subiecte, ci și dacă subiectul a fost acoperit deloc, deoarece tăcerea vorbește mult și are în sine un caracter politic distinct care vorbește despre mai mult decât doar limitări bugetare sau alte factori pragmatici care pot informa selecția știrilor.
Cu toate acestea, studiul MIT pare a fi cel mai mare de acest fel până în prezent și ar putea forma baza pentru sisteme de clasificare viitoare, și chiar tehnologii secundare, cum ar fi extensiile de browser care ar putea avertiza cititorii casuali asupra culorii politice a publicației pe care o citesc.
Bule, prejudecăți și reacții
În plus, ar trebui luat în considerare dacă astfel de sisteme ar complica și mai mult una dintre cele mai controversate aspecte ale sistemelor de recomandare algoritmice – tendința de a conduce un spectator în medii în care nu vede niciodată o perspectivă contrastantă sau provocatoare, ceea ce este probabil să întărească și mai mult poziția cititorului pe subiecte cheie.
Indiferent dacă o astfel de bulă de conținut este un “mediu sigur”, un impediment pentru creșterea intelectuală sau o protecție împotriva propagandei parțiale, este o judecată de valoare – o chestiune filosofică care este dificil de abordat din punctul de vedere mecanic și statistic al sistemelor de învățare automată.
Mai mult, la fel cum studiul MIT a făcut eforturi pentru a lăsa datele să definească rezultatele, clasificarea valorii politice a frazelor este, de asemenea, o formă de judecată de valoare, și una care nu poate rezista ușor capacității limbajului de a recodifica conținut toxic sau controversat în fraze noi care nu sunt în manual, în regulile forumului sau în baza de date de antrenament.
Dacă o astfel de codificare ar deveni încorporată în sisteme online populare, pare probabil că un efort continuu de a cartografia temperatura etică și politică a principalelor surse de știri ar putea dezvolta o război rece între capacitatea IA de a discerne prejudecăți și capacitatea editorilor de a-și exprima poziția într-un limbaj evolutiv, destinat să depășească în mod regulat înțelegerea semantică a învățării automate.
14/09/21 – 1.41 GMT+2 – Schimbat ‘100 de ziare’ în ‘100 de surse de știri’
4:58 pm – Corectat citarea articolului pentru a include Samantha D’Alonzo și corecții conexe.













