Погляд Anderson
МІТ: вимірювання медійної упередженості в найбільших новинних джерелах за допомогою машинного навчання

Дослідження Массачусетського технологічного інституту використовує техніки машинного навчання для ідентифікації упередженого формулювання у близько 100 найбільших і найвпливовіших новинних джерел у США та за їхніми межами, включаючи 83 найвпливовіших друкованих видань. Це дослідження показує шлях до автоматизованих систем, які потенційно можуть класифікувати політичний характер видання та надати читачам глибше розуміння етичної позиції джерела щодо питань, про які вони можуть відчувати пристрастно.
Робота центрується на тому, як теми розглядаються з особливим формулюванням, наприклад, незаконний іммігрант | іммігрант без документів, плід | немовля, демонстранти | анархісти.
Проект використовував техніки обробки природної мови (NLP) для виділення та класифікації таких випадків “зарядженого” мовлення (при припущенні, що, здавалося б, більш “нейтральні” терміни також представляють політичну позицію) у широкій карті, яка розкриває ліво- та право-орієнтовану упередженість понад три мільйони статей з близько 100 новинних джерел, що призводить до навігаційної карти упередженості публікацій у питаннях.
Стаття походить від Саманти Д’Алонзо та Макса Тегмарка з фізичного факультету МІТ, і спостерігає, що низка недавніх ініціатив щодо “факт-чекінгу” після численних скандалів з “фейковими новинами” можуть бути трактовані як нечесні та служити інтересам певних груп. Проект призначений для надання більш даних-орієнтованого підходу до вивчення використання упередженості та “впливової” мови в контексті нібито нейтральних новин.

Спектр (буквально) ліво-правих фраз, отриманий з дослідження. Джерело: https://arxiv.org/pdf/2109.00024.pdf
Обробка NLP
Джерельні дані дослідження були отримані з відкритої бази даних Newspaper3K, і складалися з 3 078 624 статей, отриманих з 100 джерел новин, включаючи 83 газети. Газети були вибрані на основі їхнього охоплення, тоді як онлайн-джерела новин також включали статті з військового аналітичного сайту Defense One та Science.

Джерела, використані в дослідженні.
У статті зазначається, що завантажений текст був “мінімально” попередньо оброблений. Прямі цитати були виключені, оскільки дослідження цікавиться мовою, обраною журналістами (хоча вибір цитат сам по собі є цікавою галуззю дослідження).
Британське правопис було змінено на американське для уніфікації бази даних, усунуто всі знаки пунктуації, а всі, крім порядкових чисел, також були видалені. Початкова велика літера була перетворена на малину, але всі інші великі літери збережені.
Перші 100 000 найпоширеніших фраз були визначені та відсортовані, а потім очищені та об’єднані в список фраз. Усі зайві мови, які можна було ідентифікувати (наприклад, “Поділитися цією статтею” та “стаття перепублікована”), були видалені. Варіації практично ідентичних фраз (наприклад, “більше технологій” та “Більше технологій”, “кібербезпека” та “кібер-безпека”) були уніфіковані.
‘Нутпікінг’
Перший тест був проведений на тему “Життя чорних мають значення”, і вдалося розрізнити фразову упередженість та валентні синоніми у даних.

Загальні компоненти принципів для статей про Black Lives Matter (BLM). Ми бачимо людей, які беруть участь у громадській діяльності, характеризованих, буквально і фігурально, зліва направо, як демонстранти, анархісти та, на правому кінці спектру, як ‘бунтарі’. Газети, які походять фразу, представлені в правій панелі.
Хоча “протестувальники” переходять від “анархістів” до “бунтарів”, коли ми рухаємось уздовж політичної позиції джерела, статті зазначає, що витягування NLP та аналіз позиції ускладнюється практикою “нутпікінгу” – коли джерело цитує фразу, яку вважає дійсною іншою політичною частиною суспільства, і може (очевидно) покладатися на свою читачів, щоб вони сприймали цю фразу негативно. Стаття цитує “розформувати поліцію” як приклад цього.
Природно, це означає, що “ліво-орієнтована” фраза з’являється в іншому правому контексті, і представляє особливу складність для системи NLP, яка покладається на кодифіковані фрази як індикатори політичної позиції.
Такі фрази є “бі-валентними” [SIC], тоді як певні інші фрази мають таку універсально негативну конотацію (наприклад, “інфантицид”), що вони завжди представлені як негативні у всіх джерелах.
Дослідження також розкриває подібні карти для “гарячіх” тем, таких як аборти, цензура технологій, імміграція до США та контроль над зброєю.
Хобі-коні
Є певні суперечливі політичні нахили в джерелах новин, які не діляться передбачувано, наприклад, тема військових витрат. Стаття виявила, що “ліво-орієнтований” CNN опинився поруч із право-орієнтованим National Review та Fox News на цій темі.
Загалом, однак, політична позиція може бути визначена іншими фразами, такими як перевага фрази “військово-промисловий комплекс” над більш право-орієнтованою “оборонною промисловістю”. Результати показують, що перша використовується критичними джерелами, такими як Canary та American Conservative, тоді як друга використовується частіше Fox та CNN.
Дослідження встановлює кілька інших прогресій від критичної позиції до про-урядової мови, включаючи гаму від “вбито” до більш пасивної “вбивство”; від “кримінальних ув’язнених” до “ув’язнених людей”; та від “виробників нафти” до “більших нафтових компаній”.

Валентні синоніми з упередженою установою, зверху вниз.
Дослідження визнає, що джерела будуть “відхилятися” від своєї базової політичної позиції, або на лінгвістичному рівні (наприклад, використання бі-валентних фраз), або з різних інших мотивів. Наприклад, шановане право-орієнтоване британське видання The Spectator, засноване в 1828 році, часто і помітно публікує ліво-орієнтовані статті, які суперечать загальному політичному потоку його контенту. Чи робиться це з відчуттям безстороннього повідомлення чи для періодичного розгоряння його основної аудиторії у трафіку-генеруючих бурях коментарів, є предметом припущення – і не легке питання для системи машинного навчання, яка шукає чіткі та послідовні токени.
Ці особливі “хобі-коні” та двозначне використання “дзвонких” поглядів серед окремих джерел новин трохи плутають ліво-праву карту, яку дослідження в кінцевому підсумку пропонує, хоча й надає загальне уявлення про політичну приналежність.

Утримувана значимість
Хоча статті датуються 2 вересня і опубліковані наприкінці серпня 2021 року, вона отримала відносно мало уваги. Частково це може бути тому, що критичне дослідження, спрямоване проти основних ЗМІ, малоймовірно буде з ентузіазмом прийняте ними; але це також може бути через небажання авторів створити чіткі та недвозначні графіки, які стратифікують, де впливові та потужні медійні публікації стоять щодо різних питань, разом з агрегованими значеннями, які вказують на ступінь, до якої публікація нахилена вліво чи вправо. По суті, автори здаються такими, що докладають зусиль, щоб знизити потенційний інцидентний ефект результатів.
Аналогічно, обширні опубліковані дані проекту показують частоту випадків слів, але, здається, анонімізовані, що робить складно отримати чітке уявлення про медійну упередженість серед вивчених публікацій. Без операціоналізації проекту якимось чином це залишає тільки вибрані приклади, представлені в статті.
Пізніші дослідження цього типу, можливо, будуть більш корисними, якщо вони будуть враховувати не тільки фрази, використані для тем, але й те, чи була тема взагалі розглянута, оскільки мовчання говорить об’ємно, і має в собі особливу політичну сутність, яка часто говорить про більше, ніж просто бюджетні обмеження чи інші практичні чинники, які можуть інформувати вибір новин.












