Взгляд Anderson
МИТ: Измерение медиа-предвзятости в крупных новостных источниках с помощью машинного обучения

Исследование Массачусетского технологического института (МИТ) использовало методы машинного обучения для выявления предвзятой лексики в примерно 100 крупнейших и наиболее влиятельных новостных источников в США и за рубежом, включая 83 наиболее влиятельных печатных изданий. Это исследование показывает путь к автоматизированным системам, которые потенциально могут классифицировать политический характер публикации и дать читателям более глубокое понимание этической позиции издания по темам, которые они могут считать важными.
Работа сосредоточена на том, как темы освещаются с помощью определенной лексики, такой как нелегальный иммигрант | иммигрант без документов, плоды | нерожденный ребенок, демонстранты | анархисты.
Проект использовал методы обработки естественного языка (NLP) для извлечения и классификации таких случаев “заряженной” лексики (при условии, что, по-видимому, более “нейтральные” термины также представляют политическую позицию) в широкую карту, которая раскрывает левую и правую предвзятость в более чем трех миллионах статей из примерно 100 новостных источников, в результате чего получается навигируемая ландшафт предвзятости публикаций.
Статья написана Самантой Д’Алонзо и Максом Тегмарком из физического факультета МИТ и отмечает, что ряд недавних инициатив по “фактчекингу” в связи с многочисленными скандалами вокруг “фейковых новостей” можно расценивать как неискренние и служащие интересам определенных групп. Проект направлен на предоставление более данных подхода к изучению использования предвзятости и “влияющей” лексики в якобы нейтральном новостном контексте.

Спектр (буквально) левых-правых фраз, полученный из исследования. Источник: https://arxiv.org/pdf/2109.00024.pdf
Обработка NLP
Исходные данные исследования были получены из открытой базы данных Newspaper3K и включали 3 078 624 статьи из 100 источников новостей, включая 83 газеты. Газеты были выбраны на основе их охвата, а онлайн-источники новостей также включали статьи с военного аналитического сайта Defense One и Science.

Источники, использованные в исследовании.
Статья сообщает, что скачанный текст был “минимально” предварительно обработан. Прямые цитаты были исключены, поскольку исследование интересуется языком, выбранным журналистами (хотя выбор цитат сам по себе является интересной областью исследования).
Британские написания были изменены на американские для стандартизации базы данных, все знаки препинания были удалены, а все, кроме порядковых чисел, также удалены. Начальная капитализация предложений была преобразована в нижний регистр, но все остальная капитализация сохранена.
Первые 100 000 наиболее распространенных фраз были определены и в конечном итоге ранжированы, очищены и объединены в список фраз. Все избыточный язык, который можно было определить (например, “Поделитесь этой статьей” и “статья переиздана”), был также удален. Вариации практически идентичных фраз (например, “большая технология” и “Большая технология”, “кибербезопасность” и “кибер-безопасность”) были стандартизированы.
‘Натпикинг’
Первый тест был проведен на тему “Жизни черных важны”, и смог различить предвзятость фраз и валентные синонимы в данных.

Обобщенные принципы компонентов для статей о Black Lives Matter (BLM). Мы видим людей, участвующих в гражданской активности, характеризующихся, буквально и фигурально, слева направо, как демонстранты, анархисты и, на правом конце спектра, как ‘бунтовщики’. Газеты, в которых возникла фраза, представлены в правой панели.
Хотя “протестующие” переходят от “анархистов” к “бунтовщикам”, когда мы перемещаемся вдоль политической позиции издания, статья отмечает, что извлечение и анализ NLP осложняются практикой “натпикинга” – когда медиа-издание цитирует фразу, которая считается действительной другой политической частью общества, и может (по-видимому) полагаться на то, что ее читатели рассматривают эту фразу негативно. Статья цитирует “снять финансирование с полиции” в качестве примера этого.
Естественно, это означает, что “левая” фраза появляется в правом контексте, и представляет собой необычную задачу для системы NLP, которая полагается на кодифицированные фразы в качестве сигналов для политических позиций.
Такие фразы являются “би-валентными” [SIC], тогда как определенные другие фразы имеют универсально негативную коннотацию (например, “инфантицид”), которая всегда представлена как негативная во всех изданиях.
Исследование также показывает аналогичные карты для “горячих” тем, таких как аборт, цензура технологий, иммиграция в США и контроль над оружием.
Хобби-лошади
Существуют определенные спорные политические наклонности в медиа-изданиях, которые не делятся предсказуемо, такие как тема военных расходов. Статья обнаружила, что “левое” CNN оказалось рядом с правым National Review и Fox News по этому вопросу.
В целом, однако, политическая позиция может быть определена другими фразами, такими как предпочтение фразы “военно-промышленный комплекс” над более правой “оборонной промышленностью”. Результаты показывают, что первая используется критическими изданиями, такими как Canary и American Conservative, тогда как вторая используется чаще Fox и CNN.
Исследование устанавливает несколько других прогрессий от критической к про-эстаблишменту лексики, включая спектр от “убит” до более пассивного “убийства”; от “преступников-узников” до “заключенных людей”; и от “нефтяных производителей” до “большой нефти”.

Валентные синонимы с предвзятостью эстаблишмента, сверху вниз.
Исследование признает, что издания будут “отклоняться” от своей базовой политической позиции, либо на лингвистическом уровне (например, использование би-валентных фраз), либо по различным другим мотивам. Например, почтенное правое британское издание The Spectator, основанное в 1828 году, часто и заметно публикует левые мыслительные статьи, которые противоречат общему политическому потоку его контента. Будет ли это сделано из чувства беспристрастного освещения или для периодического раздражения его основной читательской аудитории в трафик-генерирующие комментарии, является предметом猜адения – и не простым случаем для системы машинного обучения, которая ищет четкие и последовательные токены.
Эти конкретные “хобби-лошади” и неоднозначное использование “раздражающих” взглядов среди отдельных новостных организаций несколько запутывают лево-правую карту, которую исследование в конечном итоге предлагает, хотя и дает общее представление о политической принадлежности.

Сокрытая значимость
Хотя датировано 2 сентября и опубликовано в конце августа 2021 года, статья получила относительно мало внимания. Частично это может быть потому, что критические исследования, направленные на основные средства массовой информации, вряд ли будут с энтузиазмом приняты ими; но это также может быть связано с неохотой авторов производить четкие и недвусмысленные графики, стратифицирующие, где влиятельные и мощные медиа-публикации стоят на различных вопросах, а также агрегированные значения, указывающие на степень, в которой публикация склоняется влево или вправо. По сути, авторы, кажется, принимают меры, чтобы смягчить потенциальный инцидирующий эффект результатов.
Аналогично, обширные опубликованные данные проекта показывают частоту встречаемости слов, но, кажется, анонимизированы, что затрудняет получение четкого представления о медиа-предвзятости в изучаемых публикациях. Без какого-либо способа операционализировать проект остается только выбранные примеры, представленные в статье.
Поздniejsшие исследования такого рода, возможно, будут более полезными, если они будут учитывать не только лексику, используемую для тем, но и то, была ли тема вообще освещена, поскольку молчание говорит много, и имеет в себе особый политический характер, который часто говорит о более чем просто бюджетных ограничениях или других прагматических факторов, которые могут повлиять на выбор новостей.
Тем не менее, исследование МИТ, кажется, является крупнейшим своего рода на сегодняшний день и может сформировать основу для будущих систем классификации, а также вторичных технологий, таких как плагины для браузера, которые могут предупредить случайных читателей о политической окраске публикации, которую они в настоящее время читают.
Пузыри, предвзятость и обратная связь
Кроме того, необходимо учитывать, будут ли такие системы еще больше усугублять один из наиболее спорных аспектов алгоритмических систем рекомендаций – тенденцию привести зрителя в среду, где он никогда не увидит контрастную или сложную точку зрения, что, вероятно, еще больше укрепит позицию читателя по основным вопросам.
Является ли такой пузырь контента “безопасной средой”, препятствием для интеллектуального роста или защитой от частичной пропаганды, является ценностным суждением – философским вопросом, который трудно подойти с механистической, статистической точки зрения систем машинного обучения.
Дальше, как и исследование МИТ, приняло меры, чтобы позволить данным определить результаты, классификация политической ценности фраз неизбежно также является своего рода ценностным суждением, которое не может легко выдержать способность языка перекодировать токсичный или спорный контент в новые фразы, которые не находятся в справочнике, форуме правил или базе данных обучения.
Если такая кодификация станет частью популярных онлайн-систем, вероятно, что постоянная попытка картографировать этическую и политическую температуру крупных новостных источников может развиться в холодную войну между способностью ИИ обнаруживать предвзятость и способностью издателей выражать свою точку зрения в эволюционирующем идиоме, предназначенном для регулярного обгоняния понимания семантики систем машинного обучения.
14/09/21 – 1.41 GMT+2 – Изменено ‘100 газет’ на ‘100 новостных источников’
4:58 вечера – Исправлена цитата статьи, включая Саманту Д’Алонзо, и связанные исправления.












