Взгляд Anderson

Инструмент проверки предвзятости на основе ИИ для новостных статей, доступный на Python

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи в Канаде, Индии, Китае и Австралии сотрудничали в создании бесплатного пакета Python, который можно эффективно использовать для обнаружения и замены «несправедливого языка» в новостных материалах.

Система, озаглавленная Dbias, использует различные технологии машинного обучения и базы данных для разработки трехэтапной циклической рабочей схемы, которая может усовершенствовать предвзятый текст до тех пор, пока он не вернет непредвзятую или, по крайней мере, более нейтральную версию.

Загруженный язык в новостном фрагменте, идентифицированном как «предвзятый», преобразуется в менее взрывоопасную версию с помощью Dbias. Источник: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf

Загруженный язык в новостном фрагменте, идентифицированном как «предвзятый», преобразуется в менее взрывоопасную версию с помощью Dbias. Источник: https://arxiv.org/ftp/arxiv/papers/2207/2207.03938.pdf

Система представляет собой многоразовую и самодостаточную рабочую схему, которую можно установить через Pip из Hugging Face и интегрировать в существующие проекты в качестве дополнительной стадии, дополнения или плагина.

В апреле аналогичная функциональность, реализованная в Google Docs подверглась критике, не в последнюю очередь из-за отсутствия редактируемости. Dbias, с другой стороны, может быть более избирательно обучен на любой корпусе новостей, который желает конечный пользователь, сохраняя возможность разработки индивидуальных руководств по справедливости.

Критическое различие заключается в том, что рабочая схема Dbias предназначена для автоматического преобразования «загруженного языка» (слов, которые добавляют критический слой к фактической коммуникации) в нейтральный или прозаический язык, а не для обучения пользователя на постоянной основе. По сути, конечный пользователь будет определять этические фильтры и обучать систему соответственно; в подходе Google Docs система — можно сказать, — обучает пользователя в одностороннем порядке.

Концептуальная архитектура рабочей схемы Dbias.

Концептуальная архитектура рабочей схемы Dbias.

По словам исследователей, Dbias является первым по-настоящему настраиваемым пакетом обнаружения предвзятости, в отличие от проектов сборки, которые характеризовали этот сегмент естественного языкового процесса (NLP) на данный момент.

Новая статья новая статья озаглавлена Подход к обеспечению справедливости в новостных статьях, и исходит от авторов Университета Торонто, Торонтского метрополитенского университета, Управления экологическими ресурсами в Бангалоре, Академии наук DeepBlue в Китае и Университета Сиднея.

Метод

Первый модуль в Dbias — Обнаружение предвзятости, который использует пакет DistilBERT — высокооптимизированную версию довольно ресурсоемкого BERT от Google. Для проекта DistilBERT был дообучен на наборе данных Media Bias Annotation (MBIC).

MBIC состоит из новостных статей из различных источников, включая The Huffington Post, USA Today и MSNBC. Исследователи использовали расширенную версию набора данных.

Хотя исходные данные были аннотированы работниками, набранными через краудсорсинг (метод, который подвергся критике в конце 2021 года), исследователи новой статьи смогли выявить дополнительные неаннотированные случаи предвзятости в наборе данных и добавили их вручную. Выявленные случаи предвзятости были связаны с расой, образованием, этнической принадлежностью, языком, религией и полом.

Следующий модуль, Распознавание предвзятости, использует Named Entity Recognition (NER) для индивидуализации предвзятых слов из входного текста. Статья гласит:

‘Например, новость “Не покупайте псевдонаучную рекламу о торнадо и изменении климата” была классифицирована как предвзятая предыдущим модулем обнаружения предвзятости, и модуль распознавания предвзятости может теперь выявить термин “псевдонаучная реклама” как предвзятое слово.’

NER не предназначен специально для этой задачи, но был использован ранее для выявления предвзятости, в частности, для проекта 2021 года из Университета Дарема в Великобритании.

Для этой стадии исследователи использовали RoBERTa в сочетании с английским трансформаторным конвейером NER SpaCy.

Следующая стадия, Маскирование предвзятости, включает в себя новый многократный маскировщик выявленных предвзятых слов, который работает последовательно в случаях нескольких выявленных предвзятых слов.

Загруженный язык заменяется прагматическим языком на третьей стадии Dbias. Обратите внимание, что 'мусоление' и 'использование' эквивалентны одному и тому же действию, хотя первое считается уничижительным.

Загруженный язык заменяется прагматическим языком на третьей стадии Dbias. Обратите внимание, что ‘мусоление’ и ‘использование’ эквивалентны одному и тому же действию, хотя первое считается уничижительным.

По мере необходимости, обратная связь от этой стадии будет отправлена обратно в начало конвейера для дальнейшей оценки до тех пор, пока не будет сгенерировано достаточное количество подходящих альтернативных фраз или слов. Эта стадия использует Masked Language Modeling (MLM) по линиям, установленным в 2021 году сотрудничеством под руководством Facebook Research.

Обычно задача MLM будет маскировать 15% слов случайным образом, но рабочая схема Dbias вместо этого говорит процессу использовать выявленные предвзятые слова в качестве входных данных.

Архитектура была реализована и обучена на Google Colab Pro на NVIDIA (NVDA ) P100 с 24 ГБ видеопамяти при размере пакета 16, используя только два ярлыка (предвзятый и непредвзятый).

Тесты

Исследователи протестировали Dbias против пяти сравнимых подходов: LG-TFIDF с логистической регрессией и TfidfVectorizer (TFIDF) встраивания слов; LG-ELMO; MLP-ELMO (фидбэковый искусственный нейронный сетевой контейнер, содержащий встраивания ELMO); BERT; и RoBERTa.

Метрики, использованные для тестов, были точностью (ACC), точностью (PREC), полнотой (Rec) и баллом F1. Поскольку исследователи не знали о какой-либо существующей системе, которая могла бы выполнить все три задачи в одном конвейере, было сделано исключение для конкурирующих рамок, оценивающих только основные задачи Dbias — обнаружение и распознавание предвзятости.

Результаты испытаний Dbias.

Результаты испытаний Dbias.

Dbias смог превзойти результаты всех конкурирующих рамок, включая те, которые имеют более тяжелый след процессора

Статья гласит:

‘Результат также показывает, что глубокие нейронные встраивания в целом могут превосходить традиционные методы встраивания (например, TFIDF) в задаче классификации предвзятости. Это видно из лучшей производительности глубоких нейронных встраиваний (т. е. ELMO) по сравнению с векторизацией TFIDF при использовании с LG.

‘Это, вероятно, потому, что глубокие нейронные встраивания могут лучше захватить контекст слов в тексте в разных контекстах. Глубокие нейронные встраивания и глубокие нейронные методы (MLP, BERT, RoBERTa) также работают лучше, чем традиционный метод ML (LG).’

Исследователи также отмечают, что методы, основанные на трансформаторах, превосходят конкурирующие методы в обнаружении предвзятости.

Дополнительный тест включал сравнение между Dbias и различными вариантами SpaCy Core Web, включая core-sm (маленький), core-md (средний) и core-lg (большой). Dbias смог возглавить доску и в этих испытаниях:

Исследователи делают вывод, наблюдая, что задачи распознавания предвзятости обычно показывают лучшую точность в более крупных и дорогих моделях, из-за — как они предполагают — увеличенного количества параметров и точек данных. Они также отмечают, что эффективность будущей работы в этой области будет зависеть от более значительных усилий по аннотации высококачественных наборов данных.

Лес и деревья

Надеюсь, что этот тип проекта тонкого распознавания предвзятости в конечном итоге будет включен в рамки, ищущие предвзятость, которые могут принять менее узкий взгляд и учитывать, что выбор любого конкретного сюжета сам по себе является актом предвзятости, который потенциально обусловлен не только статистикой просмотров.

 

Опубликовано впервые 14 июля 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai