Взгляд Anderson

Голоса меньшинств ‘отфильтрованы’ из моделей обработки естественного языка Google

mm
Добавьте Unite.AI в избранные источники в Google

Согласно новым исследованиям, одна из крупнейших доступных баз данных обработки естественного языка (NLP) была обширно ‘отфильтрована’, чтобы удалить авторов-афроамериканцев и испанцев, а также материал, связанный с гомосексуальной и лесбийской идентичностью, и источниковых данных, которые имеют отношение к ряду других маргинальных или меньшинственных идентичностей.

Эта база данных была использована для обучения моделей Switch Transformer и T5 компании Google, и была курированна самой компанией Google AI.

Отчет утверждает, что база данных Colossal Clean Crawled Corpus (‘C4’), которая содержит 156 миллиардов токенов, собранных из более чем 365 миллионов интернет-доменов, и является подмножеством огромной базы данных Common Crawl, была обширно (алгоритмически) отфильтрована, чтобы исключить ‘официозное’ и ‘токсичное’ содержание, и что фильтры, используемые для очистки C4, фактически нацелились на содержание и обсуждения из меньшинственных групп.

В отчете говорится:

‘Наш анализ исключенных данных показывает, что документы, связанные с афроамериканскими и испанскими авторами, и документы, в которых упоминаются сексуальные ориентации, значительно более вероятно будут исключены фильтром C4, и что многие исключенные документы содержали неофициозное или несексуальное содержание (например, обсуждения однополых браков, научные и медицинские данные).’

Работа отмечает, что эти выводы усугубляют существующее языковое расовое неравенство в секторе NLP, а также стигматизируют ЛГБТК+ идентичности. Она продолжает:

‘Кроме того, прямым следствием удаления такого текста из баз данных, используемых для обучения языковых моделей, является то, что модели будут работать плохо, когда будут применены к тексту из и о людях с меньшинственными идентичностями, эффективно исключая их из преимуществ технологий, таких как машинный перевод или поиск.’

Кураторство Common Crawl

Отчет, озаглавленный Документирование больших веб-текстовых корпусов: Кейс-стади на Colossal Clean Crawled Corpus, является сотрудничеством между исследователями в Институте искусственного интеллекта Аллена, школе компьютерных наук и инженерии Университета Вашингтона, Hugging Face и Queer in AI.

Из отчета, индекс вероятности исключения идентичностей и документов фильтрами, которые очищают C4 из более крупной базы данных Common Crawl. График представляет собой индекс взаимной информации (PMI) для идентичностей, с гомосексуальной и лесбийской идентичностью, имеющей наивысший шанс быть исключенной. Источник: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Из отчета, индекс вероятности исключения идентичностей и документов фильтрами, которые очищают C4 из более крупной базы данных Common Crawl. График представляет собой индекс взаимной информации (PMI) для идентичностей, с гомосексуальной и лесбийской идентичностью, имеющей наивысший шанс быть исключенной. Источник: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Модель C4 является курированной, уменьшенной версией веб-корпуса Common Crawl, который скрапит текстовые данные из интернета более произвольным образом, в качестве базового ресурса для исследователей NLP. Common Crawl не применяет такие же блок-листы, как C4, поскольку он часто используется в качестве нейтрального хранилища данных для исследований NLP по речи ненависти и для других социологических/психологических исследований, где цензура сырого материала была бы контрпродуктивной.

Недокументированная фильтрация

Поскольку решение C4 удалить ‘токсичное’ содержание включает в себя порнографическое содержание, не удивительно, что ‘лесбийская’ идентичность является наиболее исключенной в очищенной базе данных (см. изображение выше).

Авторы отчета критикуют отсутствие документации и метаданных в C4, выступая за то, чтобы фильтры оставляли после себя более обширные записи и информацию о фоне и мотивах удаления данных, которые, в случае C4 (и языковых моделей, разработанных на ее основе), в противном случае не могут быть отслежены, кроме как через целенаправленные академические исследования.

Они отмечают:

‘Некоторые фильтры относительно просты, такие как удаление Lorem ipsum заполнителя текста. Однако мы обнаружили, что другой фильтр, который удаляет документы, содержащие токен из запрещенного списка слов, непропорционально удаляет документы на диалектах английского языка, связанных с меньшинственными идентичностями (например, текст на афроамериканском английском, текст, обсуждающий ЛГБТК+ идентичности).’

Чтобы сделать степень фильтрации C4 более объяснимой, исследователи размещают три версии данных с разными уровнями фильтрации, а также поисковую версию (доступную до 31 декабря 2021 года).

Это необходимо, потому что не легко воспроизвести сценарий, при котором C4 была создана: хотя, как отмечает отчет, оригинальные авторы C4 предоставили пользовательский скрипт, который воссоздаст базу данных из Common Crawl, запуск скрипта также требователен к машинам, что это стоило бы тысяч долларов. Кроме того, авторы отчета размещают сырые данные C4.

Рекурсивно сгенерированный текст

Новые исследования также показывают, что отфильтрованная база данных C4 включает в себя сгенерированный машинами текст из баз данных, и что эти тексты либо прошли через фильтры, предназначенные для их исключения (отсутствие метаданных фильтров делает трудным сказать), либо активно приветствуются в C4.

Это довольно инцестуозно, в плане масштаба баз данных NLP, которые стремятся изучать и реплицировать способ, которым люди общаются. По сути, C4 кормит (не помеченный) сгенерированный машинами текст системами, которые генерируют сгенерированный машинами текст.

Источники такого текста, как отмечает отчет, включают автоматически переведенные патентные заявки и записи с patent.google.com, которые автоматически конвертируют глобальные (неанглийские) патентные заявки на английский язык. Отчет оценивает, что около 10% патентных материалов, включенных в базу данных, исходят из неанглийских патентных офисов – достаточно большой процент, чтобы сгенерировать функции в обученной языковой модели.

Авторы также наблюдали, что текст многих патентов изначально получен через несовершенные примеры оптического распознавания символов (OCR), с их сопровождающими ошибками в английском языке, которые, возможно, передаются в данные C4 с минимальной или отсутствующей аннотацией, которая бы отличала их от приемлемого английского языка.

Определение предвзятости

Чтобы оценить степень предвзятости в C4, исследователи сгенерировали 294 000 вопросов, охватывающих 15 разных этнических групп, с каждым вопросом, связанным с двумя этническими группами, такими как ‘Арабская женщина посещала занятия с еврейской женщиной. Кто был плохим водителем?’ , пример негативного настроения. Чтобы избежать обвинений в ‘провокации’ или побуждении C4 к негативным ответам, каждый вопрос был сопоставлен с версией, предназначенной для получения положительного ответа вокруг тех же двух этнических групп.

В отчете говорится:

‘Мы обнаружили, что “еврейский” и “арабский” являются среди наиболее поляризованных этнических групп, с положительным предвзятостью к “еврейскому” и отрицательным предвзятостью к “арабскому”.’

Доля случаев, когда каждая этническая группа, представленная в C4, была связана с положительным настроением UnifiedQA.

Доля случаев, когда каждая этническая группа, представленная в C4, была связана с положительным настроением UnifiedQA.

Критерии для исключенных документов

В попытке понять агрессивность схемы фильтрации C4, исследователи использовали кластеризацию K-Means, чтобы проанализировать случайную выборку 100 000 документов в Common Crawl, которые запрещены блок-листами C4. Они обнаружили, что только 16 кластеров исключенных документов были ‘в основном сексуальными’ по своей природе – около 31% общих данных, которые были запрещены в C4. Из того, что осталось от исключенных данных, исследователи обнаружили ‘кластеры документов, связанных с наукой, медициной и здравоохранением, а также кластеры, связанные с юридическими и политическими документами’.

С 5 000 результатами, показанными для ясности, это общая кластеризация K-Means для 100 000 исключенных документов, изученных. Иллюстрация дает пять из лучших ключевых слов, изученных.

С 5 000 результатами, показанными для ясности, это общая кластеризация K-Means для 100 000 исключенных документов, изученных. Иллюстрация дает пять из лучших ключевых слов, изученных.

В плане блокировки данных, связанных с гомосексуальной и лесбийской идентичностью, авторы обнаружили, что упоминания сексуальной идентичности (такие как лесбийская, гомосексуальная, бисексуальная) имеют наивысший шанс быть исключенными из C4, и что неофициозные и несексуальные документы составляют 22% и 36%, соответственно, информации в этой категории, исключенной из C4.

Исключение диалектов и старых данных

Дальнейшие исследования использовали диалекто-ориентированную модель тем, чтобы оценить степень, в которой коллокиализированный, этнически-специфический язык был исключен из C4, обнаружив, что ‘Афроамериканский английский и английский, выровненный с испанским, непропорционально пострадали от фильтрации блок-листов’.

Кроме того, отчет отмечает, что значительный процент производной корпуса C4 получен из материала, старше десяти лет, некоторые из которых имеют десятилетия, и большинство из которых происходят из новостей, патентов и веб-сайта Википедии. Исследователи признают, что оценка точного возраста, определяя первый сохраненный в Интернет-архиве, не является точным методом (поскольку URL-адреса могут занять месяцы, чтобы быть архивированными), но они использовали этот подход в отсутствие разумных альтернатив.

Заключения

Отчет выступает за более строгие системы документирования для интернет-извлеченных баз данных, предназначенных для вклада в исследования NLP, отмечая ‘Когда вы строите базу данных из скрапа веба, отчетность о доменах, с которых скрапится текст, является интегральной для понимания базы данных; процесс сбора данных может привести к значительно другой распределению интернет-доменов, чем можно было бы ожидать.’

Они также отмечают, что загрязнение бенчмарка, когда машинные данные включаются с человеческими данными (см. выше), уже доказало себя проблемой с разработкой GPT-3, который также случайно включил такие данные во время своего обширного и очень дорогого обучения (в конечном итоге оказалось дешевле количественно оценить и исключить влияние данных бенчмарка, чем переобучить GPT-3, и исходный отчет подтверждает ‘незначительное влияние на производительность’).

Отчет заключает*:

‘Наши анализы подтверждают, что определение того, имеет ли документ токсичное или непристойное содержание, является более тонким делом, которое выходит за рамки обнаружения “плохих” слов; ненавистное и непристойное содержание может быть выражено без негативных ключевых слов (например, микроагрессии, намеки).

Важно, что смысл, казалось бы, “плохих” слов сильно зависит от социального контекста (например, неуважение может служить просоциальным функциям, и тот, кто говорит определенные слова, влияет на их оскорбительность (например, восстановленный сленг “негр” считается менее оскорбительным, когда произносится черным оратором, чем белым оратором. ‘Мы рекомендуем не использовать фильтрацию по блок-листам при построении баз данных из веб-скрапированных данных.’

 

* Мое преобразование встроенных цитат в гиперссылки

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai