Взгляд Anderson
‘Невидимая’, Часто Несчастная Рабочая Сила, Которая Определяет Будущее Искусственного Интеллекта

Два новых отчета, включая статью, возглавляемую исследователями Google, выражают обеспокоенность по поводу того, что текущая тенденция полагаться на дешевую и часто бесправную группу случайных фрилансеров для создания основы для систем машинного обучения может иметь серьезные последствия для искусственного интеллекта.
Среди прочего исследование Google обнаружило, что предвзятости самих фрилансеров, скорее всего, будут встроены в системы искусственного интеллекта, основанные на их ответах; что повсеместные несправедливые трудовые практики (включая в США) на фриланс-платформах могут ухудшить качество ответов; и что система “консенсуса” (по сути, “мини-выборы” для некоторого фрагмента основы, который повлияет на системы искусственного интеллекта), которая в настоящее время решает споры, может фактически отбросить лучшие и/или наиболее информированные ответы.
Это плохие новости; еще хуже то, что практически все средства являются дорогими, длительными или обоими.
Небезопасность, Случайное Отказ и Злоба
Первая статья, написанная пятью исследователями Google, называется Чья Основная Истина? Учет Индивидуальных и Коллективных Идентичностей, Подлежащих Аннотации Данных; вторая статья, написанная двумя исследователями из Университета Сиракьюз в Нью-Йорке, называется Происхождение и Значение Несогласия Среди Аннотаторов Данных: Исследование Индивидуальных Различий в Аннотации Ненавистнической Речи.
Статья Google отмечает, что фрилансеры – чьи оценки часто образуют определяющую основу для систем машинного обучения, которые могут в конечном итоге повлиять на нашу жизнь – часто работают в условиях различных ограничений, которые могут повлиять на их ответы на экспериментальные задания.
Например, текущая политика Amazon Mechanical Turk позволяет заказчикам (тех, кто выдает задания) отклонять работу аннотатора без ответственности*:
‘[Б]ольшинство фрилансеров (94%) имели работу, которая была отклонена или за которую они не были оплачены. Однако заказчики сохраняют все права на полученные данные, независимо от того, принимают или отклоняют их; Робертс (2016) описывает эту систему как “позволяющую украсть зарплату”.’
‘Кроме того, отклонение работы и удержание оплаты болезненно, поскольку отклонения часто вызваны неясными инструкциями и отсутствием значимых каналов обратной связи; многие фрилансеры сообщают, что плохая связь негативно влияет на их работу.’
Авторы рекомендуют исследователям, использующим аутсорсинговые услуги для разработки наборов данных, учитывать, как фриланс-платформа обращается со своими работниками. Они также отмечают, что в США фрилансеры классифицируются как “независимые подрядчики”, а работа, таким образом, не регулируется и не покрывается минимальной заработной платой, предусмотренной Законом о честных трудовых стандартах.
Контекст имеет Значение
Статья также критикует использование ад-хок глобальной рабочей силы для задач аннотации без учета фона аннотатора.
Когда бюджет позволяет, исследователям, использующим AMT и подобные фриланс-платформы, часто дают одну и ту же задачу четырем аннотаторам и следуют “правилу большинства” в отношении результатов.
Контекстуальный опыт, по мнению авторов статьи, заметно недооценен. Например, если вопрос, связанный с сексизмом, случайным образом распределен между тремя согласными мужчинами в возрасте 18-57 лет и одной несогласной женщиной в возрасте 29 лет, мнение мужчин выигрывает, за исключением редких случаев, когда исследователи обращают внимание на квалификацию своих аннотаторов.
Аналогично, если вопрос о поведении банд в Чикаго распределен между сельской женщиной из США в возрасте 36 лет, мужчиной-жителем Чикаго в возрасте 42 лет и двумя аннотаторами из Бангалора и Дании, человек, наиболее вероятно пострадавший от этой проблемы (мужчина из Чикаго), имеет только четвертую долю в результате, в стандартной конфигурации аутсорсинга.
Исследователи утверждают:
‘[П]онятие “одна истина” в ответах на краудсорсинг является мифом; несогласие между аннотаторами, которое часто рассматривается как негативное, может фактически предоставить ценный сигнал. Во-вторых, поскольку многие пулы аннотаторов, полученные через краудсорсинг, социально-демографически искажены, есть последствия для того, какие популяции представлены в наборах данных, а также какие популяции сталкиваются с проблемами [фриланса]. ‘
‘Учет искажений в демографии аннотаторов имеет решающее значение для контекстуализации наборов данных и обеспечения ответственного последующего использования. Короче говоря, есть ценность в признании и учете социокультурного фона работников – как с точки зрения качества данных, так и социального воздействия.’
Нет ‘Нейтральных’ Мнений по Горячим Темам
Даже когда мнения четырех аннотаторов не искажены, ни демографически, ни по каким-либо другим показателям, статья Google выражает обеспокоенность по поводу того, что исследователи не учитывают жизненный опыт или философскую позицию аннотаторов:
‘Хотя некоторые задачи представляют собой объективные вопросы с правильным ответом (есть ли человеческое лицо на изображении?), часто наборы данных направлены на суждение о относительно субъективных задачах, не имеющих универсально правильного ответа (является ли этот текст оскорбительным?). Важно быть намеренным в отношении того, чтобы полагаться на субъективные суждения аннотаторов.’
В отношении своей конкретной области для решения проблем с маркировкой ненавистнической речи статья Сиракьюзского университета отмечает, что более категорические вопросы, такие как Есть ли кошка на этом фотографии?, заметно отличаются от вопроса фрилансеру, является ли фраза “токсичной”:
‘Учитывая сложность социальной реальности, восприятие токсичности людей существенно различается. Их метки токсичного контента основаны на их собственных восприятиях.’
Обнаружив, что личность и возраст имеют “существенное влияние” на размерную маркировку ненавистнической речи, исследователи Сиракьюзского университета приходят к выводу:
‘Эти результаты предполагают, что усилия по обеспечению согласованности аннотаторов с разными фоном и личностью для ненавистнической речи могут никогда полностью не увенчаться успехом.’
Судья Может Быть Предвзятым
Эта отсутствие объективности, вероятно, будет итерироваться вверх, согласно статье Сиракьюзского университета, которая утверждает, что ручное вмешательство (или автоматизированная политика, также решаемая человеком), которое определяет “победителя” голосов консенсуса, также должно быть предметом проверки.
Сравнивая этот процесс с модерацией форума, авторы утверждают:
‘[М]одераторы сообщества могут решить судьбу как постов, так и пользователей в своем сообществе, продвигая или скрывая посты, а также чествуя, стыдя или запрещая пользователей. Решения модераторов влияют на контент, доставляемый членам сообщества и аудитории и, следовательно, также влияют на опыт сообщества в обсуждении. ‘
‘Предполагая, что человеческий модератор является членом сообщества, который имеет демографическое сходство с другими членами сообщества, возможно, что ментальная схема, которую они используют для оценки контента, будет соответствовать той, которую используют другие члены сообщества.’
Это дает некоторое представление о том, почему исследователи Сиракьюзского университета пришли к такому мрачному выводу относительно будущего аннотации ненавистнической речи; подразумевается, что политики и суждения о несогласных мнениях фрилансеров не могут быть просто случайно применены в соответствии с “допустимыми” принципами, которые нигде не закреплены (или не сводятся к применимой схеме, даже если они существуют).
Люди, которые принимают решения (фрилансеры), предвзяты, и были бы бесполезны для таких задач, если бы они не были предвзяты, поскольку задача состоит в том, чтобы предоставить ценностное суждение; люди, которые выносят решения по спорам в результатах фриланса, также принимают ценностные суждения при установлении политики для споров.
Может быть сотни политик в одном только каркасе обнаружения ненавистнической речи, и если каждая из них не будет доведена до Верховного суда, откуда может возникнуть “авторитетный” консенсус?
Исследователи Google предлагают, что ‘[н]есогласие между аннотаторами может встроить ценные нюансы о задаче’. Статья предлагает использование метаданных в наборах данных, отражающих и контекстуализирующих споры.
Однако трудно понять, как такой контекстно-зависимый слой данных может когда-либо привести к метрикам, подобным друг другу, адаптироваться к требованиям установленных стандартных тестов или поддерживать любые определенные результаты – за исключением нереалистичного сценария принятия одной и той же группы исследователей на протяжении всей последующей работы.
Кураторство Пула Аннотаторов
Все это предполагает, что в исследовательском проекте есть бюджет на множественную аннотацию, которая приведет к голосованию консенсуса. Во многих случаях исследователи пытаются “курировать” аутсорсинговый пул аннотации более дешево, указывая характеристики, которые должны иметь работники, такие как географическое положение, пол или другие культурные факторы, торгуя множественностью на специфику.
Статья Google утверждает, что выход из этих проблем может заключаться в установлении расширенных коммуникационных рамок с аннотаторами, аналогичных минимальным коммуникациям, которые приложение Uber облегчает между водителем и пассажиром.
Такой тщательный учет аннотаторов, естественно, будет препятствием для гипермасштабного аутсорсинга аннотации, что приведет либо к более ограниченным и низкообъемным наборам данных, которые имеют лучшую основу для своих результатов, либо к “спешной” оценке аннотаторов, получению ограниченной информации о них и характеризации их как “пригодных для задачи” на основе слишкомlittle информации.
Это если аннотаторы честны.
‘Люди, Угодники’ в Аутсорсинговой Маркировке Наборов Данных
С имеющейся рабочей силой, которая недооплачивается, находится под жесткой конкуренцией за доступные задания и угнетена скудными карьерными перспективами, аннотаторы мотивированы быстро предоставить “правильный” ответ и перейти к следующему мини-заданию.
Если “правильный ответ” – это что-то более сложное, чем Есть кошка/Нет кошки, статья Сиракьюзского университета утверждает, что работник, скорее всего, попытается вывести “допустимый” ответ на основе содержания и контекста вопроса*:
‘И распространение альтернативных концептуализаций, и широкое использование упрощенных методов аннотации, вероятно, препятствуют прогрессу исследований по ненавистнической речи в Интернете. Например, Росс и др. обнаружили, что показывание определения Twitter ненавистнического поведения аннотаторам привело к тому, что они частично выравнивают свои собственные мнения с определением. Это реализация привела к очень низкой надежности аннотаций.’
* Мое преобразование внутренних цитат статьи в гиперссылки.
Опубликовано 13 декабря 2021 г. – Обновлено 18 декабря 2021 г.: Добавлены теги












