Взгляд Anderson
Недостатки Amazon Mechanical Turk могут угрожать системам генерации естественного языка

Новое исследование Университета Массачусетса в Амхерсте противопоставило учителей английского языка работникам на платформе Amazon Mechanical Turk, оценивающим выходные данные систем генерации естественного языка (NLG), и пришло к выводу, что низкие стандарты и “игра” с высокооцененными задачами среди работников AMT могут препятствовать развитию отрасли.
Отчет приходит к нескольким разгромным выводам о степени, в которой “промышленная” дешевая аутсорсинг открытых задач оценки NLG может привести к худшим результатам и алгоритмам в этой области.
Исследователи также составили список из 45 работ по генерации открытого текста, где исследования использовали AMT, и обнаружили, что “большинство” не сообщили критические детали об использовании сервиса Amazon (AMZN ), что затрудняет воспроизведение результатов работ.
Труд в потогонном режиме
Отчет критикует как сам потогонный характер Amazon Mechanical Turk, так и (вероятно, ограниченные бюджетом) академические проекты, которые придают AMT дополнительную значимость, используя (и цитируя) его как действительный и последовательный ресурс для исследований. Авторы отмечают:
‘Хотя AMT является удобным и доступным решением, мы наблюдаем, что высокая вариативность между работниками, плохая калибровка и когнитивно-требовательные задачи могут привести исследователей к误ленным научным выводам (например, что текст, написанный человеком, “хуже”, чем GPT-2).’
Отчет обвиняет систему, а не игроков, и исследователи отмечают:
‘Работники часто недооцениваются за свою работу, что наносит вред как качеству исследований, так и, более importantly, способности этих работников зарабатывать достойный доход.’
Работа под названием Опасности использования Mechanical Turk для оценки открытого текстового поколения далее заключает, что ‘экспертные оценщики’, такие как учителя языка и лингвисты, должны использоваться для оценки открытого искусственного контента NLG, даже если AMT дешевле.
Тестовые задачи
При сравнении производительности AMT с менее ограниченными во времени, экспертными читателями, исследователи потратили 144 доллара на услуги AMT, фактически использованные в сравнительных тестах (хотя гораздо больше было потрачено на ‘неиспользуемые’ результаты – см. ниже), требуя от случайных ‘турок’ оценить один из 200 текстов, разделенных между контентом, созданным человеком, и искусственно сгенерированным текстом.
Назначение профессиональным учителям одной и той же работы стоило 187,50 доллара, и подтверждение их превосходной производительности (по сравнению с работниками AMT) путем найма фрилансеров Upwork для повторения задач стоило дополнительные 262,50 доллара.
Каждая задача состояла из четырех оценочных критериев: грамматика (‘На сколько грамматически правильен текст истории?’); связность (‘На сколько хорошо предложения в истории связаны между собой?’); приятность (‘На сколько вам нравится история?’); и актуальность (‘На сколько история актуальна для задачи?’).
Генерация текстов
Чтобы получить материал NLG для тестов, исследователи использовали набор данных 2018 года Facebook AI Research’s Иерархическое поколение историй, который состоит из 303 358 английских историй, составленных пользователями на популярном (15 миллионов+ пользователей) r/writingprompts subreddit, где истории пользователей ‘сеяны’ однопредложными ‘промптами’ аналогичным образом текущим практикам в генерации текста в изображение – и, конечно же, в открытых системах генерации естественного языка системах.
200 промптов из набора данных были случайно выбраны и переданы через среднюю модель GPT-2 с использованием библиотеки Hugging-Face Transformers. Таким образом, были получены два набора результатов из одних и тех же промптов: дискурсивные эссе, написанные людьми, из пользователей Reddit, и тексты, сгенерированные GPT-2.
Чтобы предотвратить оценку одним и тем же работником AMT одной и той же истории несколько раз, было собрано три суждения работников AMT за каждый пример. Вместе с экспериментами, касающимися возможностей английского языка работников (см. конец статьи), и учетом результатов от работников с низкими усилиями (см. ‘Короткое время’ ниже), это увеличило общую сумму, потраченную на AMT, до примерно 1 500 долларов США.
Чтобы создать равные условия, все тесты проводились в будние дни между 11:00-11:30 утра по тихоокеанскому времени.
Результаты и выводы
Распространенное исследование охватывает много земли, но ключевые моменты следующие:
Короткое время
Работа показала, что официально заявленное Amazon среднее время задачи в 360 секунд сводится к реальному рабочему времени всего 22 секунды, и медианному рабочему времени только 13 секунд – четверть времени, затраченного на самый быстрый английский учитель, повторяющий задачу.

Из второго дня исследования: отдельные работники (в оранжевом) потратили значительно меньше времени на оценку каждой задачи, чем лучше оплачиваемые учителя, и (позже) еще лучше оплачиваемые подрядчики Upwork. Источник: https://arxiv.org/pdf/2109.06835.pdf
Поскольку AMT не устанавливает ограничений на количество задач, которые может выполнить один работник, появились ‘большие игроки’ AMT, имеющие (прибыльную) репутацию за выполнение большого количества задач за эксперимент. Чтобы компенсировать принятые задачи одним и тем же работником, исследователи измерили время между последовательно представленными задачами, сравнивая начало и конец каждой задачи. Таким образом, нехватка между заявленным AMT WorkTimeInSeconds и фактическим временем, затраченным на задачу, стала очевидной.
Поскольку такая работа не может быть выполнена в этих сокращенных временных рамках, исследователи должны были компенсировать это:
‘Поскольку невозможно тщательно прочитать абзац истории и оценить все четыре свойства за 13 секунд, мы измеряем влияние на средние рейтинги при фильтрации работников, которые тратят слишком мало времени на каждую задачу… Конкретно, мы удаляем суждения от работников, чье медианное время ниже 40 секунд (что является низкой планкой), и обнаруживаем, что в среднем около 42% наших рейтингов фильтруются (варьируются от 20% до 72% во всех экспериментах).’
Работа утверждает, что неправильно сообщенное фактическое рабочее время в AMT является ‘большой проблемой’, обычно упускаемой из виду исследователями, использующими услуги.
Необходимо ручное управление
Найденные результаты进一步 предполагают, что работники AMT не могут надежно различать текст, написанный человеком, и текст, написанный машиной, если они не видят оба текста рядом, что фактически компрометирует типичный сценарий оценки (где читатель должен быть в состоянии сделать суждение на основе одного образца текста, ‘реального’ или искусственно сгенерированного).
Легкое принятие низкокачественного искусственного текста
Работники AMT последовательно оценивали низкокачественный искусственный текст на основе GPT наравне с более высококачественным, связным текстом, написанным людьми, в отличие от учителей английского языка, которые легко могли различить разницу в качестве.
Нет времени на подготовку, нет контекста
Вход в правильный образ мышления для такой абстрактной задачи, как оценка подлинности, не приходит естественным образом; учителям английского языка потребовалось 20 задач, чтобы откалибровать свои чувства к оценочному окружению, в то время как работники AMT обычно не получают ‘времени ориентации’ вообще, снижая качество их входных данных.
Игра в систему
Отчет утверждает, что общее время, которое работники AMT тратят на отдельные задачи, завышается работниками, которые принимают несколько задач одновременно и выполняют задачи в разных вкладках браузера, вместо того, чтобы сосредоточиться на одной задаче в течение зарегистрированного времени задачи.
Страна происхождения важна
По умолчанию настройки AMT не фильтруют работников по стране происхождения, и отчет отмечает предыдущую работу, указывающую на то, что работники AMT используют VPN, чтобы обойти географические ограничения, позволяя не носителям языка представлять себя носителями английского языка (в системе, которая, возможно, довольно наивно, связывает язык работника с его IP-адресом).
Таким образом, исследователи повторно запустили оценочные тесты на AMT с фильтрами, ограничивающими потенциальных участников не-англоязычными странами, и обнаружили, что ‘работники из неанглоязычных стран оценивали связность, актуальность и грамматику… значительно ниже, чем работники из англоязычных стран’.
Отчет заключает:
‘[Экспертные] оценщики, такие как лингвисты или учителя языка, должны использоваться, когда это возможно, поскольку они уже прошли обучение по оценке письменного текста, и это не намного дороже…’.
Опубликовано 16 сентября 2021 года – Обновлено 18 декабря 2021 года: добавлены теги












