Погляд Anderson

Недоліки Amazon Mechanical Turk можуть загрожувати системам генерації природної мови

mm
Додайте Unite.AI до бажаних джерел у Google

Нове дослідження Університету Массачусетсу в Амгерсті поставило англійських вчителів проти робітників на платформі Amazon Mechanical Turk для оцінки виводу систем генерації природної мови (NLG), і дійшло висновку, що слабкі стандарти та “ігри” з цінними завданнями серед робітників Amazon Mechanical Turk можуть перешкоджувати розвитку галузі.

Звіт містить ряд критичних висновків щодо того, якою мірою “промислово-масштабна” дешева аутсорсинг відкритих завдань оцінки NLG може призвести до нижчої якості результатів і алгоритмів у цій галузі.

Дослідники також склали список з 45 робіт про генерацію відкритого тексту, де дослідження використовувало Amazon Mechanical Turk, і виявили, що “більшість” не повідомили критичні деталі про використання сервісу Amazon, що ускладнює повторення результатів робіт.

Проблеми з працею

Звіт критикує як саму систему Amazon Mechanical Turk, так і (ймовірно, бюджетно обмежені) академічні проекти, які надають AMT додаткову легітимність, використовуючи його як дійсний і послідовний дослідницький ресурс. Автори відзначають:

‘Хоча AMT є зручним і доступним рішенням, ми спостерігаємо, що висока варіативність між робітниками, погана калібрування і когнітивно-важкі завдання можуть привести дослідників до помилкових наукових висновків (наприклад, що людський текст “гірший”, ніж GPT-2).’

Звіт звинувачує систему, а не робітників, зазначаючи:

‘Робітники часто недооплачуються за свою працю, що шкодить якісності дослідження, і більш важливо, здатності цих робітників заробляти достатній дохід.’

Стаття стаття, озаглавлена Небезпеки використання Mechanical Turk для оцінки відкритої генерації тексту, ще раз підкреслює, що “експертні оцінювачі”, такі як вчителі мови і лінгвісти, повинні бути використані для оцінки відкритого штучного контенту NLG, навіть якщо AMT дешевше.

Тестові завдання

При порівнянні результатів AMT з результатами менш обмежених у часі експертних читачів дослідники витратили 144 долари на послуги AMT, які були фактично використані в порівняльних тестах (хоча значно більше було витрачено на “не придатні” результати – див. нижче), і просили випадкових “турків” оцінити один з 200 текстів, розділених між людським текстом і штучно створеним текстом.

Навантаження професійних вчителів цією же роботою коштувало 187,50 доларів, і підтвердило їхню вищу продуктивність (у порівнянні з робітниками AMT) шляхом найму фрілансерів з Upwork для повторення завдань, що коштувало додатково 262,50 доларів.

Кожне завдання складалося з чотирьох оцінювальних критеріїв: граматика (‘Яка граматична правильність тексту уривка історії?’); узгодженість (‘Як добре речення уривка історії сполучаються?’); привабливість (‘Як ви знайшли уривок історії привабливим?’); і актуальність (‘Яка актуальність уривка історії щодо запиту?’).

Генерація текстів

Для отримання матеріалів NLG для тестів дослідники використовували набір даних Facebook AI Research 2018 року Ієрархічна генерація нейронних історій набір даних, який складається з 303 358 англійських історій, створених користувачами на популярному (15 млн+ користувачів) р/WritingPrompts subreddit, де історії користувачів “посаджені” одним реченням “промптами” подібним чином до поточних практик у генерації тексту в зображення – і, звичайно, у відкритих системах генерації природної мови систем.

200 промптів з набору даних були випадково вибрані і передані через середній модель GPT-2 за допомогою бібліотеки Hugging-Face Transformers бібліотеки. Таким чином були отримані два набори результатів з тих самих промптів: людські есе з Reddit і текст, згенерований GPT-2.

Щоб уникнути того, щоб одні й ті ж робітники AMT оцінювали одну й ту ж історію кілька разів, було запрошено три оцінки робітників AMT на приклад. Разом з експериментами щодо англійських мовних можливостей робітників (див. кінець статті) і виключенням результатів з низькими зусиллями робітників (див. “Короткий час” нижче), це збільшувало загальні витрати на AMT до близько 1 500 доларів США.

Щоб створити рівні умови, всі тести проводилися в робочі дні між 11:00-11:30 PST.

Результати та висновки

Розгорнуте дослідження охоплює багато питань, але ключові моменти такі:

Короткий час

У статті було виявлено, що офіційно заявлений Amazon середній час виконання завдання 360 секунд насправді зводиться до реального робочого часу лише 22 секунди, і медіанного робочого часу лише 13 секунд – чверть часу, витраченого найшвидшим англійським учителем на повторення завдання.

З другого дня дослідження: окремі робітники (помаранчевий колір) витратили значно менше часу на оцінку кожного завдання, ніж краще оплачувані вчителі, і (пізніше) ще краще оплачувані контрактники з Upwork. Джерело: https://arxiv.org/pdf/2109.06835.pdf

З другого дня дослідження: окремі робітники (помаранчевий колір) витратили значно менше часу на оцінку кожного завдання, ніж краще оплачувані вчителі, і (пізніше) ще краще оплачувані контрактники з Upwork. Джерело: https://arxiv.org/pdf/2109.06835.pdf

Відтак робітники Amazon Mechanical Turk не можуть надійно розрізняти текст, написаний людиною, і текст, написаний машиною, якщо вони не бачать обидва тексти поряд, що фактично компрометувало б типовий сценарій оцінки (де читач повинен бути здатний зробити висновок на основі одного зразка тексту, “реального” або штучно створеного).

Необхідність ручного керування

Результати дослідження далі свідчать про те, що робітники AMT не можуть надійно розрізняти текст, написаний людиною, і текст, написаний машиною, якщо вони не бачать обидва тексти поряд, що фактично компрометувало б типовий сценарій оцінки (де читач повинен бути здатним зробити висновок на основі одного зразка тексту, “реального” або штучно створеного).

Звичка до низькоякісного штучного тексту

Робітники AMT постійно оцінювали низькоякісний штучний текст на рівні з вищою якістю, узгодженим текстом, написаним людиною, на відміну від англійських вчителів, які легко могли розрізняти різницю в якості.

Немає часу на підготовку, нульовий контекст

Вхід у правильний стан для такої абстрактної задачі, як оцінка автентичності, не відбувається природно; англійські вчителі потребували 20 завдань, щоб калібрувати свої чуття до оцінювального середовища, тоді як робітники AMT зазвичай не мали жодного “орієнтаційного часу” зовсім, що знижувало якість їхньої інформації.

Ігри з системою

Звіт стверджує, що загальний час, витрачений робітниками AMT на окремі завдання, завищений робітниками, які приймають кілька завдань одночасно, і проходять через завдання в різних вкладках браузера, замість того, щоб зосередитися на одному завданні протягом зареєстрованого часу виконання завдання.

Країна походження має значення

За замовчуванням налаштування AMT не фільтрують робітників за країною походження, і звіт відзначає попередню роботу, яка вказує на те, що робітники AMT використовують VPN, щоб обійти географічні обмеження, дозволяючи нерідним мовцям видавати себе за рідних англійських мовців (у системі, яка, можливо, досить наївно, ототожнює мову робітника з його географічним розташуванням на основі IP-адреси).

Отже дослідники повторно провели оцінювальні тести на AMT з фільтрами, які обмежували потенційних учасників лише не-англомовними країнами, і виявили, що ‘робітники з неангломовних країн оцінювали узгодженість, актуальність і граматику… значно нижче, ніж робітники з англомовних країн’.

Звіт висновує:

‘[Експертні оцінювачі], такі як лінгвісти або вчителі мови, повинні бути використані, коли це можливо, оскільки вони вже були підготовлені для оцінки написаного тексту, і це не набагато дорожче…’.

 

Опубліковано 16 вересня 2021 рокуОновлено 18 грудня 2021 року: додано теги

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai