Погляд Anderson
Створення штучних механічних турок з допомогою попередньо навчених мовних моделей

Більша частина розробки систем машинного навчання залежить від маркування даних, де сотні, навіть тисячі запитів (наприклад, Чи це зображення кота? та Чи це текст образливий?) повинні бути вирішені для створення авторитетних наборів даних, на яких будуть навчені системи штучного інтелекту.
Хоча ми всі внесли свій внесок у цей процес в якийсь момент, більша частина цих завдань маркування виконуються за гроші людьми-робітниками на платформах, таких як Amazon Mechanical Turk, де анотатори виконують дрібні завдання класифікації в економіці штучної праці.
Розробка моделей була б дешевшою, якщо попередньо навчені мовні моделі (PLM) могли б самостійно виконувати деякі з більш базових завдань людської інтелекту (HIT), які зараз передаються на платформи, такі як AMT і подібні платформи.
Нещодавні дослідження з Німеччини та Huawei пропонують це у статті LMTurk: Few-Shot Learners as Crowdsourcing Workers.
Мовні моделі, що виконують навчання з декількома зразками
Автори пропонують, що простіші завдання, які зазвичай спрямовані на (людей-) турок, аналогічні навчанню з декількома зразками, де автоматизована система повинна прийняти рішення про міні-завдання на основі малої кількості прикладів, наданих їй.
Вони пропонують, що системи штучного інтелекту можуть ефективно навчатися з існуючих PLM, які спочатку були навчені людьми-робітниками – що основні знання, передані від людей до машин, були фактично вже здійснені, і що там, де такі знання відносно незмінні або емпіричні якимось чином, автоматизовані мовні моделі можуть потенційно виконувати ці завдання самостійно.
‘Наша основна ідея полягає в тому, що для завдання NLP T ми розглядаємо учнів з декількома зразками як некваліфікованих працівників, що нагадують працівників, які анотують ресурси для людської мови. Нас надихнуло те, що ми можемо розглядати працівника, який бере участь у краудсорсингу, як某种 типу учнів з декількома зразками.’
Варіанти включають можливість того, що багато з тих основних істин, на яких залежать системи штучного інтелекту майбутнього, будуть походити від людей вже багато років тому, а потім будуть розглядатися як попередньо валідовані та використовувані дані, які більше не потребують людського втручання.
Роботи для мовних моделей середнього рівня, що мають середню продуктивність
Окрім мотивації скоротити вартість людського втручання, дослідники пропонують використовувати ‘мовні моделі середнього рівня’ як справді механічних турок, що забезпечує корисну роботу для цих ‘таких же’ систем, які все частіше затінюються заголовними, гіпермасштабними та дорогими мовними моделями, такими як GPT-3, які надто дорогі та переоцінені для таких завдань.
‘Наша мета в цій статті полягає в тому, щоб розробити методи, які зроблять більш ефективне використання поточних учнів з декількома зразками. Це важливо, оскільки все більше і більше гігантських учнів з декількома зразками навчаються; як їх ефективно використовувати, це важливе питання. Зокрема, ми хочемо альтернативу важко розгортати великих моделей.
‘Водночас ми хочемо повністю використати сильні сторони PLM: їх гнучкість забезпечує широке застосування у завданнях; їх величезний запас знань про мову та світ (навчені під час попереднього навчання) проявляється в ефективності даних учнів з декількома зразками, що знижує витрати праці та часу на анотацію даних.’
На даний момент автори стверджують, що учні з декількома зразками в NLP розглядалися як тимчасові стадії на шляху до високорівневих систем природної мови, які набагато більше ресурсоємні, і що така робота проводилася абстрактно та без урахування можливої корисності цих систем.
Метод
Автори пропонують LMTurk (мовна модель як механічний турок), у робочому процесі, де вхідні дані з цієї автоматизованої системи забезпечують мітки для мовної моделі середнього рівня.

Базова концепція моделі LMTurk. Джерело: https://arxiv.org/pdf/2112.07522.pdf
Ця перша ітерація залежить від декількох людських міток ‘золотих’ даних, де людські турки анотували мітки для обмеженої кількості завдань, і мітки були оцінені добре, або через прямий людський нагляд, або через консенсус голосування. Варіант цієї схеми полягає в тому, що гілки або розробки з цього людського стартового пункту можуть не потребувати додаткового людського втручання в майбутньому.
Хоча автори пропонують подальші експерименти з пізнішими гібридними моделями (де людський внесок буде присутнім, але сильно зменшений), вони не проводили досліджень для порівняння моделей LMTurk з еквівалентними результатами від людських працівників, вважаючи, що ‘золоті’ дані самі по собі є ‘людським внеском’.
Мовна модель, призначена для виконання завдань турка, була адаптована для завдання за допомогою P-Tuning, методу, опублікованого дослідниками з Китаю в 2021 році, який пропонував навчальні безперервні вбудовані проміжні мітки для покращення продуктивності моделей типу GPT-3 на завданнях природної мови (NLU).
![P-Tuning намагається поглибити передбачувальну силу моделі типу GPT, і її вигляд концептуального розуміння мови, включивши вбудовані псевдопроміжні мітки. У цьому випадку початковий запит - 'Столиця Британії - це [x]'.](https://www.unite.ai/wp-content/uploads/2021/12/p-tuning.jpg)
P-Tuning намагається поглибити передбачувальну силу моделі типу GPT, і її вигляд концептуального розуміння мови, включивши вбудовані псевдопроміжні мітки. У цьому випадку початковий запит – ‘Столиця Британії – це [x]’. Джерело: https://arxiv.org/pdf/2103.10385.pdf
Дані та архітектура
LMTurk був оцінений на п’яти наборах даних: двох з Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); і Corpus of Linguistic Acceptability (CoLA).
Для більшої моделі LMTurk використовує відкрито доступні PLM ALBERT-XXLarge-v2 (AXLV2) як джерело моделі для перетворення в автоматизованого турка. Модель має 223 мільйони параметрів (у порівнянні з 175 мільярдами параметрів у GPT-3). AXLV2, як спостерігають автори, вже довела свою здатність перевершувати моделі більш високого рівня, такі як 334M BERT-Large.
Для більш рухливої, легкої та розгортної на краю моделі проект використовує TinyBERT-General-4L-312D (TBG), яка має 14,5 мільйонів параметрів з продуктивністю, порівнянною з BERT-base (яка має 110 мільйонів параметрів).
Навчання з проміжними мітками відбулося на PyTorch і HuggingFace для AXLV2 протягом 100 кроків пакету з розміром пакету 13, на швидкості навчання 5e-4, з лінійним спадом. Кожний експеримент був розпочатий з трьома різними випадковими насіннями.
Результати
Проект LMTurk запускає різні моделі проти багатьох конкретних підсекторів NLP, тому складні результати експериментів дослідників не легко зводяться до емпіричних даних, які пропонують LMTurk як життєздатний підхід до повторного використання історичних, людських, походження завдань з декількома зразками.
Однак для оцінки автори порівнюють свій метод з двома попередніми роботами: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference німецькими дослідниками Тімо Шіком і Гінріхом Шутце; і результатами з Prompt-Based Auto, представленими в Making Pre-trained Language Models Better Few-shot Learners Гао, Ченом і Фішем (відповідно з Принстона та Массачусетського технологічного інституту).

Результати експериментів LMTurk, де дослідники повідомляють про ‘порівнянну’ продуктивність.
У короткому, LMTurk пропонує відносно перспективний напрямок дослідження для дослідників, які шукають спосіб вбудувати та закріпити ‘золоті’ людські дані у розвиток мовних моделей середньої складності, де автоматизовані системи заміняють людський внесок.
Як і у відносно невеликій кількості попередніх робіт у цій галузі, центральна концепція залежить від незмінності первинних людських даних та припущення, що тимчасові чинники – які можуть представляти значні перешкоди для розвитку NLP – не будуть потребувати подальшого людського втручання, оскільки лінія розвитку машин буде розвиватися.
Оригінально опубліковано 30 грудня 2022 року












