Взгляд Anderson

Создание Искусственных Механических Турок С Помощью Предобученных Языковых Моделей

mm
Добавьте Unite.AI в избранные источники в Google

Большая часть разработки систем машинного обучения зависит от маркировки данных, где сотни, даже тысячи вопросов (таких как Это картинка кошки? и Это текст оскорбительный?) должны быть решены для разработки авторитетных наборов данных, на которых будут обучаться системы ИИ.

Хотя мы все вносим свой вклад в этот процесс в какой-то момент, большинство этих задач маркировки выполняется за деньги человеческими работниками на платформах, таких как Amazon Mechanical Turk, где аннотаторы выполняют незначительные задачи классификации в экономике piece-work.

Разработка моделей была бы дешевле, если бы предобученные языковые модели (PLM) могли сами выполнять некоторые из более простых задач человеческого интеллекта (HIT), которые в настоящее время передаются на платформы, такие как AMT и podobные платформы.

Недавние исследования из Германии и Huawei предлагают это в статье LMTurk: Few-Shot Learners as Crowdsourcing Workers.

Языковые Модели, Выполняющие Few-Shot Learning

Авторы предлагают, что более простые задачи, обычно направленные на (человеческих) турок, аналогичны few-shot learning, где автоматизированная система должна решить мини-задачу на основе небольшого количества примеров, данного ей.

Они поэтому предлагают, что системы ИИ могут эффективно учиться на существующих PLM, которые были первоначально обучены crowdworkers, что основные знания, переданные от людей к машинам, были эффективно выполнены, и что там, где такие знания относительно неизменны или эмпирически каким-то образом, автоматизированные языковые модели могут потенциально выполнять эти задачи сами по себе.

‘Наша основная идея заключается в том, что для задачи NLP T мы рассматриваем few-shot learners как неквалифицированных работников, похожих на работников crowdsourcing, которые аннотируют ресурсы для технологии человеческого языка. Мы вдохновлены тем, что мы можем рассматривать работника crowdsourcing как тип few-shot learner.’

Возможные последствия включают возможность того, что многие из истин, на которых будут основываться системы ИИ будущего, будут получены от людей много лет назад, а затем будут рассматриваться как предварительно проверенные и эксплуатируемые знания, которые больше не требуют человеческого вмешательства.

Работы Для Средних, Полуперформантных Языковых Моделей

Помимо мотивации сократить стоимость человеческого участия, исследователи предлагают, что использование ‘средних’ PLM в качестве настоящих Механических Турок предоставляет полезную работу для этих ‘also ran’ систем, которые все больше затеняются заголовками, гипермасштабными и дорогими языковыми моделями, такими как GPT-3, которые слишком дорогие и чрезмерно оснащены для таких задач.

‘Наша цель в этой статье заключается в разработке методов, которые позволят более эффективно использовать текущих few-shot learners. Это важно, поскольку все больше и больше gigantic few-shot learners обучается; как использовать их эффективно является важным вопросом. В частности, мы хотим альтернативу hard-to-deploy huge models.

‘В то же время, мы хотим полностью использовать сильные стороны PLM: их универсальность обеспечивает широкую применимость в задачах; их огромный запас знаний о языке и мире (полученный в процессе предварительного обучения) проявляется в эффективности few-shot learners, снижая трудозатраты и время, необходимые для аннотации данных.’

На данный момент авторы утверждают, что few-shot learners в NLP были рассмотрены как одноразовые промежуточные этапы на пути к высокоуровневым системам обработки естественного языка, которые намного более ресурсоемкие, и что такая работа была проведена абстрактно и без учета возможной полезности этих систем.

Метод

Авторы предлагают LMTurk (Language Model as mechanical Turk), в рабочем процессе, где входные данные из этой автоматизированной HIT предоставляют метки для средней модели NLP.

Базовая концептуальная модель для LMTurk. Source: https://arxiv.org/pdf/2112.07522.pdf

Базовая концептуальная модель для LMTurk. Source: https://arxiv.org/pdf/2112.07522.pdf

Эта первая итерация полагается на few-shot human-labeled ‘gold’ данные, где мясные Турки аннотировали метки для ограниченного числа задач, и метки были хорошо оценены, либо через прямое человеческое наблюдение, либо через консенсусное голосование. Возможное последствие этой схемы заключается в том, что ветви или разработки из этого человеческого начального пункта могут не требовать дополнительного человеческого ввода в будущем.

Хотя авторы предлагают дальнейшие эксперименты с более поздними гибридными моделями (где человеческий ввод будет присутствовать, но сильно уменьшен), они не стали, для целей своего исследования, противопоставлять модели LMTurk эквивалентным результатам от человеческих генерируемых HIT-работников, учитывая, что gold-labeled данные сами по себе являются ‘человеческим вводом’.

PLM, предназначенная для выполнения операций Турка, была адаптирована для задачи с помощью P-Tuning, метода, опубликованного исследователями из Китая в 2021 году, который предложил обучаемые непрерывные prompt embeddings для улучшения производительности моделей GPT-3-стиля на задачах понимания естественного языка (NLU).

P-Tuning пытается углубить предсказательную силу модели GPT-стиля и ее видимость понимания языка, включая встроенные псевдопромпты. В этом случае начальный запрос - 'Столица Британии - это [x]'.

P-Tuning пытается углубить предсказательную силу модели GPT-стиля и ее видимость понимания языка, включая встроенные псевдопромпты. В этом случае начальный запрос – ‘Столица Британии – это [x]’. Source: https://arxiv.org/pdf/2103.10385.pdf

Данные и Архитектура

LMTurk была оценена на пяти наборах данных: двух из Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); и Corpus of Linguistic Acceptability (CoLA).

Для своей более крупной модели LMTurk использует публично доступные PLM ALBERT-XXLarge-v2 (AXLV2) в качестве исходной модели для преобразования в автоматизированного Турка. Модель имеет 223 миллиона параметров (по сравнению с 175 миллиардами параметров в GPT-3). AXLV2, по мнению авторов, доказала свою способность превосходить более крупные модели, такие как 334M BERT-Large.

Для более гибкой, легкой и развертываемой модели проект использует TinyBERT-General-4L-312D (TBG), которая имеет 14,5 миллионов параметров с производительностью, сравнимой с BERT-base (которая имеет 110 миллионов параметров).

Обучение с помощью промптов проходило на PyTorch и HuggingFace для AXLV2 более 100 шагов пакета с размером пакета 13, на скорости обучения 5e-4, используя линейное затухание. Каждый эксперимент был начат с трех разных случайных семян.

Результаты

Проект LMTurk запускает различные модели против стольких конкретных подсекторов NLP, что сложные результаты экспериментов исследователей не легко свести к эмпирическим данным, которые предлагает LMTurk как жизнеспособный подход к повторному использованию исторических, человеко-ориентированных сценариев few shot learning.

Однако для оценки авторы сравнивают свой метод с двумя предыдущими работами: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference немецкими исследователями Timo Schick и Hinrich Schutze; и результатами из Prompt-Based Auto, представленными в Making Pre-trained Language Models Better Few-shot Learners Gao, Chen и Fisch (соответственно из Princeton и MIT).

Результаты экспериментов LMTurk, с заявлением исследователей о 'сравнимой' производительности.

Результаты экспериментов LMTurk, с заявлением исследователей о ‘сравнимой’ производительности.

Вкратце, LMTurk предлагает относительно перспективную линию исследования для исследователей, стремящихся встроить и увековечить gold-labeled человеческие данные в эволюционирующие, средней сложности языковые модели, где автоматизированные системы заменяют человеческий ввод.

Как и в случае с относительно небольшим количеством предыдущих работ в этой области, центральная концепция основана на неизменности исходных человеческих данных и предположении, что временные факторы – которые могут представлять значительные препятствия для развития NLP – не будут требовать дальнейшего человеческого вмешательства, поскольку линия машины будет развиваться.

 

Оригинально опубликовано 30 декабря 2022 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]