Взгляд Anderson

Создание модели языка в стиле GPT для одного вопроса

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Китая разработали экономически эффективный метод создания систем обработки естественного языка в стиле GPT-3, избегая все более запретительных расходов на время и деньги, связанных с обучением больших объемов данных – растущую тенденцию, которая в противном случае угрожает в конечном итоге отнести этот сектор ИИ к игрокам FAANG и высокоуровневым инвесторам.

Предлагаемая структура называется Task-Driven Language Modeling (TLM). Вместо обучения огромной и сложной модели на огромном корпусе из миллиардов слов и тысяч меток и классов, TLM обучает гораздо меньшую модель, которая фактически включает запрос直接 в модель.

Слева, типичный подход к высокомасштабным языковым моделям; справа, метод TLM для изучения большого языкового корпуса на основе темы или вопроса. Источник: https://arxiv.org/pdf/2111.04130.pdf

Слева, типичный подход к высокомасштабным языковым моделям; справа, метод TLM для изучения большого языкового корпуса на основе темы или вопроса. Источник: https://arxiv.org/pdf/2111.04130.pdf

По сути, для ответа на один вопрос создается уникальный алгоритм или модель NLP, вместо создания огромной и неуклюжей общей языковой модели, которая может ответить на более широкий спектр вопросов.

При тестировании TLM исследователи обнаружили, что новый подход достигает результатов, аналогичных или лучше, чем у предварительно обученных языковых моделей, таких как RoBERTa-Large, и гипермасштабных систем NLP, таких как GPT-3 от OpenAI, модель Switch Transformer с триллионом параметров от Google, HyperClover от Naver, Jurassic 1 от AI21 Labs и Megatron-Turing NLG 530B от Microsoft.

В испытаниях TLM на восьми классификационных наборах данных в четырех доменах исследователи также обнаружили, что система снижает количество операций с плавающей запятой (FLOPs), необходимых для обучения, на два порядка. Исследователи надеются, что TLM сможет «демократизировать» сектор, который становится все более элитным, с моделями NLP такого размера, что их невозможно реалистично устанавливать локально, и вместо этого они находятся, в случае GPT-3, за дорогими и ограниченными API от OpenAI и, теперь, Microsoft Azure.

Авторы утверждают, что сокращение времени обучения на два порядка снижает стоимость обучения на 1000 GPU за один день до 8 GPU за 48 часов.

Новая работа озаглавлена NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework и исходит от трех исследователей из Университета Цинхуа в Пекине и исследователя из китайской компании по разработке ИИ Recurrent AI, Inc.

Недоступные ответы

Стоимость обучения эффективных, универсальных языковых моделей все больше характеризуется как потенциальный «термический предел» того, насколько далеко действительно может распространиться точный и точный NLP в культуре.

Статистика роста аспектов архитектур моделей NLP, из отчета 2020 года A121 Labs. Источник: https://arxiv.org/pdf/2004.08900.pdf

Статистика роста аспектов архитектур моделей NLP, из отчета 2020 года A121 Labs. Источник: https://arxiv.org/pdf/2004.08900.pdf

В 2019 году исследователь рассчитал, что обучение модели XLNet (заявленной как лучшая в задачах NLP на тот момент) на 2,5 дня на 512 ядрах по 64 устройствам стоит 61 440 долларов США, в то время как GPT-3, как估计, стоил 12 миллионов долларов для обучения – в 200 раз больше, чем его предшественник GPT-2 (хотя недавние переоценки утверждают, что его можно обучить сейчас за 4,6 миллиона долларов на самых дешевых облачных GPU).

Подмножества данных на основе запросов

Вместо этого новая предложенная архитектура стремится получить точные классификации, метки и обобщения, используя запрос в качестве фильтра для определения подмножества информации из большого языкового корпуса, который будет обучен вместе с запросом для предоставления ответов на ограниченную тему.

Авторы заявляют:

‘TLM мотивирован двумя ключевыми идеями. Во-первых, люди осваивают задачу, используя только небольшую часть мировых знаний (например, студенты должны просмотреть только несколько глав, среди всех книг в мире, чтобы подготовиться к экзамену). ‘

‘Мы гипотезируем, что существует много избыточности в большом корпусе для конкретной задачи. Во-вторых, обучение на помеченных данных с учителем намного более эффективно для производительности вниз по потоку, чем оптимизация цели языковой модели на непомеченных данных. На основе этих мотиваций TLM использует данные задачи в качестве запросов для извлечения крошечного подмножества общего корпуса. Это за которым следует совместная оптимизация цели задачи с учителем и цели языковой модели с использованием извлеченных данных и данных задачи.’

Помимо того, что обучение моделей NLP становится высокоэффективным, авторы видят ряд преимуществ в использовании моделей NLP, управляемых задачами. Например, исследователи могут наслаждаться большей гибкостью, с индивидуальными стратегиями для длины последовательности, токенизации, настройки гиперпараметров и представления данных.

Исследователи также предвидят разработку гибридных будущих систем, которые отдают приоритет ограниченному предварительному обучению PLM (которое в противном случае не предвидится в текущей реализации) над большей универсальностью и обобщением против времени обучения. Они считают систему шагом вперед для развития методов нулевой генерализации в области.

Тестирование и результаты

TLM был протестирован на задачах классификации в восьми задачах по четырем доменам – биомедицинской науке, новостях, обзорах и компьютерной науке. Задачи были разделены на категории с высокими и низкими ресурсами. Задачи с высокими ресурсами включали более 5000 данных задач, таких как AGNews и RCT, среди других; задачи с низкими ресурсами включали ChemProt и ACL-ARC, а также HyperPartisan набор данных для обнаружения новостей.

Исследователи разработали два набора данных для обучения под названием Corpus-BERT и Corpus-RoBERTa, последний из которых в десять раз больше первого. Эксперименты сравнивали общие предварительно обученные языковые модели BERT (от Google) и RoBERTA (от Facebook ) с новой архитектурой.

Статья отмечает, что хотя TLM является общим методом и должен быть более ограничен в объеме и применимости, чем более широкие и высокообъемные модели государственного уровня, он способен работать близко к методам тонкой настройки в области.

Результаты сравнения производительности TLM с наборами на основе BERT и RoBERTa. Результаты перечисляют средний балл F1 по трем различным масштабам обучения и перечисляют количество параметров, общую вычислительную мощность (FLOPs) и размер обучающего корпуса.

Результаты сравнения производительности TLM с наборами на основе BERT и RoBERTa. Результаты перечисляют средний балл F1 по трем различным масштабам обучения и перечисляют количество параметров, общую вычислительную мощность (FLOPs) и размер обучающего корпуса.

Авторы заключают, что TLM способен достигать результатов, сравнимых или лучше, чем у PLM, с существенным сокращением необходимых FLOPs и требующим только 1/16 корпуса обучения. На средних и больших масштабах TLM, по-видимому, может улучшить производительность на 0,59 и 0,24 балла в среднем, сокращая размер обучающих данных на два порядка.

‘Эти результаты подтверждают, что TLM высоко точен и намного более эффективен, чем PLM. Кроме того, TLM получает больше преимуществ в эффективности на более крупном масштабе. Это указывает на то, что более крупномасштабные PLM могли быть обучены для хранения более общих знаний, которые не полезны для конкретной задачи.’

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai