Модели и платформы ИИ

GPT-3: Немного выстрелов для обучения языковой модели?

mm
Добавьте Unite.AI в избранные источники в Google

В последние годы индустрия ИИ и МО свидетелем метеоритного взлета разработки и применения систем НЛП, поскольку исследователи смогли реализовать практики НЛП в высоко гибких и задача-агностических способах для задач передачи.

Первоначально это были однослоевые представления, которые использовали векторы слов, и затем передавались в задача-специфическую архитектуру. Далее это была архитектура РНН, которая использовала многослойные представления и контекстное состояние для формирования лучших представлений. И, наконец, у нас есть передача языковых моделей или предварительно обученные рекуррентные модели, которые полностью исключили необходимость в задача-специфических архитектурах, настраивая эти сети.

Модели передачи языка оказались важным поворотным моментом в индустрии НЛП, поскольку они привели к огромному прогрессу в сложных задачах, таких как ответы на вопросы, чтение понимания или блоков текста, текстовое следование и многое другое.

Однако, несмотря на их преимущества, модели передачи языка имеют серьезное ограничение, поскольку они требуют задача-специфической настройки или задача-специфического набора данных для достижения желаемой производительности на задаче. Кроме того, модели передачи языка также требуют от разработчиков настраивать наборы данных на hundreds тысяч примеров, специфичных для конкретной задачи.

Само собой разумеется, что удаление требования к задача-специфическому набору данных и задача-специфической настройке будет очень желательно и полезно для индустрии НЛП по множеству причин.

Проблемы с существующими предварительно обученными моделями передачи языка или рекуррентными моделями

  • Ограничение практичности и применимости

Прежде всего, требование большого набора данных с помеченными данными для каждой задачи ограничивает применимость и практичность языковых моделей. Языковые модели находят свои применения в широком диапазоне задач, от генерации короткой истории до исправления грамматических ошибок, до генерации примеров на концепцию. Иногда бывает сложно собрать большой контролируемый набор данных с помеченными данными, особенно когда процесс необходимо повторить для каждой отдельной задачи.

  • Использование ложных корреляций в обучающих данных

Ограничения и узость распределения обучения, в сочетании с выразительностью модели, могут привести к фундаментальному росту потенциала использования ложных корреляций в обучающих данных. Потенциал использования обучающих данных может привести к проблемам во время настройки и предварительного обучения, поскольку модели передачи языка предназначены для поглощения большого количества информации во время предварительного обучения.

Кроме того, работа над предыдущими моделями показала, что большие модели не всегда приводят к лучшим результатам вне распределения. Кроме того, было показано, что обобщение, достигнутое в таком парадигме, может привести к плохой производительности, поскольку модель очень специфична для обучающих данных и не может работать хорошо в ситуациях, выходящих за рамки обучающих данных.

  • Сравнение с обучением человека

Наконец, когда сравниваются модели передачи языка, люди не требуют большого обучающего набора данных, когда речь идет об обучении большинству языковых задач. Часто краткая директива в естественном языке человека или небольшая демонстрация языковой задачи достаточно для человека, чтобы понять и выполнить языковую задачу с определенным уровнем конкурентоспособности.

Способность человека адаптироваться имеет много практических преимуществ, поскольку позволяет ему переключаться между разными наборами навыков или комбинировать их, чтобы лучше выполнить диалект, что выходит за рамки возможностей текущих систем НЛП.

Решение проблем с помощью метаобучения и GPT-3

Возможным решением вышеуказанных проблем является использование метаобучения, концепции в современном МО, которая позволяет модели развивать более широкий и разнообразный набор навыков и способность распознавать закономерности во время обучения, а затем использовать эти приобретенные способности во время интерференции, чтобы быстро адаптироваться или распознавать необходимую задачу.

Метаобучение реализуется в архитектуре языковой модели с помощью техники, называемой «обучением в контексте», которая использует текстовый ввод предварительно обученной языковой модели в качестве спецификации задачи. В процессе модель учится на естественном языковом указании и может даже использовать несколько демонстраций, и затем модель ожидается выполнить остальную часть задачи, предсказывая следующие шаги.

Единственная серьезная проблема с метаобучением заключается в том, что, хотя оно показало положительный потенциал, оно все еще уступает подходу настройки в архитектуре естественного языка и требует дальнейшего улучшения, чтобы стать практическим методом для преодоления языковых задач.

В дополнение к метаобучению, другой метод, который набирает популярность, – это увеличение емкости трансформерных языковых моделей. В последние годы передача моделей стала свидетелем значительного увеличения их емкости с RNSS18 моделью с 100 миллионами параметров, DCLT18 моделью с 300 миллионами параметров, RWC19 моделью с 1,5 миллиардами параметров, SSP19 моделью с 8 миллиардами параметров, RSR19 моделью с 11 миллиардами параметров и TUR20 моделью с 17 миллиардами параметров.

Увеличение емкости модели или увеличение количества параметров исторически приводило к улучшению синтеза текста, и было показано, что логарифмическая потеря, которая коррелирует с задачами передачи, также следует гладкому тренду улучшения с увеличением масштаба.

Это приводит нас к модели GPT-3, которая имеет более 175 миллиардов параметров, и когда она была запущена, она была моделью передачи языка с самой высокой емкостью. Давайте теперь поговорим о модели GPT-3.

Введение в модель GPT-3

GPT-3 – это автоагрессивная языковая модель с более 175 миллиардами параметров, выпущенная OpenAI в 2020 году. GPT-3 также классифицируется как большая языковая модель, которая, как и ее предшественник GPT-2, является декодером-только глубокой трансформерной моделью, которая использует архитектуру на основе сверток для генерации текстовых данных.

Модель GPT-3 измеряет свои собственные способности контекстного обучения, и модель GPT-3 оценивается на более двух десятков наборов данных НЛП и нескольких новых задач. Для каждой отдельной задачи модель GPT-3 оценивается в трех условиях,

  • Немного выстрелов или обучение в контексте: В немного выстрелов, модель GPT-3 позволяет столько распределений, сколько может поместиться в контекстное окно модели.
  • Один выстрел: В одном выстреле модель позволяет только одну демонстрацию.
  • Ноль выстрелов: В ноль выстрелов, нет демонстраций, и есть только естественный языковый указание, которое подается в модель.

В целом, модель GPT-3 достигает желаемой производительности в ноль-выстреловом и одном-выстреловом режимах, и в немного-выстреловом режиме она превосходит модели передачи в большинстве случаев. Кроме того, модель GPT-3 работает хорошо в одном-выстреловом и ноль-выстреловом режимах в задачах естественного языка, предназначенных для проверки на лету рассуждений или требующих быстрого внимания, таких как использование новых слов после предложения или расшифровка слов или выполнение арифметических операций. С другой стороны, когда она работает в немного-выстреловом режиме, модель GPT-3 генерирует синтетические новостные статьи, которые похожи на человеческое письмо, когда они проходят через человеческую оценку.

Модель GPT-3: Подход

Модель GPT-3 использует традиционный подход предварительного обучения, который состоит из модели, данных и обучения, и он похож на процесс предварительного обучения, используемый в модели передачи языка RWC-19. Модель GPT-3 увеличивает размер модели, размер набора данных, разнообразие набора данных и увеличивает длину периода обучения.

Модель также использует подход обучения в контексте, который еще раз похож на подход модели RWC-19, но немного меняет вещи, систематически исследуя разные настройки для обучения закономерностей в контексте набора данных.

Итак, давайте начнем с исследования этих настроек и оценки того, как модель GPT-3 работает в разных настройках.

Настройка

Настройка модели была традиционным подходом в моделях передачи языка, и этот подход включает обновление весов предварительно обученной модели путем обучения модели на контролируемом наборе данных, специфичном для желаемой задачи, и hundreds тысяч помеченных примеров используются во время процесса.

Подход настройки полезен, поскольку он возвращает сильную производительность на различных эталонах. С другой стороны, основное ограничение использования подхода настройки заключается в том, что оно требует нового и большого набора данных для каждой отдельной задачи, имеет потенциал использовать ложные особенности обучающего набора данных, может потенциально привести к несправедливому сравнению с человеческой производительностью и плохой обобщаемости для вне-распределения.

Текущий объем модели GPT-3 не реализует подход настройки из-за своей задача-агностической производительности, хотя настройка может быть применена к модели GPT-3 в будущем.

Немного выстрелов

Немного выстрелов – это термин, который относится к настройке, в которой модель GPT-3 получает несколько демонстраций задачи во время интерференции в качестве условности, но веса модели не обновляются. В немного-выстреловом режиме набор данных обычно имеет пример с контекстом и желаемым завершением (например, французское предложение и его английский перевод). Немного-выстреловая настройка дает модели K примеров контекста и завершения, и затем предоставляет модели один окончательный контекст и ожидает, что модель предоставит завершение.

Основное преимущество использования немного-выстреловой настройки заключается в том, что оно значительно уменьшает необходимость в задача-специфических данных и также уменьшает потенциал изучения узкого распределения из большого набора данных, который тонко настроен узко. С другой стороны, основное ограничение использования немного-выстрелового обучения заключается в том, что результаты, полученные в немного-выстреловом режиме, не на высоте и значительно хуже, чем у других моделей передачи, которые настроены.

Один выстрел

В одном-выстреловом режиме модель предоставляется только с одной демонстрацией, и остальное похоже на немного-выстреловую настройку. Причина, по которой один-выстреловая настройка актуальна в моделях передачи языка, заключается в том, что из всех трех настроек один выстрел – это тот, который наиболее похож на то, как задачи передаются людям. Это потому, что в большинстве задач обычно предоставляется одна демонстрация задачи, в противном случае может быть сложно понять контекст задачи.

Ноль выстрелов

В ноль-выстреловом режиме нет демонстраций, и модель предоставляется с естественным языковым указанием, которое описывает задачу. Ноль-выстреловой метод – это тот, который предлагает максимальную удобство, является прочным и также избегает ложных корреляций, но он также является наиболее сложным из всех трех настроек. Это потому, что в некоторых случаях может быть сложно даже для нас людей понять контекст задачи без демонстрации сначала.

Несмотря на это, для некоторых задач ноль-выстреловая настройка – это та, которая наиболее похожа на то, как люди выполняют задачи естественного языка.

Вышеуказанная фигура сравнивает немного-выстреловую, один-выстреловую и ноль-выстреловую настройки при выполнении задачи естественного языка, заключающейся в переводе английского предложения на французский.

GPT-3: Архитектура модели

Модель GPT-3 использует ту же архитектуру, что и модель GPT-2, и она включает в себя предварительную нормализацию, измененную инициализацию и обратимую токенизацию, как это было использовано в модели GPT с исключением использования альтернативной стратегии для локально-банDED внимания и чередующихся плотных слоев в трансформерных слоях, аналогично Sparse Transformer.

Чтобы изучить зависимость производительности модели от размера модели, разработчики обучили 8 разных размеров моделей, которые варьируются более чем на три порядка от 125 миллионов до более 175 миллиардов параметров, последний из которых называется моделью GPT-3. Предыдущая работа, связанная с моделями LLM, показала, что масштабирование валидационной потери с достаточным количеством обучающих данных должно быть приблизительным гладким степенным законом в качестве функции размера. Обучение моделей разного размера позволяет разработчикам проверить эту гипотезу как для задач передачи языка, так и для валидационной потери.

Вышеуказанная фигура сравнивает размер и архитектуру 8 разных моделей, использованных для разработки модели GPT-3. Здесь n(params) определяет общее количество обучаемых параметров, n(layers) определяет общее количество слоев в модели, d(model) определяет количество единиц в каждом слое бутылочного горлышка, и d(head) определяет размерность каждого внимания. Контекстное окно для каждой модели одинаково и составляет 2048 токенов.

Кроме того, чтобы минимизировать передачу данных между узлами, модель разделена на GPU по глубине и ширине измерений. Параметры архитектуры для каждой модели были выбраны на основе вычислительной эффективности и балансировки нагрузки, чтобы максимизировать точность в макете моделей на GPU.

Наборы данных для обучения

Обычно большие языковые модели используют наборы данных, которые значительно расширились с недавними разработками, и они заканчиваются в наборе данных Common Crawl, который состоит более чем из одного триллиона разных слов. Размер набора данных достаточен, чтобы обучить модель GPT-3 без обновления на одном и том же последовательности несколько раз. Однако исследования и анализ производительности показывают, что слабо отфильтрованные версии или неотфильтрованные версии набора данных Common Crawl имеют низкое качество по сравнению с более отобранными наборами данных.

Чтобы решить проблему среднего качества набора данных, разработчики предприняли 3 шага, чтобы повысить качество набора данных.

  1. Разработчики скачали и отфильтровали версию набора данных Common Crawl на основе диапазона, аналогичного высококачественным эталонным корпусам.
  2. Разработчики выполнили нечеткую дубликацию на уровне документа по всему набору данных в попытке сохранить целостность их выделенного валидационного набора в качестве эффективной меры перекрестного обучения и также предотвратить избыточность.
  3. Разработчики также добавили высококачественные эталонные корпуса в обучающие данные, чтобы дополнить набор данных Common Crawl и еще больше увеличить разнообразие набора данных.

Следующая фигура показывает окончательную пропорцию или смесь наборов данных, использованных для обучения модели GPT-3. Данные Common Crawl состоят более чем из 45 ТБ простого текста до фильтрации, что было сокращено до 570 ГБ данных после фильтрации, грубо эквивалентно более 400 миллиардам токенов, закодированных байтовыми парами. Стоит отметить, что наборы данных в обучении, которые считаются более качественными, выборочно более часто, чем выборочно пропорционально их размеру. В результате наборы данных, такие как Books2 и Common Crawl, выборочно менее одного раза во время обучения, тогда как другие наборы данных выборочно несколько раз. Это позволяет модели принять небольшое количество перекрестного обучения в обмен на обучение на обучающих данных с более высоким качеством.

Значительной проблемой с большими языковыми моделями, предварительно обученными на большом количестве интернет-данных с возможностью запоминать и изучать большое количество контента, является потенциальное загрязнение задач передачи, увидев их разработку или тестовые наборы во время предварительного обучения. Чтобы уменьшить такое потенциальное загрязнение, разработчики искали любые совпадения с тестовыми и разработанными наборами данных, изученными для модели GPT-3, и попытались удалить эти совпадения.

Вышеуказанная фигура показывает общий вычислительный ресурс, использованный во время обучения модели GPT-3. Модель использует законы масштабирования для нейронных языковых моделей, чтобы обучать гораздо более крупные модели на меньшем количестве токенов, чем обычно. В результате и модель GPT-3, и модель RoBERTa-Large, которая в 10 раз меньше модели GPT-3, заняли почти 50 петафлопс/день вычислительных ресурсов во время предварительного обучения.

Оценка

Для немного-выстрелового обучения модель оценивает каждый пример в наборе данных, выбирая K примеров случайным образом из обучающего набора данных задачи в качестве условности и ограничивая его 1 или 2 новыми строками в зависимости от задачи. Для Storycloze и LAMBADA модель выбирает условные примеры из набора разработки и оценивает их на тестовом наборе из-за недоступности контролируемого обучающего набора. Для Winograd существует только один набор данных, и поэтому условные примеры выбираются直接 из него.

K может быть любым значением от 0 до максимального количества, разрешенного контекстным окном модели, которое равно next = 2048 для всех моделей, и обычно помещает от 10 до 100 примеров. Более крупные значения K часто приводят к лучшим результатам, но не всегда, поэтому когда у модели есть тестовый набор и отдельный набор разработки, модель экспериментирует с несколькими значениями K на наборе разработки, и на основе результатов запускает лучшее значение на тестовом наборе.

Кроме того, на задачах, которые требуют выбора правильного завершения из нескольких вариантов, разработчики предоставляют K примеров правильного завершения и контекста, и затем предоставляют один пример контекста и сравнивают задачи на основе вероятности LM каждого завершения. Для задач, которые требуют бинарной классификации, модели часто предоставляют варианты более семантически и с более осмысленными именами, и затем рассматривают задачу как множественный выбор и иногда также формулируют задачу аналогично тому, что делает модель RSR и архитектура.

Для задач, которые требуют свободного завершения, модель использует поиск лучшего варианта с одинаковыми параметрами, используемыми в модели RSR, с лучшим вариантом длиной 4 и штрафом 0,6. Модель затем оценивается с помощью либо балла F1, либо точного совпадения, либо BLEU, в зависимости от стандарта набора данных.

Результаты

Вышеуказанная фигура показывает кривые обучения для 8 моделей, использованных в архитектуре модели GPT-3, как описано в предыдущих разделах. Аналогично результатам модели KMH, производительность модели GPT-3 следует правильному закону при эффективном использовании вычислительных ресурсов обучения. Есть небольшое отклонение от закона только тогда, когда тренд продлевается на два порядка больше. Может показаться, что улучшения в перекрестной энтропии являются результатом моделирования ложных деталей обучающего корпуса. Однако улучшения в перекрестной энтропии приводят к последовательным выигрышам в общей производительности на широком спектре различных задач НЛП.

До оценки 8 разных моделей на широком диапазоне обучающих данных наборы данных сгруппированы в 8 разных категорий, которые представляют аналогичные задачи. Эти категории

  1. Оценка на традиционных задачах моделирования языка и задач, аналогичных моделированию языка, таких как задачи Cloze или завершения предложения/абзаца.
  2. Оценка на «закрытых книгах» задач ответов на вопросы.
  3. Оценка способности модели переводить между языками (особенно в одном-выстреловом и немного-выстреловом режимах)
  4. Оценка на задачах, аналогичных схеме Winograd.
  5. Оценка на наборах данных, которые включают рассуждения на основе здравого смысла или ответы на вопросы.
  6. Оценка на задачах чтения понимания.
  7. Оценка на наборе задач SuperGLUE.
  8. Изучение NLI.

Моделирование языка, завершение и задачи Cloze

В этом разделе производительность модели GPT-3 оценивается на традиционных задачах моделирования языка, а также на задачах, которые требуют прогнозирования одного слова интереса, или завершения абзаца или предложения, или завершения части текста. Давайте обсудим их кратко.

Моделирование языка

Модель GPT-3 рассчитывает ноль-выстреловую сложность на наборе данных PTB или Penn Tree Bank. Модель опускает задачи, связанные с Википедией, поскольку они уже включены в обучающие данные модели, и также опускает эталон в один миллиард слов, поскольку он вызывает значительное трение набора данных, находящегося в обучающих данных. Однако набор данных PTB решает эти проблемы, поскольку он предшествует современному интернету. Самая большая модель в архитектуре модели GPT-3 устанавливает новый уровень на наборе данных PTB на заметном отрыве в 15 пунктов и достигает сложности 20,50.

LAMBADA

Набор данных LAMBADA используется для проверки моделирования модели на длинных зависимостях в абзацах или текстах. Это означает, что модель запрашивается предсказать последнее слово предложения после прочтения абзаца для контекста. Кроме того, непрерывное масштабирование языковых моделей приводит к уменьшающимся доходам на этом эталоне.

Модель GPT-3 достигает точности 76% на наборе данных LAMBADA и имеет выигрыш более 8% над предыдущими лучшими моделями. Кроме того, модель LAMBADA демонстрирует гибкость немного-выстрелового обучения, поскольку она решает проблему классическим способом с этим набором данных. Завершение предложения в наборе данных LAMBADA обычно является последним словом предложения, но поскольку языковая модель не может знать это, она присваивает вероятность не только правильному завершению, но и другим продолжениям в абзаце.

Кроме того, когда примеры, поданные в модель GPT-3, изменены определенным образом, модель возвращает точность более 86%, что является увеличением более 18% над предыдущими лучшими моделями. Кроме того, результаты также показали, что производительность модели в немного-выстреловом режиме увеличивается пропорционально с увеличением размера модели. Хотя эта стратегия уменьшает наименьшую модель в архитектуре модели GPT-3 на 20%, она улучшает точность основной модели GPT-3 с 175 миллиардами параметров на 10%.

Ответы на вопросы в закрытой книге

Ответы на вопросы в закрытой книге – это попытка измерить способность модели GPT-3 отвечать на вопросы на основе широких фактических знаний. Поскольку такие вопросы часто имеют большое количество возможных запросов, задача обычно достигается с помощью системы извлечения информации, которая позволяет модели найти соответствующий текст в сочетании с моделью, которая учится генерировать ответ на вопрос, данный извлеченный текст и вопрос.

Вышеуказанная фигура сравнивает результат для модели GPT-3 по сравнению с разными моделями и работающими на разных наборах данных. На наборе данных TriviaQA модель достигает точности 64,3% в ноль-выстреловом режиме, в то время как она достигает точности 68% и 71,2% в одном-выстреловом и немного-выстреловом режимах соответственно.

Очевидно, что модель GPT-3 в ноль-выстреловом режиме превосходит настроенную модель T5-11B более чем на 14%.

Вышеуказанная фигура показывает, что производительность модели GPT-3 растет гладко с увеличением размера модели. Производительность предполагает, что языковые модели продолжают учиться из набора данных по мере увеличения их емкости.

Окончательные мысли

Безопасно сказать, что GPT-3 была революционной фазой в индустрии LLM, поскольку GPT-3 помогла расширить границы того, что может сделать языковая модель. Это были разработки, сделанные и препятствия, преодоленные GPT-3, которые проложили путь для самой продвинутой и точной большой языковой модели на сегодняшний день, GPT-4.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.