Модели и платформы ИИ
Зефир-7Б: Введение в прямую дистилляцию выравнивания в языковых моделях
Способность и производительность более мелких, открытых крупномасштабных языковых моделей значительно улучшились в последние годы, и мы стали свидетелями прогресса от ранних моделей GPT-2 до более компактных, точных и эффективных рамок LLM, которые используют значительно большее количество токенов, чем количество токенов, рекомендованное законами масштабирования Chinchilla. Кроме того, разработчики продемонстрировали, что эти более мелкие рамки LLM могут быть дополнительно обучены с помощью подхода, основанного на проприетарных моделях, называемого dSFT или дистиллированным контролируемым тонким настройкам, который использует вывод от эффективной модели учителя в качестве контролируемых данных для модели ученика в попытке повысить точность.
В этой статье мы будем говорить о рамке Зефир-7Б, которая представляет собой рамку чат-бенчмарка для моделей с 7 миллиардами параметров, не требующую человеческих аннотаций. Основная цель рамки – позволить разработчикам производить более мелкие крупномасштабные языковые модели, которые выровнены с намерением пользователя ближе, чем когда-либо прежде. Рамка Зефир-7Б не только исследует применение текущих подходов для более крупных рамок LLM, таких как dSFT, но также изучает возможность использования других подходов для изучения чат-модели с лучшим выравниванием с намерением пользователя. Мы будем глубже изучать рамку Зефир, и исследовать ее архитектуру, работу и результаты. Итак, давайте начнем.
Зефир-7Б: Введение в прямую дистилляцию выравнивания в языковых моделях
Как упоминалось ранее, языковые модели быстро прогрессировали в последние годы, от ранних рамок GPT-2 до текущих рамок GPT-4 и MiniGPT-5, которые, хотя и очень токенно-интенсивны, теперь более точны и эффективны. Одним из основных моментов этих продвинутых рамок LLM является то, что они включают значительно большее количество токенов, чем количество токенов, ранее считавшихся вычислительно оптимальными в соответствии с законами масштабирования Chinchilla. Кроме того, разработчики и исследователи, работающие над рамками LLM, узнали, что эти более мелкие рамки LLM могут быть дополнительно обучены с помощью подхода, основанного на проприетарных моделях, называемого dSFT или дистиллированным контролируемым тонким настройкам, который использует вывод от эффективной модели учителя в качестве контролируемых данных для модели ученика в попытке повысить точность. Стратегия дистилляции оказалась высокоэффективным и полезным инструментом для максимизации потенциала и возможностей открытых моделей в широком диапазоне задач, хотя она еще не может повторить производительность модели учителя. Кроме того, пользователи часто сообщают, что эти модели часто демонстрируют “выравнивание намерения”, то есть модели не ведут себя так, чтобы соответствовать требованиям конечных пользователей, что приводит к неправильным выводам, которые не дают правильного вывода или ответа на ввод пользователя или запросы.
Выравнивание намерения всегда было серьезной проблемой для разработчиков, и недавние работы сосредоточены на разработке бенчмарков, таких как AlpacaEval и MT-Bench, разработанных для решения проблемы выравнивания. Motивация разработки рамки Зефир можно отнести к проблеме использования дистилляции для выравнивания небольшой открытой рамки LLM, где основным шагом является использование АИ-обратной связи для получения данных предпочтений от ансамбля модели учителя, а затем применение дистиллированной оптимизации предпочтений напрямую в качестве основной цели обучения, подход, который называется dDPO или дистиллированной прямой оптимизацией предпочтений. Основным моментом подхода dDPO является то, что, в отличие от его предшественников, таких как PPO или проксимальная оптимизация предпочтений, он не требует человеческого выборочного или аннотированного, и также снижает время, необходимое для обучения языковой модели. Кроме того, он также позволяет разработчикам максимизировать вознаграждения окончательного образца, обращая пристальное внимание на последовательность шагов денойзинга с самого начала до конца, то есть на протяжении всего процесса.
Разработчики разработали рамку Зефир-7Б для проверки этого подхода, и в некотором смысле она является выровненной версией рамки Mistral-7B. Рамка сначала использует dSFT или дистиллированное контролируемое тонкое настройки на основе набора данных UltraChat, а затем применяет подход dDPO или дистиллированной прямой оптимизации предпочтений на основе данных обратной связи. Эксперименты показывают, что рамка Зефир-7Б с 7 миллиардами параметров обеспечивает результаты, сравнимые с результатами, достигнутыми моделями чата, выровненными с человеческой обратной связью, с более чем 70 миллиардами параметров. Кроме того, эксперименты также показывают, что результаты можно улучшить как в плане бенчмарков, учитывающих возможности разговора, так и стандартных академических бенчмарков, и использование обучения предпочтений имеет решающее значение для достижения желаемых результатов.

Вышеуказанная фигура демонстрирует производительность различных языковых моделей на бенчмарке MT-bench. Рамка Зефир-7Б, обученная с помощью подхода dDPO, сравнивается с проприетарными и открытыми более крупными языковыми моделями, такими как GPT-3.5 Turbo, Llama-2-70B и другие, которые были обучены с помощью дополнительного обучения с подкреплением и включали большое количество человеческой обратной связи. Как можно rõчно увидеть, несмотря на существенную разницу в количестве параметров, которые используются этими рамками, рамка Зефир-7Б обеспечивает сравнимые результаты с большинством из них и превосходит несколько рамок в различных областях.
Зефир-7Б: Метод, работа и архитектура
Основной целью рамки Зефир-7Б является помощь открытой крупномасштабной языковой модели в выравнивании как можно ближе к намерению пользователя, и на протяжении всего процесса рамка Зефир-7Б предполагает доступ к большой модели учителя, которую запрашивают с помощью генерации подсказок. Рамка Зефир-7Б следует подходу, аналогичному тому, который используется в рамке InstructGPT, и направлена на генерацию эффективной и точной модели ученика.
Следующая фигура кратко демонстрирует три основных шага, участвующих в работе рамки Зефир-7Б.
- dSFT для крупномасштабного строительства набора данных с помощью самоподобного стиля.
- Сбор АИ-обратной связи с помощью ансамбля завершенных чат-моделей, за которым следует бинаризация предпочтений и оценка с помощью GPT-4.
- dPO модели dSFT с помощью данных обратной связи.

dSFT или дистиллированное контролируемое тонкое настройки
Рамка начинается с сырой крупномасштабной языковой модели, которая сначала должна быть обучена для ответа на подсказки пользователя. Традиционно, обучение этих рамок LLM для ответа на подсказки пользователя осуществляется с помощью SFT или контролируемого тонкого настройки на наборе данных, состоящем из высококачественных инструкций и их соответствующих ответов. Поскольку рамка Зефир-7Б имеет доступ к модели учителя, рамка может генерировать инструкции и ответы и обучать модель напрямую на этих инструкциях и ответах, и этот подход называется dSFT или дистиллированным SFT. Следующая фигура демонстрирует дистилляцию, выполненную SFT, где x представляет набор семенных подсказок, построенных с основной целью представления разнообразного набора тематических доменов, y представляет образец ответа, который уточняется с помощью нового образца инструкции, представленного x1, и C представляет конечную точку в окончательном наборе данных.

АИ-обратная связь через предпочтения
Человеческая обратная связь используется для назначения крупномасштабных языковых моделей, поскольку они могут предоставить необходимые дополнительные сигналы, и эти человеческие обратные связи традиционно предоставляются через предпочтения на качестве ответов, сгенерированных рамками LLM. Однако рамка Зефир использует АИ-обратную связь от модели учителя на выводах других моделей вместо человеческой обратной связи для целей дистилляции. Подход, используемый рамкой Зефир, подвержен влиянию подхода, используемого рамкой UltraFeedback, которая использует модель учителя для предоставления предпочтений на выводах модели.
Аналогично подходу SFT или контролируемому тонкому настройки, он начинается с набора подсказок, где x представляет каждую отдельную подсказку, которая затем подается на коллекцию из четырех моделей, таких как Llama, Falcon, Claude и другие, каждая из которых генерирует свой ответ. Эти ответы затем подаются в качестве входных данных в модель учителя, такую как GPT-3 или GPT-4, и модель выводит оценку для входного ответа. После сбора выходных оценок модель сохраняет ответ с наивысшей оценкой.
dDPO или дистиллированная прямая оптимизация предпочтений
dDPO является окончательным шагом рамки Зефир, и его основной целью является уточнение модели dSFT учителя путем максимизации вероятности ранжирования предпочитаемого ответа в модели предпочтений, определяемой функцией вознаграждения с помощью модели языка ученика. Предыдущий шаг, включающий использование АИ-обратной связи, был сосредоточен в основном на использовании методов обучения с подкреплением, таких как PPO или проксимальная оптимизация предпочтений, для максимальной оптимизации с учетом вознаграждения, сгенерированного. На этом шаге вознаграждение сначала обучается, а затем выбирается из текущей политики для расчета обновлений, тем самым максимизируя оптимизацию. DPO или прямая оптимизация предпочтений следует аналогичному подходу для оптимизации модели предпочтений напрямую с помощью статических данных. Цель после подключения функции вознаграждения к модели предпочтений может быть записана

Зефир-7Б: Эксперименты, бенчмарки и результаты
Рамка Зефир проводит эксперименты тонкого настройки на текущей рамке Mistral-7B, которая обеспечивает производительность, сравнимую с более крупными языковыми моделями на широком диапазоне задач обработки естественного языка или NLP.
Наборы данных
Рамка Зефир использует два набора данных диалогов, которые были дистиллированы из смеси проприетарных и открытых моделей, которые ранее доказали свою эффективность в производстве эффективных чат-моделей.
UltraChat
UltraChat является самоподобным набором данных, который состоит из почти 1,5 миллиона многоходовых диалогов, распространенных на 30 темах и 20 текстовых материалов, сгенерированных рамкой GPT-3.5-Turbo. Для решения проблемы неправильной капитализации в наборе данных UltraChat рамка применяет подход truecasing-евристики для устранения грамматических ошибок.
UltraFeedback
UltraFeedback является набором данных подсказок с более чем 64 тысячами подсказок, каждая из которых имеет четыре отдельных ответа LLM. Рамка Зефир использует наивысший средний балл, полученный из набора данных UltraFeedback, для построения бинарных предпочтений, и один из оставшихся трех ответов LLM отклоняется как случайный.
Оценка
Для оценки производительности рамки Зефир разработчики выбрали два чат-бенчмарка, один одноразовый и один многоходовой, в попытке оценить способность модели следовать инструкциям пользователя и реагировать соответственно.
MT-Bench
Бенчмарк MT-Bench состоит из 160 вопросов, распространенных на 8 уникальных областей знаний, и под бенчмарком MT-Bench модель должна ответить на первоначальный вопрос и предоставить ответ на последующий вопрос.
AlpacaEval
AlpacaEval является одноразовым бенчмарком, под которым модель или рамка генерирует ответы пользователя на более чем 800 вопросов, распространенных на различные темы, с основным вниманием на полезность.
В дополнение к этим двум основным бенчмаркам рамка Зефир-7Б также оценивается на открытом лидерборде LLM для задач многоклассовой классификации, ARC, HellaSwag, MMLU и других. Кроме того, независимо от того, на каком бенчмарке оценивается рамка Зефир-7Б, она сравнивается с рядом проприетарных и открытых моделей, с их процедурами выравнивания в качестве единственного различающего фактора.
Результаты
Давайте теперь посмотрим, как рамка Зефир-7Б работает и сравнивается с текущими рамками языковых моделей.
Реализация подхода dDPO повышает возможности чата
Следующая таблица сравнивает производительность рамки Зефир-7Б с рамками языковых моделей на бенчмарках AlpacaEval и MT-Bench.

Как можно rõчно увидеть, когда сравнивается с открытыми моделями 7B, рамка Зефир-7Б не только значительно превосходит модели dSFT на обоих бенчмарках, но также устанавливает новые стандарты. Кроме того, рамка Зефир-7Б также превосходит рамку XWIN-LM-7B, которая является одной из редких моделей, обученных на подходе dPPO или дистиллированном PPO. Кроме того, производительность, обеспечиваемая рамкой Зефир-7Б, сравнима с результатами, достигнутыми более крупными языковыми моделями, такими как Llama2-Chat с более чем 70 миллиардами параметров.
dDPO повышает производительность академических задач
Следующая фигура сравнивает производительность рамки Зефир-7Б с широким диапазоном открытых и проприетарных рамок LLM.

Как можно rõчно увидеть, рамка Зефир-7Б значительно превосходит рамки LLM с 7 миллиардами параметров, и разрыв между ее производительностью и производительностью, обеспечиваемой лучшими моделями dSFT, также заметен. Когда количество параметров увеличивается, рамка Зефир-7Б немного отстает, хотя она соответствует производительности, обеспечиваемой рамками с 40 миллиардами параметров.
Оптимизация предпочтений
На следующей фигуре мы оцениваем, как различные шаги, выполняемые в процессе выравнивания, влияют на производительность. Как можно rõчно увидеть, подход dDPO, объединенный с dSFT, значительно повышает производительность на обоих наборах данных MT-Bench и AlpacaEval.

Наконец, на следующей фигуре мы можем увидеть тестовую и обучающую точность во время реализации DPO. Как можно rõчно увидеть, подход DPO не влияет на производительность модели на задачах вниз по потоку.

Заключение
В этой статье мы говорили о рамке Зефир-7Б на основе текущей рамки Mistral-7B, которая направлена на решение проблемы дистилляции выравнивания из крупной языковой модели в более мелкую предварительно обученную рамку. Основной целью рамки является позволить разработчикам производить более мелкие крупномасштабные языковые модели, которые выровнены с намерением пользователя ближе, чем когда-либо прежде. Рамка Зефир-7Б не только исследует применение текущих подходов для более крупных рамок LLM, таких как dSFT, но также изучает возможность использования других подходов для изучения чат-модели с лучшим выравниванием с намерением пользователя.
Однако, несмотря на перспективные результаты, рамка Зефир-7Б не идеальна, и еще много работы предстоит сделать. Одним из очевидных ограничений является использование рамки GPT-4 для оценки бенчмарков MT-Bench и AlpacaEval, которые часто были предвзятыми в пользу моделей, которые они дистиллируют сами. Однако рамка Зефир-7Б надеется проложить путь для изучения возможностей более мелких открытых моделей, которые способны выравниваться с намерением пользователя и взаимодействиями.












