Модели и платформы ИИ
Zephyr-7B: гипероптимизированная LLM от Hugging Face, построенная на основе Mistral 7B
Введение
Эволюция открытых крупномасштабных языковых моделей (LLM) существенно повлияла на сообщество исследователей ИИ, особенно в разработке чат-ботов и аналогичных приложений. После выпуска моделей, таких как LLaMA, наблюдается всплеск исследований по эффективной настройке, обработке расширенных подсказок, генерации с помощью извлечения (RAG) и квантованию.
Модель LLaMA, например, ознаменовала новую эру в настройке и контекстуализации подсказок, проложив путь для последующих моделей, таких как MPT от MosaicML, RedPajama-INCITE от Together AI, Falcon от TII и Llama 2 от Meta. Каждая из этих моделей вносит уникальные возможности, расширяя общую функциональность и сферу применения LLM.
Mistral AI, стартап из Парижа, основанный бывшими сотрудниками Google DeepMind и Meta, сделал себе имя своей первой разработкой – Mistral 7B.
Преимущество Mistral 7B заключается в его эффективности, обеспечивая аналогичные или улучшенные возможности по сравнению с аналогами, такими как Llama 2, но с меньшими вычислительными требованиями.
В частности, настроенный для инструктивных задач, Mistral 7B Instruct выделяется на платформах, таких как Hugging Face, где он превосходит другие модели аналогичного размера и тесно конкурирует с моделями, имеющими почти вдвое больше параметров.
На основе этого Hugging Face представила Zephyr 7B Alpha, продемонстрировав, что дообученная модель Mistral 7B может действительно превзойти возможности значительно более крупных чат-моделей и, в некоторых задачах, даже конкурировать с GPT-4. “Альфа” была только началом, поскольку вскоре последовала Zephyr 7B Beta.
Эта статья исследует, как Zephyr-7B использует силу более крупных моделей для совершенствования своей способности отвечать и соответствовать человеческим инструкциям, процесс, который стал возможным благодаря технике дистилляции знаний. Этот метод включает в себя обучение меньших моделей на сложных закономерностях, изученных более крупными моделями, снижая требования к обучению без ущерба для возможностей моделирования языка. Мы углубимся в детали подхода Hugging Face к дистилляции знаний.
Дистилляция знаний
Ключевым нововведением в разработке моделей, таких как Zephyr-7B, является дистиллированная надзорная настройка (dSFT). Этот метод включает в себя использование вывода более крупной, более способной “учительской” модели для обучения меньшей “ученической” модели, повышая ее точность. Хотя дистилляция улучшает открытые модели в различных задачах, остается разрыв в производительности по сравнению с моделями-учителями.
Дистилляция знаний – это метод в машинном обучении, при котором компактная модель, называемая “учеником“, обучается повторять производительность более крупной, более сложной “учительской” модели. Этот метод позволяет ученику выполнять задачи, которые ранее были за пределами его возможностей, передавая сложные закономерности, изученные учителем.
Модель-ученик обучается на выходных вероятностях или особенностях, сгенерированных моделью-учителем, сосредотачиваясь на совпадении этих выходных данных, а не только на окончательных прогнозах. Это позволяет ученику изучить тонкие процессы принятия решений учителя, часто приводя к улучшению производительности по сравнению с обучением только с истинными данными.
Исторически дистилляция знаний использовалась в моделях, таких как сети дистилляции Хинтона, и более недавно в NLP с моделями, такими как DistilBERT, который дистиллировал модель BERT в меньшую, более быструю версию, сохраняющую большинство возможностей понимания языка оригинала. Другим примером является TinyBERT, который оптимизирует размер и скорость для мобильных или пограничных устройств.
В случае Zephyr-7B дистилляция знаний используется для наделения модели с 7 миллиардами параметров возможностями ее более крупных аналогов. Таким образом, Zephyr-7B достигает баланса между производительностью и эффективностью, делая ее подходящей для сред с ограниченными вычислительными ресурсами, не жертвуя качеством взаимодействия и понимания.
При разработке Zephyr-7B исследователи решали задачу выравнивания небольшой открытой LLM исключительно посредством дистилляции. Они представили подход, называемый дистиллированной прямой оптимизацией предпочтений (dDPO), который использует обратную связь ИИ из ансамбля моделей-учителей в качестве данных предпочтений. Этот метод, не требующий человеческой аннотации, существенно снижает время и ресурсы, необходимые для обучения модели.
Конструкция ZEPHYR-7B
Для проверки dDPO исследователи построили ZEPHYR-7B, выровненную версию модели Mistral-7B. Процесс включал три этапа:
- dSFT с использованием набора данных UltraChat: Дистиллированная надзорная настройка (dSFT) – это продвинутый метод обучения крупномасштабных языковых моделей (LLM) с использованием вывода более крупных, более способных “учительских” моделей. Он начинается с сырой LLM, обученной отвечать на пользовательские подсказки. В отличие от традиционной надзорной настройки (SFT), использующей фиксированный набор данных, dSFT использует динамический подход, при котором модель сама генерирует инструкции и ответы. Этот метод, известный как самоинструкция, включает в себя использование модели-учителя для ответа на инструкции и их уточнения на основе ответов.
- Включение данных обратной связи ИИ из UltraFeedback: Эти данные были важны для уточнения ответов модели. На этом этапе модель генерирует ответы на различные подсказки (например, описание того, как сделать шоколадные брауни), которые затем ранжируются более совершенной моделью, такой как GPT-4. Наивысший балл ответа (yw) и случайно выбранный ответ с более низким баллом (yl) образуют набор данных обратной связи D.
- Применение dDPO: Последний этап, дистиллированная прямая оптимизация предпочтений (dDPO), включает в себя уточнение модели dSFT путем максимизации вероятности более высокого ранжирования предпочитаемых ответов. Это достигается с помощью функции вознаграждения rθ(x, y) в модели предпочтений, основанной на оптимальной политике LLM π* и исходной политике πdSFT. Цель оптимизации формулируется как πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), что упрощает процесс обучения, начиная с версии модели dSFT и итерируя через каждую тройку AIF.
Замечательно, что Zephyr-7B достигает производительности, сравнимой с более крупными моделями с 70 миллиардами параметров, выровненных с человеческой обратной связью. Она превосходно справляется как с академическими бенчмарками, так и с разговорными возможностями, подчеркивая эффективность обучения предпочтений в разработке моделей. Для дальнейшего изучения модели, кода и инструкций доступны в репозитории Hugging Face на GitHub.
Решение проблемы выравнивания намерений
Заметной проблемой для LLM является их выравнивание с человеческими намерениями. Предыдущие модели часто не смогли произвести ответы, соответствующие предпочтениям пользователей, что приводило к неточным или нерелевантным ответам. Однако недавние бенчмарки, такие как MT-Bench и AlpacaEval, предоставили инструменты для количественной оценки и улучшения этого аспекта, подчеркивая превосходную производительность проприетарных моделей, обученных с человеческой обратной связью, над теми, которые обучались исключительно посредством дистилляции.
Методы оценки
Оценка Zephyr 7B включала тщательное тестирование на бенчмарках, оценивающих разговорные возможности модели в обоих однозначных и многозначных контекстах:
- MT-Bench: Этот многозначный бенчмарк требует от модели ответить на 160 вопросов, охватывающих восемь доменов. Каждый ответ оценивается GPT-4, а окончательный балл модели отражает среднее значение за два раунда вопросов.
- AlpacaEval: В этом однозначном бенчмарке модель представляется 805 вопросами по различным предметам. Здесь фокусируется на полезности модели, а ответы оцениваются GPT-4 для определения сравнительной победной ставки.
Кроме того, Zephyr 7B была протестирована на Open LLM Leaderboard, который, хотя и не является прямой оценкой разговорных навыков, предоставляет информацию о рассуждениях модели и ее правдивости после дообучения.
Zephyr 7B была сравнена с различными открытыми и проприетарными моделями, включая модели разных размеров и методов выравнивания. Она установила новые бенчмарки для моделей с 7 миллиардами параметров на MT-Bench и AlpacaEval и показала конкурентную производительность по сравнению с более крупными моделями, подтверждая эффективность прямой оптимизации предпочтений (dDPO) в обучении.
Фазы SFT и DPO были тщательно настроены, охватывая несколько эпох и скоростей обучения и размеров пакетов для оптимальной производительности. Окончательная модель Zephyr не только оказалась устойчивой к переобучению, но и улучшилась в решении практических задач и академических бенчмарков.
Наборы данных и результаты
Используемые наборы данных
Производительность и результаты
Ниже представлена диаграмма, иллюстрирующая производительность Zephyr 7B в различных категориях задач по сравнению с другими моделями, такими как GPT-3.5-turbo, Claude 1, GPT-4 и Llama-2-70b-chat. Категории могут включать письмо, гуманитарные науки, ролевая игра, рассуждение, STEM, извлечение, программирование и математику.
Из диаграммы можно сделать вывод, в каких областях Zephyr 7B превосходит и в каких может потребоваться дальнейшее улучшение. Например, если линия Zephyr на оси письма выходит дальше, чем у других, это указывает на то, что Zephyr особенно силен в генерации письменного контента. С другой стороны, если линия ближе к центру на оси математики, это может указывать на относительную слабость в решении математических задач.
Радарная диаграмма помогает выявить сильные и слабые стороны Zephyr 7B, предоставляя визуальное представление о том, где она стоит по сравнению с более крупными моделями, такими как GPT-4, и специализированными моделями, такими как Llama-2-70b-chat.
Сравнение различных языковых моделей на двух бенчмарках: MT-Bench и AlpacaEval. Модели оцениваются на основе их размера, метода выравнивания (такого как dSFT для дистиллированной надзорной настройки или dDPO для дистиллированной прямой оптимизации предпочтений) и баллов производительности. Zephyr выделяется высокими баллами в обоих бенчмарках, указывая на ее эффективность в генерации выровненных ответов.
Заключение
В заключение, разработка Zephyr-7B демонстрирует, что выравнивание и дистилляция разговорных возможностей из более крупной языковой модели (LLM) в меньшую модель может быть достигнута без использования методов, основанных на выборке. Используя прямую оптимизацию предпочтений (DPO) с обратной связью ИИ, Zephyr-7B использует сильную основу Mistral-7B, чтобы установить новый бенчмарк для моделей чата с 7 миллиардами параметров, демонстрируя способность меньших, открытых моделей понимать и отвечать на намерения пользователей эффективно.
Однако это исследование не обходится без ограничений. Зависимость от GPT-4 в качестве оценщика для бенчмарков вводит предвзятость в пользу моделей, дистиллированных из него, потенциально отдавая предпочтение точным ответам. Кроме того, масштабируемость этого метода для более крупных моделей, таких как LLAMA2-70B, и его влияние на прирост производительности остаются областями для дальнейших исследований. Эти ограничения подчеркивают необходимость постоянной инновации и разработки необоснованных методов оценки в сообществе ИИ.
Глядя за пределы исследования, очевидно, что потенциал меньших моделей работать на уровне более крупных аналогов может демократизировать ИИ, позволяя более доступное и эффективное использование в различных приложениях. Успех Zephyr-7B поощряет дальнейшее исследование открытых моделей, которое может ускорить достижения в области ИИ, способствуя совместным исследованиям и разработкам.
















