Моделі та платформи ШІ

Zephyr-7B: Hugging Face’s Hyper-Optimized LLM Built on Top of Mistral 7B

mm
Додайте Unite.AI до бажаних джерел у Google

Вступ

Еволюція відкритих великомасштабних мовних моделей (LLM) суттєво вплинула на дослідницьке співтовариство штучного інтелекту, особливо у розробці чат-ботів та подібних застосунків. Після випуску моделей, таких як LLaMA, відбулося зростання досліджень щодо ефективного доопрацювання, розширення обробки запитів, генерації з підтримкою пошукових запитів (RAG) та кванталізації.

Модель LLaMA, наприклад, позначила нову еру доопрацювання та контекстуалізації запитів, проклавши шлях для наступних моделей, таких як MosaicML’s MPT, Together AI’s RedPajama-INCITE, TII’s Falcon та Meta’s Llama 2. Кожна з цих моделей внесла унікальні можливості, підвищуючи загальну функціональність та сферу застосування LLM.

Mistral AI, стартап з Парижа, заснований колишніми працівниками Google DeepMind та Meta, здобув популярність завдяки своїй першій пропозиції: Mistral 7B.

Перевага Mistral 7B полягає в його ефективності, забезпечуючи подібні або покращені можливості порівняно з однорідними моделями, такими як Llama 2, але з меншими обчислювальними вимогами.

Зокрема, налаштований для інструктивних завдань, Mistral 7B Instruct вирізняється на платформах, таких як Hugging Face, де він перевершує інші моделі такого самого розміру та конкурує з моделями, що мають майже вдвічі більше параметрів.

Розбудовуючи на цьому, Hugging Face представила Zephyr 7B Alpha, продемонструвавши, що доопрацьована модель Mistral 7B може перевершити можливості значно більших чат-моделей і, в деяких завданнях, навіть конкурувати з GPT-4. “Alpha” був лише початком, оскільки Zephyr 7B Beta слідувала невдовзі.

Ця стаття досліджуватиме, як Zephyr-7B використовує потужність більших моделей для вдосконалення своєї здатності реагувати та відповідати на людські інструкції, процес, який став можливим завдяки техніці знань дистиляції. Цей метод включає навчання менших моделей на складних закономірностях, вивчених більшістю моделей, зменшуючи вимоги до навчання без жертвування можливостями мовної моделі. Ми зануримося в особливості підходу Hugging Face до знань дистиляції.

Знання дистиляції

Ключова інновація у розробці моделей, таких як Zephyr-7B, полягає в дистильованому наглядовому доопрацюванні (dSFT). Цей метод включає використання виводу з більшої, здатнішої “вчительської” моделі для навчання меншої “учнівської” моделі, підвищуючи її точність. Хоча дистиляція покращує відкриті моделі в різних завданнях, все ще існує розрив у продуктивності порівняно з вчительськими моделями.

Знання дистиляції – це метод у машинному навчанні, де компактна модель, відома як “учнів”, навчається повторювати продуктивність більшої, складнішої “вчительської” моделі. Ця техніка дозволяє учню виконувати завдання, які раніше були поза його можливостями, передаючи складні закономірності, вивчені вчительською моделлю.

Знання дистиляції | Вчительська-модель

Знання дистиляції | Вчительська-модель

Модель учня навчається на вивідних імовірностях або ознаках, згенерованих вчительською моделлю, зосереджуючись на збігу цих виводів, а не лише на остаточних прогнозах. Це дозволяє учню вивчити нюансовані процеси прийняття рішень вчительської моделі, часто результатом чого є покращена продуктивність порівняно з навчанням лише з використанням основних даних.

Історично знання дистиляції застосовувалися в моделях, таких як оригінальні мережі дистиляції Хінтона, і нещодавно в NLP з моделями, такими як DistilBERT, який дистильований з BERT у меншу, швидшу версію, що зберігає більшість можливостей мовної моделі оригіналу. Іншим прикладом є TinyBERT, який ще далі оптимізує розмір і швидкість для мобільних або периферійних пристроїв.

У випадку Zephyr-7B знання дистиляції застосовуються для наділення меншої 7B-параметрової моделі можливостями своїх більших аналогів. Роблячи це, Zephyr-7B досягає балансу між продуктивністю та ефективністю, роблячи її придатною для середовищ, де обчислювальні ресурси обмежені, не жертвуючи якістю взаємодії та розуміння.

При розробці Zephyr-7B дослідники подолали виклик повної дистиляції малих відкритих LLM. Вони ввели підхід, названий дистильованою прямою оптимізацією переваг (dDPO), який використовує зворотний зв’язок штучного інтелекту з ансамблю вчительських моделей як дані переваг. Цей метод, який не вимагає людської анотації, суттєво зменшує час і ресурси, необхідні для навчання моделі.

Конструкція ZEPHYR-7B

Для перевірки dDPO дослідники створили ZEPHYR-7B, вирівняну версію моделі Mistral-7B. Процес включав три етапи:

  1. dSFT за допомогою набору даних UltraChat: Дистильоване наглядове доопрацювання (dSFT) – це просунутий метод навчання великомасштабних мовних моделей (LLM) шляхом використання виводу з більших, здатніших “вчительських” моделей. Воно починається з сирої LLM, яка навчається реагувати на запити користувача. На відміну від традиційного наглядового доопрацювання (SFT), яке використовує фіксований набір даних, dSFT застосовує динамічний підхід, у якому модель сама генерує інструкції та відповіді. Цей метод, відомий як самоінструкція, включає використання вчительської моделі для того, щоб і відповідати, і уточнювати інструкції на основі відповідей. Процес починається з набору початкових запитів (x₀₁, x₀₂, …, x₀_J), які представляють різні теми. Кожен запит уточнюється ітеративно: для заданого запиту x₀ генерується відповідь y₀ вчительською моделлю, а потім на основі x₀ та y₀ вибірково вибирається нова інструкція x₁. Остаточний набір даних C = {(x₁, y₁), …, (x_J, y_J)} використовується для доопрацювання моделі.
  2. Включення даних зворотного зв’язку штучного інтелекту з UltraFeedback: Ці дані були важливими для уточнення відповідей моделі. На цьому етапі модель генерує відповіді на різні запити (наприклад, описуючи, як зробити шоколадні брауні), які потім ранжуються більш просунутою моделлю, такою як GPT-4. Найкраща відповідь (yw) та випадково вибрана нижча за оцінкою відповідь (yl) утворюють набір даних зворотного зв’язку D.
  3. Застосування dDPO: Останній етап, дистильована пряма оптимізація переваг (dDPO), включає уточнення моделі dSFT шляхом максимізації імовірності вищої оцінки переваги відповідей. Це досягається шляхом використання функції винагороди rθ(x, y) у моделі переваг, яка базується на оптимальній політиці LLM π* та первинній політиці πdSFT. Цільова функція оптимізації формується як πθ = max π E (x, yw, yl) ∼ D log σ (β log π(yw|x)/πdSFT(yw|x) − β log π(yl|x)/πdSFT(yl|x)), що спрощує процес навчання, починаючи з версії моделі dSFT і ітеративно проходячи кожну трійку AIF.
Метод, використаний у Zephyr-7B, дзеркально відображає процеси, використані в InstructGPT.

Метод, використаний у Zephyr-7B, дзеркально відображає процеси, використані в InstructGPT.

Вражаюче, але Zephyr-7B досягає продуктивності, порівнянної з моделями значно більших розмірів, вирівняними з людським зворотним зв’язком. Вона вирізняється як у академічних бенчмарках, так і у розмовних можливостях, підкреслюючи ефективність навчання переваг у розробці моделей. Для подальшого дослідження моделі, коду та інструкцій доступні на GitHub-репозиторії Hugging Face.

Подолання виклику вирівнювання намірів

Одним із суттєвих проблем з LLM є їхнє вирівнювання з людським наміром. Попередні моделі часто не могли генерувати відповіді, які відповідали перевагам користувача, що призводило до неточних або неважливих відповідей. Однак останні бенчмарки, такі як MT-Bench і AlpacaEval, надали інструменти для кількісної оцінки та покращення цього аспекту, підкреслюючи вищу продуктивність власницьких моделей, навчених з людським зворотним зв’язком, над тими, які навчені лише за допомогою дистиляції.

Методи оцінки

Оцінка Zephyr 7B включала ретельне тестування на бенчмарках, які оцінюють розмовні можливості моделі як у однозахідному, так і у багатокроковому контексті:

  • MT-Bench: Цей багатокроковий бенчмарк вимагає від моделі відповісти на 160 запитів у восьми доменах. Кожна відповідь оцінюється GPT-4, а остаточний бал моделі відображає середнє значення за два раунди запитів.
  • AlpacaEval: У цьому однозахідному бенчмарку модель представляється 805 запитами з різних предметів. Основна увага тут зосереджена на корисності моделі, а відповіді оцінюються GPT-4 для визначення порівняльної частки перемог.

Крім того, Zephyr 7B була протестована на Open LLM Leaderboard, який, хоча і не є прямою оцінкою розмовних можливостей, надає уявлення про здатність моделі до логічного мислення та істини після доопрацювання.

Zephyr 7B була порівняна з різними відкритими та власницькими моделями, включаючи ті, які мають різні розміри та методи вирівнювання. Вона встановила нові бенчмарки для 7B-моделей на MT-Bench і AlpacaEval, показавши конкурентоспроможну продуктивність проти більших моделей, що підтверджує ефективність прямої оптимізації переваг (dDPO) у навчанні.

Фази SFT і DPO були ретельно налаштовані, охоплюючи кілька епох та доопрацювання швидкості навчання та розмірів пакетів для оптимальної продуктивності. Остаточна модель Zephyr не лише виявилася стійкою до переобучення, але й покращеною у справі з практичними завданнями та академічними бенчмарками.

Набори даних і результати

Використані набори даних

При розробці Zephyr-7B було використано два ключових набори даних для навчання та уточнення моделі, кожен з яких адресував різні аспекти генерації діалогу:

Набір даних UltraChat

  • Джерело: Розроблений з діалогів, згенерованих GPT-3.5-TURBO.
  • Зміст: Містить 1,47 мільйона багатокрокових діалогів по 30 темах та 20 типах текстових матеріалів.
  • Уточнення: Набір даних пройшов через евристичний підхід до виправлення граматичних питань, а фільтри були застосовані для підвищення корисності відповідей та усунення некорисних фраз-преамбули.

Набір даних UltraFeedback

  • Джерело: Складається з запитів, оцінених GPT-4, який оцінював відповіді за інструкціями, чесністю та корисністю.
  • Зміст: Містить 64 000 запитів з чотирма відповідями кожна, оціненими GPT-4.
  • Бінарні переваги: Генеруються шляхом вибору відповіді з найвищим середнім балом як “обраної” та випадкової з решти як “відхиленої” для підвищення різноманітності та виклику процесу прямої оптимізації переваг (DPO).

Обидва набори даних є важливими для навчання Zephyr-7B розуміти та генерувати людські діалоги, які відповідають інструкціям, чесності та корисності. Ці набори даних були розміщені на Hugging Face Hub, до якого ви можете звернутися тут.

Продуктивність і результати

Нижче наведена діаграма показує продуктивність Zephyr 7B у різних категоріях завдань порівняно з іншими моделями, такими як GPT-3.5-turbo, Claude 1, GPT-4 та Llama-2-70b-chat. Категорії можуть включати Письмо, Гуманітарні науки, Рольові ігри, Розуміння, STEM, Видобуток, Кодування та Математику.

З діаграми можна зробити висновок, у яких областях Zephyr 7B вирізняється та які області можуть потребувати подальшого покращення. Наприклад, якщо лінія Zephyr простягнута далі на осі Письма порівняно з іншими, це свідчить про те, що Zephyr особливо сильна у генерації письмового контенту. Навпаки, якщо лінія ближче до центру на осі Математики, це може вказувати на відносну слабкість у розв’язанні математичних задач.

Радарна діаграма допомагає визначити сильні та слабкі сторони Zephyr 7B, надає візуальне представлення того, де вона знаходиться порівняно з більшістю моделей, таких як GPT-4 та спеціалізованими моделями, такими як Llama-2-70b-chat.

 

Діаграма продуктивності моделі

Діаграма продуктивності моделі

Порівняння різних мовних моделей на двох бенчмарках: MT-Bench і AlpacaEval. Моделі оцінюються на основі їхнього розміру, методу вирівнювання (такого як dSFT для дистильованого наглядового доопрацювання або dDPO для дистильованої прямої оптимізації переваг) та балів продуктивності. Zephyr вирізняється високими балами в обох бенчмарках, вказуючи на її ефективність у генерації вирівняних відповідей.

MT-Bench і AlpacaEval

MT-Bench і AlpacaEval

Висновок

У висновку, розробка Zephyr-7B демонструє, що вирівнювання та дистиляція розмовних можливостей з великої мовної моделі (LLM) на меншу модель може бути досягнуте без залежності від методів, заснованих на вибірці. Використовуючи пряму оптимізацію переваг (DPO) із зворотним зв’язком штучного інтелекту, Zephyr-7B використовує сильну основу Mistral-7B для встановлення нового бенчмарку для 7B-параметрових чат-моделей, демонструючи здатність менших, відкритих моделей розуміти та реагувати на людські наміри ефективно.

Однак, це дослідження не позбавлене обмежень. Залежність від GPT-4 як оцінювача для бенчмарків вводить упередженість щодо моделей, дистильованих з нього, потенційно надає перевагу точним відповідям. Крім того, масштабованість цього методу для більших моделей, таких як LLAMA2-70B, та його вплив на продуктивність залишаються сферами для подальших досліджень. Ці обмеження підкреслюють необхідність безперервної інновації та розробки необмежених методів оцінки в спільноті штучного інтелекту.

Оглядаючи дослідження, очевидно, що потенціал менших моделей виконувати завдання на рівні більших аналогів може демократизувати штучний інтелект, дозволяючи більш доступне та ефективне використання в різних застосуваннях. Успіх Zephyr-7B заохочує подальше дослідження відкритих моделей, яке може прискорити досягнення в галузі штучного інтелекту шляхом сприяння колективним дослідженням та розробкам.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.