Моделі та платформи ШІ
Підйом суміші експертів для ефективних великомасштабних мовних моделей

By
Aayush Mittal Міттал
У світі обробки природної мови (NLP) пошук побудови більших і більш потужних мовних моделей був рушійною силою багатьох останніх досягнень. Однак, оскільки ці моделі зростають у розмірі, обчислювальні вимоги для навчання та висновку стають все більш вимогливими, тягнучи проти меж доступних апаратних ресурсів.
Вступає Суміш-експертів (MoE), техніка, яка обіцяє полегшити цю обчислювальну ношу, одночасно дозволяючи навчати більших і більш потужних мовних моделей. Нижче ми обговоримо MoE, дослідимо його походження, внутрішню роботу та його застосування в трансформерних мовних моделях.
Походження суміші експертів
Концепція суміші експертів (MoE) можна простежити до початку 1990-х років, коли дослідники досліджували ідею умовного обчислення, коли частини нейронної мережі вибірково активуються на основі вхідних даних. Однією з піонерських робіт в цій галузі була робота “Адаптивна суміш локальних експертів” Джейкобса та ін. у 1991 році, яка запропонувала керований навчальний каркас для ансамблю нейронних мереж, кожна з яких спеціалізується на різних регіонах вхідного простору.
Основна ідея за сумішшю експертів полягає в тому, щоб мати кілька “експертних” мереж, кожна з яких відповідає за обробку підмножини вхідних даних. Гейтінг-механізм, зазвичай нейронна мережа сама по собі, визначає, які експерти повинні обробляти певний вхід. Цей підхід дозволяє моделі виділяти свої обчислювальні ресурси більш ефективно, активуючи лише відповідних експертів для кожного вхідного сигналу, а не займаючи повну ємність моделі для кожного вхідного сигналу.
За роки різні дослідники досліджували і розширили ідею умовного обчислення, що призвело до розробок, таких як ієрархічні суміші експертів, низькорангові апроксимації для умовного обчислення та техніки для оцінки градієнтів через стохастичні нейрони та функції активації з жорстким порогом.
Суміш експертів у трансформерах
Хоча ідея суміші експертів існує вже десятиліття, її застосування до трансформерних мовних моделей відносно недавнє. Трансформери, які стали де-факто стандартом для мовних моделей останнього покоління, складаються з декількох шарів, кожен з яких містить механізм самоуваження та густу нейронну мережу (FFN).
Ключова інновація у застосуванні суміші експертів до трансформерів полягає у заміні густих шарів FFN на розріджені шари суміші експертів, кожен з яких складається з декількох експертних FFN та гейтінг-механізму. Гейтінг-механізм визначає, які експерти повинні обробляти кожен вхідний токен, дозволяючи моделі вибірково активувати лише підмножину експертів для даної вхідної послідовності.
Однією з перших робіт, яка продемонструвала потенціал суміші експертів у трансформерах, була робота “Нейронні мережі, що виходять за рамки: розріджений шар суміші експертів” Шейзера та ін. у 2017 році. Ця робота ввела концепцію розрідженого шару суміші експертів, який використовував гейтінг-механізм, який додав розрідженість та шум до процесу вибору експертів, забезпечуючи активацію лише підмножини експертів для кожного вхідного сигналу.
З того часу декілька інших робіт далі просунули застосування суміші експертів до трансформерів, звертаючи увагу на такі проблеми, як нестабільність навчання, балансування навантаження та ефективне висновок. Видатними прикладами є Switch Transformer (Fedus et al., 2021), ST-MoE (Zoph et al., 2022) та GLaM (Du et al., 2022).
Переваги суміші експертів для мовних моделей
Основна перевага застосування суміші експертів у мовних моделях полягає у можливості збільшення розміру моделі при збереженні відносно сталої обчислювальної вартості під час висновку. Вибірково активуючи лише підмножину експертів для кожного вхідного токену, моделі суміші експертів можуть досягти виразної потужності великих густих моделей при значно менших обчислювальних витратах.
Наприклад, розглянемо мовну модель з густим шаром FFN, який містить 7 мільярдів параметрів. Якщо ми замінимо цей шар на шар суміші експертів, який складається з восьми експертів, кожен з яких має 7 мільярдів параметрів, загальна кількість параметрів збільшується до 56 мільярдів. Однак під час висновку, якщо ми активуємо лише два експерти на токен, обчислювальна вартість еквівалентна моделі з 14 мільярдами параметрів, оскільки вона обчислює дві матричні множення з 7 мільярдами параметрів.
Ця обчислювальна ефективність під час висновку особливо цінна у сценаріях розгортання, де ресурси обмежені, такі як мобільні пристрої або середовища=edge-обчислення. Крім того, знижені обчислювальні вимоги під час навчання можуть привести до суттєвої економії енергії та нижчого вуглецевого сліду, що відповідає зростаючому акценту на сталій практиці штучного інтелекту.
Виклики та розгляди
Хоча моделі суміші експертів пропонують привабливі переваги, їхнє прийняття та розгортання також пов’язані з декількома викликами та розглядами:
- Нестабільність навчання: Моделі суміші експертів відомі тим, що вони більш схильні до нестабільності навчання порівняно зі своїми густими аналогами. Ця проблема виникає через розріджену та умовну природу активації експертів, що може привести до труднощів у пропагації градієнтів та збіжності. Техніки, такі як з-loss роутера (Zoph et al., 2022), були запропоновані для пом’якшення цих нестабільностей, але подальші дослідження все ще потрібні.
- Файн-тюнінг та переобучення: Моделі суміші експертів схильні до переобучення під час файн-тюнингу, особливо коли завдання внизу має відносно малий набір даних. Це поведінка пояснюється підвищеною ємністю та розрідженістю моделей суміші експертів, що може привести до надспеціалізації на навчальних даних. Ретельна регуляризація та стратегії файн-тюнингу необхідні для пом’якшення цієї проблеми.
- Вимоги до пам’яті: Хоча моделі суміші експертів можуть зменшити обчислювальні витрати під час висновку, вони часто мають вищі вимоги до пам’яті порівняно з густими моделями подібного розміру. Це відбувається через те, що всі ваги експертів потрібно завантажувати в пам’ять, навіть якщо лише підмножина активується для кожного вхідного сигналу. Обмеження пам’яті можуть обмежити масштабованість моделей суміші експертів на пристроях з обмеженими ресурсами.
- Балансування навантаження: Для досягнення оптимальної обчислювальної ефективності важливо балансувати навантаження між експертами, забезпечуючи, щоб жоден експерт не був перевантажений, тоді як інші залишаються недообладнаними. Це балансування зазвичай досягається за допомогою допоміжних втрат під час навчання та ретельного налаштування коефіцієнта ємності, який визначає максимальну кількість токенів, які можуть бути призначені кожному експерту.
- Зв’язок: У розподілених сценаріях навчання та висновку моделі суміші експертів можуть вводити додатковий зв’язок через необхідність обміну інформацією про активацію та градієнти між експертами, які мешкають на різних пристроях або прискорювачах. Ефективні стратегії зв’язку та апаратно-орієнтований дизайн моделі необхідні для пом’якшення цього зв’язку.
Незважаючи на ці виклики, потенційні переваги моделей суміші експертів у дозволі подальшого зростання мовних моделей спонукали суттєві дослідницькі зусилля для вирішення та пом’якшення цих проблем.
Приклад: Mixtral 8x7B і GLaM
Для ілюстрації практичного застосування суміші експертів у мовних моделях розглянемо два помітні приклади: Mixtral 8x7B і GLaM.
Mixtral 8x7B – це варіант суміші експертів мовної моделі Mistral, розроблений компанією Anthropic. Він складається з восьми експертів, кожен з яких має 7 мільярдів параметрів, що результатує у загальній кількості 56 мільярдів параметрів. Однак під час висновку активуються лише два експерти на токен, ефективно зменшуючи обчислювальну вартість до рівня 14-мільярдної густої моделі.
Mixtral 8x7B продемонстрував вражаючі результати, випереджаючи 70-мільярдну модель Llama, при цьому пропонуючи значно швидші часи висновку. Версія Mixtral 8x7B, налаштована на інструкції, під назвою Mixtral-8x7B-Instruct-v0.1, також була випущена, ще більше розширюючи її можливості щодо виконання природних мовних інструкцій.
Іншим помітним прикладом є GLaM (Google (GOOGL ) Language Model), великомасштабна модель суміші експертів, розроблена компанією Google. GLaM використовує архітектуру декодера-тільки трансформера та була навчена на величезному наборі даних у 1,6 трильйона токенів. Модель досягає вражаючих результатів у кількох тестах, дорівнюючи якості GPT-3, при цьому використовуючи лише одну третину енергії, необхідної для навчання GPT-3.
Успіх GLaM можна віднести до її ефективної архітектури суміші експертів, яка дозволила навчати модель з величезною кількістю параметрів при збереженні розумних обчислювальних вимог. Модель також продемонструвала потенціал моделей суміші експертів бути більш енергоефективними та екологічно чистими порівняно з їхніми густими аналогами.
Архітектура Grok-1
Grok-1 – це трансформерна модель суміші експертів з унікальною архітектурою, розробленою для максимізації ефективності та продуктивності. Давайте розглянемо ключові характеристики:
- Параметри: З приголомшливими 314 мільярдами параметрів Grok-1 є найбільшою відкритою LLM на сьогодні. Однак завдяки архітектурі суміші експертів лише 25% ваг (приблизно 86 мільярдів параметрів) активні в будь-який момент часу, підвищуючи можливості обробки.
- Архітектура: Grok-1 використовує архітектуру суміші восьми експертів, кожен з яких обробляє два токени під час висновку.
- Шари: Модель складається з 64 трансформерних шарів, кожен з яких включає механізм самоуваження та густу нейронну мережу.
- Токенізація: Grok-1 використовує токенізацію SentencePiece з розміром словника 131 072 токенів.
- Вбудовування та позиційне кодування: Модель має 6 144-мірні вбудовування та використовує роторне позиційне кодування, що дозволяє більш динамічну інтерпретацію даних порівняно з традиційними фіксованими позиційними кодуваннями.
- Увага: Grok-1 використовує 48 голів уваги для запитів та 8 голів уваги для ключів та значень, кожна з яких має розмір 128.
- Довжина контексту: Модель може обробляти послідовності довжиною до 8 192 токенів, використовуючи точність bfloat16 для ефективних обчислень.
Про продуктивність та реалізації
Grok-1 продемонстрував вражаючі результати, випереджаючи LLaMa 2 70B та Mixtral 8x7B з результатом MMLU 73%, демонструючи свою ефективність та точність у різних тестах.
Однак варто зазначити, що Grok-1 вимагає значних ресурсів GPU через свій величезний розмір. Поточна реалізація у відкритому випуску зосереджена на перевірці правильності моделі та використовує неефективну реалізацію шару суміші експертів, щоб уникнути необхідності використання спеціальних ядер.
Незважаючи на це, модель підтримує шардування активації та 8-бітову квантизацію, що може оптимізувати продуктивність та зменшити вимоги до пам’яті.
У вражаючому русі xAI випустила Grok-1 під ліцензією Apache 2.0, зробивши її ваги та архітектуру доступними для глобального співтовариства для використання та внесення змін.
Відкритий випуск включає репозиторій прикладного коду JAX, який демонструє, як завантажити та запустити модель Grok-1. Користувачі можуть завантажити ваги моделі за допомогою клієнта торрентів або безпосередньо через HuggingFace Hub, що полегшує доступ до цієї революційної моделі.
Майбутнє суміші експертів у мовних моделях
Поки триває попит на більші та більш потужні мовні моделі, прийняття технік суміші експертів, як очікується, буде набувати подальшого імпульсу. Тривалі дослідницькі зусилля зосереджені на вирішенні залишилися викликів, таких як покращення стабільності навчання, пом’якшення переобучення під час файн-тюнингу та оптимізація вимог до пам’яті та зв’язку.
Одним з перспективних напрямків є дослідження ієрархічних архітектур суміші експертів, де кожен експерт сам складається з декількох субекспертів. Цей підхід потенційно може дозволити ще більшу масштабованість та обчислювальну ефективність при збереженні виразної потужності великих моделей.
Крім того, розвиток апаратних та програмних систем, оптимізованих для моделей суміші експертів, є активною областю дослідження. Спеціалізовані прискорювачі та розподілені каркаси навчання, розроблені для ефективного оброблення розріджених та умовних обчислень моделей суміші експертів, можуть ще більше підвищити їхню продуктивність та масштабованість.
Крім того, інтеграція технік суміші експертів з іншими досягненнями у галузі мовних моделей, такими як розріджені механізми уваги, ефективні стратегії токенізації та багатомодальні представлення, може привести до ще більш потужних та універсальних мовних моделей, здатних вирішувати широкий спектр завдань.
Висновок
Техніка суміші експертів виникла як потужний інструмент у пошуках більших та більш потужних мовних моделей. Вибірково активуючи експертів на основі вхідних даних, моделі суміші експертів пропонують перспективне рішення обчислювальних проблем, пов’язаних із масштабуванням густих моделей. Хоча залишаються виклики, такі як нестабільність навчання, переобучення та вимоги до пам’яті, потенційні переваги моделей суміші експертів у термінах обчислювальної ефективності, масштабованості та екологічної чистоти роблять їх цікавою областю дослідження та розвитку.
Поки галузь обробки природної мови продовжує розширювати межі того, що можливо, прийняття технік суміші експертів, як очікується, буде відігравати важливу роль у дозволі подальшого зростання мовних моделей. Об’єднавши суміш експертів з іншими досягненнями у галузі архітектури моделей, технік навчання та апаратної оптимізації, ми можемо очікувати ще більш потужних та універсальних мовних моделей, здатних справжньо зрозуміти та спілкуватися з людьми природним та безшовним чином.
Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.
Дізнайтеся більше


xAI запускає Grok Bot, завжди-включені штучні інтелекти з власними хмарними комп’ютерами


Космічний бізнес SpaceX потроїв свій дохід, але все одно втрачає гроші


Microsoft розширює угоду з Mistral, щоб привабити покупців, що підлягають регулюванню, для придбання штучного інтелекту


Європарламент створює власну платформу штучного інтелекту для депутатів


Чому більшість сучасних застосунків стануть безкорисними у добу штучного інтелекту


Mistral AI отримує 830 мільйонів доларів кредиту для будівництва дата-центру в Парижі

