Моделі та платформи ШІ

BlackMamba: Мішання Експертів для Моделей Державного Простору

mm
Додайте Unite.AI до бажаних джерел у Google

Розробка великих мовних моделей (LLM) на основі моделей трансформерів з декодером тільки грає важливу роль у трансформації області обробки природної мови (NLP), а також у розвитку різних застосунків глибокого навчання, включаючи підкріплення навчання, аналіз часових рядів, обробку зображень та багато іншого. Однак, незважаючи на свою масштабованість і сильну продуктивність, LLM, побудовані на основі моделей трансформерів з декодером тільки, все ще зустрічають значні труднощі. Хоча вони виразні, механізм уваги в моделях трансформерів, похідних від LLM, вимагає великих обчислювальних ресурсів під час як інференсу, так і навчання, що потребує великої кількості пам’яті для довжини послідовності та квадратичних операцій (FLOPs). Це високе обчислювальне вимог обмежує довжину контексту моделей, підвищує вартість автoreгенеративних завдань генерації при масштабуванні моделі та перешкоджає здатності моделей навчатися з безперервних потоків даних та обробляти послідовності необмеженої довжини ефективно.

Нещодавно Моделі Державного Простору (МДП) продемонстрували видатні можливості та продуктивність, конкуруючи з моделями архітектури трансформерів у великомасштабних бенчмарках моделювання, а також досягаючи лінійної складності пам’яті щодо довжини послідовності та лінійного часу. Крім того, Mamba, недавно випущена Модель Державного Простору, продемонструвала видатну продуктивність у ряді завдань моделювання мови та обробки довгих послідовностей. Одночасно Моделі Мішання Експертів (ММЕ) також продемонстрували вражаючу продуктивність, суттєво знижуючи затримку та обчислювальні витрати інференсу, хоча й за рахунок збільшення пам’яті. Будуючи на Mamba та ММЕ, ця стаття обговорює BlackMamba, нову архітектуру, яка поєднує Модель Державного Простору Mamba з Моделями Мішання Експертів, щоб використати переваги обох框. Експерименти з BlackMamba продемонстрували її здатність перевершити існуючу рамку Mamba та базові моделі трансформерів як у навчанні FLOPs, так і в інференсі. Видатна продуктивність рамки BlackMamba показує, що вона може ефективно поєднувати можливості рамок Mamba та ММЕ, пропонуючи швидку та економічну інференсу з ММЕ з лінійно-складною генерацією з Mamba.

Ця стаття має на меті охопити рамку BlackMamba докладно. Ми досліджуємо механізм, методологію та архітектуру рамки, а також її порівняння з найкращими框ами генерації зображень та відео. Давайте почнемо.

BlackMamba: Введення у Мішання Експертів для Моделей Державного Простору

Розвиток великих мовних моделей (LLM), особливо тих, що базуються на архітектурі трансформерів з декодером тільки, суттєво вплинув на область обробки природної мови (NLP) та розширився до різних застосунків глибокого навчання, включаючи підкріплення навчання, аналіз часових рядів, обробку зображень та багато іншого. Однак, незважаючи на свою масштабованість та сильну продуктивність, ці моделі трансформерів з декодером тільки все ще зустрічають суттєві труднощі. Механізм уваги, ключова особливість моделей трансформерів, вимагає великих обчислювальних ресурсів під час як інференсу, так і навчання. Це涉ує потребу у пам’яті, яка зростає з довжиною послідовності та обчислювальними операціями (FLOPs), які зростають квадратично. Такі інтенсивні обчислювальні потреби обмежують довжину контексту моделей, підвищують вартість автoreгенеративних завдань генерації при масштабуванні моделі та перешкоджає здатності моделей навчатися з безперервних потоків даних або обробляти послідовності необмеженої довжини ефективно.

Значні зусилля були зроблені за останні кілька років, щоб подолати ці обмеження, і увага була зосереджена на розробці архітектурних альтернатив канонічним густих моделям уваги трансформерів з Моделями Державного Простору та Моделями Мішання Експертів, які є найбільш перспективними кандидатами на архітектури. Ключова перевага, яку дають Моделі Державного Простору над моделями архітектури трансформерів, полягає у лінійній обчислювальній складності щодо довжини вхідної послідовності, яку пропонують МДП, на відміну від квадратичної складності, яку пропонують трансформери. Теоретично, лінійна обчислювальна складність щодо довжини вхідної послідовності дозволяє Моделям Державного Простору обробляти більші послідовності, ніж моделі архітектури трансформерів, для заданого бюджету FLOPS або операцій з плаваючою точкою в секунду, та надає автoreгенеративну генерацію постійну у обчислювальних витратах без кешу KV. Недавно розроблені Моделі Державного Простору, включаючи RWKV та Mamba, продемонстрували ефективну обробку довгих послідовностей та навчання, а також конкурентоспроможну продуктивність завдань моделювання мови до трансформерів з аналогічними властивостями масштабування. З іншого боку, Моделі Мішання Експертів набувають популярності як альтернатива густим трансформерам, оскільки вони забезпечують суттєве зниження інференсу та навчальних FLOPs, необхідних для досягнення порівняльної якості з густою моделлю. Моделі Мішання Експертів працюють шляхом активації лише розрідженої вибірки з загальної кількості параметрів під час одного прямого проходу. Вони використовують функцію маршрутизації для визначення, які “експерти” викликаються у дію на основі заданого контексту. Цей підхід створює розмежування між обчислювальними витратами інференсу та загальною кількістю параметрів, що дозволяє підвищити продуктивність у фіксованому бюджеті інференсу, хоча й за рахунок збільшення кількості параметрів та більших вимог до пам’яті.

Цей підхід пропонує суттєві переваги над традиційними трансформерами та представляє цікавий напрямок для подальшого розвитку. Ми припускаємо, що інтеграція цих вдосконалень у поєднану модель Mamba-ММЕ може суттєво прискорити можливості моделювання мови та ефективність за межами стандартних моделей трансформерів. Очікувані переваги архітектури Mamba-ММЕ порівняно з традиційною густою моделлю трансформерів включають:

Mamba: Досягає лінійної обчислювальної складності щодо довжини вхідної послідовності для фаз навчання та інференсу. Це дозволяє автoreгенеративній генерації відбуватися у постійному часовому інтервалі та з постійним використанням пам’яті.

ММЕ: Надає швидкість інференсу та ефективність навчання, порівнянну з меншою, густою базовою моделлю, зберігаючи рівень якості моделі, який конкурує з моделлю з еквівалентною кількістю параметрів, як у густішої версії.

З урахуванням цього, важливо зазначити, що моделі архітектури трансформерів все ще є найкращими, і продемонстрували стабільну та вражаючу продуктивність у завданнях моделювання мови та обробки послідовностей. У своїй основі архітектура трансформерів використовує самовагу, яка здійснює квадратичне порівняння між добутками схожості між вкладеннями різних токенів у послідовності, та здійснює лінійну карту до вихідного вектора. Модель трансформатора складається з блоків самоваги, розміщених між блоками MLP (Мульті-Лayer Перцептрон), які складаються з двошарового MLP з заданою функцією активації.

BlackMamba: Архітектура та Методологія

Моделі Державного Простору

Моделі Державного Простору належать до групи моделей послідовностей з лінійною складністю щодо довжини вхідної послідовності. Архітектура Моделей Державного Простору більш відповідає рекурентним нейронним мережам та конволюційним нейронним мережам, ніж архітектурі, заснованій на увазі, та заснована на безперервній динамічній системі, яка відображає одновимірну функцію через неявний латентний простір. Лінійна динамічна система робить паралельні обчислення ефективними за допомогою асоціативного чи конволюційного скану. На практиці, рекурентна природа Моделей Державного Простору була причиною, чому вони ще не були прийняті на високопаралельному апаратному забезпеченні, таким як GPU. Однак появою Моделей Державного Простору, таких як RWKV та Mamba, було використано паралельні ядра сканування для ефективного відображення рекурентних операцій на GPU, що дозволило тренувати нові архітектури з ефективністю, порівнянною з тією, яку досягають моделі трансформерів.

Внутрішня квадратична складність щодо довжини послідовності у трансформерах є добре відомим обмеженням, яке перешкоджає розумінню та сприйняттю над дуже довгими контекстами. Недавні інновації ввели ідею розширення довжини контексту, що дозволяє тренувати трансформери на прийнятному масштабі перед застосуванням їх до значно довших контекстів під час інференсу. Однак, незважаючи на ці досягнення, процес інференсу все ще вимагає великої кількості обчислювальних ресурсів та пам’яті, особливо для підтримання кешу Key-Value (KV), що робить його ресурсоємним завданням. Недавні дослідження були спрямовані на підвищення виразних можливостей Моделей Державного Простору шляхом включення залежних від входу механізмів ґейтингу, подібних до матриць QKV, знайдених у механізмах уваги.

Ці зусилля спрямовані на збереження внутрішньої лінійної прогресії рекурсії державного простору, що дозволяє виконувати ефективні обчислення за допомогою або конволюції, або вибіркового скану. Цей підхід суттєво звужує розрив у продуктивності з трансформерами у практичних застосунках. Серед цих досягнень, Mamba виділяється як Модель Державного Простору, яка віддзеркалює цілі попередніх досліджень, демонструючи вражаючу продуктивність, порівнянну з трансформерами у масштабах до 2,8 мільярдів параметрів. Це досягається шляхом застосування залежного від входу ґейтингу до входів рекурсії Моделі Державного Простору (МДП), зберігаючи при цьому ефективні обчислення за допомогою спеціальних вибіркових ядер сканування.

Моделі Мішання Експертів

Моделі Мішання Експертів досягають розмежування між витратами інференсу та загальною кількістю параметрів шляхом вибіркової активації параметрів під час прямого проходу. Замість використання всіх параметрів, ці моделі направляють токени до конкретних експертів MLP. Ідеально, кожен експерт призначений для обробки певного типу входу, з механізмом маршрутизації, який є компактною нейронною мережею, що визначає найбільш підходящого експерта для кожного токену. Цей підхід спрямований на збереження повної виразної сили моделі з еквівалентною кількістю параметрів у густішій конфігурації, але з суттєво зменшеними обчислювальними витратами. Зазвичай, маршрутизатор є відображенням лінійних шарів від токенів до індексів експертів, з кожним експертом, який є стандартним трансформерним MLP. Однак розробникам ще належить визначити оптимальний метод тренування маршрутизатора, оскільки проблема призначення експерта є недиференційованою, а Моделі Мішання Експертів часто стикаються з проблемами балансування та стабільності тренування між різними експертами для апаратної ефективності.

Архітектура

У своїй основі BlackMamba використовує стандартну модель трансформера, що складається з чергових блоків MLP та блоків уваги, доданих послідовно вздовж залишкової потоку. Тепер, більшість Моделей Мішання Експертів просто замінюють блоки MLP на шар експертів з маршрутизацією. З іншого боку, рамка BlackMamba не тільки замінює блок MLP у трансформері на шар експертів з маршрутизацією, але також замінює шар уваги на шар Моделі Державного Простору Mamba. Архітектура рамки BlackMamba демонструється на наступній фігурі.

Навчання та Дані

Модель BlackMamba тренується на понад 300 мільярдів токенів на спеціальному наборі даних, та використовує активаційну функцію SwiGLU для експертних MLP. Рамка тренується з 8 експертами, кількість, яку розробники визначили як правильний баланс між пам’яттю та витратами інференсу моделі. Спеціальний набір даних, використаний для тренування рамки BlackMamba, складається з суміші вже існуючих відкритих джерел даних, включаючи Starcoder, SlimPajama, Pile та багато іншого. Наступна таблиця демонструє ваги кожного набору даних, використаних для тренування рамки BlackMamba. Загалом, у наборі даних міститься 1,8 трильйона токенів.

BlackMamba: Результати

Для забезпечення справедливого порівняння між Mamba та BlackMamba, розробники тренували обидві моделі з одними й тими ж параметрами тренування на одних й тих же тренувальних даних. Рамка BlackMamba здатна перевершити як Mamba, так і моделі трансформерів для ідентичного розміру моделі прямого проходу під час інференсу, а також тренування FLOPs. Наступна фігура демонструє час, необхідний для генерації послідовності заданої довжини автoreгенеративно з початкового однотокенного запуску як функцію довжини послідовності.

Крім того, переваги затримки обох Моделей Мішання Експертів та Mamba моделей поєднуються у рамці BlackMamba, що результатує у суттєво швидших часах інференсу при порівнянні з моделями трансформерів, чистими моделями Mamba, та Моделями Мішання Експертів. Крім того, перевага інференсу рамки BlackMamba прямо пропорційна довжині послідовності, що робить BlackMamba надзвичайно ефективною для генерації довгих послідовностей. Далі, наступна фігура ілюструє кількість токенів, призначених моделям BlackMamba з 340 мільйонами та 640 мільйонами параметрів відповідно. Як можна побачити, більшість шарів демонструють високий рівень балансування експертів у результаті вдосконаленого алгоритму Sinkhorn, реалізованого моделями BlackMamba.

Наступна таблиця охоплює оціночні бали рамки BlackMamba порівняно з рядом відкритих попередньо тренованих мовних моделей. Як можна побачити, рамка BlackMamba здатна конкурувати та перевершити більшість рамок у всіх базових показниках. Крім того, варто зазначити, що моделі, які перевершують BlackMamba, мають суттєво більшу кількість параметрів, а розрив у продуктивності мінімальний, що вказує на здатність рамки BlackMamba з меншою кількістю параметрів.

Фінальні Думки

У цій статті ми говорили про BlackMamba, нову архітектуру, яка поєднує Модель Державного Простору Mamba з Моделями Мішання Експертів, щоб використати переваги обох цих рамок. Експерименти з BlackMamba продемонстрували її здатність перевершити існуючу рамку Mamba та базові моделі трансформерів як у навчанні FLOPs, так і в інференсі. Видатна продуктивність рамки BlackMamba показує, що вона може ефективно поєднувати можливості рамок Mamba та ММЕ, пропонуючи швидку та економічну інференсу з ММЕ з лінійно-складною генерацією з Mamba. Ми говорили про те, як архітектура рамки BlackMamba здатна перевершити сильні треновані великі мовні моделі, існуючу рамку Mamba, та Моделі Мішання Експертів у термінах тренування FLOPs та витрат інференсу. Крім того, рамка BlackMamba також успадковує генерацію FLOPs та знижене тренування з обох Моделей Мішання Експертів та рамки Mamba одночасно.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.