Основи ШІ

Зростання Міксу Експертів: Як Рідкі Моделі Штучного Інтелекту Формують Майбутнє Машинного Навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Моделі Міксу Експертів (MoE) революціонізують спосіб масштабування штучного інтелекту. Активуючи лише підмножину компонентів моделі в будь-який момент часу, MoE пропонують новий підхід до керування компромісом між розміром моделі та обчислювальною ефективністю. На відміну від традиційних щільних моделей, які використовують всі параметри для кожного входу, MoE досягають величезної кількості параметрів, зберігаючи при цьому витрати на обчислення та навчання під контролем. Цей прорив спровокував хвилю досліджень та розробок, що призвело до того, що як технологічні гіганти, так і стартапи вклали значні кошти в архітектури на основі MoE.

Як Працюють Моделі Міксу Експертів

У своїй основі моделі MoE складаються з декількох спеціалізованих підмереж, які називаються “експертами”, під контролем механізму ґейтингу, який вирішує, які експерти повинні обробляти кожен вхід. Наприклад, речення, введене в мовну модель, може активувати лише два з восьми експертів, суттєво зменшуючи обчислювальне навантаження.

Ця концепція була введена в мейнстрім завдяки моделям Switch Transformer і GLaM від Google (GOOGL ), де експерти замінили традиційні фід-форвард-шари в трансформерах. Switch Transformer, наприклад, маршрутизує токени до одного експерта на шар, тоді як GLaM використовує маршрутизацію top-2 для покращення продуктивності. Ці конструкції продемонстрували, що MoE можуть порівняться з щільними моделями, такими як GPT-3, при використанні значно менше енергії та обчислень.

Ключова інновація полягає в умовному обчисленні. Замість активації всієї моделі, MoE активують лише найбільш актуальні частини, що означає, що модель з сотнями мільярдів або навіть трильйонами параметрів може працювати з ефективністю моделі, яка в десятки разів менша. Це дозволяє дослідникам збільшувати потужність без лінійного зростання обчислень, що є неможливим за традиційними методами масштабування.

Практичні Застосування MoE

Моделі MoE вже залишили свій слід у кількох галузях. Моделі GLaM і Switch Transformer від Google показали результати рівня стану мистецтва в мовному моделюванні з нижчими витратами на навчання та висновок. Модель Z-Code MoE від Microsoft (MSFT ) використовується в інструменті Translator, обробляючи понад 100 мов з вищою точністю та ефективністю, ніж попередні моделі. Це не просто дослідницькі проекти – вони живуть у реальних сервісах.

У галузі комп’ютерного бачення архітектура V-MoE від Google покращила точність класифікації на бенчмарках, таких як ImageNet, а модель LIMoE продемонструвала сильну продуктивність у мультимодальних завданнях, що включають як зображення, так і текст. Спроможність експертів спеціалізуватися – деякі обробляють текст, інші – зображення – додає новий рівень можливостей штучного інтелекту.

Системи рекомендацій та платформи багаторазового навчання також виграли від MoE. Наприклад, система рекомендацій YouTube використала архітектуру, подібну до MoE, для обробки цілей, таких як час перегляду та кількість кліків, більш ефективно. Асигнування різних експертів до різних завдань або поведінки користувачів допомагає будувати більш надійні двигуни персоналізації.

Переваги та Виклики

Основна перевага MoE полягає в ефективності. Вони дозволяють тренувати та розгортати величезні моделі з значно меншими обчислювальними витратами. Наприклад, модель Mixtral 8×7B від Mistral AI має 47 млрд параметрів, але активує лише 12,9 млрд на токен, надаючи їй ефективність моделі розміром 13 млрд при конкуренції з моделями типу GPT-3.5 за якістю.

MoE також сприяють спеціалізації. Оскільки різні експерти можуть вивчати різні закономірності, загальна модель стає кращою в обробці різноманітних входів. Це особливо корисно в багатомовних, багатоконтекстних або мультимодальних завданнях, де щільна модель “один розмір для всіх” може показати нижчу продуктивність.

Однак, MoE мають інженерні виклики. їхнє тренування вимагає ретельного балансування для забезпечення ефективного використання всіх експертів. Іншим питанням є накладні витрати на пам’ять – хоча лише частина параметрів активна під час висновку, всі вони повинні бути завантажені в пам’ять. Ефективне розподілення обчислень між GPU або TPU не є тривіальним і призвело до розробки спеціалізованих фреймворків, таких як DeepSpeed від Microsoft та GShard від Google.

Незважаючи на ці перешкоди, переваги продуктивності та витрат є настільки суттєвими, що MoE тепер розглядаються як критичний компонент великомасштабного дизайну штучного інтелекту. По мірі того, як інструменти та інфраструктура дозрівають, ці виклики поступово подолávají.

Як MoE Порівняються з Іншими Методами Масштабування

Традиційне щільне масштабування збільшує розмір моделі та обчислення пропорційно. MoE порушують цю лінійність, збільшуючи загальну кількість параметрів без збільшення обчислень на вхід. Це дозволяє тренувати моделі з трильйонами параметрів на тому самому апаратному забезпеченні, яке раніше було обмежене десятками мільярдів.

У порівнянні з ансамблевим моделюванням, яке також вводить спеціалізацію, але вимагає декілька повних проходів вперед, MoE значно ефективніші. Замість виконання декількох моделей паралельно, MoE виконують лише одну, але з перевагою декількох експертних шляхів.

MoE також доповнюють стратегії, такі як масштабування навчальних даних (наприклад, метод Chinchilla). Хоча Chinchilla підкреслює використання більшої кількості даних з меншими моделями, MoE розширюють потужність моделі, зберігаючи при цьому обчислення стабільними, що робить їх ідеальними для випадків, коли обчислення є вузьким місцем.

Нарешті, хоча техніки, такі як прунінг та квантування, зменшують моделі після тренування, MoE збільшують потужність моделі під час тренування. Вони не є заміною стиснення, а ортогональним інструментом для ефективного зростання.

Компанії, які Простують Революцію MoE

Технологічні Гіганти

Google піонерської більшості сучасних досліджень MoE. Їхні моделі Switch Transformer і GLaM масштабувалися до 1,6 трлн і 1,2 трлн параметрів відповідно. GLaM показала результати на рівні GPT-3, використовуючи лише третину енергії. Google також застосувала MoE до зору (V-MoE) та мультимодальних завдань (LIMoE), що відповідає їхньому більш широкому баченню універсальних моделей штучного інтелекту.

Microsoft інтегрувала MoE у виробництво через свою модель Z-Code в Microsoft Translator. Вони також розробили DeepSpeed-MoE, що дозволяє швидке тренування та низьколатентний висновок для моделей з трильйонами параметрів. Їхні внески включають алгоритми маршрутизації та бібліотеку Tutel для ефективних обчислень MoE.

Meta досліджувала MoE у великомасштабних мовних моделях та системах рекомендацій. Їхня модель MoE розміром 1,1 трлн показала, що вона може порівнятися з щільними моделями за якістю, використовуючи при цьому в 4 рази менше обчислень. Хоча моделі LLaMA є щільними, дослідження Meta щодо MoE продовжує інформувати ширшу спільноту.

Amazon (AMZN ) підтримує MoE через свою платформу SageMaker та внутрішні зусилля. Вони сприяли тренуванню моделі Mixtral від Mistral та, як кажуть, використовують MoE в сервісах, таких як Alexa AI. Документація AWS активно пропагує MoE для великомасштабного тренування моделей.

Huawei і BAAI в Китаї також розробили рекордні моделі MoE, такі як PanGu-Σ (1,085 трлн параметрів). Це демонструє потенціал MoE в мовних та мультимодальних завданнях та підкреслює їхню глобальну привабливість.

Стартапи та Претенденти

Mistral AI є постером інновацій MoE в відкритому джерелі. Їхні моделі Mixtral 8×7B і 8×22B продемонстрували, що MoE можуть перевершити щільні моделі, такі як LLaMA-2 70B, працюючи при цьому з меншими витратами. З понад 600 млн євро фінансування, Mistral робить велику ставку на розріджені архітектури.

xAI, заснована Ілоном Маском, як кажуть, досліджує MoE у своїй моделі Grok. Хоча деталі обмежені, MoE пропонують спосіб для стартапів, таких як xAI, конкурувати з більшіми гравцями без необхідності величезних обчислень.

Databricks, через свою придбану компанію MosaicML, випустила DBRX, відкриту модель MoE, розроблену для ефективності. Вони також пропонують інфраструктуру та рецепти для тренування MoE, знижуючи бар’єр для прийняття.

Інші гравці, такі як Hugging Face, інтегрували підтримку MoE у свої бібліотеки, роблячи простішим для розробників будувати на цих моделях. Навіть якщо вони не будують MoE самостійно, платформи, які їх підтримують, є важливими для екосистеми.

Висновок

Моделі Міксу Експертів не просто тренд – вони представляють фундаментальний зсув у тому, як будуються та масштабуються системи штучного інтелекту. Активуючи лише частини мережі, MoE пропонують потужність величезних моделей без їхньої заборонної вартості. По мірі того, як програмна інфраструктура доходить до рівня та алгоритми маршрутизації покращуються, MoE готуються стати стандартною архітектурою для багатоконтекстних, багатомовних та мультимодальних систем штучного інтелекту.

Хочу ви дослідник, інженер чи інвестор, MoE пропонують погляд у майбутнє, де штучний інтелект стає ще потужнішим, ефективнішим та адаптивним, ніж будь-коли раніше.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.