Моделі та платформи ШІ

Стіна GPU розсипається: Невидима революція в пост-трансформерних архітектурах

mm
Додайте Unite.AI до бажаних джерел у Google

За останні п’ять років галузь штучного інтелекту була фактично синонімом одного слова: Трансформер. Від часу виходу семінальної статті “Attention Is All You Need” у 2017 році, ця архітектура поглинула галузь. Від GPT до Claude, майже кожна модель, яка привертає увагу, використовує той самий основний механізм самоуваги. Ми здебільшого припускали, що шлях до кращого штучного інтелекту полягає просто у збільшенні масштабу. На практиці це означає навчання більших Трансформерів з більшим обсягом даних на більших кластерах GPU.

Хоча ця віра призвела до багатьох проривів, вона тепер досягає своїх меж. Ми натикаємося на “Стіну GPU”, бар’єр не тільки суто обчислювальної потужності, але й пам’яті та економічної життєздатності. Хоча світ зосереджується на перегонах за моделі з трильйонами параметрів, радикальна зміна відбувається в дослідницьких лабораторіях. Нова хвиля “пост-трансформерних архітектур” з’являється, щоб розбити обмеження поточної парадигми. Ця зміна обіцяє зробити штучний інтелект більш ефективним, доступним та здатним розуміти контекст без обмежень.

Кремнієва стеля: Чому Трансформери натикаються на стіну

Щоб зрозуміти, чому нам потрібна зміна, ми спочатку повинні зрозуміти вузьке місце поточної системи. Трансформери неймовірно потужні, але вони також неймовірно неефективні певним чином. Серцевина їхньої здатності лежить у “механізмі уваги”, який дозволяє моделі дивитися на кожен токен у послідовності та обчислювати його відносини з кожним іншим токеном. Це дає їм здатність розуміти контекст неймовірно добре.

Однак, ця здатність супроводжується фатальним дефектом квадратичного зростання. Якщо ви подвоїте довжину документа, який хочете прочитати штучний інтелект, обчислювальна робота, яка необхідна, не просто подвоюється, а квадруплікується. Коли ми прагнемо до моделей “безкінечного контексту”, які можуть читати цілі бібліотеки чи кодові бази, обчислювальні вимоги стають дуже високими.

Але більш негайною проблемою є пам’ять, зокрема “KV Cache” (Кеш ключ-значення). Щоб генерувати текст плавно, Трансформер повинен зберігати поточну історію всього, що він тільки що сказав у високошвидкісній пам’яті GPU (VRAM). Коли розмова триває, цей кеш розбухає, споживаючи величезну кількість пам’яті просто для того, щоб пам’ятати, що відбулося три абзаци тому.

Це створює “Стіну GPU”. Ми не просто не маємо достатньо мікросхем; ми не маємо достатньої пропускної здатності пам’яті, щоб годувати їх. Ми побудували двигуни, які стають більші й більші, але вони стають неможливими для палива. Протягом тривалого часу рішенням галузі було просто купувати більше NVIDIA H100 (NVDA ). Але ця груба сила досягає точки зменшення доходності. Нам не потрібен двигун, який споживає паливо квадратично, а нова архітектура.

Невидима революція

Хоча основні дослідження були зосереджені на великих мовних моделях, група дослідників переглянула стару ідею: Рекурентні нейронні мережі (RNN). До Трансформерів RNN були стандартом для мови. Вони обробляли текст послідовно, слово за словом, оновлюючи приховане внутрішнє “стан” по ходу. Вони були неймовірно ефективними, оскільки їм не потрібно було дивитися назад на всю історію; їм достатньо було нести “істоту” її у своїй пам’яті.

RNN зазнали поразки, оскільки вони не могли впоратися з довгими залежностями; вони “забували” початок речення до того, як досягали кінця. Вони також були повільними у навчанні, оскільки їх не можна було паралелізувати. Це означало, що вам потрібно було обробити слово А до того, як ви могли обробити слово Б. Трансформери вирішили цю проблему, обробляючи все одночасно (паралелізуючи) та зберігаючи все у пам’яті (увага).

Тепер ми свідчимо появу архітектур, які поєднують найкраще з обох світів. Ці архітектури відомі як Моделі стану простору (SSM). Вони пропонують швидкість навчання Трансформерів (паралелізовані) та ефективність висновку RNN (лінійне масштабування).

Однією з видатних архітектур цієї нової хвилі є Mamba. Видача у кінці 2023 року та доопрацювання протягом 2024 року, Mamba являє собою фундаментальну зміну того, як моделі обробляють інформацію. На відміну від Трансформера, який зберігає оригінальну копію кожного слова, яке він коли-небудь бачив у своєму буфері пам’яті, Mamba використовує “вибірковий простір стану”.

Ми можемо зрозуміти різницю між Трансформером та Mamba, уявляючи Трансформер як ученого, який тримає кожну книгу, яку він коли-небудь читав, відкритою на величезному столі, постійно скануючи туди й назад, щоб знайти зв’язки. Mamba, з іншого боку, є ученим, який читає книгу один раз і стискає ключові ідеї у високо-ефективний блокнот. Коли Mamba генерує наступне слово, йому не потрібно дивитися назад на сирій текст; йому достатньо дивитися на свій стиснутий стан.

Ця відмінність змінює економіку розгортання штучного інтелекту. З Mamba та подібними архітектурами, такими як RWKV (Receptance Weighted Key Value), вартість генерації тексту не вибухає, коли послідовність триває. Ви можете теоретично годувати ці моделі мільйоном слів контексту, і обчислювальна вартість генерації наступного токену залишається такою самою, як і при годуванні десятьма словами.

Повернення рекурентності

Технічний прорив за Mamba полягає у “вибірковості”. Попередні спроби модернізувати RNN зазнали поразки, оскільки вони були надто жорсткими. Вони стискали інформацію однаково, незалежно від того, чи була вона важливою, чи шумом. Mamba вводить механізм, який дозволяє моделі динамічно вирішувати, що пам’ятати, а що забувати під час потокової обробки даних.

Якщо модель отримує важливу інформацію, наприклад визначення змінної у кодовому блоці, вона “відкриває ворота” та записує її сильно у свій стан. Якщо вона стикається з зайвими словами чи неважливим шумом, вона закриває ворота, зберігаючи свій обмежений потенціал пам’яті для того, що має значення.

Ця вибірковість ефективно вирішує проблему “забування”, яка викликала труднощі у старих RNN. У багатьох тестах моделі на основі Mamba відповідають результатам Трансформерів такого самого розміру, але працюють у п’ять разів швидше під час висновку. Що ще важливіше, їхні відбитки пам’яті значно менші. Це відкриває двері для високопродуктивних великих мовних моделей, які можуть працювати на пристроях, які раніше вважалися нездатними їх обробляти, таких як ноутбуки, мережі країв або навіть смартфони, без вивантаження у хмару.

Ми також свідчимо появу Hyena, іншої суб-квадратичної архітектури, яка використовує довгі конволюції для обробки даних. Як і Mamba, Hyena спрямована на видалення важких “шарів уваги” Трансформера та заміну їх математичними операціями, які значно дешевші для апаратури. Ці моделі вже почали викликати інкумбентам Трансформерів у головних таблицях лідерів.

Поява гібридів

Революція, однак, може не бути повною заміною Трансформера, а радше еволюцією у гібридні форми. Ми вже бачимо появу моделей, таких як Jamba (від AI21 Labs), які поєднують шари Трансформера з шарами Mamba.

Цей гібридний підхід пропонує практичний спосіб вирішення обмежень Трансформера. Трансформери залишаються винятково сильними у певних завданнях, особливо для копіювання точних деталей з контексту. Поєднуючи шари Mamba (які обробляють більшу частину даних та довготривалу пам’ять) з декількома шарами уваги Трансформера (які обробляють гостру, негайну логіку), ми отримуємо модель, яка поєднує найкраще з обох світів.

Гібридна модель створює величезне вікно контексту, яке насправді можна використовувати. Наразі багато “довгих контекстів” Трансформерів стверджують, що можуть обробляти 100 000 токенів, але їхня продуктивність швидко погіршується, коли контекст заповнюється. Це явище відоме як “загублене у середині“. Гібридна архітектура підтримує свою спроможність значно краще на великих відстанях, оскільки шари SSM спеціально розроблені для стиснення та переносу стану з часом.

Ці розробки зсувають фокус галузі з “Обчислювальної потужності” (який кластер потрібно побудувати для моделі?) на “Економіку висновку” (як дешево можна служити цій моделі мільярду користувачів?). Якщо гібридна модель може служити користувачеві за 10% вартості Трансформера, бізнес-кейс для застосунків штучного інтелекту змінюється за одну ніч.

Майбутнє розгортання штучного інтелекту

Вплив цієї пост-трансформерної революції не обмежується лише центром даних. Стіна GPU історично служила охоронцем, забезпечуючи, що тільки найбільші технологічні гіганти з мільярдами доларів у апаратурі могли побудувати та запустити моделі найвищого рівня. Ефективні архітектури, такі як Mamba та RWKV, демократизують цю силу. Якщо ви можете запустити модель рівня GPT-4 на споживчій карті, тому що вам вже не потрібно терабайт VRAM для кешу ключ-значення, центральний контроль штучного інтелекту починає слабшати. Ми могли б побачити відродження локальних, приватних агентів штучного інтелекту, які живуть повністю на вашому комп’ютері, обробляючи ваші приватні дані без відправлення пакету у хмару.

Крім того, ця ефективність є ключем до розблокування “Агентських систем штучного інтелекту“, які працюють на задньому плані годинами або днями, щоб завершити складні завдання. Поточні Трансформери занадто дорогі та повільні, щоб працювати у безперервних циклах протягом тривалого часу. Ефективна, лінійна архітектура може “думати” та обробляти цикли безперервно без банкрутства користувача чи перегріву апаратури.

Резюме

Трансформер домінував у заголовках штучного інтелекту, але за кулисами тиха революція відбувається. Стіна GPU змушує дослідників переглянути, як моделі обробляють пам’ять та обчислення. Пост-трансформерні архітектури, такі як Mamba та гібридні моделі, доводять, що ефективність, а не тільки масштаб, визначатиме наступну епоху. Ці інновації роблять величезні вікна контексту практичними, висновок дешевшим та просунутий штучний інтелект доступним за межами центрів даних. Майбутнє штучного інтелекту лежить не у більших моделях, а у розумніших, які пам’ятають, розуміють та масштабуються ефективно.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.