Моделі та платформи ШІ
xLSTM: Комплексний Посібник з Розширеної Довгої Короткочасної Пам’яті
Більше двох десятиліть архітектура довгої короткочасної пам’яті (LSTM) Сеппа Хохрайтера була інструментальною в численних проривах глибокого навчання та реальних застосуваннях. Від генерації природної мови до забезпечення систем розпізнавання мови, LSTM були рушійною силою за революцією штучного інтелекту.
Однак, навіть творець LSTM визнав їх внутрішні обмеження, які заважали їм реалізувати свій повний потенціал. Недоліки, такі як нездатність переглянути збережену інформацію, обмежені можливості пам’яті та відсутність паралелізму, стали причиною появи моделей трансформерів та інших моделей, які перевершують LSTM для більш складних мовних завдань.
Але в недавньому розвитку Хохрайтер та його команда в NXAI представили нову варіант під назвою розширена LSTM (xLSTM), яка вирішує ці давні проблеми. Представлена в недавній дослідницькій роботі, xLSTM будується на фундаментальних ідеях, які зробили LSTM такими потужними, але вирішує їх ключові слабкості за допомогою архітектурних інновацій.
У центрі xLSTM лежать два нові компоненти: експоненціальне управління та покращені структури пам’яті. Експоненціальне управління дозволяє більш гнучке керування потоком інформації, що дозволяє xLSTM ефективно переглянути рішення при зустрічі з новим контекстом. Тим часом, введення матричної пам’яті суттєво збільшує місткість зберігання порівняно з традиційними скалярними LSTM.
Але покращення не зупиняються там. Використовуючи техніки, запозичені з великих мовних моделей, таких як паралелізм та залишкова укладка блоків, xLSTM можуть ефективно масштабуватися до мільярдів параметрів. Це розблоковує їх потенціал для моделювання надзвичайно довгих послідовностей та контекстних вікнів – це можливість критична для складного мовного розуміння.
Вплив останньої творіння Хохрайтера є монументальним. Уявіть віртуальних асистентів, які можуть надійно відстежувати контекст протягом тривалих розмов. Або мовні моделі, які узагальнюють більш стійко до нових доменів після навчання на широких даних. Застосування охоплюють всюди, де LSTM мали вплив – чат-боти, переклад, мовні інтерфейси, програмний аналіз та багато іншого – але тепер з потужними можливостями xLSTM.
У цьому глибокому технічному посібнику ми зануримося в архітектурні деталі xLSTM, оцінюючи його нові компоненти, такі як скалярні та матричні LSTM, експоненціальні механізми управління, структури пам’яті та багато іншого. Ви отримаєте уявлення з експериментальних результатів, які демонструють вражаючі покращення продуктивності xLSTM над архітектурами стану мистецтва, такими як трансформери та останні рекурентні моделі.
Поняття походження: Обмеження LSTM
Перед тим, як ми зануримося у світ xLSTM, важливо зрозуміти обмеження, з якими традиційні архітектури LSTM зіштовхнулися. Ці обмеження стали рушійною силою за розвиток xLSTM та інших альтернативних підходів.
- Нездатність переглянути рішення про зберігання: Одним з основних обмежень LSTM є їх боротьба з переглядом збережених значень, коли зустрічається більш подібний вектор. Це може привести до субоптимальної продуктивності в завданнях, які вимагають динамічних оновлень збереженої інформації.
- Обмежені можливості зберігання: LSTM стискають інформацію в скалярні стани комірок, що може обмежити їх здатність ефективно зберігати та відновлювати складні шаблони даних, особливо при роботі з рідкісними токенами або довгими залежностями.
- Відсутність паралелізму: Механізм змішування пам’яті в LSTM, який включає приховані-пріховані з’єднання між кроками часу, примушує послідовну обробку, що перешкоджає паралелізму обчислень та обмежує масштабованість.
Ці обмеження стали причиною появи трансформерів та інших архітектур, які перевершують LSTM у певних аспектах, особливо при масштабуванні до більших моделей.
Архітектура xLSTM
У центрі xLSTM лежать дві основні модифікації традиційної архітектури LSTM: експоненціальне управління та нові структури пам’яті. Ці покращення вводять дві нові варіанти LSTM, відомі як sLSTM (скалярний LSTM) та mLSTM (матричний LSTM).
- sLSTM: Скалярний LSTM з експоненціальним управлінням та змішуванням пам’яті
- Експоненціальне управління: sLSTM включає експоненційні активаційні функції для вхідних та забуваних воріт, що дозволяє більш гнучке керування потоком інформації.
- Нормалізація та стабілізація: Для запобігання числових нестабільностей sLSTM вводить нормалізатор стану, який відстежує добуток вхідних воріт та майбутніх забуваних воріт.
- Змішування пам’яті: sLSTM підтримує кілька комірок пам’яті та дозволяє змішування пам’яті через рекурентні з’єднання, що дозволяє витягувати складні шаблони та відстежувати стани.
- mLSTM: Матричний LSTM з покращеними можливостями зберігання
- Матрична пам’ять: Замість скалярної комірки пам’яті mLSTM використовує матричну пам’ять, що збільшує її місткість зберігання та дозволяє більш ефективне відновлення інформації.
- Правило оновлення коваріації: mLSTM використовує правило оновлення коваріації, надихнене асоціативними пам’ятями (BAMs), для зберігання та відновлення ключових пар ефективно.
- Паралелізм: Покинувши змішування пам’яті, mLSTM досягає повного паралелізму, що дозволяє ефективні обчислення на сучасних апаратних прискорювачах.
Ці два варіанти, sLSTM та mLSTM, можуть бути інтегровані в архітектури залишкових блоків, утворюючи блоки xLSTM. Резидуально укладаючи ці блоки xLSTM, дослідники можуть конструктувати потужні архітектури xLSTM, призначені для конкретних завдань та застосунків.
Математика
Традиційний LSTM:
Оригінальна архітектура LSTM ввела постійний карусель помилок та механізми управління для подолання проблеми зникаючого градієнта в рекурентних нейронних мережах.

Повторюваний модуль в LSTM – Джерело
Оновлення стану комірки LSTM керуються наступними рівняннями:
Оновлення стану комірки: ct = ft ⊙ ct-1 + it ⊙ zt
Оновлення прихованого стану: ht = ot ⊙ tanh(ct)
Де:
- 𝑐𝑡 є станом комірки в часі 𝑡
- 𝑓𝑡 є вектором забуваної воріт
- 𝑖𝑡 є вектором вхідної воріт
- 𝑜𝑡 є вектором вихідної воріт
- 𝑧𝑡 є вхідним модульованим вхідною воріт
- ⊙ представляє елементно-місцеве множення
Воріт ft, it та ot контролюють, яка інформація зберігається, забувається та виводиться зі стану комірки ct, що пом’якшує проблему зникаючого градієнта.
xLSTM з експоненціальним управлінням:
Архітектура xLSTM вводить експоненціальне управління для більш гнучкого контролю над потоком інформації. Для варіанту скалярного xLSTM (sLSTM):
Оновлення стану комірки: ct = ft ⊙ ct-1 + it ⊙ zt
Оновлення нормалізатора стану: nt = ft ⊙ nt-1 + it
Оновлення прихованого стану: ht = ot ⊙ (ct / nt)
Вхідні та забувані воріт: it = exp(W_i xt + R_i ht-1 + b_i) ft = σ(W_f xt + R_f ht-1 + b_f) Або ft = exp(W_f xt + R_f ht-1 + b_f)
Експоненційні активаційні функції для вхідних та забуваних воріт, разом з нормалізатором стану nt, дозволяють більш ефективний контроль над оновленнями пам’яті та переглядом збереженої інформації.
xLSTM з матричною пам’яттю:
Для варіанту матричного xLSTM (mLSTM) з покращеними можливостями зберігання:
Оновлення стану комірки: Ct = ft ⊙ Ct-1 + it ⊙ (vt kt^T)
Оновлення нормалізатора стану: nt = ft ⊙ nt-1 + it ⊙ kt
Оновлення прихованого стану: ht = ot ⊙ (Ct qt / max(qt^T nt, 1))
Де:
- 𝐶𝑡 є матричним станом комірки
- 𝑣𝑡 та 𝑘𝑡 є векторами значення та ключа
- 𝑞𝑡 є вектором запиту, використовуваним для відновлення
Ці ключові рівняння підкреслюють, як xLSTM розширює оригінальну формулу LSTM експоненціальним управлінням для більш гнучкого контролю над пам’яттю та матричною пам’яттю для покращених можливостей зберігання. Комбінація цих інновацій дозволяє xLSTM подолати обмеження традиційних LSTM.
Ключові особливості та переваги xLSTM
- Здатність переглянути рішення про зберігання: Завдяки експоненціальному управлінню xLSTM може ефективно переглянути збережені значення при зустрічі з більш актуальною інформацією, подолавши суттєве обмеження традиційних LSTM.
- Покращені можливості зберігання: Матрична пам’ять у mLSTM забезпечує збільшену місткість зберігання, дозволяючи xLSTM ефективніше обробляти рідкісні токени, довгі залежності та складні шаблони даних.
- Паралелізм: Варіант mLSTM xLSTM є повністю паралельним, що дозволяє ефективні обчислення на сучасних апаратних прискорювачах, таких як GPU, та забезпечує масштабованість до більших моделей.
- Змішування пам’яті та відстежування стану: Варіант sLSTM xLSTM зберігає здатність змішування пам’яті традиційних LSTM, що дозволяє відстежувати стан та робить xLSTM більш виразним, ніж трансформери та моделі стану простору для певних завдань.
- Масштабованість: Використовуючи останні техніки з сучасних великих мовних моделей (LLM), xLSTM можуть масштабуватися до мільярдів параметрів, розблоковуючи нові можливості в мовному моделюванні та обробці послідовностей.
Експериментальна оцінка: демонстрація можливостей xLSTM
Дослідницька робота представляє комплексну експериментальну оцінку xLSTM, підкреслюючи її продуктивність у різних завданнях та бенчмарках. Ось деякі ключові висновки:
- Синтетичні завдання та довгий арена:
- xLSTM excels у вирішенні формальних мовних завдань, які вимагають відстежування стану, перевершуючи трансформери, моделі стану простору та інші рекурентні архітектури.
- У завданні асоціативного відгуку xLSTM демонструє покращені можливості пам’яті, перевершуючи не-трансформерські моделі та конкуруючи з продуктивністю трансформерів.
- На бенчмарку довгого арени xLSTM демонструє стійку сильну продуктивність, демонструючи свою ефективність у обробці довгих контекстів.
- Мовне моделювання та завдання нижнього рівня:
- При навчанні на 15 мільярдах токенів з набору даних SlimPajama xLSTM перевершує існуючі методи, включаючи трансформери, моделі стану простору та інші варіанти рекурентних моделей, за перплексією валідації.
- При масштабуванні моделей до більших розмірів xLSTM продовжує зберігати свою продуктивну перевагу, демонструючи сприятливу поведінку масштабування.
- У завданнях нижнього рівня, таких як розуміння спільного відчуття та відповіді на питання, xLSTM виходить найкращим методом у різних розмірах моделей, перевершуючи сучасні підходи.
- Продуктивність на завданнях PALOMA:
- При оцінці на 571 текстових доменах з бенчмарку PALOMA xLSTM[1:0] (варіант sLSTM) досягає нижчих перплексій, ніж інші методи, у 99,5% доменів порівняно з Mamba, 85,1% порівняно з Llama та 99,8% порівняно з RWKV-4.
- Закони масштабування та екстраполяція довжини:
- При навчанні на 300 мільярдах токенів з SlimPajama xLSTM демонструє сприятливі закони масштабування, вказуючи на свій потенціал для подальших покращень продуктивності при збільшенні розмірів моделей.
- У експериментах з екстраполяцією довжини послідовності моделі xLSTM зберігають низькі перплексії навіть для контекстів, суттєво довших, ніж ті, які бачили під час навчання, перевершуючи інші методи.
Ці експериментальні результати підкреслюють вражаючі можливості xLSTM, позиціонуючи її як перспективного претендента для мовного моделювання, обробки послідовностей та широкого спектра інших застосунків.
Реальні застосування та майбутні напрямки
Потенційні застосування xLSTM охоплюють широкий спектр доменів, від обробки природної мови та генерації до моделювання послідовностей, аналізу часових рядів та багатьох інших. Ось деякі захоплюючі області, де xLSTM може зробити суттєвий вплив:
- Мовне моделювання та генерація тексту: З покращеними можливостями зберігання та здатністю переглянути збережену інформацію xLSTM може революціонізувати мовне моделювання та генерацію тексту, дозволяючи більш кохерентну, контекстно-чутливу та плавну генерацію тексту.
- Машинний переклад: Способність xLSTM відстежувати стан може бути невід’ємною у завданнях машинного перекладу, де підтримання контекстної інформації та розуміння довгих залежностей є важливими для точних перекладів.
- Розпізнавання та генерація мови: Паралелізм та масштабованість xLSTM роблять її добре підходящою для застосунків розпізнавання та генерації мови, де ефективна обробка довгих послідовностей є суттєвою.
- Аналіз та прогнозування часових рядів: Способність xLSTM обробляти довгі залежності та ефективно зберігати та відновлювати складні шаблони може привести до суттєвих покращень у завданнях аналізу та прогнозування часових рядів у різних доменах, таких як фінанси, прогнозування погоди та промислові застосування.
- Посилене навчання та системи контролю: Потенціал xLSTM у посиленому навчанні та системах контролю є перспективним, оскільки її покращені можливості пам’яті та відстежування стану можуть забезпечити більш інтелектуальне прийняття рішень та контроль у складних середовищах.
Оптимізації архітектури та налаштування гіперпараметрів
Хоча поточні результати є перспективними, все ще є місце для оптимізації архітектури xLSTM та налаштування її гіперпараметрів. Дослідники можуть досліджувати різні комбінації блоків sLSTM та mLSTM, варіюючи їх співвідношення та розміщення всередині загальної архітектури. Крім того, систематичний пошук гіперпараметрів може привести до подальших покращень продуктивності, особливо для більших моделей.
Оптимізації, залежні від апаратного забезпечення: Для повного використання паралелізму xLSTM, особливо варіанту mLSTM, дослідники можуть досліджувати оптимізації, залежні від апаратного забезпечення, спеціально розроблені для певних архітектур GPU або інших прискорювачів. Це може включати оптимізацію ядер CUDA, стратегії управління пам’яттю та використання спеціалізованих інструкцій або бібліотек для ефективних матричних операцій.
Інтеграція з іншими компонентами нейронної мережі: Дослідження інтеграції xLSTM з іншими компонентами нейронної мережі, такими як механізми уваги, конволюції або техніки самоорганізованого навчання, може привести до гібридних архітектур, які поєднують сильні сторони різних підходів. Ці гібридні моделі потенційно можуть розблокувати нові можливості та покращити продуктивність у широкому спектрі завдань.
Навчання з少шими даними та перенос навчання: Дослідження використання xLSTM у сценаріях навчання з少шими даними та переносу навчання може бути захоплюючим напрямком майбутніх досліджень. Використовуючи її покращені можливості пам’яті та відстежування стану, xLSTM потенційно може забезпечити більш ефективний перенос знань та швидку адаптацію до нових завдань або доменів з обмеженими навчальними даними.
Тлумачення та пояснюваність: Як і у випадку з багатьма моделями глибокого навчання, внутрішня робота xLSTM може бути не прозорою та складною для тлумачення. Розробка технік для тлумачення та пояснення рішень, прийнятих xLSTM, може привести до більш прозорих та надійних моделей, що полегшить їх прийняття у критичних застосуваннях та забезпечить підзвітність.
Ефективні та масштабовані стратегії навчання: При зростанні розмірів моделей ефективні та масштабовані стратегії навчання стають все більш важливими. Дослідники можуть досліджувати техніки, такі як паралельне навчання, розподілене навчання та підходи, спеціально розроблені для архітектур xLSTM, що дозволить навчати ще більші моделі та потенційно зменшити обчислювальні витрати.
Це лише деякі потенційні напрямки майбутніх досліджень та області для подальшого дослідження з xLSTM.
Висновок
Введення xLSTM позначає суттєвий рубіж у пошуках більш потужних та ефективних архітектур мовного моделювання та обробки послідовностей. Подолавши обмеження традиційних LSTM та використовуючи нові техніки, такі як експоненціальне управління та матричні структури пам’яті, xLSTM продемонструвала вражаючу продуктивність у широкому спектрі завдань та бенчмарків.
Однак, шлях не закінчується тут. Як і у випадку з будь-якою революційною технологією, xLSTM представляє захоплюючі можливості для подальшого дослідження, уточнення та застосування у реальних сценаріях. При подальшому розвитку цієї галузі ми можемо очікувати ще більш вражаючих досягнень у сфері обробки природної мови та штучного інтелекту.
















