Моделі та платформи ШІ
MoE-LLaVA: Комбінація експертів для великих моделей мови та зору
Нещодавні досягнення в галузі великих моделей мови та зору (LVLMs) показали, що масштабування цих структур значно підвищує продуктивність за різними завданнями. LVLMs, включаючи MiniGPT, LLaMA та інші, досягли видатних можливостей завдяки інтеграції візуальних проєкційних шарів та зображення у свою архітектуру. Реалізуючи ці компоненти, LVLMs підвищують візуальні сприймальні можливості великих мовних моделей (LLMs). Продуктивність можна ще більше покращити, збільшуючи розмір моделі та кількість параметрів, а також розширюючи масштаб набору даних.
Моделі, такі як InternVL, розширили свій зображувальний кодувальник до понад 6 мільярдів параметрів, тоді як інші розширили бекенд LVLM до 13 мільярдів параметрів, досягнувши вищої продуктивності за широким спектром завдань. IDEFICS навчила LVLM з понад 80 мільярдами параметрів. Ці методи масштабування дозволили досягти або перевершити продуктивність LLMs, попередньо натренованих на понад 34, 70 або навіть 100 мільярдів параметрів. Однак масштабування має свою негативну сторону: воно суттєво збільшує витрати на навчання та висновок. Це відбувається через те, що для кожного токену в обчисленнях необхідно активація всіх параметрів, що призводить до високих обчислювальних потреб та, як наслідок, вищих витрат.
Ця стаття розглядає MoE-LLaVA, архітектуру великої моделі мови та зору на основі комбінації експертів (MoE), яка використовує ефективну стратегію навчання, MoE-Tuning, для LVLM. MoE-Tuning інноваційно вирішує проблему погіршення продуктивності при багатомодальній вивченні розрідженості, що призводить до моделі з великою кількістю параметрів, але з постійними витратами на навчання та висновок. Архітектура MoE-LLaVA спроєктована так, щоб під час розгортання активації лише верхніх-k експертів, залишаючи інші неактивними.
Ми розглянемо.framework MoE-LLaVA, вивчаючи його механізм, методологію, архітектуру та те, як він порівнюється з провідними моделями генерації зображень та відео.
MoE-LLaVA: Масштабування великих моделей мови та зору за прийнятною ціною
Крім використання візуальних проєкційних шарів та зображувальних кодувальників, великі моделі мови та зору також масштабують розмір моделі, збільшуючи кількість параметрів для покращення продуктивності моделі. Наприклад, MiniGPT-4, InternGPT, InternVL та інші великі моделі мови та зору слідували цьому підходу для покращення продуктивності. У реальних застосуваннях масштабування великої мовної моделі або великої моделі мови та зору з високоякісними навчальними даними часто стає необхідністю для покращення продуктивності моделі. Хоча масштабування моделі покращує продуктивність, воно також збільшує обчислювальні витрати на навчання та розгортання моделі, а також збільшує складність та ефективність розгортання моделі на паралельних пристроях одночасно. Основною причиною підвищення витрат на навчання та висновок, а також обчислювальних вимог, є те, що кожен токен у рамках вимагає обчислень з кожним параметром моделі, відомим як щільна модель.
З іншого боку, розріджені моделі комбінації експертів (MoE) продемонстрували ефективне масштабування структур шляхом обробки даних за допомогою фіксованих активованих параметрів, підходу, який широко застосовується в галузі обробки природної мови. Однак використання комбінації експертів для прямого навчання розріджених великих моделей мови та зору є складним, оскільки перетворення LLMs у LVLMs та розрідження моделі одночасно призводить до суттєвого погіршення продуктивності. Для реалізації комбінації моделей для масштабування LLMs та LVLMs необхідно спочатку ініціалізувати LVLM для розрідження. Для цього framework MoE-LLaVA вводить MoE-Tuning, просту, але ефективну трифазну стратегію навчання.

Як показано на вищезазначеній схемі, процес MoE-Tuning спочатку тренує багатошаровий перцептрон, який адаптує візуальні токени до великої мовної моделі на першому етапі. Потім framework тренує всі параметри LLM, щоб попередньо наділити велику модель мови та зору загальними багатомодальними можливостями розуміння. Нарешті, на третьому етапі framework повторно використовує багатошаровий перцептрон як ваги ініціалізації для експертів та тренує лише шари комбінації експертів. Загалом, процес навчання допомагає у поступовому переході розрідженої моделі від ініціалізації LVLM до розрідженої комбінації експертів.
Після розгляду процесу навчання давайте розглянемо MoE-LLaVA, базову модель великої моделі мови та зору з комбінацією експертів, яка включає навчальні роутери та моделі комбінації експертів. У своєму ядрі модель MoE-LLaVA складається з декількох розріджених шляхів, а framework використовує ці шляхи для направлення кожного токену до різних експертів через навчений роутер. Токени потім обробляються колективно активованими експертами, залишаючи неактивні шляхи тихими. Потім framework укладає шари кодувальника комбінації експертів ітеративно, щоб забезпечити розріджений шлях до більшої та потужнішої LVLM.

Дякуючи підходу, реалізованому framework MoE-LLaVA, він здатний перевершити моделі з подібною кількістю активованих параметрів та значно перевершити їх на бенчмарку POPE для об’єктної галюцинації, незважаючи на те, що має лише 2,2 мільярди параметрів. Крім того, framework MoE-LLaVA з 2,2 мільярдами параметрів здатний досягти продуктивності, порівнянної з.framework InternVL-Chat-19B з майже у вісім разів більшим числом активованих параметрів.
Потужні великі мовні моделі з сильними можливостями узагальнення та виконання інструкцій були реалізовані для великих моделей мови та зору. Ранні LLMs, такі як BLIP, закодували візуальні сигнали у послідовність візуальних токенів, дозволяючи їм успішно адаптувати зір до LLMs за допомогою кількох проєкційних шарів. Тим часом останні роботи зосереджені на покращенні продуктивності моделі шляхом реалізації методів, таких як розширення набору даних для налаштування інструкцій, збільшення роздільної здатності зображення, оптимізація стратегій навчання, вирівнювання вхідних даних, покращення зображувальних кодувальників та багато іншого. Ці підходи допомогли наділити великі моделі мови та зору потужними візуальними можливостями розуміння шляхом розширення візуального набору даних для налаштування інструкцій та масштабу моделі. Крім того, деякі великі моделі мови та зору також володіють тонкими можливостями розуміння зображень, такими як регіональне та багаторегіональне розуміння, а також можливістю піксельного ґрунтування. Однак обчислювальні витрати, пов’язані з масштабуванням густої візуальної інформації та моделей, часто дуже високі, що робить їх складними у використанні. З іншого боку, framework MoE-LLaVA спрямований на те, щоб зробити дослідження великих моделей мови та зору більш доступними завдяки використанню можливостей моделей комбінації експертів.
MoE-LLaVA: Методологія та архітектура
У своєму ядрі framework MoE-LLaVA складається з візуального проєкційного шару (багатошаровий перцептрон), зображувального кодувальника, блоків комбінації експертів, декількох укладених блоків LLM та шару вкладення слів.

Архітектура
Наступна таблиця підсумовує детальні конфігурації framework MoE-LLaVA.

Для заданого RGB-зображення зображувальний кодувальник обробляє зображення для отримання послідовності візуальних токенів з візуальним проєкційним шаром, який відображає послідовність візуальних токенів у вхідні зображення. Вхідні тексти обробляються шаром вкладення слів, який потім проєктує їх у послідовність токенів. Тим часом framework MoE-LLaVA пов’язує тексти та візуальні токени разом та годує їх у LLM. Однак framework тренує лише візуальний проєкційний шар з великою мовною моделлю, що складається з багатошарового перцептрону (FFN) та шарів багатомодального самообслуговування. Нарешті, framework застосовує залишкові зв’язки та нормалізацію шарів до кожного блоку.
Далі, framework MoE-LLaVA повторно використовує багатошаровий перцептрон з другого етапу для формування ансамблю експертів як процедури ініціалізації. Роутер, який є лінійним шаром, передбачає ймовірність кожного токену бути призначеним до кожного експерта. Кожен токен обробляється верхніми-k експертами з максимальною ймовірністю та обчислює зважену суму на основі результату softmax ймовірностей. Як тільки верхні-k експерти активаються, модель деактивує інші експерти, підхід, який наділяє framework MoE-LLaVA нескінченними можливими розрідженими шляхами, забезпечуючи модель широким спектром можливостей.
MoE-Tuning
MoE-Tuning – це проста, але ефективна трифазна стратегія навчання, яка спочатку тренує багатошаровий перцептрон, який адаптує візуальні токени до великої мовної моделі на першому етапі. Потім framework тренує всі параметри LLM, щоб попередньо наділити велику модель мови та зору загальними багатомодальними можливостями розуміння. Нарешті, на третьому етапі framework повторно використовує багатошаровий перцептрон як ваги ініціалізації для експертів та тренує лише шари комбінації експертів.
Етап 1
На першому етапі основною метою є адаптація зображувальних токенів до великої мовної моделі, що дозволяє LLM зрозуміти екземпляри у зображенні. Framework MoE-LLaVA використовує багатошаровий перцептрон для проєкції зображувальних токенів у вхідну область великої мовної моделі та розглядає зображувальні патчі як псевдотекстові токени. На цьому етапі framework MoE-LLaVA тренує LLM для опису зображень та не застосовує шари комбінації експертів до LLM під час цього етапу.
Етап 2
На другому етапі framework MoE-LLaVA намагається покращити можливості та керування моделлю, налаштування її за допомогою багатомодальних інструкційних даних. Framework MoE-LLaVA досягає цього, регулюючи LLM для перетворення його у велику модель мови та зору з багатомодальними можливостями розуміння. Framework використовує більш складні інструкції, включаючи розпізнавання тексту та логічні завдання розуміння зображень, які вимагають від моделі мати сильніші багатомодальні можливості. Традиційно процес навчання для густих моделей вважається завершеним на цьому етапі. Однак framework MoE-LLaVA зустрічає складності при перетворенні LLM у LVLM одночасно з розрідженням LVLM. Для подолання цієї складності framework використовує ваги з цього етапу як ініціалізацію для наступного етапу, намагаючись пом’якшити складність навчання розрідженої моделі.
Етап 3
На третьому етапі модель повторно використовує багатошаровий перцептрон декілька разів для ініціалізації експертів як процедури ініціалізації. Потім framework годує тексти та зображувальні токени у шари комбінації експертів, після чого роутер обчислює ваги збігів між експертами та кожним токеном. Кожен токен обробляється верхніми-k експертами з агрегованим виходом, розрахованим за допомогою зваженої суми на основі ваг роутера. Як тільки верхні-k експерти активауються, модель деактивує інші експерти, підхід, який наділяє framework MoE-LLaVA нескінченними можливими розрідженими шляхами, забезпечуючи модель широким спектром можливостей.
MoE-LLaVA: Результати та експерименти
Framework MoE-LLaVA приймає CLIP-Large як зображувальний кодувальник з багатошаровим перцептроном, що складається з двох шарів з шаром активації GELU, який розділяє їх. За замовчуванням framework використовує чергування багатошарових перцептронів з шарами комбінації експертів, тобто шари комбінації експертів складають 50% від загальної кількості шарів. Наступна таблиця містить різні набори даних разом з їхнім розміром вибірки, використаним для навчання та оцінки framework MoE-LLaVA.

Відповіді на питання про зображення без навчання
Наступна схема демонструє, що MoE-LLaVA – це розріджена модель з м’яким роутером на основі LVLM. Framework оцінюється на 5 бенчмарках відповідей на питання про зображення, і, як можна побачити, framework MoE-LLaVA демонструє видатні візуальні можливості розуміння та забезпечує продуктивність, порівнянну з державою мистецтва framework LLaVA 1.5 на п’яти різних бенчмарках.

Оцінка об’єктної галюцинації
Для оцінки об’єктної галюцинації framework MoE-LLaVA приймає трубопровід оцінки POPE, метод опитування на основі голосування, і результати демонструються у наступній таблиці. Як можна побачити, серед усіх frameworkів, MoE-LLaVA забезпечує найкращі результати, вказуючи на здатність framework генерувати об’єкти, що узгоджуються з вхідним зображенням. Крім того, варто зазначити, що framework MoE-LLaVA балансує співвідношення «так» добре, вказуючи на здатність розрідженої моделі забезпечувати точну зворотню зв’язок для заданого питання.

Наступне зображення містить розподіл навантаження експертів, де переривчасті лінії представляють добре збалансований розподіл токенів серед модальностей або експертів. Перша схема ілюструє навантаження всередині експертів, тоді як інші зображення демонструють продуктивність експертів щодо різних модальностей.

Крім того, наступна схема демонструє розподіл модальностей серед різних експертів.

Заключні думки
У цій статті ми говорили про MoE-LLaVA, базову модель великої моделі мови та зору з комбінацією експертів, яка включає навчальні роутери та моделі комбінації експертів. У своєму ядрі модель MoE-LLaVA складається з декількох розріджених шляхів, а framework використовує ці шляхи для направлення кожного токену до різних експертів через навчений роутер. Токени потім обробляються колективно активованими експертами, залишаючи неактивні шляхи тихими. Потім framework укладає шари кодувальника комбінації експертів ітеративно, щоб забезпечити розріджений шлях до більшої та потужнішої LVLM. Стратегія MoE-Tuning інноваційно вирішує проблему погіршення продуктивності при багатомодальній вивченні розрідженості, забезпечуючи модель з великою кількістю параметрів, але з постійними витратами на навчання та висновок. Архітектура framework MoE-LLaVA спроєктована так, щоб під час розгортання активації лише верхніх-k експертів, залишаючи інші неактивними.












