Моделі та платформи ШІ
MiniGPT-5: Інтерлейкова генерація мови та зору за допомогою генеративних вокенів
За останні кілька років великі мовні моделі (LLM) привернули увагу розробників штучного інтелекту у всьому світі завдяки проривам у галузі обробки природної мови (NLP). Ці моделі встановили нові стандарти генерації тексту та його розуміння. Однак, незважаючи на прогрес у генерації тексту, генерація зображень, які узгоджуються з текстовими нарративами, залишається складною задачею. Для вирішення цієї проблеми розробники ввели інноваційний підхід до генерації мови та зору на основі “генеративних вокенів”, який містить у собі розрив між узгодженими текстово-образними виходами.
Фундаментом MiniGPT-5 є двоступенева стратегія тренування, яка сильно фокусується на генерації багатомодальної інформації без описів. Крім того, для підвищення цілісності моделі вона включає систему керування класифікатором, яка підвищує ефективність вokens для генерації зображень. На початковому етапі MiniGPT-5 продемонстрував потужну продуктивність та суттєве покращення порівняно з базовою моделлю Divter, тренованою на наборі даних MMDialog, і постійно демонстрував свою здатність доставляти порівнянні та навіть кращі багатомодальні виходи під час оцінювання людини на наборі даних VIST, що ще більше підкреслює її продуктивність та ефективність у різних стандартах.
MiniGPT5: Введення
З recent розробками каркасів LLM та застосунками на основі цих каркасів, інтеграція мультимедійних функцій є галуззю, яка пережила зростання популярності, оскільки вона також доводить себе як важливий крок, який живить широкий спектр застосунків – від інструментів створення контенту до передових багатомодальних діалогових агентів. З постійними дослідженнями та розробками мови та моделей зору зараз на етапі, коли проводиться робота з метою надання їм можливості генерувати як текст, так і візуальні дані безперешкодно. Можливість LLM генерувати багатомодальні дані безперешкодно допоможе покращити взаємодію в різних галузях, включаючи електронну комерцію, ЗМІ та віртуальну реальність.

У кінцевому підсумку, мета полягає в тому, щоб дозволити моделям синтезувати, розпізнавати та реагувати послідовно та логічно, використовуючи як текстові, так і візуальні модальності, відіграючи важливу роль у гармонізуванні потоку інформації та створенні логічних та послідовних нарративів. Потреба досягти поєднання текстових та візуальних модальностей спонукається в першу чергу необхідністю більш рідинних, інтегрованих та інтерактивних багатомодальних взаємодій у LLM, і в кінцевому підсумку досягнення чергування мови та зору генерації. Однак досягнення інтегрованих та інтерактивних багатомодальних взаємодій у LLM є складною задачею, повною численних викликів, включаючи
- Хоча поточні LLM дуже ефективні та здатні генерувати текст та обробляти текстово-образні пари, вони не демонструють задовільної продуктивності при генерації зображень.
- Розробка цих моделей зору та мови сильно залежить від тематично-орієнтованих даних, що робить складним для моделей узгоджувати згенерований текст з відповідними зображеннями.
- Нарешті, існує необхідність розробити більш ефективні стратегії, оскільки з підвищенням їхніх можливостей зростають також вимоги до пам’яті LLM, особливо під час виконання завдань нижнього рівня.
Фреймворк MiniGPT-5, техніка генерації мови та зору, що чергується, вводить концепцію “генеративних вокенів” у спробі вирішити вищезгадані виклики. Фреймворк MiniGPT-5 пропонує новий підхід до генерації багатомодальної інформації шляхом поєднання великих мовних моделей з технікою стабільної дифузії за допомогою спеціальних візуальних токенів. Запропонована двоступенева методика тренування підкреслює важливість початкової стадії, вільної від описів, та підготовки моделі до ефективної продуктивності навіть у сценаріях з обмеженими даними.

Але те, що відрізняє модель MiniGPT-5 від поточних каркасів, полягає в тому, що загальні стадії фреймворку MiniGPT-5 не складаються з домен-специфічних анотацій. Крім того, для забезпечення того, щоб згенерований текст та відповідні зображення були в гармонії один з одним, фреймворк MiniGPT-5 розгортає двофакторну стратегію втрат, яка ще більше підвищує підхід MiniGPT-5 до використання керування класифікатором та генеративних вокенів. Фреймворк MiniGPT-5 оптимізує ефективність тренування та вирішує обмеження пам’яті завдяки параметро-ефективній стратегії налаштування моделі.
Для того щоб надати вам швидкий огляд, фреймворк MiniGPT-5
- Пропонує метод, який використовує багатомодальні кодувачі, що представляють новий та загальний метод, який історично довів свою ефективність більше, ніж традиційні LLM, та використовує генеративні токени у поєднанні з технікою стабільної дифузії для генерації чергованих мовних та візуальних виходів.
- Пропонує двоступеневу стратегію тренування для генерації багатомодальної інформації без описів, та включення керування класифікатором під час тренування для подальшого уточнення якості згенерованих даних.
Модель MiniGPT-5 сильно заснована на попередніх дослідженнях та роботі у галузях
- Генерація зображень з тексту: Для перетворення текстових описів у відповідні візуальні представлення, та моделей тексту-ізображення.
- Багатомодальні великі мовні моделі (MLLM): Використання попередньо тренованих моделей LLM для дослідження їхніх застосунків та ефективності у генерації багатомодальної інформації.
- Багатомодальна генерація з великими мовними моделями: Для розширення можливостей LLM до безперешкодної інтеграції мовної та візуальної генерації даних.
MiniGPT-5: Метод, архітектура та фреймворк
Для забезпечення великих мовних моделей можливістю генерації багатомодальної інформації, модель MiniGPT-5 вводить фреймворк, який має на меті інтегрувати моделі генерації тексту-ізображення та попередньо треновані багатомодальні великі мовні моделі. Фреймворк MiniGPT-5 далі вводить “генеративні вokens”, спеціальні візуальні токени, які дозволяють розробникам вирішувати розбіжності, які з’являються у різних доменах, тренуючись безпосередньо на сурових зображеннях. Для подальшого підвищення якості багатомодальної інформації, згенерованої LLM, фреймворк MiniGPT-5 вводить стратегію керування класифікатором у поєднанні з двоступеневою методикою тренування. Давайте розглянемо фреймворк MiniGPT-5 детальніше.
Багатомодальна стадія входу
Розвиток LLM у недавньому минулому привернув увагу до багатомодальної здатності розуміння LLM, що дозволяє обробляти зображення як послідовний вхід. Фреймворк MiniGPT-5 використовує спеціально розроблені генеративні вokens для виходу візуальних особливостей у спробі розширити багатомодальну здатність розуміння LLM до генерації багатомодальної інформації. Крім того, фреймворк MiniGPT-5 використовує параметро-ефективні та передові методи налаштування для навчання багатомодального виходу з каркасом LLM.
Багатомодальне кодування
Попередньо тренований візуальний кодувач у фреймворку MiniGPT-5 перетворює кожне вхідне зображення у особливість, а кожен текстовий токен вкладається як вектор, і вхідні особливості промпта генеруються, коли ці вкладення конкатенуються один з одним.
Додавання вокенів у великі мовні моделі
Традиційно, словник великої мовної моделі складається лише з текстових токенів, тому розробники, які працюють над фреймворком MiniGPT-5, мали besoin мостити розрив між генеративними та традиційними LLM. Фреймворк MiniGPT-5 вводить набір спеціальних токенів у вигляді генеративних токенів до словника LLM. Фреймворк потім використовує прихований вихідний стан LLM для цих спеціальних вокенів для подальшої генерації зображень, і вставка чергованих зображень представлена позицією вокенів.
Параметро-ефективне налаштування (PEFT)
Параметро-ефективне налаштування є важливою концепцією, використовуваною для тренування LLM, однак застосування PEFT у багатомодальних умовах ще недостатньо досліджене. Фреймворк MiniGPT-5 використовує параметро-ефективне налаштування над кодувачем фреймворку MiniGPT-4 для тренування моделі до розуміння промптів або інструкцій краще, та підвищення загальної продуктивності моделі у умовах нульового або нового середовища.
Багатомодальна генерація виходу
Для узгодження генеративної моделі з генеративними токенами точно, фреймворк MiniGPT-5 формує компактний модуль відображення для узгодження розмірів та включення наглядових втрат, включаючи втрати латентної дифузії та втрати простору тексту. Втрата латентної дифузії узгоджує відповідні візуальні особливості з токенами безпосередньо, тоді як втрата простору тексту допомагає моделі вивчити правильні позиції токенів. Оскільки генеративні вokens у фреймворку MiniGPT-5 керуються безпосередньо зображеннями, фреймворк MiniGPT-5 не потребує, щоб зображення мали повний опис, що призводить до навчання без описів.
Генерація простору тексту
Фреймворк MiniGPT-5 слідує методу казуальної моделі мови для генерації як вокенів, так і тексту у просторі тексту спільно, і під час фази тренування розробники додають вokens до позиції зображень, і тренують модель для передбачення вокенів під час генерації тексту.
Відображення особливостей вокенів для генерації зображень
Після генерації простору тексту фреймворк узгоджує прихований вихідний стан з текстово-умовним простором особливостей моделі генерації тексту-ізображення. Фреймворк також підтримує модуль відображення особливостей, який включає двошаровий модель MLP, вивідний декодер послідовності особливостей, та чотиришарову модель трансформера кодувача-дешифратора.
Генерація зображень з латентною дифузією (LDM)
Для генерації необхідних зображень у процесі денойзингу фреймворк використовує особливості відображення як умовний вхід. Фреймворк також використовує латентну дифузійну модель (LDM) для керування, оскільки під час фази тренування зображення перетворюється у латентну особливість за допомогою попередньо тренованої VAE, після чого розробники отримують латентну особливість шуму, додавши деякий шум.
Комплексний підхід, застосований у фреймворку MiniGPT-5, дозволяє розробникам мати узгоджене розуміння та генерацію як візуальних, так і текстових елементів, використовуючи спеціальні токени, розширюючи можливості попередньо тренованих моделей, та застосовуючи інноваційні методи тренування.
MiniGPT-5: Тренування та результати
Під час роботи над фреймворком MiniGPT-5 розробники спостерігали, що тренування на обмеженому інтерлейованому текстово-ізображному наборі даних безпосередньо може призвести до зображень низької якості та розбіжностей, враховуючи значний зсув доменів між текстом та зображенням. Для подолання цієї проблеми розробники прийняли дві різні стратегії тренування,
- Включення техніки керування класифікатором, яка підвищує ефективність генеративних токенів під час процесу дифузії.
- Друга стратегія розділена на дві стадії
- Початкова стадія попереднього тренування, яка фокусується на узгодженні грубих особливостей.
- Стадія налаштування, яка полегшує навчання особливостей.
Керування класифікатором (CFG)
Ідея застосування CFG для багатомодальної генерації виникла у результаті спроби підвищити узгодженість та логічність між згенерованими зображеннями та текстом, і CFG вводиться під час процесу дифузії тексту-ізображення. Цей метод спостерігає, що тренування як безумовної, так і умовної генерації з умовним dropout дозволяє генеративній моделі досягти підвищеної умовної продуктивності.
Двоступенева стратегія тренування
Враховуючи значний зсув доменів між генерацією тексту-ізображення та чистою генерацією тексту, фреймворк MiniGPT-5 використовує двоступеневу стратегію тренування
- Унімодальна стадія узгодження (UAS),
- Багатомодальна стадія навчання (MLS).
Спочатку фреймворк узгоджує особливості генерації зображень з особливостями вokens у одиночному текстово-ізображному наборі даних, де кожен зразок містить лише один текст та одне зображення, і текст зазвичай є підписом до зображення. На цій стадії фреймворк дозволяє LLM генерувати вokens, використовуючи підписи як вхідні дані LLM.
Після успішного виконання стадії UAS модель може генерувати зображення для окремих текстових описів, але має труднощі з чергуванням мови та зору генерації, включаючи текстово-ізображні пари, та складну логіку, необхідну для генерації зображень та тексту. Для подолання цієї проблеми розробники додатково налаштували фреймворк MiniGPT-5, використовуючи параметри PEFT, за допомогою інтерлейованого бачення та мови набору даних, такого як VIST. Під час цієї стадії фреймворк створює три різні завдання з набору даних
- Генерація тексту лише: Генерує пов’язаний текст, дане наступне зображення.
- Генерація зображення лише: Генерує пов’язане зображення, дане наступний текст.
- Багатомодальна генерація: Генерує пари текст-ізображення, використовуючи заданий контекст.
MiniGPT-5: Стандарти та результати
Для комплексної оцінки своєї продуктивності у багатомодальній генерації команда розробників MiniGPT-5 порівнює свою продуктивність з іншими відомими моделями, включаючи Divter, GILL та тонко налаштовану унімодальну модель генерації, і порівняння представлено у таблиці нижче.

Фреймворк MiniGPT-5 розуміє, що багатомодальний вихід може бути значимим згідно з контекстом, однак він може відрізнятися від реальності, що є основною причиною, чому фреймворк MiniGPT-5 також включає людські входи для оцінювання та оцінки продуктивності моделі. Загалом, ефективність фреймворку MiniGPT-5 для багатомодальних завдань оцінюється з трьох точок зору.
- Континуальність мови: Оцінка того, чи згенерований контент узгоджується з заданим контекстом безперешкодно.
- Якість зображення: Оцінка актуальності та чіткості згенерованого зображення.
- Багатомодальна узгодженість: Визначення того, чи об’єднаний текстово-ізображний вихід узгоджується з початковим контекстом.
Оцінка VIST на фінальному етапі
На першій стадії експериментів фреймворк MiniGPT-5 спрямований на генерацію відповідних зображень, і таблиця нижче підсумовує результати, отримані з цього налаштування.

Як можна побачити, фреймворк MiniGPT-5 у всіх трьох налаштуваннях може перевершити тонко налаштовану модель SD2, підкреслюючи ефективність фреймворку MiniGPT-5.

Вище зображення порівнює продуктивність фреймворку MiniGPT-5 з тонко налаштованим фреймворком MiniGPT-4 на метриках продуктивності S-BERT, Rouge-L та Meteor. Результати вказують на те, що використання генеративних вокенів не впливає негативно на продуктивність фреймворку під час виконання багатомодальних завдань. Результати також демонструють, що фреймворк MiniGPT-5 здатний використовувати довгі горизонтальні багатомодальні промпти для генерації високоякісних та узгоджених зображень без компромісу щодо можливостей оригінальної моделі для багатомодального розуміння.

Таблиця вище порівнює продуктивність трьох фреймворків на 5000 зразках для багатомодальної генерації з точки зору багатомодальної узгодженості, якості зображення та континуальності мови. Як можна побачити, фреймворк MiniGPT-5 перевершує інші дві базові моделі більш ніж у 70% випадків. З іншого боку, таблиця нижче демонструє продуктивність фреймворку MiniGPT-5 на валідаційному наборі даних CC3M для генерації окремих зображень. Завдяки обмеженням даних розробники виявили розрив у визначенні вокенів при використанні зі стабільною дифузією. Незважаючи на це обмеження, фреймворк MiniGPT-5 перевершує поточний стан базової моделі GILL за всіма метриками.


Висновок
У цій статті ми говорили про MiniGPT-5, техніку генерації мови та зору, що чергується, яка вводить концепцію “генеративних вокенів” у спробі використати можливості великих мовних моделей для генерації багатомодальної інформації шляхом узгодження великої мовної моделі з попередньо тренованою моделлю генерації тексту-ізображення. Ми говорили про основні компоненти та загальну архітектуру фреймворку MiniGPT-5, а також результати, які вказують на суттєве покращення продуктивності та ефективності порівняно з поточними базовими та передовими моделями. Фреймворк MiniGPT-5 прагне встановити новий стандарт у галузі багатомодальної генерації контенту та даних, і спрямований на вирішення проблем, з якими зіштовхнулися попередні моделі при спробі вирішити одну й ту ж проблему.












