Моделі та платформи ШІ
SHOW-O: Єдина трансформерна модель, що поєднує багатомодальну обробку та генерацію
За останні роки значно просунулася розробка великих мовних моделей (LLM). Ранні спроби створення багатомодальних великих мовних моделей (MLLM) демонструють помітні можливості багатомодальної обробки. Для інтеграції LLM у багатомодальні області ці дослідження досліджували проєкціювання ознак з попередньо натренованого модального кодувача, такого як CLIP, у вхідний простір LLM, що дозволяє здійснювати багатомодальну обробку та висновок у трансформерній основі. Хоча існує кілька варіантів проєктування MLLM, таких як візуальні кодувачі, адаптери вирівнювання ознак та набори даних, навчання більшості цих моделей здійснюється згідно з парадигмою автoregresивної генерації, яка довела свою ефективність для генерації тексту в LLM. Незважаючи на їх сильні можливості багатомодальної обробки, ці моделі в основному зосереджені на візуальному сприйнятті та не мають можливості генерації багатомодальних виходів за межами тексту.
Моделі трансформерів продемонстрували великий успіх у автoregresивному моделюванні в обробці природної мови. Під впливом такого прогресу попередні дослідження безпосередньо застосовували той же автoregresивний моделювання для вивчення залежності пікселів зображення для генерації зображень та відео. Наприклад, VideoPoet використовує архітектуру декодера-трансформера для синтезу високоякісних відео з багатомодальних входів. Нещодавно LlamaGen показав, що архітектура великої мовної моделі, подібна до Llama, може автoregresивно моделювати токени зображення, досягнувши приємної продуктивності у клас-умовій генерації зображень.
У цій статті ми обговоримо Show-O, єдину трансформерну модель, що поєднує багатомодальну обробку та генерацію. На відміну від повністю автoregresивних моделей, Show-O поєднує автoregresивне та дискретне дифузійне моделювання для адаптивної обробки входів та виходів різних та змішаних модальностей. Єдина модель гнучко підтримує широкий спектр завдань зору-мови, включаючи візуальне питання-відповідь, генерацію зображення-текст, текст-належне заповнення/екстраполяція та змішану генерацію модальностей. На різних бенчмарках Show-O демонструє порівняльну або вищу продуктивність порівняно з індивідуальними моделями з еквівалентною або більшою кількістю параметрів, підкреслюючи її потенціал як наступної генерації фундаментальної моделі.
У цьому рамках модель доручається передбачення гауссовського шуму, доданого до безперервних латентних представлень. На відміну від інших моделей, таких як D3PM, Mask-predict, ARDM та MaskGIT, які використовують дискретний процес корупції як альтернативу гауссовому дифузію. Конкретно, зображення представляється як послідовність дискретних токенів за допомогою токенізації зображення, причому кожен токен асоціюється з категоріальним ярликом. Розподіл токенів перетворюється у уніформний розподіл через стохастичний процес вибірки. Під час навчання частина цих токенів випадково маскується, і модель тренується для передбачення оригінальних значень маскованих токенів. У цій роботі Show-O приймає дискретне дифузійне моделювання для візуальної генерації.
SHOW-O: Єдина трансформерна модель, що поєднує багатомодальну обробку та генерацію
За останні кілька років значно просунулася розробка двох основних напрямків багатомодальної інтелекту: обробка та генерація. Для багатомодальної обробки Багатомодальні великі мовні моделі (MLLM) типу LLaVA продемонстрували виняткові можливості у завданнях зору-мови, таких як візуальне питання-відповідь (VQA). Для візуальної генерації денойзинг-дифузійні ймовірнісні моделі (DDPM) революціонізували традиційні генераційні парадигми, досягнувши неперевершеної продуктивності у генерації тексту-ізображення/відео.
Враховуючи ці досягнення в окремих областях, природно досліджувати потенціал їх поєднання. Останні роботи намагалися зібрати експертні моделі з цих двох різних областей для формування єдиної системи, що може обробляти як багатомодальну обробку, так і генерацію. Однак існуючі спроби часто передбачають окремі моделі для обробки та генерації. Наприклад, NExT-GPT використовує базову мовну модель для багатомодальної обробки, але вимагає додаткової попередньо натренованої дифузійної моделі для генерації зображення. Це піднімає питання: чи може одна трансформерна модель обробляти як багатомодальну обробку, так і генерацію?
Нещодавно Chameleon продемонстрував, що це можливо. Конкретно, Chameleon дозволяє об’єднання різних модальностей для генерації як текстових, так і зображень-токенів за допомогою автoregresивного моделювання. Хоча це має сенс для моделювання текстових токенів автoregresивно, менш зрозуміло, чи оптимально моделювання зображень-патчів або пікселів таким же чином. Ключовим вузьким місцем автoregresивного передбачення зображення є велика кількість необхідних кроків вибірки, особливо при роботі з високороздільними зображеннями. Континуючі дифузійні моделі продемонстрували вищу продуктивність у візуальній генерації порівняно з автoregresивними.
Це призводить нас до дослідження того, чи може одна трансформерна модель поєднати автoregresивне та дифузійне моделювання. Show-O передбачає нову парадигму, у якій текст представляється у вигляді дискретних токенів та моделюється автoregresивно, тоді як безперервні пікселі зображення моделюються за допомогою денойзинг-дифузії. Однак інтеграція цих двох різних технік у одну мережу не є тривіальною через відмінності між дискретними текстовими токенами та безперервними представленнями зображення. Крім того, дифузійні моделі зазвичай залежать від двох окремих моделей: текстового кодувача та денойзинг-мережі.
Для вирішення цієї проблеми Show-O вводить нову єдину модель, здатну обробляти як багатомодальну обробку, так і генерацію за допомогою змішаного автoregresивного та дифузійного моделювання. Show-O побудована на основі попередньо натренованої LLM та використовує її автoregresивні моделювальні можливості для текстової логіки. Під впливом інших робіт, Show-O використовує дискретне денойзинг-дифузійне моделювання для моделювання зображень-токенів замість безперервних представлень. Крім того, Show-O внутрішньо кодує текстову умовну інформацію, усуваючи потребу у додаткових текстових кодувачах. Використовуючи текстові та зображенні токенізаційні засоби, Show-O може обробляти різноманітні вхідні дані та завдання, надаючи відповіді автoregresивно для завдань зору-мови та генеруючи зображення за допомогою дискретного денойзинг-дифузійного моделювання.
Show-O демонструє порівняльну або вищу продуктивність порівняно з індивідуальними моделями з еквівалентною або більшою кількістю параметрів на різних бенчмарках. На відміну від автoregresивної генерації зображень,.framework Show-O вимагає приблизно у 20 раз менше кроків вибірки, що робить її внутрішньо швидшою. Крім того,.framework Show-O підтримує додатки нижнього рівня, такі як текст-належне заповнення та екстраполяція, без необхідності дофільтрування, як це демонструється на наступному зображенні.

Show-O також має потенціал для змішаної генерації модальностей, chẳng hạn як чергування відеокадрів з текстовими описами, демонструючи перспективи для генерації довгих відео. Крім того,.framework Show-O досліджує вплив дискретних та безперервних представлень зображення на багатомодальну обробку, надаючі уявлення для майбутніх єдиних моделей.
Наступна фігура представляє порівняння характеристик моделей між.framework Show-O та існуючими методами у різних областях. Show-O виділяється як єдина модель, що поєднує сучасні техніки для багатомодальної обробки та генерації.

У підсумку, основні внески цієї статті полягають у наступному:
- Show-O є єдиною моделлю, що поєднує багатомодальну обробку та генерацію за допомогою однієї трансформерної моделі.
- Show-O поєднує автoregresивне та дискретне дифузійне моделювання у одному трансформері, обробляючи як текст, так і зображення ефективно.
- Framework Show-O перевершує або дорівнює індивідуальним базовим моделям з еквівалентною або більшою кількістю параметрів на багатомодальних завданнях генерації та обробки.
- Show-O підтримує додатки нижнього рівня, такі як текст-належне заповнення та екстраполяція, без необхідності дофільтрування та демонструє потенціал для змішаної генерації модальностей.
- Show-O досліджує вплив різних типів представлень, надаючі цінні уявлення для покращення багатомодальної обробки у єдиних моделях.
За останні роки все більше досліджень зосереджується на єдиних багатомодальних мовних моделях, здатних як до обробки, так і генерації. Деякі з цих зусиль використовують безперервні представлення, чергуючи їх з текстовими токенами для автoregresивного моделювання, щоб генерувати зображення. SEED-X пропонує єдину та універсальну фундаментальну систему, здатну обробляти як багатомодальну обробку, так і генерацію. У цьому підході безперервні представлення зображення з кодувача CLIP-ViT поєднуються з текстовими токенами та подаються у велику мовну модель (LLM) для виконання передбачення наступного слова та регресії представлення зображення. Chameleon вводить сімейство токен-орієнтованих змішаних моделей, здатних як до обробки, так і генерації зображень. Цей підхід представляє всі модальності у вигляді дискретних токенів, використовуючи єдину трансформерну архітектуру та тренуючи модель з нуля у спосіб кінця у кінець. На відміну від цього, Show-O також приймає дискретні токени для представлення всіх модальностей, але використовує дискретний дифузійний процес замість автoregresивного моделювання для візуальної генерації.
SHOW-O: Методологія та архітектура
Основною метою.framework Show-O є розробка єдиної моделі, що поєднує автoregresивне та дифузійне моделювання для спільної багатомодальної обробки та генерації. Розробка такої єдиної моделі супроводжується суттєвими викликами, з основними питаннями, пов’язаними з:
- визначенням вхідного/вихідного простору моделі;
- поєднанням різних типів вхідних даних з різних модальностей;
- інтеграцією автoregresивного та дифузійного моделювання у одному трансформері;
- ефективним тренуванням такої єдиної моделі.
Show-O вирішує ці виклики наступними рішеннями:
- Show-O будує вхідний/вихідний простір за допомогою токенізації текстових та зображеньних даних у дискретні токени.
- Show-O вводить свою стандартну архітектуру та єдину стратегію промптингу для структуризації вхідних даних та модальностей.
- Show-O демонструє, як інтегрувати автoregresивне та дифузійне моделювання у одному трансформері.
- Show-O пропонує триступеневий процес тренування для ефективного тренування єдиної моделі.
Токенізація
Оскільки запропонована модель Show-O побудована на основі попередньо натренованих LLM, природно проводити єдине навчання у дискретному просторі. Зберігаючи єдиний словник, який включає дискретні текстові та зображенні токени, Show-O має однакову мету навчання: передбачення дискретних токенів.
Токенізація тексту
Show-O побудована на основі попередньо натренованої LLM, і той же токенізаційний засіб використовується для токенізації текстових даних без змін.
Токенізація зображення
Слідуючи за MAGVIT-v2, Show-O тренує безпосередній квантизатор за допомогою близько 35 мільйонів зображень. Квантизатор підтримує кодобук із розміром 8 192 та кодує зображення роздільності 256×256 у 16×16 дискретних токенів. MAGVIT-v2 обрано через свою легкість у дофільтруванні, що робить його придатним для відеотокенізації з темпоральної компресією, аспект, який Show-O планує дослідити у майбутньому. Альтернативний підхід полягає у використанні різних токенізаційних засобів для обробки та генерації відповідно. Під впливом існуючих досліджень, Show-O також витягує безперервні представлення зображення з попередньо натренованого MAGVIT-v2 та кодувача CLIP-ViT для дослідження покращення багатомодальної обробки. У наступних розділах стандартна модель Show-O використовує дискретні токени зображення як вхід для як багатомодальної обробки, так і генерації. Для простоти методологічні розділи будуть роз’яснювати лише стандартну модель Show-O.

Архітектура
Show-O успадковує архітектуру існуючих LLM без будь-яких змін архітектури, крім додавання операції QK-Norm до кожного шару уваги. Show-O ініціалізується вагами попередньо натренованої LLM та розширює розмір шару вкладення, включивши 8 192 нових навчальних вкладень для дискретних токенів зображення. На відміну від сучасних дифузійних моделей, які вимагають додаткового текстового кодувача, Show-O внутрішньо кодує текстову умовну інформацію для генерації зображення-текст.
Єдина промптинг-стратегія
Для виконання єдиного навчання на багатомодальній обробці та генерації Show-O використовує єдину промптинг-стратегію для формування різних типів вхідних даних. Для даної пари зображення-текст (x, y) вона спочатку токеніzuється у M токенів зображення та N токенів тексту за допомогою токенізаційних засобів зображення та тексту відповідно. Токени потім формуються у вхідну послідовність згідно з типом завдання, як показано на наступному зображенні.

Використовуючи цей дизайн промптингу, Show-O може ефективно кодувати різні вхідні дані для багатомодальної обробки, генерації зображення-текст та змішаної генерації модальностей як послідовні дані. Ця установка дозволяє єдиному навчанню працювати безперешкодно через послідовності для цих різних завдань. Як тільки модель тренується, Show-O може бути запущена для обробки широкого спектру завдань зору-мови, включаючи візуальне питання-відповідь та генерацію зображення-текст.
Омні-увага механізм
На відміну від існуючих робіт, які моделюють послідовності автoregresивно лише, Show-O вводить механізм омні-уваги, що дозволяє їй моделювати різні типи сигналів по-різному. Цей комплексний механізм уваги адаптивно перемикається між каузальною та повною увагою залежно від формату вхідної послідовності. Наступна фігура демонструє приклади омні-уваги для різних вхідних послідовностей.

Конкретно, Show-O обробляє текстові токени у послідовності за допомогою каузальної уваги, тоді як токени зображення обробляються за допомогою повної уваги, дозволяючи кожному токену повністю взаємодіяти з усіма іншими. У багатомодальній обробці текстові токени можуть звертатися до усіх попередніх токенів зображення, тоді як у генерації зображення-текст токени зображення можуть взаємодіяти з усіма попередніми текстовими токенами. Омні-увага зберігає знання текстової логіки з попередньо натренованої LLM та підвищує ефективність генерації зображення, зменшуючи кількість кроків вибірки. Крім того, вона підтримує різні додатки нижнього рівня, такі як заповнення та екстраполяція, без необхідності дофільтрування. Коли подаються лише текстові токени, механізм за замовчуванням використовує каузальну увагу.
SHOW-O: Експерименти та результати
Наступна таблиця представляє багатомодальну обробку Show-O на публічних бенчмарках, таких як завдання капіталізації зображення та візуальне питання-відповідь.

Поточна версія Show-O побудована на основі Phi-1.5, і тому її аналог лише для обробки, LLaVA-v1.5-Phi-1.5, служить прямим бенчмарком. Show-O демонструє порівняльну продуктивність у всіх оцінювальних метриках порівняно з бенчмарком LLaVA-v1.5-Phi-1.5, який присвячений лише багатомодальній обробці. Це демонструє великий потенціал.framework Show-O для поєднання багатомодальної обробки та генерації у одному трансформері. Коли порівнюється з моделями лише для обробки, такими як InstructBLIP, Qwen-VL-Chat та mPLUG-Owl2, Show-O, незважаючи на значно менший розмір моделі, демонструє конкурентоспроможну продуктивність на бенчмарках POPE, MME, Flickr30k та VQAv2, і виконує краще на бенчмарці GQA. Коли порівнюється з єдиними моделями з значно більшим числом параметрів, такими як NExT-GPT-13B та Chameleon-34B, Show-O також демонструє сильну продуктивність на бенчмарці Flickr30k та виконує значно краще на бенчмарці VQAv2.
Враховуючи ці перспективні результати, Show-O розглядається як потенційна наступна генерація фундаментальної моделі для поєднання обробки та генерації. Ці результати також демонструють потенціал масштабування Show-O для досягнення найкращої продуктивності.
Якісні порівняння
Ми представляємо якісні порівняння з дифузійними моделями, такими як SDv1.5, SDXL, та автoregresивною моделлю LlamaGen, а також єдиними моделями, такими як LWM та SEED-X, як це демонструється на наступному зображенні.

Show-O демонструє здатність генерувати реалістичні зображення з узгодженим змістом, описаним у коротких та довгих текстових промптах. Порівняно з SDv1.5 та LlamaGen, Show-O демонструє кращу візуальну якість та сильніше узгодження зображення-текст. Наприклад, у другому стовпчику як SDv1.5, так і LlamaGen не можуть повністю зрозуміти текстовий промпт і пропустити атрибути, такі як “закат” та “блакитні куполи” у згенерованих зображеннях. Порівняно з SDXL, Show-O демонструє порівняльну візуальну якість та узгодження, як це видно у прикладах, таких як “гонки раллі-кара” та “потрясаючий контраст проти яскравого закату.”

Текст-належне заповнення та екстраполяція
Show-O природно підтримує текст-належне заповнення та екстраполяцію без необхідності дофільтрування. Наступна фігура демонструє кілька прикладів.

У верхній частині зображення, дано вхідне зображення та маску заповнення, Show-O може перетворити червоний трамвай у синій спортивний автомобіль з гладкими кривими та тонованими вікнами на основі текстового промпту користувача. Show-O також може екстраполювати оригінальне зображення горизонтально або вертикально на основі даного текстового промпту. Наприклад, у другому рядку Show-O екстраполює зображення, додаючи нові об’єкти, такі як “червоні дикі квітки”. Пікселі у заповнених та екстрапольованих регіонах залишаються узгодженими з оригінальним зображенням. Ці приклади явно демонструють внутрішні переваги Show-O над автoregresивними моделями для додатків нижнього рівня.
Заключні думки
У цій статті ми обговорили Show-O, єдину трансформерну модель, що поєднує багатомодальну обробку та генерацію. На відміну від повністю автoregresивних моделей, Show-O поєднує автoregresивне та дискретне дифузійне моделювання для адаптивної обробки входів та виходів різних та змішаних модальностей. Єдина модель гнучко підтримує широкий спектр завдань зору-мови, включаючи візуальне питання-відповідь, генерацію зображення-текст, текст-належне заповнення/екстраполяцію та змішану генерацію модальностей. На різних бенчмарках Show-O демонструє порівняльну або вищу продуктивність порівняно з індивідуальними моделями з еквівалентною або більшою кількістю параметрів, підкреслюючи її потенціал як наступної генерації фундаментальної моделі. У цьому рамках модель доручається передбачення гауссовського шуму, доданого до безперервних латентних представлень. На відміну від інших моделей, таких як D3PM, Mask-predict, ARDM та MaskGIT, які використовують дискретний процес корупції як альтернативу гауссовому дифузію. Show-O є першою, хто поєднує автoregresивне та дискретне дифузійне моделювання, дозволяючи їй обробляти різні модальності по-різному. Розширені експериментальні результати демонструють, що Show-O порівняльна або навіть краща за індивідуальні експертні моделі у широкому спектрі завдань зору-мови, підкреслюючи її потенціал як наступної генерації фундаментальної моделі.












