Моделі та платформи ШІ
LLaVA-UHD: ефективне сприйняття зображень у будь-якому співвідношенні сторін та високій роздільності
Нещодавній прогрес та розвиток великих мовних моделей призвели до значного збільшення можливостей розуміння, взаємодії та вивчення мови. Сучасні.frameworkи досягають цього шляхом проєктування візуальних сигналів у великі мовні моделі, щоб дати їм можливість візуально інтерпретувати світ, різноманітні сценарії, які залежать від візуальної кодування стратегії. Однак реальні зображення не тільки містять широкий спектр сценаріїв, але також значно різняться за роздільністю та співвідношенням сторін, що створює значні перешкоди для великих мовних моделей у різних областях та завданнях. Щоб подолати значну відмінність, яку створюють реальні зображення, сучасні великі мовні моделі сприймають зображення у низькій роздільності, наприклад 224×224, та фіксованому співвідношенні сторін, наприклад 1:1. Хоча компроміс щодо низької роздільності та фіксованого співвідношення сторін збільшує загальну придатність великої мовної моделі до реальних застосунків, він часто призводить до значного розмиття зображення та серйозної спотворення форми. Це суттєво впливає на можливості великих моделей багатомодального навчання, особливо тих, які оптимізовані для тонких завдань, таких як оптичне розпізнавання символів та розуміння малих об’єктів. Крім того, оскільки роздільність та співвідношення сторін попередньо визначені, моделі можуть тільки здогадуватися щодо розмитих зображень, що призводить до “галюцинації моделі”, тобто ситуації, коли модель генерує текстові відповіді, які не мають підґрунтя у зображенні.
У цій статті ми будемо говорити про LLaVA-UHD, новий підхід, який спочатку бере.frameworkи LLaVA-1.5 та GPT-4V як представницькі приклади та намагається викрити системні недоліки, закладені у їхній візуальній кодуванні стратегії. .framework LLaVA-UHD, багатомодальний модуль, є спробою подолати ці перешкоди. .framework LLaVA-UHD може сприймати зображення у високій роздільності, а також у будь-якому співвідношенні сторін. .framework LLaVA-UHD складається з трьох основних компонентів. По-перше, стратегія модуляризації зображення, яка розділяє зображення у менші змінні за розміром сегменти з метою підвищення ефективності та розширення кодування. По-друге, модуль стиснення, який стискає візуальні токени, згенеровані візуальними кодувальниками. По-третє, просторова схема, яка організовує токени сегментів для великих мовних моделей. Комплексні експерименти показують, що .framework LLaVA-UHD може перевершити великі мовні моделі сучасного рівня на 9 тестових завданнях. Крім того, використовуючи лише 94% обчислювальних ресурсів, .framework LLaVA-UHD може підтримувати зображення з роздільністю у 6 разів вищою, тобто 672×1088.
LLaVA-UHD: ефективне сприйняття зображень у будь-якому співвідношенні сторін та високій роздільності
Розуміння мови та взаємодія зробили значний прогрес останнім часом, головним чином завдяки недавньому поштовху великих мовних моделей. У сучасних.frameworkах це досягається шляхом введення візуальних сигналів у великі мовні моделі, щоб дати їм можливість візуально інтерпретувати світ, різноманітні сценарії, які залежать від візуальної кодування стратегії. Відмінність у сценарії відображає вузьке покриття великих мовних моделей у різних областях та завданнях, тоді як відмінність у роздільності та співвідношенні сторін відображає велику внутрішньокласову відмінність у реальних зображеннях, яку важко обробляти. На відміну від малих масштабів, які знижують відмінність, моделі після BERT підходять до значущості низької роздільності (наприклад, для LLaVA-UHD це 224×224) зображень з фіксованим співвідношенням сторін, 1:1, щоб надати реальним зображенням. Хоча цей компроміс корисний для забезпечення загальної придатності великої мовної моделі до реальних застосунків, він часто призводить до дуже розмитих зображень та серйозного спотворення форми. Це знижує можливості великих багатомодальних моделей, особливо тих, які оптимізовані для тонких завдань, таких як оптичне розпізнавання символів та розуміння малих об’єктів. Оскільки роздільність та співвідношення сторін попередньо визначені, моделі можуть тільки здогадуватися щодо розмитих зображень, що призводить до “галюцинації моделі”, тобто ситуації, коли модель генерує текстові відповіді, які не мають підґрунтя у зображенні. Чому ж не можна сприймати зображення у високій роздільності та змінному співвідношенні сторін?
Є дві основні причини, чому великі мовні моделі не можуть сприймати зображення у високій роздільності та змінному співвідношенні сторін. По-перше, оскільки візуальні кодувальники попередньо навчаються у фіксованих роздільностях, це робить важким для моделі та кодувальника обробляти зображення з різними співвідношеннями сторін та роздільностями, що суттєво впливає на адаптивність моделі. По-друге, кодування високої роздільності зображень безпосередньо за допомогою візуальних трансформерів пов’язане з значними обчислювальними витратами щодо розміру зображення. Крім того, обчислювальні витрати можуть бути суттєво вищими для великої мовної моделі при обробці великої кількості візуальних токенів для високої роздільності зображень, що суттєво впливає на загальну ефективність моделі. Щоб подолати ці перешкоди, LLaVA-UHD, велика багатомодальна модель, яка сприймає високої роздільності зображення та будь-яке співвідношення сторін, бере.frameworkи LLaVA-1.5 та GPT-4V як представницькі приклади та намагається викрити системні недоліки, закладені у їхній візуальній кодуванні стратегії.

Вище зображення відображає результати експериментів GPT-4V щодо визначення кількості об’єктів у зображенні. У основі.framework LLaVA-UHD лежать три компоненти. По-перше, стратегія модуляризації зображення, яка розділяє зображення у менші змінні за розміром сегменти з метою підвищення ефективності та розширення кодування. По-друге, модуль стиснення, який стискає візуальні токени, згенеровані візуальними кодувальниками. По-третє, просторова схема, яка організовує токени сегментів для великих мовних моделей.
LLaVA-UHD: методологія та архітектура
На основі висновків з деяких пілотних експериментів щодо вивчення існуючих.frameworkів, включно з GPT-4V та LLaVA-1.5, .framework LLaVA-UHD реалізує трикомпонентну архітектуру, як показано на наступному зображенні.

По-перше, стратегія модуляризації зображення, яка розділяє зображення у менші змінні за розміром сегменти з метою підвищення ефективності та розширення кодування. По-друге, модуль стиснення, який стискає візуальні токени, згенеровані візуальними кодувальниками. По-третє, просторова схема, яка організовує токени сегментів для великих мовних моделей. Давайте розглянемо ці компоненти детальніше.
Модульована візуальна кодування
Поширений підхід до обробки високої роздільності зображень з різними співвідношеннями сторін полягає у інтерполяції позиційних вкладень Візуального Трансформера або ViT до цільової форми для прямого кодування у цілому. Однак реалізація цього підходу часто супроводжується високими обчислювальними витратами, а проблеми поза розподілом призводять до подальшого погіршення продуктивності. Щоб подолати цю перешкоду, .framework LLaVA-UHD пропонує модульовану візуальну кодування стратегію, яка розділяє зображення у менші змінні за розміром сегменти, де форма кожного сегмента близька до стандартної попередньої настройки Візуального Трансформера. Завдяки використанню змінних сегментів .framework LLaVA-UHD може досягти повної адаптивності до зображень у їхній рідній роздільності без реалізації спотворюючої зміни форми або доповнення.
Крім того, більшість існуючих великих мовних моделей реалізують статичну роздільність для кодування зображень, підхід, який перешкоджає повній адаптивності моделі до рідних роздільностей, оскільки вони мають доступ тільки до декількох попередньо визначених фіксованих форм сегментів. Крім того, статична роздільність сегментів шкодить продуктивності, ефективності та правильності моделі, оскільки вона призводить до спотворюючої зміни форми або доповнення. Щоб подолати цю проблему, .framework LLaVA-UHD пропонує кодувати зображення у співвідношенні сторін, визначеному стратегією поділу. Конкретно, .framework LLaVA-UHD спочатку змінює оригінальне зображення пропорційно відповідно до співвідношення сторін, так щоб кількість патчів входила у бюджет попередньої настройки, тобто кількість позиційних вкладень у Візуальному Трансформері, максимально. Потім .framework LLaVA-UHD змінює попередньо налаштовану 1D позиційну послідовність Візуального Трансформера у 2D формат відповідно до його попередньої настройки.
Шар стиснення
Поширена проблема, з якою стикаються великі мовні моделі при обробці високої роздільності зображень, полягає у тому, що кількість візуальних токенів, які вони повинні обробити, суттєво вища (наприклад, .framework LLaVA-1.5 генерує близько 3500 візуальних токенів при обробці одного зображення з роздільністю 672×1008), що становить суттєву частину обчислювальних ресурсів та витрат. Щоб подолати цю перешкоду, .framework LLaVA-UHD реалізує спільний перцептор-ресемплер шар для стиснення візуальних токенів кожного сегмента зображення. Потім .framework LLaVA-UHD реалізує набір запитових векторів через跨-увагу для ресемплювання виводу токенів зображення візуальними кодувальниками до меншої кількості. При порівнянні з поширеними стратегіями візуальної проєкції на основі багаторівневого перцептрону підхід перцептор-ресемплювання, реалізований .framework LLaVA-UHD, може підтримувати доступну, але фіксовану кількість візуальних токенів незалежно від роздільності зображення, що робить .framework LLaVA-UHD більш сумісним з задачами обробки та розуміння високої роздільності зображень.
Просторова схема для сегментів зображення
Це необхідно інформувати велику мовну модель про просторову організацію сегментів зображення, оскільки поділ зображень є динамічним для різних зображень. .framework LLaVA-UHD пропонує просторову схему, яка використовує два спеціальних токени для інформування великої мовної моделі про відносну позицію сегментів зображення. Під цією просторовою схемою .framework LLaVA-UHD використовує “,” для розділення представлень сегментів у рядку, а різні рядки розділяються за допомогою “n”.
LLaVA-UDH: експерименти та результати
.framework LLaVA-UHD оцінюється проти 9 популярних тестових завдань, включаючи загальні візуальні завдання питання-відповідь, оптичні завдання питання-відповідь на основі символів, завдання галюцинації та комплексні завдання. Крім того, .framework LLaVA-UHD порівнюється з сильними базовими моделями, включаючи LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 та інші.
Продуктивність .framework LLaVA-UHD на 9 популярних тестових завданнях підсумовується та порівнюється з популярними завданнями у таблиці нижче.

На основі вищезазначеної продуктивності можна зробити висновок, що .framework LLaVA-UHD може перевершити сильні базові моделі на популярних тестових завданнях, включаючи сильні загальні базові моделі, навчені на значно більшій кількості даних, а також перевершити великі мовні моделі, які потребують значно більше обчислень, такі як Fuyu-8B, Monkey та інші. По-друге, результати також показують, що .framework LLaVA-UHD досягає суттєво кращих результатів порівняно з архітектурою LLaVA-1.5, а з іншого боку, де LLaVA-1.5 підтримує фіксовану роздільність 336×336, .framework LLaVA-UHD підтримує зображення з роздільністю 672×1088 та будь-яким співвідношенням сторін, а також ту саму кількість візуальних токенів.


Фінальні думки
У цій статті ми говорили про LLaVA-UHD, новий підхід, який спочатку бере.frameworkи LLaVA-1.5 та GPT-4V як представницькі приклади та намагається викрити системні недоліки, закладені у їхній візуальній кодуванні стратегії. .framework LLaVA-UHD, багатомодальний модуль, є спробою подолати ці перешкоди. .framework LLaVA-UHD може сприймати зображення у високій роздільності, а також у будь-якому співвідношенні сторін. .framework LLaVA-UHD складається з трьох основних компонентів. По-перше, стратегія модуляризації зображення, яка розділяє зображення у менші змінні за розміром сегменти з метою підвищення ефективності та розширення кодування. По-друге, модуль стиснення, який стискає візуальні токени, згенеровані візуальними кодувальниками. По-третє, просторова схема, яка організовує токени сегментів для великих мовних моделей. Комплексні експерименти показують, що .framework LLaVA-UHD може перевершити великі мовні моделі сучасного рівня на 9 тестових завданнях. Крім того, використовуючи лише 94% обчислювальних ресурсів, .framework LLaVA-UHD може підтримувати зображення з роздільністю у 6 разів вищою, тобто 672×1088.












