Моделі та платформи ШІ

Оспрей: Розуміння на рівні пікселів з візуальною настройкою інструкцій

mm
Додайте Unite.AI до бажаних джерел у Google

З недавнім удосконаленням методів візуальної настройки інструкцій, багатомодальні великі мови моделі (MLLMs) продемонстрували видатні загальні можливості бачення-мови. Ці можливості роблять їх ключовими будівельними блоками для сучасних загальних візуальних помічників. Недавні моделі, включаючи MiniGPT-4, LLaVA, InstructBLIP та інші, демонструють вражаючі візуальні розуміння та інструкції-слідування можливості. Хоча більшість з них покладаються на пари зображення-текст для візуальної мови-виду рівня, вони добре виконують свою роботу в цій галузі. Однак їхня залежність від рівня коробки та рівня зображення є основною причиною, чому MLLM не можуть повторити свою продуктивність на завданнях візуальної мови-виду на рівні пікселів. Крім того, обмежена доступність маскових інструкційних даних для навчання становить виклик для подальшого вдосконалення MLLM.

Оспрей – це метод навчання інструкцій маски-тексту з основною метою розширення можливостей MLLM. Він включає тонкі масовані регіони в мовних інструкціях для досягнення розуміння мови-виду на рівні пікселів. Для цього Оспрей створює масковий регіональний текстовий набір даних з понад 700 тисяч зразків. Він вводить представлення рівня пікселів у великі мови моделі (LLM), щоб розробити модель мови-виду. Особливо Оспрей приймає конволюційну модель CLIP як свою візуальну кодувальню та інтегрує маску-обізнану візуальну витягувачку в свою архітектуру. Це дозволяє точно витягувати візуальні маскові особливості з високороздільних входів.

У цій статті ми обговоримо Оспрей та його архітектуру. Ми також дослідимо створений регіональний текстовий набір даних з понад 700 тисяч зразків та порівняємо його продуктивність у різних завданнях розуміння регіону. Тому давайте почнемо.

Оспрей: Розуміння на рівні пікселів з візуальною настройкою інструкцій

Багатомодальні великі мови моделі, такі як MiniGPT-4, Otter, Qwen-LV, InstructBLIP та інші, є лідерами у розробці загальних візуальних помічників, і вони відомі своїми винятковими багатомодальними та візуальними можливостями генерації. Однак багатомодальні великі мови моделі стикаються з великим викликом, оскільки вони дають незадовільні результати на завданнях тонкого розуміння зображень, таких як підписи, класифікація регіону та розуміння. Основною причиною цієї низької продуктивності на завданнях тонкого розуміння зображень є відсутність вирівнювання на рівні регіону. Недавні MLLM, такі як GPT4RoI, Shikra та інші, спрямовані на забезпечення розуміння на рівні регіону у моделях мови-виду шляхом обробки регіону, визначеного коробкою, та використання візуальної інструкційної настройки з просторовими особливостями на рівні об’єкта.

Хоча підхід до забезпечення розуміння на рівні регіону може покращити продуктивність, використання рідких коробок, що позначають регіони, як вхідних регіональних даних, може вводити незначимі фонові особливості, що призводить до неточного вирівнювання регіональних текстових пар для візуальної інструкційної настройки на великих мови моделях. Під час процесу висновку вхідні регіональні дані на рівні коробки можуть не бути здатні виявити та представити об’єкт точно; це може призвести до семантичного відхилення, як показано на наступному зображенні.

Натомість використання тонких масок замість грубих коробок як вхідних регіональних даних може представляти об’єкти з більшою точністю. Недавно розроблені SAM або Segment Anything Model тренуються на мільярдах високоякісних масок, демонструють видатну якість сегментації на нульових об’єктах та підтримують використання точок або простих коробок як підказок. Однак SAM-фреймворк не може генерувати первинні семантичні мітки, а також не може надавати детальні семантичні підписи та атрибути. Як результат, існуючі моделі не мають вбудованої багатомодальної тонкої інформації, а також обмеженого розуміння сцен у реальному світі.

Щоб подолати виклики, з якими стикаються існуючі MLLM, Оспрей, новий метод навчання інструкцій маски-тексту, спрямований на розширення можливостей багатомодальних великих мови моделей для тонкого розуміння на рівні пікселів. Оспрей вводить маску-обізнану візуальну витягувачку, яка точно витягує візуальні маскові особливості з різною ґрануляцією. Фреймворк потім чередує візуальні особливості з мовними інструкціями для генерації вхідної послідовності для великої мови моделі та використовує конволюційну архітектуру CLIP для полегшення використання високороздільних входів. Завдяки своїй конструкції та архітектурі Оспрей能够 досягти тонкого семантичного розуміння для регіональних областей на рівні об’єкта та частини, а також надавати детальні об’єктні атрибути разом з первинною категорією об’єкта та покращеними описами складних сцен.

Відповідно до можливостей візуальної інструкційної настройки, Оспрей фреймворк дозволяє нові можливості за межами розуміння на рівні зображення та коробки сцен, оскільки Оспрей能够 генерувати тонкі семантики за допомогою клас-агностичних масок з готових SAM. Крім того, Оспрей демонструє видатні можливості у завданнях класифікації об’єктів, відкритої лексики, регіонального підпису та детального опису регіону.

Оспрей: Методологія та архітектура

Наступне зображення демонструє архітектурний огляд Оспрей фреймворку, який складається з великої мови моделі, візуальної витягувачки рівня пікселів та кодувальниці зображення рівня.

Для заданого зображення, вхідної мови та регіональних масок фреймворк виконує конверсію та токенізацію для генерації вкладень перед відправкою мовних вкладень та чередованих маскових особливостей до великої мови моделі для отримання тонкого семантичного розуміння.

Конволюційна CLIP Візуальна Кодувальниця

Візуальна кодувальниця, розгорнута у більшості багатомодальних великих мови моделей, демонструється за допомогою моделі CLIP на основі ViT. Як результат, фреймворк приймає роздільну здатність зображення 224×224 пікселів або 336 x 336 пікселів. Однак використання моделі CLIP на основі ViT робить важким досягнення тонкого розуміння зображень на рівні пікселів, проблема, яку посилює ще більше у малих регіонах. Крім того, обчислювальне навантаження, пов’язане з архітектурою ViT, перешкоджає можливості збільшення роздільної здатності вхідного зображення.

Щоб подолати цей виклик, Оспрей фреймворк реалізує конволюційну модель CLIP як візуальну кодувальницю у своїй архітектурі. Традиційно конволюційні нейронні мережі на основі моделей CLIP демонструють видатні можливості узагальнення за різними входами порівняно з моделями CLIP на основі трансформера. Реалізація моделі CLIP на основі CNN робить можливим швидке висновок та ефективне навчання без компромісу продуктивності моделі. Крім того, модель CLIP на основі CNN能够 генерувати багатомасштабні особливості, які фреймворк потім безпосередньо використовує для витягування особливостей у кожному наступному об’єктному регіоні.

Маскова Обізнана Візуальна Витягувачка

На відміну від існуючих регіональних моделей, які використовують рідкі коробки як вхідні регіональні дані, Оспрей фреймворк використовує детальні регіональні маски для реалізації об’єктних представлень. Оспрей модель використовує маску-обізнану візуальну витягувачку для захоплення особливостей рівня пікселів у кожному об’єктному регіоні. Маскова обізнана візуальна витягувачка кодує візуальні маскові особливості та додатково збирає просторову позиційну інформацію кожного регіону.

Щоб реалізувати це, Оспрей спочатку використовує багаторівневі особливості зображення, згенеровані кодувальницею зображення, для прийняття операції маскового пулінгу, а для кожного рівня особливостей фреймворк пулить всі особливості, що лежать у масковому регіоні. Модель потім кодує особливості по різних рівнях, пропускаючи кожну особливість через лінійний проєкційний шар, який генерує регіональні вкладення, та з’єднує багатозначні особливості шляхом підсумовування. Модель потім використовує шар MLP для генерації візуального маскового токену. Крім того, Оспрей зберігає просторову геометрію об’єктного регіону шляхом кодування піксельного рівня позиційного відношення шляхом реалізації бінарної маски для кожного об’єктного регіону. В кінцевому підсумку Оспрей включає візуальний масковий токен та його відповідні просторові токени для кожного маскового регіонального вкладення.

LLM Токенізація

Як згадувалося раніше, модель витягує вкладення рівня зображення зображення, вводячи його у попередньо натреновану CNN-основану візуальну кодувальницю. Для текстової інформації модель спочатку використовує попередньо натреновані LLM-токенізаційні інструменти для токенізації текстових послідовностей, а потім проєктує ці токенізаційні текстові послідовності у текстові вкладення. Для маскових регіональних даних модель визначає спеціальний токен як місце збереження, а потім заміняє його просторовим токеном разом з масковим токеном. Коли модель посилається на об’єктний регіон у текстовому вході, вона додає місце збереження після імені регіону, що дозволяє масковим регіональним даним змішуватися з текстом без пробілу. Крім того, окрім інструкцій користувача, модель також включає префікс-підказку, спеціальний токен, який служить місцем збереження, який потім заміняється вкладеннями зображення рівня кодувальниці зображення. Нарешті, фреймворк чередує регіональні та зображення рівня візуальні токени разом з текстовими токенами та вводить їх у велику мовну модель для розуміння інструкцій користувача та зображення з різними регіонами у об’єкті.

Оспрей: Триетапний Процес Навчання

Оспрей фреймворк розгортає триетапний процес навчання, у якому кожна з етапів навчання супроводжується мінімізацією втрат передбачення наступного токену.

Етап 1: Навчання Вирівнювання Зображення-Тексту

На першому етапі Оспрей фреймворк розгортає CNN-основану модель CLIP для навчання особливостей рівня зображення та мовного конектору для навчання моделі для вирівнювання особливостей зображення-тексту. На першому етапі фреймворк включає три компоненти: попередньо натреновану велику мовну модель, попередньо натреновану візуальну кодувальницю та проєктор рівня зображення. Фреймворк також приймає шар MLP як візуально-мовний конектор, який допомагає покращувати багатомодальні генеративні можливості Оспрея.

Етап 2: Переднавчання Вирівнювання Маски-Тексту

На другому етапі Оспрей завантажує ваги, натреновані на першому етапі, та використовує свій маску-обізнаний візуальний витягувач для захоплення особливостей рівня пікселів регіональних даних. На другому етапі фреймворк тренує лише маску-обізнану візуальну витягувачку для вирівнювання мовних вкладень з масковими регіональними особливостями. Крім того, модель збирає піксельні маскові пари та короткі тексти з регіональних даних рівня частини та публічно доступних регіональних даних рівня об’єкта, та конвертує їх у дані інструкцій для подальшого навчання моделі.

Етап 3: Кінцеве Тонке Настройування

На третьому та останньому етапі модель фіксує ваги візуальної кодувальниці та тонко налаштовує велику мовну модель, маскові регіональні особливості витягувачки та проєктор рівня зображення компоненти у своїй архітектурі. Основною метою навчання на третьому етапі є розширення можливостей моделі для точного виконання інструкцій користувача та ефективного виконання завдань розуміння регіону рівня пікселів.

Після реалізації трьох етапів навчання Оспрей фреймворк能够 зрозуміти складні сценарії, визначені інструкціями користувача та масковими регіональними даними.

Оспрей: Експериментальні Результати

Щоб оцінити свою продуктивність, розробники Оспрея проводять широкий спектр експериментів для демонстрації можливостей моделі у класифікації, розпізнаванні регіональних даних рівня пікселів та складних описах.

Відкрита Лексика Сегментація

Основною метою відкритої лексичної сегментації є генерація маскової регіональної розпізнавання та її відповідної категорії явно. Для досягнення відкритої лексичної сегментації Оспрей спочатку використовує вхідний текстовий підказ, після чого модель приймає регіональні маскові дані для інтерференції моделі для оцінки продуктивності моделі у відкритій лексичній розпізнаванні завдань. На основі речової відповіді, згенерованої багатомодальною великою мовною моделлю, Оспрей обчислює семантичну схожість між лексичним списком та виходом кожного набору даних. Наступне зображення порівнює Оспрей з сучасними багатомодальними великими мовними моделями.

Як можна побачити, Оспрей фреймворк перевершує існуючі методи на значній відстані як у наборі даних Cityscapes, так і у наборі даних ADE20K-150. Результати свідчать про здатність Оспрея перевершувати існуючі підходи та досягати надійного розуміння та розпізнавання на рівні пікселів регіональних даних об’єктів.

Класифікація Об’єктів, що Посилаються

У завданнях класифікації об’єктів, що посилаються, модель повинна класифікувати об’єкт у певному регіоні зображення. Для оцінки своїх класифікаційних можливостей Оспрей фреймворк використовує два семантичні метрики актуальності, включаючи S-IoU та SS. S-IoU представляє перекриття слів між мітками ґрунтової правди та передбачуваними мітками, тоді як SS вимірює передбачувану та/або ґрунтову правду у семантичному просторі. Наступне зображення демонструє продуктивність Оспрея у завданнях класифікації об’єктів, що посилаються, порівняно з моделями, що використовують підходи рівня коробки та зображення.

Детальний Опис Регіону

У завданнях детального опису регіону модель оцінює свою продуктивність у інструкціях, що слідують, та описах регіональних даних разом з іншими регіональними підходами. Модель випадково вибирає вхідну інферентну підказку з списку попередньо визначених підказок та використовує фреймворк LLM GPT-4 для вимірювання якості відповіді, згенерованої моделлю, порівняно з вхідними регіональними даними у всьому обсязі. Використовуючи інструкційний генеративний трубопровід, модель генерує питання та шукає відповіді GPT-4, після чого LLM оцінює правильність семантики та точність розуміння регіону. Наступна таблиця демонструє продуктивність Оспрея порівняно з сучасними моделями у завданнях детального опису регіону.

Підписи Регіонального Рівня

Оспрей фреймворк також перевершує сучасні підходи у завданнях підписів регіонального рівня, результати яких містяться у наступному зображенні.

Фінальні Думки

У цій статті ми обговорили Оспрей, метод навчання інструкцій маски-тексту з основною метою розширення можливостей MLLM шляхом включення тонких масованих регіональних даних у мовні інструкції для досягнення розуміння мови-виду на рівні пікселів. Для досягнення своєї мети Оспрей створює масковий регіональний текстовий набір даних з понад 700 тисяч зразків та вводить представлення рівня пікселів у великі мови моделі для розробки мови-виду моделі. Оспрей фреймворк спрямований на значне покращення MLLM для тонкого візуального розуміння, а реалізуючи модель CLIP на основі CNN та маску-обізнану візуальну витягувачку, Оспрей能够 зрозуміти зображення на рівні частини та об’єкта.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.