Моделі та платформи ШІ

Ferret: Надзвичайна продуктивність у завданнях посилання та прив’язки

mm
Додайте Unite.AI до бажаних джерел у Google

Надання простору розуміння у моделях навчання мови та зору залишається основним дослідницьким викликом. Це розуміння підтримує дві важливі можливості: прив’язку та посилання. Посилання дозволяє моделі точно інтерпретувати семантику конкретних регіонів, тоді як прив’язка полягає у використанні семантичних описів для локалізації цих регіонів.

Розробники представили Ferret, багатозадачну велику мовну модель (MLLM), здатну розуміти просторове посилання через будь-яку гранулярність або форму в зображенні та точно прив’язувати відкриті описи словника. Ferret використовує нову гібридну репрезентацію, що поєднує безперервні візуальні особливості та дискретні координати для представлення регіону зображення. Її просторово-чутливий візуальний зразок обробляє різну щільність форм, що дозволяє їй обробляти різні регіональні входи, такі як вільні форми, обмежувальні рамки та точки.

Підхід Ferret дозволяє їй excelling у класичних завданнях прив’язки та посилання та перевершувати інші MLLM у завданнях локалізації та регіональному багатомодальному спілкуванні. Ця стаття глибоко вивчає архітектуру та методологію Ferret, підкреслюючи її вражаючу продуктивність у різних багатомодальних мовних завданнях. Давайте глибше вивчимо це.

Ferret: Надзвичайна продуктивність у завданнях посилання та прив’язки

Посилання у моделі – це можливість, що дозволяє моделі зрозуміти семантику даних конкретних регіонів, тоді як прив’язка робить її важливою для моделі використовувати дані семантичні описи для локалізації цих регіонів. Хоча вони можуть відрізнятися своїми завданнями, обидва посилання та прив’язка мають одну й ту ж фундаментальну концепцію: вирівнювання просторової семантики та інформації. Однак, попри те, що вони мають одну й ту ж концепцію, існуючі моделі вивчають прив’язку та посилання окремо. Хоча цей метод працює, він створює перепону у досягненні людських можливостей, оскільки люди можуть вивчати одну задачу та застосовувати знання до інших задач без зусиль та легко інтегрувати можливості прив’язки/посилання з розумуванням та щоденним діалогом. Фреймворк Ferret черпає натхнення з цієї прогалини в існуючих фреймворках MLLM та вивчає три основні питання:

  1. Як уніфікувати можливості прив’язки та посилання у фреймворку, і як їхнє союз буде взаємно корисним?
  2. Люди використовують різні типи регіонів, такі як коробка, точка, малювання, вільні форми для посилання? Як представити ці різні регіони?
  3. Як зробити прив’язку та посилання інструктивними, надійними та відкритими словниковими, що критично важливо для їх практичних та реальних застосувань?

Фреймворк Ferret – це нова багатозадачна велика мовна модель, що намагається відповісти на ці питання. Фреймворк Ferret обирає MLLM як свою основу через їхню вражаючу глобальну візію та мовне розуміння. Крім того, для уніфікації можливостей прив’язки та посилання фреймворк Ferret представляє координати регіонів у природній мовній числовій формі. Однак на практиці неефективно використовувати координати коробки або навіть окремі точки для представлення різних форм регіону, таких як малювання, штрихи або складні полігони, оскільки ці форми критично важливі для підвищення точності та більш універсального людського-модельного взаємодії. Для вирішення цієї проблеми фреймворк Ferret використовує просторово-чутливий візуальний зразок, який отримує візуальні регіони для регіонів незалежно від форми, тим самим перемовляючись з різною щільністю цих форм. Потім фреймворк поєднує безперервні візуальні особливості з дискретними координатами для представлення візуальних регіонів у вході, що призводить до створення гібридної регіональної репрезентації у Ferret.

Фреймворк Ferret використовує вищеописані методи для вирішення входів, що поєднують вільний текст з посиленими регіонами, і здатний безперешкодно генерувати координати для кожного прив’язуваного об’єкта з генеруванням тексту для прив’язки згаданих об’єктів у виводі. Таким чином, Ferret є першою моделлю, що обробляє вільні регіони входу у багатозадачних великих мовних моделях. Крім того, фреймворк Ferret поглинає вражаючі відкриті словникові можливості просторової локалізації та розуміння, що дозволяє фреймворку досягнути надзвичайної продуктивності при оцінці традиційних завдань прив’язки та посилання.

Далі фреймворк Ferret черпає натхнення з трьох існуючих фреймворків штучного інтелекту, включаючи багатозадачні великі мовні моделі, MLLM для посилання та прив’язки, а також уніфікацію прив’язки та візуального розуміння.

Введення великих мовних моделей, включаючи GPT, DALL-E, PaLM, LLaMA та BLOOM, змінило ландшафт досліджень у галузі обробки природної мови, що призвело до значних досягнень у багатомодальних мовних моделях. Раніші багатомодальні мовні моделі зосереджувалися переважно на великомасштабному генеруванні зображень та тексту з деякими помітними прикладами, такими як PaLI, SimVLM, GIT, BLIP-2, FLAMINGO, CM3 та PaLI-X. Однак після того, як фреймворк Flamingo досяг ефективної інтеграції великих мовних моделей з попередньо навченим кодувальником зображень CLIP через блоки крос-гейтед уваги, що призвело до вражаючих багатомодальних можливостей навчання з декількома зразками. Поточні дослідження шукають способи використання попередньо навчених великих мовних моделей для візуальної інструктивної настройки з помітними прикладами, такими як MiniGPT-4, Otter, InstructBLIP та інші. Що ще важливіше, останні моделі, такі як Emu та GILL, показали вражаючий успіх у використанні MLLM для генерації зображень та пошуку зображень. Фреймворк Ferret також посилається на попередні дослідження, які зосереджуються на уніфікації текстових та обмежувальних коробок виводу для моделей мови та зору.

Ferret: Методологія та архітектура

Гібридні регіональні репрезентації

Точка, коробка та вільні форми – три домінуючі формати, які мовна модель використовує при посиланні на конкретні регіони. З одного боку, точка та коробка можуть бути точно представлені координатами, проте відображення вільних форм є складним завданням, оскільки вільні форми можуть охоплювати широкий спектр регіонів, включаючи маски, полігони та штрихи. Використання координат для опису вільних форм – це складне завдання, яке заважає моделі вивчати кореляцію між регіонами та відповідними координатами. Крім того, використання координат для вільних форм обчислювально дороге та неясне.

Для вирішення цієї проблеми та універсалізації усіх трьох форматів фреймворк Ferret пропонує гібридну регіональну репрезентацію, що поєднує безперервні візуальні особливості з дискретними координатами для посилання на конкретний регіон.

Для безперервних візуальних особливостей для заданого регіону фреймворк Ferret спочатку створює двовимірну бінарну маску такого ж розміру, як зображення, і позначає значення 1 всередині цільового регіону, тоді як поза регіоном присвоює значення 0. Потім модель витягує бінарну маску разом з витягнутими особливостями зображення та надсилає її до просторово-чутливого візуального зразка.

Архітектура

Архітектура моделі Ferret складається з трьох основних компонентів

  1. Кодувальник зображення для витягування вкладень зображення.
  2. Просторово-чутливий візуальний зразок для витягування регіональних безперервних особливостей.
  3. Велика мовна модель для спільного моделювання тексту, зображення та регіональних особливостей.

Зображення спочатку подається у попередньо навчений візуальний кодувальник для витягування вкладень зображення. Для текстових входів фреймворк спочатку використовує попередньо навчений токенізаційний інструмент великої мовної моделі для токенізації текстової послідовності, а потім проєктує ці токени у текстові вкладення. Для посилених регіонів Ferret додає спеціальний токен та координати як зайвий символ для безперервних особливостей після назви регіону. Якщо назва регіону невідома або складна для опису через включення кількох об’єктів, фреймворк просто використовує назву області або назву регіону.

Одним із основних викликів, пов’язаних з посиленими регіонами, є те, що їхня форма може бути досить різною, тобто вони можуть мати різні форми, і не обмежуються лише прямокутними коробками або точками. Регіони з нерівними формами не можуть бути оброблені традиційними методами, такими як ґратчаста обробка, включаючи увагу до патчів або конволюційні техніки. Для вирішення цієї проблеми фреймворк Ferret пропонує просторово-чутливий візуальний зразок. Для заданої витягнутої особливості з бінарною маскою регіону модель Ferret спочатку випадково вибірково вибирає N кількість точок всередині бінарної маски регіону.

Для кожної окремої точки модель отримує її особливість шляхом виконання білінійної інтерполяції. N точок потім подаються у каскад блоків, кожний з яких проходить через три різні стадії: вибірковий, збори та пулінг. На стадії вибіркового вибору фіксована кількість точок вибирається з N кількості доступних точок за допомогою алгоритму FPS або алгоритму вибіркового вибору, який гарантує достатню покриття. На другій стадії для кожної вибраної точки фреймворк шукає її k найближчих сусідів з пулу доступних N точок. Для кожної групи модель потім об’єднує особливості вибраної точки з особливостями її сусідів. На останній стадії фреймворк Ferret проводить максимальний пулінг для об’єднання k особливостей сусідів у одну особливість, яка служить представленням для вибраної точки. Виконуючи ці три стадії, фреймворк Ferret залишається з меншою кількістю точок, але з особливостями простору з вищою щільністю, оскільки він не тільки включає особливості місцевих сусідів, але й їхні відносні позиції.

GPT-допоміжна візуальна генерація даних

Дані налаштування діалогових інструкцій мають критичне значення для багатозадачних великих мовних моделей, оскільки вони не тільки допомагають перетворити існуючі набори даних за допомогою шаблонів, але й допомагають моделі зрозуміти людську намірення та генерувати відповідну реакцію. Більшість MLLM використовують метод vài-зразкової інструкції для отримання візуальних інструктивних даних, де модель надає текстовий опис сцен у зображенні разом з людськими анотованими діалогами як vài-зразкові демонстрації. Однак існуючі інструктивні методи зосереджуються переважно на описі всього зображення без явного вказання просторової інформації. Фреймворк Ferret підкреслює регіональні знання для збору інструктивних даних посилання та прив’язки у трьох стадіях.

  1. Крім використання глобальних підписів та об’єктів, фреймворк надає символічний опис сцени, який описує фізичні відносини між підписами регіону та об’єктами, а також їхні координати.
  2. Для людських анотованих діалогів фреймворк додає координати після прив’язуваних об’єктів або регіонів у вході або виході, або в обох, з діалогами, що зосереджуються переважно на конкретних регіонах, що допомагає мовній моделі імпліцитно слідувати подібним шаблонам для генерації нових діалогів.
  3. Може статися, що діалог, згенерований фреймворком, не буде слідувати правилам та шаблонам, встановленим vài-зразковими прикладами та системними запитами. Для вирішення цієї проблеми фреймворк знову використовує мовну модель для уточнення діалогів, згенерованих моделлю спочатку.

Просторова негативна гірнича справа

Попередні дослідження показали, що багатозадачні великі мовні моделі мають високу ймовірність галюцинації при відповіді на питання типу “Так” чи “Ні”. Для запобігання тому, щоб модель Ferret не галюцинувала у подібних умовах, фреймворк використовує підхід просторової негативної гірничої справи з локалізацією категорій, умовленою зображенням, та семантично-умовленою локалізацією категорій. Обидва ці методи запитують у моделі локалізацію конкретних категорій об’єктів, що дозволяє моделі визнати відсутність певних об’єктів у зображенні.

Ferret: Результати та експериментування

Для аналізу своєї продуктивності фреймворк Ferret оцінюється на традиційних завданнях прив’язки та посилання після чого фреймворк оцінюється у більш складному багатомодальному завданні спілкування та тестуванні його можливостей посилання та прив’язки.

Можливість моделі зрозуміти посилання оцінюється тим, наскільки точно модель може зрозуміти семантику посиленого регіону, даного регіону у зображенні або запитанні. Для вимірювання точності моделі спочатку розглядаються об’єкти, найбільш базова семантика, оскільки це не тільки фундаментально, але й легко визначити. Для імітації людської універсальності фреймворк замінює розташування об’єкта всередині зображення вільною формою, коробкою та точкою. Для вільної форми модель випадково генерує штрихи всередині об’єкта Ground Truth для симуляції. Для коробки фреймворк Ferret використовує обмежувальну коробку Ground Truth, надану компонентом LVIS. Нарешті, для точки модель випадково вибірково вибирає точку всередині об’єкта Ground Truth, яка також знаходиться біля межі об’єкта Ground Truth. Результати на трьох типах посилань демонструються у наступному зображенні.

Фреймворк Ferret демонструє вражаючу продуктивність у діалогових завданнях посилання, що робить його придатним для інтеграції з різними візуальними завданнями навчання, особливо з тими, які мають прив’язку виводу. Для оцінки його можливостей прив’язки фреймворк Ferret спочатку піддається візуальним завданням прив’язки з генеративним парадигмою. Потім фреймворк оцінює свою здатність у завданнях прив’язки підписів для вимірювання вирівнювання між регіонами та словами.

У візуальних завданнях прив’язки фреймворк намагається прив’язати мовні запити до вирівнених регіонів зображення, і, як можна побачити у наступному зображенні, фреймворк Ferret демонструє вражаючу продуктивність у всіх завданнях, і продуктивність порівнянна з тією, яку досягають спеціалізовані методи тонкої настройки.

Для завдань прив’язки підписів модель повинна генерувати підпис, а потім прив’язати згенеровані іменні фрази до регіону зображення. Останнє передбачення, зроблене моделлю, складається з трьох компонентів: візуальні регіони у вигляді коробок, текстові підписи та прив’язки між коробками та словами. Результати демонструються у наступному зображенні, і, як можна побачити, фреймворк доставляє продуктивність, порівнянну з державними методами.

Нарешті, багатомодальне спілкування є однією з найбільш бажаних можливостей у багатозадачній великій мовній моделі, і існуючі MLLM переважно оцінюють детальні описи, розмови та складне розуміння з мовною моделлю як суддею. Однак, оскільки немає набору даних, який оцінює багатомодальне спілкування з обов’язковими діями посилання або прив’язки, це залишає прогалину. Для закриття цієї прогалини фреймворк Ferret охоплює три регіональні питання для оцінки його можливостей посилання та прив’язки у багатомодальному завданні спілкування.

Нарешті, фреймворк Ferret порівнюється безпосередньо з державною мовною моделлю GPT, і результати демонструються нижче.

Остаточні думки

У цій статті ми говорили про Ferret, багатозадачну велику мовну модель, яка демонструє вражаючі можливості прив’язки та посилання. Фреймворк Ferret може посилатися на регіони зображення незалежно від їхньої форми та може встановлювати прив’язку для тексту, передбаченого моделлю автоматично. Фреймворк Ferret використовує просторово-чутливий візуальний зразок, здатний обробляти різну щільність, демонструє різні форми, для витягування безперервних особливостей універсальних регіонів. Як результат, фреймворк Ferret може обробляти різні регіональні входи, включаючи вільні форми, обмежувальні коробки та точки.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.