Моделі та платформи ШІ

Міні-Джеміні: Прискорення багатозадачних моделей мови та зору

mm
Додайте Unite.AI до бажаних джерел у Google

Розробка великих мовних моделей значно прискорила розвиток обробки природної мови, або NLP. Введення трансформерної структури стало етапом, що полегшив розвиток нової хвилі мовних моделей, включаючи OPT і BERT, які демонструють глибоке лінгвістичне розуміння. Крім того, створення моделей GPT, або генераційних попередньо тренованих трансформерів, ввело новий парадигм з автoregresивним моделюванням та встановило надійний метод для мовного передбачення та генерації. Поява мовних моделей, таких як GPT-4, ChatGPT, Mixtral, LLaMA та інших, ще більше прискорила еволюцію, причому кожна модель демонструє покращену продуктивність у завданнях, що включають складну обробку мови. Серед існуючих методів інструктивне налаштування стало ключовим методом для уточнення виводу великих попередньо тренованих мовних моделей, а інтеграція цих моделей з конкретними інструментами для візуальних завдань підкреслила їх адаптивність та відкрила двері для майбутніх застосувань. Ці застосування виходять далеко за рамки традиційної текстової обробки великих мовних моделей та включають багатомодальні взаємодії.

Крім того, злиття природної мови та моделей комп’ютерного зору дало початок моделям мови та зору, або VLM, які поєднують лінгвістичні та візуальні моделі для досягнення міжмодальної компренсії та розуміння. Інтеграція та поява візуальних та лінгвістичних моделей зіграли важливу роль у розвитку завдань, які вимагають як мовної обробки, так і візуального розуміння. Поява революційних моделей, таких як CLIP, ще більше звузила розрив між візуальними завданнями та мовними моделями, демонструючи здійсненність та практичність міжмодальних застосувань. Більш недавні структури, такі як LLaMA та BLIP, використовують спеціально розроблені інструктивні дані для розробки ефективних стратегій, які демонструють потужні можливості моделі. Крім того, поєднання великих мовних моделей з візуальними виводами є фокусом недавніх багатомодальних досліджень, причому останні методи можуть обходити прямої генерації, використовуючи підхід пошуку зображень для генерації візуальних виводів та інтерлейкових текстів.

Відповідно, і попри швидкий розвиток моделей мови та зору, що полегшує базове розуміння та візуальний діалог, все ще існує значущий розрив у продуктивності між просунутими моделями, такими як GPT-4, та моделями мови та зору. Міні-Джеміні є спробою звузити розрив між моделями мови та зору та більш просунутими моделями шляхом розробки потенціалу VLM з трьох аспектів: генерації VLM, високоякісних даних та високорозірених візуальних токенів. Для покращення візуальних токенів структура Міні-Джеміні пропонує використовувати додатковий візуальний кодувальник для високорозіреної обробки без збільшення кількості візуальних токенів. Структура Міні-Джеміні далі створює високоякісний набір даних у спробі сприяти точному розумінню зображень та генерації на основі розуміння. Загалом, структура Міні-Джеміні намагається розробити потенціал моделей мови та зору та спрямована на надання існуючим структурам можливостей розуміння зображень, генерації та розуміння одночасно. Ця стаття має на меті детально розглянути структуру Міні-Джеміні та дослідити механізм, методологію, архітектуру структури та її порівняння з сучасними структурами. Тому почнемо.

Міні-Джеміні: Прискорення багатозадачних моделей мови та зору

За останні роки великі мовні моделі еволюціонували та тепер володіють вражаючими багатомодальними можливостями, ставши невід’ємною частиною сучасних моделей мови та зору. Однак існує розрив між багатомодальною продуктивністю великих мовних моделей та моделями мови та зору, причому останні дослідження шукають способи поєднати зір з великими мовними моделями за допомогою зображень та відео. Для візуальних завдань самої візуальної роздільності є важливим елементом, який явно виражає навколишнє середовище з мінімальними візуальними галюцинаціями. Для звуження розриву дослідники розробляють моделі для покращення візуального розуміння у сучасних моделях мови та зору, а два з найбільш поширених підходів включають збільшення роздільності та збільшення кількості візуальних токенів. Хоча збільшення кількості візуальних токенів з високорозіреними зображеннями дійсно покращує візуальне розуміння, цей підйом часто супроводжується збільшенням обчислювальних вимог та пов’язаних з ними витрат, особливо при обробці кількох зображень. Крім того, можливості існуючих моделей, якість існуючих даних та їх застосуваність залишаються недостатніми для прискореного процесу розробки, залишаючи дослідників із запитанням: “Як прискорити розвиток моделей мови та зору з прийнятними витратами?”

Структура Міні-Джеміні є спробою відповісти на це запитання, оскільки вона намагається дослідити потенціал моделей мови та зору з трьох аспектів: генерації VLM або розширених застосувань, високоякісних даних та високорозірених візуальних токенів. Спочатку структура Міні-Джеміні реалізує архітектуру ConvNet для генерації високорозірених кандидатів ефективно, покращуючи візуальні деталі при збереженні кількості візуальних токенів для великої мовної моделі. Структура Міні-Джеміні поєднує публічно доступні високоякісні набори даних у спробі покращити якість даних та інтегрує ці вдосконалення з сучасними генеративними та великими мовними моделями з метою покращення продуктивності VLM та поліпшення користувацького досвіду. Багатогранна стратегія, реалізована структурою Міні-Джеміні, дозволяє їй дослідити приховані можливості моделей мови та зору та досягти значних успіхів із очевидними обмеженнями ресурсів.

Загалом, структура Міні-Джеміні використовує парадигму “будь-що у будь-що”, оскільки вона здатна обробляти як текст, так і зображення як вхідні та вихідні дані. Зокрема, структура Міні-Джеміні вводить ефективний трубопровід для покращення візуальних токенів для вхідних зображень та включає подвійну систему кодувальників, що складається з двох кодувальників: перший кодувальник призначений для високорозірених зображень, а другий кодувальник призначений для низькоякісної візуальної вкладки. Під час висновку кодувальники працюють у механізмі уваги, де низькорозірений кодувальник генерує візуальні запити, а високорозірений кодувальник надає ключ та значення для посилання. Для покращення якості даних структура Міні-Джеміні збирає та створює більше даних на основі публічних ресурсів, включаючи завдань-орієнтовані інструкції, дані, пов’язані з генерацією, та високорозірені відповіді, причому збільшена кількість та покращена якість покращують загальну продуктивність та можливості моделі. Крім того, структура Міні-Джеміні підтримує одночасну генерацію тексту та зображень у результаті інтеграції моделі мови та зору з просунутими генеративними моделями.

Міні-Джеміні: Методологія та Архітектура

У своїй основі структура Міні-Джеміні концептуально проста та складається з трьох компонентів.

  1. Структура використовує подвійні візуальні кодувальники для надання низькорозірених візуальних вкладок та високорозірених кандидатів.
  2. Структура пропонує реалізувати видобування інформації про патчі для проведення видобування на рівні патчів між низькорозіреними візуальними запитами та високорозіреними регіонами.
  3. Структура Міні-Джеміні використовує велику мовну модель для поєднання тексту з зображеннями як для генерації, так і для розуміння одночасно.

Повійні Візуальні Кодувальники

Структура Міні-Джеміні може обробляти як текстові, так і зображенні вхідні дані, з можливістю обробляти їх окремо або у поєднанні. Як показано на наступному зображенні, структура Міні-Джеміні починає процес із застосуванням білінійної інтерполяції для генерації низькорозіреного зображення з відповідного високорозіреного зображення.

Структура потім обробляє ці зображення та кодує їх у багаторозмірну візуальну вкладку у двох паралельних потоках зображень. Більш конкретно, структура Міні-Джеміні зберігає традиційний трубопровід для низькорозірених потоків та використовує попередньо тренований візуальний трансформер для кодування візуальних вкладок, що дозволяє моделі зберегти довгозахватну взаємодію між візуальними патчами для подальших взаємодій у великих мовних моделях. Для високорозірених потоків структура Міні-Джеміні приймає кодувальник на основі CNN або конволюційної нейронної мережі для адаптивної та ефективної обробки високорозірених зображень.

Видобування Інформації Про Патчі

З подвійними візуальними кодувальниками, що генерують низькорозірені вкладки та високорозірені особливості, структура Міні-Джеміні пропонує реалізувати видобування інформації про патчі з метою розширення потенціалу моделей мови та зору з покращеними візуальними токенами. Для збереження кількості візуальних токенів для ефективності у великих мовних моделях структура Міні-Джеміні приймає низькорозірені візуальні вкладки як запит та намагається витягнути відповідні візуальні підказки з високорозірених особливостей кандидатів, причому структура приймає високорозірену особливість як ключ та значення.

Як показано на вищезазначеному зображенні, формула охоплює процес уточнення та синтезу візуальних підказок, що призводить до генерації просунутих візуальних токенів для подальшої обробки великими мовними моделями. Процес забезпечує, що структура能够 обмежити видобування для кожного запиту до його відповідної підобласті у високорозіреній особливості з піксельною особливістю, що призводить до покращеної ефективності. Завдяки цьому дизайну структура Міні-Джеміні здатна витягнути високорозірені особливості без збільшення кількості візуальних токенів та зберігає баланс між обчислювальною здійсненністю та багатством деталей.

Генерація Тексту та Зображення

Структура Міні-Джеміні поєднує візуальні токени та вхідні текстові токени як вхідні дані для великих мовних моделей для автoregresивної генерації. На відміну від традиційних моделей мови та зору, структура Міні-Джеміні підтримує генерацію лише тексту, а також генерацію тексту та зображення як вхідних та вихідних даних, тобто будь-яке у будь-що висновок, і це результат видатного розуміння зображень та тексту та розуміння, що дозволяє Міні-Джеміні генерувати високоякісні зображення. На відміну від останніх робіт, що фокусуються на розриві між текстовими вкладками генераційних моделей та великими мовними моделями, структура Міні-Джеміні намагається оптимізувати розрив у домені мовних підказок, перекладаючи інструкції користувача у високоякісні підказки, що генерують контекстно-відповідні зображення у моделях латентного розсіювання. Крім того, для кращого розуміння інструктивного налаштування та міжмодальної відповідності структура Міні-Джеміні збирає зразки з публічно доступних високоякісних наборів даних та використовує структуру GPT-4 Turbo для подальшої побудови набору даних із 13 тисяч інструкцій для підтримки генерації зображень.

Міні-Джеміні: Експерименти та Результати

Для оцінки своєї продуктивності структура Міні-Джеміні реалізується з попередньо тренованою структурою ConvNext-L для високорозіреного візуального кодувальника та з попередньо тренованим візуальним трансформером для низькорозіреного візуального кодувальника. Для забезпечення ефективності тренування структура Міні-Джеміні зберігає два візуальні кодувальники фіксованими та оптимізує проєктори видобування інформації про патчі на всіх стадіях та оптимізує велику мовну модель під час стадії інструктивного налаштування.

Наступна таблиця порівнює продуктивність структури Міні-Джеміні з сучасними моделями у різних умовах та також враховує приватні моделі. Як можна побачити, Міні-Джеміні перевершує існуючі структури у широкому діапазоні великих мовних моделей, демонструючи вищу продуктивність при конфігурації з Gemma-2B у категорії ефективних моделей. Крім того, коли використовуються більші великі мовні моделі, масштабованість структури Міні-Джеміні є очевидною.

Для оцінки своєї продуктивності на високій роздільності та розширених візуальних токенах експерименти проводяться з вхідним розміром 672 для низькорозіреного візуального кодувальника та 1536 для візуального кодувальника. Як згадувалося раніше, основною метою високорозіреного візуального кодувальника є надання високорозіреної кандидатної інформації. Як можна побачити, структура Міні-Джеміні демонструє вищу продуктивність порівняно з сучасними структурами.

Крім того, для оцінки візуальної компренсії структури Міні-Джеміні у реальних умовах розробники застосовують модель до різноманітних завдань розуміння та виводу, як показано на наступному зображенні. Як можна побачити, Міні-Джеміні здатна розв’язувати широкий спектр складних завдань завдяки реалізації видобування інформації про патчі та високоякісних даних. Але що ще більш вражаюче, так це те, що Міні-Джеміні демонструє тонке розуміння деталей, що виходить за рамки простої розпізнавальної здатності, та описує складні елементи детально.

Наступна фігура надає всебічну оцінку генеративних можливостей структури Міні-Джеміні.

Порівняно з останніми моделями, такими як ChatIllusion та AnyGPT, Міні-Джеміні демонструє сильніше багатомодальне розуміння, що дозволяє їй генерувати текст-ізображення-капці, які краще відповідають вхідним інструкціям, та результати у вигляді зображення-текстових відповідей з сильнішою концептуальною подібністю. Що ще більш вражаюче, так це те, що Міні-Джеміні демонструє видатну майстерність у генерації високоякісного контенту за допомогою багатомодальної інструкції людини лише з текстовими тренувальними даними, що демонструє її надійне семантичне розуміння та зображення-текстову відповідність.

Фінальні Думки

У цій статті ми говорили про Міні-Джеміні, потужну та оптимізовану структуру для багатомодальних моделей мови та зору. Основною метою структури Міні-Джеміні є розробка прихованого потенціалу моделей мови та зору за допомогою високоякісних даних, стратегічного дизайну структури та розширення функціонального обсягу. Міні-Джеміні є спробою звузити розрив між моделями мови та зору та більш просунутими моделями шляхом розробки потенціалу VLM з трьох аспектів: генерації VLM, високоякісних даних та високорозірених візуальних токенів. Для покращення візуальних токенів структура Міні-Джеміні пропонує використовувати додатковий візуальний кодувальник для високорозіреної обробки без збільшення кількості візуальних токенів. Структура Міні-Джеміні далі створює високоякісний набір даних у спробі сприяти точному розумінню зображень та генерації на основі розуміння. Загалом, структура Міні-Джеміні намагається розробити потенціал моделей мови та зору та спрямована на надання існуючим структурам можливостей розуміння зображень, генерації та розуміння одночасно.

Kunal Kejriwal — бекенд‑інженер, який спеціалізується на Python, PostgreSQL, Redis та хмарній інфраструктурі в GCP і AWS. Має три роки досвіду у створенні та масштабуванні виробничих систем, пише про інфраструктуру ШІ, розподілені системи та архітектуру розгортання навантажень машинного навчання.