Модели и платформы ИИ

ОРЕЛ: Изучение дизайн-пространства для многомодальных больших языковых моделей с помощью смеси кодировщиков

mm
Добавьте Unite.AI в избранные источники в Google

Способность точно интерпретировать сложную визуальную информацию является важным направлением исследований в области многомодальных больших языковых моделей (MLLM). Недавние работы показывают, что улучшенное визуальное восприятие значительно снижает галлюцинации и улучшает результаты на задачах, чувствительных к разрешению, таких как оптическое распознавание символов и анализ документов. Несколько недавних MLLM достигают этого, используя смесь кодировщиков зрения. Несмотря на их успех, существует недостаток систематических сравнений и подробных исследований, касающихся критических аспектов, таких как выбор экспертов и интеграция нескольких экспертов зрения. Эта статья предоставляет обширное исследование дизайн-пространства для MLLM, использующих смесь кодировщиков зрения и разрешений, и представляет собой каркас ORLE, который пытается изучить дизайн-пространство для многомодальных больших языковых моделей с помощью смеси кодировщиков. Результаты показывают несколько основных принципов, общих для различных существующих стратегий, что приводит к упрощенному, но эффективному подходу к дизайну. ORLE обнаруживает, что простое соединение визуальных токенов из набора дополнительных кодировщиков зрения так же эффективно, как и более сложные архитектуры смешивания или стратегии. Кроме того, ORLE вводит предварительное выравнивание для моста между кодировщиками зрения и языковыми токенами, что улучшает согласованность модели. Полученная семья MLLM, ORLE, превосходит другие ведущие открытые модели на основных бенчмарках MLLM.

Работа ORLE связана с общей архитектурой дизайна многомодальных больших языковых моделей (MLLM). Кроме линии представительных открытых исследований, упомянутых ранее, другие известные семьи MLLM включают, но не ограничиваются, MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini и Llama 3.1. В зависимости от того, как сигналы зрения интегрируются в языковую модель, MLLM можно условно разделить на “кросс-модальные модели внимания” и “модели настройки префикса”. Первые вводят визуальную информацию в различные слои LLM с помощью кросс-модального внимания, тогда как вторые рассматривают визуальные токены как часть последовательности языковых токенов и直接 добавляют их с текстовыми вложениями. Модель ORLE принадлежит к семейству моделей настройки префикса, следующей за архитектурой LLaVA.

Работа ORLE тесно связана с исследованиями, направленными на улучшение дизайна кодировщиков зрения для MLLM. Ранние работы обычно использовали кодировщики зрения, предварительно обученные на задачах выравнивания языка и зрения, таких как CLIP и EVA-CLIP. Более сильные кодировщики зрения, такие как SigLIP и InternVL, были предложены для улучшения задач языка и зрения с помощью лучшего дизайна, более крупных размеров модели и более эффективных рецептов обучения. Поскольку модели часто предварительно обучаются на изображениях с низким разрешением и могут не иметь возможности кодировать тонкие детали, часто выполняется адаптация к более высокому разрешению для увеличения входного разрешения MLLM. Кроме адаптации к более высокому разрешению, модели, такие как LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer и InternVL, используют технологию тайлинга или адаптивного тайлинга для обработки высокоразрешающих входных данных, где изображения делятся на нижние разрешающие патчи и обрабатываются отдельно. Хотя возможность обработки более высоких разрешений становится возможной благодаря введению дополнительных экспертов зрения, этот подход слегка отличается от технологии тайлинга, хотя оба подхода совместимы и могут быть объединены.

ОРЕЛ: Использование смеси кодировщиков для изучения дизайн-пространства для многомодальных LLM

Успех больших языковых моделей (LLM) вызвал значительный интерес к обеспечению их визуального восприятия, позволяя им видеть, понимать и рассуждать в реальном мире. В основе этих многомодальных больших языковых моделей (MLLM) лежит типичный дизайн, в котором изображения преобразуются в серию визуальных токенов кодировщиками зрения и добавляются к текстовым вложениям. CLIP часто выбирается в качестве кодировщика зрения, поскольку его визуальное представление выравнивается с текстовым пространством путем предварительного обучения на парах изображений и текста. В зависимости от архитектур, рецептов обучения и способа введения визуальных токенов в языковую модель, известные семьи MLLM включают Flamingo, BLIP, PaLI, PaLM-E и LLaVA. Большинство этих моделей поддерживают относительно низкие входные разрешения из-за ограничений предварительно обученных кодировщиков зрения и длины последовательности LLM. Работа ORLE тесно связана с моделями, которые используют несколько кодировщиков зрения для улучшения восприятия.

Например, модели, такие как Mousi и Brave, объединяют визуальные токены из разных кодировщиков зрения путем соединения вдоль канала или направления токена. RADIO вводит метод многотехнологического дистилляции для унификации способностей разных кодировщиков зрения в одну модель. MoAI, IVE и Prismer используют вывод кодировщиков экспертов, таких как OCR, обнаружение или оценка глубины, для дополнительной информации для MLLM для генерации ответов. MoVA разрабатывает сеть маршрутизации для назначения оптимальной модели зрения на основе данного изображения и инструкций.

Недавние исследования показали, что более сильные дизайны кодировщиков зрения важны для снижения галлюцинаций MLLM и улучшения результатов на задачах, чувствительных к разрешению, таких как оптическое распознавание символов (OCR). Несколько работ фокусируются на улучшении способностей кодировщика зрения, либо путем масштабирования предварительно обученных данных и параметров, либо путем деления изображений на нижние разрешающие патчи. Однако эти подходы часто вводят большие требования к ресурсам обучения. Эффективная, но мощная стратегия заключается в смешивании визуальных кодировщиков, предварительно обученных на разных задачах и входных разрешениях, либо путем объединения кодировщиков более высокого разрешения с кодировщиком CLIP, либо путем последовательного добавления функций из разных кодировщиков, либо путем принятия более сложных стратегий смешивания и маршрутизации для максимизации преимуществ разных кодировщиков. Этот подход “смеси экспертов зрения” оказался эффективным, хотя подробное исследование его дизайн-пространства с тщательным анализом все еще отсутствует, что мотивирует ORLE вернуться к этому вопросу. Остаются ключевые вопросы: какие комбинации кодировщиков зрения выбрать, как объединить разные экспертов и как скорректировать стратегии обучения с большим количеством кодировщиков зрения.

Для решения этих вопросов ORLE систематически исследует дизайн-пространство смеси кодировщиков зрения для улучшения восприятия MLLM. Изучение этого дизайн-пространства включает следующие шаги: 1) Бенчмаркинг различных кодировщиков зрения и поиск более высокого разрешения; 2) Проведение “яблоко к яблоку” сравнения между стратегиями объединения кодировщиков зрения; 3) Постепенное определение оптимальной комбинации нескольких кодировщиков зрения; 4) Улучшение предварительного выравнивания экспертов зрения и смеси данных. Шаги исследования иллюстрируются на следующем изображении.

Работа ORLE охватывает результаты кодировщиков зрения, предварительно обученных на разных задачах и разрешениях, таких как выравнивание языка и зрения, самообучение, обнаружение, сегментация и OCR. Используя круговой подход, ORLE начинает с базового кодировщика CLIP и добавляет одного дополнительного эксперта за раз, выбирая эксперта, который обеспечивает лучшее улучшение на каждом круге.

Хотя работа ORLE не является первой, которая использует несколько кодировщиков зрения в MLLM, систематическое исследование приводит к нескольким ключевым выводам в этом контексте:

  • Разблокировка кодировщиков зрения во время обучения MLLM имеет значение. Это контрастирует с моделями, такими как LLaVA и другими, которые учитывают несколько кодировщиков зрения или учителей, где замораживание кодировщиков зрения было обычной практикой.
  • Некоторые недавно предложенные стратегии смешивания не показывают значительных преимуществ. Вместо этого прямое соединение каналов возникает как простая, но конкурентоспособная стратегия смешивания, предлагающая лучшую эффективность и результат.
  • Включение дополнительных экспертов зрения приводит к последовательным выигрышам. Это делает его перспективным путем для систематического улучшения восприятия MLLM, помимо масштабирования отдельных кодировщиков. Улучшение особенно выражено, когда кодировщики зрения разблокируются.
  • Этап предварительного выравнивания является ключевым. ORLE вводит этап предварительного выравнивания, на котором не выровненные эксперты зрения индивидуально дообучены с замороженной LLM до их совместного обучения. Этот этап значительно улучшает результаты MLLM в дизайне смеси кодировщиков зрения.

ОРЕЛ: Методология и архитектура

В отличие от предыдущих методов, которые фокусируются на новых парадигмах смешивания или архитектурах кодировщиков зрения, целью ORLE является определение минималистичного дизайна для объединения разных кодировщиков зрения, поддержанного подробными анализами и удалением любых ненужных компонентов. Как показано на следующем рисунке, ORLE начинает с расширения базового кодировщика CLIP до набора экспертов зрения с разными архитектурами, задачами предварительного обучения и разрешениями. С этими экспертами ORLE затем сравнивает разные архитектуры смешивания и исследует, как оптимизировать стратегии предварительного обучения с несколькими кодировщиками.

Наконец, ORLE объединяет все выводы и расширяет подход к нескольким экспертам зрения с разными разрешениями и знаниями домена. Используя те же данные предварительного обучения, что и LLaVA-1.5, которые состоят из 595 тысяч пар изображений и текста, ORLE переходит к этапу настраиваемого обучения, собирая данные из серии задач и преобразуя их в многомодальные разговоры, включая LLaVA-1.5, Laion-GPT4V, ShareGPT-4V, DocVQA, synDog-EN, ChartQA, DVQA и AI2D, в результате чего получается 934 тысячи образцов.

Модель сначала предварительно обучается на парах изображений и текста в течение одного эпохи с размером пакета 256, где вся модель заморожена, и только слой проекции обновляется. На втором этапе модель дообучается на данных настраиваемого обучения в течение одного эпохи с размером пакета 128. Для этого исследования ORLE использует Vicuna-7B в качестве базовой языковой модели. Темпы обучения устанавливаются в 1e-3 для первого этапа и 2e-5 для второго этапа.

Более сильный кодировщик CLIP

ORLE начинает исследование с модели CLIP, поскольку она стала основным выбором для многих MLLM. Хотя модели CLIP известны тем, что улучшают многомодальные задачи, их ограничения также хорошо задокументированы. Например, многие существующие MLLM используют предварительно обученные разрешения CLIP (такие как 224 × 224 или 336 × 336) в качестве входных разрешений. В этих случаях кодировщики часто испытывают трудности с захватом тонких деталей, важных для задач, чувствительных к разрешению, таких как OCR и понимание документов.

Для обработки увеличенного входного разрешения распространенным подходом является тайлинг, при котором входные изображения делятся на тайлы и кодируются отдельно. Другой, более простой метод заключается в прямом масштабировании входного разрешения и интерполяции позиционных вложений модели трансформера зрения, если необходимо. ORLE сравнивает эти два подхода с замороженными и разблокированными кодировщиками зрения на разных разрешениях, и результаты содержатся в таблице выше. Выводы можно суммировать следующим образом:

  • Разблокировка кодировщика CLIP приводит к значительному улучшению при интерполяции до более высокого входного разрешения MLLM, отличного от разрешения предварительного обучения CLIP, без ухудшения результатов, когда разрешения остаются одинаковыми.
  • Замораживание кодировщика CLIP и прямая адаптация его к более высокому входному разрешению MLLM значительно ухудшают результаты.
  • Среди сравниваемых стратегий прямая интерполяция до 448 × 448 с разблокированным кодировщиком CLIP оказывается эффективной и эффективной в плане результатов и затрат.
  • Лучший кодировщик CLIP достигает результатов, близких к InternVL, несмотря на то, что является гораздо меньшей моделью (300M против 6B) с меньшим объемом предварительно обученных данных.

Стоит отметить, что CLIP-448 позволяет ORLE соответствовать настройкам LLaVA-HR и InternVL, где кодировщики CLIP аналогично адаптируются для обработки входных изображений размером 448 × 448 и вывода 1024 патч-токенов. Для дальнейшего исследования ORLE следует простой стратегии масштабирования входного разрешения и разблокировки кодировщика зрения во время обучения.

ORLE наблюдает, что существующие популярные стратегии смешивания, несмотря на вариации дизайна, можно условно разделить на следующие:

  1. Последовательное добавление: Прямое добавление визуальных токенов из разных кодировщиков в качестве более длинной последовательности.
  2. Соединение каналов: Соединение визуальных токенов вдоль канального измерения без увеличения длины последовательности.
  3. LLaVA-HR: Введение высокоразрешающих особенностей в низкоразрешающие кодировщики зрения с помощью адаптера смеси разрешений.
  4. Mini-Gemini: Использование токенов CLIP в качестве низкоразрешающих запросов для кросс-аттенции к другому высокоразрешающему кодировщику зрения в локальных окнах.
  5. Деформированное внимание: Новый бaseline, введенный поверх Mini-Gemini, где обычное окно внимания заменяется деформированным вниманием.

Вместо обучения проектора для одновременного выравнивания нескольких экспертов зрения, как в исходной стратегии предварительного обучения LLaVA, мы сначала выравниваем представление каждого отдельного эксперта с помощью меньшей языковой модели (Vicuna-7B на практике) с помощью надзора предсказания следующего токена. Как показано на следующем рисунке, с предварительным выравниванием, весь процесс обучения состоит из трех шагов: 1) обучение каждого предварительно обученного эксперта зрения с его собственным проектировщиком на данных настраиваемого обучения, сохраняя языковую модель замороженной; 2) объединение всех экспертов зрения из первого шага и обучение только проектировщика с данными пар изображений и текста; 3) обучение всей модели на данных настраиваемого обучения.

ОРЕЛ: Эксперименты и результаты

После тщательного развития своих стратегий ORLE установил следующие принципы для модели: (1) интеграция большего количества экспертов зрения с оптимизированным рецептом обучения; (2) объединение нескольких экспертов зрения путем прямого соединения каналов; (3) предварительное обучение экспертов зрения отдельно через предварительное выравнивание. В этом разделе, чтобы еще больше продемонстрировать преимущества моделей ORLE, включены дополнительные данные обучения, и ORLE сравнивается с текущими лучшими MLLM на различных задачах. ORLE использует Vicuna-v1.5-7B, Llama3-8B и Vicuna-v1.5-13B в качестве языковых моделей. Для кодировщиков зрения модели ORLE обозначаются как ORLE-X4, которые включают четыре кодировщика зрения: CLIP, ConvNeXt, Pix2Struct и EVA-02, и ORLE-X5, которые включают дополнительный кодировщик SAM.

Задачи визуального вопроса и ответа

ORLE сравнивает серию моделей на трех бенчмарках визуального вопроса и ответа (VQA), включая GQA, VQAv2 и VizWiz. Как показано в следующей таблице, ORLE-X5 достигает лучших результатов на GQA и VQAv2, подчеркивая преимущества включения дополнительных экспертов зрения.

Задачи OCR и понимания графиков

Для оценки возможностей OCR, документов и понимания графиков ORLE оценивается на OCRBench, TextVQA и ChartQA. Как показано в таблице выше, ORLE значительно превосходит конкурентов на TextVQA, выигрывая от своей архитектуры высокого разрешения и интеграции разных кодировщиков зрения. Заметно, что ORLE сохраняет простой дизайн, поддерживая до 1024 токенов без необходимости сложной декомпозиции изображений на тайлы.

На следующем рисунке представлены примеры задач OCR и понимания документов. С адаптацией к высокому разрешению и включением большего количества экспертов зрения ORLE может идентифицировать мелкий текст внутри изображений и точно извлекать информацию на основе инструкций пользователя.

Для лучшего понимания преимуществ введения экспертов, обученных на других задачах зрения, следующий рисунок визуализирует результаты модели с только кодировщиками ConvNeXt и CLIP по сравнению с результатами ORLE-X5. С полным набором кодировщиков зрения модель успешно исправляет ошибки, демонстрируя, что даже когда оснащена высокоразрешающими кодировщиками зрения, предварительно обученными на выравнивании языка и зрения, возможности ORLE дополнительно усиливаются включением дополнительных экспертов зрения, обученных на различных задачах зрения.

Многомодальный бенчмарк

ORLE оценивается на семи бенчмарках для MLLM, чтобы продемонстрировать его возможности с разных сторон, включая MME, MMBench, SEED, MathVista, MMMU, ScienceQA и POPE. Конкретно, MME, MMBench и SEED оценивают общую производительность на различных реальных задачах, включающих рассуждение, распознавание, знания и OCR. MMMU фокусируется на сложных задачах из различных доменов, требующих знаний уровня колледжа. POPE оценивает визуальные галлюцинации MLLM. Метрики, используемые в этой оценке, соответствуют настройкам по умолчанию этих бенчмарков. ORLE сообщает балл восприятия для MME, раздел en_dev для MMBench, раздел изображений для SEED, тестовый раздел mini для MathVista, раздел val для MMMU, балл F1 для POPE и балл изображений для ScienceQA, обеспечивая соответствие заявленным результатам других моделей.

Заключительные мысли

В этой статье мы говорили об ORLE, глубоком анализе дизайн-пространства для интеграции кодировщиков зрения в многомодальные большие языковые модели. В отличие от предыдущих работ, которые фокусируются на проектировании новых парадигм смешивания или архитектур кодировщиков зрения, ORLE обнаруживает, что систематические дизайнерские выборы имеют значение и открывает ряд полезных методов. Шаг за шагом, ORLE оптимизирует рецепт обучения отдельных кодировщиков зрения, определяет расширяемый и эффективный метод смешивания и постепенно объединяет кодировщики зрения с разными знаниями домена. Результаты подчеркивают критическую важность основных соображений дизайн-пространства.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.