Модели и платформы ИИ
Мини-Джемини: Ускорение Мультимодальных Моделей Языка и Видения
Прогресс в области больших языковых моделей существенно ускорил развитие обработки естественного языка, или NLP. Введение фреймворка трансформера стало важной вехой, облегчив разработку новой волны языковых моделей, включая OPT и BERT, которые демонстрируют глубокое лингвистическое понимание. Кроме того, появление GPT, или генеративных предварительно обученных трансформерных моделей, ввело новую парадигму с автoregressивной моделью и установило прочный метод для языкового прогнозирования и генерации. Появление языковых моделей, таких как GPT-4, ChatGPT, Mixtral, LLaMA и других, еще больше ускорило эволюцию, причем каждая модель демонстрирует улучшенную производительность в задачах, связанных с сложной обработкой языка. Среди существующих методов настройка инструкций стала ключевым методом для совершенствования вывода предварительно обученных больших языковых моделей, и интеграция этих моделей с конкретными инструментами для визуальных задач подчеркнула их адаптивность и открыла двери для будущих применений. Эти применения далеко выходят за рамки традиционной текстовой обработки LLM до включения мультимодальных взаимодействий.
Кроме того, слияние обработки естественного языка и моделей компьютерного зрения привело к появлению VLM, или моделей языка и видения, которые объединяют лингвистические и визуальные модели для достижения межмодальной компрехенсии и возможностей рассуждения. Интеграция и появление визуальных и лингвистических моделей сыграли решающую роль в продвижении задач, требующих как обработки языка, так и визуального понимания. Появление революционных моделей, таких как CLIP, еще больше сократило разрыв между задачами видения и языковыми моделями, продемонстрировав осуществимость и практичность межмодальных применений. Более недавние фреймворки, такие как LLaMA и BLIP, используют адаптированные инструкционные данные для разработки эффективных стратегий, демонстрирующих мощные возможности модели. Кроме того, объединение больших языковых моделей с изображениями является фокусом недавних мультимодальных исследований, причем недавние методы могут обходить прямую генерацию, используя подход извлечения изображений для производства изображений и перемежающихся текстов.

Учитывая все вышесказанное, и несмотря на быстрые достижения в моделях языка и видения, обеспечивающих базовое рассуждение и визуальный диалог, все еще существует значенный разрыв в производительности между передовыми моделями, такими как GPT-4, и моделями языка и видения. Мини-Джемини является попыткой сократить разрыв между моделями языка и видения и более продвинутыми моделями путем изучения потенциала VLM с трех сторон: руководство VLM-генерацией, высококачественными данными и высокоразрешающими визуальными токенами. Для улучшения визуальных токенов фреймворк Мини-Джемини предлагает использовать дополнительный визуальный кодировщик для высокоразрешающей доработки без увеличения количества визуальных токенов. Фреймворк Мини-Джемини далее создает высококачественную базу данных в попытке содействовать точному пониманию изображений и генерации на основе рассуждений. В целом, фреймворк Мини-Джемини стремится изучить потенциал моделей языка и видения и направлен на обеспечение существующих фреймворков возможностями рассуждения изображений, понимания и генерации одновременно. Эта статья направлена на подробное освещение фреймворка Мини-Джемини и мы исследуем механизм, методологию, архитектуру фреймворка, а также его сравнение с передовыми фреймворками. Итак, начнем.
Мини-Джемини: Ускорение Мультимодальных Моделей Языка и Видения
За годы большие языковые модели эволюционировали и теперь обладают замечательными мультимодальными возможностями, становясь важной частью текущих моделей языка и видения. Однако существует разрыв между мультимодальной производительностью больших языковых моделей и моделей языка и видения, причем недавние исследования ищут способы объединения видения с большими языковыми моделями с помощью изображений и видео. Для задач видения само по себе разрешение изображения является важным элементом для явного окружающей среды с минимальными визуальными галлюцинациями. Чтобы сократить разрыв, исследователи разрабатывают модели для улучшения визуального понимания в текущих моделях языка и видения, и два наиболее распространенных подхода – это увеличение разрешения и увеличение количества визуальных токенов. Хотя увеличение количества визуальных токенов с более высоким разрешением изображений действительно улучшает визуальное понимание, этот рост часто сопровождается повышенными вычислительными требованиями и связанными затратами, особенно при обработке нескольких изображений. Кроме того, возможности существующих моделей, качество существующих данных и применимость остаются недостаточными для ускоренного процесса разработки, оставляя исследователей с вопросом: “как ускорить разработку моделей языка и видения с приемлемыми затратами”?
Фреймворк Мини-Джемини является попыткой ответить на этот вопрос, поскольку он стремится изучить потенциал моделей языка и видения с трех сторон: руководство VLM-генерацией или расширенными приложениями, высококачественными данными и высокоразрешающими визуальными токенами. Сначала фреймворк Мини-Джемини реализует архитектуру ConvNet для эффективной генерации высокоразрешающих кандидатов, улучшая визуальные детали при сохранении количества визуальных токенов для большой языковой модели. Фреймворк Мини-Джемини объединяет публично доступные высококачественные базы данных в попытке улучшить качество данных и интегрирует эти улучшения с передовыми генеративными и большими языковыми моделями с целью улучшения производительности VLM и улучшения пользовательского опыта. Многофакторная стратегия, реализованная фреймворком Мини-Джемини, позволяет ему изучить скрытые возможности моделей языка и видения и достигает значительных достижений с очевидными ограничениями ресурсов.

В целом, фреймворк Мини-Джемини использует парадигму “любой к любому”, поскольку он способен обрабатывать как текст, так и изображения как входные и выходные данные. В частности, фреймворк Мини-Джемини вводит эффективный конвейер для улучшения визуальных токенов для входных изображений и включает двойную систему кодировщиков, состоящую из двух кодировщиков: первый кодировщик предназначен для высокоразрешающих изображений, а второй кодировщик – для низкокачественных визуальных вложений. Во время вывода кодировщики работают в механизме внимания, где низкоразрешающий кодировщик генерирует визуальные запросы, а высокоразрешающий кодировщик предоставляет ключ и значения для справки. Для улучшения качества данных фреймворк Мини-Джемини собирает и производит больше данных на основе публичных ресурсов, включая инструкции, ориентированные на задачи, данные, связанные с генерацией, и высокоразрешающие ответы, причем увеличение количества и улучшение качества улучшают общую производительность и возможности модели. Кроме того, фреймворк Мини-Джемини поддерживает параллельную генерацию текста и изображений в результате интеграции модели языка и видения с передовыми генеративными моделями.
Мини-Джемини: Методология и Архитектура
В своей основе фреймворк Мини-Джемини концептуально прост и состоит из трех компонентов.
- Фреймворк использует двойные визуальные кодировщики для предоставления низкокачественных визуальных вложений и высокоразрешающих кандидатов.
- Фреймворк предлагает реализовать извлечение информации о патчах для проведения извлечения на уровне патчей между низкокачественными визуальными запросами и высокоразрешающими регионами.
- Фреймворк Мини-Джемини использует большую языковую модель для объединения текста с изображениями как для генерации, так и для понимания одновременно.
Двойные Визуальные Кодировщики
Фреймворк Мини-Джемини может обрабатывать как текстовые, так и изображения-входные данные, с возможностью обрабатывать их отдельно или в комбинации. Как показано на следующем изображении, фреймворк Мини-Джемини начинает процесс, используя билинейную интерполяцию для генерации низкокачественного изображения из соответствующего высокоразрешающего изображения.

Затем фреймворк обрабатывает эти изображения и кодирует их в многоячеичное визуальное вложение в двух параллельных потоках изображений. Более конкретно, фреймворк Мини-Джемини сохраняет традиционный конвейер для низкокачественных потоков и использует предварительно обученный Visual Transformer для кодирования визуальных вложений, облегчая модели сохранять долгосрочные отношения между визуальными патчами для последующих взаимодействий в больших языковых моделях. Для высокоразрешающих потоков фреймворк Мини-Джемини принимает кодировщик на основе CNN или свёрточной нейронной сети для адаптивной и эффективной обработки высокоразрешающих изображений.
Извлечение Информации о Патчах
С двойными визуальными кодировщиками, генерирующими низкокачественные вложения и высокоразрешающие функции, фреймворк Мини-Джемини предлагает реализовать извлечение информации о патчах с целью расширения потенциала моделей языка и видения с улучшенными визуальными токенами. Чтобы сохранить количество визуальных токенов для эффективности в больших языковых моделях, фреймворк Мини-Джемини принимает низкокачественные визуальные вложения в качестве запроса и стремится извлечь соответствующие визуальные подсказки из высокоразрешающих функций-кандидатов, причем фреймворк принимает функцию высокоразрешающего вложения в качестве ключа и значения.

Как показано на изображении выше, формула обобщает процесс уточнения и синтеза визуальных подсказок, что приводит к генерации передовых визуальных токенов для последующей обработки больших языковых моделей. Процесс обеспечивает, что фреймворк может ограничить извлечение для каждого запроса до его соответствующего подрегиона в функции высокоразрешающего вложения с количеством пиксельных функций, в результате чего улучшается эффективность. Благодаря этому дизайну фреймворк Мини-Джемини может извлечь высокоразрешающие функциональные детали без увеличения количества визуальных токенов и сохраняет баланс между вычислительной осуществимостью и богатством деталей.
Генерация Текста и Изображений
Фреймворк Мини-Джемини объединяет визуальные токены и входные текстовые токены в качестве входных данных для больших языковых моделей для автoregressивной генерации. В отличие от традиционных моделей языка и видения, фреймворк Мини-Джемини поддерживает как текстовые, так и текстово-изображенные входные и выходные данные, т. е. любая к любой вывод, и это результат исключительных возможностей понимания изображений и текста и рассуждений, Мини-Джемини может генерировать высококачественные изображения. В отличие от недавних работ, которые фокусируются на разрыве между текстовыми вложениями моделей генерации и больших языковых моделей, фреймворк Мини-Джемини стремится оптимизировать разрыв в области языковых подсказок, переводя пользовательские инструкции в высококачественные подсказки, которые производят контекстно-релевантные изображения в моделях латентного распространения. Кроме того, для лучшего понимания настройки инструкций и межмодальной выравнивания фреймворк Мини-Джемини собирает образцы из публично доступных высококачественных баз данных и использует фреймворк GPT-4 Turbo для дальнейшего создания набора данных из 13 000 инструкций для поддержки генерации изображений.

Мини-Джемини: Эксперименты и Результаты
Чтобы оценить свою производительность, фреймворк Мини-Джемини реализуется с предварительно обученным фреймворком ConvNext-L для кодировщика высокоразрешающего видения и с предварительно обученным Visual Transformer для кодировщика низкокачественного видения. Чтобы обеспечить эффективность обучения, фреймворк Мини-Джемини сохраняет два визуальных кодировщика фиксированными и оптимизирует проектировщиков извлечения информации о патчах на всех стадиях, и оптимизирует большую языковую модель во время стадии настройки инструкций.

Следующая таблица сравнивает производительность фреймворка Мини-Джемини с передовыми моделями в различных условиях, а также учитывает частные модели. Как можно наблюдать, Мини-Джемини превосходит существующие фреймворки в широком диапазоне больших языковых моделей последовательно на нормальном разрешении и демонстрирует превосходную производительность, когда настроен с Gemma-2B в категории эффективных моделей. Кроме того, когда используются более крупные большие языковые модели, масштабируемость фреймворка Мини-Джемини очевидна.

Чтобы оценить свою производительность на высоком разрешении и расширенных визуальных токенах, эксперименты проводятся с входным размером 672 для кодировщика низкокачественного видения и 1536 для визуального кодировщика. Как упоминалось ранее, основная цель кодировщика высокоразрешающего видения – предоставить информацию о высокоразрешающих кандидатах. Как можно наблюдать, фреймворк Мини-Джемини демонстрирует превосходную производительность по сравнению с передовыми фреймворками.

Кроме того, чтобы оценить возможности визуального понимания фреймворка Мини-Джемини в реальных условиях, разработчики применяют модель к различным задачам рассуждения и понимания, как показано на следующем изображении. Как можно наблюдать, фреймворк Мини-Джемини способен решить широкий спектр сложных задач благодаря реализации извлечения информации о патчах и высококачественных данных. Но что еще более впечатляет, так это то, что фреймворк Мини-Джемини демонстрирует тонкое добавление деталей, которое выходит за рамки простых возможностей распознавания и описывает сложные элементы подробно.


Следующая фигура предоставляет всестороннюю оценку генеративных возможностей фреймворка Мини-Джемини.

По сравнению с недавними моделями, такими как ChatIllusion и AnyGPT, фреймворк Мини-Джемини демонстрирует более сильные мультимодальные возможности понимания, позволяя генерировать текст-изображение-captions, которые лучше соответствуют входным инструкциям, и приводят к изображению-текст-ответам с более сильной концептуальной подобием. Что еще более впечатляет, так это то, что фреймворк Мини-Джемини демонстрирует замечательную способность генерировать высококачественный контент, используя мультимодальные человеческие инструкции только с текстовыми данными обучения, что иллюстрирует прочную семантическую интерпретацию и выравнивание изображения-текста.

Окончательные Мысли
В этой статье мы говорили о Мини-Джемини, мощном и оптимизированном фреймворке для мультимодальных моделей языка и видения. Основная цель фреймворка Мини-Джемини – использовать скрытые возможности моделей языка и видения с помощью высококачественных данных, стратегического дизайна фреймворка и расширенного функционального объема. Мини-Джемини является попыткой сократить разрыв между моделями языка и видения и более продвинутыми моделями путем изучения потенциала VLM с трех сторон: руководство VLM-генерацией, высококачественными данными и высокоразрешающими визуальными токенами. Чтобы улучшить визуальные токены, фреймворк Мини-Джемини предлагает использовать дополнительный визуальный кодировщик для высокоразрешающей доработки без увеличения количества визуальных токенов. Фреймворк Мини-Джемини далее создает высококачественную базу данных в попытке содействовать точному пониманию изображений и генерации на основе рассуждений. В целом, фреймворк Мини-Джемини стремится изучить потенциал моделей языка и видения и направлен на обеспечение существующих фреймворков возможностями рассуждения изображений, понимания и генерации одновременно.












