Модели и платформы ИИ

Осprey: Понимание Пикселей с Визуальной Настройкой Инструкций

mm
Добавьте Unite.AI в избранные источники в Google

С недавним улучшением методов визуальной настройки инструкций, Мультимодальные Большие Языковые Модели (MLLMs) продемонстрировали замечательные возможности понимания языка и изображений. Эти возможности делают их ключевыми строительными блоками для современных универсальных визуальных помощников. Недавние модели, включая MiniGPT-4, LLaVA, InstructBLIP и другие, демонстрируют впечатляющие возможности визуального рассуждения и выполнения инструкций. Хотя большинство из них полагаются на пары изображений и текста для выравнивания изображения и языка на уровне изображения, они работают хорошо в этой области. Однако их зависимость от понимания на уровне коробки и изображения является основной причиной, по которой MLLM не могут повторить свою производительность на задачах тонкого выравнивания языка и изображения на уровне пикселя. Кроме того, ограниченная доступность масок-инструкций для обучения создает проблемы для дальнейшего улучшения MLLM.

Осprey – это метод обучения инструкций с маской-текстом, основная цель которого – расширить возможности MLLM. Он включает тонкие маскированные регионы в языковые инструкции для достижения понимания языка и изображения на уровне пикселя. Для этого Осprey создает набор данных регионов-текста с более чем 700 тысячами образцов. Он вводит представление пикселя в Большие Языковые Модели (LLM), чтобы разработать модель языка и изображения. Заметно, что Осprey принимает модель CLIP на основе свертки в качестве своего визуального кодировщика и интегрирует визуальный экстрактор, осведомленный о маске, в свою архитектуру. Это позволяет точно извлекать визуальные маски-признаки из высокоразрешающего входа.

В этой статье мы обсудим Осprey и более глубоко рассмотрим его архитектуру. Мы также исследуем созданный набор данных регионов-текста с более чем 700 тысячами образцов и сравним его производительность в различных задачах понимания регионов. Итак, давайте начнем.

Осprey: Понимание Пикселей с Визуальной Настройкой Инструкций

Мультимодальные Большие Языковые Модели, такие как MiniGPT-4, Otter, Qwen-LV, InstructBLIP и другие, являются лидерами в разработке универсальных визуальных помощников и известны своими исключительными мультимодальными и генеративными возможностями языка и изображения. Однако Мультимодальные Большие Языковые Модели сталкиваются с серьезной проблемой, поскольку они дают неудовлетворительные результаты на задачах тонкого понимания изображений, таких как подписывание, классификация регионов и рассуждение. Основная причина неудовлетворительной производительности на задачах тонкого понимания изображений заключается в отсутствии выравнивания на уровне региона. Недавние MLLM, такие как GPT4RoI, Shikra и другие, направлены на включение понимания на уровне региона в модели языка и изображения, обрабатывая регионы, указанные в коробке, и используя визуальную настройку инструкций с пространственными признаками на уровне объекта.

Хотя подход к включению понимания на уровне региона может улучшить производительность, использование разреженных коробок как входного региона может ввести неуместные фоновые признаки, что приведет к неточной выравниванию пар регион-текст для визуальной настройки инструкций на больших языковых моделях. Во время процесса вывода входной регион в коробке может не быть в состоянии обнаружить и представить объект точно, что может привести к семантическому отклонению, как показано на следующем изображении.

Напротив, использование тонких масок вместо грубых коробок в качестве входного региона может представить объекты с большей точностью. Недавно разработанная модель SAM или Segment Anything Model обучается на миллиардах высококачественных масок, демонстрирует замечательное качество сегментации на нулевом уровне объектов и поддерживает использование точек или простых коробок в качестве подсказок. Однако модель SAM не может генерировать основные семантические метки, ни предоставлять подробные семантические подписи и атрибуты. В результате существующие модели не имеют внутренней мультимодальной тонкой информации и имеют ограниченное понимание сцен в реальном мире.

Чтобы решить проблемы, с которыми сталкиваются существующие MLLM, Осprey, новый метод обучения инструкций с маской-текстом, направлен на расширение возможностей мультимодальных больших языковых моделей для тонкого понимания на уровне пикселя. Осprey вводит визуальный экстрактор, осведомленный о маске, который точно захватывает визуальные маски-признаки. Осprey затем чередует визуальные признаки с языковыми инструкциями, чтобы сгенерировать входную последовательность для большой языковой модели, и использует архитектуру CLIP на основе свертки, чтобы облегчить использование высокоразрешающего входа. Благодаря своей конструкции и архитектуре, Осprey может достичь тонкого семантического понимания для регионов на уровне объекта и части, и предоставляет подробные атрибуты объектов вместе с основной категорией объекта и улучшенными описаниями сложных сцен.

Используя возможности визуальной настройки инструкций, Осprey включает новые возможности за пределами понимания изображений и коробок, поскольку Осprey может генерировать тонкие семантики, используя класс-агностические маски из готовых SAM. Кроме того, Осprey демонстрирует замечательные возможности в задачах классификации объектов, открытого словарного распознавания, регионального подписывания и подробного описания регионов.

Осprey: Методология и Архитектура

Следующая фигура демонстрирует обзор архитектуры Осprey, состоящей из большой языковой модели, визуального экстрактора на уровне пикселя и визуального кодировщика на уровне изображения.

Для данного изображения, входного языка и регионов-масок, Осprey выполняет преобразование и токенизацию, чтобы сгенерировать вложения, прежде чем отправить последовательности языковых вложений и чередовать маски-признаки в большую языковую модель, чтобы получить тонкое семантическое понимание.

Визуальный Кодировщик CLIP на основе Свертки

Визуальный кодировщик, используемый в большинстве мультимодальных больших языковых моделей, представляет собой модель CLIP на основе ViT. В результате Осprey принимает разрешение изображения 224×224 пикселей или 336 x 336 пикселей. Однако использование модели CLIP на основе ViT затрудняет достижение модели тонкого понимания изображения на уровне пикселя, проблема, усугубленная в небольших регионах. Кроме того, вычислительная нагрузка, связанная с архитектурой ViT, препятствует возможности увеличения разрешения входного изображения.

Чтобы решить эту проблему, Осprey реализует визуальный кодировщик CLIP на основе свертки в качестве визуального кодировщика в своей архитектуре. Традиционно модели CLIP на основе свертки демонстрируют замечательные возможности обобщения на разных входных разрешениях по сравнению с моделями CLIP на основе трансформера. Реализация модели CLIP на основе свертки позволяет выполнять быстрое вывод и эффективное обучение без ущерба для производительности модели. Кроме того, модель CLIP на основе свертки может генерировать многоуровневые карты признаков, которые Осprey затем напрямую использует для извлечения признаков в каждом последующем объектном регионе.

Визуальный Экстрактор, Осведомленный о Маске

В отличие от существующих моделей на основе регионов, которые используют разреженные коробки в качестве входного региона, Осprey использует подробные регионы-маски для реализации представлений на основе объектов. Осprey использует компонент визуального экстрактора, осведомленный о маске, для захвата признаков на уровне пикселя в каждом объектном регионе. Компонент визуального экстрактора, осведомленный о маске, кодирует визуальные маски-признаки и собирает пространственную позиционную информацию каждого региона.

Для этого Осprey сначала использует многоуровневые изображения, сгенерированные визуальным кодировщиком, для принятия операции пулинга маски, и для каждого уровня признаков Осprey пулингует все признаки, которые лежат внутри региона-маски. Осprey затем кодирует признаки на разных уровнях, пропуская каждый признак через линейный проекционный слой, который генерирует региональные вложения, и объединяет многоуровневые признаки, выполняя суммирование. Осprey затем использует слой MLP, чтобы произвести визуальный маски-токен. Кроме того, Осprey сохраняет пространственную геометрию объектного региона, кодируя пиксельное положение отношения, реализуя бинарную маску для каждого объектного региона. В конце Осprey включает визуальный маски-токен и его соответствующие пространственные токены для каждого вложения региона-маски.

Токенизация LLM

Как упоминалось ранее, Осprey извлекает вложения изображения на уровне изображения, подая изображение в предварительно обученный визуальный кодировщик на основе свертки. Для текстовой информации Осprey сначала использует предварительно обученные токенизаторы LLM, чтобы токенизировать текстовые последовательности, и затем проецирует эти токенизированные текстовые последовательности в вложения текста. Для регионов-масок Осprey определяет специальный токен в качестве заполнителя и затем заменяет его пространственным токеном вместе с маски-токеном. Когда Осprey ссылается на объектный регион в текстовом входе, он добавляет заполнитель после имени региона, что позволяет регионам-маскам смешиваться с текстом хорошо, в результате чего получаются полные предложения без пробела токенизации. Кроме того, помимо инструкций пользователя, Осprey также включает префикс-подсказку, специальный токен, который служит заполнителем, который затем заменяется вложениями изображения на уровне изображения от визуального кодировщика. Наконец, Осprey чередует региональные и изображения-визуальные токены вместе с текстовыми токенами и подает их в большую языковую модель, чтобы понять инструкции пользователя и изображение с разными регионами в объекте.

Осprey: Трехэтапный Процесс Обучения

Осprey развертывает трехэтапный процесс обучения, в котором каждая из фаз обучения контролируется путем минимизации потери предсказания следующего токена.

Этап 1: Обучение Выравнивания Изображения и Текста

На первом этапе Осprey развертывает визуальный кодировщик CLIP на основе свертки для обучения изображения на уровне изображения и языкового соединителя для обучения модели выравнивания изображения и текста. На первом этапе Осprey использует три компонента: предварительно обученную большую языковую модель, предварительно обученный визуальный кодировщик и проектировщик на уровне изображения. Осprey также принимает слой MLP в качестве визуально-языкового соединителя, который помогает улучшить мультимодальные генеративные возможности Осprey.

Этап 2: Предобучение Выравнивания Маски и Текста

На втором этапе Осprey загружает веса, обученные на первом этапе, и использует компонент визуального экстрактора, осведомленный о маске, для захвата региональных признаков на уровне пикселя. На втором этапе Осprey обучает только визуальный экстрактор, осведомленный о маске, для выравнивания языковых вложений с маски-признаками на основе регионов. Кроме того, Осprey собирает пары масок-пикселей и короткие тексты из наборов данных на уровне части и объекта и преобразует их в данные для обучения, следуя инструкциям.

Этап 3: Конечное Сверточное Дообучение

На третьем и последнем этапе Осprey фиксирует веса визуального кодировщика и дообучает большую языковую модель, маски-признаки на основе регионов и проектировщик на уровне изображения в своей архитектуре. Основная цель обучения на третьем этапе – расширить возможности модели для точного выполнения инструкций пользователя и эффективного выполнения задач понимания регионов на уровне пикселя.

После реализации трех этапов обучения Осprey может понимать сложные сценарии, определяемые инструкциями пользователя и на основе регионов-масок на уровне пикселя.

Осprey: Экспериментальные Результаты

Чтобы оценить свою производительность, разработчики Осprey проводят широкий спектр экспериментов, чтобы продемонстрировать возможности модели в классификации, распознавании регионов на уровне пикселя и сложных описаниях.

Открытое Словарное Сегментирование

Основная цель открытого словарного сегментирования – сгенерировать распознавание регионов-масок и их категорию явно. Чтобы достичь открытого словарного сегментирования, Осprey сначала использует входную текстовую подсказку, после чего модель принимает регионы-маски для модели интерференции, чтобы оценить производительность модели в задачах открытого словарного распознавания. На основе ответа, сгенерированного мультимодальной большой языковой моделью, Осprey рассчитывает семантическое сходство между списком словаря и выводом каждого набора данных. Следующая фигура сравнивает Осprey с современными мультимодальными большими языковыми моделями.

Как можно увидеть, Осprey превосходит существующие методы на значительную величину как на наборе данных Cityscapes, так и на наборе данных ADE20K-150. Результаты указывают на способность Осprey превосходить существующие подходы и достигать прочного понимания и распознавания на тонких объектных регионах.

Классификация Объектов, на которые Ссылаются

В задаче классификации объектов, на которые ссылаются, модель должна классифицировать объект внутри конкретного региона изображения. Чтобы оценить свои классификационные возможности, Осprey использует два семантических метрика соответствия, включая Семантическое IoU (S-IoU) и Семантическое Сходство (SS). Семантическое IoU представляет собой перекрытие слов между метками ground-truth и предсказанными, в то время как Семантическое Сходство измеряет сходство между предсказанными и/или метками ground-truth в семантическом пространстве. Следующее изображение демонстрирует производительность Осprey в задаче классификации объектов, на которые ссылаются, по сравнению с моделями, использующими подходы на уровне коробки и изображения.

Подробное Описание Региона

В задаче подробного описания региона модель оценивает свою производительность на возможностях подробного описания, следующих инструкциям, вместе с другими подходами на уровне региона. Модель случайным образом выбирает входную подсказку вывода из списка предварительно определенных подсказок и использует модель LLM GPT-4, чтобы измерить качество ответа, сгенерированного моделью, по отношению к входным регионам-маскам всесторонне. Используя конвейер генерации инструкций, модель генерирует вопросы и ищет ответы GPT-4, после чего LLM оценивает правильность семантики и точность понимания регионов. Следующая таблица демонстрирует производительность Осprey по сравнению с современными моделями на задаче подробного описания региона.

Подписывание Регионов

Осprey также превосходит существующие подходы в задаче подписывания регионов, результаты которой содержатся в следующем изображении.

Окончательные Мысли

В этой статье мы говорили об Осprey, методе обучения инструкций с маской-текстом, основная цель которого – расширить возможности MLLM, включая тонкие маскированные регионы в языковые инструкции для достижения понимания языка и изображения на уровне пикселя. Чтобы достичь своей цели, Осprey создает набор данных регионов-текста с более чем 700 тысячами образцов и вводит представление пикселя в LLM, чтобы разработать модель языка и изображения. Осprey направлен на улучшение MLLM для тонкого визуального понимания значительно, и реализуя модель CLIP на основе свертки и визуальный экстрактор, осведомленный о маске, Осprey приобретает возможность понимать изображения на уровне части и объекта.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.