Модели и платформы ИИ

LLaVA-UHD: Эффективное восприятие изображений в любом соотношении сторон и высоком разрешении

mm
Добавьте Unite.AI в избранные источники в Google

Недавние достижения и прогресс в области больших языковых моделей привели к значительному увеличению возможностей по рассуждению, пониманию и взаимодействию с визуальной информацией. Современные框架 достигают этого, проецируя визуальные сигналы в большие языковые модели, чтобы сделать их способными интерпретировать мир визуально, в широком диапазоне сценариев, где стратегии визуального кодирования играют решающую роль. Однако реальные изображения не только содержат широкий спектр сценариев, но также существенно различаются по разрешению и соотношению сторон, что представляет значительные проблемы для больших языковых моделей в различных областях и задачах. Чтобы решить значительную вариативность, представленную реальными изображениями, современные большие языковые модели воспринимают изображения в низком разрешении, например, 224×224, и фиксированном соотношении сторон, 1:1. Хотя этот компромисс полезен для обеспечения общей применимости больших языковых моделей в реальных приложениях, он часто приводит к сильному размытию изображений и значительному искажению формы. Этот компромисс существенно влияет на возможности больших моделей многомодального взаимодействия, особенно тех, которые оптимизированы для тонких задач, включая оптическое распознавание символов и понимание небольших объектов. Поскольку разрешение и соотношение сторон предопределены, модели могут только делать предположения о размытых изображениях, что приводит к галлюцинациям модели, когда модель генерирует текстовые ответы, которые не основаны на фактах, представленных в изображениях.

В этой статье мы будем говорить о LLaVA-UHD, новом подходе, который сначала рассматривает LLaVA-1.5 и GPT-4V как представительные примеры и пытается раскрыть системные недостатки, коренящихся в их стратегии визуального кодирования. LLaVA-UHD – это многомодальная модель, которая пытается решить эти проблемы. LLaVA-UHD может воспринимать изображения в высоком разрешении, а также в любом соотношении сторон. LLaVA-UHD построен вокруг трех ключевых компонентов. Первый – это стратегия модульного кодирования изображений, которая делит изображения в родном разрешении на более мелкие переменные по размеру срезы, чтобы повысить эффективность и расширить кодирование. Далее, модуль сжатия, который конденсирует токены изображений, сгенерированные визуальными кодировщиками. Наконец, пространственная схема, которая организует токены срезов для больших языковых моделей. Комплексные эксперименты показывают, что LLaVA-UHD может превосходить современные большие языковые модели на 9 эталонных тестах. Кроме того, используя только 94% вычислений при выводе, LLaVA-UHD может поддерживать изображения с разрешением, увеличенным в 6 раз, например, 672×1088.

LLaVA-UHD: Эффективное восприятие изображений в любом соотношении сторон и высоком разрешении

Рассуждение, понимание и взаимодействие с визуальной информацией сделали значительный прогресс в последнее время, в основном благодаря недавнему толчку в области больших языковых моделей. В современных рамках это достигается путем подачи визуальных сигналов в большие языковые модели, чтобы сделать их способными интерпретировать реальный мир визуально, в широком диапазоне сценариев, которые полагаются на стратегии визуального кодирования. Разница в сценарии отражает узкое покрытие больших языковых моделей в различных областях и задачах, в то время как разница в разрешении и соотношении сторон раскрывает большую внутриклассовую вариативность реальных изображений, которую трудно обработать. В отличие от малого масштаба, который снижает вариативность, модели после BERT решают значимость низкого разрешения (например, для LLaVA-UHD это 224×224) изображений с фиксированным соотношением сторон, 1:1, чтобы обеспечить реальные изображения. Хотя этот компромисс полезен для обеспечения общей применимости больших языковых моделей в реальных приложениях, он часто приводит к сильному размытию изображений и значительному искажению формы. Это снижает возможности больших моделей многомодального взаимодействия, особенно тех, которые оптимизированы для тонких задач, таких как оптическое распознавание символов и понимание небольших объектов. Поскольку разрешение и соотношение сторон предопределены, модели могут только делать предположения о размытых изображениях, что приводит к галлюцинациям модели, когда модель генерирует текстовые ответы, которые не основаны на фактах, представленных в изображениях. Почему современные модели многомодального взаимодействия не воспринимают изображения в высоком разрешении и переменном соотношении сторон?

Существует две основные причины, почему современные модели многомодального взаимодействия не могут воспринимать изображения с высоким разрешением и переменным соотношением сторон. Первая заключается в том, что визуальные кодировщики предварительно обучены в фиксированных разрешениях, что делает трудным для модели и кодировщика справиться с изображениями с переменным соотношением сторон и разрешением, что существенно влияет на адаптивность модели. Вторая заключается в том, что кодирование высокоразрешенных изображений напрямую с помощью визуальных трансформеров связано с значительными вычислительными затратами по отношению к размеру изображения. Кроме того, стоимость вычислений может быть существенно выше для большой языковой модели, чтобы обработать большое количество визуальных токенов для высокоразрешенных изображений, что существенно влияет на общую эффективность модели. Чтобы решить эти проблемы, LLaVA-UHD, большая многомодальная модель, которая воспринимает высокоразрешенные изображения и любое соотношение сторон, рассматривает LLaVA-1.5 и GPT-4V как представительные примеры и пытается раскрыть системные недостатки, коренящихся в их стратегии визуального кодирования.

Изображение выше отражает результаты экспериментов GPT-4V по определению количества объектов в изображении. В основе LLaVA-UHD лежит три компонента. Первый – это стратегия модульного кодирования изображений, которая делит изображения в родном разрешении на более мелкие переменные по размеру срезы для расширения и эффективного кодирования. В отличие от недавних больших языковых моделей, которые подгоняют изображения под несколько фиксированных разрешений и соотношений сторон, переменные по размеру срезы, сгенерированные LLaVA-UHD, обеспечивают полную адаптивность к изображениям в родном разрешении без искажения форм, изменения размера или заполнения. Второй – это модуль сжатия, который конденсирует визуальные токены, сгенерированные визуальными кодировщиками, до скромной длины, что существенно снижает вычисления для больших языковых моделей. Наконец, модель организует сжатые токены срезов в пространственной схеме, чтобы проинформировать большие языковые модели о позициях срезов в изображении.

LLaVA-UHD: Методология и архитектура

На основе выводов из некоторых пилотных экспериментов по изучению существующих рамок, включая GPT-4V и LLaVA-1.5, LLaVA-UHD реализует трехкомпонентную архитектуру, как показано на следующем изображении.

Первый – это стратегия модульного кодирования изображений, которая делит изображения в родном разрешении на более мелкие переменные по размеру срезы, чтобы повысить эффективность и расширить кодирование. Далее, модуль сжатия, который конденсирует токены изображений, сгенерированные визуальными кодировщиками. Наконец, пространственная схема, которая организует токены срезов для больших языковых моделей. Давайте подробно рассмотрим эти компоненты.

Модульное визуальное кодирование

Общий подход к решению проблемы высокоразрешенных изображений с разным соотношением сторон заключается в интерполяции позиционных вложений визуального трансформера или ViT до целевого размера для прямого кодирования в целом. Однако реализация этого подхода часто сопровождается высокими вычислительными затратами, и проблемы, возникающие вне распределения, приводят к дальнейшему снижению производительности. Чтобы решить эту проблему, LLaVA-UHD представляет модульную стратегию визуального кодирования, которая делит изображения в родном разрешении на более мелкие переменные по размеру срезы, где форма каждого среза близка к стандартной предварительной настройке визуального трансформера. Благодаря использованию переменных по размеру срезов, LLaVA-UHD может обеспечить полную адаптивность к изображениям в родном разрешении без реализации каких-либо искажающих преобразований или заполнения. Кроме того, основная цель стратегии срезания изображений заключается в определении разделения высокоразрешенных изображений с минимальными изменениями разрешения каждого среза. Для данного изображения с определенным разрешением (w, h) и визуальным трансформером, предварительно обученным в другом разрешении, LLaVA-UHD сначала определяет идеальное количество срезов, необходимое для обработки изображения. Затем модель факторизует количество срезов по m столбцам и n строкам. Затем модель определяет функцию оценки, чтобы измерить отклонение от стандартной предварительной настройки визуального трансформера. Теоретически, LLaVA-UHD может продемонстрировать, что стратегия разделения, реализованная в его архитектуре, гарантирует незначительные ожидаемые изменения и скромные худшие изменения по отношению к стандартной предварительной настройке разрешения для каждого среза.

Кроме того, большинство существующих больших языковых моделей реализуют статическое разрешение для кодирования срезов изображений, подход, который предотвращает полную адаптивность модели к изображениям в родном разрешении, поскольку они имеют доступ только к нескольким предварительно определенным фиксированным формам срезов. Кроме того, статическое разрешение срезов негативно влияет на производительность, эффективность и правильность модели, поскольку оно неизбежно приводит к искажающему изменению размера или заполнению. Чтобы решить эту проблему, LLaVA-UHD предлагает кодировать срезы изображений в соотношении сторон, определённом стратегией разделения. Более конкретно, LLaVA-UHD сначала изменяет исходное изображение пропорционально в соответствии с соотношением сторон, чтобы количество патчей соответствовало предварительно обученному бюджету, то есть количеству позиционных вложений в визуальном трансформере, максимально. Затем модель LLaVA-UHD перестраивает предварительно обученную одномерную последовательность позиционных вложений визуального трансформера в двумерный формат в соответствии с его предварительными настройками.

Слой сжатия

Общая проблема, с которой сталкиваются большие языковые модели при обработке высокоразрешенных изображений, заключается в том, что количество визуальных токенов, которые они должны обработать, существенно выше (например, рамка LLaVA-1.5 генерирует около 3500 визуальных токенов при обработке одного изображения с разрешением 672×1008), что составляет значительную часть вычислительных ресурсов и затрат. Чтобы решить эту проблему, модель LLaVA-UHD реализует общий перцептор-ресемплерный слой, чтобы сжать визуальные токены каждого среза изображения. Затем модель реализует набор запросов через кросс-аттенцию, чтобы ресемплировать вывод токенов изображений, сгенерированных визуальными кодировщиками, до меньшего числа. По сравнению с распространенными стратегиями визуальной проекции на основе многослойного перцептрона, подход перцептора, реализованный LLaVA-UHD, может поддерживать доступное, но фиксированное количество визуальных токенов, независимо от разрешения изображения, что делает LLaVA-UHD более совместимым с задачами обработки и понимания высокоразрешенных изображений. Чтобы проиллюстрировать это, рамка LLaVA-UDH генерирует одинаковое количество токенов при кодировании изображения с разрешением 672×1008, как и рамка LLaVA-1.5 при кодировании изображения с разрешением 336×336, что примерно в 6 раз более эффективно, чем ее конкурент.

Пространственная схема для срезов изображений

Необходимо проинформировать большую языковую модель о пространственной организации срезов изображений, поскольку разделение изображений является динамическим для разных изображений. LLaVA-UHD проектирует и реализует пространственную схему, которая использует два специальных токена, чтобы проинформировать большую языковую модель о относительной позиции срезов изображений. В рамках этой пространственной схемы LLaVA-UHD использует “,” для разделения представлений срезов в строке, и разные строки разделены с помощью “n”.

LLaVA-UDH: Эксперименты и результаты

Рамка LLaVA-UHD оценивается на 9 популярных эталонных тестах, включая общие визуальные тесты вопросов и ответов, оптические тесты вопросов и ответов на основе символов, тесты галлюцинаций и комплексные тесты. Кроме того, LLaVA-UHD сравнивается с сильными базовыми моделями, включая LLaVA-1.5, MiniGPT-v2, InstructBLIP, BLIP-2 и другие.

Производительность рамки LLaVA-UHD на 9 популярных эталонных тестах суммирована и сравнена с популярными базовыми моделями в таблице ниже.

На основе вышеуказанной производительности можно заключить, что LLaVA-UHD может превосходить сильные базовые модели на популярных эталонных тестах, включая сильные базовые модели, обученные на значительно большем количестве данных, а также превосходить большие языковые модели, которые требуют значительно больше вычислений, такие как Fuyu-8B, Monkey и другие. Во-вторых, результаты также показывают, что LLaVA-UHD достигает значительно лучших результатов по сравнению с архитектурой LLaVA-1.5, и, с одной стороны, где LLaVA-1.5 поддерживает фиксированное разрешение 336×336, LLaVA-UHD поддерживает изображения с разрешением 672×1088 и любым соотношением сторон, и одинаковое количество визуальных токенов.

Окончательные мысли

В этой статье мы говорили о LLaVA-UHD, новом подходе, который сначала рассматривает LLaVA-1.5 и GPT-4V как представительные примеры и пытается раскрыть системные недостатки, коренящихся в их стратегии визуального кодирования. LLaVA-UHD – это многомодальная модель, которая пытается решить эти проблемы. LLaVA-UHD может воспринимать изображения в высоком разрешении, а также в любом соотношении сторон. LLaVA-UHD построен вокруг трех ключевых компонентов. Первый – это стратегия модульного кодирования изображений, которая делит изображения в родном разрешении на более мелкие переменные по размеру срезы, чтобы повысить эффективность и расширить кодирование. Далее, модуль сжатия, который конденсирует токены изображений, сгенерированные визуальными кодировщиками. Наконец, пространственная схема, которая организует токены срезов для больших языковых моделей. Комплексные эксперименты показывают, что LLaVA-UHD может превосходить современные большие языковые модели на 9 эталонных тестах. Кроме того, используя только 94% вычислений при выводе, LLaVA-UHD может поддерживать изображения с разрешением, увеличенным в 6 раз, например, 672×1088.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.