Модели и платформы ИИ

MambaOut: Нужен ли Mamba для зрения?

mm
Добавьте Unite.AI в избранные источники в Google

В современных рамках машинного обучения и искусственного интеллекта трансформеры являются одним из наиболее широко используемых компонентов в различных областях, включая серию GPT, BERT в обработке естественного языка и Vision Transformers в задачах компьютерного зрения. Хотя включение трансформеров в архитектуру модели дает значительный прирост производительности модели, модуль внимания в трансформерах масштабируется с длиной последовательности квадратично, что приводит к высоким вычислительным проблемам. За годы различные модели исследовали различные стратегии для решения вычислительных проблем, включая методы, такие как ядренизация, сжатие исторической памяти, ограничение диапазона смешивания токенов и методы низкого ранга. Недавно рекуррентные нейронные сети, такие как методы, включающие Mamba и RWKV, привлекли значительное внимание благодаря их перспективным результатам в больших языковых моделях.

Mamba, семейство моделей, имеет архитектуру с рекуррентным нейронным сетевым токен-миксером государственного пространственного моделирования, который был недавно введен для решения квадратичной сложности механизмов внимания и был применен к задачам зрения. Исследователи уже исследовали способы включения Mamba и SSM или государственного пространственного моделирования в задачи визуального распознавания, и Vision Mamba, который включает Mamba для разработки изотропных моделей зрения, подобных Vision Transformer, является отличным примером этого. С другой стороны, LocalMamba включает локальные индуктивные предубеждения для улучшения визуальных моделей Mamba, а фреймворк VMamba использует базовую модель Mamba для построения иерархических моделей, подобных ResNet и AlexNet. Однако, действительно ли фреймворк Mamba необходим для контекста задач визуального распознавания? Этот вопрос возникает потому, что производительность семейства моделей Mamba для задач зрения была неудовлетворительной на данный момент по сравнению с традиционными вниманием-основанными и свертками-основанными моделями.

MambaOut пытается ответить на вопрос, подходит ли Mamba для задач с автoregressивными и длинно-последовательными характеристиками. Фреймворк MambaOut предполагает, что Mamba не необходим для задач зрения, поскольку классификация изображений не соответствует ни длинно-последовательным, ни автoregressивным характеристикам. Хотя задачи сегментации и обнаружения также не являются автoregressивными, они демонстрируют длинно-последовательные характеристики, что приводит фреймворк MambaOut к гипотезе о потенциале Mamba для этих задач. Фреймворк MambaOut построен путем стэкинга блоков Mamba друг на друга, удаляя государственное пространственное моделирование, его основной токен-миксер. Экспериментальные результаты подтверждают гипотезу, выдвинутую фреймворком MambaOut, поскольку он способен превосходить все визуальные модели Mamba на фреймворке классификации изображений ImageNet, указывая на то, что Mamba не необходим для задач зрения. С другой стороны, для задач обнаружения и сегментации фреймворк MambaOut не может повторить производительность, предложенную современными моделями Mamba, демонстрируя потенциал семейства моделей Mamba для длинно-последовательных задач зрения.

Эта статья направлена на глубокое освещение фреймворка MambaOut, и мы исследуем механизм, методологию, архитектуру фреймворка, а также его сравнение с современными фреймворками. Итак, давайте начнем.

MambaOut: Нужен ли Mamba для зрения?

С прогрессом приложений машинного обучения и их возможностей трансформеры стали основой для широкого спектра задач, включая Vision Transformers, серию моделей GPT, BERT и некоторые другие. Однако токен-миксер трансформера имеет квадратичную сложность относительно длины последовательности и представляет значительные вычислительные проблемы. Чтобы решить эту проблему, были введены различные токен-миксеры с линейной сложностью по длине токена, такие как Linformer, Longformer, Performer, Dynamic Convolution и Big Bird. Однако в последнее время рекуррентные нейронные сети, такие как модели Mamba и RWKV, привлекли внимание благодаря своей способности к параллельной тренировке и эффективной производительности на длинных последовательностях. Руководствуясь замечательными результатами, предложенными моделями RNN-подобными, исследователи пытаются ввести и использовать семейство моделей Mamba в задачи визуального распознавания, поскольку токен-миксер моделей Mamba является структурированным государственным пространственным моделированием в духе рекуррентных нейронных сетей. Однако экспериментальные результаты показывают, что фреймворки, основанные на государственном пространственном моделировании, для зрения работают неудовлетворительно на реальных задачах зрения по сравнению с вниманием-основанными и современными свертками-основанными моделями.

MambaOut является попыткой исследовать природу семейства моделей Mamba и суммирует, что Mamba подходит для задач, которые либо автoregressивны, либо имеют длинно-последовательные характеристики, поскольку государственное пространственное моделирование имеет встроенный механизм RNN. Однако большинство задач зрения не демонстрируют обе этих характеристики, и на основе некоторых экспериментов MambaOut предлагает две гипотезы. Первая заключается в том, что государственное пространственное моделирование не необходимо для классификации изображений, поскольку задача классификации изображений не соответствует ни автoregressивным, ни длинно-последовательным характеристикам. Вторая гипотеза заключается в том, что государственные пространственные модели могут быть полезны для задач сегментации и обнаружения, поскольку они демонстрируют длинно-последовательные характеристики, хотя и не являются автoregressивными. Экспериментальные результаты, проведенные для анализа RNN-подобного механизма государственного пространственного моделирования, показывают, что фреймворк Mamba подходит для задач с автoregressивными или длинно-последовательными характеристиками и не необходим для задач классификации изображений. Что касается самого фреймворка MambaOut, он представляет собой серию моделей Mamba, основанных на блоках свертки с затвором, без государственного пространственного моделирования, и экспериментальные результаты показывают, что фреймворк MambaOut способен превосходить модели Mamba в задачах классификации изображений, но не может повторить производительность на задачах обнаружения и сегментации.

Для каких задач подходит Mamba?

Токен-миксер фреймворка Mamba является избирательным государственным пространственным моделированием, которое определяет четыре входозависимых параметра. Рекуррентное свойство фреймворка отличает RNN-подобные государственные пространственные модели от внимания. Скрытое состояние можно рассматривать как фиксированную память, которая хранит историческую информацию. Фиксированный размер означает, что память является потерянной, но она также гарантирует, что вычислительная сложность интеграции памяти с текущим входом остается постоянной. Напротив, внимание сохраняет все ключи и значения из предыдущих токенов и расширяется путем добавления ключа и значения текущего токена с каждым новым входом, и эта память является безошибочной в теории. Однако размер памяти увеличивается с каждым новым токеном, что увеличивает сложность интеграции памяти с текущим входом. Разница между механизмами памяти внимания и RNN-подобных моделей иллюстрируется на следующей схеме.

Поскольку память государственного пространственного моделирования является внутренне потерянной, она уступает безошибочной памяти внимания, и в результате модели Mamba не могут продемонстрировать свою силу в обработке коротких последовательностей, область, где механизм внимания работает хорошо. Однако в сценариях, включающих длинные последовательности, подход внимания терпит неудачу из-за квадратичной сложности. В этом сценарии фреймворк Mamba демонстрирует свою эффективность в слиянии памяти с текущим входом и способен обрабатывать длинные последовательности гладко, указывая на то, что семейство моделей Mamba хорошо подходит для обработки длинных последовательностей.

Также стоит отметить, что с одной стороны, где рекуррентное свойство государственного пространственного моделирования позволяет моделям Mamba эффективно обрабатывать длинные последовательности, оно вводит определенное ограничение, поскольку может получить доступ только к информации из текущего и предыдущих временных шагов, и этот тип токен-миксинга называется причинным режимом, и проиллюстрирован на следующей схеме. Из-за своего причинного характера этот метод подходит для автoregressивных задач генерации.

Полностью видимый режим подходит для задач понимания, где модель может получить доступ ко всем входам одновременно. Кроме того, внимание находится в полностью видимом режиме по умолчанию и может быть преобразовано в причинный режим легко путем применения причинных масок к картам внимания, и RNN-подобные модели работают внутренне в причинном режиме из-за своих рекуррентных свойств. Чтобы суммировать, фреймворк Mamba подходит для задач, которые либо включают обработку длинных последовательностей, либо требуют причинного токен-миксинга.

Задачи визуального распознавания, причинный токен-миксинг и очень длинные последовательности

Как обсуждалось ранее, полностью видимый режим токен-миксинга позволяет неограниченный диапазон миксинга, тогда как причинный режим ограничивает текущий токен доступом только к информации из предыдущих токенов. Кроме того, визуальное распознавание категоризируется как задача понимания, где модель может увидеть все изображение одновременно, и это устраняет необходимость в ограничениях на токен-миксинг, и введение дополнительных ограничений на токен-миксинг может потенциально ухудшить производительность модели. Обычно полностью видимый режим подходит для задач понимания, тогда как причинный режим лучше подходит для автoregressивных задач. Кроме того, это утверждение подтверждается еще и тем, что модели BeRT и ViT используются для задач понимания чаще, чем модели GPT.

Экспериментальная проверка и результаты

Следующий шаг – экспериментально проверить гипотезы, предложенные фреймворком MambaOut. Как показано на следующем изображении, блок Mamba основан на блоке свертки с затвором, и мета-архитектура блоков Mamba и Gated CNN может быть рассмотрена как упрощенная интеграция токен-миксера фреймворка MetaFormer и MLP.

Блок Mamba расширяет блок свертки с затвором дополнительным государственным пространственным моделированием, и наличие SSm является тем, что отличает блок Gated CNN и блок Mamba. Кроме того, для улучшения практической скорости фреймворк MambaOut проводит только глубокую свертку на частичных каналах, и как показано на следующем алгоритме, реализация блока Gated CNN проста, но эффективна и элегантна.

Задача классификации изображений

ImageNet служит эталоном для задач классификации изображений, поскольку он включает более тысячи общих классов, более 1,3 миллиона тренировочных изображений и более 50 000 проверочных изображений. Усиление данных, использованное в эксперименте, включает случайное изменение размера, Mixup, изменение цвета, случайное удаление, CutMix и Rand Augment. Следующая таблица суммирует производительность семейства моделей Mamba, модели MambaOut и других вниманием-основанных и свертками-основанных моделей на наборе данных ImageNet. Как можно увидеть, фреймворк MambaOut без государственного пространственного моделирования превосходит визуальные модели Mamba с SSm последовательно во всех размерах моделей.

Например, модель MambaOut-Small возвращает значение точности топ-1 более 84%, что на 0,4% выше, чем у ближайшего конкурента Mamba. Этот результат сильно подтверждает первую гипотезу, которая утверждает, что введение государственного пространственного моделирования для задач классификации изображений не необходимо.

Задачи обнаружения и сегментации объектов

COCO служит эталоном для задач обнаружения и сегментации объектов. Хотя фреймворк MambaOut способен превосходить производительность некоторых визуальных моделей Mamba, он все еще уступает современным визуальным моделям Mamba, включая LocalVMamba и VMamba. Разница в производительности между MambaOut и современными визуальными моделями подчеркивает выгоды от интеграции семейства моделей Mamba в длинно-последовательные задачи зрения. Однако стоит отметить, что значенная разница в производительности все еще существует между современными свертками-вниманием-гибридными моделями и визуальными моделями Mamba.

Окончательные мысли

Семейство моделей Mamba, кажется, подходит для задач, включающих автoregressивные и длинно-последовательные характеристики. Фреймворк MambaOut предполагает, что Mamba не необходим для задач зрения, поскольку классификация изображений не соответствует ни длинно-последовательным, ни автoregressивным характеристикам. Хотя задачи сегментации и обнаружения также не являются автoregressивными, они демонстрируют длинно-последовательные характеристики, что приводит фреймворк MambaOut к гипотезе о потенциале Mamba для этих задач. Фреймворк MambaOut построен путем стэкинга блоков Mamba друг на друга, удаляя государственное пространственное моделирование, его основной токен-миксер. Экспериментальные результаты подтверждают гипотезу, выдвинутую фреймворком MambaOut, поскольку он способен превосходить все визуальные модели Mamba на фреймворке классификации изображений ImageNet, указывая на то, что Mamba не необходим для задач зрения. С другой стороны, для задач обнаружения и сегментации фреймворк MambaOut не может повторить производительность, предложенную современными моделями Mamba, демонстрируя потенциал семейства моделей Mamba для длинно-последовательных задач зрения.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.