Модели и платформы ИИ

MoE-LLaVA: Смесь экспертов для крупномасштабных моделей компьютерного зрения и языка

mm
Добавьте Unite.AI в избранные источники в Google

Недавние достижения в области крупномасштабных моделей компьютерного зрения и языка (LVLM) показали, что масштабирование этих рамок значительно увеличивает производительность по различным задачам. LVLM, включая MiniGPT, LLaMA и другие, достигли замечательных возможностей, включая в себя визуальные проекционные слои и кодировщик изображений в свою архитектуру. Реализуя эти компоненты, LVLM улучшают возможности визуального восприятия крупномасштабных языковых моделей (LLM). Производительность можно еще больше улучшить, увеличивая размер модели и количество параметров, а также расширяя масштаб набора данных.

Модели, такие как InternVL, расширили свой кодировщик изображений до более 6 миллиардов параметров, в то время как другие расширили заднюю часть LVLM до 13 миллиардов параметров, достигнув превосходной производительности по широкому спектру задач. IDEFICS обучил LVLM с более 80 миллиардами параметров. Эти методы масштабирования сравнялись или превзошли производительность LLM, предварительно обученных на более 34, 70 или даже 100 миллиардов параметров. Однако масштабирование имеет недостаток: оно значительно увеличивает затраты на обучение и вывод. Это связано с тем, что для каждого токена в расчете требуется активация всех параметров, что приводит к высоким вычислительным потребностям и, как следствие, более высоким затратам.

Эта статья обсуждает MoE-LLaVA, рамку на основе смеси экспертов (MoE) для крупномасштабных моделей компьютерного зрения и языка, которая использует эффективную стратегию обучения, MoE-Tuning, для LVLM. MoE-Tuning инновационно решает проблему ухудшения производительности при многомодальной обучении с разреженностью, в результате чего получается модель с большим количеством параметров, но постоянными затратами на обучение и вывод. Архитектура MoE-LLaVA разработана так, чтобы активировать только лучших экспертов во время развертывания, сохраняя остальных экспертов неактивными.

Мы рассмотрим рамку MoE-LLaVA, изучая ее механизм, методологию, архитектуру и то, как она сравнивается с ведущими рамками генерации изображений и видео.

MoE-LLaVA: Масштабирование крупномасштабных моделей компьютерного зрения и языка доступно

Помимо использования визуальных проекционных слоев и кодировщиков изображений, крупномасштабные модели компьютерного зрения и языка также масштабируют размер модели, увеличивая количество параметров для улучшения производительности модели. Некоторые заметные примеры крупномасштабных моделей компьютерного зрения и языка, которые следовали этому подходу для улучшения производительности, – это MiniGPT-4, InternGPT, InternVL и другие. В реальных приложениях масштабирование крупномасштабной языковой модели или крупномасштабной модели компьютерного зрения и языка с высококачественными данными обучения часто становится необходимостью для улучшения производительности модели. Хотя увеличение размера модели действительно улучшает производительность, оно также увеличивает вычислительные затраты на обучение и вывод модели, а также увеличивает сложность и эффективность развертывания модели на параллельных устройствах одновременно. Основная причина увеличения затрат на обучение и вывод, а также вычислительных требований заключается в том, что каждый токен в рамке требует вычислений с каждым параметром модели, известным как плотная модель.

С другой стороны, разреженные модели на основе смеси экспертов (MoE) продемонстрировали эффективное масштабирование рамок, обрабатывая данные с помощью фиксированных активированных параметров, подход, который широко используется в области обработки естественного языка. Однако использование смеси экспертов для прямого обучения крупномасштабных моделей компьютерного зрения и языка является сложной задачей, поскольку преобразование LLM в LVLM и разрежение модели одновременно приводит к значительному ухудшению производительности. Чтобы реализовать смесь моделей для масштабирования LLM и LVLM, необходимо сначала инициализировать LVLM для разрежения. Для этого рамка MoE-LLaVA вводит MoE-Tuning, простую, но эффективную трехэтапную стратегию обучения.

Как показано на приведенном выше рисунке, процесс MoE-Tuning сначала обучает многослойный перцептрон, который адаптирует визуальные токены к крупномасштабной языковой модели на первом этапе. Затем рамка обучает все параметры LLM, чтобы предварительно наделить крупномасштабную модель компьютерного зрения и языка общими многомодальными понимательными возможностями. Наконец, на третьем этапе рамка реплицирует многослойный перцептрон в качестве начальных весов для экспертов и обучает только слои смеси экспертов. В целом, процесс обучения помогает в постепенном переходе разреженной модели от инициализации LVLM к разреженной смеси экспертов.

С учетом процесса обучения, давайте рассмотрим MoE-LLaVA, базовую модель для крупномасштабных моделей компьютерного зрения и языка с моделями смеси экспертов, которая включает в себя обучаемые маршрутизаторы и модели смеси экспертов. В своей основе модель MoE-LLaVA состоит из нескольких разреженных путей, и рамка использует эти пути для отправки каждого токена разным экспертам через обучаемый маршрутизатор. Токены затем обрабатываются коллективно активированными экспертами, сохраняя неактивные пути в молчании. Рамка затем укладывает слои кодировщика смеси экспертов итеративно, чтобы обеспечить разреженный путь к более крупной и мощной LVLM.

Благодаря подходу, реализованному рамкой MoE-LLaVA, она способна превосходить модели с подобным количеством активированных параметров и превосходить их на большую разницу на бенчмарке POPE для оценки зрительных галлюцинаций, несмотря на наличие только 2,2 миллиарда параметров. Кроме того, рамка MoE-LLaVA с 2,2 миллиардами параметров способна достичь производительности, сравнимой с рамкой InternVL-Chat-19B, имеющей почти в 8 раз больше активированных параметров.

Мощные крупномасштабные языковые модели с сильными возможностями обобщения и выполнения инструкций были реализованы для крупномасштабных моделей компьютерного зрения и языка. Ранние LLM, такие как BLIP, закодировали визуальные сигналы в последовательность визуальных токенов, позволяя им успешно адаптировать зрение к LLM с помощью нескольких проекционных слоев. В то же время недавние работы сосредоточены на улучшении производительности модели, реализуя методы, такие как расширение набора данных для настройки инструкций, увеличение разрешения изображения, оптимизация стратегий обучения, выравнивание входных данных, улучшение кодировщиков изображений и многое другое. Эти подходы помогли наделить крупномасштабные модели компьютерного зрения и языка мощными возможностями визуального понимания, расширяя набор данных для тонкой настройки визуальных инструкций и масштабов модели. Кроме того, некоторые крупномасштабные модели компьютерного зрения и языка также обладают тонкими возможностями понимания изображений, такими как понимание регионов и многорегиональное понимание, а также возможностями пиксельного заземления. Однако вычислительные затраты, связанные с масштабированием плотных визуальных данных и моделей, часто очень высоки, что делает их сложными для носки. С другой стороны, рамка MoE-LLaVA стремится сделать исследования крупномасштабных моделей компьютерного зрения и языка более доступными, используя возможности моделей смеси экспертов.

MoE-LLaVA: Метод и архитектура

В своей основе рамка MoE-LLaVA состоит из визуального проекционного слоя (многослойный перцептрон), кодировщика изображений, блоков смеси экспертов, нескольких укладывающихся блоков LLM и слоя встраивания слов.

Архитектура

Следующая таблица суммирует подробные конфигурации рамки MoE-LLaVA.

Для данного RGB-изображения кодировщик изображений обрабатывает изображения, чтобы получить последовательность визуальных токенов с визуальным проекционным слоем, отображающим последовательность визуальных токенов на входные изображения. Входные текстовые данные обрабатываются слоем встраивания слов, который затем проецирует их, чтобы получить последовательность токенов. В то же время рамка MoE-LLaVA связывает текстовые и визуальные токены вместе и подает их в LLM. Однако рамка обучает только визуальный проекционный слой с крупномасштабной языковой моделью, состоящей из FFN или слоев самообратного внимания. Наконец, рамка применяет остаточные связи и нормализацию слоев к каждому блоку.

Двигаясь дальше, рамка MoE-LLaVA реплицирует FFN или многослойный перцептрон несколько раз, чтобы сформировать ансамбль экспертов в качестве начального шага. Маршрутизатор, являющийся линейным слоем, предсказывает вероятность каждого токена, назначаемого каждому эксперту. Каждый токен обрабатывается лучшими экспертами с максимальной вероятностью и рассчитывает взвешенную сумму на основе результатов softmax вероятностей. Как только лучшие эксперты активируются, модель выключает остальных экспертов, подход, который наделяет рамку MoE-LLaVA бесконечно возможными разреженными путями, тем самым наделяя модель широким спектром возможностей.

MoE-Tuning

MoE-Tuning – это простая, но эффективная трехэтапная стратегия обучения, которая сначала обучает многослойный перцептрон, адаптирующий визуальные токены к крупномасштабной языковой модели на первом этапе. Затем рамка обучает все параметры LLM, чтобы предварительно наделить крупномасштабную модель компьютерного зрения и языка общими многомодальными понимательными возможностями. Наконец, на третьем этапе рамка реплицирует FFN или многослойный перцептрон в качестве начальных весов для экспертов и обучает только слои смеси экспертов.

Этап 1

На первом этапе основной целью является адаптация изображений к крупномасштабной языковой модели, что позволяет LLM понимать экземпляры в изображении. Рамка MoE-LLaVA использует многослойный перцептрон, чтобы спроецировать изображения в область входных данных крупномасштабной языковой модели, и рассматривает изображения как псевдо-текстовые токены. На этом этапе рамка MoE-LLaVA обучает LLM, чтобы описать изображения, и не применяет слои смеси экспертов к LLM во время этого этапа.

Этап 2

На втором этапе рамка MoE-LLaVA пытается улучшить возможности и контролируемость рамки, настраивая модель на многомодальные инструкции. Рамка MoE-LLaVA достигает этого, регулируя LLM, чтобы сделать его крупномасштабной моделью компьютерного зрения и языка с многомодальными понимательными возможностями. Рамка использует более сложные инструкции, включая текстовое распознавание и логическое рассуждение изображений, что требует от модели иметь более сильные многомодальные возможности. Традиционно процесс обучения для плотных моделей считается завершенным на этом шаге. Однако рамка MoE-LLaVA столкнулась с проблемами при преобразовании LLM в крупномасштабную модель компьютерного зрения и языка одновременно с разрежением крупномасштабной модели компьютерного зрения и языка. Чтобы преодолеть эту проблему, рамка использует веса из предыдущего этапа в качестве инициализации для следующего этапа, пытаясь облегчить процесс обучения разреженной модели.

Этап 3

На третьем этапе модель реплицирует многослойный перцептрон несколько раз, чтобы инициализировать экспертов в качестве начального шага. Затем рамка подает текстовые и визуальные токены в слои смеси экспертов, после чего маршрутизатор рассчитывает веса совпадения между экспертами и каждым токеном. Каждый токен затем обрабатывается лучшими экспертами, и рассчитывается взвешенная сумма на основе весов маршрутизатора. Как только лучшие эксперты активируются, модель выключает остальных экспертов, подход, который наделяет рамку MoE-LLaVA бесконечно возможными разреженными путями, тем самым наделяя модель широким спектром возможностей.

MoE-LLaVA: Результаты и эксперименты

Рамка MoE-LLaVA принимает CLIP-Large в качестве кодировщика изображений с многослойным перцептроном, состоящим из двух слоев с слоем активации GELU, разделяющим два слоя. По умолчанию рамка использует чередующуюся замену многослойных перцептронов со слоями смеси экспертов, что означает, что слои смеси экспертов составляют 50% от общего количества слоев. Следующая таблица содержит различные наборы данных, а также их размер выборки, используемые для обучения и оценки рамки MoE-LLaVA.

Вопросы и ответы на изображениях без обучения

Следующий рисунок демонстрирует, что MoE-LLaVA – это разреженная модель с мягким маршрутизатором на основе LVLM. Рамка оценивается на 5 бенчмарках вопросов и ответов на изображениях, и как можно наблюдать, рамка MoE-LLaVA демонстрирует замечательные возможности понимания изображений и обеспечивает производительность, сравнимую с рамкой LLaVA 1.5 на пяти различных бенчмарках.

Оценка зрительных галлюцинаций

Чтобы оценить зрительные галлюцинации, рамка MoE-LLaVA принимает конвейер оценки POPE, метод опроса, и результаты демонстрируются в следующей таблице. Как можно наблюдать, из всех рамок MoE-LLaVA обеспечивает самые сильные результаты, указывая на способность рамки генерировать объекты, согласующиеся с входным изображением. Кроме того, стоит отметить, что рамка MoE-LLaVA хорошо балансирует соотношение “да”, указывая на способность разреженной модели обеспечить точную обратную связь для заданного вопроса.

Следующее изображение содержит распределение нагрузки экспертов, где прерывистые линии представляют хорошо сбалансированное распределение токенов среди модальностей или экспертов. Первый рисунок иллюстрирует нагрузку внутри экспертов, в то время как остальные изображения демонстрируют производительность экспертов по отношению к различным модальностям.

Кроме того, следующий рисунок демонстрирует распределение модальностей по различным экспертам.

Заключительные мысли

В этой статье мы говорили о MoE-LLaVA, базовой модели для крупномасштабных моделей компьютерного зрения и языка с моделями смеси экспертов, которая включает в себя обучаемые маршрутизаторы и модели смеси экспертов. В своей основе модель MoE-LLaVA состоит из нескольких разреженных путей, и рамка использует эти пути для отправки каждого токена разным экспертам через обучаемый маршрутизатор. Токены затем обрабатываются коллективно активированными экспертами, сохраняя неактивные пути в молчании. Рамка затем укладывает слои кодировщика смеси экспертов итеративно, чтобы обеспечить разреженный путь к более крупной и мощной LVLM. Стратегия MoE-Tuning решает проблему ухудшения производительности при многомодальной обучении с разреженностью инновационно, тем самым конструируя модель с значительным количеством параметров, но постоянными затратами на обучение и вывод. Архитектура рамки MoE-LLaVA разработана так, чтобы активировать только лучших экспертов во время развертывания, сохраняя остальных экспертов неактивными.

Kunal Kejriwal — backend‑инженер, специализирующийся на Python, PostgreSQL, Redis и облачной инфраструктуре в GCP и AWS. Имея три года опыта в построении и масштабировании производственных систем, он пишет об инфраструктуре ИИ, распределённых системах и архитектуре развертывания нагрузок машинного обучения.