Модели и платформы ИИ

Последняя модель Mixture of Experts (MoE) 8x7B от Mistral AI

mm
Добавьте Unite.AI в избранные источники в Google

Mistral AI

, парижская стартап-компания с открытым исходным кодом, бросила вызов нормам, выпустив свою последнюю большую языковую модель (LLM), MoE 8x7B, через простую ссылку на торрент. Это контрастирует с традиционным подходом Google с их выпуском Gemini, вызывая разговоры и волнение в сообществе ИИ.

Подход Mistral AI к выпускам всегда был неортодоксальным. Часто отказываясь от обычных сопровождений в виде статей, блогов или пресс-релизов, их стратегия была уникально эффективной в привлечении внимания сообщества ИИ.

Недавно компания достигла замечательной $2 миллиардной оценки после раунда финансирования под руководством Andreessen Horowitz. Этот раунд финансирования был историческим, установив рекорд с $118 миллионами в качестве стартового финансирования, что является крупнейшим в европейской истории. Помимо успехов в финансировании, Mistral AI активно участвует в обсуждениях вокруг закона ЕС об ИИ, выступая за снижение регулирования в области открытого ИИ.

Почему MoE 8x7B привлекает внимание

Описанная как “масштабированная GPT-4”, Mixtral 8x7B использует архитектуру Mixture of Experts (MoE) с восемью экспертами. Каждый эксперт имеет 111B параметров, в сочетании с 55B общими параметрами внимания, что дает в общей сложности 166B параметров на модель. Этот выбор дизайна значим, поскольку он позволяет включать только двух экспертов для вывода каждого токена, подчеркивая сдвиг в сторону более эффективной и сосредоточенной обработки ИИ.

Одним из ключевых моментов Mixtral является его способность обрабатывать обширный контекст из 32 000 токенов, предоставляя широкие возможности для выполнения сложных задач. Мультимедийные возможности модели включают надежную поддержку английского, французского, итальянского, немецкого и испанского языков, удовлетворяя потребности глобального сообщества разработчиков.

Предварительная подготовка Mixtral включает данные из открытого веба, с одновременным обучением как экспертов, так и маршрутизаторов. Этот метод гарантирует, что модель не только обширна в своем пространстве параметров, но и тонко настроена на нюансы обширных данных, с которыми она была знакома.

Mixtral 8x7B достигает впечатляющего результата

Mixtral 8x7B достигает впечатляющего результата

Mixtral 8x7B превосходит LLaMA 2 70B и соперничает с GPT-3.5, особенно заметно в задаче MBPP с результатом 60,7%, что значительно выше, чем у его аналогов. Даже в строгой задаче MT-Bench, предназначенной для моделей, следующих инструкциям, Mixtral 8x7B достигает впечатляющего результата, практически сравниваясь с GPT-3.5

Понимание архитектуры Mixture of Experts (MoE)

Модель Mixture of Experts (MoE), привлекающая недавно внимание благодаря ее включению в передовые языковые модели, такие как MoE 8x7B от Mistral AI, на самом деле основана на фундаментальных концепциях, которые восходят к нескольким годам назад. Давайте вернемся к истокам этой идеи через фундаментальные исследовательские работы.

Концепция MoE

Mixture of Experts (MoE) представляет собой сдвиг парадигмы в архитектуре нейронных сетей. В отличие от традиционных моделей, которые используют единую, однородную сеть для обработки всех типов данных, MoE принимает более специализированный и модульный подход. Она состоит из нескольких “экспертных” сетей, каждая из которых предназначена для обработки конкретных типов данных или задач, под наблюдением “гейтинговой” сети, которая динамически направляет входные данные к наиболее подходящему эксперту.

Слой Mixture of Experts (MoE), встроенный в рекуррентную языковую модель

Слой Mixture of Experts (MoE), встроенный в рекуррентную языковую модель (Источник)

 

Вышеизложенное изображение представляет собой высокоуровневый вид слоя MoE, встроенного в языковую модель. По своей сути, слой MoE состоит из нескольких под-сетей с прямым подключением, называемых “экспертами”, каждый из которых имеет потенциал специализироваться в обработке различных аспектов данных. Гейтинговая сеть, выделенная на диаграмме, определяет, какой набор экспертов будет задействован для данного входного сигнала. Это условная активация позволяет сети значительно увеличить свою емкость без соответствующего скачка вычислительных требований.

Функциональность слоя MoE

На практике гейтинговая сеть оценивает входные данные (обозначенные как G(x) на диаграмме) и выбирает скудный набор экспертов для их обработки. Этот выбор модулируется выходными данными гейтинговой сети, эффективно определяя “голос” или вклад каждого эксперта в окончательный результат. Например, как показано на диаграмме, могут быть выбраны только два эксперта для вычисления результата для каждого конкретного токена, что делает процесс эффективным, концентрируя вычислительные ресурсы там, где они наиболее необходимы.

 

Трансформер-энкодер с слоями MoE (Источник)

Второе изображение выше контрастирует традиционный трансформер-энкодер с тем, который дополнен слоем MoE. Архитектура трансформера, широко известная своей эффективностью в языковых задачах, традиционно состоит из слоев само-внимания и слоев с прямым подключением, сложенных в последовательность. Введение слоев MoE заменяет некоторые из этих слоев с прямым подключением, позволяя модели более эффективно масштабироваться по емкости.

В дополненной модели слои MoE разделены на несколько устройств, демонстрируя подход, параллельный модели. Это имеет решающее значение при масштабировании до очень больших моделей, поскольку позволяет распределять вычислительную нагрузку и требования к памяти по кластеру устройств, таких как GPU или TPU. Это разделение имеет важное значение для эффективного обучения и развертывания моделей с миллиардами параметров, как это видно из обучения моделей с сотнями миллиардов до триллионов параметров на крупных вычислительных кластерах.

Редкий подход MoE с настройкой инструкций на LLM

Статья под названием “Редкая смесь экспертов (MoE) для масштабируемой языковой модели” обсуждает инновационный подход к улучшению больших языковых моделей (LLM), интегрируя архитектуру Mixture of Experts с методами настройки инструкций.

Она подчеркивает общую проблему, когда модели MoE хуже работают по сравнению с плотными моделями равной вычислительной емкости при тонкой настройке для конкретных задач из-за расхождений между общей предварительной подготовкой и задачной тонкой настройкой.

Настройка инструкций – это методология обучения, при которой модели совершенствуются для лучшего выполнения инструкций на естественном языке, эффективно повышая их производительность задач. Статья предлагает, что модели MoE демонстрируют заметное улучшение, когда объединены с настройкой инструкций, больше, чем их плотные аналоги. Этот метод выравнивает предварительно обученные представления модели для выполнения инструкций более эффективно, что приводит к значительному повышению производительности.

Исследователи провели исследования в трех экспериментальных установках, показав, что модели MoE изначально хуже работают при прямой задачной тонкой настройке. Однако, когда применяется настройка инструкций, модели MoE превосходят, особенно когда дополнительно дополняются задачной тонкой настройкой. Это говорит о том, что настройка инструкций является важным шагом для моделей MoE, чтобы превосходить плотные модели в задачах.

Влияние настройки инструкций на MOE

Влияние настройки инструкций на MOE

Она также вводит FLAN-MOE32B, модель, демонстрирующую успешное применение этих концепций. Заметно, что она превосходит FLAN-PALM62B, плотную модель, на эталонных задачах, используя только одну треть вычислительных ресурсов. Это демонстрирует потенциал для редких моделей MoE, объединенных с настройкой инструкций, чтобы установить новые стандарты эффективности и производительности LLM.

Реализация Mixture of Experts в реальных сценариях

Универсальность моделей MoE делает их идеальными для широкого спектра применений:

  • Обработка естественного языка (NLP): Модели MoE могут более эффективно обрабатывать нюансы и сложности человеческого языка, что делает их идеальными для продвинутых задач NLP.
  • Обработка изображений и видео: В задачах, требующих высококачественной обработки, MoE может управлять различными аспектами изображений или кадров видео, повышая как качество, так и скорость обработки.
  • Настраиваемые решения ИИ: Бизнес и исследователи могут адаптировать модели MoE для конкретных задач, что приводит к более целенаправленным и эффективным решениям ИИ.

Проблемы и соображения

Хотя модели MoE предлагают многочисленные преимущества, они также представляют уникальные проблемы:

  • Сложность в обучении и настройке: Распределенная природа моделей MoE может усложнить процесс обучения, требуя тщательного балансирования и настройки экспертов и гейтинговой сети.
  • Управление ресурсами: Эффективное управление вычислительными ресурсами среди нескольких экспертов имеет решающее значение для максимизации преимуществ моделей MoE.

Включение слоев MoE в нейронные сети, особенно в области языковых моделей, предлагает путь к масштабированию моделей до размеров, ранее невозможных из-за вычислительных ограничений. Условная вычислительная возможность, обеспечиваемая слоями MoE, позволяет более эффективно распределять вычислительные ресурсы, что делает возможным обучение более крупных и способных моделей. По мере того, как мы продолжаем требовать больше от наших систем ИИ, архитектуры, такие как MoE-оснащенный трансформер, вероятно, станут стандартом для обработки сложных, крупномасштабных задач в различных областях.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.