Модели и платформы ИИ

Mistral AI: устанавливает новые стандарты за пределами Llama2 в открытом пространстве

mm
Добавьте Unite.AI в избранные источники в Google

Большие языковые модели (LLM) недавно заняли центральное место, благодаря выдающимся исполнителям, таким как ChatGPT. Когда Meta представила свои модели Llama, это вызвало обновленный интерес к открытым языковым моделям. Цель? Создать доступные, открытые LLM, которые так же хороши, как лучшие модели, такие как GPT-4, но без высокой цены или сложности.

Эта смесь доступности и эффективности не только открыла новые пути для исследователей и разработчиков, но и поставила сцену для новой эры технологических достижений в области обработки естественного языка.

Недавно стартапы, занимающиеся генеративным ИИ, получили значительное финансирование. Together подняли 20 миллионов долларов, чтобы сформировать открытый ИИ. Anthropic также получил впечатляющие 450 миллионов долларов, а Cohere, в партнерстве с Google Cloud, получил 270 миллионов долларов в июне этого года.

Введение в Mistral 7B: размер и доступность

mistral AI

Mistral AI, базирующаяся в Париже и основанная выпускниками Google’s DeepMind и Meta, объявила о своей первой большой языковой модели: Mistral 7B. Эта модель может быть легко загружена кем угодно из GitHub и даже через 13,4-гигабайтный торрент.

Этот стартап смог получить рекордное финансирование даже до того, как у них был продукт. Mistral AI первая модель с 7 миллиардами параметров превышает производительность Llama 2 13B во всех тестах и превосходит Llama 1 34B во многих метриках.

По сравнению с другими моделями, такими как Llama 2, Mistral 7B обеспечивает аналогичные или лучшие возможности, но с меньшей вычислительной нагрузкой. Хотя базовые модели, такие как GPT-4, могут достичь большего, они имеют более высокую цену и не так удобны в использовании, поскольку в основном доступны через API.

Когда речь идет о задачах программирования, Mistral 7B дает CodeLlama 7B возможность побежать. Кроме того, он достаточно компактный, чтобы работать на стандартных машинах.

Кроме того, Mistral 7B Instruct, настроенный специально для инструктивных наборов данных на Hugging Face, показал отличную производительность. Он превосходит другие 7B-модели на MT-Bench и стоит наравне с 13B-чат-моделями.

Бенчмаркинг производительности

В подробном анализе производительности Mistral 7B был измерен против моделей Llama 2. Результаты были ясны: Mistral 7B значительно превосходит Llama 2 13B во всех бенчмарках. На самом деле, он соответствует производительности Llama 34B, особенно выделяясь в коде и рассуждениях.

Бенчмарки были организованы в несколько категорий, таких как общие рассуждения, знания мира, чтение, математика и код, среди других. Особенно заметным наблюдением было метрика “эквивалентный размер модели” Mistral 7B. В областях, таких как рассуждения и понимание, Mistral 7B показал производительность, аналогичную модели Llama 2 в три раза больше его размера, что указывает на потенциальную экономию памяти и увеличение пропускной способности. Однако в бенчмарках знаний Mistral 7B совпадает с Llama 2 13B, что, вероятно, связано с ограничениями параметров, влияющими на сжатие знаний.

Что действительно делает модель Mistral 7B лучше, чем большинство других языковых моделей?

Упрощение механизмов внимания

Хотя тонкости механизмов внимания технически сложны, их основная идея относительно проста. Представьте, что вы читаете книгу и выделяете важные предложения; это аналогично тому, как механизмы внимания “выделяют” или придает важность определенным данным в последовательности.

В контексте языковых моделей эти механизмы позволяют модели сосредоточиться на наиболее важных частях входных данных, гарантируя, что выходные данные будут связными и контекстно точными.

В стандартных трансформерах механизмы внимания рассчитываются по формуле:

Transformers attention Formula

Формула внимания трансформеров

Формула для этих баллов включает важный шаг – матричное умножение Q и K. Проблема здесь заключается в том, что по мере роста длины последовательности обе матрицы расширяются соответственно, что приводит к вычислительно интенсивному процессу. Эта проблема масштабируемости является одной из основных причин, почему стандартные трансформеры могут быть медленными, особенно при работе с длинными последовательностями.

трансформерМеханизмы внимания помогают моделям сосредоточиться на определенных частях входных данных. Обычно эти механизмы используют “головы”, чтобы управлять этим вниманием. Чем больше голов, тем более специфичное внимание, но оно также становится более сложным и медленным. Загляните глубже в трансформеры и механизмы внимания здесь.

Многозапросное внимание (MQA) ускоряет процесс, используя один набор “ключ-значение” голов, но иногда жертвует качеством. Теперь вы можете задаться вопросом, почему не объединить скорость MQA с качеством многоголового внимания? Вот где появляется Группированное-запросное внимание (GQA).

Группированное-запросное внимание (GQA)

Группированное-запросное внимание

Группированное-запросное внимание

GQA – это компромиссное решение. Вместо использования одного или нескольких “ключ-значение” голов, оно группирует их. Таким образом, GQA достигает производительности, близкой к подробному многоголовому вниманию, но со скоростью MQA. Для моделей, таких как Mistral, это означает эффективную производительность без значительного компромисса качества.

Скользящее окно внимания (SWA)

длинные трансформеры скользящее окно

Скользящее окно – это другой метод, используемый при обработке последовательностей внимания. Этот метод использует фиксированное окно внимания вокруг каждого токена в последовательности. С несколькими слоями, укладывающими это окно внимания, верхние слои в конечном итоге получают более широкий взгляд, охватывающий информацию из всей входной последовательности. Этот механизм аналогичен рецептивным полям, наблюдаемым в свёрточных нейронных сетях (CNN).

С другой стороны, “дилатированное скользящее окно внимания” модели Longformer, которая концептуально похожа на метод скользящего окна, вычисляет только несколько диагоналей матрицы . Это изменение приводит к тому, что использование памяти увеличивается линейно, а не квадратично, что делает его более эффективным методом для более длинных последовательностей.

Прозрачность Mistral AI и проблемы безопасности в децентрализации

В своем объявлении Mistral AI также подчеркнула прозрачность, заявив: “Нет трюков, нет проприетарных данных”. Но в то же время их единственная доступная модель в настоящее время – ‘Mistral-7B-v0.1’ – это предварительно обученная базовая модель, поэтому она может генерировать ответ на любой запрос без модерации, что вызывает потенциальные проблемы безопасности. Хотя модели, такие как GPT и Llama, имеют механизмы для определения, когда отвечать, полностью децентрализованная природа Mistral может быть использована злоумышленниками.

Однако децентрализация больших языковых моделей имеет свои достоинства. Хотя некоторые могут использовать ее во зло, люди могут использовать ее силу для общественного блага и сделать интеллект доступным для всех.

Гибкость развертывания

Одним из наиболее заметных моментов является то, что Mistral 7B доступен под лицензией Apache 2.0. Это означает, что нет реальных барьеров для его использования – будь то личные цели, большая корпорация или даже государственное учреждение. Вам просто нужна подходящая система для запуска или, возможно, необходимо инвестировать в облачные ресурсы.

Хотя существуют другие лицензии, такие как более простая лицензия MIT и кооперативная лицензия CC BY-SA-4.0, которая требует указания авторства и аналогичной лицензии для производных работ, лицензия Apache 2.0 обеспечивает прочную основу для крупномасштабных начинаний.

Окончательные мысли

Рост открытых больших языковых моделей, таких как Mistral 7B, знаменует собой поворотный момент в индустрии ИИ, делая высококачественные языковые модели доступными для более широкой аудитории. Инновационные подходы Mistral AI, такие как Группированное-запросное внимание и Скользящее окно внимания, обещают эффективную производительность без компромисса качества.

Хотя децентрализованная природа Mistral представляет определенные проблемы, ее гибкость и открытая лицензия подчеркивают потенциал для демократизации ИИ. По мере эволюции ландшафта внимание неизбежно будет сосредоточено на балансировании силы этих моделей с этическими соображениями и механизмами безопасности.

Что дальше для Mistral? Модель 7B была только началом. Команда планирует запустить еще более крупные модели скоро. Если эти новые модели соответствуют производительности 7B, Mistral может быстро подняться как один из лучших игроков в отрасли, все в течение первого года.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.