Модели и платформы ИИ

Внутри DBRX: Databricks представила мощную открытую LLM

mm
Добавьте Unite.AI в избранные источники в Google

В быстро развивающейся области больших языковых моделей (LLM) появилась новая мощная модель – DBRX, открытая модель, созданная компанией Databricks. Эта LLM делает волны своей передовой производительностью по широкому спектру тестов, даже конкурируя с возможностями индустриальных гигантов, таких как GPT-4 от OpenAI.

DBRX представляет собой значительный этап в демократизации искусственного интеллекта, предоставляя исследователям, разработчикам и предприятиям открытый доступ к топовому языковому модели. Но что именно такое DBRX, и что делает его так особенным? В этом техническом глубоком погружении мы исследуем инновационную архитектуру, процесс обучения и ключевые возможности, которые привели DBRX к лидерству в ландшафте открытых LLM.

Рождение DBRX Создание DBRX было обусловлено миссией Databricks по сделать интеллект данных доступным для всех предприятий. Как лидер в платформах анализа данных, Databricks осознала огромный потенциал LLM и приступила к разработке модели, которая могла бы соответствовать или даже превосходить производительность проприетарных предложений.

После месяцев интенсивных исследований, разработки и многомиллионных инвестиций команда Databricks достигла прорыва с DBRX. Впечатляющая производительность модели на широком спектре тестов, включая понимание языка, программирование и математику, твердо установила ее как новое состояние искусства в открытых LLM.

Инновационная Архитектура

Сила Mixture-of-Experts В основе исключительной производительности DBRX лежит его инновационная архитектура mixture-of-experts (MoE). Этот передовой дизайн представляет собой отход от традиционных плотных моделей, принимая разреженный подход, который повышает как эффективность предварительного обучения, так и скорость вывода.

В рамках MoE только выбранная группа компонентов, называемых “экспертами”, активируется для каждого входа. Эта специализация позволяет модели решать более широкий спектр задач с большей ловкостью, а также оптимизировать вычислительные ресурсы.

DBRX доводит эту концепцию еще дальше с помощью своей тонкой MoE-архитектуры. В отличие от некоторых других MoE-моделей, которые используют меньшее количество более крупных экспертов, DBRX использует 16 экспертов, с четырьмя активными экспертами для любого данного входа. Этот дизайн обеспечивает ошеломляющие 65 раз больше возможных комбинаций экспертов, что напрямую способствует исключительной производительности DBRX.

DBRX отличается несколькими инновационными функциями:

  • Ротари Позиционные Кодировки (RoPE): Улучшает понимание позиций токенов, что важно для генерации контекстно точного текста.
  • Гейтед Линейные Единицы (GLU): Вводит механизм шлюза, который повышает способность модели учиться сложным закономерностям более эффективно.
  • Группированная Запросная Внимание (GQA): Улучшает эффективность модели, оптимизируя механизм внимания.
  • Расширенная Токенизация: Использует токенизатор GPT-4 для более эффективной обработки входов.

Архитектура MoE особенно подходит для крупномасштабных языковых моделей, поскольку она позволяет более эффективно масштабироваться и лучше использовать вычислительные ресурсы. Распределяя процесс обучения по нескольким специализированным подсетям, DBRX может эффективно распределить данные и вычислительную мощность для каждой задачи, обеспечивая как высококачественный вывод, так и оптимальную эффективность.

Обширные Тренировочные Данные и Эффективная Оптимизация Хотя архитектура DBRX безусловно впечатляет, его истинная сила заключается в тщательном процессе обучения и огромном количестве данных, на которых он был обучен. DBRX был предварительно обучен на ошеломляющих 12 триллионах токенов текстовых и кодовых данных, тщательно отобранных для обеспечения высокого качества и разнообразия.

Тренировочные данные были обработаны с помощью набора инструментов Databricks, включая Apache Spark для обработки данных, Unity Catalog для управления и управления данными, и MLflow для отслеживания экспериментов. Этот комплексный инструментарий позволил команде Databricks эффективно управлять, исследовать и совершенствовать огромную базу данных, заложив основу для исключительной производительности DBRX.

Чтобы еще больше повысить возможности модели, Databricks использовала динамический учебный план предварительного обучения, инновационно варьируя смесь данных во время обучения. Эта стратегия позволила каждому токену быть эффективно обработанным с помощью активных 36 миллиардов параметров, в результате чего получилась более всесторонняя и адаптируемая модель.

Более того, процесс обучения DBRX был оптимизирован для эффективности, используя набор проприетарных инструментов и библиотек Databricks, включая Composer, LLM Foundry, MegaBlocks и Streaming. Используя такие методы, как обучение по учебному плану и оптимизированные стратегии оптимизации, команда достигла почти четырехкратного улучшения эффективности вычислений по сравнению с их предыдущими моделями.

Обучение и Архитектура

DBRX был обучен с помощью модели предсказания следующего токена на колоссальной базе данных из 12 триллионов токенов, подчеркивая как текст, так и код. Эта обучающая база данных, как полагают, значительно более эффективна, чем те, которые использовались в предыдущих моделях, обеспечивая богатое понимание и способность реагировать на различные запросы.

Архитектура DBRX не только является свидетельством технической мощи Databricks, но также подчеркивает ее применение в нескольких секторах. От улучшения взаимодействия чат-ботов до обеспечения сложных задач анализа данных DBRX может быть интегрирован в различные области, требующие нюансов понимания языка.

Замечательно, что DBRX Instruct даже превосходит некоторые из самых передовых закрытых моделей на рынке. Согласно измерениям Databricks, он превосходит GPT-3.5 и конкурирует с Gemini 1.0 Pro и Mistral Medium на различных тестах, включая общее знание, рассуждение на основе здравого смысла, программирование и математическое рассуждение.

Например, на тесте MMLU, который измеряет понимание языка, DBRX Instruct достигнул результата 73,7%, превысив результат GPT-3.5 в 70,0%. На тесте HellaSwag по рассуждению на основе здравого смысла DBRX Instruct набрал впечатляющие 89,0%, превысив результат GPT-3.5 в 85,5%.

DBRX Instruct действительно блестит, достигнув замечательной точности 70,1% на тесте HumanEval, превысив не только GPT-3.5 (48,1%), но и специализированную модель CodeLLaMA-70B Instruct (67,8%).

Эти исключительные результаты подчеркивают универсальность DBRX и его способность преуспеть в широком спектре задач, от понимания естественного языка до сложного программирования и решения математических задач.

Эффективное Вывод и Масштабируемость Одним из ключевых преимуществ архитектуры DBRX является ее эффективность во время вывода. Благодаря разреженной активации параметров DBRX может достичь скорости вывода, которая в два-три раза быстрее, чем у плотных моделей с тем же общим количеством параметров.

По сравнению с LLaMA2-70B, популярной открытой LLM, DBRX не только демонстрирует более высокое качество, но и имеет почти вдвое большую скорость вывода, несмотря на то, что имеет примерно половину активных параметров. Эта эффективность делает DBRX привлекательным выбором для развертывания в широком спектре приложений, от создания контента до анализа данных и за их пределами.

Более того, Databricks разработала прочный стек обучения, который позволяет предприятиям обучать свои собственные модели DBRX с нуля или продолжать обучение на основе предоставленных контрольных точек. Эта возможность наделяет бизнес способностью использовать полный потенциал DBRX и адаптировать его к своим конкретным потребностям, еще больше демократизируя доступ к передовым технологиям LLM.

Доступность и Интеграции

В соответствии с миссией Databricks по продвижению открытого доступа к ИИ, DBRX был представлен через несколько каналов. Веса как базовой модели (DBRX Base), так и тонкой модели (DBRX Instruct) размещены на популярной платформе Hugging Face, позволяя исследователям и разработчикам легко загружать и работать с моделью.

Кроме того, репозиторий модели DBRX доступен на GitHub, обеспечивая прозрачность и позволяя дальнейшее исследование и настройку кода модели.

пропускная способность вывода для различных конфигураций модели на нашей оптимизированной инфраструктуре обслуживания с помощью NVIDIA TensorRT-LLM с 16-разрядной точностью и лучшими флагами оптимизации, которые мы смогли найти.

Для клиентов Databricks DBRX Base и DBRX Instruct удобно доступны через API-интерфейсы модели Databricks Foundation, обеспечивая бесшовную интеграцию в существующие рабочие процессы и приложения. Это не только упрощает процесс развертывания, но и гарантирует управление данными и безопасность для чувствительных случаев использования.

Кроме того, DBRX уже был интегрирован в несколько сторонних платформ и сервисов, таких как You.com и Perplexity Labs, расширяя его охват и потенциальные применения. Эти интеграции демонстрируют растущий интерес к DBRX и его возможностям, а также растущее внедрение открытых LLM в различных отраслях и случаях использования.

Возможности Длинного Контекста и Усиленная Генерация Одной из выдающихся особенностей DBRX является его способность обрабатывать длинные контекстные входы, с максимальной длиной контекста 32 768 токенов. Эта возможность позволяет модели обрабатывать и генерировать текст на основе обширной контекстной информации, что делает ее хорошо подходящей для задач, таких как суммирование документов, ответы на вопросы и извлечение информации.

В тестах, оценивающих производительность в длинном контексте, таких как KV-Pairs и HotpotQAXL, DBRX Instruct превзошел GPT-3.5 Turbo на различных длинах последовательностей и позициях контекста.

DBRX превосходит установленные открытые модели на понимании языка (MMLU), программировании (HumanEval) и математике (GSM8K).

DBRX превосходит установленные открытые модели на понимании языка (MMLU), программировании (HumanEval) и математике (GSM8K).

Ограничения и Будущая Работа

Хотя DBRX представляет собой значительное достижение в области открытых LLM, важно признать его ограничения и области для будущего улучшения. Как и любая модель ИИ, DBRX может производить неточные или предвзятые ответы, в зависимости от качества и разнообразия его обучающих данных.

Кроме того, хотя DBRX превосходно справляется с общими задачами, определенные приложения, специфичные для области, могут потребовать дальнейшего тонкого настройки или специализированного обучения для достижения оптимальной производительности. Например, в сценариях, где точность и достоверность имеют первостепенное значение, Databricks рекомендует использовать методы усиленной генерации (RAG) для улучшения вывода модели.

Кроме того, текущая обучающая база данных DBRX в основном состоит из контента на английском языке, что потенциально ограничивает его производительность на задачах, не связанных с английским языком. Будущие итерации модели могут включать расширение обучающих данных для включения более разнообразного спектра языков и культурных контекстов.

Databricks привержена постоянному улучшению возможностей DBRX, решению его ограничений и исследованию методов для смягчения потенциальных предубеждений и продвижения этичного использования ИИ.

Кроме того, компания планирует дальнейшее усовершенствование процесса обучения, используя такие передовые методы, как федеративное обучение и методы, сохраняющие конфиденциальность, для обеспечения конфиденциальности и безопасности данных.

Дорога Вперед

DBRX представляет собой значительный шаг вперед в демократизации разработки ИИ. Он предвидит будущее, в котором каждое предприятие имеет возможность контролировать свои данные и свою судьбу в мире генеративного ИИ.

Открывая DBRX и предоставляя доступ к тем же инструментам и инфраструктуре, которые были использованы для его создания, Databricks наделяет бизнес и исследователей возможностью разработать свои собственные передовые модели Databricks, адаптированные к их конкретным потребностям.

Через платформу Databricks клиенты могут использовать набор инструментов для обработки данных, включая Apache Spark, Unity Catalog и MLflow, для курирования и управления своими обучающими данными. Затем они могут использовать оптимизированные библиотеки обучения Databricks, такие как Composer, LLM Foundry, MegaBlocks и Streaming, для эффективного обучения своих собственных моделей DBRX класса и в масштабе.

Эта демократизация разработки ИИ имеет потенциал разблокировать новую волну инноваций, поскольку предприятия получают возможность использовать силу крупномасштабных языковых моделей для широкого спектра приложений, от создания контента и анализа данных до поддержки принятия решений и за их пределами.

Кроме того, продвигая открытую и сотрудническую экосистему вокруг DBRX, Databricks стремится ускорить темп исследований и разработок в области крупномасштабных языковых моделей. По мере того, как больше организаций и людей вносят свой вклад в экспертизу и идеи, коллективные знания и понимание этих мощных систем ИИ будут продолжать расти, открывая путь для еще более передовых и способных моделей в будущем.

Заключение

DBRX является прорывом в мире открытых крупномасштабных языковых моделей. С его инновационной архитектурой mixture-of-experts, обширными обучающими данными и передовыми возможностями, он установил новый эталон того, что возможно с открытыми LLM.

Демократизируя доступ к передовым технологиям ИИ, DBRX наделяет исследователей, разработчиков и предприятия возможностью исследовать новые горизонты в обработке естественного языка, создании контента, анализе данных и за их пределами. По мере того, как Databricks продолжает совершенствовать и улучшать DBRX, потенциальные применения и влияние этой мощной модели действительно безграничны.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.