Моделі та платформи ШІ

Всередині DBRX: Databricks розблоковує потужну відкриту мовну модель

mm
Додайте Unite.AI до бажаних джерел у Google

У швидкозмінному полі великих мовних моделей (LLM) з’явилася нова потужна модель – DBRX, відкрита модель, створена компанією Databricks. Ця LLM робить хвилі своєю революційною продуктивністю у широкому діапазоні тестів, навіть конкуруючи з можливостями промислових гігантів, таких як GPT-4 від OpenAI.

DBRX представляє собою значний етап у демократизації штучного інтелекту, надаючи дослідникам, розробникам та підприємствам відкритий доступ до топової мовної моделі. Але що саме таке DBRX, і що робить його таким особливим? У цьому технічному аналізі ми дослідимо інноваційну архітектуру, процес навчання та ключові можливості, які підняли DBRX на чільне місце у відкритому ландшафті LLM.

Народження DBRX Створення DBRX було спровоковано місією Databricks зробити дані інтелекту доступними для всіх підприємств. Як лідер у сфері платформ даних, Databricks визнав величезний потенціал LLM і поставив за мету розробити модель, яка могла б конкурувати з пропрієтарними пропозиціями.

Після місяців інтенсивних досліджень, розробки та інвестицій у кілька мільйонів доларів, команда Databricks досягла прориву з DBRX. Вражаюча продуктивність моделі у широкому діапазоні тестів, включаючи мовне розуміння, програмування та математику, твердо встановила її як новий стандарт у відкритих LLM.

Інноваційна архітектура

Сила суміші експертів У основі вражаючої продуктивності DBRX лежить інноваційна архітектура суміші експертів (MoE). Ця передова конструкція являє собою відхід від традиційних щільних моделей, прийняття розрідженої підходу, який підвищує ефективність як попереднього навчання, так і швидкості висновку.

У рамках архітектури MoE тільки вибрана група компонентів, званих “експертами”, активується для кожного входу. Ця спеціалізація дозволяє моделі займатися широким спектром завдань з більшою майстерністю, а також оптимізувати обчислювальні ресурси.

DBRX ще далі розвиває цю концепцію зі своєю тонкою архітектурою MoE. На відміну від деяких інших моделей MoE, які використовують менше експертів більших розмірів, DBRX використовує 16 експертів, з чотирма активними експертами для будь-якого даного входу. Цей дизайн забезпечує приголомшливі 65 разів більше можливих комбінацій експертів, що безпосередньо сприяє вищій продуктивності DBRX.

DBRX відрізняється кількома інноваційними особливостями:

  • Ротаційні позиційні кодування (RoPE): Покращує розуміння позицій токенів, що є важливим для генерації контекстно точного тексту.
  • Замкнені лінійні одиниці (GLU): Вводить механізм блокування, який підвищує здатність моделі вивчати складні закономірності більш ефективно.
  • Групова увага запиту (GQA): Покращує ефективність моделі, оптимізуючи механізм уваги.
  • Розширена токенізація: Використовує токенізацію GPT-4 для більш ефективної обробки входів.

Архітектура MoE особливо підходить для великомасштабних мовних моделей, оскільки вона дозволяє більш ефективно масштабуватися та краще використовувати обчислювальні ресурси. Розподіл процесу навчання по декілька спеціалізованих підмереж, DBRX може ефективно розподіляти дані та обчислювальну потужність для кожного завдання, забезпечуючи як високу якість виходу, так і оптимальну ефективність.

Об’ємні дані для навчання та ефективна оптимізація Хоча архітектура DBRX безумовно вражаюча, її справжня сила лежить у ретельному процесі навчання та величезній кількості даних, на яких вона була навчена. DBRX була попередньо навчена на 12 трильйонах токенів текстових та кодових даних, які були ретельно відібрані для забезпечення високої якості та різноманітності.

Дані для навчання були оброблені за допомогою інструментарію Databricks, включаючи Apache Spark для обробки даних, Unity Catalog для управління та керування даними та MLflow для відстеження експериментів. Цей комплексний інструментарій дозволив команді Databricks ефективно керувати, досліджувати та уточнювати величезний набір даних, закладючи основу для виняткової продуктивності DBRX.

Щоб ще більше підвищити можливості моделі, Databricks використала динамічний навчальний план, інноваційно змінюючи суміш даних під час навчання. Ця стратегія дозволила кожному токену бути ефективно обробленим за допомогою 36 мільярдів активних параметрів, що призвело до більш універсальної та адаптивної моделі.

Крім того, процес навчання DBRX був оптимізований для ефективності, використовуючи набір власних інструментів та бібліотек Databricks, включаючи Composer, LLM Foundry, MegaBlocks та Streaming. Застосовуючи техніки, такі як навчання за планом та оптимізовані стратегії оптимізації, команда досягла майже чотирикратного покращення ефективності обчислень порівняно з попередніми моделями.

Навчання та архітектура

DBRX була навчена за допомогою моделі передбачення наступного токену на колосальному наборі даних у 12 трильйонів токенів, підкреслюючи як текст, так і код. Цей навчальний набір вважається значно більш ефективним, ніж ті, що використовувалися в попередніх моделях, забезпечуючи багатий розуміння та здатність реагувати на різноманітні запити.

Архітектура DBRX не тільки свідчить про технічну майстерність Databricks, але також підкреслює її застосування в різних галузях. Від покращення взаємодії чат-ботів до надання можливостей для складного аналізу даних, DBRX може бути інтегрована у різні галузі, які потребують нюансового мовного розуміння.

Відміідно, DBRX Instruct навіть конкурує з деякими з найбільш просунутих закритих моделей на ринку. За даними Databricks, вона перевершує GPT-3.5 і конкурує з Gemini 1.0 Pro та Mistral Medium у різних тестах, включаючи загальні знання, повсякденне мислення, програмування та математичне мислення.

Наприклад, у тесті MMLU, який вимірює мовне розуміння, DBRX Instruct досягла результату 73,7%, перевершивши заявлений результат GPT-3.5 у 70,0%. У тесті HellaSwag на повсякденне мислення DBRX Instruct показала вражаючий результат 89,0%, перевершивши GPT-3.5 у 85,5%.

DBRX Instruct справді сяє, досягнувши результату 70,1% точності у тесті HumanEval, перевершивши не тільки GPT-3.5 (48,1%), але й спеціалізовану модель CodeLLaMA-70B Instruct (67,8%).

Ці виняткові результати підкреслюють універсальність DBRX та її здатність excelling у широкому діапазоні завдань, від природного мовного розуміння до складного програмування та математичного вирішення проблем.

Ефективне висновок та масштабованість Одним з ключових переваг архітектури DBRX є її ефективність під час висновку. Завдяки розрідженій активації параметрів DBRX може досягати швидкості висновку, яка у два-три рази вища, ніж у щільних моделей з тією ж загальною кількістю параметрів.

У порівнянні з LLaMA2-70B, популярною відкритою мовною моделлю, DBRX не тільки демонструє вищу якість, але й має майже вдвічі вищу швидкість висновку, незважаючи на те, що має лише половину активних параметрів. Ця ефективність робить DBRX привабливим вибором для розгортання у широкому діапазоні застосунків, від створення контенту до аналізу даних та подальшого.

Крім того, Databricks розробила потужний стек навчання, який дозволяє підприємствам навчати свої власні моделі класу DBRX з нуля або продовжувати навчання на основі наданих контрольних точок. Ця можливість дозволяє підприємствам використовувати весь потенціал DBRX та адаптувати його до своїх конкретних потреб, ще більше демократизуючи доступ до передових технологій LLM.

Доступність та інтеграції

У відповідності зі своєю місією з просування відкритого доступу до штучного інтелекту, Databricks зробила DBRX доступною через різні канали. Ваги як базової моделі (DBRX Base), так і моделі з тонким налаштуванням (DBRX Instruct) розміщені на популярній платформі Hugging Face, що дозволяє дослідникам та розробникам легко завантажувати та працювати з моделлю.

Крім того, репозиторій моделі DBRX доступний на GitHub, забезпечуючи прозорість та дозволяючи подальшу дослідженість та налаштування коду моделі.

пропускна здатність висновку для різних конфігурацій моделей на нашій оптимізованій інфраструктурі служб з використанням NVIDIA TensorRT-LLM з 16-розрядною точністю та найкращими прапорцями оптимізації, які ми могли знайти.

Для клієнтів Databricks DBRX Base та DBRX Instruct доступні через API-моделі Databricks Foundation, забезпечуючи безшовну інтеграцію у існуючі робочі процеси та застосунки. Це не тільки спрощує процес розгортання, але й забезпечує керування даними та безпеку для чутливих випадків використання.

Крім того, DBRX вже інтегрована у кілька сторонніх платформ та сервісів, таких як You.com та Perplexity Labs, розширюючи її охоплення та потенційні застосування. Ці інтеграції демонструють зростаючий інтерес до DBRX та її можливостей, а також збільшення прийняття відкритих LLM у різних галузях та випадках використання.

Можливості довгого контексту та генерації з підтримкою пошуку Одна з видатних особливостей DBRX полягає у її здатності обробляти довгі контексти входів, з максимальною довжиною контексту 32 768 токенів. Ця здатність дозволяє моделі обробляти та генерувати текст на основі обширної контекстної інформації, роблячи її придатною для завдань, таких як підсумовування документів, відповіді на питання та пошук інформації.

У тестах, що оцінюють продуктивність довгого контексту, таких як KV-Pairs та HotpotQAXL, DBRX Instruct перевершує GPT-3.5 Turbo у різних довжинах послідовностей та позиціях контексту.

DBRX перевершує встановлені відкриті моделі у мовному розумінні (MMLU), програмуванні (HumanEval) та математиці (GSM8K).

DBRX перевершує встановлені відкриті моделі у мовному розумінні (MMLU), програмуванні (HumanEval) та математиці (GSM8K).

Обмеження та майбутня робота

Хоча DBRX представляє собою значний крок у сфері відкритих LLM, важливо визнати її обмеження та області для майбутнього покращення. Як і будь-яка модель штучного інтелекту, DBRX може генерувати неточні або упереджені відповіді, залежно від якості та різноманітності її навчальних даних.

Крім того, хоча DBRX excels у загальних завданнях, певні галузеві застосування можуть потребувати подальшого тонкого налаштування або спеціалізованого навчання для досягнення оптимальної продуктивності. Наприклад, у сценаріях, де точність та вірність мають першорядне значення, Databricks рекомендує використовувати техніки генерації з підтримкою пошуку (RAG), щоб підвищити продуктивність моделі.

Крім того, поточний навчальний набір даних DBRX складається переважно з англомовного контенту, що потенційно обмежує її продуктивність у неангломовних завданнях. Майбутні ітерації моделі можуть включати розширення навчального набору даних для включення більш різноманітного діапазону мов та культурних контекстів.

Databricks зобов’язується безперервно покращувати можливості DBRX, адресуючи її обмеження. Майбутня робота буде зосереджена на покращенні продуктивності моделі, масштабованості та зручності використання у різних застосунках та випадках використання, а також на вивченні технік для пом’якшення потенційних упереджень та просування етичного використання штучного інтелекту.

Крім того, компанія планує далі уточнювати процес навчання, використовуючи передові техніки, такі як федераційне навчання та методи, що зберігають приватність, для забезпечення безпеки та приватності даних.

Дорога вперед

DBRX представляє собою значний крок вперед у демократизації розвитку штучного інтелекту. Вона бачить майбутнє, у якому кожне підприємство має можливість контролювати свої дані та свою долю у світі генерації штучного інтелекту.

Відкриваючи DBRX та надаючи доступ до тих самих інструментів та інфраструктури, які були використані для її побудови, Databricks надає підприємствам та дослідникам можливість розробити свої власні моделі Databricks, адаптовані до їхніх конкретних потреб.

Через платформу Databricks клієнти можуть використовувати інструментарій компанії для обробки даних, включаючи Apache Spark, Unity Catalog та MLflow, для кураторства та управління своїми навчальними даними. Потім вони можуть використовувати оптимізовані бібліотеки навчання Databricks, такі як Composer, LLM Foundry, MegaBlocks та Streaming, для навчання своїх власних моделей класу DBRX ефективно та у масштабі.

Ця демократизація розвитку штучного інтелекту має потенціал розблокувати нову хвилю інновацій, оскільки підприємства здобувають можливість використовувати силу великих мовних моделей для широкого діапазону застосунків, від створення контенту та аналізу даних до підтримки прийняття рішень та подальшого.

Крім того, фостеруючи відкриту та колаборативну екосистему навколо DBRX, Databricks спрямована на прискорення темпу досліджень та розвитку у сфері великих мовних моделей. Коли більше організацій та осіб внесуть свій досвід та ідеї, колективні знання та розуміння цих потужних систем штучного інтелекту будуть продовжувати зростати, прокладаючи шлях для ще більш просунутих та здатних моделей у майбутньому.

Висновок

DBRX є революційною силою у світі відкритих великих мовних моделей. З її інноваційною архітектурою суміші експертів, об’ємними даними для навчання та революційною продуктивністю, вона встановила новий стандарт того, що можливо з відкритими LLM.

Демократизуючи доступ до передових технологій штучного інтелекту, DBRX надає дослідникам, розробникам та підприємствам можливість досліджувати нові горизонти у природному мовному обробленні, створенні контенту, аналізі даних та подальшому. Коли Databricks продовжує уточнювати та покращувати DBRX, потенційні застосування та вплив цієї потужної моделі є真正 безмежними.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.