Моделі та платформи ШІ

MPT-30B: MosaicML перевершує GPT-3 з новим LLM для розширення меж NLP

mm
Додайте Unite.AI до бажаних джерел у Google

MosaicML – це компанія з генерації штучного інтелекту, яка надає рішення для розгортання та масштабування штучного інтелекту. Їхня остання велика мова модель (LLM) MPT-30B викликає великий інтерес у спільноті штучного інтелекту.

Подорож MosaicML з LLM почалася з випуску MPT-7B (Mosaic Pretrained Transformer) у травні 2023 року, який мав три варіанти:

  1. MPT-7B-StoryWriter-65k+ (для генерації довгих історій)
  2. MPT-7B-Instruct (для виконання коротких інструкцій)
  3. MPT-7B-Chat (для генерації діалогів)

Ці моделі мали великий успіх у спільноті машинного навчання через свою відкриту природу, комерційну придатність та виняткову здатність обробляти розширені контекстні вікна.

Найважливіше, що модель була на рівні та в деяких випадках перевершувала інші порівнювані моделі (LLaMA-7B, StableLM 7B тощо). До червня серія MPT-7B була завантажена понад 3 мільйони разів. 22 червня MosaicML випустила MPT-30B, яка ще більше підняла планку для відкритих фонових моделей.

MPT-30B: потужна LLM, яка перевершує GPT-3

MPT-30B – це відкрита та комерційно ліцензована декодерна LLM, яка потужніша за GPT-3-175B з лише 17% параметрів GPT-3, тобто 30B. Вона перевершує GPT-3 у багатьох завданнях. Ось порівняння між MPT-30B та GPT-3.

MPT-30B побудована на основі попередньої моделі MPT-7B. Вона є обчислювально ефективною для навчання порівняно з моделями подібного розміру. Наприклад, LLaMA-30B використала приблизно 1,44 рази більше бюджету FLOPs, ніж MPT-30B, тоді як Falcon-40B мав на 1,27 рази вищій бюджет FLOPs, ніж MPT-30B. Ось ілюстрація покращення MPT-30B у різних завданнях порівняно з попередником.

Деякі особливості MPT-30B:

8k токен контекстне вікно

Контекстне вікно в LLM означає діапазон токенів, які модель може розглянути перед генерацією виводу. MPT-30B мала контекстне вікно розміром 8000 токенів під час навчання. Спочатку вона була навчена на 1T токенів за допомогою послідовностей з 2k токенів, а потім додатково на 50B токенів за допомогою послідовностей з 8k токенів (приблизно 6000 слів).

Підтримка ALiBi

Щоб пояснити цю особливість, розглянемо питання:

Як MPT-30B може зрозуміти та зробити передбачення для довших послідовностей, ніж ті, на яких вона була навчена?

MPT-30B використовує техніку Attention with Linear Biases (ALiBi) для розуміння довших послідовностей та розширення контекстного вікна понад 8k токенів під час тонкого налаштування або висновку.

Замість розрахунку позиційних вкладень, у яких кожному слову у послідовності присвоюється вектор, ALiBi розраховує оцінки уваги між ключовими та запитувальними токенами. Коли ключові та запитувальні токени знаходяться поруч, покарання низьке, але вище в іншому випадку. Таким чином, базова архітектура трансформера може екстраполювати до довгих входів.

Ефективне висновок та навчання через FlashAttention

Увага, тобто фокусування на відповідних частинах вхідної послідовності, є критичним компонентом трансформерів, але вона може бути повільною та пам’яттю інтенсивною, особливо при обробці довгих текстових послідовностей.

FlashAttention – це підхід, запропонований дослідниками Корнелльського університету, який вирішує цю проблему для MPT-30B. Використовуючи техніку тайлінгу, FlashAttention зменшує кількість разів, коли модель потрібно читати з або записувати у пам’ять, прискорюючи обробку. Таким чином, модель використовує техніку FlashAttention та бібліотеку оптимізації NVIDIA (NVDA ) FasterTransformer для ефективного навчання та висновку.

Легкість навчання та розгортання

Розробники можуть навчати MPT-30B з нуля або використовувати контрольні точки MosaicML для швидшого розгортання. Крім того, її можна тонко налаштувати для конкретних випадків використання на певній базі даних.

Розмір моделі був обраний для забезпечення легкого розгортання на одному графічному процесорі, зокрема 1xA100-80GB у 16-розрядній точності або 1xA100-40GB у 8-розрядній точності. Це означає, що модель була розроблена для розміщення у межах обмежень пам’яті цих графічних процесорів.

Кодування можливості

MPT-30B забезпечує виняткові можливості кодування. HumanEval – це база даних, випущена OpenAI, яка містить 164 рукописних програмних завдань. На базі даних HumanEval модель перевершує спеціалізовані LLM-моделі, такі як серія StarCoder.

Варіанти тонкого налаштування: MPT-30B-Instruct та MPT-30B-Chat

MPT-30B-Instruct

LLM переважно використовуються для інструкцій, таких як відповіді на питання, підсумовування тексту, переклад мови тощо. MPT-30B-Instruct – це комерційно придатний (зберігає ліцензію CC-By-SA-3.0) варіант MPT-30B, тонко налаштований спеціально для завдань виконання інструкцій. Для тонкого налаштування були використані наступні бази даних:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

База даних Dolly була додатково доповнена базою даних Anthropic’s Helpful and Harmless для тонкого налаштування інструкцій. Крім того, для даних було використано різноманітні бази даних, зокрема:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat – це тонко налаштована версія MPT-30B для генерації діалогів. Це дослідницький артефакт, випущений під ліцензією CC-By-NC-SA-4.0, який дозволяє лише некомерційне використання. Модель була тонко налаштована за допомогою різних мовних баз даних, зокрема:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM займають велику частку мільярдного ринку генерації штучного інтелекту, який пережив величезний зростання за короткий час після того, як ChatGPT революціонізував ландшафт минулого року. Родина MPT є фундаментальною частиною цієї революції. У найближчому майбутньому ми можемо очікувати побачити комерційно доступні відкриті моделі, які будуть ще потужнішими та ефективнішими, ніж родина MPT.

Для отримання останніх новин про штучний інтелект відвідайте unite.ai.

Haziqa є вченим-даними з великим досвідом написання технічного контенту для компаній AI та SaaS.