Моделі та платформи ШІ
Найпотужніший відкритий LLM дотепер: Meta LLAMA 3.1-405B
Llama 3.1-405B, розроблений Meta AI, представляє значний крок вперед у відкритих моделях мови. З 405 мільярдами параметрів він є найбільшим публічно доступним мовним моделем на сьогоднішній день, конкуруючи та навіть перевершуючи деякі з найбільш просунутих пропріетарних моделей у різних бенчмарках.
Ключові особливості:
- 405 мільярдів параметрів
- 128К токенів довжини контексту
- Багатомовна підтримка (8 мов)
- Інструкційна настройка версія доступна
- Відкритий вихідний код з перmissive ліцензією
Випуск такого потужного моделі в відкритому домені є революційним, демократизуючи доступ до передових можливостей штучного інтелекту та сприяючи інноваціям у галузі.
Архітектура моделі та навчання
Процес починається з перетворення вхідних текстових токенів у токен-ембеддинги. Ці ембеддинги проходять через кілька шарів самоуваження та фідфорвард-мереж, що дозволяє моделі захопити складні відносини та залежності всередині тексту. Авторегресивний механізм декодування потім генерує вихідні текстові токени, завершуючи процес.

-
Групове запитання уваги (GQA)
Llama 3.1 використовує Групове запитання уваги, яке є важливим оптимізаційним методом, не повністю розглянутим у попередній відповіді. Давайте розглянемо це детальніше:
Групове запитання уваги (GQA) є варіантом багатоголової уваги, який спрямований на зменшення обчислювальних витрат та використання пам’яті під час інференсу, особливо для довгих послідовностей. У моделі Llama 3.1 405B GQA реалізовано з 8 ключ-значення голів.
Ось як працює GQA:
- Замість окремих ключ-значення проєкцій для кожної голови уваги, GQA групує кілька запит-голів для спільного використання ключ-значення голів.
- Ця груповка суттєво зменшує кількість параметрів у ключ-значення проєкціях, що призводить до менших розмірів моделі та швидшого інференсу.
- Обчислення уваги можна виразити як:
Увага(Q, K, V) = softmax(QK^T / sqrt(d_k))VДе Q групується у g груп, а K і V мають менше голів, ніж Q.
Переваги GQA у Llama 3.1 405B включають:
- Зменшений відбиток пам’яті: Менше ключ-значення проєкцій означає менше пам’яті, необхідної для зберігання параметрів моделі.
- Швидший інференс: З меншими обчисленнями, необхідними для ключ-значення проєкцій, швидкість інференсу покращується.
- Збережена продуктивність: Незважаючи на зменшення кількості параметрів, GQA показав збереження порівнянної продуктивності з стандартною багатоголовою увагою у багатьох завданнях.
-
Двостадійна попередня підготовка для розширення контексту
Стаття згадує двостадійний процес попередньої підготовки для досягнення 128К токенів контекстного вікна. Це є важливим аспектом можливостей Llama 3.1 405B:
Стадія 1: Початкова попередня підготовка на 8К токенів
- Модель спочатку тренується на послідовностях до 8К токенів.
- Ця стадія дозволяє моделі вивчити загальне розуміння мови та генерацію.
Стадія 2: Продовження попередньої підготовки для розширення контексту
- Після початкової підготовки модель продовжує попередню підготовку для збільшення довжини контексту до 128К токенів.
- Ця стадія включає спеціально розроблені навчальні режими для того, щоб модель могла узагальнювати до довших послідовностей без втрати здатності обробляти коротші контексти.
-
Багатомодальні можливості
Хоча попередня відповідь торкнулася багатомодальних можливостей, ми можемо розширити інформацію про те, як Llama 3.1 405B реалізує це:
Композиційний підхід:
- Llama 3.1 405B використовує окремі кодувальники для різних модальностей (наприклад, зображень, мовлення).
- Ці кодувальники перетворюють вхідні дані з різних модальностей у спільний простір ембеддингів, який мовна модель може зрозуміти.
Інтеграція з мовною моделлю:
- Вихідні дані з цих спеціалізованих кодувальників потім подаються у основну мовну модель.
- Це дозволяє Llama 3.1 405B обробляти та розуміти різні типи даних одночасно, що дозволяє їй виконувати завдання, які включають кілька модальностей.
Механізми跨-уваги:
- Для обробки інтеграції різних модальностей Llama 3.1 405B, ймовірно, використовує механізми跨-уваги.
- Ці механізми дозволяють моделі звертатися до відповідної інформації з різних модальностей під час генерації тексту або виконання інших завдань.
Багатомодальні можливості Llama 3.1 405B відкривають широкий спектр застосувань, таких як:
- Капціонування зображень та візуальне питання-відповідь
- Транскрипція мовлення з контекстним розумінням
- Багатомодальні завдання розуміння, що поєднують текст, зображення та потенційно інші типи даних
Деталі навчання
- Навчений на понад 15 трильйонів токенів
- Кастомний GPU-кластер з 39,3M GPU-годин для моделі 405B
- Розрізноманітнена кураторська база даних для багатомовних можливостей
Інструкційна настройка пройшла додаткове навчання:
- Настройка на публічно доступних інструкційних наборах даних
- Понад 25M синтетичних прикладів
- Кероване тонке налаштування (SFT) та Посилення навчання з людською оцінкою (RLHF)
Бенчмарки продуктивності
Таблиця порівнює Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni та Claude 3.5 Sonnet. Ключові бенчмарки включають загальні завдання, такі як MMLU та IFEval, завдання кодування, такі як HumanEval та GSM8K, та завдання розуміння, такі як ARC Challenge. Кожний бал бенчмарку відображає здатність моделі розуміти та генерувати текст, подібний до людського, розв’язувати складні завдання та виконувати код. Особливо Llama 3.1 405B та Claude 3.5 Sonnet виявили себе у багатьох бенчмарках, демонструючи свої просунуті можливості у загальних та спеціалізованих завданнях.
Майбутні напрямки
Випуск Llama 3.1-405B, ймовірно, прискорить інновації в кількох областях:
- Поліпшені техніки настройки для спеціалізованих доменів
- Розробка більш ефективних методів інференсу
- Прогрес у стисненні моделей та відокремленні знань
Висновок
Llama 3.1-405B представляє значний рубіж у відкритих моделях мови, пропонуючи можливості, які раніше були ексклюзивними для закритих моделей.
Під час дослідження можливостей цієї моделі важливо підходити до її використання з відповідальністю та етичними міркуваннями. Інструменти та заходи безпеки, надані разом з моделлю, пропонують рамки для відповідального розгортання, але подальша увага та співпраця спільноти будуть ключовими для забезпечення того, що ця потужна технологія буде використовуватися на благо суспільства.














