Моделі та платформи ШІ
Все, що вам потрібно знати про Llama 3 | Найпотужніша відкрита модель до цього часу | Концепції до використання
Meta недавно випустила Llama 3, наступне покоління своєї революційної відкритої моделі великих мовних моделей (LLM). Будуючи на основі засад, закладених її попередником, Llama 3 спрямована на покращення можливостей, які поставили Llama 2 як значного відкритого конкурента ChatGPT, як це описано в статті Llama 2: Глибокий аналіз відкритого конкурента ChatGPT.
У цій статті ми обговоримо основні концепції, що стоять за Llama 3, дослідимо її інноваційну архітектуру та процес навчання, та надамо практичні поради щодо того, як отримати доступ, використовувати та розгортати цю революційну модель відповідально. Чи ви дослідник, розробник, чи ентузіаст штучного інтелекту, цей пост забезпечить вас знаннями та ресурсами, необхідними для використання можливостей Llama 3 у ваших проектах та застосунках.
Еволюція Llama: Від Llama 2 до Llama 3
Генеральний директор Meta, Марк Цукерберг, оголосив про дебют Llama 3, останньої моделі штучного інтелекту, розробленої Meta AI. Ця революційна модель, тепер відкрита, призначена для покращення різних продуктів Meta, включаючи Messenger та Instagram. Цукерберг підкреслив, що Llama 3 позиціонує Meta AI як найбільш просунуту безкоштовно доступну модель штучного інтелекту.
Перед тим, як ми поговоримо про особливості Llama 3, давайте коротко розглянемо її попередника, Llama 2. Представлена у 2022 році, Llama 2 була значним етапом у ландшафті відкритих мовних моделей, пропонуючи потужну та ефективну модель, яку можна було запускати на споживчій апаратурі.
Однак, хоча Llama 2 була значним досягненням, вона мала свої обмеження. Користувачі повідомляли про проблеми з хибними відмовами (модель відмовлялася відповідати на безпечні запити), обмеженою корисністю та можливостями для покращення в таких областях, як висновок та генерація коду.
Llama 3: відповідь Meta на ці виклики та відгуки спільноти. З Llama 3, Meta поставила за мету створити найкращі відкриті моделі на рівні з найкращими власницькими моделями, які доступні сьогодні, одночасно пріоритезуючи відповідальне розроблення та розгортання.
Llama 3: Архітектура та навчання
Одним з ключових інновацій у Llama 3 є її токенізація, яка має значно розширений словник з 128,256 токенів (у порівнянні з 32,000 у Llama 2). Цей більший словник дозволяє більш ефективно кодувати текст, як для входу, так і для виходу, потенційно ведучи до покращення багатомовності та загальної продуктивності.
Llama 3 також включає Групувальну увагу запиту (GQA), ефективну техніку представлення, яка покращує масштабованість та допомагає моделі обробляти довші контексти більш ефективно. Версія 8B Llama 3 використовує GQA, тоді як обидві моделі 8B та 70B можуть обробляти послідовності до 8,192 токенів.
Дані навчання та масштабування
Дані навчання, використані для Llama 3, є важливим фактором у її покращеній продуктивності. Meta підготувала величезну базу даних з понад 15 трильйонів токенів з публічно доступних онлайн-джерел, у сім разів більшу, ніж база даних, використана для Llama 2. Ця база даних також включає значну частку (більше 5%) високоякісних неанглійських даних, що охоплює понад 30 мов, у підготовці до майбутніх багатомовних застосунків.
Для забезпечення якості даних Meta використала передові фільтраційні техніки, включаючи евристичні фільтри, фільтри NSFW, семантичну дедуплікацію та текстові класифікатори, навчені на Llama 2 для передбачення якості даних. Команда також провела широкі експерименти для визначення оптимальної суміші джерел даних для попереднього навчання, забезпечуючи, що Llama 3 працює добре у широкому діапазоні випадків використання, включаючи тривіальні питання, STEM, кодування та історичні знання.
Масштабування попереднього навчання було ще одним критичним аспектом розробки Llama 3. Meta розробила закони масштабування, які дозволили їм передбачити продуктивність своїх найбільших моделей на ключових завданнях, таких як генерація коду, до їх фактичного навчання. Це інформувало рішення щодо суміші даних та розподілу обчислень, в кінцевому підсумку ведучи до більш ефективного та ефективного навчання.
Найбільші моделі Llama 3 були навчені на двох спеціально побудованих кластерах з 24,000 GPU, використовуючи комбінацію паралельної обробки даних, паралельної обробки моделей та техніки паралельної обробки трубопроводів. Передовий стек навчання Meta автоматизував виявлення та обробку помилок, максимізуючи час безперебійного використання GPU та збільшуючи ефективність навчання приблизно у три рази порівняно з Llama 2.
Інструкційна настройка та продуктивність
Для розблокування повного потенціалу Llama 3 для застосунків чату та діалогу Meta інноваційно підходила до інструкційної настройки. Її метод поєднує кероване тонке налаштування (SFT), вибірковий відбір, проксимальну оптимізацію політики (PPO) та пряму оптимізацію переваг (DPO).
Якість запиту, використаного в SFT, та рейтингів переваг, використаних у PPO та DPO, відігравала важливу роль у продуктивності вирівняних моделей. Команда Meta ретельно підготувала ці дані та провела кілька раундів забезпечення якості анотацій, наданих людьми-анотаторами.
Навчання на рейтингах переваг через PPO та DPO також суттєво покращило продуктивність Llama 3 на завданнях висновку та кодування. Meta виявила, що навіть коли модель бореться з прямим відповіддю на питання висновку, вона все ж може виробляти правильний слід висновку. Навчання на рейтингах переваг дозволило моделі навчитися, як вибирати правильну відповідь з цих слідів.
Результати говорять самі за себе: Llama 3 перевершує багато доступних відкритих чат-моделей на загальних галузевих бенчмарках, встановлюючи новий рівень продуктивності для мовних моделей на рівні 8B та 70B параметрів.
Відповідальне розроблення та питання безпеки
Прагнучи до революційної продуктивності, Meta також пріоритезувала відповідальне розроблення та розгортання практик для Llama 3. Компанія прийняла системний підхід, уявляючи моделі Llama 3 як частину ширшої екосистеми, яка ставить розробників у центр управління, дозволяючи їм проектувати та налаштовувати моделі для своїх конкретних випадків використання та вимог безпеки.
Meta провела широкі навчання червоних команд, провела оцінки зловмисної діяльності та реалізувала техніки мінімізації ризиків, щоб знизити залишкові ризики у своїх інструкційно-налаштованих моделях. Однак компанія визнає, що залишкові ризики, ймовірно, залишаться, і рекомендує розробникам оцінювати ці ризики у контексті своїх конкретних випадків використання.
Для підтримки відповідального розгортання Meta оновила свій Посібник з відповідального використання, надаючи комплексний ресурс для розробників щодо реалізації найкращих практик безпеки моделей та систем для їхніх застосунків. Посібник охоплює теми, такі як модерування контенту, оцінка ризиків та використання інструментів безпеки, таких як Llama Guard 2 та Code Shield.
Llama Guard 2, побудована на основі таксономії MLCommons, призначена для класифікації входів LLM (запитів) та відповідей, виявлення контенту, який може бути визнаний небезпечним або шкідливим. CyberSecEval 2 розширює свій попередник, додаючи заходи для запобігання зловживанню інтерпретатором моделі, кібербезпеки та вразливості до атак ін’єкції запиту.
Code Shield, нова функція, представлена з Llama 3, додає фільтрацію небезпечного коду, згенерованого LLM, на час інференції, пом’якшуючи ризики, пов’язані з небезпечними пропозиціями коду, зловживанням інтерпретатором та безпечним виконанням команд.
Отримання доступу та використання Llama 3
Після запуску Llama 3 Meta AI кілька відкритих інструментів стали доступними для локального розгортання на різних операційних системах, включаючи Mac, Windows та Linux. Цей розділ описує три помітні інструменти: Ollama, Open WebUI та LM Studio, кожен з яких пропонує унікальні функції для використання можливостей Llama 3 на персональних пристроях.
Ollama: Доступна для Mac, Linux та Windows, Ollama спрощує роботу з Llama 3 та іншими великими мовними моделями на персональних комп’ютерах, навіть тих, що мають менш потужну апаратуру. Вона включає менеджер пакетів для легкого управління моделями та підтримує команди на різних платформах для завантаження та запуску моделей.
Open WebUI з Docker: Цей інструмент пропонує зручний, Docker-базований інтерфейс, сумісний з Mac, Linux та Windows. Він інтегрується безшовно з моделями з реєстру Ollama, дозволяючи користувачам розгортати та взаємодіяти з моделями, такими як Llama 3, у локальному веб-інтерфейсі.
LM Studio: Орієнтована на користувачів на Mac, Linux та Windows, LM Studio підтримує ряд моделей та побудована на основі проекту llama.cpp. Вона пропонує інтерфейс чату та дозволяє прямому взаємодії з різними моделями, включаючи модель Llama 3 8B Instruct.
Ці інструменти забезпечують, щоб користувачі могли ефективно використовувати Llama 3 на своїх персональних пристроях, задовольняючи різноманітні технічні навички та вимоги. Кожна платформа пропонує крок за кроком процеси налаштування та взаємодії з моделями, роблячи просунутий штучний інтелект більш доступним для розробників та ентузіастів.















