Моделі та платформи ШІ

Все, що вам потрібно знати про Llama 3 | Найпотужніша відкрита модель до цього часу | Концепції до використання

mm
Додайте Unite.AI до бажаних джерел у Google

Meta недавно випустила Llama 3, наступне покоління своєї революційної відкритої моделі великих мовних моделей (LLM). Будуючи на основі засад, закладених її попередником, Llama 3 спрямована на покращення можливостей, які поставили Llama 2 як значного відкритого конкурента ChatGPT, як це описано в статті Llama 2: Глибокий аналіз відкритого конкурента ChatGPT.

У цій статті ми обговоримо основні концепції, що стоять за Llama 3, дослідимо її інноваційну архітектуру та процес навчання, та надамо практичні поради щодо того, як отримати доступ, використовувати та розгортати цю революційну модель відповідально. Чи ви дослідник, розробник, чи ентузіаст штучного інтелекту, цей пост забезпечить вас знаннями та ресурсами, необхідними для використання можливостей Llama 3 у ваших проектах та застосунках.

Еволюція Llama: Від Llama 2 до Llama 3

Генеральний директор Meta, Марк Цукерберг, оголосив про дебют Llama 3, останньої моделі штучного інтелекту, розробленої Meta AI. Ця революційна модель, тепер відкрита, призначена для покращення різних продуктів Meta, включаючи Messenger та Instagram. Цукерберг підкреслив, що Llama 3 позиціонує Meta AI як найбільш просунуту безкоштовно доступну модель штучного інтелекту.

Перед тим, як ми поговоримо про особливості Llama 3, давайте коротко розглянемо її попередника, Llama 2. Представлена у 2022 році, Llama 2 була значним етапом у ландшафті відкритих мовних моделей, пропонуючи потужну та ефективну модель, яку можна було запускати на споживчій апаратурі.

Однак, хоча Llama 2 була значним досягненням, вона мала свої обмеження. Користувачі повідомляли про проблеми з хибними відмовами (модель відмовлялася відповідати на безпечні запити), обмеженою корисністю та можливостями для покращення в таких областях, як висновок та генерація коду.

Llama 3: відповідь Meta на ці виклики та відгуки спільноти. З Llama 3, Meta поставила за мету створити найкращі відкриті моделі на рівні з найкращими власницькими моделями, які доступні сьогодні, одночасно пріоритезуючи відповідальне розроблення та розгортання.

Llama 3: Архітектура та навчання

Одним з ключових інновацій у Llama 3 є її токенізація, яка має значно розширений словник з 128,256 токенів (у порівнянні з 32,000 у Llama 2). Цей більший словник дозволяє більш ефективно кодувати текст, як для входу, так і для виходу, потенційно ведучи до покращення багатомовності та загальної продуктивності.

Llama 3 також включає Групувальну увагу запиту (GQA), ефективну техніку представлення, яка покращує масштабованість та допомагає моделі обробляти довші контексти більш ефективно. Версія 8B Llama 3 використовує GQA, тоді як обидві моделі 8B та 70B можуть обробляти послідовності до 8,192 токенів.

Дані навчання та масштабування

Дані навчання, використані для Llama 3, є важливим фактором у її покращеній продуктивності. Meta підготувала величезну базу даних з понад 15 трильйонів токенів з публічно доступних онлайн-джерел, у сім разів більшу, ніж база даних, використана для Llama 2. Ця база даних також включає значну частку (більше 5%) високоякісних неанглійських даних, що охоплює понад 30 мов, у підготовці до майбутніх багатомовних застосунків.

Для забезпечення якості даних Meta використала передові фільтраційні техніки, включаючи евристичні фільтри, фільтри NSFW, семантичну дедуплікацію та текстові класифікатори, навчені на Llama 2 для передбачення якості даних. Команда також провела широкі експерименти для визначення оптимальної суміші джерел даних для попереднього навчання, забезпечуючи, що Llama 3 працює добре у широкому діапазоні випадків використання, включаючи тривіальні питання, STEM, кодування та історичні знання.

Масштабування попереднього навчання було ще одним критичним аспектом розробки Llama 3. Meta розробила закони масштабування, які дозволили їм передбачити продуктивність своїх найбільших моделей на ключових завданнях, таких як генерація коду, до їх фактичного навчання. Це інформувало рішення щодо суміші даних та розподілу обчислень, в кінцевому підсумку ведучи до більш ефективного та ефективного навчання.

Найбільші моделі Llama 3 були навчені на двох спеціально побудованих кластерах з 24,000 GPU, використовуючи комбінацію паралельної обробки даних, паралельної обробки моделей та техніки паралельної обробки трубопроводів. Передовий стек навчання Meta автоматизував виявлення та обробку помилок, максимізуючи час безперебійного використання GPU та збільшуючи ефективність навчання приблизно у три рази порівняно з Llama 2.

Інструкційна настройка та продуктивність

Для розблокування повного потенціалу Llama 3 для застосунків чату та діалогу Meta інноваційно підходила до інструкційної настройки. Її метод поєднує кероване тонке налаштування (SFT), вибірковий відбір, проксимальну оптимізацію політики (PPO) та пряму оптимізацію переваг (DPO).

Якість запиту, використаного в SFT, та рейтингів переваг, використаних у PPO та DPO, відігравала важливу роль у продуктивності вирівняних моделей. Команда Meta ретельно підготувала ці дані та провела кілька раундів забезпечення якості анотацій, наданих людьми-анотаторами.

Навчання на рейтингах переваг через PPO та DPO також суттєво покращило продуктивність Llama 3 на завданнях висновку та кодування. Meta виявила, що навіть коли модель бореться з прямим відповіддю на питання висновку, вона все ж може виробляти правильний слід висновку. Навчання на рейтингах переваг дозволило моделі навчитися, як вибирати правильну відповідь з цих слідів.

Результати Арени

Результати говорять самі за себе: Llama 3 перевершує багато доступних відкритих чат-моделей на загальних галузевих бенчмарках, встановлюючи новий рівень продуктивності для мовних моделей на рівні 8B та 70B параметрів.

Відповідальне розроблення та питання безпеки

Прагнучи до революційної продуктивності, Meta також пріоритезувала відповідальне розроблення та розгортання практик для Llama 3. Компанія прийняла системний підхід, уявляючи моделі Llama 3 як частину ширшої екосистеми, яка ставить розробників у центр управління, дозволяючи їм проектувати та налаштовувати моделі для своїх конкретних випадків використання та вимог безпеки.

Meta провела широкі навчання червоних команд, провела оцінки зловмисної діяльності та реалізувала техніки мінімізації ризиків, щоб знизити залишкові ризики у своїх інструкційно-налаштованих моделях. Однак компанія визнає, що залишкові ризики, ймовірно, залишаться, і рекомендує розробникам оцінювати ці ризики у контексті своїх конкретних випадків використання.

Для підтримки відповідального розгортання Meta оновила свій Посібник з відповідального використання, надаючи комплексний ресурс для розробників щодо реалізації найкращих практик безпеки моделей та систем для їхніх застосунків. Посібник охоплює теми, такі як модерування контенту, оцінка ризиків та використання інструментів безпеки, таких як Llama Guard 2 та Code Shield.

Llama Guard 2, побудована на основі таксономії MLCommons, призначена для класифікації входів LLM (запитів) та відповідей, виявлення контенту, який може бути визнаний небезпечним або шкідливим. CyberSecEval 2 розширює свій попередник, додаючи заходи для запобігання зловживанню інтерпретатором моделі, кібербезпеки та вразливості до атак ін’єкції запиту.

Code Shield, нова функція, представлена з Llama 3, додає фільтрацію небезпечного коду, згенерованого LLM, на час інференції, пом’якшуючи ризики, пов’язані з небезпечними пропозиціями коду, зловживанням інтерпретатором та безпечним виконанням команд.

Отримання доступу та використання Llama 3

Після запуску Llama 3 Meta AI кілька відкритих інструментів стали доступними для локального розгортання на різних операційних системах, включаючи Mac, Windows та Linux. Цей розділ описує три помітні інструменти: Ollama, Open WebUI та LM Studio, кожен з яких пропонує унікальні функції для використання можливостей Llama 3 на персональних пристроях.

Ollama: Доступна для Mac, Linux та Windows, Ollama спрощує роботу з Llama 3 та іншими великими мовними моделями на персональних комп’ютерах, навіть тих, що мають менш потужну апаратуру. Вона включає менеджер пакетів для легкого управління моделями та підтримує команди на різних платформах для завантаження та запуску моделей.

Open WebUI з Docker: Цей інструмент пропонує зручний, Docker-базований інтерфейс, сумісний з Mac, Linux та Windows. Він інтегрується безшовно з моделями з реєстру Ollama, дозволяючи користувачам розгортати та взаємодіяти з моделями, такими як Llama 3, у локальному веб-інтерфейсі.

LM Studio: Орієнтована на користувачів на Mac, Linux та Windows, LM Studio підтримує ряд моделей та побудована на основі проекту llama.cpp. Вона пропонує інтерфейс чату та дозволяє прямому взаємодії з різними моделями, включаючи модель Llama 3 8B Instruct.

Ці інструменти забезпечують, щоб користувачі могли ефективно використовувати Llama 3 на своїх персональних пристроях, задовольняючи різноманітні технічні навички та вимоги. Кожна платформа пропонує крок за кроком процеси налаштування та взаємодії з моделями, роблячи просунутий штучний інтелект більш доступним для розробників та ентузіастів.

Розгортання Llama 3 у великому масштабі

Крім надання прямого доступу до ваг моделі, Meta співпрацює з різними постачальниками хмарних послуг, служб моделей API та платформ апаратного забезпечення для забезпечення безшовного розгортання Llama 3 у великому масштабі.

Одним з ключових переваг Llama 3 є її покращена ефективність токенів, завдяки новому токенізації. Бенчмарки показують, що Llama 3 вимагає до 15% менше токенів порівняно з Llama 2, що призводить до швидшого та більш економічного висновку.

Інтеграція Групувальної уваги запиту (GQA) у версії 8B Llama 3 сприяє підтриманню ефективності висновку на рівні з версією 7B Llama 2, незважаючи на збільшення кількості параметрів.

Для спрощення процесу розгортання Meta надала репозиторій рецептів Llama, який містить відкритий код та приклади для тонкого налаштування, розгортання, оцінки моделей та іншого. Цей репозиторій служить цінним ресурсом для розробників, які хочуть використовувати можливості Llama 3 у своїх застосунках.

Для тих, хто цікавиться продуктивністю Llama 3, Meta інтегрувала свої останні моделі у Meta AI, провідного помічника штучного інтелекту, побудованого з технологією Llama 3. Користувачі можуть взаємодіяти з Meta AI через різні застосунки Meta, такі як Facebook (META ), Instagram, WhatsApp, Messenger та веб, щоб виконувати завдання, навчатися, створювати та зв’язуватися з тим, що їм важливо.

Що далі для Llama 3?

Хоча моделі 8B та 70B позначають початок випуску Llama 3, у Meta є амбіційні плани на майбутнє цієї революційної мовної моделі.

У найближчі місяці ми можемо очікувати нових можливостей, включаючи багатомодальність (спроможність обробляти та генерувати різні модальності даних, такі як зображення та відео), багатомовність (підтримку кількох мов) та значно довші вікна контексту для покращення продуктивності на завданнях, які вимагають розширеного контексту.

Крім того, Meta планує випустити більші розміри моделей, включаючи моделі з понад 400 мільярдами параметрів, які зараз знаходяться у стадії навчання та демонструють перспективні тенденції щодо продуктивності та можливостей.

Для подальшого просування галузі Meta також опублікує детальну наукову статтю про Llama 3, поділячись своїми висновками та інсайтами з ширшою спільнотою штучного інтелекту.

Як попередній погляд на те, що очікується, Meta поділилася деякими ранніми знімками продуктивності своєї найбільшої моделі LLM на різних бенчмарках. Хоча ці результати засновані на ранньому чекпойнті та можуть змінитися, вони надають захопливий погляд на майбутній потенціал Llama 3.

Висновок

Llama 3 представляє значний етап у розвитку відкритих великих мовних моделей, розширюючи межі продуктивності, можливостей та відповідального розроблення. З її інноваційною архітектурою, величезною базою даних навчання та передовими техніками тонкого налаштування Llama 3 встановлює новий рівень продуктивності для мовних моделей на рівні 8B та 70B параметрів.

Однак, Llama 3 – це не просто потужна мова модель; це свідчення зобов’язання Meta щодо створення відкритої та відповідальної екосистеми штучного інтелекту. Надавши комплексні ресурси, інструменти безпеки та найкращі практики, Meta надає можливість розробникам використовувати повний потенціал Llama 3, забезпечуючи відповідальне розгортання, адаптоване до їхніх конкретних випадків використання та аудиторії.

Як продовжується шлях Llama 3, з новими можливостями, розмірами моделей та науковими висновками на горизонті, спільнота штучного інтелекту з нетерпінням чекає інноваційних застосунків та проривів, які безумовно виникнуть з цієї революційної мовної моделі.

Чи ви дослідник, який розширює межі обробки природної мови, розробник, який будує наступне покоління інтелектуальних застосунків, чи ентузіаст штучного інтелекту, який цікавиться останніми досягненнями, Llama 3 обіцяє бути потужним інструментом у вашому арсеналі, відкриваючи нові двері та розблоковуючи світ можливостей.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.