Моделі та платформи ШІ

Розкриття Meta Llama 3: стрибок вперед у великих мовних моделях

mm
Додайте Unite.AI до бажаних джерел у Google

У сфері генерації штучного інтелекту Meta продовжує лідерство завдяки своєму зобов’язанню щодо відкритого доступу, розповсюджуючи свою передову велику мовну модель Meta AI (Llama) серії у світі серед розробників та дослідників. Розробляючи свої прогресивні ініціативи, Meta недавно представила третю ітерацію цієї серії, Llama 3. Ця нова редакція суттєво покращує Llama 2, пропонуючи численні поліпшення та встановлюючи стандарти, які викликають конкуренцію серед промислових конкурентів, таких як Google (GOOGL ), Mistral та Anthropic. Ця стаття досліджує суттєві досягнення Llama 3 та те, як вона порівнюється зі своєю попередницею, Llama 2.

Серія Llama Meta: від ексклюзивності до відкритого доступу та підвищення продуктивності

Meta розпочала свою серію Llama у 2022 році з запуском Llama 1, моделі, обмеженої некомерційним використанням та доступною лише для вибраних дослідницьких інститутів через величезні обчислювальні вимоги та власницький характер, який характеризував передові LLM на той час. У 2023 році з випуском Llama 2 Meta AI перейшла до більшої відкритості, пропонуючи модель безкоштовно для дослідницьких та комерційних цілей. Це було зроблено для демократизації доступу до складних технологій генерації штучного інтелекту, дозволяючи ширшому колу користувачів, включаючи стартапи та менші дослідницькі команди, інновувати та розробляти додатки без високих витрат, зазвичай пов’язаних з великомасштабними моделями. Продовжуючи цю тенденцію до відкритості, Meta представила Llama 3, яка зосереджена на покращенні продуктивності менших моделей у різних промислових бенчмарках.

Розкриття Llama 3

Llama 3 є другим поколінням відкритих великих мовних моделей Meta (LLM), що містить як попередньо натреновані, так і інструкційно-тонко налаштовані моделі з 8B та 70B параметрів. У відповідності зі своїми попередниками, Llama 3 використовує декодер-ексклюзивну трансформерну архітектуру та продовжує практику автoregresивної, само-навчальної підготовки для передбачення наступних токенів у текстових послідовностях. Llama 3 попередньо натренована на наборі даних, який у сім разів більший, ніж той, який використовувався для Llama 2, і містить понад 15 трильйонів токенів, отриманих з нового кураторського міксу публічно доступних онлайн-даних. Цей величезний набір даних обробляється двома кластерами, оснащеними 24 000 GPU. Для підтримання високої якості цих навчальних даних застосовувалися різні дані-орієнтовані техніки штучного інтелекту, включаючи евристичні та NSFW-фільтри, семантичну дедуплікацію та класифікацію якості тексту. Призначена для діалогових додатків, модель Llama 3 Instruct була суттєво покращена, включаючи понад 10 мільйонів зразків даних, анотованих людьми, та використовуючи складну суміш методів навчання, таких як кероване тонке налаштування (SFT), вибірковий відбір, проксимальна оптимізація політики (PPO) та пряма оптимізація політики (DPO).

Llama 3 проти Llama 2: ключові поліпшення

Llama 3 пропонує кілька поліпшень порівняно з Llama 2, суттєво підвищуючи її функціональність та продуктивність:

  • Розширена лексика: Llama 3 має розширену лексику до 128 256 токенів, у порівнянні з 32 000 токенів Llama 2. Це поліпшення підтримує більш ефективне текстове кодування для входів та виходів і посилює її багатомовні можливості.
  • Розширена довжина контексту: Моделі Llama 3 пропонують довжину контексту 8 000 токенів, подвоюючи 4 090 токенів, підтримуваних Llama 2. Це збільшення дозволяє обробляти більш об’ємний контент, охоплюючи як користувацькі запити, так і відповіді моделі.
  • Поліпшені навчальні дані: Навчальний набір даних для Llama 3 у сім разів більший, ніж для Llama 2, включаючи у чотири рази більше коду. Він містить понад 5% високоякісних, неанглійських даних, що охоплюють понад 30 мов, що є важливим для багатомовної підтримки додатків. Ці дані проходять суворий контроль якості за допомогою передових технік, таких як евристичні та NSFW-фільтри, семантична дедуплікація та текстові класифікатори.
  • Уточнене інструкційне налаштування та оцінка: Відхиляючись від Llama 2, Llama 3 використовує передові інструкційні техніки налаштування, включаючи кероване тонке налаштування (SFT), вибірковий відбір, проксимальну оптимізацію політики (PPO) та пряму оптимізацію політики (DPO). Для доповнення цього процесу представлено новий високоякісний набір оцінки людини, що складається з 1 800 запитів, які охоплюють різноманітні випадки використання, такі як поради, мозковий штурм, класифікація, кодування тощо, забезпечуючи всебічну оцінку та тонке налаштування можливостей моделі.
  • Розширена безпека штучного інтелекту: Llama 3, як і Llama 2, включає суворі заходи безпеки, такі як інструкційне тонке налаштування та комплексне червоне командування для мінімізації ризиків, особливо в критичних галузях, таких як кібербезпека та біологічні загрози. У підтримку цих зусиль Meta також представила Llama Guard 2, тонко налаштовану на 8B-версії Llama 3. Ця нова модель покращує серію Llama Guard шляхом класифікації входів та виходів LLM для ідентифікації потенційно небезпечного контенту, що робить її ідеальною для виробничих середовищ.

Доступність Llama 3

Моделі Llama 3 тепер інтегровані в екосистему Hugging Face, підвищуючи доступність для розробників. Моделі також доступні через платформи типу “модель як послуга”, такі як Perplexity Labs та Fireworks.ai, а також на хмарних платформах, таких як AWS SageMaker, Azure ML та Vertex AI. Meta планує розширити доступність Llama 3 далі, включаючи платформи, такі як Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM та Snowflake. Крім того, апаратна підтримка для Llama 3 буде розширена для включення платформ від AMD, AWS, Dell, Intel (INTC ), NVIDIA та Qualcomm.

Майбутні поліпшення в Llama 3

Meta оголосила, що поточний випуск Llama 3 є лише початковою фазою в їхньому широкому баченні повної версії Llama 3. Вони розробляють передову модель з понад 400 мільярдами параметрів, яка представить нові функції, включаючи багатомодальність та можливість обробляти кілька мов. Ця покращена версія також матиме суттєво розширений контекстний вікно та покращені загальні можливості продуктивності.

Висновок

Llama 3 Meta позначає суттєву еволюцію у ландшафті великих мовних моделей, рухаючи серію не тільки до більшої відкритості, але й суттєво підвищуючи її продуктивні можливості. З навчальним набором даних, у сім разів більшим, ніж у попередниці, та функціями, такими як розширена лексика та збільшена довжина контексту, Llama 3 встановлює нові стандарти, які викликають конкуренцію навіть серед найсильніших промислових конкурентів.

Ця третя ітерація не тільки продовжує демократизацію технологій штучного інтелекту, роблячи високорівневі можливості доступними для ширшого спектру розробників, але також вводить суттєві досягнення в безпеці та точності навчання. Інтегруючи ці моделі в платформи, такі як Hugging Face, та розширюючи доступність через основні хмарні послуги, Meta забезпечує, що Llama 3 є не тільки універсальною, але й потужною.

Оглядаючи майбутнє, подальша розробка Meta обіцяє ще більш потужні можливості, включаючи багатомодальність та розширену мовну підтримку, встановлюючи сцену для того, щоб Llama 3 не тільки конкурувала, але й потенційно перевершувала інші великі моделі штучного інтелекту на ринку. Llama 3 є свідченням зобов’язання Meta лідерства в революції штучного інтелекту, забезпечуючи інструменти, які не тільки більш доступні, але й суттєво покращені та безпечні для глобальної бази користувачів.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.