Моделі та платформи ШІ

Gemma: Google привносить просунуті можливості штучного інтелекту через відкритий код

mm
Додайте Unite.AI до бажаних джерел у Google

Область штучного інтелекту (ШІ) пережила величезний прогрес за останні роки, головним чином завдяки досягненням у галузі глибокого навчання та обробки природної мови (NLP). На чолі цих досягнень стоять багатомовні моделі мови (LLM) – системи ШІ, навчені на величезних обсягах текстових даних, які можуть генерувати текст, подібний до людського, та брати участь у розмовних завданнях.

LLM, такі як PaLM від Google , Claude від Anthropic та Gopher від DeepMind, продемонстрували видатні можливості, від програмування до розсудливого мислення. Однак більшість цих моделей не були відкрито випущені, що обмежує їх доступ для дослідження, розробки та корисних застосувань.

Ця ситуація змінилася з недавнім відкритим випуском Gemma – сім’ї LLM від DeepMind, заснованої на їхніх потужних пропріетарних моделях Gemini. У цьому блог-пості ми зануримося у Gemma, аналізуючи її архітектуру, процес навчання, продуктивність та відповідальний випуск.

Огляд Gemma

У лютому 2023 року DeepMind відкрила джерельний код двох розмірів моделей Gemma – версії з 2 млрд параметрів, оптимізованої для розгортання на пристрої, та більшої версії з 7 млрд параметрів, призначеної для використання на GPU/TPU.

Gemma використовує подібну архітектуру трансформера та методологію навчання, як і провідні моделі Gemini від DeepMind. Вона була навчена на до 6 трильйонів токенів текстових даних з веб-документів, математики та коду.

DeepMind випустила як сирі попередньо навчені чекпойнти Gemma, так і версії, дофіновані з допомогою наглядового навчання та зворотного зв’язку людини для поліпшення можливостей у таких областях, як діалог, виконання інструкцій та програмування.

Початок роботи з Gemma

Відкритий випуск Gemma робить її просунуті можливості ШІ доступними для розробників, дослідників та ентузіастів. Ось швидкий посібник, щоб почати роботу:

Платформо-незалежне розгортання

Однією з сильних сторін Gemma є її гнучкість – ви можете запускати її на CPU, GPU або TPU. Для CPU використовуйте TensorFlow Lite або HuggingFace Transformers. Для прискореного виконання на GPU/TPU використовуйте TensorFlow. Хмарні служби, такі як Vertex AI від Google Cloud, також забезпечують безшовне масштабування.

Доступ до попередньо навчених моделей

Gemma доступна у різних попередньо навчених варіантах, залежно від ваших потреб. Моделі 2B та 7B пропонують сильні генеративні можливості безпосередньо з коробки. Для настройки під ваші дані ідеально підходять моделі 2B-FT та 7B-FT.

Створення цікавих застосунків

Ви можете створювати широкий спектр застосунків з Gemma, таких як генерація історій, переклад мови, відповіді на питання та виробництво творчого контенту. Ключем є використання сильних сторін Gemma через настройку під ваші власні дані.

Архітектура

Gemma використовує архітектуру трансформера тільки з декодером, будучи заснованою на таких досягненнях, як багатозапитний механізм уваги та роторні позиційні вкладення:

  • Трансформери: Введені у 2017 році, архітектура трансформера, заснована тільки на механізмах уваги, стала універсальною у NLP. Gemma успадкувала здатність трансформера моделювати довгострокові залежності у тексті.
  • Тільки декодер: Gemma використовує тільки стек декодера трансформера, на відміну від моделей типу BART або T5, які мають як декодер, так і енкодер. Це забезпечує сильні генеративні можливості для завдань, таких як генерація тексту.
  • Багатозапитна увага: Gemma використовує багатозапитну увагу у своїй більшій моделі, дозволяючи кожній головці уваги обробляти кілька запитів паралельно для прискорення висновку.
  • Роторні позиційні вкладення: Gemma представляє позиційну інформацію за допомогою роторних вкладень замість абсолютних позиційних кодувань. Ця техніка зменшує розмір моделі, зберігаючи при цьому позиційну інформацію.

Використання таких технік, як багатозапитна увага та роторні позиційні вкладення, дозволяє моделям Gemma досягати оптимального балансу між продуктивністю, швидкістю висновку та розміром моделі.

Дані та процес навчання

Gemma була навчена на до 6 трильйонів токенів текстових даних, головним чином англійською мовою. Це включало веб-документи, математичні тексти та джерельний код.

Навчання проводилось на інфраструктурі TPUv5 від Google, з використанням до 4096 TPU для навчання моделі Gemma-7B. Ефективні техніки паралелізму моделі та даних дозволили навчати величезні моделі на стандартному обладнанні.

Було використано стадійне навчання, яке постійно коригувало розподіл даних для фокусування на високоякісному, релевантному тексті. Фінальні стадії дофінування використовували суміш людських та синтетичних прикладів виконання інструкцій для поліпшення можливостей.

Продуктивність моделі

DeepMind ретельно оцінила моделі Gemma на широкому наборі з понад 25 бенчмарків, що охоплюють питання-відповідь, міркування, математику, програмування, здоровий глузд та діалогові можливості.

Gemma досягає результатів на рівні стану мистецтва порівняно з подібними відкритими моделями на більшості бенчмарків. Деякі видатні результати:

  • Математика: Gemma виділяється на математичних тестах, таких як GSM8K та MATH, перевершуючи моделі, такі як Codex та Claude від Anthropic, на понад 10 пунктів.
  • Програмування: Gemma дорівнює або перевершує продуктивність Codex на програмних бенчмарках, таких як MBPP,尽管 вона не була спеціально навчена на коді.
  • Діалог: Gemma демонструє сильні розмовні можливості з 51,7% перемог над моделлю Mistral-7B від Anthropic у тестах людських переваг.
  • Міркування: На завданнях, що вимагають висновку, таких як ARC та Winogrande, Gemma перевершує інші 7B-моделі на 5-10 пунктів.

Універсальність Gemma по різних дисциплінам демонструє її сильні можливості загального інтелекту. Хоча залишаються прогалини до людського рівня продуктивності, Gemma представляє собою крок вперед у відкритих моделях NLP.

Безпека та відповідальність

Випуск відкритих ваг моделей великого розміру вводить виклики щодо наміреного зловживання та вбудованих моделей упередженості. DeepMind вжила кроки для мінімізації ризиків:

  • Фільтрація даних: Потенційно токсичні, незаконні або упереджені тексти були видалені з навчальних даних за допомогою класифікаторів та евристик.
  • Оцінки: Gemma була протестована на понад 30 бенчмарках, призначених для оцінки безпеки, справедливості та стійкості. Вона дорівнює або перевершує інші моделі.
  • Дофінування: Дофінування моделі було зосереджено на поліпшенні можливостей безпеки, таких як фільтрація інформації та відповідна поведінка відмови/застереження.
  • Умови використання: Умови використання забороняють використання моделей Gemma для образливих, незаконних або неетичних застосунків. Однак забезпечення дотримання цих умов залишається складним завданням.
  • Картки моделей: Були випущені картки, що містять інформацію про можливості моделі, обмеження та упередженість, для сприяння прозорості.

Хоча існують ризики, пов’язані з відкритим випуском, DeepMind визначила, що випуск Gemma забезпечує чисту соціальну користь на основі її профілю безпеки та можливості сприяння дослідженням. Однак подальше спостереження за потенційними шкодами залишається критично важливим.

Забезпечення наступної хвилі інновацій ШІ

Випуск Gemma як відкритої моделі сім’ї має потенціал розблокувати прогрес по всьому співтовариству ШІ:

  • Доступність: Gemma зменшує бар’єри для організацій, які хочуть будувати з використанням передових можливостей NLP, яким раніше доводилося сталікатися з високими витратами на обчислення та дані для навчання своїх власних LLM.
  • Нові застосування: Відкритий випуск попередньо навчених та дофінованих чекпойнтів дозволяє DeepMind забезпечити легше розроблення корисних застосунків у таких областях, як освіта, наука та доступність.
  • Настройка: Розробники можуть далі налаштовувати Gemma для промислових або галузевих застосунків шляхом подальшого навчання на власних даних.
  • Дослідження: Відкриті моделі, такі як Gemma, сприяють більшій прозорості та аудиту поточних систем NLP, освітлюючи майбутні напрямки досліджень.
  • Інновації: Доступність сильних базових моделей, таких як Gemma, прискорить прогрес у таких областях, як мінімізація упередженості, фактологічність та безпека ШІ.

Відкритий випуск Gemma забезпечує доступ до її можливостей для всіх, сподіваючись тим самим спонукати відповідальне розроблення ШІ для соціальної добробути.

Дорога вперед

З кожним кроком у ШІ ми наближаємося до моделей, які дорівнюють або перевершують людський інтелект у всіх областях. Системи, такі як Gemma, підкреслюють, як швидкі досягнення у самонавчанні розблоковують усе більш просунуті когнітивні можливості.

Однак залишається робота для поліпшення надійності, інтерпретації та керованості ШІ – областей, де людський інтелект усе ще панує. Області, такі як математика, підкреслюють ці постійні прогалини, з Gemma, яка набирає 64% на MMLU порівняно з оцінкою людської продуктивності на рівні 89%.

Закриття цих прогалин, забезпечуючи при цьому безпеку та етику усе більш здатних систем ШІ, буде центральним викликом у майбутньому. Знаходження правильного балансу між відкритістю та обережністю буде критично важливим, оскільки DeepMind намагається демократизувати доступ до переваг ШІ, керуючи при цьому новими ризиками.

Ініціативи з просування безпеки ШІ, такі як ANC від Dario Amodei, команда Етики та Спільноти DeepMind та Конституційний ШІ від Anthropic, свідчать про зростаюче визнання цієї потреби у нюансах. Певний прогрес буде вимагати відкритого, заснованого на доказах діалогу між дослідниками, розробниками, політиками та громадськістю.

Якщо це буде здійснено відповідально, Gemma представляє не вершину ШІ, а базовий табір для наступного покоління дослідників ШІ, які слідують за DeepMind у напрямку справедливої, корисної штучної загальної інтелігентності.

Висновок

Випуск моделей Gemma від DeepMind означає нову еру для відкритого ШІ – одну, яка переходить від вузьких бенчмарків до загальних інтелектуальних можливостей. Тестована широко на безпеку та доступна широкому колу людей, Gemma встановлює новий стандарт для відповідального відкритого випуску у сфері ШІ.

Стимульована конкурентним духом, врівноваженим кооперативними цінностями, спільність проривів, таких як Gemma, підвищує рівень усіх учасників екосистеми ШІ. Усі тепер мають доступ до універсальної сім’ї моделей LLM для підтримки своїх ініціатив.

Хоча ризики залишаються, технічна та етична ретельність DeepMind забезпечує впевненість, що переваги Gemma перевершують її потенційні шкоди. Коли можливості ШІ стають усе більш просунутими, підтримання цього нюансу між відкритістю та обережністю буде критично важливим.

Gemma робить ще один крок до ШІ, який приносить користь усім людям. Однак залишаються великі виклики на шляху до благонаміряної штучної загальної інтелігентності. Якщо дослідники ШІ, розробники та суспільство загалом зможуть підтримувати колаборативний прогрес, Gemma колись може бути сприйнята як історичний базовий табір, а не остаточна вершина.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.