Моделі та платформи ШІ

Битва відкритих проти закритих мовних моделей: Технічний аналіз

mm
Додайте Unite.AI до бажаних джерел у Google

Великі мовні моделі (LLM) захопили увагу спільноти штучного інтелекту в останні роки, забезпечуючи прориви в обробці природної мови. За цією гіперією лежить складний диспут – чи повинні ці потужні моделі бути відкритими чи закритими?

У цьому пості ми проаналізуємо технічну диференціацію між цими підходами, щоб зрозуміти можливості та обмеження кожного з них. Ми розглянемо наступні ключові аспекти:

  • Визначення відкритих та закритих мовних моделей
  • Архітектурна прозорість та налаштування
  • Бенчмаркінг продуктивності
  • Обчислювальні вимоги
  • Застосування універсальності
  • Доступність та ліцензування
  • Конфіденційність даних та конфіденційність
  • Комерційна підтримка та розвиток

До кінця ви отримаєте інформовану перспективу на технічні компроміси між відкритими та закритими мовними моделями, щоб керувати вашою власною стратегією штучного інтелекту. Давайте почнемо!

Визначення відкритих та закритих мовних моделей

Відкриті мовні моделі мають публічно доступні архітектури моделей, вихідний код та вагові параметри. Це дозволяє дослідникам інспектувати внутрішню структуру, оцінювати якість, повторювати результати та створювати власні варіанти. До прикладів належать ConstitutionalAI від Anthropic, LLaMA від Meta та GPT-NeoX від EleutherAI.

Натомість закриті мовні моделі вважають архітектуру моделі та вагові параметри власністю. Комерційні організації, такі як Anthropic, DeepMind та OpenAI, розробляють їх внутрішньо. Без доступу до коду чи дизайнерських деталей повторюваність та налаштування зустрічають обмеження.

Архітектурна прозорість та налаштування

Доступ до внутрішньої структури відкритих мовних моделей відкриває можливості для налаштування, які просто неможливі з закритими альтернативами.

Відрегулювавши архітектуру моделі, дослідники можуть досліджувати техніки, такі як введення розрідженої зв’язності між шарами або додавання спеціальних класифікаційних токенів для підвищення продуктивності на вузьких завданнях. З доступом до вагових параметрів розробники можуть передавати знання з існуючих представлень або ініціалізувати варіанти з попередньо навченими будівельними блоками, такими як T5 та BERT-ембеддинги.

Це налаштування дозволяє відкритим мовним моделям краще служити спеціалізованим галузям, таким як біомедичні дослідження, генерація коду та освіта. Однак експертиза, необхідна для цього, може підвищити бар’єр для доставки реалізації виробництва.

Закриті мовні моделі пропонують обмежене налаштування, оскільки їх технічні деталі залишаються власністю. Однак їх підтримка вкладає великі ресурси у внутрішні дослідження та розвиток. Результатом є системи, які розширюють межі того, що можливо з загальною архітектурою мовної моделі.

Отже, хоча вони менш гнучкі, закриті мовні моделі відрізняються широкими завданнями природної мови. Вони також спрощують інтеграцію, дотримуючись встановлених інтерфейсів, таких як стандарт OpenAPI.

Бенчмаркінг продуктивності

Незважаючи на архітектурну прозорість, вимірювання продуктивності відкритих мовних моделей вводить складності. Їх гнучкість дозволяє безліч можливих конфігурацій та стратегій налаштування. Це також дозволяє моделям, позначеним як “відкриті”, насправді включати власницькі техніки, які спотворюють порівняння.

Закриті мовні моделі мають більш чітко визначені цілі продуктивності, оскільки їх підтримка бенчмарку та рекламує конкретні пороги метрик. Наприклад, Anthropic публікує точність ConstitutionalAI на відібраних наборах завдань NLU. Microsoft (MSFT ) підкреслює, як GPT-4 перевершує людські базові рівні на інструментарії мови SuperGLUE.

Тим не менш, ці вузькі бенчмарки зазнали критики за завищення продуктивності на реальних завданнях та недооцінку невдач. Справді безстороннє оцінювання мовних моделей залишається відкритим дослідницьким питанням – як для відкритих, так і для закритих підходів.

Обчислювальні вимоги

Навчання великих мовних моделей вимагає великих обчислювальних ресурсів. OpenAI витратила мільйони на навчання GPT-3 на інфраструктурі хмарних обчислень, тоді як Anthropic витратила понад 10 мільйонів доларів на GPU для ConstitutionalAI.

Сума за такі моделі виключає окремих осіб та малих команд з відкритої спільноти. Фактично, EleutherAI довелося прибрати модель GPT-J з публічного доступу через вибухові витрати на розміщення.

Без глибоких кишень, успіхи відкритих мовних моделей спираються на добровільні обчислювальні ресурси. LAION курирував свій технологічний модель LAION-5B, використовуючи добровільні дані. Проект Конституційного AI Anthropic використовував добровільні обчислення.

Великі технологічні компанії, такі як Google (GOOGL ), Meta та Baidu, забезпечують закритим зусиллям фінансовий імпульс, необхідний для індустріалізації розвитку мовних моделей. Це дозволяє масштабувати до довжин, неможливих для грантових ініціатив – просто дивіться на модель Gopher DeepMind з 280 мільярдами параметрів.

Застосування універсальності

Гнучкість відкритих мовних моделей дозволяє їм займатися дуже спеціалізованими випадками використання. Дослідники можуть агресивно змінювати внутрішню структуру моделі, щоб підвищити продуктивність на вузьких завданнях, таких як передбачення структури білків, генерація документації коду та перевірка математичних доведень.

Тим не менш, можливість доступу та редагування коду не гарантує ефективного рішення для конкретної галузі без правильних даних. Комплексні навчальні набори даних для вузьких застосунків вимагають значних зусиль для кураторства та оновлення.

Закриті мовні моделі користуються ресурсами для джерел даних з внутрішніх репозиторіїв та комерційних партнерів. Наприклад, DeepMind ліцензує бази даних, такі як ChEMBL для хімії та UniProt для білків, щоб розширити сферу застосування. Промисловий масштаб доступу до даних дозволяє моделям, таким як Gopher, досягати вражаючої універсальності, незважаючи на архітектурну непрозорість.

Доступність та ліцензування

Перmissive ліцензування відкритих мовних моделей сприяє вільному доступу та співробітництву. Моделі, такі як GPT-NeoX, LLaMA та Jurassic-1 Jumbo, використовують угоди, такі як Creative Commons та Apache 2.0, щоб дозволити некомерційне дослідження та справедливе комерціалізацію.

Натомість закриті мовні моделі мають обмежувальні ліцензії, які обмежують доступ до моделі. Комерційні організації тісно контролюють доступ, щоб зберегти потенційні потоки доходів від API прогнозування та партнерств підприємств.

Зрозуміло, організації, такі як Anthropic та Cohere, стягують плату за доступ до інтерфейсів ConstitutionalAI та Cohere-512. Однак це ризикує ціною вивести важливі галузі досліджень, викривляючи розвиток у бік добре фінансованих галузей.

Відкрите ліцензування також має свої виклики, зокрема щодо атрибуції та відповідальності. Для дослідницьких випадків використання свободи, надані відкритим доступом, пропонують явні переваги.

Конфіденційність даних та конфіденційність

Навчальні набори даних для мовних моделей зазвичай агрегують вміст з різних онлайн-джерел, таких як веб-сторінки, наукові статті та дискусійні форуми. Це ризикує виявленням особистої ідентифікаційної або іншої чутливої інформації в результатах моделі.

Для відкритих мовних моделей перевірка складу набору даних забезпечує найкращий захист проти питань конфіденційності. Оцінювання джерел даних, процедур фільтрації та документація прикладів, виявлених під час тестування, можуть допомогти ідентифікувати уразливості.

На жаль, закриті мовні моделі виключають таку публічну перевірку. Замість цього споживачі повинні покладатися на суворість внутрішніх процесів перевірки, заснованих на оголошених політиках. Наприклад, Azure Cognitive Services обіцяє фільтрувати особисті дані, тоді як Google вказує формальні огляди конфіденційності та маркування даних.

В цілому відкриті мовні моделі дозволяють більш активну ідентифікацію ризиків конфіденційності в системах штучного інтелекту до того, як ці недоліки виявляються у великому масштабі. Закриті альтернативи пропонують відносно обмежену прозорість у практиках обробки даних.

Комерційна підтримка та розвиток

Потенціал монетизації закритих мовних моделей стимулює значні комерційні інвестиції у розвиток та підтримку. Наприклад, очікуючи прибуткові повернення від свого портфеля Azure AI, Microsoft погодився на багатомільярдні партнерства з OpenAI щодо моделей GPT.

Натомість відкриті мовні моделі покладаються на добровольців, які виділяють особистий час для технічного обслуговування чи гранти, які забезпечують обмежене фінансування. Ця асиметрія ресурсів ризикує безперервністю та довголіттям відкритих проектів.

Тим не менш, бар’єри для комерціалізації також звільняють відкриті спільноти від зосередження на науковому прогресі над прибутком. І децентралізована природа відкритих екосистем пом’якшує залежність від тривалої зацікавленості будь-якого окремого спонсора.

В кінцевому підсумі кожен підхід несе компроміси щодо ресурсів та стимулів. Закриті мовні моделі мають більшу безпеку фінансування, але концентрують вплив. Відкриті екосистеми сприяють різноманіттю, але зазнають підвищеної невизначеності.

Навігація у відкритому проти закритого мовного моделі ландшафту

Вирішення між відкритими чи закритими мовними моделями вимагає зіставлення пріоритетів організації, таких як налаштування, доступність та масштабованість, з можливостями моделі.

Для дослідників та стартапів відкриті мовні моделі надають більший контроль над налаштуванням моделей для конкретних завдань. Ліцензування також спрощує безкоштовне обміну інсайтами між співробітниками. Однак тягар джерела навчальних даних та інфраструктури може підірвати реальну життєздатність.

Натомість закриті мовні моделі обіцяють значне покращення якості завдяки великим фінансуванням та даним. Однак обмеження щодо доступу та модифікацій обмежують наукову прозорість, а розгортання прив’язують до планів постачальників.

На практиці відкриті стандарти навколо специфікацій архітектури, контрольних точок моделі та оцінюваних даних можуть допомогти компенсувати недоліки обох підходів. Спільні основи, такі як трансформатор Google чи бенчмарк REALTO Оксфорду, покращують повторюваність. Стандарти інтероперабельності, такі як ONNX, дозволяють змішувати компоненти з відкритих та закритих джерел.

В кінцевому підсумі те, що має значення, – це вибір правильного інструменту – відкритого чи закритого – для завдання. Комерційні організації, які підтримують закриті мовні моделі, мають невід’ємний вплив. Однак пристрасть та принципи відкритих наукових спільнот продовжуватимуть відігравати важливу роль у розвитку штучного інтелекту.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.