Моделі та платформи ШІ
Зростаючий вплив малих мовних моделей

By
Aayush Mittal Міттал
Поява малих мовних моделей
У світі штучного інтелекту, що швидко розвивається, розмір мовної моделі часто був синонімом її можливостей. Великі мовні моделі (LLM) типу GPT-4 домінували в ландшафті штучного інтелекту, демонструючи видатні можливості у розумінні та генерації природної мови. Однак відбувається тонка, але значима зміна. Малі мовні моделі, які раніше перебували в тіні своїх більших аналогів, тепер виникають як потужні інструменти у різних застосуваннях штучного інтелекту. Ця зміна позначає критичний момент у розвитку штучного інтелекту, що викликує довгостійнє переконання, що більший завжди краще.
Еволюція та обмеження великих мовних моделей
Розробка систем штучного інтелекту, здатних розуміти та генерувати мову, подібну до людської, в першу чергу зосереджувалася на великих мовних моделях. Ці моделі перевершували попередні, менші моделі, у таких областях, як переклад, підсумовування та відповіді на питання. Однак успіх великих мовних моделей відбувається за ціну. Їх високий енергоспоживання, великі вимоги до пам’яті та обчислювальних ресурсів викликають занепокоєння. Ці проблеми посилюються тим, що темп інновацій у сфері графічних процесорів відстає від зростання розміру цих моделей, що вказує на можливу межу для збільшення масштабу.
Дослідники все частіше звертають увагу на малі мовні моделі, які пропонують більш ефективні та універсальні альтернативи в певних сценаріях. Наприклад, дослідження Turc et al. (2019) показало, що знання, отримані з великих мовних моделей та перенесені до менших моделей, дали подібні результати з значно зменшеними обчислювальними вимогами. Крім того, застосування технік, таких як перенос навчання, дозволило цим моделям адаптуватися ефективно до конкретних завдань, досягнувши порівняних або навіть кращих результатів у таких областях, як аналіз настрою та переклад.
Останні досягнення підкреслили потенціал менших моделей. Chinchilla від DeepMind, LLaMa від Meta, Alpaca від Стенфордського університету та серія StableLM від Stability AI – це помітні приклади. Ці моделі, незважаючи на свій менший розмір, конкурують або навіть перевершують великі моделі типу GPT-3.5 у певних завданнях. Модель Alpaca, наприклад, після доопрацювання на основі відповідей GPT-3.5 досягла подібних результатів при значно нижчих витратах. Такі розробки свідчать про те, що ефективність та ефективність малих моделей посилюються в сфері штучного інтелекту.
Технологічні досягнення та їх наслідки
Нові техніки у розробці малих мовних моделей
Останні дослідження підкреслили кілька інноваційних технік, які покращують роботу малих мовних моделей. UL2R та Flan від Google (GOOGL ) – це приклади таких підходів. UL2R, або “Ультралегка 2-відновлення”, вводить мету змішаних денойзерів у подальшому доопрацюванні, покращуючи роботу моделі у різних завданнях. Flan полягає у доопрацюванні моделей на широкому спектрі завдань, сформульованих як інструкції, покращуючи як результати, так і придатність.
Крім того, дослідження Yao Fu et al. показало, що малі моделі можуть видатно виконувати певні завдання, такі як математичний розрахунок, якщо їх належним чином тренувати та доопрацьовувати. Ці висновки підкреслюють потенціал малих моделей у спеціалізованих застосуваннях, викликуючи загальні можливості великих моделей.
Важливість ефективного використання даних
Ефективне використання даних стало ключовим напрямком у сфері малих мовних моделей. Стаття “Малі мовні моделі також є моделями з少샷-навчанням” від Timo Schick et al. пропонує спеціалізовані техніки маскування, поєднані з несбалансованими наборами даних, для покращення результатів малих моделей. Такі стратегії підкреслюють зростаючу увагу до інноваційних підходів для максимізації можливостей малих мовних моделей.
Переваги малих мовних моделей
Привабливість малих мовних моделей полягає у їх ефективності та універсальності. Вони пропонують швидші часи тренування та висновків, зменшені вуглецеві та водні сліди, і є більш придатними для розгортання на пристроях з обмеженими ресурсами, таких як мобільні телефони. Ця адаптивність все частіше стає критичною у галузі, що пріоритезує доступність та результати штучного інтелекту на широкому спектрі пристроїв.
Індустріальні інновації та розробки
Зміна індустрії до менших, більш ефективних моделей демонструється останніми розробками. Mistral’s Mixtral 8x7B, модель зі спарсеним змішанням експертів, та Microsoft’s Phi-2 – це прориви у цій сфері. Mixtral 8x7B, незважаючи на свій менший розмір, досягає якості GPT-3.5 на деяких бенчмарках. Phi-2 йде далі, працюючи на мобільних телефонах з лише 2,7 мільярдами параметрів. Ці моделі підкреслюють зростаючу увагу індустрії до досягнення більшого з меншим.
Microsoft’s Orca 2 ще раз демонструє цю тенденцію. Розробляючи оригінальну модель Orca, Orca 2 покращує можливості малих мовних моделей щодо висновків, розширюючи межі досліджень штучного інтелекту.
У підсумку, зростання малих мовних моделей представляє собою зміну парадигми у ландшафті штучного інтелекту. Коли ці моделі продовжують розвиватися та демонструвати свої можливості, вони не тільки викликають домінування великих моделей, але й переформатовують наше розуміння того, що можливе у сфері штучного інтелекту.
Мотивація для прийняття малих мовних моделей
Ростовий інтерес до малих мовних моделей (SLM) спонукається декількома ключовими факторами, головним чином ефективністю, вартістю та налаштованістю. Ці аспекти позиціонують SLM як привабливі альтернативи великим мовним моделям у різних застосуваннях.
Ефективність: ключовий фактор
SLM, через меншу кількість параметрів, пропонують значні обчислювальні ефективності порівняно з великими моделями. Ці ефективності включають швидшу швидкість висновків, зменшені вимоги до пам’яті та зберігання, а також менші потреби у даних для тренування. Таким чином, ці моделі не тільки швидші, але й більш ресурсо-еффективні, що особливо корисно у застосуваннях, де швидкість та використання ресурсів є критичними.
Вартість
Високі обчислювальні ресурси, необхідні для тренування та розгортання великих мовних моделей типу GPT-4, перекладаються у суттєві витрати. Натомість, SLM можуть бути треновані та розгорнуті на більш доступному обладнанні, роблячи їх більш доступними та фінансово досяжними для ширшого спектра підприємств. Їх зменшені вимоги до ресурсів також відкривають можливості у сфері краївих обчислень, де моделі повинні працювати ефективно на пристроях з нижчою потужністю.
Налаштованість: стратегічна перевага
Однією з найважливіших переваг SLM над великими мовними моделями є їх налаштованість. На відміну від великих мовних моделей, які пропонують широкі, але загальні можливості, SLM можуть бути налаштовані для конкретних доменів та застосунків. Ця адаптивність забезпечується швидшими циклами ітерацій та можливістю доопрацювання моделей для спеціалізованих завдань. Ця гнучкість робить SLM особливо корисними для нішевих застосунків, де конкретна, націлена продуктивність є більш цінною, ніж загальні можливості.
Масштабування малих мовних моделей без компромісу можливостей
Пошук мінімального розміру мовної моделі без втрати можливостей є центральною темою у сучасних дослідженнях штучного інтелекту. Питання полягає у тому, наскільки малими можуть бути мовні моделі, зберігаючи при цьому свою ефективність?
Встановлення нижніх меж масштабу моделі
Останні дослідження показали, що моделі з кількома мільйонами параметрів можуть набувати базових мовних компетенцій. Наприклад, модель з лише 8 мільйонами параметрів досягла близько 59% точності на бенчмарку GLUE у 2023 році. Ці висновки свідчать про те, що навіть відносно малі моделі можуть бути ефективними у певних завданнях обробки мови.
Результати здаються плато після досягнення певного масштабу, близько 200-300 мільйонів параметрів, вказуючи на те, що подальше збільшення розміру дає зменшені повернення. Це плато представляє собою “сладке місце” для комерційно розгортаних SLM, балансуючи можливості з ефективністю.
Тренування ефективних малих мовних моделей
Декілька методів тренування були вирішальними у розробці кваліфікованих SLM. Перенос навчання дозволяє моделям набувати широких компетенцій під час попереднього тренування, які потім можуть бути доопрацьовані для конкретних застосунків. Самостійне навчання, особливо ефективне для малих моделей, змушує їх глибоко узагальнювати з кожного прикладу даних, повніше використовуючи можливості моделі під час тренування.
Вибір архітектури також грає важливу роль. Ефективні трансформери, наприклад, досягають порівняних результатів з базовими моделями при значно меншій кількості параметрів. Ці техніки колективно дозволяють створювати малі, але здатні мовні моделі, придатні для різних застосунків.
Останній прорив у цій сфері – це введення механізму “Дистиляція крок за кроком“. Цій новий підхід пропонує покращені результати з зменшеними потребами у даних.
Механізм дистиляції крок за кроком використовує великі мовні моделі не тільки як джерела шумових міток, але й як агентів, здатних до висновків. Цей механізм використовує природні мовні підстави, згенеровані великими мовними моделями, для виправдання їхніх передбачень, використовуючи їх як додаткове нагородження для тренування малих моделей. Включаючи ці підстави, малі моделі можуть набувати відповідних знань про завдання більш ефективно, зменшуючи потребу у великих обсягах тренувальних даних.
Фреймворки для розробників та моделі для конкретних доменів
Фреймворки, такі як Hugging Face Hub, Anthropic Claude, Cohere for AI та Assembler, роблять розробку налаштованих SLM легшою для розробників. Ці платформи пропонують інструменти для тренування, розгортання та моніторингу SLM, роблячи мовний штучний інтелект доступним для ширшого спектра галузей.
Моделі для конкретних доменів особливо вигідні у галузях, таких як фінанси, де точність, конфіденційність та реакційна здатність є найважливішими. Ці моделі можуть бути налаштовані для конкретних завдань та часто є більш ефективними та безпечними, ніж їхні великі аналоги.
Погляд у майбутнє
Дослідження малих мовних моделей не тільки технічне завдання, але й стратегічний крок до більш сталого, ефективного та налаштованого штучного інтелекту. Коли штучний інтелект продовжує розвиватися, акцент на менших, спеціалізованіших моделях, ймовірно, зростатиме, пропонуючи нові можливості та виклики у розробці та застосуванні технологій штучного інтелекту.
Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.
Дізнайтеся більше


Лабораторії довели, що пісочниця вашого агента – це лише порада


Найкраща модель OpenAI тепер доступна лише за урядовим парканом


Якщо бот може зафліртувати з дітьми, то що ще йому дозволено робити з вашими даними?


Як обманути відгуків AI фальшивими науковими статтями


Моделі штучного інтелекту віддають перевагу текстам, написаним людьми, над текстами, згенерованими штучним інтелектом


Оркестр штучного інтелекту: чому інтелектуальна координація перевершує обчислення