Моделі та платформи ШІ

Повстання малих моделей: чому маленький AI перевершує гігантські моделі мови

mm
Додайте Unite.AI до бажаних джерел у Google

За останні роки штучний інтелект розвивався у напрямку створення все більших моделей. Кожен новий реліз оцінювався за кількістю параметрів, розміром навчальних даних та масштабом інфраструктури, що стояла за ним. Було припущено, що більший означає кращий. Хоча технологічні гіганти продовжують будувати все більш масивні моделі мови з сотнями мільярдів параметрів, тиха революція відбувається. Малі моделі AI, часто у тисячі разів менші за своїх гігантських аналогів, досягають порівняної та іноді вищої продуктивності у конкретних завданнях. Ця зміна викликає сумніви щодо всього, що ми думали про масштабування AI, та відкриває нові можливості для демократизації, ефективного штучного інтелекту.

Історія Давида та Голіафа сучасного AI

Тривалий час галузь AI працювала під припущенням, що більші моделі забезпечують кращу продуктивність. Серія GPT від OpenAI росла з 117 мільйонів параметрів до понад 175 мільярдів. Модель PaLM від Google (GOOGL ) досягла 540 мільярдів параметрів. Великі технологічні компанії вклали мільярди доларів у навчання цих моделей та інвестують далі, щоб створити ще більші моделі. У цій ситуації, коли кількість параметрів стала ключовим фактором визначення місткості моделі та будівництва місткості AI стало перегою обчислювальних ресурсів та витрат на інфраструктуру, цікаве явище почало відбуватися в дослідницьких лабораторіях по всьому світу.

Інженери почали виявляти, що менші, ретельно спроєктовані моделі могли дорівнювати або перевершувати продуктивність цих гігантів у конкретних завданнях. Серія Phi від Microsoft (MSFT ) продемонструвала, що модель з 2,7 мільярдами параметрів могла конкурувати з моделями у десять разів більші. Модель LLaMA від Meta довела, що моделі з 7 мільярдами параметрів могли забезпечувати виняткові результати при правильному навчанні. Ці розробки представляють фундаментальну зміну нашого розуміння ефективності AI.

Ця зміна парадигми має суттєві наслідки для використання та експлуатації AI. Малі моделі можуть працювати на споживчій апаратурі, обробляти запити швидше та споживати лише частину енергії, необхідної великим моделям. Вони роблять AI доступним для організацій, які не можуть дозволити собі масивну обчислювальну інфраструктуру. Найважливіше, що вони викликають сумніви щодо монополізованих тенденцій розвитку AI, коли тільки компанії з величезними ресурсами могли конкурувати.

Поява ефективної архітектури AI

Революція малих моделей будується на складних інженерних підходах, які максимізують продуктивність у рамках обмежених бюджетів параметрів. Ці моделі використовують передові техніки, такі як знання дистиляції, де менші “студентські” моделі вчаться у більших “вчителів” моделей, захоплюючи суттєві знання, одночасно суттєво знижуючи обчислювальні вимоги.

Серія Phi-4 від Microsoft є прикладом цього підходу. Модель Phi-4 з лише 14 мільярдами параметрів конкурує з моделями у п’ять разів більші у математичних розрахунках та логічному вирішенні проблем. Аналогічно, модель Gemma 3 270M від Google демонструє, що компактна модель з 270 мільйонами параметрів може забезпечувати сильні інструктивні можливості та служити чудовим фундаментом для тонкого налаштування.

Модель Llama 3.2 1B від Meta є ще одним проривом у ефективності малих моделей. За допомогою структурованого скорочення та знання дистиляції з більших моделей Llama вона зберігає вражаючу продуктивність, одночасно працюючи ефективно на пристроях краю. Ці моделі доводять, що інновації архітектури та методології навчання мають більшу вагу, ніж кількість параметрів для багатьох реальних застосунків.

Архітектура суміші експертів є суттєвим проривом у ефективному дизайні AI. Замість використання всіх параметрів для кожного завдання, ці моделі активують лише відповідні спеціалізовані компоненти. Вони направляють різні запити до спеціалізованих підмереж, зберігаючи широкі можливості, одночасно використовуючи менше активних параметрів в будь-який момент часу. Модель Mixtral 8x7B від Mistral AI демонструє цей підхід ефективно. Хоча вона має 47 мільярдів параметрів, вона активує лише 13 мільярдів параметрів на запит, досягаючи продуктивності, порівнянної з великими щільними моделями, одночасно зберігаючи швидшу швидкість висновку.

Техніки квантування також мали суттєвий вплив на підвищення ефективності малих моделей. Представляючи ваги моделі меншою кількістю біт, дослідники можуть зменшити розмір моделі, одночасно зберігаючи точність. Сучасні методи квантування можуть зменшити розмір моделі на 75 відсотків з мінімальною втратою продуктивності. Модель Phi-3-mini від Microsoft продемонструвала ефективність цього підходу. Коли вона квантується до 4-бітної точності, вона зберігає понад 95 відсотків своєї початкової продуктивності, одночасно знижуючи вимоги до пам’яті з 7 ГБ до менше 2 ГБ, роблячи її практичною, особливо для мобільного розгортання.

Спеціалізація перевершує універсальність

Революція малих моделей відкрила важливу правду про розгортання AI. Більшість реальних застосунків не потребують моделі, яка може писати поезію, розв’язувати калькулюс чи обговорювати філософію. їм потрібні моделі, які excelling у конкретних завданнях. Чат-бот служби клієнтів не потребує знання Шекспіра. Інструмент завершення коду не потребує медичних знань. Це усвідомлення змінило фокус від будівництва універсальних моделей до створення спеціалізованих.

Домен-специфічна підготовка дозволяє малим моделям зосередити свій обмежений потенціал на відповідних знаннях. Модель з 3 мільярдами параметрів, підготовлена виключно на юридичних документах, може перевершити модель з 70 мільярдами параметрів у юридичних завданнях. Спеціалізована модель вчиться глибших закономірностей у своїй галузі, а не розподіляє свій потенціал по безлічі не пов’язаних тем. Це подібно до порівняння спеціаліста-доктора з загальним практиком для складних процедур.

Стратегії тонкого налаштування стали все більш складними. Замість навчання моделей з нуля, розробники починають з малих базових моделей та адаптують їх до конкретних потреб. Цей підхід вимагає мінімальних обчислювальних ресурсів, одночасно забезпечуючи високо здатні спеціалізовані моделі. Організації тепер можуть створювати власні рішення AI без величезних інвестицій у інфраструктуру.

Переборювання продуктивності

Останні бенчмарки відкривають несподівані переваги малих моделей у конкретних галузях. Модель Olmo 2 1B від AI2 перевершує моделі подібного розміру від великих технологічних компаній у завданнях розуміння природної мови. Модель Phi-4-mini-flash-reasoning від Microsoft досягає до 10 разів вищої швидкості обробки з 2-3 разами нижчою затримкою порівняно з традиційними моделями висновку, одночасно зберігаючи математичні можливості висновку.

Продуктивна різниця стає ще більш вражаючою, коли розглядаються завдання-специфічні застосунки. Малі моделі, налаштовані для спеціалізованих галузей, послідовно перевершують універсальні великі моделі за точністю та актуальністю. Застосунки у сфері охорони здоров’я, аналіз юридичних документів та реалізації клієнтського сервісу демонструють особливо вражаючі результати, коли малі моделі тренуються на домен-специфічних наборах даних.

Ця продуктивна перевага виникає з фокусованих підходів до навчання. Замість вивчення широких, але мілких знань по безлічі галузей, малі моделі розвивають глибоку експертизу у цілевих областях. Результатом є більш надійні, контекстно-відповідні відповіді для конкретних випадків використання.

Перевага швидкості та ефективності

Продуктивність не полягає лише у точності. Це також про швидкість, вартість та екологічний вплив. Малі моделі excelling у всіх цих вимірах. Мала модель може генерувати відповіді за мілісекунди, тоді як великі моделі потребують секунд. Ця різниця у швидкості може здатися тривіальною, але вона стає критичною у застосунках, які вимагають реального часу взаємодії чи обробки мільйонів запитів.

Споживання енергії є ще одним критичним аспектом. Великі моделі потребують масивних центрів даних з складними системами охолодження. Кожен запит споживає суттєву кількість електроенергії. Малі моделі можуть працювати на стандартних серверах або навіть персональних комп’ютерах, використовуючи лише частину енергії. Коли організації стикаються з тиском щодо зниження свого вуглецевого сліду, екологічна перевага малих моделей стає все більш важливою.

Розгортання на пристроях краю є, можливо, найбільш трансформаційною можливістю малих моделей. Ці моделі можуть працювати безпосередньо на телефонах, ноутбуках чи пристроях IoT без інтернет-з’єднання. Уявіть діагностичні інструменти охорони здоров’я, які працюють у віддалених районах без інтернет-доступу, або пристрої реального часу перекладу, які не потребують хмарного з’єднання. Малі моделі роблять ці сценарії можливими, привнося можливості AI на мільярди пристроїв по всьому світу.

Проблеми конфіденційності також сприяють малим моделям. Коли AI працює локально на пристроях користувачів, чутливі дані ніколи не покидають пристрій. Охоронці здоров’я можуть аналізувати дані пацієнтів без завантаження їх на хмарні сервери. Фінансові інститути можуть обробляти транзакції без відкриття інформації клієнтів зовнішнім системам. Ця локальна можливість обробки вирішує одну з основних проблем про прийняття AI у чутливих галузях.

Основне

Повстання малих моделей AI викликає сумніви щодо переконання, що більші моделі завжди забезпечують кращу продуктивність. Компактні моделі з меншою кількістю параметрів тепер дорівнюють або навіть перевершують більші моделі у певних завданнях, використовуючи техніки, такі як знання дистиляції, квантування та спеціалізацію. Ця зміна робить AI більш доступним, дозволяючи швидше та більш енергоефективне використання на звичайних пристроях. Це також знижує витрати, зменшує екологічний вплив та покращує конфіденційність, дозволяючи локальне розгортання. Зосереджуючись на ефективних, завдань-специфічних моделях замість масивних універсальних систем, AI стає більш практичним, доступним та корисним для організацій та окремих осіб.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.