Моделі та платформи ШІ

Розбиваючи код масштабування: Як моделі штучного інтелекту переозначають правила

mm
Додайте Unite.AI до бажаних джерел у Google

Штучний інтелект зробив видатні кроки в останні роки. Моделі, які раніше мали труднощі з базовими завданнями, тепер успішно розв’язують математичні задачі, генерують код і відповідають на складні питання. Центральним моментом цього прогресу є концепція законів масштабування – правил, які пояснюють, як моделі штучного інтелекту покращуються при зростанні, навчанні на більших даних або збільшенні обчислювальних ресурсів. Протягом років ці закони служили планом для розробки кращого штучного інтелекту.

Нещодавно з’явилася нова тенденція. Дослідники знаходять способи досягати революційних результатів без простого збільшення моделей. Ця зміна є не тільки технічною еволюцією. Це переозначає, як будується штучний інтелект, роблячи його більш ефективним, доступним і стійким.

Основи законів масштабування

Закони масштабування схожі на формулу для покращення штучного інтелекту. Вони стверджують, що при збільшенні розміру моделі, наданні їй більшої кількості даних або збільшенні обчислювальних ресурсів її продуктивність покращується. Наприклад:

Розмір моделі: Більші моделі з більшою кількістю параметрів можуть вивчати і представляти більш складні закономірності. Параметри – це налаштовувані частини моделі, які дозволяють їй робити передбачення.

Дані: Навчання на великих, різноманітних наборах даних допомагає моделям загальнувати краще, дозволяючи їм виконувати завдання, для яких вони не були явно навчені.

Обчислювальні ресурси: Більша обчислювальна потужність дозволяє швидше і ефективніше навчання, досягнення вищої продуктивності.

Цей рецепт керував еволюцією штучного інтелекту понад десятиліття. Ранні нейронні мережі, такі як AlexNet і ResNet, продемонстрували, як збільшення розміру моделі може покращити розпізнавання зображень. Потім з’явилися трансформери, де моделі, такі як GPT-3 і BERT від Google (GOOGL ), показали, що масштабування може розблокувати зовсім нові можливості, такі як навчання з少шими даними.

Межі масштабування

Незважаючи на свій успіх, масштабування має межі. При зростанні моделей покращення від додавання нових параметрів зменшується. Це явище, відоме як “закон зменшення віддачі“, означає, що подвійне збільшення розміру моделі не подвоює її продуктивність. Замість цього кожне збільшення приносить менші вигоди. Це означає, що для подальшого покращення продуктивності таких моделей потрібно буде ще більше ресурсів для відносно скромних вигод. Це має реальні наслідки. Будування великих моделей супроводжується значними фінансовими та екологічними витратами. Навчання великих моделей дорого. GPT-3, як повідомляється, коштував мільйони доларів для навчання. Ці витрати роблять передові технології штучного інтелекту недоступними для менших організацій. Навчання великих моделей споживає величезну кількість енергії. Дослідження оцінило, що навчання однієї великої моделі може викинути стільки ж вуглекислого газу, скільки п’ять автомобілів за весь їхній термін служби.

Дослідники визнали ці виклики і почали шукати альтернативи. Замість того, щоб покладатися на силю, вони запитали: Як ми можемо зробити штучний інтелект розумнішим, а не більшим?

Розбиваючи код масштабування

Недавні прориви показують, що можливо перевершити традиційні закони масштабування. Розумніші архітектури, розвинені стратегії даних і ефективні методи навчання дозволяють штучному інтелекту досягати нових висот без потреби в величезних ресурсах.

Розумніші конструкції моделей: Замість збільшення моделей дослідники зосереджуються на тому, щоб зробити їх більш ефективними. Прикладами є:

    • Розріджені моделі: Замість активації всіх параметрів одночасно розріджені моделі використовують тільки ті частини, які необхідні для конкретного завдання. Цей підхід економить обчислювальну потужність, зберігаючи продуктивність. Видатним прикладом є Mistral 7B, який, незважаючи на те, що має тільки 7 мільярдів параметрів, перевершує великі моделі завдяки розрідженій архітектурі.
    • Покращення трансформерів: Трансформери залишаються основою сучасного штучного інтелекту, але їхній дизайн еволюціонує. Інновації, такі як лінійні механізми уваги, роблять трансформери швидшими і менш ресурсоємними.

Кращі стратегії даних: Більше даних не завжди краще. Кураторські, високоякісні набори даних часто перевершують простий обсяг. Наприклад,

    • Фокусовані набори даних: Замість навчання на величезних, нефільтрованих даних дослідники використовують чисті і релевантні набори даних. Наприклад, OpenAI перейшов до ретельно відібраних даних для покращення надійності.
    • Домен-специфічне навчання: У спеціалізованих галузях, таких як медицина чи право, націлені набори даних допомагають моделям виконувати завдання з меншою кількістю прикладів.

Ефективні методи навчання: Нові методи навчання зменшують потребу в ресурсах без жертвування продуктивністю. Наприклад:

    • Навчання за навчальною програмою: Починаючи з простіших завдань і поступово вводячи складніші, моделі вчаться більш ефективно. Це нагадує, як люди вчаться.
    • Техніки, такі як LoRA (Низькорангове адаптування): Ці методи дозволяють ефективно налаштовувати моделі без повного їх повторного навчання.
    • Захоплення градієнта: Цей підхід зменшує використання пам’яті під час навчання, дозволяючи великим моделям працювати на обмеженому обладнанні.

Емерджентні можливості: При зростанні моделей вони іноді демонструють несподівані можливості, такі як розв’язання задач, для яких вони не були явно навчені. Ці емерджентні можливості викликають сумніви щодо традиційних законів масштабування, оскільки вони часто з’являються в великих моделях, але не в менших.

Гібридні підходи для розумнішого штучного інтелекту: Об’єднання нейронних мереж з символічним висновком є ще одним перспективним напрямком. Ці гібридні системи поєднують розпізнавання закономірностей з логічним висновком, роблячи їх більш розумними і адаптивними. Цей підхід зменшує потребу в величезних наборах даних і обчислювальних ресурсах.

Реальні приклади

Деякі недавні моделі демонструють, як ці досягнення переозначають правила:

GPT-4o Mini: Модель демонструє продуктивність, порівнянну з великою версією, але при цьому потребує значно менше ресурсів. Вона досягає цих результатів завдяки розумнішим методам навчання і фокусованим наборам даних.

Mistral 7B: З лише 7 мільярдами параметрів ця модель перевершує великі моделі. Її розріджена архітектура доводить, що розумний дизайн може перевершити простий розмір.

Claude 3.5: Приоритезуючи безпеку і етичні міркування, ця модель балансує сильну продуктивність з вдумливим використанням ресурсів.

Вплив на розбивання законів масштабування

Ці досягнення мають реальні наслідки.

Зробити штучний інтелект більш доступним: Ефективні конструкції зменшують витрати на розробку і розгортання штучного інтелекту. Відкриті моделі, такі як Llama 3.1, роблять передові інструменти штучного інтелекту доступними для менших компаній і дослідників.

Більш зелений майбутній: Оптимізовані моделі зменшують споживання енергії, роблячи розвиток штучного інтелекту більш стійким. Ця зміна є критичною, оскільки зростають побоювання щодо екологічного сліду штучного інтелекту.

Розширення можливостей штучного інтелекту: Менші, більш ефективні моделі можуть працювати на звичайних пристроях, таких як смартфони і пристрої Інтернету речей. Це відкриває нові можливості для застосунків, від реального часу перекладу до автономних систем у автомобілях.

Основне

Закони масштабування сформували минуле штучного інтелекту, але вони вже не визначають його майбутнє. Розумніші архітектури, краще оброблення даних і ефективні методи навчання розбивають традиційні закони масштабування. Ці інновації роблять штучний інтелект не тільки потужнішим, але й більш практичним і стійким.

Фокус змістився від примусового зростання до розумного дизайну. Ця нова епоха обіцяє штучний інтелект, який буде доступним для більшої кількості людей, екологічно чистим і здатним розв’язувати задачі способами, яких ми тільки починаємо уявляти. Код масштабування не тільки розбивається – він переписується.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.