Лідери думок

Еволюція навчання моделей штучного інтелекту: від розміру до ефективності

mm
Додайте Unite.AI до бажаних джерел у Google

У швидкозмінному ландшафті штучного інтелекту традиційний підхід до поліпшення мовних моделей шляхом простого збільшення розміру моделі підходить до суттєвої трансформації. Ця зміна підкреслює більш стратегічний, орієнтований на дані підхід, як це демонструють недавні розробки моделей типу Llama3.

Дані – це все, що вам потрібно

Історично склалося так, що панівним переконанням щодо вдосконалення можливостей штучного інтелекту було те, що більший розмір моделі означає кращу продуктивність.

У минулому ми були свідками драматичного збільшення можливостей глибокого навчання просто шляхом додавання更多 шарів до нейронних мереж. Алгоритми та програми, такі як розпізнавання зображень, які раніше були лише теоретично можливими до появи глибокого навчання, швидко стали широко прийнятими. Розробка графічних карт ще більше посилила цю тенденцію, дозволяючи більшим моделям працювати з підвищеною ефективністю. Ця тенденція продовжується і в сучасній хвилі великих мовних моделей.

Періодично ми зустрічаємося з оголошеннями великих компаній штучного інтелекту про випуск моделей з десятками або навіть сотнями мільярдів параметрів. Легко зрозуміти раціоналізм такого підходу: чим більше параметрів має модель, тим вона більш досконала. Однак цей метод масштабування досягнув точки зменшення віддачі, особливо якщо考虑увати вартість ефективності таких моделей у практичних застосуваннях. Недавнє оголошення Meta про підхід Llama3, який використовує 8 мільярдів параметрів, але збагачений 6-7 разів більшим обсягом високоякісних навчальних даних, дорівнює – і в деяких випадках перевершує – ефективність попередніх моделей типу GPT3.5, які мають понад 100 мільярдів параметрів. Це позначає суттєву зміну у законі масштабування мовних моделей, де якість і кількість даних починають переважати чистий розмір.

Вартість проти продуктивності: деликатний баланс

Когда моделі штучного інтелекту переходять від розробки до практичного використання, їх економічний вплив, особливо високі операційні витрати великомасштабних моделей, стає дедалі більш суттєвим. Ці витрати часто перевершують початкові витрати на навчання, підкреслюючи необхідність устойчивого підходу до розробки, який пріоритезує ефективне використання даних над збільшенням розміру моделі. Стратегії, такі як розширення даних і перенос навчання, можуть покращити набори даних і зменшити потребу у великомасштабному повторному навчанні. Оптимізація моделей шляхом вибору ознак і зменшення розмірності підвищує обчислювальну ефективність і знижує витрати. Техніки, такі як dropout і раннє зупинення, покращують узагальнення, дозволяючи моделям працювати ефективно з меншим обсягом даних. Альтернативні стратегії розгортання, такі як обчислення на краю, зменшують залежність від дорогих хмарних інфраструктур, тоді як серверні обчислення пропонують масштабовані та економічні ресурси. Зосереджуючись на орієнтованому на дані підході та досліджуючи економічні методи розгортання, організації можуть створити більш устойчиву екосистему штучного інтелекту, яка балансує продуктивність з вартістю.

Зменшення віддачі більших моделей

Ландшафт розробки штучного інтелекту проходить суттєву трансформацію, з зростаючим акцентом на ефективному використанні даних і оптимізації моделей. Центральні компанії штучного інтелекту традиційно покладалися на створення дедалі більших моделей для досягнення найкращих результатів. Однак ця стратегія стає дедалі менш устойчивою, як з точки зору обчислювальних ресурсів, так і з точки зору масштабованості.

Децентралізований штучний інтелект, з іншого боку, пропонує інший набір викликів і можливостей. Децентралізовані блокчейн-мережі, які утворюють основу децентралізованого штучного інтелекту, мають суттєво іншу конструкцію порівняно з центральними компаніями штучного інтелекту. Це робить складним для децентралізованих підприємств штучного інтелекту конкурувати з центральними підприємствами щодо масштабування більших моделей при збереженні ефективності децентралізованих операцій.

Саме тут децентралізовані спільноти можуть максимально реалізувати свій потенціал і зайняти свою нішу в ландшафті штучного інтелекту. Зберігаючи колективний інтелект і ресурси, децентралізовані спільноти можуть розробляти і розгортати складні моделі штучного інтелекту, які є як ефективними, так і масштабованими. Це дозволить їм конкурувати ефективно з центральними компаніями штучного інтелекту і визначати майбутнє розвитку штучного інтелекту.

Погляд у майбутнє: шлях до устойчивого розвитку штучного інтелекту

Траєкторія майбутнього розвитку штучного інтелекту повинна зосереджуватися на створенні моделей, які є не тільки інноваційними, але й інтегративними та економічними. Акцент повинен зсуватися у бік систем, які можуть досягати високих рівнів точності та корисності з прийнятними витратами та використанням ресурсів. Така стратегія не тільки забезпечить масштабованість технологій штучного інтелекту, але й їх доступність і устойчивість у довгостроковій перспективі.

Когда галузь штучного інтелекту дозріває, стратегії розробки штучного інтелекту повинні еволюціонувати відповідно. Зміна від оцінки розміру до пріоритету ефективності та економічної ефективності у навчанні моделей не є лише технічним вибором, а стратегічною необхідністю, яка визначить наступне покоління застосунків штучного інтелекту. Цей підхід, ймовірно, каталізує нову еру інновацій, де розвиток штучного інтелекту буде керуватися розумними, устойчивими практиками, які обіцяють ширшу采用 і більший вплив.​​​​​​​​​​​​​​​​

Джiahao Sun, засновник і генеральний директор FLock.io, є випускником Оксфорду та експертом у галузі штучного інтелекту та блокчейну. З попередніми ролями директора штучного інтелекту в Королівському банку Канади та наукового співробітника з досліджень штучного інтелекту в Імперському коледжі Лондона, він заснував FLock.io, щоб зосередитися на рішеннях штучного інтелекту, орієнтованих на конфіденційність. Під його керівництвом FLock.io займається впровадженням інноваційних рішень у сфері безпечної та спільної підготовки та розгортання моделей штучного інтелекту, демонструючи його відданість використанню технологій для соціального прогресу.