Моделі та платформи ШІ

Google робить навчання штучного інтелекту на 28% швидшим за допомогою SLM як учителів

mm
Додайте Unite.AI до бажаних джерел у Google

Навчання більших мовних моделей (LLM) стало недосяжним для більшості організацій. З витратами, що складають мільйони, та вимогами до обчислювальних ресурсів, які б зробили суперкомп’ютер потому, розвиток штучного інтелекту залишився закритим за дверима технологічних гігантів. Але Google (GOOGL ) просто змінила цю історію, використовуючи підхід, так простий, що дивно, чому ніхто не подумав про нього раніше: використання менших моделей штучного інтелекту як учителів.

Як працює SALT: Новий підхід до навчання моделей штучного інтелекту

У недавній дослідницькій роботі під назвою “Троха допомоги йде далеко: Ефективне навчання LLM за допомогою використання малих моделей,” дослідники Google та DeepMind представили SALT (Мала модель, що допомагає великій моделі навчання). Це новий метод, який викликає сумніви щодо нашого традиційного підходу до навчання LLM.

Чому це дослідження важливе? Наразі навчання великих моделей штучного інтелекту подібне до того, як намагатися навчити когось всього одночасно – це неефективно, дорого та часто обмежене організаціями з величезними обчислювальними ресурсами. SALT пропонує інший шлях, вводячи двостадійний процес навчання, який є як інноваційним, так і практичним.

Розбивка того, як SALT насправді працює:

Стадія 1: Відокремлення знань

  • Менша мова модель (SLM) виступає як учитель, ділячись своїм розумінням з більшим моделлю
  • Менша модель зосереджується на передачі свого “навчених знань” через те, що дослідники називають “м’якими мітками”
  • Подіумайте це як викладача, який займається фундаментальними концепціями, перш ніж студент переходить до складніших тем
  • Ця стадія особливо ефективна в “легких” регіонах навчання – областях, де менша модель має сильну передбачувальну впевненість

Стадія 2: Самостійне навчання

  • Більша модель переходить до незалежного навчання
  • Вона зосереджується на освоєнні складних закономірностей та складних завдань
  • Це місце, де модель розвиває можливості, що виходять за рамки того, що могла б забезпечити менша “учителька”
  • Перехід між стадіями використовує ретельно розроблені стратегії, включаючи лінійне зниження та лінійне співвідношення зниження ваги дистиляції

У не-технічних термінах, уявіть, що менша модель штучного інтелекту подібна до корисного репетитора, який направляє більшу модель на початку стадій навчання. Цей репетитор надає додаткову інформацію разом зі своїми відповідями, вказуючи, наскільки впевнено він щодо кожної відповіді. Ця додаткова інформація, відома як “м’які мітки”, допомагає більшій моделі вивчати швидше та ефективніше.

Тепер, коли більша модель штучного інтелекту стає більш здатною, їй потрібно перейти від залежності від репетитора до самостійного навчання. Це місце, де “лінійне зниження” та “лінійне співвідношення зниження” вступають у гру.
Подіумайте це як поступове зменшення впливу репетитора з часом:
  • Лінійне зниження: Це подібно до повільного зниження гучності голосу репетитора. Напрям репетитора стає менш помітним на кожному етапі, дозволяючи більшій моделі зосередитися більше на вивченні суто з самих даних.
  • Лінійне співвідношення зниження: Це подібно до регулювання балансу між порадами репетитора та самим завданням. По мірі прогресу навчання акцент зміщується більше до原始ної задачі, тоді як вхід репетитора стає менш домінантним.
Мета обидвох технік полягає в тому, щоб забезпечити плавний перехід для більшої моделі штучного інтелекту, запобігаючи будь-яким раптовим змінам у її поведінці навчання.

Результати переконливі. Коли дослідники Google протестували SALT, використовуючи модель SLM з 1,5 млрд параметрів для навчання моделі LLM з 2,8 млрд параметрів на наборі даних Pile, вони побачили:

  • Зниження часу навчання на 28% порівняно з традиційними методами
  • Помітне покращення продуктивності після доопрацювання:
    • Точність математичних завдань зросла до 34,87% (порівняно з 31,84% базового рівня)
    • Точність читання сягнула 67% (зросла з 63,7%)

Але те, що робить SALT真正 інноваційним, – це його теоретична основа. Дослідники виявили, що навіть “слабша” модель-учителька може покращити продуктивність учня, досягнувши того, що вони називають “вигідним компромісом між дисперсією та зміщенням”. У простих термінах, менша модель допомагає більшій вивчити фундаментальні закономірності більш ефективно, створюючи міцніший фундамент для подальшого навчання.

Чому SALT може змінити поле розвитку штучного інтелекту

Пам’ятайте, коли хмарні обчислення змінили те, хто може заснувати технологічну компанію? SALT може зробити те саме для розвитку штучного інтелекту.

Я слідкував за інноваціями у сфері навчання штучного інтелекту протягом років, і більшість проривів здебільшого приносили користь технологічним гігантам. Але SALT інша.

Ось що це може означати для майбутнього:

Для організацій з обмеженими ресурсами:

  • Вам, можливо, більше не потрібно величезної обчислювальної інфраструктури для розробки здатних моделей штучного інтелекту
  • Менші дослідницькі лабораторії та компанії могли б експериментувати з розробкою власних моделей
  • Зниження часу навчання на 28% прямо перетворюється на нижчі обчислювальні витрати
  • Що більш важливо, ви могли б почати з скромними обчислювальними ресурсами та все ж досягнути професійних результатів

Для ландшафту розвитку штучного інтелекту:

  • Більше гравців могли б вступити на це поле, що призведе до більш різноманітних та спеціалізованих рішень штучного інтелекту
  • Університети та дослідницькі установи могли б проводити більше експериментів зі своїми наявними ресурсами
  • Бар’єр для входу в дослідження штучного інтелекту значно знижується
  • Ми могли б побачити нові застосування в галузях, які раніше не могли собі дозволити розвиток штучного інтелекту

Що це означає для майбутнього

Використовуючи менші моделі як учителів, ми не тільки робимо навчання штучного інтелекту більш ефективним – ми також фундаментально змінюємо те, хто може брати участь у розвитку штучного інтелекту. Наслідки виходять далеко за рамки просто технічних поліпшень.

Ключові висновки, які потрібно пам’ятати:

  • Зниження часу навчання на 28% – це те, що відрізняє початок проекту штучного інтелекту від того, щоб вважати його недосяжним
  • Покращення продуктивності (34,87% на математичних завданнях, 67% на завданнях читання) показує, що доступність не завжди означає компроміс щодо якості
  • Підхід SALT доводить, що іноді найкращі рішення походять від переосмислення фундаментальних принципів, а не просто додавання більшої обчислювальної потужності

На що слід звернути увагу:

  1. Слідкуйте за малими організаціями, які починають розробляти власні моделі штучного інтелекту
  2. Слідкуйте за новими застосуваннями в галузях, які раніше не могли собі дозволити розвиток штучного інтелекту
  3. Шукайте інновації в тому, як менші моделі використовуються для спеціалізованих завдань

Пам’ятайте: Реальна цінність SALT полягає в тому, як він може змінити те, хто може інновувати в сфері штучного інтелекту. Чи Ви керуєте дослідницькою лабораторією, керуєте командою технологій або просто цікавитесь розробкою штучного інтелекту, цей прорив може зробити Вашу наступну велику ідею можливою.

Можливо, почніть думати про той проект штучного інтелекту, який Ви вважали недосяжним. Він може бути більш можливим, ніж Ви уявляли.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.