Моделі та платформи ШІ

Як Google скоротила вимоги до навчання ІІ на 10 000 разів

mm
Додайте Unite.AI до бажаних джерел у Google

Індустрія штучного інтелекту стикається з фундаментальною парадоксом. Хоча машини можуть тепер обробляти дані у величезних масштабах, навчання залишається дивно неефективним, стикаючись з проблемою зменшення віддачі. Традиційні підходи до машинного навчання вимагають величезних маркованих наборів даних, які можуть коштувати мільйони доларів і займати роки для створення. Ці підходи зазвичай працюють під припущенням, що більше даних веде до кращих моделей ІІ. Однак дослідники Google (GOOGL ) недавно ввели інноваційний метод, який викликає сумніви щодо цього довгострокового переконання. Вони демонструють, що подібна продуктивність ІІ може бути досягнута з допомогою менше даних – до 10 000 разів менше навчальних даних. Цей прорив має потенціал фундаментально змінити наш підхід до ІІ. У цій статті ми розглянемо, як дослідники Google досягли цього прориву, потенційний майбутній вплив цього відкриття та проблеми й напрямки подальших досліджень.

Велика проблема даних у ІІ

Тривалий час мантра “більше даних – кращий ІІ” керувала підходом індустрії до ІІ. Великі мовні моделі, такі як GPT-4, споживають трильйони токенів під час навчання. Цей підхід, залежний від даних, створює значний бар’єр для організацій, яким бракує великих ресурсів або спеціалізованих наборів даних. По-перше, вартість людської маркування значно висока. Експертні анотатори вимагають високої оплати, а величезний обсяг даних, необхідний для проекту, робить його дорогим. По-друге, більша частина зібраних даних часто є надлишковою і не грає важливої ролі в процесі навчання. Традиційний метод також стикається з проблемами, пов’язаними з зміною вимог. Коли політики змінюються або з’являються нові види проблемного контенту, компанії повинні розпочати процес маркування заново. Цей процес створює постійний цикл дорогого збору даних і повторного навчання моделей.

Вирішення проблем великих даних за допомогою активного навчання

Одним із відомих способів вирішення цих проблем даних є активне навчання. Цей підхід залежить від ретельного процесу кураторства, який ідентифікує найбільш цінні навчальні приклади для людського маркування. Основна ідея полягає в тому, що моделі вчаться краще з прикладів, які вони вважають найбільш заплутаними, а не пасивно споживають усі доступні дані. На відміну від традиційних методів ІІ, які вимагають великих наборів даних, активне навчання застосовує більш стратегічний підхід, зосереджуючись на зборі лише найбільш інформативних прикладів. Цей підхід допомагає уникнути неефективності маркування очевидних або надлишкових даних, які надають мало цінності моделі. Замість цього активне навчання націлюється на крайні випадки та невизначені приклади, які мають потенціал значно покращити продуктивність моделі.

Підхід Google до активного навчання

Дослідницька команда Google успішно застосувала цей підхід. Їхня нова методологія активного навчання демонструє, що ретельно відібрані, високоякісні приклади можуть замінити величезні кількості маркованих даних. Наприклад, вони показують, що моделі, навчені на менше ніж 500 експертно-маркованих прикладах, досягли або перевищили продуктивність систем, навчених на 100 000 традиційних міток.

Процес працює через систему “LLM-as-Scout”, яку назвала Google. Велика мовна модель спочатку сканує величезні об’єми немаркованих даних, ідентифікуючи випадки, коли вона відчуває найбільшої невизначеності. Ці межові випадки представляють саме сценарії, у яких моделі потрібно людське керівництво для покращення процесів прийняття рішень. Процес починається з початкової моделі, яка маркує великі набори даних за допомогою базових запитів. Система потім групує приклади за їх передбачуваними класифікаціями та ідентифікує області, де модель демонструє плутаність між різними категоріями. Ці перекриваючі групи розкривають точні точки, де людське експертне судження може стати найбільш цінним.

Методологія явно націлюється на пари прикладів, які лежать найближче один до одного, але мають різні мітки. Ці межові випадки представляють саме сценарії, у яких людська експертиза має найбільше значення. Зосереджуючи експертні зусилля з маркування на цих заплутаних прикладах, система досягає видатних показників ефективності.

Якість над кількістю

Дослідження показало ключовий висновок щодо якості даних, який викликає сумніви щодо поширеного припущення в ІІ. Воно демонструє, що експертні мітки, з їх високою вірогідністю, послідовно перевершують великомасштабні анотації, створені натовпом. Вони виміряли це за допомогою коефіцієнта Каппи Когена, статистичного інструменту, який оцінює, наскільки передбачення моделі узгоджуються з експертними думками, понад те, що відбувається випадково. У експериментах Google експертні анотатори досягли коефіцієнтів Каппи Когена вище 0,8, значно перевершуючи те, що зазвичай надають анотації, створені натовпом.
Ця вища узгодженість дозволяє моделям ефективно навчатися з набагато менше прикладів. У тестах з Gemini Nano-1 і Nano-2 моделі досягли або перевищили експертну узгодженість, використовуючи лише 250-450 ретельно відібраних прикладів порівняно з близько 100 000 випадкових анотацій, створених натовпом. Це зменшення становить три-чотири порядки величини. Однак переваги не обмежуються лише зменшенням кількості даних. Моделі, навчені за допомогою цього підходу, часто перевершують ті, які навчені традиційними методами. Для складних завдань і більших моделей покращення продуктивності досягли 55-65% порівняно з базовим рівнем, що показує більш суттєве і надійне узгодження з експертами політики.

Чому цей прорив має значення зараз

Цей прорив відбувається в критичний момент для індустрії ІІ. Коли моделі зростають більшістю і більш складними, традиційний підхід до масштабування навчальних даних став дедалі менш підтримуваним. Екологічна вартість навчання величезних моделей продовжує зростати, а економічні бар’єри для входу залишаються високими для багатьох організацій.

Метод Google вирішує кілька промислових проблем одночасно. Драматичне зменшення витрат на маркування робить розвиток ІІ більш доступним для менших організацій і дослідницьких команд. Більш швидкі цикли ітерації дозволяють швидко адаптуватися до змінних вимог, що є важливим у динамічних галузях, таких як модерування контенту або кібербезпека.

Підхід також має широкі наслідки для безпеки та надійності ІІ. Зосереджуючись на випадках, у яких моделі найбільш невизначені, метод природно ідентифікує потенційні режими відмов та крайні випадки. Цей процес створює більш надійні системи, які краще розуміють свої обмеження.

Ширші наслідки для розвитку ІІ

Цей прорив свідчить про те, що ми можемо входити в нову фазу розвитку ІІ, у якій ефективність має значення більше, ніж масштаб. Традиційний підхід “більше – краще” до навчальних даних може поступитися місцем більш складним методам, які пріоритезують якість даних і стратегічний відбір.

Екологічні наслідки самі по собі значні. Навчання великих моделей ІІ зараз вимагає величезних обчислювальних ресурсів і споживання енергії. Якщо подібна продуктивність може бути досягнута з драматично меншою кількістю даних, вуглецевий слід розвитку ІІ міг би суттєво зменшитися.

Демократизуючий ефект міг би бути рівнозначним. Менші дослідницькі команди та організації, яким раніше не могли дозволити собі величезні зусилля з збору даних, тепер мають шлях до конкурентоспроможних систем ІІ. Цей прорив міг би прискорити інновації та створити більш різноманітні перспективи в розвитку ІІ.

Обмеження та розгляди

Незважаючи на свої перспективні результати, методологія стикається з кількома практичними проблемами. Вимога до експертних анотаторів з коефіцієнтами Каппи Когена вище 0,8 може обмежити застосування в галузях, яким бракує достатньої експертизи або чітких критеріїв оцінки. Дослідження в основному зосереджені на завданнях класифікації та застосуванні безпеки контенту. Чи相同ні драматичні покращення застосовуються до інших типів завдань ІІ, таких як генерація мови або висновок, залишається невідомим.

Ітеративна природа активного навчання також вводить складність порівняно з традиційними підходами пакетної обробки. Організаціям потрібно розробити нові робочі процеси та інфраструктуру для підтримки циклів запит-відповідь, які дозволяють безперервне покращення моделі.

Майбутні дослідження, ймовірно, будуть досліджувати автоматизовані підходи для підтримання експертного рівня якості анотації та розробки галузевих адаптацій основної методології. Інтеграція принципів активного навчання з іншими техніками ефективності, такими як ефективне тонке налаштування параметрів, могла б принести додаткові покращення продуктивності.

Основне

Дослідження Google показують, що націлене, високоякісне навчання може бути більш ефективним, ніж величезні набори даних. Зосереджуючись на маркуванні лише найбільш цінних прикладів, вони скоротили потреби у навчанні до 10 000 разів, покращуючи продуктивність. Цей підхід знижує витрати, прискорює розвиток, зменшує екологічний вплив і робить просунуте ІІ більш доступним. Це позначає суттєвий зсув у напрямку ефективного та сталого розвитку ІІ.

Доктор Техсін Зія є доцентом COMSATS University Islamabad, який має ступінь PhD з штучного інтелекту у Віденському технічному університеті, Австрія. Спеціалізується на штучному інтелекті, машинному навчанні, науці про дані та комп'ютерному баченні, він зробив значний внесок з публікаціями в авторитетних наукових журналах. Доктор Техсін також очолював різні промислові проекти як головний дослідник і служив консультантом з штучного інтелекту.