Моделі та платформи ШІ
Дослідники відкрили високоефективні підмережі у глибинних нейронних мережах
Глибинні нейронні мережі часто є величезними та вимагають величезної кількості обчислювальної потужності, але нове відкриття демонструє, як це можна скоротити для виконання завдань більш ефективно. Джонатан Франкл і його команда з Массачусетського технологічного інституту розробили гіпотезу “лотерейного квитка”, яка показує, що є більш легкі підмережі всередині більших нейронних мереж. Ці підмережі можуть виконувати завдання більш ефективно з меншою необхідною обчислювальною потужністю, одним з найбільших викликів є пошук цих підмереж, або виграш лотерейних квитків, як їх називають команда.
Команда виявила ці підмережі всередині BERT, найкращої машини навчання для обробки природної мови (NLP). NLP, яка є підполем штучного інтелекту (AI), відповідає за розшифрування та аналіз людської мови, і використовується для застосунків, таких як генерація передбачуваного тексту та чат-боти.
Однак, BERT великий і вимагає суперкомп’ютерної потужності, яка недоступна більшості користувачів. З новим відкриттям цих підмереж, це може відкрити доступ, дозволяючи більшому числу користувачів використовувати технологію для розробки інструментів NLP.
“Ми доходимо до точки, де нам потрібно зробити ці моделі більш легкими та ефективними”, – говорить Франкл.
Згідно з ним, це відкриття може “знизити бар’єри входу” для NLP.
BERT – “Непомірно дорогий”
BERT є фундаментальним для таких речей, як пошукова система Google , і отримав велику увагу після того, як Google випустив його у 2018 році. Це метод створення нейронних мереж і тренується шляхом багаторазових спроб заповнення пропущених пасажів тексту. Однією з найбільш вражаючих особливостей BERT є його величезна початкова навчальна база даних.
Потім його можна налаштувати користувачами для конкретних завдань, таких як чат-боти для обслуговування клієнтів, але знову ж таки, це вимагає величезної кількості обчислювальної потужності, з можливістю досягнення 1 млрд параметрів.
“Стандартна модель BERT сьогодні – звичайна – має 340 млн параметрів”, – говорить Франкл. “Це просто непомірно дорого. Це далеко за межами обчислювальних можливостей вас або мене”.
Згідно з головним автором Тяньлуном Ченом з Університету Техасу в Остині, моделі, такі як BERT, “страждають від величезного розміру мережі”, але завдяки новим дослідженням, “гіпотеза лотерейного квитка здається рішенням”.
Ефективні підмережі
Чен і команда шукали меншу модель, розташовану всередині BERT, і порівняли результати виявлених підмереж з оригінальною моделлю BERT. Це було протестовано на різних завданнях NLP, включаючи відповіді на питання та заповнення пропущених слів у реченні.
Команда виявила успішні підмережі, які були на 40-90% легші, ніж оригінальна модель BERT, з фактичним відсотком, залежним від завдання. Крім того, вони могли ідентифікувати їх до завдання-специфічної настройки, що призводить до ще більш знижених обчислювальних витрат. Інша перевага полягала в тому, що деякі підмережі, вибрані для конкретного завдання, можна було повторно використати для іншого.
“Я був трохи шокований, що це взагалі працює”, – говорить Франкл. “Це не те, що я приймав як належне. Я очікував набагато більш заплутаний результат, ніж той, який ми отримали”.
Згідно з Арі Моркосом, науковцем у Facebook (META ) AI Research, це відкриття є “переконливим”, і “Ці моделі стають дедалі більш поширеними. Тому важливо зрозуміти, чи гіпотеза лотерейного квитка тримається”.
Моркос також говорить, що якщо ці підмережі можуть працювати з значно меншою обчислювальною потужністю, то це буде “дуже впливовим, враховуючи, що ці дуже великі моделі зараз дуже дорогі у використанні”.
“Я не знаю, наскільки більші ми можемо стати, використовуючи ці суперкомп’ютерні обчислення”, – додає Франкл. “Нам потрібно буде знизити бар’єр входу.”
“Надія полягає в тому, що це знизить витрати, що це зробить його більш доступним для всіх… для маленьких хлопчиків, які мають лише ноутбук”, – він підсумовує.
Дослідження має бути представлено на Конференції з обробки нейронної інформації.












