Погляд Anderson

ГПУ можуть бути кращими, а не просто швидшими, для навчання глибоких нейронних мереж

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Польщі та Японії, які працюють з Sony, знайшли докази того, що системи машинного навчання, навчені на ГПУ, а не на ЦПУ, можуть містити менше помилок під час процесу навчання та давати кращі результати, що суперечить загальному розумінню того, що ГПУ просто виконують такі операції швидше, а не краще.

Дослідження, озаглавлене Вплив невизначеності ГПУ на навчання передбачувальних глибоких нейронних мереж, проведене факультетом психології та когнітивних наук університету Адама Міцкевича та двох японських університетів разом з SONY Computer Science Laboratories.

Дослідження показало, що ‘невизначеності’, яких глибокі нейронні мережі демонструють у разі різних апаратних та програмних конфігурацій, більше підходять дорогим (і дедалі рідшим) графічним процесорам, та виявили, що глибока нейронна мережа, навчена виключно на ЦПУ, давала вищі показники помилок за той самий кількість епох (кількість раз, коли система повторно обробляє навчальні дані за одну сесію).

На цьому додатковому прикладі з статті ми бачимо (два нижні ряди), подібну якість результатів, отриманих від різноманітних ГПУ, та (перший ряд), гірші результати, отримані від ряду досить потужних ЦПУ. Джерело: https://arxiv.org/pdf/2109.01451.pdf

На цьому додатковому прикладі з статті ми бачимо (два нижні ряди), подібну якість результатів, отриманих від різноманітних ГПУ, та (перший ряд), гірші результати, отримані від ряду досить потужних ЦПУ. Джерело: https://arxiv.org/pdf/2109.01451.pdf

Странні явища

Ці попередні висновки не застосовуються однаково до всіх популярних алгоритмів машинного навчання, і у випадку простих архітектур автоенкодерів це явище не спостерігається.

Натомість робота натякає на можливий ‘поріг ефективності’ для навчання у складних нейронних мережах, де виконання тих самих операцій з нижчою швидкістю та більшим часом навчання не дає очікуваної рівності результатів, яких можна було б очікувати від математичних ітераційних процедур.

Дослідники припускають, що ця різниця у ефективності може бути особливою для певних типів нейронних мереж, і що невизначені аспекти обробки, специфічні для ГПУ, часто розглядаються як перешкода, яку потрібно подолати, можуть не тільки давати суттєві переваги, але й можуть бути свідомо включені у майбутні системи. Стаття також припускає, що ці висновки можуть дати глибші знання про обчислювальні процеси, пов’язані з мозком.

Визначення особливостей, які збільшують ефективність та якість результатів таким чином на ГПУ, має потенціал для отримання глибшого розуміння ‘чорних скриньок’ архітектур штучного інтелекту, та навіть для покращення ефективності ЦПУ – хоча зараз основні причини залишаються неясними.

Автоенкодер проти PredNet

При вивченні аномалій дослідники використовували базовий автоенкодер та мережу Predictive Neural Network PredNet Гарвардського університету, дослідження 2016 року, яке було розроблено для вивчення та спроби відтворити поведінку людської кори головного мозку.

Обидві системи є глибокими нейронними мережами, розробленими для синтезу відповідних зображень через несупервізоване навчання (із даними, з яких були вилучені мітки), хоча автоенкодер лінійно обробляє одне зображення за раз, яке потім дає вихід як наступне зображення у повторюваному потоці. Автоенкодер був навчений на базі даних рукописних цифр MNIST.

Автоенкодер у дослідженні був навчений на базі даних MNIST, яка складається з 60 000 навчальних зображень розміром 28x28 пікселів, з антиаліасингом для індукції градацій сірого кольору, а також 10 000 тестових зображень.

Автоенкодер у дослідженні був навчений на базі даних MNIST, яка складається з 60 000 навчальних зображень розміром 28×28 пікселів, з антиаліасингом для індукції градацій сірого кольору, а також 10 000 тестових зображень.

Натомість PredNet оцінює складний відеоввід, і у випадку цього дослідження був навчений на базі даних FPSI, яка містить обширні відеодані з носимих камер за день у Дісней-Ворлді в Орландо, Флорида (Дісней був одним із дослідницьких асоціатів у статті 2012 року).

Послідовності зображень з FPSI, що показують перший план виду на день у Дісней-Ворлді.

Послідовності зображень з FPSI, що показують перший план виду на день у Дісней-Ворлді.

Дві архітектури дуже відрізняються за складністю. Автоенкодер розроблений для реконструкції зображень, а не для передбачення цілей. Натомість PredNet має чотири шари, кожний із яких складається з репрезентаційних нейронів, що використовують卷ITIONAL довгострокову пам’ять (LSTM).

Шари видають контекстні передбачення, які потім порівнюються з ціллю для отримання терміну помилки, який поширюється по мережі. Обидві моделі використовують несупервізоване навчання.

Проста, лінійна архітектура автоенкодера та більш лабіринтна і рекурсивна мережа PredNet.

Проста, лінійна архітектура автоенкодера та більш лабіринтна і рекурсивна мережа PredNet.

Обидві системи були протестовані на різних апаратних та програмних конфігураціях, включаючи ЦПУ без ГПУ (Intel i5-4590, i7-6800K, i5-7600K або AMD Ryzen-5-3600) та ЦПУ з ГПУ (Intel i5-7600K + NVIDIA GTX-750Ti, i5-7600K + GTX-970, i7-6700K + GTX-1080, i7-7700K + GTX-1080Ti, i7-9700 + RTX-2080Ti, i5-7600K + RTX-2060 super, AMD Ryzen-5-3600 + RTX-2070 super, або i5-9400 + Titan-RTX).

Інтерактивний переглядач процесу htop був використаний для забезпечення того, щоб усі навчання відбувалися або на одному потоці (на Intel i7-6800K), на чотирьох потоках (на Intel i5-4590 та i5-7600K), або шести потоках (на AMD Ryzen-5-3600).

Сідлові точки

На автоенкодері середня різниця по всіх конфігураціях, з та без cuDNN, не була суттєвою. Для PredNet результати були більш приголомшливими, з помітними різницями у оцінці втрат та якості між навчанням на ЦПУ та ГПУ.

Середні результати втрат для навчання PredNet на чотирьох ЦПУ та восьми ГПУ, з мережею, навченою на 5000 відеокадрах у 250 пакетах, з середньою втратою для останніх 1000 кадрів (50 пакетів), зображених. cuDNN був вимкнений.

Середні результати втрат для навчання PredNet на чотирьох ЦПУ та восьми ГПУ, з мережею, навченою на 5000 відеокадрах у 250 пакетах, з середньою втратою для останніх 1000 кадрів (50 пакетів), зображених. cuDNN був вимкнений.

Дослідники роблять висновок, що ‘Хоча механізм неясний, апаратне забезпечення ГПУ, здається, має здатність просунути навчання глибоких нейронних мереж.’

Результати вказують на те, що ГПУ можуть бути кращими у уникненні сідлових точок – областей у градієнтному спуску, які описують дно схилу.

Надір схилів у градієнтному спуску є 'сідловою точкою', названою за очевидними причинами. Джерело: https://www.pinterest.com.au/pin/436849232581124086/

Надір схилів у градієнтному спуску є ‘сідловою точкою’, названою за очевидними причинами. Джерело: https://www.pinterest.com.au/pin/436849232581124086/

Сідлові точки, хоча й є перешкодою, були в основному відкинуті як легко обходяться у сучасній думці про оптимізацію стохастичного градієнтного спуску (SGD), але нова стаття припускає, що не тільки ГПУ можуть бути унікально обладнані для уникнення їх, але й що вплив сідлових точок слід, можливо, переглянути.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai