Моделі та платформи ШІ
Нова бібліотека Neural Tangent від Google дає вченим-даністам “безпрецедентний” погляд на моделі
Google (GOOGL ) розробила нову відкриту бібліотеку, призначену для роз’яснення чорної скриньки машинного навчання та надання інженерам більшого розуміння того, як працюють їхні системи машинного навчання. Як повідомляє VentureBeat, команда дослідників Google стверджує, що бібліотека може надати “безпрецедентний” погляд на поведінку моделей машинного навчання.
Нейронні мережі працюють через нейрони, що містять математичні функції, які перетворюють дані різними способами. Нейрони в мережі з’єднані між собою шарами, і нейронні мережі мають глибину та ширину. Глибина нейронної мережі контролюється кількістю шарів, і різні шари мережі регулюють з’єднання між нейронами, впливаючи на те, як дані обробляються при переході між шарами. Кількість нейронів у шарі визначає ширину шару. За словами інженера-дослідника Google Романа Новака та старшого наукового співробітника Google Семюеля С. Шенхольца, ширина моделей тісно пов’язана з регулярною, повторюваною поведінкою. У блог-пості двоє дослідників пояснили, що збільшення ширини нейронних мереж робить їх поведінку більш регулярною та легшою для інтерпретації.
Існує інший тип моделей машинного навчання, званий гаусовським процесом. Гаусовський процес – це стохастичний процес, який можна представити як багатовимірне нормальне розподілення. З гаусовським процесом кожна скінченна лінійна комбінація змінних буде нормально розподілена. Це означає, що можна представити надзвичайно складні взаємодії між змінними як інтерпретовані лінійні алгебраїчні рівняння, а тому можна вивчати поведінку штучного інтелекту через цю лінзу. Як саме моделі машинного навчання пов’язані з гаусовськими процесами? Моделі машинного навчання, які нескінченно великі за шириною, збігаються на гаусовському процесі.
Однак, хоча можна інтерпретувати моделі машинного навчання через призму гаусовського процесу, для цього потрібно вивести нескінченну ширину моделі. Це складна серія обчислень, яку потрібно виконувати для кожної окремої архітектури. Щоб зробити ці обчислення легшими та швидшими, команда дослідників Google розробила Neural Tangents. Neural Tangents дозволяє вченим-даністам використовувати лише кілька рядків коду та тренувати кілька нескінченних мереж одночасно. Часто тренуються кілька нейронних мереж на одних і тих же наборах даних, а їхні передбачення усереднюються, щоб отримати більш надійне передбачення, яке не залежить від проблем, які можуть виникнути в окремих моделях. Такий підхід називається ансамблевим навчанням. Однією з недоліків ансамблевого навчання є те, що воно часто обчислювально дороге. Однак, коли тренується мережа, яка нескінченно широка, ансамбль описується гаусовським процесом, а дисперсія та середнє значення можна розрахувати.
Для тестування порівняли три різні архітектури нескінченних нейронних мереж, а результати порівняння були опубліковані в блог-пості. Загалом, результати ансамблевих мереж, керованих гаусовськими процесами, схожі на результати звичайних скінченних нейронних мереж:
Як пояснює команда дослідників у блог-пості :
«Ми бачимо, що нескінченні мережі, наслідуючи скінченні нейронні мережі, слідують подібній ієрархії продуктивності, при цьому повністю зв’язані мережі працюють гірше, ніж сворінкові мережі, які, в свою чергу, працюють гірше, ніж широкі резидуальні мережі. Однак, на відміну від звичайної тренування, динаміка навчання цих моделей повністю витлумачується у закритій формі, що дозволяє отримати новий погляд на їхню поведінку».
Випуск Neural Tangents здається своєчасним, оскільки він збігається з конференцією TensorFlow Dev Summit. На конференції збираються інженери-машинного навчання, які використовують платформу Google TensorFlow. Оголошення про Neural Tangents також відбулося не довго після оголошення про TensorFlow Quantum.
Neural Tangents стала доступною через GitHub, а також є ноутбук Google Colaboratory та навчальний посібник, до якого можуть звернутися зацікавлені особи.










