Modely a platformy AI
Nová knihovna Neural Tangent od Googlu poskytuje datovým vědcům “nezpochybnitelný” vhled do modelů
Google (GOOGL ) navrhl novou open-source knihovnu, která má otevřít černou skříňku strojového učení a poskytnout inženýrům více vhledu do toho, jak fungují jejich systémy strojového učení. Jak uvádí VentureBeat, tým výzkumu Googlu říká, že knihovna by mohla poskytnout „nezpochybnitelný“ vhled do toho, jak fungují modely strojového učení.
Neuronové sítě fungují prostřednictvím neuronů, které obsahují matematické funkce, které transformují data různými způsoby. Neurony v síti jsou spojeny do vrstev a neuronové sítě mají hloubku a šířku. Hloubka neuronové sítě je řízena počtem vrstev, a různé vrstvy sítě upravují spojení mezi neurony, což ovlivňuje, jak jsou data zpracovávána při přechodu mezi vrstvami. Počet neuronů ve vrstvě je šířka vrstvy. Podle Romana Novaka, inženýra výzkumu Googlu, a Samuela S. Schoenholze, senior výzkumného vědce Googlu, je šířka modelů úzce spojena s pravidelným, opakujícím se chováním. V blogovém příspěvku dva výzkumníci vysvětlili, že zvětšení neuronových sítí činí jejich chování více pravidelným a snazším na interpretaci.
Existuje jiný typ modelu strojového učení nazývaný Gaussian proces. Gaussian proces je stochastický proces, který může být reprezentován jako multivariační normální distribuce. S Gaussian procesem bude každá konečná lineární kombinace proměnných normálně distribuována. To znamená, že je možné reprezentovat mimořádně složité interakce mezi proměnnými jako interpretovatelné lineární algebraické rovnice, a proto je možné studovat chování AI prostřednictvím tohoto hlediska. Jak přesně jsou modely strojového učení spojeny s Gaussian procesy? Modely strojového učení, které jsou nekonečně široké, konvergují na Gaussian proces.
Avšak zatímco je možné interpretovat modely strojového učení prostřednictvím hlediska Gaussian procesu, vyžaduje to odvození nekonečné šířky modelu. To je komplexní série výpočtů, které musí být provedeny pro každou samostatnou architekturu. Aby tyto výpočty byly snazší a rychlejší, tým výzkumu Googlu navrhl Neural Tangents. Neural Tangents umožňuje datovému vědci použít pouze několik řádků kódu a trénovat multiple nekonečně široké sítě najednou. Často se trénují multiple neuronové sítě na stejných datech a jejich předpovědi se průměrují, aby se získala robustnější předpověď imunní vůči problémům, které mohou nastat v kterémkoli jednotlivém modelu. Taková technika se nazývá ensemble učení. Jednou z nevýhod ensemble učení je, že je často výpočetně náročné. Avšak když se trénuje síť, která je nekonečně široká, je ensemble popsáno Gaussian procesem a lze vypočítat variaci a průměr.
Byly porovnány tři různé architektury nekonečně širokých neuronových sítí jako test a výsledky porovnání byly zveřejněny v blogovém příspěvku. Obecně jsou výsledky ensemble sítí poháněných Gaussian procesy podobné výkonu běžných neuronových sítí:
Jak vysvětluje výzkumný tým v blogovém příspěvku:
„Zjišťujeme, že nekonečně široké sítě, podobně jako konečné neuronové sítě, následují podobnou hierarchii výkonu, přičemž plně propojené sítě fungují hůře než konvoluční sítě, které fungují hůře než široké residuální sítě. Avšak na rozdíl od běžného trénování je učení dynamika těchto modelů kompletně sledovatelná v uzavřené formě, což umožňuje [nový] vhled do jejich chování.”
Vydání Neural Tangents se zdá být načasováno s TensorFlow Dev Summit. Dev summit vidí, jak se setkávají inženýři strojového učení, kteří využívají platformu Googlu TensorFlow. Oznámení o Neural Tangents také přichází brzy po oznámení o TensorFlow Quantum.
Neural Tangents je k dispozici prostřednictvím GitHubu a existuje notebook a tutoriál Googlu Colaboratory, ke kterým mohou zájemci získat přístup.










