Modele i platformy AI

Nowa biblioteka Neural Tangent od Google daje naukowcom danych “bezprecedensowy” wgląd w modele

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Google (GOOGL ) zaprojektowała nową bibliotekę open-source, mającą na celu otworzenie “czarnej skrzynki” uczenia maszynowego i dać inżynierom więcej wglądu w sposób, w jaki działają ich systemy uczenia maszynowego. Jak donosi VentureBeat, zespół badawczy Google twierdzi, że biblioteka może zapewnić “bezprecedensowy” wgląd w sposób, w jaki działają modele uczenia maszynowego.

Sieci neuronowe działają poprzez neurony zawierające funkcje matematyczne, które transformują dane w różny sposób. Neurony w sieci są połączone warstwami, a sieci neuronowe mają głębokość i szerokość. Głębokość sieci neuronowej jest kontrolowana przez liczbę warstw, a różne warstwy sieci regulują połączenia między neuronami, wpływając na sposób, w jaki dane są przetwarzane podczas przechodzenia między warstwami. Liczba neuronów w warstwie jest szerokością warstwy. Zgodnie z oświadczeniem inżyniera badawczego Google, Romana Novaka, i starszego naukowca w Google, Samuela S. Schoenholza, szerokość modeli jest ściśle skorelowana z regularnym, powtarzalnym zachowaniem. W poście na blogu dwaj badacze wyjaśnili, że zwiększanie szerokości sieci neuronowych sprawia, że ich zachowanie staje się bardziej regularne i łatwiejsze do interpretacji.

Istnieje inny typ modelu uczenia maszynowego, zwany procesem Gaussa. Proces Gaussa jest procesem stochastycznym, który może być reprezentowany jako wielowymiarowa rozkład normalny. W przypadku procesu Gaussa każdy skończony liniowy zestaw zmiennych będzie rozkładem normalnym. Oznacza to, że możliwe jest reprezentowanie nadzwyczaj złożonych interakcji między zmiennymi jako interpretowalne równania algebry liniowej, a zatem możliwe jest badanie zachowania AI za pomocą tej optyki. Jak dokładnie modele uczenia maszynowego są związane z procesami Gaussa? Modele uczenia maszynowego, które są nieskończenie szerokie, zbiegają się do procesu Gaussa.

Jednakże, chociaż możliwe jest interpretowanie modeli uczenia maszynowego za pomocą procesu Gaussa, wymaga to pochodzenia granicy nieskończonej szerokości modelu. Jest to złożony szereg obliczeń, które muszą być wykonane dla każdej oddzielnej architektury. Aby ułatwić i przyspieszyć te obliczenia, zespół badawczy Google zaprojektował Neural Tangents. Neural Tangents umożliwia naukowcom danych używanie tylko kilku linii kodu i trenowanie wielu sieci o nieskończonej szerokości w tym samym czasie. Często wiele sieci neuronowych jest trenowanych na tych samych zbiorach danych, a ich predykcje są uśredniane, aby uzyskać bardziej solidną predykcję, odporną na problemy, które mogą wystąpić w poszczególnych modelach. Taka technika nazywa się ensemble learning. Jedną z wad ensemble learning jest to, że często jest to kosztowne obliczeniowo. Jednakże, gdy sieć o nieskończonej szerokości jest trenowana, ensemble jest opisany przez proces Gaussa, a wariancja i średnia mogą być obliczone.

Trzy różne architektury sieci neuronowych o nieskończonej szerokości zostały porównane jako test, a wyniki porównania zostały opublikowane w poście na blogu. Ogólnie rzecz biorąc, wyniki ensemble sieci napędzanych przez procesy Gaussa są podobne do zwykłej, skończonej wydajności sieci neuronowych:

Jak wyjaśnia zespół badawczy w poście na blogu:

„Widzimy, że sieci o nieskończonej szerokości, naśladując sieci skończone, podążają za podobną hierarchią wydajności, przy czym sieci całkowicie połączone działają gorzej niż sieci konwolucyjne, które z kolei działają gorzej niż sieci rezidualne. Jednak w przeciwieństwie do zwykłego treningu, dynamika uczenia się tych modeli jest całkowicie śledzalna w zamkniętej formie, co pozwala na nowy wgląd w ich zachowanie.”

Wydanie Neural Tangents wydaje się być związane z TensorFlow Dev Summit. Podczas dev summitu inżynierowie uczenia maszynowego, którzy wykorzystują platformę TensorFlow, spotykają się razem. Ogłoszenie o Neural Tangents następuje niedługo po ogłoszeniu o TensorFlow Quantum.

Neural Tangents została udostępniona za pośrednictwem GitHub, a dostępny jest również notes i tutorial Google Colaboratory dla zainteresowanych.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.