AI-modeller och plattformar
Ny Neural Tangent-bibliotek från Google ger datavetare “ohämmad” insikt i modeller
Google (GOOGL ) har designat ett nytt öppen källkods bibliotek som syftar till att öppna den svarta lådan av maskinlärning och ge ingenjörer mer insikt i hur deras maskinlärningssystem fungerar. Som rapporterats av VentureBeat, säger Googles forskarteam att biblioteket kan ge “ohämmad” insikt i hur maskinlärningsmodeller fungerar.
Neuronnätverk fungerar genom neuroner som innehåller matematiska funktioner som omvandlar data på olika sätt. Neuronerna i nätverket är sammankopplade i lager, och neuronnätverk har djup och bredd. Djupet på ett neuronnätverk styrs av hur många lager det har, och de olika lagren i nätverket justerar anslutningarna mellan neuroner, vilket påverkar hur data hanteras när den flyttas mellan lager. Antalet neuroner i lagret är lagrets bredd. Enligt Google-forskaren Roman Novak och senior forskare vid Google, Samuel S. Schoenholz, är bredden på modellerna tätt korrelerad med regelbundet, upprepat beteende. I en bloggpost förklarade de två forskarna att att göra neuronnätverk bredare gör deras beteende mer regelbundet och lättare att tolka.
Det finns en annan typ av maskinlärningsmodell som kallas Gaussisk process. En Gaussisk process är en stokastisk process som kan representeras som en multivariat normalfördelning. Med en Gaussisk process kommer varje uppsättning/ändlig linjär kombination av variabler att vara normalfördelad. Detta innebär att det är möjligt att representera oerhört komplexa interaktioner mellan variabler som tolkningsbara linjära algebraiska ekvationer, och därför är det möjligt att studera ett AI:s beteende genom denna lins. Hur är maskinlärningsmodeller relaterade till Gaussiska processer? Maskinlärningsmodeller som är oändligt breda i bredd konvergerar mot en Gaussisk process.
Men medan det är möjligt att tolka maskinlärningsmodeller genom linsen av en Gaussisk process, kräver det att man härleder den oändliga breddens gräns för en modell. Detta är en komplex serie beräkningar som måste göras för varje separat arkitektur. För att göra dessa beräkningar enklare och snabbare, har Googles forskarteam designat Neural Tangents. Neural Tangents möjliggör för en datavetare att använda bara några rader kod och träna flera oändligt breda nätverk samtidigt. Flera neuronnätverk tränas ofta på samma datamängder och deras förutsägelser genomsnittas, för att få en mer robust förutsägelse som är immun mot problem som kan uppstå i en enskild modell. En sådan teknik kallas ensemble-inlärning. En av nackdelarna med ensemble-inlärning är att det ofta är beräkningsmässigt dyrt. Men när ett nätverk som är oändligt brett tränas, beskrivs ensemblen av en Gaussisk process och variansen och medelvärdet kan beräknas.
Tre olika oändligt breda neuronnätverksarkitekturer jämfördes som en test, och resultaten av jämförelsen publicerades i bloggposten. I allmänhet är resultaten av ensemble-nätverk som drivs av Gaussiska processer liknande den reguljära, ändliga neuronnätverksprestandan:
Som forskarteamet förklarar i en bloggpost:
“Vi ser att, likt ändliga neuronnätverk, oändligt breda nätverk följer en liknande hierarki av prestanda, där fullständigt anslutna nätverk presterar sämre än konvolutionsnätverk, som i sin tur presterar sämre än breda residualnätverk. Men till skillnad från vanlig träning, är inlärningsdynamiken i dessa modeller fullständigt spårbar i slutna former, vilket möjliggör [nya] insikter i deras beteende.”
Släppandet av Neural Tangents tycks vara tidsbestämt för att sammanfalla med TensorFlow Dev Summit. Dev-summiten ser maskinlärningsingenjörer som använder Googles TensorFlow-plattform mötas. Tillkännagivandet av Neural Tangents kommer inte långt efter att TensorFlow Quantum tillkännagavs.
Neural Tangents har gjorts tillgängligt via GitHub och det finns en Google Colaboratory-anteckningsbok och tutorial som de som är intresserade kan komma åt.










