AI-mallit ja alustat
Uusi Neural Tangent -kirjasto Googlelta antaa data-analyytikoille “poikkeuksellisen” näkyvyyden malleihin
Google (GOOGL ) on suunnitellut uuden avoimen lähdekoodin kirjaston, jonka tarkoituksena on avata musta laatikko koneoppimisesta ja antaa insinööreille enemmän tietoa siitä, miten heidän koneoppimisjärjestelmänsä toimivat. VentureBeatin mukaan Google-tutkimusryhmä sanoo, että kirjasto voi antaa “poikkeuksellisen” näkyvyyden siihen, miten koneoppimismallit toimivat.
Neuraaliset verkot toimivat neuroneja, jotka sisältävät matemaattisia funktioita, jotka muuttavat dataa eri tavoilla. Neuronit verkossa ovat yhdistetty kerroksittain, ja neuraalisilla verkoilla on syvyys ja leveys. Verkon syvyys määräytyy kerrosten määrän mukaan, ja eri kerrosten välillä olevat yhteydet vaikuttavat siihen, miten data käsitellään kerrosten välillä. Kerroksen leveys on määriteltynä kerroksessa olevien neuronien määränä. Google-tutkimusinsinööri Roman Novak ja vanhempi tutkimusasiantuntija Samuel S. Schoenholz sanovat, että mallien leveys on tiiviisti korreloiva säännöllisen ja toistuvan käyttäytymisen kanssa. Blogikirjoituksessaan tutkijat selittävät, että tehdessä neuraaliverkoista leveämmät, niiden käyttäytyminen tulee säännöllisemmäksi ja helpommin tulkittavaksi.
On olemassa erityinen tyyppi koneoppimismallia, jota kutsutaan gaussian-prosessiksi. Gaussian-prosessi on stokastinen prosessi, joka voidaan esittää moniulotteisena normaalijakautumana. Gaussian-prosessissa jokainen muuttujien äärellinen lineaarinen yhdistelmä on normaalijakautunut. Tämä tarkoittaa, että voidaan esittää erittäin monimutkaiset vuorovaikutukset muuttujien välillä tulkittavina lineaarialgebran kaavoina, ja siten voidaan tutkia tekoälyjen käyttäytymistä tämän näkökulman kautta. Miten koneoppimismallit liittyvät gaussian-prosesseihin? Äärettömän leveät koneoppimismallit lähestyvät gaussian-prosessia.
Kuitenkin, vaikka on mahdollista tulkita koneoppimismalleja gaussian-prosessin näkökulmasta, se vaatii äärettömän leveän mallin derivointia. Tämä on monimutkainen laskutoimitus, joka on tehtävä kullekin erilliselle arkkitehtuurille. Jotta laskelmat olisivat helpompia ja nopeampia, Google-tutkimusryhmä suunnitteli Neural Tangents -kirjaston. Neural Tangents mahdollistaa data-analyytikon käyttää vain muutamia koodirivejä ja kouluttaa useita äärettömän leveitä verkkoja yhtä aikaa. Useat neuraaliset verkot koulutetaan usein samalle aineistolle, ja niiden ennusteet keskiarvoistetaan, jotta saadaan robusti ennuste, joka on immuuni yksittäisen mallin ongelmiin. Tällaista tekniikkaa kutsutaan ensemble-oppimiseksi. Yksi ensemble-oppimisen haittoja on, että se on usein laskennallisesti kallista. Kun kuitenkin äärettömän leveä verkko koulutetaan, ensemble voidaan kuvata gaussian-prosessilla, ja varianssi ja keskiarvo voidaan laskea.
Kolmea erilaista äärettömän leveää neuraaliverkkomallia verrattiin testissä, ja vertailun tulokset julkaistiin blogikirjoituksessa. Yleisesti ottaen, gaussian-prosessien ohjaamien ensemble-verkkojen tulokset ovat samankaltaisia kuin tavallisten, äärellisten neuraaliverkkojen suorituskyky:
Tutkimusryhmä selittää blogikirjoituksessaan:
“Havaitsemme, että äärettömän leveät verkot seuraavat samanlaista suorituskyvyn hierarkiaa kuin tavalliset, äärelliset neuraaliverkot, jossa täysin yhdistetyt verkot suorittavat huonommin kuin konvoluutioverkot, jotka puolestaan suorittavat huonommin kuin laajat residuaaliverkot. Kuitenkin toisin kuin tavallinen koulutus, näiden mallien oppimisdynamiikka on täysin seurattavissa suljetussa muodossa, mikä mahdollistaa uuden näkökulman niiden käyttäytymiseen.”
Neural Tangents -julkaisu näyttää sattuvan yhteen TensorFlow Dev Summitin kanssa. Dev Summitissa machine learning -insinöörit, jotka käyttävät Google:n TensorFlow-alustaa, kokoontuvat yhteen. Neural Tangents -ilmoitus tulee myös pian sen jälkeen, kun TensorFlow Quantum julkaistiin.
Neural Tangents on julkaistu GitHubissa, ja siitä on saatavilla myös Google Colaboratory -muistikirja ja opas, johon kiinnostuneet voivat tutustua.










