AI-mallit ja alustat
Gemma: Google tuo edistyneitä tekoälyominaisuuksia avoimen lähdekoodin kautta
Tekoälyalan kehitys on ollut valtavaa viime vuosina, ja suurimman osan siitä voidaan laskea olevan syvän oppimisen ja luonnollisen kielen prosessoinnin edistymisen ansiota. Näiden edistysten eturintamassa ovat suuret kielen mallit, jotka ovat tekoälyjärjestelmiä, jotka on koulutettu valtavilla määrillä tekstidataa ja jotka voivat tuottaa ihmismäistä tekstiä ja osallistua keskustelutehtäviin.
Suuret kielen mallit, kuten Google’ (GOOGL ) n PaLM, Anthropicin Claude ja DeepMindin Gopher, ovat osoittaneet merkittäviä kykyjä, koodauksesta yleiseen järkeilyyn. Kuitenkin useimmat näistä malleista eivät ole olleet vapaasti saatavilla, mikä on rajoittanut niiden käyttöä tutkimuksessa, kehityksessä ja hyödyllisissä sovelluksissa.
Tämä muuttui, kun Google julkaisi avoimen lähdekoodin Gemma-malliperheen, joka perustuu heidän voimakkaisiin omiin Gemini-malleihin. Tässä blogipostauksessa tutustumme Gemmaan, analysoimme sen arkkitehtuuria, koulutusprosessia, suorituskykyä ja vastuullista julkaisua.
Gemman yleiskatsaus
Helmikuussa 2023 DeepMind julkaisi avoimen lähdekoodin Gemma-malleja, joista kaksi kokoa on saatavilla – 2 miljardin parametrin versio, joka on optimoitu laitteistojen käyttöön, ja suurempi 7 miljardin parametrin versio, joka on suunniteltu GPU/TPU-käyttöön.
Gemma hyödyntää samanlaista transformer-pohjaista arkkitehtuuria ja koulutusmenetelmää kuin DeepMindin johtavat Gemini-mallit. Se on koulutettu jopa 6 biljoonalla tokenilla tekstidataa, pääasiassa englanniksi. Tähän kuului verkkodokumentteja, matemaattista tekstiä ja lähdekoodia.
DeepMind julkaisi sekä raakakoulutetut Gemma-mallit että versiot, jotka on hienosäädetty valvotulla oppimisella ja ihmisten palautteella parantamaan kykyjä alueilla kuten dialogi, ohjeiden seuraaminen ja koodaus.
Gemman käyttöönotto
Gemman avoin julkaisu tekee sen edistyneistä tekoälyominaisuuksista saatavilla kehittäjille, tutkijoille ja harrastajille. Tässä on nopea opas käyttöönottoon:
Alustariippumaton käyttöönotto
Gemman avainvoimassa on sen joustavuus – voit ajaa sen CPU:lla, GPU:lla tai TPU:lla. CPU:lle voit käyttää TensorFlow Litea tai HuggingFace Transformersia. Nopeutetun suorituskyvyn saavuttamiseksi GPU/TPU:lla voit käyttää TensorFlowia. Pilvipalvelut kuten Google Cloudin Vertex AI tarjoavat myös helpon skaalautuvuuden.
Esikoulutettujen mallien käyttöönotto
Gemma on saatavilla eri esikoulutetuissa varianteissa, riippuen tarpeistasi. 2B- ja 7B-mallit tarjoavat vahvat generatiiviset kyvyt valmiina. Mukautetun hienosäätöön 2B-FT- ja 7B-FT-mallit ovat ihanteellisia lähtökohtia.
Mielenkiintoisten sovellusten luominen
Voit luoda monipuolisen valikoiman sovelluksia Gemman avulla, kuten tarinoiden luominen, kielien kääntäminen, kysymysten vastaaminen ja luovien sisältöjen tuottaminen. Avain on hyödyntää Gemman vahvuuksia kouluttamalla se omilla tietojoukoilla.
Arkkitehtuuri
Gemma käyttää dekooderi-vain transformer-arkkitehtuuria, joka perustuu edistysaskeliin kuten moni-kyselyhuomioon ja rotaatioasentojen upotukseen:
- Transformerit: Transformer-arkkitehtuuri, joka perustuu vain huomioon, on tullut yleiseksi luonnollisen kielen prosessoinnissa vuodesta 2017. Gemma perii transformerin kyvyn mallintaa pitkiä riippuvuuksia teksteissä.
- Dekooderi-vain: Gemma käyttää vain transformer-dekooderipinoa, toisin kuin kooderi-dekooderi-mallit kuten BART tai T5. Tämä tarjoaa vahvat generatiiviset kyvyt tehtäville kuten tekstin luominen.
- Moni-kyselyhuomio: Gemma käyttää moni-kyselyhuomioita suuremmissa malleissaan, jolloin jokainen huomioita pääsee käsittelemään useita kyselyjä rinnakkain nopeamman inference-tuloksen saavuttamiseksi.
- Rotaatioasentojen upotukset: Gemma edustaa asentoinformaatiota rotaatio-upotuksilla eikä absoluuttisilla asentojen koodauksilla. Tämä tekniikka vähentää mallin kokoa säilyttäen asentoinformaation.
Tekniikoiden kuten moni-kyselyhuomion ja rotaatioasentojen upotusten käyttäminen mahdollistaa Gemman malleille saavuttaa optimaalisen suorituskyvyn, inference-nopeuden ja mallikoon välisen tasapainon.
Tiedot ja koulutusprosessi
Gemma koulutettiin jopa 6 biljoonalla tokenilla tekstidataa, pääasiassa englanniksi. Tähän kuului verkkodokumentteja, matemaattista tekstiä ja lähdekoodia. DeepMind panosti merkittäviä ponnisteluita tietojen suodattamiseen, poistamalla toksiisia tai vahingollisia sisältöjä luokittimien ja heuristiikkojen avulla.
Koulutus suoritettiin Google’n TPUv5-infrastruktuurilla, jossa käytettiin jopa 4096 TPU:ta Gemma-7B:n kouluttamiseen. Tehokkaat mallin ja datan rinnakkaisuuden tekniikat mahdollistivat valtavien mallien kouluttamisen peruslaitteistolla.
Vaiheittainen koulutus käytettiin, jolloin datajakauma sopeutettiin jatkuvasti keskittyen laadukkaisiin, merkityksellisiin teksteihin. Lopulliset hienosäätövaiheet käyttivät sekä ihmisten luomia että synteettisiä ohjeiden seuraamisen esimerkkejä parantamaan kykyjä.
Mallin suorituskyky
DeepMind arvioi Gemma-malleja perusteellisesti laajalla joukolla yli 25 benchmarkista, jotka kattavat kysymysten vastaamisen, järkeilyn, matematiikan, koodauksen, yleisen järjen ja dialogikykyjen.
Gemma saavuttaa huipputuloksia verrattuna samankokoisiin avoimiin lähdekoodin malleihin useimmissa benchmarkissa. Jotkut korkeimpia saavutuksia:
- Matematiikka: Gemma erottuu matemaattisissa päättelytesteissä kuten GSM8K ja MATH, jossa se ylittää malleja kuten Codex ja Anthropicin Claude yli 10 prosenttiyksiköllä.
- Koodaus: Gemma vastaa tai ylittää Codexin suorituskyvyn ohjelmointibenchmarkkeja kuten MBPP, vaikka se ei ole erityisesti koulutettu koodaukseen.
- Dialogi: Gemma osoittaa vahvaa keskustelukykyä 51,7 prosentin voittoprosentilla Anthropicin Mistral-7B:ta vastaan ihmisten preferenssitesteissä.
- Järkeily: Tehtävissä, jotka vaativat päättelyä kuten ARC ja Winogrande, Gemma ylittää muita 7B-malleja 5-10 prosenttiyksiköllä.
Gemman monipuolisuus eri aloilla osoittaa sen vahvaa yleistä älykkyyttä. Vaikka ihmisten suorituskyvyn ja Gemman välillä on vielä eroja, Gemma edustaa merkittävää askelta avoimen lähdekoodin NLP:ssä.
Turvallisuus ja vastuu
Suurten mallien avoimen lähdekoodin julkaiseminen tuo haasteita tahallisen väärinkäytön ja sisäänrakennettujen mallinharhaisuuksien yhteydessä. DeepMind on ottanut toimia riskien vähentämiseksi:
- Tietojen suodatus: Mahdollisesti toksiisia, laittomia tai harhaisia sisältöjä poistettiin koulutusdatasta luokittimien ja heuristiikkojen avulla.
- Arviointi: Gemma testattiin 30+:ssa benchmarkissa, jotka on kuratoitu arvioimaan turvallisuutta, reiluutta ja robustisuutta. Se vastasi tai ylitti muiden mallien suorituskykyä.
- Hienosäätö: Mallin hienosäätö keskittyi parantamaan turvallisuuskykyjä kuten tietojen suodatus ja sopiva varovaisuus/käyttäytymisen kieltäminen.
- Käyttöehdot: Käyttöehdot kieltävät loukkaavien, laittomien tai eettömien sovellusten käytön Gemma-malleissa. Kuitenkin valvonta on edelleen haasteellista.
- Mallikortit: Kortit, jotka yksityiskohtaisesti kuvaavat mallin kykyjä, rajoituksia ja harhaisuuksia, julkaistiin edistääkseen avoimuutta.
Vaikka avoimen lähdekoodin julkaisemisesta aiheutuvat riskit ovat olemassa, DeepMind on päättänyt, että Gemman julkaisu tarjoaa yhteiskunnalle enemmän hyötyä sen turvallisuusprofiilin ja tutkimuksen mahdollistamisen perusteella. Kuitenkin tarkka valvonta mahdollisista vahingoista on edelleen tärkeää.
Seuraavan sukupolven tekoälyinnovaatioiden mahdollistaminen
Gemman julkaiseminen avoimen lähdekoodin malliperheenä on avainasemassa koko tekoälyyhteisön edistymisessä:
- Saatavuus: Gemma vähentää esteitä organisaatioille, jotka haluavat kehittää edistyneitä NLP-sovelluksia, joilla ei aiemmin ollut pääsyä koulutus- ja datatietokoneisiin.
- Uudet sovellukset: Julkaisemalla esikoulutetut ja hienosäätöityt mallit, DeepMind mahdollistaa helpomman kehittämisen hyödyllisissä sovelluksissa, kuten koulutuksessa, tieteessä ja saatavuudessa.
- Mukauttaminen: Kehittäjät voivat mukauttaa Gemmaa teollisuus- tai alakohtaisiin sovelluksiin jatkamalla koulutusta omilla tietojoukoilla.
- Tutkimus: Avoimet mallit kuten Gemma edistävät suurempaa avoimuutta ja tutkimusta nykyisissä NLP-järjestelmissä, valaisten tulevia tutkimussuuntia.
- Innovaatio: Vahvien perusmallien kuten Gemman saatavuus kiihdyttää edistystä alueilla kuten harhaisuuden vähentäminen, faktualisuus ja tekoälyturvallisuus.
Julkaisemalla Gemman avoimen lähdekoodin, DeepMind toivoo edistävänsä vastuullista tekoälykehitystä hyväksi yhteiskunnalle.
Tie eteenpäin
Jokainen askel tekoälyssä vie meidät lähemmäs malleja, jotka vastaavat tai ylittävät ihmisen älykkyyttä kaikilla aloilla. Järjestelmät kuten Gemma korostavat, kuinka nopeasti itseohjautuvat mallit avaavat yhä edistyneempiä kognitiivisia kykyjä.
Kuitenkin työtä on jäljellä parantamiseksi luotettavuutta, selittävyyttä ja tekoälyjärjestelmien hallittavuutta – alueilla, joilla ihmisen älykkyys edelleen hallitsee. Matematiikka korostaa näitä jatkuvia aukkoja, Gemman saavuttaessa 64 %:n MMLU:ssa verrattuna arvioidulle 89 %:n ihmisen suorituskykyyn.
Täyttämällä nämä aukot samalla varmistamalla tekoälyjärjestelmien turvallisuus ja eettisyys tulee olemaan keskeisiä haasteita tulevina vuosina. Oikean tasapainon löytäminen avoimuuden ja varovaisuuden välillä on kriittistä, kun DeepMind pyrkii demokratisoimaan pääsyn tekoälyn hyötyihin hallitsemalla samalla nousevia riskejä.
Alustoja, kuten Dario Amodein ANC, DeepMindin Ethics & Society -tiimi ja Anthropicin Constitutional AI, osoittavat kasvavaa tunnistamista tämän tarpeen tarkkuudesta. Merkittävää edistystä vaatii avoin, näyttöön perustuva vuoropuhelu tutkijoiden, kehittäjien, päätöksentekijöiden ja yleisön välillä.
Jos navigoidaan vastuullisesti, Gemma edustaa ei tekoälyn huippua, vaan tukikohdan seuraavalle tekoälytutkijoiden sukupolvelle, joka seuraa DeepMindin jalanjäljissä kohti reilua, hyödyllistä tekoälyä.
Johtopäätös
DeepMindin julkaiseminen Gemma-malleista merkitsee uuden aikakauden avoimen lähdekoodin tekoälylle – yhtä, joka ylittää kapeat benchmarkit ja siirtyy yleisiin älykkyyden kykyihin. Laajasti testattu turvallisuuden ja laajasti saatavilla oleva, Gemma asettaa uuden standardin vastuulliselle avoimen lähdekoodin julkaisemiselle tekoälyssä.
Kilpailuhenkinen ja yhteistyöhön perustuva lähestymistapa, jossa jaetaan läpimurtoja kuten Gemma, kohottaa koko tekoälyekosysteemin tasoa. Koko yhteisöllä on nyt pääsy monipuoliseen suuren kielen malliperheeseen, jota voidaan käyttää tai tukea omia aloitteita.
Vaikka riskejä on olemassa, DeepMindin tekninen ja eettinen tarkkaavaisuus antaa luottamusta, että Gemman hyödyt ylittävät sen mahdolliset haitat. Kun tekoälykykyjen kehitys jatkuu, tämän tarkkaavaisuuden ylläpitäminen avoimuuden ja varovaisuuden välillä on kriittistä.
Gemma vie meidät askelen lähemmäs tekoälyä, joka hyödyttää kaikkia. Mutta monia suuria haasteita odottaa edelleen tekoälyn kehitystien varrella. Jos tekoälytutkijat, kehittäjät ja yhteiskunta voivat ylläpitää yhteistyötä, Gemma voi nähdä historian tukikohdaksi, ei viimeiseksi huipuksi.












