AI-modeller og plattformer
Gemma: Google bringer avanserte AI-egenskaper gjennom ÃĨpne kilder
Feltet kunstig intelligens (AI) har sett enorme fremgang i de siste ÃĨrene, hovedsakelig drevet av fremgang i dypt lÃĶring og naturleg sprÃĨkbehandling (NLP). I forkant av disse fremgangene er store sprÃĨkmodeller (LLM) â AI-systemer trent pÃĨ enorme mengder tekstdata som kan generere menneske-lignende tekst og delta i konversasjoner.
LLM-er som Googleâs (GOOGL ) PaLM, Anthropicâs Claude og DeepMindâs Gopher har vist bemerkelsesverdige evner, fra kode til vanlig fornuft. Men de fleste av disse modellene har ikke blitt ÃĨpnet for offentligheten, og begrensninger i tilgangen for forskning, utvikling og nyttige anvendelser.
Dette endret seg med den nylige ÃĨpningen av Gemma â en familie av LLM-er fra Googleâs DeepMind basert pÃĨ deres kraftfulle proprietÃĶre Gemini-modeller. I denne bloggposten vil vi dykke ned i Gemma, analysere dens arkitektur, treningsprosess, ytelse og ansvarlig utgivelse.
Overblik over Gemma
I februar 2023 ÃĨpnet DeepMind ÃĨpnet to stÃļrrelser av Gemma-modeller â en 2 milliarder parameter-versjon optimalisert for pÃĨ-enhet-utbredelse, og en stÃļrre 7 milliarder parameter-versjon designet for GPU/TPU-bruk.
Gemma utnytter en lignende transformer-basert arkitektur og treningsmetodikk som DeepMindâs ledende Gemini-modeller. Den ble trent pÃĨ opptil 6 billioner token av tekstdata fra webdokumenter, matematikk og kode.
DeepMind utga bÃĨde rÃĨ forhÃĨnds-treningssjekkpunkter av Gemma, samt versjoner finjustert med overvÃĨket lÃĶring og menneskelig tilbakemelding for ÃĨ forbedre evnene i omrÃĨder som dialog, instruksjonsfÃļlging og kode.
Komme i gang med Gemma
Gemmaâs ÃĨpne utgivelse gjÃļr det mulig for utviklere, forskere og entusiaster ÃĨ fÃĨ tilgang til avanserte AI-egenskaper. Her er en rask veiledning for ÃĨ komme i gang:
Plattform-uavhengig utbredelse
En nÃļkkelstyrke med Gemma er dens fleksibilitet â du kan kjÃļre den pÃĨ CPU, GPU eller TPU. For CPU, utnytt TensorFlow Lite eller HuggingFace Transformers. For akselerert ytelse pÃĨ GPU/TPU, bruk TensorFlow. Skytjenester som Google Cloudâs Vertex AI tilbyr ogsÃĨ sammenhengende skalerbarhet.
Tilgang til forhÃĨnds-trente modeller
Gemma kommer i forskjellige forhÃĨnds-trente varianter avhengig av dine behov. 2B- og 7B-modellene tilbyr sterke generative evner ut av boksen. For tilpasset finjustering er 2B-FT- og 7B-FT-modellene ideelle utgangspunkter.
Bygge spennende applikasjoner
Du kan bygge en rekke forskjellige applikasjoner med Gemma, som historiegenerering, sprÃĨkoversettelse, spÃļrsmÃĨl-svar og kreativ innholdproduksjon. NÃļkkelen er ÃĨ utnytte Gemmaâs styrker gjennom finjustering pÃĨ dine egne datasett.
Arkitektur
Gemma utnytter en decoder-kun transformer-arkitektur, bygget pÃĨ fremgang som multi-spÃļrsmÃĨl-oppmerksomhet og roterende posisjons-embeddings:
- Transformatorer: Introdusert i 2017, har transformer-arkitekturen basert pÃĨ oppmerksomhetsmekanismer blitt ubenyttet i NLP. Gemma arver transformerens evne til ÃĨ modellere lange avhengigheter i tekst.
- Decoder-kun: Gemma bruker bare en transformer-decoder-stakk, i motsetning til encoder-decoder-modeller som BART eller T5. Dette gir sterke generative evner for oppgaver som tekstgenerering.
- Multi-spÃļrsmÃĨl-oppmerksomhet: Gemma bruker multi-spÃļrsmÃĨl-oppmerksomhet i dens stÃļrre modell, som tillater hver oppmerksomhets-hode ÃĨ prosessere flere spÃļrsmÃĨl parallelt for raskere inferens.
- Roterende posisjons-embeddings: Gemma representerer posisjonsinformasjon ved hjelp av roterende embeddings i stedet for absolutt posisjonskoding. Denne teknikken reduserer modellstÃļrrelsen samtidig som den beholder posisjonsinformasjonen.
Bruken av teknikker som multi-spÃļrsmÃĨl-oppmerksomhet og roterende posisjons-embeddings gjÃļr det mulig for Gemma-modellene ÃĨ nÃĨ en optimal avveining mellom ytelse, inferens-hastighet og modellstÃļrrelse.
Data og treningsprosess
Gemma ble trent pÃĨ opptil 6 billioner token av tekstdata, hovedsakelig pÃĨ engelsk. Dette inkluderte webdokumenter, matematisk tekst og kildekode. DeepMind investerte betydelige anstrengelser i datafiltrering, fjerning av potensielt giftig, ulovlig eller skjev tekst ved hjelp av klassifiseringsalgoritmer og heuristikk.
Treningsprosessen ble utfÃļrt ved hjelp av Googleâs TPUv5-infrastruktur, med opptil 4096 TPUs brukt til ÃĨ trene Gemma-7B. Effektive modell- og dataparalleliseringsteknikker muliggjorde treningsmassive modeller med kommersiell hÃĨrdvara.
Trinnvis treningsprosess ble brukt, hvor datafordelingen kontinuerlig ble justert for ÃĨ fokusere pÃĨ hÃļykvalitets-, relevante tekst. De siste finjusteringsstadiene brukte en blanding av menneske-generert og syntetisk instruksjonsfÃļlging-eksempler for ÃĨ forbedre evnene i omrÃĨder som dialog, instruksjonsfÃļlging og kode.
Modell-ytelse
DeepMind utvurderte Gemma-modellene grundig pÃĨ en rekke av over 25 benchmark-tester som omfattet spÃļrsmÃĨl-svar, resonnering, matematikk, kode, vanlig fornuft og dialog-evner.
Gemma oppnÃĨr toppkvalitetsresultater sammenlignet med lignende stÃļrrelse ÃĨpne kilde-modeller pÃĨ de fleste benchmark-tester. Noen hÃļydepunkter:
- Matematikk: Gemma utmerker seg pÃĨ matematisk resonneringstester som GSM8K og MATH, og overgÃĨr modeller som Codex og Anthropicâs Claude med over 10 poeng.
- Kode: Gemma matcher eller overgÃĨr Codexâ ytelse pÃĨ programmeringsbenchmark-tester som MBPP, til tross for at den ikke ble spesifikt trent pÃĨ kode.
- Dialog: Gemma demonstrerer sterk konversasjons-evne med 51,7% seierprosent over Anthropicâs Mistral-7B pÃĨ menneske-preferanse-tester.
- Resonnering: PÃĨ oppgaver som krever inferens som ARC og Winogrande, overgÃĨr Gemma andre 7B-modeller med 5-10 poeng.
Gemmaâs fleksibilitet over flere fagomrÃĨder demonstrerer dens sterke generelle intelligens-evner. Selv om det fortsatt er noen avstander til menneske-lignende ytelse, representerer Gemma et stort skritt fremover i ÃĨpne kilde-NLP.
Sikkerhet og ansvar
Utgivelse av ÃĨpne kilde-vektorer for store modeller innfÃļrer utfordringer rundt bevisst misbruk og innebygde modell-forvrengninger. DeepMind tok skritt for ÃĨ minimere risiko:
- Datafiltrering: Potensielt giftig, ulovlig eller skjev tekst ble fjernet fra treningsdataene ved hjelp av klassifiseringsalgoritmer og heuristikk.
- Utvurderinger: Gemma ble testet pÃĨ 30+ benchmark-tester som var kuratert for ÃĨ vurdere sikkerhet, rettferdighet og robusthet. Den matchet eller overgikk andre modeller.
- Finjustering: Modell-finjustering fokuserte pÃĨ ÃĨ forbedre sikkerhets-evner som informasjonsfiltrering og passende avvisnings-/nektelses-atferd.
- BruksvilkÃĨr: BruksvilkÃĨrene forbÃļd offensiv, ulovlig eller etisk uakseptabelt bruk av Gemma-modellene. Likevel forblir gjennomfÃļringen utfordrende.
- Modell-kort: Kort som detaljer modellens evner, begrensninger og forvrengninger ble utgitt for ÃĨ fremme ÃĨpenhet.
Selv om det finnes risikoer med ÃĨpne kilde-utgivelse, bestemte DeepMind at Gemmaâs utgivelse gir en netto positiv effekt pÃĨ samfunnet basert pÃĨ dens sikkerhetsprofil og mulighet for forskning. Likevel vil det vÃĶre viktig ÃĨ overvÃĨke potensielle skader.
à muliggjÃļre den neste bÃļlgen av AI-innovasjon
Utgivelsen av Gemma som en ÃĨpen kilde-modell-familie kan ÃĨpne opp for fremgang i hele AI-samfunnet:
- Tilgjengelighet: Gemma reduserer barrierer for organisasjoner til ÃĨ bygge med toppmoderne NLP, som tidligere mÃļtte hÃļye beregnings-/data-kostnader for ÃĨ trene sine egne LLM-er.
- Nye anvendelser: Ved ÃĨ utgi forhÃĨnds-trente og finjusterte sjekkpunkter, muliggjÃļr DeepMind enklere utvikling av nyttige applikasjoner i omrÃĨder som utdanning, vitenskap og tilgjengelighet.
- Tilpassing: Utviklere kan videre tilpasse Gemma for bransje- eller domene-spesifikke anvendelser gjennom videre trening pÃĨ proprietÃĶr data.
- Forskning: Ã pne modeller som Gemma fremmer stÃļrre ÃĨpenhet og gjennomgang av nÃĨvÃĶrende NLP-systemer, og belyser fremtidige forskningsretninger.
- Innovasjon: Tilgjengeligheten av sterke baseline-modeller som Gemma vil akselerere fremgang pÃĨ omrÃĨder som bias-mitigering, faktualitet og AI-sikkerhet.
Ved ÃĨ gi Gemmaâs evner til alle gjennom ÃĨpne kilde-utgivelse, hÃĨper DeepMind ÃĨ fremme ansvarlig utvikling av AI for samfunnets beste.
Veiene fremover
Med hver fremgang i AI, nÃĶrmer vi oss modeller som kan matche eller overgÃĨ menneske-lignende intelligens over alle fagomrÃĨder. Systemer som Gemma understreker hvordan raske fremgang i selv-superviserte modeller ÃĨpner opp for stadig mer avanserte kognitive evner.
Likevel gjenstÃĨr det arbeid for ÃĨ forbedre pÃĨliteligheten, tolkbarheten og kontrollerbarheten av AI â omrÃĨder hvor menneskelig intelligens fortsatt er overlegen. FagomrÃĨder som matematikk understreker disse bestÃĨende gapene, med Gemma som scorer 64% pÃĨ MMLU sammenlignet med estimert 89% menneske-lignende ytelse.
à lukke disse gapene samtidig som vi sikrer sikkerheten og etikken til stadig mer kapable AI-systemer, vil vÃĶre de sentrale utfordringene i ÃĨrene fremover. à finne riktig balanse mellom ÃĨpenhet og forsiktighet vil vÃĶre kritisk, ettersom DeepMind sÃļker ÃĨ demokratisere tilgangen til AIâs fordeler samtidig som de hÃĨndterer nye risikoer.
Initiativer for ÃĨ fremme AI-sikkerhet â som Dario Amodeiâs ANC, DeepMindâs Etikk & Samfunn-team og Anthropicâs Constitutional AI â signaliserer en voksende erkjennelse av dette behovet for nuanser. Meningsfull fremgang vil kreve ÃĨpen, evidens-basert dialog mellom forskere, utviklere, politikere og allmennheten.
Hvis navigert ansvarlig, representerer Gemma ikke toppen av AI, men en base-leir for den neste generasjonen av AI-forskere som fÃļlger i DeepMindâs fotspor mot rettferdig, nyttig kunstig generell intelligens.
Konklusjon
DeepMindâs utgivelse av Gemma-modellene markerer en ny ÃĶra for ÃĨpen kilde-AI â en som gÃĨr utenfor smale benchmark-tester og inn i generelle intelligens-evner. Testet grundig for sikkerhet og bredt tilgjengelig, setter Gemma en ny standard for ansvarlig ÃĨpen kilde-utgivelse i AI.
Drevet av en konkurrerende ÃĨnd temperert med samarbeidsverdier, deler gjennombrudd som Gemma hever alle bÃĨter i AI-Ãļkosystemet. Hele samfunnet har nÃĨ tilgang til en fleksibel LLM-familie for ÃĨ drive eller stÃļtte sine initiativer.
Selv om det fortsatt finnes risikoer, gir DeepMindâs tekniske og etiske grundighet tillit til at Gemmaâs fordeler overgÃĨr dens potensielle skader. Ettersom AI-evnene blir stadig mer avanserte, vil det vÃĶre kritisk ÃĨ opprettholde denne nuansen mellom ÃĨpenhet og forsiktighet.
Gemma bringer oss ett skritt nÃĶrmere AI som fordeler hele menneskeheten. Men mange store utfordringer venter fortsatt langs veien til velvillig kunstig generell intelligens. Hvis AI-forskere, utviklere og samfunnet kan opprettholde samarbeidende fremgang, kan Gemma en dag bli sett pÃĨ som en historisk base-leir, snarere enn det endelige mÃĨlet.












