AI-modeller og plattformer

Gemma: Google bringer avanserte AI-egenskaper gjennom ÃĨpne kilder

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Feltet kunstig intelligens (AI) har sett enorme fremgang i de siste ÃĨrene, hovedsakelig drevet av fremgang i dypt lÃĶring og naturleg sprÃĨkbehandling (NLP). I forkant av disse fremgangene er store sprÃĨkmodeller (LLM) – AI-systemer trent pÃĨ enorme mengder tekstdata som kan generere menneske-lignende tekst og delta i konversasjoner.

LLM-er som Google’s (GOOGL ) PaLM, Anthropic’s Claude og DeepMind’s Gopher har vist bemerkelsesverdige evner, fra kode til vanlig fornuft. Men de fleste av disse modellene har ikke blitt ÃĨpnet for offentligheten, og begrensninger i tilgangen for forskning, utvikling og nyttige anvendelser.

Dette endret seg med den nylige ÃĨpningen av Gemma – en familie av LLM-er fra Google’s DeepMind basert pÃĨ deres kraftfulle proprietÃĶre Gemini-modeller. I denne bloggposten vil vi dykke ned i Gemma, analysere dens arkitektur, treningsprosess, ytelse og ansvarlig utgivelse.

Overblik over Gemma

I februar 2023 ÃĨpnet DeepMind ÃĨpnet to stÃļrrelser av Gemma-modeller – en 2 milliarder parameter-versjon optimalisert for pÃĨ-enhet-utbredelse, og en stÃļrre 7 milliarder parameter-versjon designet for GPU/TPU-bruk.

Gemma utnytter en lignende transformer-basert arkitektur og treningsmetodikk som DeepMind’s ledende Gemini-modeller. Den ble trent pÃĨ opptil 6 billioner token av tekstdata fra webdokumenter, matematikk og kode.

DeepMind utga bÃĨde rÃĨ forhÃĨnds-treningssjekkpunkter av Gemma, samt versjoner finjustert med overvÃĨket lÃĶring og menneskelig tilbakemelding for ÃĨ forbedre evnene i omrÃĨder som dialog, instruksjonsfÃļlging og kode.

Komme i gang med Gemma

Gemma’s ÃĨpne utgivelse gjÃļr det mulig for utviklere, forskere og entusiaster ÃĨ fÃĨ tilgang til avanserte AI-egenskaper. Her er en rask veiledning for ÃĨ komme i gang:

Plattform-uavhengig utbredelse

En nÃļkkelstyrke med Gemma er dens fleksibilitet – du kan kjÃļre den pÃĨ CPU, GPU eller TPU. For CPU, utnytt TensorFlow Lite eller HuggingFace Transformers. For akselerert ytelse pÃĨ GPU/TPU, bruk TensorFlow. Skytjenester som Google Cloud’s Vertex AI tilbyr ogsÃĨ sammenhengende skalerbarhet.

Tilgang til forhÃĨnds-trente modeller

Gemma kommer i forskjellige forhÃĨnds-trente varianter avhengig av dine behov. 2B- og 7B-modellene tilbyr sterke generative evner ut av boksen. For tilpasset finjustering er 2B-FT- og 7B-FT-modellene ideelle utgangspunkter.

Bygge spennende applikasjoner

Du kan bygge en rekke forskjellige applikasjoner med Gemma, som historiegenerering, sprÃĨkoversettelse, spÃļrsmÃĨl-svar og kreativ innholdproduksjon. NÃļkkelen er ÃĨ utnytte Gemma’s styrker gjennom finjustering pÃĨ dine egne datasett.

Arkitektur

Gemma utnytter en decoder-kun transformer-arkitektur, bygget pÃĨ fremgang som multi-spÃļrsmÃĨl-oppmerksomhet og roterende posisjons-embeddings:

  • Transformatorer: Introdusert i 2017, har transformer-arkitekturen basert pÃĨ oppmerksomhetsmekanismer blitt ubenyttet i NLP. Gemma arver transformerens evne til ÃĨ modellere lange avhengigheter i tekst.
  • Decoder-kun: Gemma bruker bare en transformer-decoder-stakk, i motsetning til encoder-decoder-modeller som BART eller T5. Dette gir sterke generative evner for oppgaver som tekstgenerering.
  • Multi-spÃļrsmÃĨl-oppmerksomhet: Gemma bruker multi-spÃļrsmÃĨl-oppmerksomhet i dens stÃļrre modell, som tillater hver oppmerksomhets-hode ÃĨ prosessere flere spÃļrsmÃĨl parallelt for raskere inferens.
  • Roterende posisjons-embeddings: Gemma representerer posisjonsinformasjon ved hjelp av roterende embeddings i stedet for absolutt posisjonskoding. Denne teknikken reduserer modellstÃļrrelsen samtidig som den beholder posisjonsinformasjonen.

Bruken av teknikker som multi-spÃļrsmÃĨl-oppmerksomhet og roterende posisjons-embeddings gjÃļr det mulig for Gemma-modellene ÃĨ nÃĨ en optimal avveining mellom ytelse, inferens-hastighet og modellstÃļrrelse.

Data og treningsprosess

Gemma ble trent pÃĨ opptil 6 billioner token av tekstdata, hovedsakelig pÃĨ engelsk. Dette inkluderte webdokumenter, matematisk tekst og kildekode. DeepMind investerte betydelige anstrengelser i datafiltrering, fjerning av potensielt giftig, ulovlig eller skjev tekst ved hjelp av klassifiseringsalgoritmer og heuristikk.

Treningsprosessen ble utfÃļrt ved hjelp av Google’s TPUv5-infrastruktur, med opptil 4096 TPUs brukt til ÃĨ trene Gemma-7B. Effektive modell- og dataparalleliseringsteknikker muliggjorde treningsmassive modeller med kommersiell hÃĨrdvara.

Trinnvis treningsprosess ble brukt, hvor datafordelingen kontinuerlig ble justert for ÃĨ fokusere pÃĨ hÃļykvalitets-, relevante tekst. De siste finjusteringsstadiene brukte en blanding av menneske-generert og syntetisk instruksjonsfÃļlging-eksempler for ÃĨ forbedre evnene i omrÃĨder som dialog, instruksjonsfÃļlging og kode.

Modell-ytelse

DeepMind utvurderte Gemma-modellene grundig pÃĨ en rekke av over 25 benchmark-tester som omfattet spÃļrsmÃĨl-svar, resonnering, matematikk, kode, vanlig fornuft og dialog-evner.

Gemma oppnÃĨr toppkvalitetsresultater sammenlignet med lignende stÃļrrelse ÃĨpne kilde-modeller pÃĨ de fleste benchmark-tester. Noen hÃļydepunkter:

  • Matematikk: Gemma utmerker seg pÃĨ matematisk resonneringstester som GSM8K og MATH, og overgÃĨr modeller som Codex og Anthropic’s Claude med over 10 poeng.
  • Kode: Gemma matcher eller overgÃĨr Codex’ ytelse pÃĨ programmeringsbenchmark-tester som MBPP, til tross for at den ikke ble spesifikt trent pÃĨ kode.
  • Dialog: Gemma demonstrerer sterk konversasjons-evne med 51,7% seierprosent over Anthropic’s Mistral-7B pÃĨ menneske-preferanse-tester.
  • Resonnering: PÃĨ oppgaver som krever inferens som ARC og Winogrande, overgÃĨr Gemma andre 7B-modeller med 5-10 poeng.

Gemma’s fleksibilitet over flere fagomrÃĨder demonstrerer dens sterke generelle intelligens-evner. Selv om det fortsatt er noen avstander til menneske-lignende ytelse, representerer Gemma et stort skritt fremover i ÃĨpne kilde-NLP.

Sikkerhet og ansvar

Utgivelse av ÃĨpne kilde-vektorer for store modeller innfÃļrer utfordringer rundt bevisst misbruk og innebygde modell-forvrengninger. DeepMind tok skritt for ÃĨ minimere risiko:

  • Datafiltrering: Potensielt giftig, ulovlig eller skjev tekst ble fjernet fra treningsdataene ved hjelp av klassifiseringsalgoritmer og heuristikk.
  • Utvurderinger: Gemma ble testet pÃĨ 30+ benchmark-tester som var kuratert for ÃĨ vurdere sikkerhet, rettferdighet og robusthet. Den matchet eller overgikk andre modeller.
  • Finjustering: Modell-finjustering fokuserte pÃĨ ÃĨ forbedre sikkerhets-evner som informasjonsfiltrering og passende avvisnings-/nektelses-atferd.
  • BruksvilkÃĨr: BruksvilkÃĨrene forbÃļd offensiv, ulovlig eller etisk uakseptabelt bruk av Gemma-modellene. Likevel forblir gjennomfÃļringen utfordrende.
  • Modell-kort: Kort som detaljer modellens evner, begrensninger og forvrengninger ble utgitt for ÃĨ fremme ÃĨpenhet.

Selv om det finnes risikoer med ÃĨpne kilde-utgivelse, bestemte DeepMind at Gemma’s utgivelse gir en netto positiv effekt pÃĨ samfunnet basert pÃĨ dens sikkerhetsprofil og mulighet for forskning. Likevel vil det vÃĶre viktig ÃĨ overvÃĨke potensielle skader.

Å muliggjÃļre den neste bÃļlgen av AI-innovasjon

Utgivelsen av Gemma som en ÃĨpen kilde-modell-familie kan ÃĨpne opp for fremgang i hele AI-samfunnet:

  • Tilgjengelighet: Gemma reduserer barrierer for organisasjoner til ÃĨ bygge med toppmoderne NLP, som tidligere mÃļtte hÃļye beregnings-/data-kostnader for ÃĨ trene sine egne LLM-er.
  • Nye anvendelser: Ved ÃĨ utgi forhÃĨnds-trente og finjusterte sjekkpunkter, muliggjÃļr DeepMind enklere utvikling av nyttige applikasjoner i omrÃĨder som utdanning, vitenskap og tilgjengelighet.
  • Tilpassing: Utviklere kan videre tilpasse Gemma for bransje- eller domene-spesifikke anvendelser gjennom videre trening pÃĨ proprietÃĶr data.
  • Forskning: Åpne modeller som Gemma fremmer stÃļrre ÃĨpenhet og gjennomgang av nÃĨvÃĶrende NLP-systemer, og belyser fremtidige forskningsretninger.
  • Innovasjon: Tilgjengeligheten av sterke baseline-modeller som Gemma vil akselerere fremgang pÃĨ omrÃĨder som bias-mitigering, faktualitet og AI-sikkerhet.

Ved ÃĨ gi Gemma’s evner til alle gjennom ÃĨpne kilde-utgivelse, hÃĨper DeepMind ÃĨ fremme ansvarlig utvikling av AI for samfunnets beste.

Veiene fremover

Med hver fremgang i AI, nÃĶrmer vi oss modeller som kan matche eller overgÃĨ menneske-lignende intelligens over alle fagomrÃĨder. Systemer som Gemma understreker hvordan raske fremgang i selv-superviserte modeller ÃĨpner opp for stadig mer avanserte kognitive evner.

Likevel gjenstÃĨr det arbeid for ÃĨ forbedre pÃĨliteligheten, tolkbarheten og kontrollerbarheten av AI – omrÃĨder hvor menneskelig intelligens fortsatt er overlegen. FagomrÃĨder som matematikk understreker disse bestÃĨende gapene, med Gemma som scorer 64% pÃĨ MMLU sammenlignet med estimert 89% menneske-lignende ytelse.

Å lukke disse gapene samtidig som vi sikrer sikkerheten og etikken til stadig mer kapable AI-systemer, vil vÃĶre de sentrale utfordringene i ÃĨrene fremover. Å finne riktig balanse mellom ÃĨpenhet og forsiktighet vil vÃĶre kritisk, ettersom DeepMind sÃļker ÃĨ demokratisere tilgangen til AI’s fordeler samtidig som de hÃĨndterer nye risikoer.

Initiativer for ÃĨ fremme AI-sikkerhet – som Dario Amodei’s ANC, DeepMind’s Etikk & Samfunn-team og Anthropic’s Constitutional AI – signaliserer en voksende erkjennelse av dette behovet for nuanser. Meningsfull fremgang vil kreve ÃĨpen, evidens-basert dialog mellom forskere, utviklere, politikere og allmennheten.

Hvis navigert ansvarlig, representerer Gemma ikke toppen av AI, men en base-leir for den neste generasjonen av AI-forskere som fÃļlger i DeepMind’s fotspor mot rettferdig, nyttig kunstig generell intelligens.

Konklusjon

DeepMind’s utgivelse av Gemma-modellene markerer en ny ÃĶra for ÃĨpen kilde-AI – en som gÃĨr utenfor smale benchmark-tester og inn i generelle intelligens-evner. Testet grundig for sikkerhet og bredt tilgjengelig, setter Gemma en ny standard for ansvarlig ÃĨpen kilde-utgivelse i AI.

Drevet av en konkurrerende ÃĨnd temperert med samarbeidsverdier, deler gjennombrudd som Gemma hever alle bÃĨter i AI-Ãļkosystemet. Hele samfunnet har nÃĨ tilgang til en fleksibel LLM-familie for ÃĨ drive eller stÃļtte sine initiativer.

Selv om det fortsatt finnes risikoer, gir DeepMind’s tekniske og etiske grundighet tillit til at Gemma’s fordeler overgÃĨr dens potensielle skader. Ettersom AI-evnene blir stadig mer avanserte, vil det vÃĶre kritisk ÃĨ opprettholde denne nuansen mellom ÃĨpenhet og forsiktighet.

Gemma bringer oss ett skritt nÃĶrmere AI som fordeler hele menneskeheten. Men mange store utfordringer venter fortsatt langs veien til velvillig kunstig generell intelligens. Hvis AI-forskere, utviklere og samfunnet kan opprettholde samarbeidende fremgang, kan Gemma en dag bli sett pÃĨ som en historisk base-leir, snarere enn det endelige mÃĨlet.

Jeg har brukt de siste fem ÃĨrene pÃĨ ÃĨ dykke ned i den fasiniserende verden av MaskinlÃĶring og Dypt LÃĶring. Min lidenskap og ekspertise har ledet meg til ÃĨ bidra til over 50 ulike programvareprosjekter, med sÃĶrlig fokus pÃĨ AI/ML. Min pÃĨgÃĨende nysgjÃļrhet har ogsÃĨ trukket meg mot Naturlig SprÃĨkbehandling, et felt jeg er ivrig etter ÃĨ utforske videre.