AI-modeller og plattformer

Gemma: Google bringer avanserte AI-egenskaper gjennom åpne kilder

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Feltet kunstig intelligens (AI) har sett enorme fremgang i de siste årene, hovedsakelig drevet av fremgang i dypt læring og naturleg språkbehandling (NLP). I forkant av disse fremgangene er store språkmodeller (LLM) – AI-systemer trent på enorme mengder tekstdata som kan generere menneske-lignende tekst og delta i konversasjoner.

LLM-er som Google’s PaLM, Anthropic’s Claude og DeepMind’s Gopher har vist bemerkelsesverdige evner, fra kode til vanlig fornuft. Men de fleste av disse modellene har ikke blitt åpnet for offentligheten, og begrensninger i tilgangen for forskning, utvikling og nyttige anvendelser.

Dette endret seg med den nylige åpningen av Gemma – en familie av LLM-er fra Google’s DeepMind basert på deres kraftfulle proprietære Gemini-modeller. I denne bloggposten vil vi dykke ned i Gemma, analysere dens arkitektur, treningsprosess, ytelse og ansvarlig utgivelse.

Overblik over Gemma

I februar 2023 åpnet DeepMind åpnet to størrelser av Gemma-modeller – en 2 milliarder parameter-versjon optimalisert for på-enhet-utbredelse, og en større 7 milliarder parameter-versjon designet for GPU/TPU-bruk.

Gemma utnytter en lignende transformer-basert arkitektur og treningsmetodikk som DeepMind’s ledende Gemini-modeller. Den ble trent på opptil 6 billioner token av tekstdata fra webdokumenter, matematikk og kode.

DeepMind utga både rå forhånds-treningssjekkpunkter av Gemma, samt versjoner finjustert med overvåket læring og menneskelig tilbakemelding for å forbedre evnene i områder som dialog, instruksjonsfølging og kode.

Komme i gang med Gemma

Gemma’s åpne utgivelse gjør det mulig for utviklere, forskere og entusiaster å få tilgang til avanserte AI-egenskaper. Her er en rask veiledning for å komme i gang:

Plattform-uavhengig utbredelse

En nøkkelstyrke med Gemma er dens fleksibilitet – du kan kjøre den på CPU, GPU eller TPU. For CPU, utnytt TensorFlow Lite eller HuggingFace Transformers. For akselerert ytelse på GPU/TPU, bruk TensorFlow. Skytjenester som Google Cloud’s Vertex AI tilbyr også sammenhengende skalerbarhet.

Tilgang til forhånds-trente modeller

Gemma kommer i forskjellige forhånds-trente varianter avhengig av dine behov. 2B- og 7B-modellene tilbyr sterke generative evner ut av boksen. For tilpasset finjustering er 2B-FT- og 7B-FT-modellene ideelle utgangspunkter.

Bygge spennende applikasjoner

Du kan bygge en rekke forskjellige applikasjoner med Gemma, som historiegenerering, språkoversettelse, spørsmål-svar og kreativ innholdproduksjon. Nøkkelen er å utnytte Gemma’s styrker gjennom finjustering på dine egne datasett.

Arkitektur

Gemma utnytter en decoder-kun transformer-arkitektur, bygget på fremgang som multi-spørsmål-oppmerksomhet og roterende posisjons-embeddings:

  • Transformatorer: Introdusert i 2017, har transformer-arkitekturen basert på oppmerksomhetsmekanismer blitt ubenyttet i NLP. Gemma arver transformerens evne til å modellere lange avhengigheter i tekst.
  • Decoder-kun: Gemma bruker bare en transformer-decoder-stakk, i motsetning til encoder-decoder-modeller som BART eller T5. Dette gir sterke generative evner for oppgaver som tekstgenerering.
  • Multi-spørsmål-oppmerksomhet: Gemma bruker multi-spørsmål-oppmerksomhet i dens større modell, som tillater hver oppmerksomhets-hode å prosessere flere spørsmål parallelt for raskere inferens.
  • Roterende posisjons-embeddings: Gemma representerer posisjonsinformasjon ved hjelp av roterende embeddings i stedet for absolutt posisjonskoding. Denne teknikken reduserer modellstørrelsen samtidig som den beholder posisjonsinformasjonen.

Bruken av teknikker som multi-spørsmål-oppmerksomhet og roterende posisjons-embeddings gjør det mulig for Gemma-modellene å nå en optimal avveining mellom ytelse, inferens-hastighet og modellstørrelse.

Data og treningsprosess

Gemma ble trent på opptil 6 billioner token av tekstdata, hovedsakelig på engelsk. Dette inkluderte webdokumenter, matematisk tekst og kildekode. DeepMind investerte betydelige anstrengelser i datafiltrering, fjerning av potensielt giftig, ulovlig eller skjev tekst ved hjelp av klassifiseringsalgoritmer og heuristikk.

Treningsprosessen ble utført ved hjelp av Google’s TPUv5-infrastruktur, med opptil 4096 TPUs brukt til å trene Gemma-7B. Effektive modell- og dataparalleliseringsteknikker muliggjorde treningsmassive modeller med kommersiell hårdvara.

Trinnvis treningsprosess ble brukt, hvor datafordelingen kontinuerlig ble justert for å fokusere på høykvalitets-, relevante tekst. De siste finjusteringsstadiene brukte en blanding av menneske-generert og syntetisk instruksjonsfølging-eksempler for å forbedre evnene i områder som dialog, instruksjonsfølging og kode.

Modell-ytelse

DeepMind utvurderte Gemma-modellene grundig på en rekke av over 25 benchmark-tester som omfattet spørsmål-svar, resonnering, matematikk, kode, vanlig fornuft og dialog-evner.

Gemma oppnår toppkvalitetsresultater sammenlignet med lignende størrelse åpne kilde-modeller på de fleste benchmark-tester. Noen høydepunkter:

  • Matematikk: Gemma utmerker seg på matematisk resonneringstester som GSM8K og MATH, og overgår modeller som Codex og Anthropic’s Claude med over 10 poeng.
  • Kode: Gemma matcher eller overgår Codex’ ytelse på programmeringsbenchmark-tester som MBPP, til tross for at den ikke ble spesifikt trent på kode.
  • Dialog: Gemma demonstrerer sterk konversasjons-evne med 51,7% seierprosent over Anthropic’s Mistral-7B på menneske-preferanse-tester.
  • Resonnering: På oppgaver som krever inferens som ARC og Winogrande, overgår Gemma andre 7B-modeller med 5-10 poeng.

Gemma’s fleksibilitet over flere fagområder demonstrerer dens sterke generelle intelligens-evner. Selv om det fortsatt er noen avstander til menneske-lignende ytelse, representerer Gemma et stort skritt fremover i åpne kilde-NLP.

Sikkerhet og ansvar

Utgivelse av åpne kilde-vektorer for store modeller innfører utfordringer rundt bevisst misbruk og innebygde modell-forvrengninger. DeepMind tok skritt for å minimere risiko:

  • Datafiltrering: Potensielt giftig, ulovlig eller skjev tekst ble fjernet fra treningsdataene ved hjelp av klassifiseringsalgoritmer og heuristikk.
  • Utvurderinger: Gemma ble testet på 30+ benchmark-tester som var kuratert for å vurdere sikkerhet, rettferdighet og robusthet. Den matchet eller overgikk andre modeller.
  • Finjustering: Modell-finjustering fokuserte på å forbedre sikkerhets-evner som informasjonsfiltrering og passende avvisnings-/nektelses-atferd.
  • Bruksvilkår: Bruksvilkårene forbød offensiv, ulovlig eller etisk uakseptabelt bruk av Gemma-modellene. Likevel forblir gjennomføringen utfordrende.
  • Modell-kort: Kort som detaljer modellens evner, begrensninger og forvrengninger ble utgitt for å fremme åpenhet.

Selv om det finnes risikoer med åpne kilde-utgivelse, bestemte DeepMind at Gemma’s utgivelse gir en netto positiv effekt på samfunnet basert på dens sikkerhetsprofil og mulighet for forskning. Likevel vil det være viktig å overvåke potensielle skader.

Å muliggjøre den neste bølgen av AI-innovasjon

Utgivelsen av Gemma som en åpen kilde-modell-familie kan åpne opp for fremgang i hele AI-samfunnet:

  • Tilgjengelighet: Gemma reduserer barrierer for organisasjoner til å bygge med toppmoderne NLP, som tidligere møtte høye beregnings-/data-kostnader for å trene sine egne LLM-er.
  • Nye anvendelser: Ved å utgi forhånds-trente og finjusterte sjekkpunkter, muliggjør DeepMind enklere utvikling av nyttige applikasjoner i områder som utdanning, vitenskap og tilgjengelighet.
  • Tilpassing: Utviklere kan videre tilpasse Gemma for bransje- eller domene-spesifikke anvendelser gjennom videre trening på proprietær data.
  • Forskning: Åpne modeller som Gemma fremmer større åpenhet og gjennomgang av nåværende NLP-systemer, og belyser fremtidige forskningsretninger.
  • Innovasjon: Tilgjengeligheten av sterke baseline-modeller som Gemma vil akselerere fremgang på områder som bias-mitigering, faktualitet og AI-sikkerhet.

Ved å gi Gemma’s evner til alle gjennom åpne kilde-utgivelse, håper DeepMind å fremme ansvarlig utvikling av AI for samfunnets beste.

Veiene fremover

Med hver fremgang i AI, nærmer vi oss modeller som kan matche eller overgå menneske-lignende intelligens over alle fagområder. Systemer som Gemma understreker hvordan raske fremgang i selv-superviserte modeller åpner opp for stadig mer avanserte kognitive evner.

Likevel gjenstår det arbeid for å forbedre påliteligheten, tolkbarheten og kontrollerbarheten av AI – områder hvor menneskelig intelligens fortsatt er overlegen. Fagområder som matematikk understreker disse bestående gapene, med Gemma som scorer 64% på MMLU sammenlignet med estimert 89% menneske-lignende ytelse.

Å lukke disse gapene samtidig som vi sikrer sikkerheten og etikken til stadig mer kapable AI-systemer, vil være de sentrale utfordringene i årene fremover. Å finne riktig balanse mellom åpenhet og forsiktighet vil være kritisk, ettersom DeepMind søker å demokratisere tilgangen til AI’s fordeler samtidig som de håndterer nye risikoer.

Initiativer for å fremme AI-sikkerhet – som Dario Amodei’s ANC, DeepMind’s Etikk & Samfunn-team og Anthropic’s Constitutional AI – signaliserer en voksende erkjennelse av dette behovet for nuanser. Meningsfull fremgang vil kreve åpen, evidens-basert dialog mellom forskere, utviklere, politikere og allmennheten.

Hvis navigert ansvarlig, representerer Gemma ikke toppen av AI, men en base-leir for den neste generasjonen av AI-forskere som følger i DeepMind’s fotspor mot rettferdig, nyttig kunstig generell intelligens.

Konklusjon

DeepMind’s utgivelse av Gemma-modellene markerer en ny æra for åpen kilde-AI – en som går utenfor smale benchmark-tester og inn i generelle intelligens-evner. Testet grundig for sikkerhet og bredt tilgjengelig, setter Gemma en ny standard for ansvarlig åpen kilde-utgivelse i AI.

Drevet av en konkurrerende ånd temperert med samarbeidsverdier, deler gjennombrudd som Gemma hever alle båter i AI-økosystemet. Hele samfunnet har nå tilgang til en fleksibel LLM-familie for å drive eller støtte sine initiativer.

Selv om det fortsatt finnes risikoer, gir DeepMind’s tekniske og etiske grundighet tillit til at Gemma’s fordeler overgår dens potensielle skader. Ettersom AI-evnene blir stadig mer avanserte, vil det være kritisk å opprettholde denne nuansen mellom åpenhet og forsiktighet.

Gemma bringer oss ett skritt nærmere AI som fordeler hele menneskeheten. Men mange store utfordringer venter fortsatt langs veien til velvillig kunstig generell intelligens. Hvis AI-forskere, utviklere og samfunnet kan opprettholde samarbeidende fremgang, kan Gemma en dag bli sett på som en historisk base-leir, snarere enn det endelige målet.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.