AI-modeller og platforme

Gemma: Google bringer avancerede AI-kapaciteter gennem open source

mm
Føj Unite.AI til dine foretrukne kilder på Google

Det kunstige intelligensfelt (AI) har oplevet enorm fremgang i de seneste år, primært drevet af fremskridt i dyb læring og naturlig sprogbehandling (NLP). I forkanten af disse fremskridt er store sprogmodeller (LLM’er) – AI-systemer trænet på massive mængder tekstdata, der kan generere menneske-lignende tekst og deltage i konversationsopgaver.

LLM’er som Google’s (GOOGL ) PaLM, Anthropic’s Claude og DeepMind’s Gopher har demonstreret bemærkelsesværdige evner, fra kodning til fælles fornuftig resonnering. Men de fleste af disse modeller er ikke blevet åbent frigivet, hvilket begrænser deres adgang til forskning, udvikling og nyttige anvendelser.

Dette ændrede sig med den nylige open sourcing af Gemma – en familie af LLM’er fra Google’s DeepMind baseret på deres kraftfulde proprietære Gemini-modeller. I denne blogindlæg, dykker vi ned i Gemma, analyserer dens arkitektur, træningsproces, ydeevne og ansvarlig frigivelse.

Overblik over Gemma

I februar 2023 open sourcede DeepMind to størrelser af Gemma-modeller – en 2 milliard parameter version optimeret til på-enhed-udrulning, og en større 7 milliard parameter version designet til GPU/TPU-brug.

Gemma udnytter en lignende transformer-baseret arkitektur og træningsmetode som DeepMind’s ledende Gemini-modeller. Den blev trænet på op til 6 billioner tokens af tekstdata fra webdokumenter, matematik og kode.

DeepMind frigav både rå fortrænede checkpoints af Gemma, samt versioner finjusteret med overvåget læring og menneskelig feedback for forbedret kapacitet i områder som dialog, instruktionsfølging og kodning.

Introduktion til Gemma

Gemma’s åbne frigivelse gør dens avancerede AI-kapaciteter tilgængelige for udviklere, forskere og entusiaster. Her er en hurtig vejledning til at komme i gang:

Platform-uafhængig udrulning

En nøglestyrke i Gemma er dens fleksibilitet – du kan køre den på CPU’er, GPU’er eller TPU’er. Til CPU, udnyt TensorFlow Lite eller HuggingFace Transformers. Til accelereret ydeevne på GPU/TPU, brug TensorFlow. Cloud-tjenester som Google Cloud’s Vertex AI tilbyder også problemfri skalerbarhed.

Adgang til fortrænede modeller

Gemma kommer i forskellige fortrænede varianter afhængigt af dine behov. 2B- og 7B-modellerne tilbyder stærke generative evner ud af boksen. Til brugerkontrolleret finjustering, er 2B-FT og 7B-FT-modellerne ideelle startpunkter.

Byg spændende applikationer

Du kan bygge en bred vifte af applikationer med Gemma, som historiegenerering, sprogoversættelse, spørgsmålssvar og kreativ indholdproduktion. Nøglen er at udnytte Gemma’s styrker gennem finjustering på dine egne datasæt.

Arkitektur

Gemma anvender en decoder-kun transformer-arkitektur, bygget på fremskridt som multi-spørgsmål-opmærksomhed og roterende positionelle indlejring:

  • Transformatorer: Introduceret i 2017, er transformer-arkitekturen baseret på opmærksomheds-mekanismer blevet almindelig i NLP. Gemma arver transformerens evne til at modellere lange afhængigheder i tekst.
  • Decoder-kun: Gemma bruger kun en transformer-decoder-stak, i modsætning til encoder-decoder-modeller som BART eller T5. Dette giver stærke generative evner til opgaver som tekstgenerering.
  • Multi-spørgsmål-opmærksomhed: Gemma anvender multi-spørgsmål-opmærksomhed i dens større model, hvilket tillader hver opmærksomheds-hoved at behandle multiple spørgsmål samtidigt for hurtigere inferens.
  • Roterende positionelle indlejring: Gemma repræsenterer positionelle oplysninger ved hjælp af roterende indlejring i stedet for absolut positionskodning. Denne teknik reducerer modelstørrelsen, mens den bevarende positionelle oplysninger.

Anvendelsen af teknikker som multi-spørgsmål-opmærksomhed og roterende positionelle indlejring tillader Gemma-modellerne at nå et optimalt kompromis mellem ydeevne, inferens-hastighed og modelstørrelse.

Data og træningsproces

Gemma blev trænet på op til 6 billioner tokens af tekstdata, primært på engelsk. Dette inkluderede webdokumenter, matematisk tekst og kildekode. DeepMind investerede betydelige anstrengelser i data-filtrering, fjernelse af giftig eller skadelig indhold ved hjælp af klassificatorer og heuristikker.

Træningen blev udført ved hjælp af Google’s TPUv5-infrastruktur, med op til 4096 TPU’er brugt til at træne Gemma-7B. Effektive model- og data-parallelliseringsteknikker tillod træning af de massive modeller med commodity-hardware.

Trinvis træning blev anvendt, hvor datafordelingen kontinuerligt blev justeret for at fokusere på højkvalitets-, relevante tekst. De endelige finjusteringsfaser brugte en blanding af menneske-genererede og syntetiske instruktionsfølge-eksempler til at forbedre kapaciteter.

Model-ydeevne

DeepMind udvælgerede Gemma-modellerne på en bred vifte af over 25 benchmarks, der spænder over spørgsmålssvar, resonnering, matematik, kodning, fælles fornuft og dialog-kapaciteter.

Gemma opnår state-of-the-art-resultater i forhold til lignende åbne modeller på de fleste benchmarks. Nogle højdepunkter:

  • Matematik: Gemma excellerer på matematiske resonneringstests som GSM8K og MATH, overgående modeller som Codex og Anthropic’s Claude med over 10 point.
  • Kodning: Gemma matcher eller overgår Codex’s ydeevne på programmeringsbenchmarks som MBPP, på trods af at den ikke er specifikt trænet på kode.
  • Dialog: Gemma demonstrerer stærke konversations-evner med 51,7% sejrsrate over Anthropic’s Mistral-7B på menneske-præferencestests.
  • Resonnering: På opgaver, der kræver inferens som ARC og Winogrande, overgår Gemma andre 7B-modeller med 5-10 point.

Gemma’s fleksibilitet på tværs af discipliner demonstrerer dens stærke generelle intelligens-kapaciteter. Selv om der stadig er huller til menneske-lignende ydeevne, repræsenterer Gemma et spring fremad i åbne NLP-modeller.

Sikkerhed og ansvar

Frigivelsen af åbne modeller introducerer udfordringer omkring bevidst misbrug og indbyggede model-forvrængninger. DeepMind tog skridt for at minimere risici:

  • Data-filtrering: Potentielt giftig, ulovlig eller forvrængt tekst blev fjernet fra træningsdata ved hjælp af klassificatorer og heuristikker.
  • Evalueringer: Gemma blev testet på 30+ benchmarks, der var kurateret til at vurdere sikkerhed, retfærdighed og robusthed. Den matchede eller overgik andre modeller.
  • Finjustering: Model-finjustering fokuserede på at forbedre sikkerheds-kapaciteter som informations-filtrering og passende afvisnings-/afvisnings-adfærd.
  • Brugsbetingelser: Brugsbetingelserne forbød offensiv, ulovlig eller etisk uacceptabel anvendelse af Gemma-modellerne. Men gennemtvingelse forbliver en udfordring.
  • Model-kort: Kort, der detaljerer model-kapaciteter, begrænsninger og forvrængninger, blev udgivet for at fremme gennemsigtighed.

Selv om risici fra åbne modeller findes, fastslog DeepMind, at Gemma’s frigivelse giver netto-samfundsmæssige fordele baseret på dens sikkerhedsprofil og mulighed for at fremme forskning. Men vigilen overvågning af potentielle skader vil forblive kritisk.

Enabling den næste bølge af AI-innovation

Frigivelsen af Gemma som en åben model-familie kan låse op for fremskridt på tværs af AI-samfundet:

  • Tilgængelighed: Gemma reducerer barrierer for organisationer til at bygge med avancerede NLP, som tidligere stod over for høje beregnings-/data-omkostninger for at træne deres egne LLM’er.
  • Nye anvendelser: Ved at frigive fortrænede og finjusterede checkpoints, muliggør DeepMind lettere udvikling af nyttige applikationer i områder som uddannelse, videnskab og tilgængelighed.
  • Tilpasning: Udviklere kan yderligere tilpasse Gemma til branche- eller domæne-specifikke anvendelser gennem fortsat træning på proprietær data.
  • Forskning: Åbne modeller som Gemma fremmer større gennemsigtighed og gennemgang af nuværende NLP-systemer, og oplyser fremtidige forskningsretninger.
  • Innovation: Tilgængeligheden af stærke baseline-modeller som Gemma vil accelerere fremskridt på områder som bias-mitigation, faktualitet og AI-sikkerhed.

Ved at tilbyde Gemma’s kapaciteter til alle gennem åbne modeller, håber DeepMind at fremme ansvarlig udvikling af AI til sociale formål.

Vejen frem

Med hvert spring i AI, nærmer vi os modeller, der kan matche eller overgå menneske-lignende intelligens på tværs af alle domæner. Systemer som Gemma understreger, hvordan hurtige fremskridt i selv-supervisede modeller låser op for stadig mere avancerede kognitive kapaciteter.

Men der er stadig arbejde at gøre for at forbedre pålidelighed, gennemsigtighed og kontrollerbarhed af AI – områder, hvor menneskelig intelligens stadig er overlegen. Domæner som matematik understreger disse bestående huller, med Gemma, der scorer 64% på MMLU i forhold til estimeret 89% menneske-lignende ydeevne.

At lukke disse huller, samtidig med at sikkerhed og etik af stadig mere kapable AI-systemer sikres, vil være de centrale udfordringer i de kommende år. At finde det rette balance mellem åbenhed og forsigtighed vil være kritisk, da DeepMind søger at demokratisere adgangen til AI’s fordele, samtidig med at man håndterer nye risici.

Initiativer til at fremme AI-sikkerhed – som Dario Amodei’s ANC, DeepMind’s Ethics & Society-team og Anthropic’s Constitutional AI – signalerer en voksende erkendelse af dette behov for nuance. Meningsfuld fremgang vil kræve åben, evidens-baseret dialog mellem forskere, udviklere, politikere og offentligheden.

Hvis navigeret ansvarligt, repræsenterer Gemma ikke toppen af AI, men en base-lejr for den næste generation af AI-forskere, der følger i DeepMind’s fodspor mod retfærdig, nyttig kunstig generel intelligens.

Konklusion

DeepMind’s frigivelse af Gemma-modellerne markerer en ny æra for åben AI – en, der transcenderer snævre benchmarks til generelle intelligens-kapaciteter. Testet omfattende for sikkerhed og bredt tilgængelig, sætter Gemma en ny standard for ansvarlig åbne modeller i AI.

Drevet af en konkurrence-ånd tempereret med samarbejdsværdier, deler gennembrud som Gemma alle både i AI-økosystemet. Hele samfundet har nu adgang til en fleksibel LLM-familie til at drive eller støtte deres initiativer.

Selv om risici består, giver DeepMind’s tekniske og etiske omhyggelighed tillid til, at Gemma’s fordele overvælder dens potentielle skader. Da AI-kapaciteterne vokser stadig mere avancerede, vil det være kritisk at fastholde denne nuance mellem åbenhed og forsigtighed.

Gemma bringer os et skridt nærmere AI, der gavner alle mennesker. Men mange store udfordringer venter stadig langs vejen til velgørende kunstig generel intelligens. Hvis AI-forskere, udviklere og samfundet kan opretholde samarbejdende fremskridt, kan Gemma en dag blive set som en historisk base-lejr, snarere end den endelige toppen.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.