AI-modeller och plattformar

Gemma: Google fÃķrmedlar avancerade AI-funktioner genom open source

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

OmrÃĨdet fÃķr artificiell intelligens (AI) har sett enorma framsteg under de senaste ÃĨren, till stor del driven av framsteg inom deep learning och naturlig sprÃĨkbehandling (NLP). I framkanten av dessa framsteg finns stora sprÃĨkmodeller (LLM) – AI-system som trÃĪnats pÃĨ enorma mÃĪngder textdata och kan generera mÃĪnsklig text och delta i konversationsuppgifter.

LLM som Google’s (GOOGL ) PaLM, Anthropic’s Claude och DeepMind’s Gopher har visat anmÃĪrkningsvÃĪrda fÃķrmÃĨgor, frÃĨn kodning till vanligt fÃķrnuft. Men de flesta av dessa modeller har inte slÃĪppts Ãķppet, vilket begrÃĪnsar deras tillgÃĪnglighet fÃķr forskning, utveckling och nyttiga tillÃĪmpningar.

Detta ÃĪndrades med den nyliga Ãķppna kÃĪllkoden fÃķr Gemma – en familj av LLM frÃĨn Google’s DeepMind baserad pÃĨ deras kraftfulla proprietÃĪra Gemini-modeller. I den hÃĪr bloggposten kommer vi att dyka in i Gemma, analysera dess arkitektur, trÃĪningsprocess, prestanda och ansvarsfull release.

Översikt av Gemma

I februari 2023 slÃĪppte DeepMind Ãķppen kÃĪllkod fÃķr tvÃĨ storlekar av Gemma-modeller – en 2 miljarder parametrar version optimerad fÃķr enhetsdistribution, och en stÃķrre 7 miljarder parametrar version designad fÃķr GPU/TPU-anvÃĪndning.

Gemma anvÃĪnder en liknande transformer-baserad arkitektur och trÃĪningsmetodik som DeepMind’s ledande Gemini-modeller. Den trÃĪnades pÃĨ upp till 6 biljoner token av textdata frÃĨn webbdokument, matematik och kod.

DeepMind slÃĪppte bÃĨde rÃĨa fÃķrtrÃĪnade kontrollpunkter av Gemma, samt versioner som finjusterats med Ãķvervakad inlÃĪrning och mÃĪnsklig feedback fÃķr fÃķrbÃĪttrade fÃķrmÃĨgor inom omrÃĨden som dialog, instruktionsfÃķljande och kodning.

Komma igÃĨng med Gemma

Gemma’s Ãķppna release gÃķr dess avancerade AI-funktioner tillgÃĪngliga fÃķr utvecklare, forskare och entusiaster. HÃĪr ÃĪr en snabbguide fÃķr att komma igÃĨng:

Plattformsoberoende distribution

En nyckelstyrka hos Gemma ÃĪr dess flexibilitet – du kan kÃķra den pÃĨ CPU, GPU eller TPU. FÃķr CPU, anvÃĪnd TensorFlow Lite eller HuggingFace Transformers. FÃķr accelererad prestanda pÃĨ GPU/TPU, anvÃĪnd TensorFlow. MolntjÃĪnster som Google Cloud’s Vertex AI erbjuder ocksÃĨ sÃķmlÃķs skalning.

TillgÃĨng till fÃķrtrÃĪnade modeller

Gemma finns i olika fÃķrtrÃĪnade varianter beroende pÃĨ dina behov. 2B- och 7B-modellerna erbjuder starka generativa fÃķrmÃĨgor direkt. FÃķr anpassad finjustering ÃĪr 2B-FT och 7B-FT-modellerna idealiska startpunkter.

Bygg spÃĪnnande applikationer

Du kan bygga en mÃĪngd olika applikationer med Gemma, som berÃĪttelsegenerering, sprÃĨkÃķversÃĪttning, frÃĨgesvar och kreativt innehÃĨllsproduktion. Nyckeln ÃĪr att utnyttja Gemma’s styrkor genom finjustering pÃĨ dina egna dataset.

Arkitektur

Gemma anvÃĪnder en decoder-endast transformer-arkitektur, byggd pÃĨ framsteg som multi-query-uppmÃĪrksamhet och roterande positionella inbÃĪddningar:

  • Transformatorer: InfÃķrda 2017, har transformer-arkitekturen baserad enbart pÃĨ uppmÃĪrksamhetsmekanismer blivit allmÃĪnt anvÃĪnd i NLP. Gemma ÃĪrver transformerens fÃķrmÃĨga att modellera lÃĨngvÃĪga beroenden i text.
  • Decoder-endast: Gemma anvÃĪnder endast en transformer-decoder-stack, till skillnad frÃĨn encoder-decoder-modeller som BART eller T5. Detta ger starka generativa fÃķrmÃĨgor fÃķr uppgifter som textgenerering.
  • Multi-query-uppmÃĪrksamhet: Gemma anvÃĪnder multi-query-uppmÃĪrksamhet i sin stÃķrre modell, vilket tillÃĨter varje uppmÃĪrksamhetsdel att bearbeta flera frÃĨgor parallellt fÃķr snabbare inferens.
  • Roterande positionella inbÃĪddningar: Gemma representerar positionell information med roterande inbÃĪddningar istÃĪllet fÃķr absoluta positionskodningar. Den hÃĪr tekniken minskar modellens storlek samtidigt som den behÃĨller positionsinformation.

AnvÃĪndningen av tekniker som multi-query-uppmÃĪrksamhet och roterande positionella inbÃĪddningar mÃķjliggÃķr fÃķr Gemma-modellerna att nÃĨ en optimal avvÃĪgning mellan prestanda, inferenstid och modellstorlek.

Data och trÃĪningsprocess

Gemma trÃĪnades pÃĨ upp till 6 biljoner token av textdata, frÃĪmst pÃĨ engelska. Detta inkluderade webbdokument, matematisk text och kÃĪllkod. DeepMind investerade betydande anstrÃĪngningar i datafiltrering, borttagning av giftig eller skadlig innehÃĨll med klassificerare och heuristiker.

TrÃĪningsprocessen utfÃķrdes med Google’s TPUv5-infrastruktur, med upp till 4096 TPUs som anvÃĪndes fÃķr att trÃĪna Gemma-7B. Effektiv modell- och dataparallellismtekniker mÃķjliggjorde trÃĪningsprocessen av de stora modellerna med standardmaskinvara.

Stegvis trÃĪningsprocess anvÃĪndes, kontinuerligt justerande datadistributionen fÃķr att fokusera pÃĨ hÃķgkvalitativ, relevant text. De slutliga finjusteringsstegen anvÃĪnde en blandning av mÃĪnskligt genererade och syntetiska instruktionsfÃķljande exempel fÃķr att fÃķrbÃĪttra fÃķrmÃĨgor inom omrÃĨden som dialog, instruktionsfÃķljande och kodning.

Modellprestanda

DeepMind utvÃĪrderade rigorÃķst Gemma-modellerna pÃĨ en bred uppsÃĪttning av Ãķver 25 benchmark-tester som omfattar frÃĨgesvar, resonemang, matematik, kodning, vanligt fÃķrnuft och dialogfÃķrmÃĨga.

Gemma uppnÃĨr toppprestanda jÃĪmfÃķrt med liknande Ãķppna kÃĪllkodsmodeller pÃĨ de flesta benchmark-tester. NÃĨgra hÃķjdpunkter:

  • Matematik: Gemma excellerar pÃĨ matematiska resonemangstester som GSM8K och MATH, och ÃķvertrÃĪffar modeller som Codex och Anthropic’s Claude med Ãķver 10 poÃĪng.
  • Kodning: Gemma matchar eller ÃķvertrÃĪffar prestandan hos Codex pÃĨ programmeringsbenchmark-tester som MBPP, trots att den inte specifikt trÃĪnats pÃĨ kod.
  • Dialog: Gemma visar stark konversationsfÃķrmÃĨga med 51,7% vinstfrekvens Ãķver Anthropic’s Mistral-7B pÃĨ mÃĪnskliga preferenstester.
  • Resonemang: PÃĨ uppgifter som krÃĪver inferens som ARC och Winogrande, ÃķvertrÃĪffar Gemma andra 7B-modeller med 5-10 poÃĪng.

Gemma’s mÃĨngsidighet Ãķver discipliner visar dess starka allmÃĪnna intelligensfÃķrmÃĨgor. Medan det fortfarande finns gap till mÃĪnsklig prestanda, representerar Gemma ett stort steg framÃĨt i Ãķppen kÃĪllkods-NLP.

SÃĪkerhet och ansvar

SlÃĪppandet av Ãķppen kÃĪllkod fÃķr stora modeller introducerar utmaningar kring avsiktlig missbruk och inneboende modellbias. DeepMind tog steg fÃķr att mildra risker:

  • Datafiltrering: Potentiellt giftig, olaglig eller biased text togs bort frÃĨn trÃĪningsdata med klassificerare och heuristiker.
  • UtvÃĪrderingar: Gemma testades pÃĨ 30+ benchmark-tester som utvÃĪrderar sÃĪkerhet, rÃĪttvisa och robusthet. Den matchade eller ÃķvertrÃĪffade andra modeller.
  • Finjustering: Modellfinjustering fokuserade pÃĨ att fÃķrbÃĪttra sÃĪkerhetsfÃķrmÃĨgor som informationsfiltrering och lÃĪmplig avvisningsbeteende.
  • AnvÃĪndarvillkor: AnvÃĪndarvillkoren fÃķrbjuder offensiv, olaglig eller oetisk anvÃĪndning av Gemma-modellerna. Men, efterlevnad fÃķrblir en utmaning.
  • Modellkort: Kort som detaljerar modellens fÃķrmÃĨgor, begrÃĪnsningar och bias slÃĪpptes fÃķr att frÃĪmja transparens.

Medan risker frÃĨn Ãķppen kÃĪllkod finns, faststÃĪllde DeepMind att Gemma’s release ger netto samhÃĪllsnytta baserat pÃĨ dess sÃĪkerhetsprofil och mÃķjliggÃķrande av forskning. Men, noggrann Ãķvervakning av potentiella skador kommer att fÃķrbli kritisk.

MÃķjliggÃķrande av nÃĪsta vÃĨg av AI-innovation

SlÃĪppandet av Gemma som en Ãķppen kÃĪllkodsmodellfamilj kan lÃĨsa upp framsteg inom hela AI-samhÃĪllet:

  • TillgÃĪnglighet: Gemma minskar hinder fÃķr organisationer att bygga med avancerad NLP, som tidigare stod infÃķr hÃķga berÃĪknings- och datakostnader fÃķr att trÃĪna sina egna LLM.
  • Nya tillÃĪmpningar: Genom att slÃĪppa Ãķppen kÃĪllkod fÃķr fÃķrtrÃĪnade och finjusterade kontrollpunkter, mÃķjliggÃķr DeepMind enklare utveckling av nyttiga applikationer inom omrÃĨden som utbildning, vetenskap och tillgÃĪnglighet.
  • Anpassning: Utvecklare kan ytterligare anpassa Gemma fÃķr bransch- eller domÃĪnspecifika tillÃĪmpningar genom fortsatt trÃĪningsprocess pÃĨ proprietÃĪr data.
  • Forskning: Öppna modeller som Gemma frÃĪmjar stÃķrre transparens och granskning av nuvarande NLP-system, som belyser framtida forskningsriktningar.
  • Innovation: TillgÃĪngligheten av starka basmodeller som Gemma kommer att accelerera framsteg inom omrÃĨden som bias-minskning, faktualitet och AI-sÃĪkerhet.

Genom att tillhandahÃĨlla Gemma’s fÃķrmÃĨgor till alla genom Ãķppen kÃĪllkod, hoppas DeepMind pÃĨ att stimulera ansvarsfull utveckling av AI fÃķr socialt vÃĪl.

VÃĪgen framÃĨt

Med varje steg i AI, nÃĪrmar vi oss modeller som rivaliserar eller ÃķvertrÃĪffar mÃĪnsklig intelligens inom alla omrÃĨden. System som Gemma understryker hur snabba framsteg inom sjÃĪlvstÃĪndiga modeller lÃĨser upp alltmer avancerade kognitiva fÃķrmÃĨgor.

Men, arbete ÃĨterstÃĨr fÃķr att fÃķrbÃĪttra tillfÃķrlitlighet, tolkbarhet och kontrollerbarhet av AI – omrÃĨden dÃĪr mÃĪnsklig intelligens fortfarande ÃĪr ÃķverlÃĪgsen. OmrÃĨden som matematik belyser dessa bestÃĨende gap, med Gemma som uppnÃĨr 64% pÃĨ MMLU jÃĪmfÃķrt med uppskattad 89% mÃĪnsklig prestanda.

Att stÃĪnga dessa gap samtidigt som man sÃĪkerstÃĪller sÃĪkerheten och etiken fÃķr alltmer kapabla AI-system kommer att vara de centrala utmaningarna i framtiden. Att hitta rÃĪtt balans mellan Ãķppenhet och fÃķrsiktighet kommer att vara avgÃķrande, eftersom DeepMind syftar till att demokratisera tillgÃĨngen till AI-fÃķrdelar samtidigt som man hanterar framvÃĪxande risker.

Initiativ fÃķr att frÃĪmja AI-sÃĪkerhet – som Dario Amodei’s ANC, DeepMind’s Etik och samhÃĪllesteam, och Anthropic’s Konstitutionell AI – signalerar en vÃĪxande erkÃĪnsla av detta behov av nyans. Meningsfulla framsteg kommer att krÃĪva Ãķppen, evidensbaserad dialog mellan forskare, utvecklare, beslutsfattare och allmÃĪnheten.

Om det navigeras pÃĨ ett ansvarsfullt sÃĪtt, representerar Gemma inte toppen av AI, utan en baslÃĪger fÃķr nÃĪsta generation av AI-forskare som fÃķljer i DeepMind’s fotspÃĨr mot rÃĪttvis och nyttig artificiell allmÃĪn intelligens.

Slutsats

DeepMind’s release av Gemma-modellerna markerar en ny era fÃķr Ãķppen kÃĪllkods-AI – en som gÃĨr utÃķver smala benchmark-tester till generella intelligensfÃķrmÃĨgor. Testad noggrant fÃķr sÃĪkerhet och brett tillgÃĪnglig, sÃĪtter Gemma en ny standard fÃķr ansvarsfull Ãķppen kÃĪllkodsrelease inom AI.

Driven av en konkurrensanda som balanseras med samarbetsvÃĪrderingar, delar av banbrytande framsteg som Gemma hÃķjer alla bÃĨtar i AI-ekosystemet. Hela samhÃĪllet har nu tillgÃĨng till en mÃĨngsidig LLM-familj fÃķr att driva eller stÃķdja sina initiativ.

Medan risker kvarstÃĨr, ger DeepMind’s tekniska och etiska omsorg fÃķrtroende fÃķr att Gemma’s fÃķrdelar ÃķvervÃĪger dess potentiella skador. NÃĪr AI-fÃķrmÃĨgorna vÃĪxer alltmer avancerade, kommer att upprÃĪtthÃĨlla denna nyans mellan Ãķppenhet och fÃķrsiktighet att vara avgÃķrande.

Gemma tar oss ett steg nÃĪrmare AI som gynnar alla mÃĪnniskor. Men mÃĨnga stora utmaningar vÃĪntar fortfarande lÃĪngs vÃĪgen till vÃĪlgÃķrande artificiell allmÃĪn intelligens. Om AI-forskare, utvecklare och samhÃĪllet i stort kan upprÃĪtthÃĨlla samarbetsframsteg, kan Gemma en dag ses som ett historiskt baslÃĪger, snarare ÃĪn den slutliga toppen.

Jag har tillbringat de senaste fem ÃĨren med att dyka djupt in i den fascinerande vÃĪrlden av MaskinlÃĪrning och DjupinlÃĪrning. Min passion och expertis har lett mig till att bidra till Ãķver 50 olika mjukvaruprojekt, med sÃĪrskild fokus pÃĨ AI/ML. Min pÃĨgÃĨende nyfikenhet har ocksÃĨ lett mig mot Naturlig SprÃĨkbehandling, ett omrÃĨde som jag ÃĪr angelÃĪgen om att utforska vidare.