AI-modeller och plattformar
Gemma: Google förmedlar avancerade AI-funktioner genom open source
Området för artificiell intelligens (AI) har sett enorma framsteg under de senaste åren, till stor del driven av framsteg inom deep learning och naturlig språkbehandling (NLP). I framkanten av dessa framsteg finns stora språkmodeller (LLM) – AI-system som tränats på enorma mängder textdata och kan generera mänsklig text och delta i konversationsuppgifter.
LLM som Google’s PaLM, Anthropic’s Claude och DeepMind’s Gopher har visat anmärkningsvärda förmågor, från kodning till vanligt förnuft. Men de flesta av dessa modeller har inte släppts öppet, vilket begränsar deras tillgänglighet för forskning, utveckling och nyttiga tillämpningar.
Detta ändrades med den nyliga öppna källkoden för Gemma – en familj av LLM från Google’s DeepMind baserad på deras kraftfulla proprietära Gemini-modeller. I den här bloggposten kommer vi att dyka in i Gemma, analysera dess arkitektur, träningsprocess, prestanda och ansvarsfull release.
Översikt av Gemma
I februari 2023 släppte DeepMind öppen källkod för två storlekar av Gemma-modeller – en 2 miljarder parametrar version optimerad för enhetsdistribution, och en större 7 miljarder parametrar version designad för GPU/TPU-användning.
Gemma använder en liknande transformer-baserad arkitektur och träningsmetodik som DeepMind’s ledande Gemini-modeller. Den tränades på upp till 6 biljoner token av textdata från webbdokument, matematik och kod.
DeepMind släppte både råa förtränade kontrollpunkter av Gemma, samt versioner som finjusterats med övervakad inlärning och mänsklig feedback för förbättrade förmågor inom områden som dialog, instruktionsföljande och kodning.
Komma igång med Gemma
Gemma’s öppna release gör dess avancerade AI-funktioner tillgängliga för utvecklare, forskare och entusiaster. Här är en snabbguide för att komma igång:
Plattformsoberoende distribution
En nyckelstyrka hos Gemma är dess flexibilitet – du kan köra den på CPU, GPU eller TPU. För CPU, använd TensorFlow Lite eller HuggingFace Transformers. För accelererad prestanda på GPU/TPU, använd TensorFlow. Molntjänster som Google Cloud’s Vertex AI erbjuder också sömlös skalning.
Tillgång till förtränade modeller
Gemma finns i olika förtränade varianter beroende på dina behov. 2B- och 7B-modellerna erbjuder starka generativa förmågor direkt. För anpassad finjustering är 2B-FT och 7B-FT-modellerna idealiska startpunkter.
Bygg spännande applikationer
Du kan bygga en mängd olika applikationer med Gemma, som berättelsegenerering, språköversättning, frågesvar och kreativt innehållsproduktion. Nyckeln är att utnyttja Gemma’s styrkor genom finjustering på dina egna dataset.
Arkitektur
Gemma använder en decoder-endast transformer-arkitektur, byggd på framsteg som multi-query-uppmärksamhet och roterande positionella inbäddningar:
- Transformatorer: Införda 2017, har transformer-arkitekturen baserad enbart på uppmärksamhetsmekanismer blivit allmänt använd i NLP. Gemma ärver transformerens förmåga att modellera långväga beroenden i text.
- Decoder-endast: Gemma använder endast en transformer-decoder-stack, till skillnad från encoder-decoder-modeller som BART eller T5. Detta ger starka generativa förmågor för uppgifter som textgenerering.
- Multi-query-uppmärksamhet: Gemma använder multi-query-uppmärksamhet i sin större modell, vilket tillåter varje uppmärksamhetsdel att bearbeta flera frågor parallellt för snabbare inferens.
- Roterande positionella inbäddningar: Gemma representerar positionell information med roterande inbäddningar istället för absoluta positionskodningar. Den här tekniken minskar modellens storlek samtidigt som den behåller positionsinformation.
Användningen av tekniker som multi-query-uppmärksamhet och roterande positionella inbäddningar möjliggör för Gemma-modellerna att nå en optimal avvägning mellan prestanda, inferenstid och modellstorlek.
Data och träningsprocess
Gemma tränades på upp till 6 biljoner token av textdata, främst på engelska. Detta inkluderade webbdokument, matematisk text och källkod. DeepMind investerade betydande ansträngningar i datafiltrering, borttagning av giftig eller skadlig innehåll med klassificerare och heuristiker.
Träningsprocessen utfördes med Google’s TPUv5-infrastruktur, med upp till 4096 TPUs som användes för att träna Gemma-7B. Effektiv modell- och dataparallellismtekniker möjliggjorde träningsprocessen av de stora modellerna med standardmaskinvara.
Stegvis träningsprocess användes, kontinuerligt justerande datadistributionen för att fokusera på högkvalitativ, relevant text. De slutliga finjusteringsstegen använde en blandning av mänskligt genererade och syntetiska instruktionsföljande exempel för att förbättra förmågor inom områden som dialog, instruktionsföljande och kodning.
Modellprestanda
DeepMind utvärderade rigoröst Gemma-modellerna på en bred uppsättning av över 25 benchmark-tester som omfattar frågesvar, resonemang, matematik, kodning, vanligt förnuft och dialogförmåga.
Gemma uppnår toppprestanda jämfört med liknande öppna källkodsmodeller på de flesta benchmark-tester. Några höjdpunkter:
- Matematik: Gemma excellerar på matematiska resonemangstester som GSM8K och MATH, och överträffar modeller som Codex och Anthropic’s Claude med över 10 poäng.
- Kodning: Gemma matchar eller överträffar prestandan hos Codex på programmeringsbenchmark-tester som MBPP, trots att den inte specifikt tränats på kod.
- Dialog: Gemma visar stark konversationsförmåga med 51,7% vinstfrekvens över Anthropic’s Mistral-7B på mänskliga preferenstester.
- Resonemang: På uppgifter som kräver inferens som ARC och Winogrande, överträffar Gemma andra 7B-modeller med 5-10 poäng.
Gemma’s mångsidighet över discipliner visar dess starka allmänna intelligensförmågor. Medan det fortfarande finns gap till mänsklig prestanda, representerar Gemma ett stort steg framåt i öppen källkods-NLP.
Säkerhet och ansvar
Släppandet av öppen källkod för stora modeller introducerar utmaningar kring avsiktlig missbruk och inneboende modellbias. DeepMind tog steg för att mildra risker:
- Datafiltrering: Potentiellt giftig, olaglig eller biased text togs bort från träningsdata med klassificerare och heuristiker.
- Utvärderingar: Gemma testades på 30+ benchmark-tester som utvärderar säkerhet, rättvisa och robusthet. Den matchade eller överträffade andra modeller.
- Finjustering: Modellfinjustering fokuserade på att förbättra säkerhetsförmågor som informationsfiltrering och lämplig avvisningsbeteende.
- Användarvillkor: Användarvillkoren förbjuder offensiv, olaglig eller oetisk användning av Gemma-modellerna. Men, efterlevnad förblir en utmaning.
- Modellkort: Kort som detaljerar modellens förmågor, begränsningar och bias släpptes för att främja transparens.
Medan risker från öppen källkod finns, fastställde DeepMind att Gemma’s release ger netto samhällsnytta baserat på dess säkerhetsprofil och möjliggörande av forskning. Men, noggrann övervakning av potentiella skador kommer att förbli kritisk.
Möjliggörande av nästa våg av AI-innovation
Släppandet av Gemma som en öppen källkodsmodellfamilj kan låsa upp framsteg inom hela AI-samhället:
- Tillgänglighet: Gemma minskar hinder för organisationer att bygga med avancerad NLP, som tidigare stod inför höga beräknings- och datakostnader för att träna sina egna LLM.
- Nya tillämpningar: Genom att släppa öppen källkod för förtränade och finjusterade kontrollpunkter, möjliggör DeepMind enklare utveckling av nyttiga applikationer inom områden som utbildning, vetenskap och tillgänglighet.
- Anpassning: Utvecklare kan ytterligare anpassa Gemma för bransch- eller domänspecifika tillämpningar genom fortsatt träningsprocess på proprietär data.
- Forskning: Öppna modeller som Gemma främjar större transparens och granskning av nuvarande NLP-system, som belyser framtida forskningsriktningar.
- Innovation: Tillgängligheten av starka basmodeller som Gemma kommer att accelerera framsteg inom områden som bias-minskning, faktualitet och AI-säkerhet.
Genom att tillhandahålla Gemma’s förmågor till alla genom öppen källkod, hoppas DeepMind på att stimulera ansvarsfull utveckling av AI för socialt väl.
Vägen framåt
Med varje steg i AI, närmar vi oss modeller som rivaliserar eller överträffar mänsklig intelligens inom alla områden. System som Gemma understryker hur snabba framsteg inom självständiga modeller låser upp alltmer avancerade kognitiva förmågor.
Men, arbete återstår för att förbättra tillförlitlighet, tolkbarhet och kontrollerbarhet av AI – områden där mänsklig intelligens fortfarande är överlägsen. Områden som matematik belyser dessa bestående gap, med Gemma som uppnår 64% på MMLU jämfört med uppskattad 89% mänsklig prestanda.
Att stänga dessa gap samtidigt som man säkerställer säkerheten och etiken för alltmer kapabla AI-system kommer att vara de centrala utmaningarna i framtiden. Att hitta rätt balans mellan öppenhet och försiktighet kommer att vara avgörande, eftersom DeepMind syftar till att demokratisera tillgången till AI-fördelar samtidigt som man hanterar framväxande risker.
Initiativ för att främja AI-säkerhet – som Dario Amodei’s ANC, DeepMind’s Etik och samhällesteam, och Anthropic’s Konstitutionell AI – signalerar en växande erkänsla av detta behov av nyans. Meningsfulla framsteg kommer att kräva öppen, evidensbaserad dialog mellan forskare, utvecklare, beslutsfattare och allmänheten.
Om det navigeras på ett ansvarsfullt sätt, representerar Gemma inte toppen av AI, utan en basläger för nästa generation av AI-forskare som följer i DeepMind’s fotspår mot rättvis och nyttig artificiell allmän intelligens.
Slutsats
DeepMind’s release av Gemma-modellerna markerar en ny era för öppen källkods-AI – en som går utöver smala benchmark-tester till generella intelligensförmågor. Testad noggrant för säkerhet och brett tillgänglig, sätter Gemma en ny standard för ansvarsfull öppen källkodsrelease inom AI.
Driven av en konkurrensanda som balanseras med samarbetsvärderingar, delar av banbrytande framsteg som Gemma höjer alla båtar i AI-ekosystemet. Hela samhället har nu tillgång till en mångsidig LLM-familj för att driva eller stödja sina initiativ.
Medan risker kvarstår, ger DeepMind’s tekniska och etiska omsorg förtroende för att Gemma’s fördelar överväger dess potentiella skador. När AI-förmågorna växer alltmer avancerade, kommer att upprätthålla denna nyans mellan öppenhet och försiktighet att vara avgörande.
Gemma tar oss ett steg närmare AI som gynnar alla människor. Men många stora utmaningar väntar fortfarande längs vägen till välgörande artificiell allmän intelligens. Om AI-forskare, utvecklare och samhället i stort kan upprätthålla samarbetsframsteg, kan Gemma en dag ses som ett historiskt basläger, snarare än den slutliga toppen.












