AI-modeller och plattformar

Googles multimodala AI Gemini – En teknisk djupdykning

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Google's First Multimodal Model: Gemini

Sundar Pichai, Googles VD, tillsammans med Demis Hassabis från Google DeepMind, har presenterat Gemini i december 2023. Denna nya stora språkmodell är integrerad i Googles omfattande utbud av produkter, vilket förbättrar tjänsterna och verktygen som används av miljontals människor.

(GOOGL )

Gemini, Googles avancerade multimodala AI, är född ur de sammanförda ansträngningarna från de förenade DeepMind- och Brain AI-laboratorierna. Gemini står på axlarna av sina föregångare och lovar att leverera en mer sammanhängande och intelligent svit av applikationer.

Tillkännagivandet av Google Gemini, som ligger nära efter debuterna av Bard, Duet AI och PaLM 2 LLM, markerar en tydlig avsikt från Google att inte bara konkurrera utan också leda i AI-revolutionen.

Till skillnad från alla föreställningar om en AI-vinter, tyder lanseringen av Gemini på en blomstrande AI-vår, full av potential och tillväxt. När vi ser tillbaka på ett år sedan uppkomsten av ChatGPT, som i sig var ett banbrytande ögonblick för AI, visar Googles drag att branschens expansion är långt ifrån över; faktum är att den kanske bara börjar ta fart.

Vad är Gemini?

Googles Gemini-modell kan bearbeta olika typer av data, såsom text, bilder, ljud och video. Den finns i tre versioner – Ultra, Pro och Nano – var och en anpassad för specifika tillämpningar, från komplexa resonemang till användning på enheten. Ultra excellerar i multifacetterade uppgifter och kommer att finnas tillgänglig på Bard Advanced, medan Pro erbjuder en balans mellan prestanda och resurseffektivitet, redan integrerad i Bard för textprompt. Nano, optimerad för distribution på enheten, finns i två storlekar och har hårdvaruoptimeringar som 4-bitars kvantisering för offlineanvändning i enheter som Pixel 8 Pro.

Geminis arkitektur är unik i sin naturliga multimodala utmatningsförmåga, med diskreta bildtoken för bildgenerering och integrerade ljudfunktioner från det universella talmodellen för nyanserad ljudförståelse. Dess förmåga att hantera videodata som sekvenser av bilder, vävda samman med text- eller ljudinmatningar, exemplifierar dess multimodala duglighet.

Gemini stöder sekvenser av text, bild, ljud och video som inmatningar

Gemini stöder sekvenser av text, bild, ljud och video som inmatningar

Tillgång till Gemini

Gemini 1.0 rullas ut över Googles ekosystem, inklusive Bard, som nu dra nytta av de raffinerade förmågorna hos Gemini Pro. Google har också integrerat Gemini i sin Sök, Annons och Duet-tjänster, förbättrar användarupplevelsen med snabbare och mer precisa svar.

För de som är angelägna om att utnyttja Geminis förmågor erbjuder Google AI Studio och Google Cloud Vertex tillgång till Gemini Pro, med den senare som erbjuder större anpassningsförmåga och säkerhetsfunktioner.

För att uppleva de förbättrade förmågorna hos Bard som drivs av Gemini Pro kan användarna följa följande enkla steg:

  1. Navigera till Bard: Öppna din föredragna webbläsare och gå till Bard-webbplatsen.
  2. Säker inloggning: Kom åt tjänsten genom att logga in med ditt Google-konto, vilket säkerställer en smidig och säker upplevelse.
  3. Interaktiv chatt: Du kan nu använda Bard, där Geminis avancerade funktioner kan väljas.

Multimodalitetens kraft:

I sin kärna använder Gemini en transformer-baserad arkitektur, liknande de som används i framgångsrika NLP-modeller som GPT-3. Men Geminis unikhet ligger i dess förmåga att bearbeta och integrera information från flera modaliteter, inklusive text, bilder och kod. Detta uppnås genom en ny teknik som kallas cross-modal uppmärksamhet, som tillåter modellen att lära sig relationer och beroenden mellan olika typer av data.

Här är en nedbrytning av Geminis viktigaste komponenter:

  • Multimodal encoder: Denna modul bearbetar indata från varje modalitet (t.ex. text, bild) oberoende, extraherar relevanta funktioner och genererar individuella representationer.
  • Cross-modal uppmärksamhetsnätverk: Detta nätverk är hjärtat i Gemini. Det tillåter modellen att lära sig relationer och beroenden mellan de olika representationerna, vilket möjliggör att de “pratar” med varandra och berikar sin förståelse.
  • Multimodal avkodare: Denna modul använder de berikade representationer som genereras av cross-modal uppmärksamhetsnätverket för att utföra olika uppgifter, såsom bildbeskrivning, text-till-bild-generering och kodgenerering.

Geminis modell är inte bara om att förstå text eller bilder – det handlar om att integrera olika typer av information på ett sätt som är mycket närmare hur vi, som människor, uppfattar världen. Till exempel kan Gemini titta på en sekvens av bilder och bestämma den logiska eller rumsliga ordningen på objekten i dem. Den kan också analysera designfunktionerna hos objekten för att fatta beslut, såsom vilken av två bilar som har en mer aerodynamisk form.

Men Geminis talanger går utöver bara visuell förståelse. Den kan omvandla en uppsättning instruktioner till kod, skapa praktiska verktyg som en nedräkningstimer som inte bara fungerar som avsett utan också innehåller kreativa element, såsom motivations-emoji, för att förbättra användarinteraktionen. Detta indikerar en förmåga att hantera uppgifter som kräver en blandning av kreativitet och funktionalitet – färdigheter som ofta anses vara distinkt mänskliga.

Geminis förmågor : Rumslig resonemang

Geminis förmågor : Rumslig resonemang (Källa)

 

Geminis förmågor sträcker sig till att utföra programmeringsuppgifter

Geminis förmågor sträcker sig till att utföra programmeringsuppgifter(Källa)

Geminis sofistikerade design bygger på en rik historia av neurala nätverksforskning och utnyttjar Googles senaste TPU-teknik för utbildning. Gemini Ultra har i synnerhet satt nya benchmark för olika AI-domäner, visar imponerande prestandaförbättringar i multimodala resonemangsaktiviteter.

Med sin förmåga att analysera och förstå komplexa data erbjuder Gemini lösningar för verkliga tillämpningar, särskilt inom utbildning. Den kan analysera och korrigera lösningar på problem, som i fysik, genom att förstå handskrivna anteckningar och tillhandahålla exakt matematisk typsättning. Sådana förmågor antyder en framtid där AI assisterar i utbildningsmiljöer, erbjuder studenter och utbildare avancerade verktyg för lärande och problemlösning.

Gemini har använts för att skapa agenter som AlphaCode 2, som excellerar i konkurrenskraftiga programmeringsproblem. Detta visar Geminis potential att fungera som en generalist-AI, kapabel att hantera komplexa, flerstegsproblem.

Gemini Nano bringar AI-kraften till vardagsenheter, bibehåller imponerande förmågor i uppgifter som sammanfattning och läsförståelse, samt kod- och STEM-relaterade utmaningar. Dessa mindre modeller är finjusterade för att erbjuda högkvalitativa AI-funktioner på enheter med låg minneskapacitet, vilket gör avancerad AI mer tillgänglig än någonsin.

Utvecklingen av Gemini involverade innovationer i utbildningsalgoritmer och infrastruktur, med användning av Googles senaste TPUs. Detta möjliggjorde effektiv skalning och robusta utbildningsprocesser, vilket säkerställde att även de minsta modellerna levererade exceptionell prestanda.

Träningsdataset för Gemini är lika varierat som dess förmågor, inklusive webbdokument, böcker, kod, bilder, ljud och videor. Detta multimodala och flerspråkiga dataset säkerställer att Gemini-modeller kan förstå och bearbeta en stor mängd olika innehållstyper effektivt.

Gemini och GPT-4

Trots uppkomsten av andra modeller är frågan på alla människors läppar hur Googles Gemini står sig mot OpenAIs GPT-4, branschens benchmark för nya LLM. Googles data tyder på att medan GPT-4 kan excellerera i vanligt förnuft-resonemangsaktiviteter, har Gemini Ultra övertaget i nästan alla andra områden.

Gemini VS GPT-4

Gemini VS GPT-4

Ovanstående benchmark-tabell visar den imponerande prestandan hos Googles Gemini AI över en mängd olika uppgifter. Noterbart har Gemini Ultra uppnått remarkabla resultat i MMLU-benchmarken med 90,04% noggrannhet, vilket indikerar dess överlägsna förståelse för flera valfrågor över 57 ämnen.

I GSM8K, som utvärderar grundskolematematikfrågor, uppnår Gemini Ultra 94,4%, vilket visar dess avancerade aritmetiska bearbetningsförmåga. I kodbenchmark, med Gemini Ultra som uppnår 74,4% i HumanEval för Python-kodgenerering, vilket indikerar dess starka programmeringsspråksförståelse.

DROP-benchmarken, som testar läsförståelse, ser Gemini Ultra leda med 82,4% poäng. Medan i en vanligt förnuft-resonemangstest, HellaSwag, presterar Gemini Ultra bra, men överträffar inte den extremt höga benchmark som satts av GPT-4.

Slutsats

Geminis unika arkitektur, driven av Googles senaste teknik, positionerar den som en formidabel spelare i AI-arenan, utmanar befintliga benchmark som satts av modeller som GPT-4. Dess versioner – Ultra, Pro och Nano – var och en tillgodoser specifika behov, från komplexa resonemangsaktiviteter till effektiva tillämpningar på enheten, vilket visar Googles engagemang för att göra avancerad AI tillgänglig över olika plattformar och enheter.

Integreringen av Gemini i Googles ekosystem, från Bard till Google Cloud Vertex, betonar dess potential att förbättra användarupplevelser över en mängd olika tjänster. Den lovar inte bara att förbättra befintliga applikationer utan också att öppna nya vägar för AI-drivna lösningar, antingen i personlig assistans, kreativa företag eller affärsanalys.

När vi ser framåt, understryker de kontinuerliga framstegen i AI-modeller som Gemini vikten av pågående forskning och utveckling. Utmaningarna med att träna sådana sofistikerade modeller och säkerställa deras etiska och ansvarsfulla användning förblir i förgrunden för diskussion.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.