AI-modeller og plattformer

Googles multimodale AI Gemini – En teknisk dybdeundersøkelse

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Google's First Multimodal Model: Gemini

Sundar Pichai, Googles CEO, sammen med Demis Hassabis fra Google DeepMind, har introdisert Gemini i desember 2023. Dette nye store språkmodell er integrert på tvers av Googles omfattende produktutvalg, og tilbyr forbedringer som går igjennom tjenester og verktøy brukt av millioner.

(GOOGL )

Gemini, Googles avanserte multimodale AI, er født fra de samarbeidende innsatsene fra de forente DeepMind og Brain AI-laboratoriene. Gemini står på skuldrene av sine forgjengere, og lover å levere en mer sammenhengende og intelligent samling av applikasjoner.

Annonsen av Google Gemini, som ligger tett etter debuterne av Bard, Duet AI og PaLM 2 LLM, markerer en tydelig intensjon fra Google til ikke bare å konkurrere, men å lede i AI-revolusjonen.

I motsetning til noen forestillinger om en AI-vinter, tyder lanseringen av Gemini på en blomstrende AI-vår, full av potensial og vekst. Mens vi reflekterer over et år siden fremveksten av ChatGPT, som selv var et banebrytende øyeblikk for AI, indikerer Googles trekk at industrien utvikling langt ifra er over; faktisk kan den bare være i ferd med å ta seg opp.

Hva er Gemini?

Googles Gemini-modell er i stand til å prosessere forskjellige datatyper som tekst, bilder, lyd og video. Den kommer i tre versjoner – Ultra, Pro og Nano – hver tilpasset bestemte anvendelser, fra komplekse resonneringer til på-enhet-bruk. Ultra utmerker seg i multifasetterte oppgaver og vil være tilgjengelig på Bard Advanced, mens Pro tilbyr en balanse mellom ytelse og ressurs-effektivitet, allerede integrert i Bard for tekst-prompter. Nano, optimalisert for på-enhet-utbredelse, kommer i to størrelser og har maskin-optimieringer som 4-bit-kvantifisering for offline-bruk i enheter som Pixel 8 Pro.

Geminis arkitektur er unik i sin native multimodale utgangsevne, ved å bruke diskrete bilde-token for bilde-generering og integrere lyd-funksjoner fra Universal Speech Model for nyansert lyd-forståelse. Dens evne til å håndtere video-data som sekvensielle bilder, sammenflettet med tekst eller lyd-innganger, eksemplifiserer dens multimodale dyktighet.

Gemini støtter sekvenser av tekst, bilde, lyd og video som innganger

Gemini støtter sekvenser av tekst, bilde, lyd og video som innganger

Tilgang til Gemini

Gemini 1.0 ruller ut på tvers av Googles økosystem, inkludert Bard, som nå drar nytte av de raffinerte evnene til Gemini Pro. Google har også integrert Gemini i sine Søk, Annonser og Duet-tjenester, og forbedrer brukeropplevelsen med raskere og mer nøyaktige svar.

For de som er interesserte i å utnytte evnene til Gemini, tilbyr Google AI Studio og Google Cloud Vertex tilgang til Gemini Pro, med den siste som tilbyr større tilpasning og sikkerhetsfunksjoner.

For å oppleve de forbedrede evnene til Bard, drevet av Gemini Pro, kan brukerne følge de følgende enkle trinnene:

  1. Naviger til Bard: Åpne din foretrukne nettleser og gå til Bard-nettstedet.
  2. Sikker innlogging: Tilgang til tjenesten ved å logge inn med din Google-konto, og sikre en sammenhengende og sikker opplevelse.
  3. Interaktivt chat: Du kan nå bruke Bard, hvor Gemini Pros avanserte funksjoner kan velges.

Kraften av multimodalitet:

I sin kjernelæring, bruker Gemini en transformer-basert arkitektur, lignende de som er brukt i suksessfulle NLP-modeller som GPT-3. Likevel ligger Geminis unikhet i dens evne til å prosessere og integrere informasjon fra flere modaliteter, inkludert tekst, bilder og kode. Dette oppnås gjennom en ny teknikk kalt cross-modale oppmerksomhet, som tillater modellen å lære relasjoner og avhengigheter mellom forskjellige typer data.

Her er en oppsummering av Geminis nøkkelkomponenter:

  • Multimodal encoder: Denne modulen prosesserer inndata fra hver modalitet (f.eks. tekst, bilde) uavhengig, og trekker ut relevante funksjoner og genererer enkelt-representasjoner.
  • Cross-modale oppmerksomhetsnettverk: Dette nettverket er hjertet av Gemini. Det tillater modellen å lære relasjoner og avhengigheter mellom de forskjellige representasjonene, og muliggjør at de kan “snakke” sammen og berike sin forståelse.
  • Multimodal decoder: Denne modulen bruker de berikede representasjonene generert av cross-modale oppmerksomhetsnettverket til å utføre forskjellige oppgaver, som bilde-underskrift, tekst-til-bilde-generering og kode-generering.

Gemini-modellen er ikke bare om å forstå tekst eller bilder – det handler om å integrere forskjellige typer informasjon på en måte som er mye nærmere hvordan vi, som mennesker, oppfatter verden. For eksempel kan Gemini se på en sekvens av bilder og bestemme den logiske eller romlige rekkefølgen av objekter inni dem. Den kan også analysere design-funksjonene til objekter for å gjøre dommer, som hvilken av to biler som har en mer aerodynamisk form.

Men Geminis talenter går langt utenfor bare visuell forståelse. Den kan omdanne en sett av instruksjoner til kode, og skape praktiske verktøy som en nedtellingstimer som ikke bare fungerer som instruert, men også inkluderer kreative elementer, som motivasjonsemoter, for å forbedre brukerinteraksjonen. Dette indikerer en evne til å håndtere oppgaver som krever en blanding av kreativitet og funksjonalitet – ferdigheter som ofte anses som distinkt menneskelige.

Geminis evner : Romlig resonnering

Geminis evner : Romlig resonnering (Kilde)

 

Geminis evner utvides til å utføre programmeringsoppgaver

Geminis evner utvides til å utføre programmeringsoppgaver (Kilde)

Geminis sofistikerte design er basert på en rik historie av nevralt nettverksforskning og utnytter Googles banebrytende TPU-teknologi for trening. Gemini Ultra har særlig satt nye standarder i flere AI-domener, og viser bemerkelsesverdige ytelsesforbedringer i multimodale resonneringsoppgaver.

Med dens evne til å parse gjennom og forstå kompleks data, tilbyr Gemini løsninger for virkelige anvendelser, særlig i utdanning. Den kan analysere og korrigere løsninger på problemer, som i fysikk, ved å forstå håndskrevne notater og gi nøyaktige matematiske typesetting. Slike evner antyder en fremtid hvor AI assisterer i utdanningsmiljøer, og tilbyr studenter og lærere avanserte verktøy for læring og problemløsning.

Geminis har blitt brukt til å skape agenter som AlphaCode 2, som utmerker seg i konkurranse-programmeringsproblemer. Dette viser Geminis potensial til å fungere som en generalist AI, i stand til å håndtere komplekse, multi-trinn problemer.

Gemini Nano bringer kraften av AI til hverdagsenheter, og beholder imponerende evner i oppgaver som sammenfatting og leseforståelse, samt kode- og STEM-relaterte utfordringer. Disse mindre modellene er finjustert for å tilby høykvalitets AI-funksjoner på lav-minne-enheter, og gjør avansert AI mer tilgjengelig enn noensinne.

Utviklingen av Gemini involverte innovasjoner i treningsalgoritmer og infrastruktur, og utnytter Googles siste TPUs. Dette tillot effektiv skalerbarhet og robuste treningsprosesser, og sikrer at selv de minste modellene leverer eksepsjonell ytelse.

Treningsdatasettet for Gemini er like diversifisert som dens evner, og inkluderer webdokumenter, bøker, kode, bilder, lyd og video. Dette multimodale og flerspråklige datasett sikrer at Gemini-modellene kan forstå og prosessere en bred variasjon av innholdstyper effektivt.

Gemini og GPT-4

Til tross for fremveksten av andre modeller, er spørsmålet på alle sine sinn hvordan Googles Gemini sammenlignes med OpenAIs GPT-4, bransjens benchmark for nye LLM-er. Googles data antyder at mens GPT-4 kan utmerke seg i sunn fornuft-resonneringsoppgaver, har Gemini Ultra overtaket i nesten alle andre områder.

Gemini VS GPT-4

Gemini VS GPT-4

Ovenfor benchmark-tabellen viser den imponerende ytelsen til Googles Gemini AI på tvers av en rekke oppgaver. Merkverdig har Gemini Ultra oppnådd bemerkelsesverdige resultater i MMLU-benchmarken med 90,04% nøyaktighet, og indikerer dens overlegne forståelse i flervalgs-spørsmål på tvers av 57 emner.

I GSM8K, som vurderer grunnskole-matematikk-spørsmål, scorer Gemini Ultra 94,4%, og viser dens avanserte aritmetiske prosesseringsferdigheter. I kode-benchmark, oppnår Gemini Ultra en score på 74,4% i HumanEval for Python-kode-generering, og indikerer dens sterke programmeringsspråk-forståelse.

DROP-benchmarken, som tester leseforståelse, ser Gemini Ultra igjen lede med en score på 82,4%. I et sunn fornuft-resonneringstest, HellaSwag, utfører Gemini Ultra merkelig, selv om den ikke overgår den ekstremt høye benchmark satt av GPT-4.

Konklusjon

Geminis unike arkitektur, drevet av Googles banebrytende teknologi, stiller den som en formidabel spiller i AI-arenaen, og utfordrer eksisterende benchmark- standarder satt av modeller som GPT-4. Dens versjoner – Ultra, Pro og Nano – hver tilpasset bestemte behov, fra komplekse resonneringsoppgaver til effektive på-enhet-applikasjoner, viser Googles engasjement for å gjøre avansert AI tilgjengelig på tvers av ulike plattformer og enheter.

Integreringen av Gemini i Googles økosystem, fra Bard til Google Cloud Vertex, understreker dens potensial til å forbedre brukeropplevelser på tvers av en rekke tjenester. Den lover ikke bare å forfine eksisterende applikasjoner, men også å åpne nye veier for AI-drevne løsninger, enten i personlig assistanse, kreative innsats eller forretningsanalyse.

Mens vi ser fremover, understreker de kontinuerlige fremstegene i AI-modeller som Gemini viktigheten av pågående forskning og utvikling. Utfordringene med å trene slike sofistikerte modeller og sikre deres etiske og ansvarlige bruk, forblir i forkant av diskusjonen.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.