AI-modeller og plattformer

ChatGPTs første årsdag: Omdefinering av fremtiden for AI-interaksjon

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Etter å ha reflektert over ChatGPTs første år, er det tydelig at dette verktøyet har forandret AI-landskapet betydelig. Lansert mot slutten av 2022, sto ChatGPT ut på grunn av sin brukervennlige og konversasjonelle stil som gjorde det å interagere med AI mer som å snakke med en person enn en maskin. Denne nye tilnærmingen fanget raskt offentlighetens øye. Bare fem dager etter lanseringen, hadde ChatGPT allerede tiltrekt seg en million brukere. Tidlig i 2023 hadde dette tallet blåst opp til omkring 100 millioner månedlige brukere, og til oktober var plattformen i ferd med å trekke inn rundt 1,7 milliarder besøk verden over. Disse tallene taler for seg selv om populariteten og nyttighetene.

Over det siste året har brukerne funnet alle mulige kreative måter å bruke ChatGPT, fra enkle oppgaver som å skrive e-poster og oppdatere CV-er til å starte suksessfulle bedrifter. Men det handler ikke bare om hvordan folk bruker det; teknologien selv har vokst og forbedret seg. Opprinnelig var ChatGPT en gratis tjeneste som tilbød detaljerte tekstresponser. Nå finnes det ChatGPT Plus, som inkluderer ChatGPT-4. Denne oppdaterte versjonen er trent på mer data, gir færre feilresponser og forstår komplekse instruksjoner bedre.

En av de største oppdateringene er at ChatGPT nå kan interagere på flere måter – det kan lytte, snakke og sogar prosessere bilder. Dette betyr at du kan snakke med det gjennom mobilappen og vise det bilder for å få responser. Disse endringene har åpnet opp nye muligheter for AI og har forandret hvordan folk ser på og tenker om AI-rolle i våre liv.

Fra begynnelsen som en teknisk demo til sin nåværende status som en stor spiller i teknologiverden, er ChatGPTs reise ganske imponerende. Opprinnelig ble det sett på som en måte å teste og forbedre teknologien ved å få tilbakemeldinger fra offentligheten. Men det ble raskt en essensiell del av AI-landskapet. Dette suksessen viser hvor effektivt det er å finjustere store språkmodeller (LLM) med både overvåket læring og tilbakemeldinger fra mennesker. Som et resultat kan ChatGPT håndtere et bredt spekter av spørsmål og oppgaver.

Konkurransen om å utvikle de mest kapable og fleksible AI-systemene har ført til en proliferasjon av både åpne og proprietære modeller som ChatGPT. For å forstå deres generelle evner, kreves omfattende benchmarking over et bredt spekter av oppgaver. Denne delen utforsker disse benchmarkene og kaster lys over hvordan ulike modeller, inkludert ChatGPT, sammenlignes med hverandre.

Evaluering av LLM: Benchmarkene

  1. MT-Bench: Denne benchmarken tester multi-turn konversasjon og instruksjonsfølging over åtte domener: skriving, rollespill, informasjonsutvinning, resonnering, matematikk, kode, STEM-kunnskap og humaniora/samfunnsvitenskap. Større LLM-er som GPT-4 brukes som evalueringer.
  2. AlpacaEval: Basert på AlpacaFarm-evalueringssettet, denne LLM-baserte automatiske evalueringen benchmarker modeller mot responser fra avanserte LLM-er som GPT-4 og Claude, og beregner seiersprosenten for kandidatmodellene.
  3. Åpen LLM-lederliste: Ved å bruke Language Model Evaluation Harness, denne ledertabellen evaluerer LLM-er på syv nøkkelbenchmarks, inkludert resonneringsutfordringer og generell kunnskapstest, i både nullskudd og fåskuddssettinger.
  4. BIG-bench: Denne samarbeidsbenchmarken dekker over 200 nye språkoppgaver, som spenner over et diversifisert spekter av emner og språk. Den søker å undersøke LLM-er og forutsi deres fremtidige evner.
  5. ChatEval: En multi-agent debatt-ramme som tillater team å diskutere og evaluere kvaliteten på responser fra ulike modeller på åpne spørsmål og tradisjonelle naturlige språkgenereringsoppgaver.

Sammenlignende ytelse

I forhold til generelle benchmark, har åpne LLM-er vist betydelig fremgang. Llama-2-70B, for eksempel, oppnådde imponerende resultater, spesielt etter å ha blitt finjustert med instruksjonsdata. Dets variant, Llama-2-chat-70B, utmerket seg i AlpacaEval med en seiersprosent på 92,66%, og overgikk GPT-3.5-turbo. Likevel forble GPT-4 frontløperen med en seiersprosent på 95,28%.

Zephyr-7B, en mindre modell, viste evner sammenlignbare med større 70B LLM-er, spesielt i AlpacaEval og MT-Bench. I mellomtiden scoret WizardLM-70B, finjustert med en diversifisert rekke instruksjonsdata, høyest blant åpne LLM-er på MT-Bench. Likevel lå den fortsatt bak GPT-3.5-turbo og GPT-4.

En interessant inngang, GodziLLa2-70B, oppnådde en konkurrerende score på den åpne LLM-lederlisten, og viste potensialet for eksperimentelle modeller som kombinerer diverse datasett. Liksom Yi-34B, utviklet fra scratch, sto ut med resultater sammenlignbare med GPT-3.5-turbo og bare litt bak GPT-4.

UltraLlama, med sin finjustering på diversifisert og høykvalitetsdata, matchet GPT-3.5-turbo i sine foreslåtte benchmark, og overgikk den sogar i områder som verdens- og profesjonell kunnskap.

Skalering opp: Oppblomstringen av kjempe-LLM-er

LLM-modeller

Topp LLM-modeller siden 2020

En merkbart trend i LLM-utvikling har vært å øke modellparametere. Modeller som Gopher, GLaM, LaMDA, MT-NLG og PaLM har presset grensene, og kulminert i modeller med opp til 540 milliarder parametre. Disse modellene har vist eksepsjonelle evner, men deres lukkede kildekode har begrenset deres videre anvendelse. Dette har utløst interesse for å utvikle åpne LLM-er, en trend som vokser i momentum.

I parallell med å øke modellstørrelser, har forskerne utforsket alternative strategier. I stedet for bare å gjøre modellene større, har de fokusert på å forbedre fortrening av mindre modeller. Eksempler inkluderer Chinchilla og UL2, som har vist at mer ikke alltid er bedre; smartere strategier kan gi effektive resultater også. Videre har det vært betydelig fokus på instruksjonstuning av språkmodeller, med prosjekter som FLAN, T0 og Flan-T5 som har gjort betydelige bidrag til dette området.

ChatGPT-katalysatoren

Introduksjonen av OpenAIs ChatGPT markerte et vendepunkt i NLP-forskning. For å konkurrere med OpenAI, lanserte selskaper som Google (GOOGL ) og Anthropic sine egne modeller, Bard og Claude, henholdsvis. Mens disse modellene viser sammenlignbare resultater med ChatGPT i mange oppgaver, ligger de fortsatt bak den siste modellen fra OpenAI, GPT-4. Suksessen til disse modellene skyldes primært forsterket læring fra menneskelig tilbakemelding (RLHF), en teknikk som mottar økt forskningsfokus for videre forbedring.

Rykter og spekulasjoner omkring OpenAIs Q* (Q-Stjerne)

Nylige rapporter antyder at forskere ved OpenAI kan ha oppnådd en betydelig fremgang i AI med utviklingen av en ny modell kalt Q* (uttalt Q-stjerne). Ifølge påstandene har Q* evnen til å utføre matematikk på skole-nivå, en bragd som har utløst diskusjoner blant eksperter om dens potensiale som en milepæl mot kunstig generell intelligens (AGI). Mens OpenAI ikke har kommentert på disse rapportene, har de antatte evnene til Q* generert betydelig spenning og spekulasjoner på sosiale medier og blant AI-entusiaster.

Utviklingen av Q* er merkbart fordi eksisterende språkmodeller som ChatGPT og GPT-4, selv om de er i stand til å utføre noen matematisk oppgaver, er ikke spesielt dyktige til å håndtere dem pålitelig. Utfordringen ligger i behovet for AI-modeller å ikke bare gjenkjenne mønster, som de gjør gjennom dypt læring og transformatorer, men også å resonnere og forstå abstrakte konsepter. Matematikk, som en benchmark for resonnering, krever at AI-modellen planlegger og utfører flere steg, og demonstrerer en dypt forståelse av abstrakte konsepter. Denne evnen ville markere en betydelig sprang i AI-evner, potensielt utvidet utenfor matematikk til andre komplekse oppgaver.

Likevel advarer eksperter mot å overhyppe denne utviklingen. Mens en AI-system som pålitelig løser matematisk oppgaver ville være en imponerende bragd, signaliserer det ikke nødvendigvis ankomsten av superintelligent AI eller AGI. Nåværende AI-forskning, inkludert innsatsen fra OpenAI, har fokusert på enkle problemer, med varierende grad av suksess i mer komplekse oppgaver.

Potensielle anvendelser av fremgang som Q* er enorme, spennende fra personlig veiledning til å assistere i vitenskapelig forskning og ingeniørarbeid. Likevel er det viktig å håndtere forventninger og erkjenne begrensningene og sikkerhetsproblemer forbundet med slike fremgang. Bekymringene om AI som utgjør eksistensielle risiko, en grunnleggende bekymring for OpenAI, forblir relevante, spesielt når AI-systemer begynner å samhandle mer med den virkelige verden.

Den åpne LLM-bevegelsen

For å fremme åpen LLM-forskning, lanserte Meta Llama-serien modeller, utløsende en bølge av nye utviklinger basert på Llama. Dette inkluderer modeller finjustert med instruksjonsdata, som Alpaca, Vicuna, Lima og WizardLM. Forskningen utvider seg også til å forbedre agentkapasiteter, logisk resonnering og lang-kontekstmodellering innenfor Llama-rammen.

Videre er det en voksende trend å utvikle kraftfulle LLM-er fra scratch, med prosjekter som MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok og Yi. Disse innsatsene reflekterer en kompromiss for å demokratisere evnene til lukkede LLM-er, og gjøre avanserte AI-verktøy mer tilgjengelige og effektive.

Påvirkningen av ChatGPT og åpne kilde-modeller i helsevesenet

Vi ser frem til en fremtid hvor LLM-er assisterer i klinisk notat-takning, skjema-fylling for refusjoner og støtter leger i diagnose og behandlingsplanlegging. Dette har fanget oppmerksomheten til både teknologigigantene og helseinstitusjonene.

Microsofts diskusjoner med Epic, en ledende elektronisk helsejournal-programvareleverandør, signaliserer integreringen av LLM-er i helsevesenet. Initiativer er allerede i gang ved UC San Diego Health og Stanford University Medical Center. Liksom Googles samarbeid med Mayo Clinic og Amazon (AMZN ) Web Services’ lansering av HealthScribe, en AI-klinisk dokumentasjonstjeneste, markerer betydelige skritt i denne retningen.

Likevel reiser disse raske utviklingene bekymringer om å overlate kontrollen over medisin til kommersielle interesser. Den lukkede naturen til disse LLM-ene gjør dem vanskelige å evaluere. Deres mulige modifisering eller avslutning for lønnsomhetsårsaker kunne kompromittere pasientomsorg, personvern og sikkerhet.

Den presserende behov er for en åpen og inklusiv tilnærming til LLM-utvikling i helsevesenet. Helseinstitusjoner, forskere, kliniske ansatte og pasienter må samarbeide globalt for å bygge åpne LLM-er for helsevesenet. Denne tilnærmingen, lik den Trillion Parameter Consortium, ville tillate pooling av beregnings-, finansielle ressurser og ekspertise.

Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.