AI-modeller og platforme

ChatGPT’s Første Årsdag: Omformning af Fremtiden for AI-Interaktion

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da vi ser tilbage på ChatGPT’s første år, er det tydeligt, at dette værktøj har ændret AI-scenen betydeligt. Lanceret i slutningen af 2022, udgjorde ChatGPT sig selv på grund af sin brugervenlige og konversationelle stil, der gjorde det til at interagere med AI mere som at chatte med en person end en maskine. Denne nye tilgang fik hurtigt offentlighedens opmærksomhed. Inden for blot fem dage efter udgivelsen havde ChatGPT allerede tiltrukket en million brugere. I begyndelsen af 2023 var dette tal steget til omkring 100 millioner månedlige brugere, og i oktober var platformen tiltrukket omkring 1,7 milliarder besøg verden over. Disse tal taler for sig selv om dets popularitet og nyttighed.

Over det sidste år har brugerne fundet alle mulige kreative måder at bruge ChatGPT på, fra simple opgaver som at skrive e-mails og opdatere CV’er til at starte succesfulde virksomheder. Men det handler ikke kun om, hvordan folk bruger det; teknologien selv er vokset og forbedret. Til at begynde med var ChatGPT en gratis tjeneste, der tilbød detaljerede tekstsvare. Nu er der ChatGPT Plus, som inkluderer ChatGPT-4. Denne opdaterede version er trænet på mere data, giver færre forkerte svar og forstår komplekse instruktioner bedre.

En af de største opdateringer er, at ChatGPT nu kan interagere på flere måder – det kan lytte, tale og sogar behandle billeder. Dette betyder, at du kan tale med det gennem dets mobile app og vise det billeder for at få svar. Disse ændringer har åbnet op for nye muligheder for AI og har ændret, hvordan folk ser på og tænker om AI’s rolle i vores liv.

Fra dens begyndelse som en teknisk demo til dens nuværende status som en stor spiller i tech-verdenen er ChatGPT’s rejse ret imponerende. Til at begynde med blev det set som en måde at teste og forbedre teknologien ved at få feedback fra offentligheden. Men det blev hurtigt en essentiel del af AI-landskabet. Denne succes viser, hvor effektivt det er at finjustere store sprogmodeller (LLM’er) med både overvåget læring og feedback fra mennesker. Som resultat kan ChatGPT håndtere et bredt spektrum af spørgsmål og opgaver.

Kapløbet om at udvikle de mest kapable og fleksible AI-systemer har ført til en udvikling af både open-source- og proprietære modeller som ChatGPT. For at forstå deres generelle evner kræver det omfattende benchmarks på tværs af et bredt spektrum af opgaver. Dette afsnit udforsker disse benchmarks og kaster lys over, hvordan forskellige modeller, herunder ChatGPT, sammenlignes med hinanden.

Evaluering af LLM’er: Benchmarkene

  1. MT-Bench: Denne benchmark tester multi-turn konversation og instruktionsfølgen på tværs af otte domæner: skrivning, rolleleg, informationsudtrækning, resonnering, matematik, kodning, STEM-kundskab og humaniora/samfundsvidenskab. Stærkere LLM’er som GPT-4 bruges som evalueringer.
  2. AlpacaEval: Baseret på AlpacaFarm-evalueringssættet, denne LLM-baserede automatiske evaluator benchmark-modeller mod svar fra avancerede LLM’er som GPT-4 og Claude, beregner sejrsprocenten for kandidatmodeller.
  3. Open LLM Leaderboard

    : Ved hjælp af Language Model Evaluation Harness, denne leaderboard evaluerer LLM’er på syv nøglebenchmarks, herunder resonneringsudfordringer og generelle kundskabsprøver, i både zero-shot og few-shot-indstillinger.
  4. BIG-bench: Denne samarbejdsbenchmark dækker over 200 nye sprogopgaver, der spænder over en bred vifte af emner og sprog. Den søger at undersøge LLM’er og forudsige deres fremtidige evner.
  5. ChatEval: En multi-agent-debatsramme, der tillader hold at diskutere og evaluere kvaliteten af svar fra forskellige modeller på åbne spørgsmål og traditionelle naturlige sproggenereringsopgaver.

Sammenlignende Præstation

I forhold til generelle benchmarks har open-source LLM’er vist betydelig fremgang. Llama-2-70B, for eksempel, opnåede imponerende resultater, især efter at være finjusteret med instruktionsdata. Dens variant, Llama-2-chat-70B, excellerede i AlpacaEval med en sejrsprocent på 92,66%, overgående GPT-3.5-turbo. Men GPT-4 forbliver frontløberen med en sejrsprocent på 95,28%.

Zephyr-7B, en mindre model, demonstrerede evner, der var sammenlignelige med større 70B LLM’er, især i AlpacaEval og MT-Bench. Imens WizardLM-70B, finjusteret med en bred vifte af instruktionsdata, scorede højest blandt open-source LLM’er på MT-Bench. Men den lå stadig bagud i forhold til GPT-3.5-turbo og GPT-4.

En interessant indgang, GodziLLa2-70B, opnåede en konkurrencedygtig score på Open LLM Leaderboard, hvilket viser potentialet for eksperimentelle modeller, der kombinerer diverse datasæt. Ligeledes stod Yi-34B, udviklet fra scratch, frem med score, der var sammenlignelige med GPT-3.5-turbo og kun lidt bagud i forhold til GPT-4.

UltraLlama, med sin finjustering på diverse og højkvalitetsdata, matchede GPT-3.5-turbo i dens foreslåede benchmarks og overgik endda den i områder som verdens- og professionel viden.

Skalering Op: Stigningen af Kæmpe LLM’er

LLM-modeller

Top LLM-modeller siden 2020

En bemærkelsesværdig trend i LLM-udviklingen har været skaleringen af modelparametre. Modeller som Gopher, GLaM, LaMDA, MT-NLG og PaLM har presset grænserne, kulminerende i modeller med op til 540 milliarder parametre. Disse modeller har vist ekstraordinære evner, men deres lukkede kildekode har begrænset deres bredere anvendelse. Dette har fremmet interesse for at udvikle open-source LLM’er, en trend, der er i fremgang.

I parallel med at skale modelstørrelser op, har forskere udforsket alternative strategier. I stedet for bare at gøre modellerne større, har de fokuseret på at forbedre fortræningen af mindre modeller. Eksempler herpå inkluderer Chinchilla og UL2, som har vist, at mere ikke altid er bedre; smartere strategier kan give effektive resultater. Derudover har der været betydelig opmærksomhed på instruktionsafstemning af sprogmodeller, med projekter som FLAN, T0 og Flan-T5, der har bidraget væsentligt til dette område.

ChatGPT-Katalysatoren

Introduktionen af OpenAI’s ChatGPT markerede et vendepunkt i NLP-forskning. For at konkurrere med OpenAI, lancerede virksomheder som Google (GOOGL ) og Anthropic deres egne modeller, Bard og Claude, henholdsvis. Selv om disse modeller viser sammenlignelige præstationer med ChatGPT i mange opgaver, ligger de stadig bagud i forhold til den seneste model fra OpenAI, GPT-4. Succesen med disse modeller tilskrives primært forstærket læring fra menneskefeedback (RLHF), en teknik, der modtager øget forskningsfokus til yderligere forbedring.

Rygter og Spekulationer Omkring OpenAI’s Q* (Q-Stjerne)

Seneste rapporter antyder, at forskere ved OpenAI måske har opnået en betydelig fremgang i AI med udviklingen af en ny model kaldet Q* (udtalt Q-stjerne). Ifølge rygterne har Q* evnen til at udføre matematik på grundskoleniveau, en bedrift, der har ført til diskussioner blandt eksperter om dets potentiale som et milepæl mod kunstig almen intelligens (AGI). Selv om OpenAI ikke har kommenteret på disse rapporter, har de formodede evner af Q* genereret betydelig ophidselse og spekulation på sociale medier og blandt AI-entusiaster.

Udviklingen af Q* er bemærkelsesværdig, fordi eksisterende sprogmodeller som ChatGPT og GPT-4, selv om de er i stand til at udføre visse matematiske opgaver, ikke er særlig dygtige til at håndtere dem pålideligt. Udfordringen ligger i behovet for, at AI-modeller ikke kun kan genkende mønstre, som de gør i øjeblikket gennem dyb læring og transformers, men også kan resonere og forstå abstrakte begreber. Matematik, der er en benchmark for resonnering, kræver, at AI-planen og udfører multiple trin, hvilket demonstrerer en dyb forståelse af abstrakte begreber. Denne evne ville markere et betydeligt spring i AI-kapaciteter, muligvis udover matematik til andre komplekse opgaver.

Ekspertne advarer imidlertid mod at overhyppe denne udvikling. Selv om et AI-system, der pålideligt løser matematiske problemer, ville være en imponerende præstation, signalerer det ikke nødvendigvis ankomsten af superintelligent AI eller AGI. Nuværende AI-forskning, herunder OpenAI’s bestræbelser, har fokuseret på grundlæggende problemer med varierende grad af succes i mere komplekse opgaver.

De potentielle anvendelser af fremskridt som Q* er enorme, spændende fra personlig undervisning til at assistere i videnskabelig forskning og ingeniørarbejde. Det er dog vigtigt at håndtere forventninger og erkende begrænsningerne og sikkerhedsproblemerne forbundet med sådanne fremskridt. Bekymringen om, at AI udgør eksistentielle risici, en grundlæggende bekymring for OpenAI, forbliver relevant, især da AI-systemer begynder at interface mere med den virkelige verden.

Open-Source LLM-Bevægelsen

For at fremme open-source LLM-forskning udgav Meta Llama-serien modeller, hvilket udløste en bølge af nye udviklinger baseret på Llama. Dette inkluderer modeller finjusteret med instruktionsdata, såsom Alpaca, Vicuna, Lima og WizardLM. Forskningen udvider sig også til at forbedre agentkapaciteter, logisk resonnering og lang-kontekstmodellering inden for Llama-rammen.

Derudover er der en voksende trend i udviklingen af kraftfulde LLM’er fra scratch, med projekter som MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok og Yi. Disse bestræbelser afspejler en tilgang til at demokratisere de avancerede AI-værktøjs kapaciteter, gøre dem mere tilgængelige og effektive.

ChatGPT’s og Open Source-Modellerne’s Indvirkning på Sundhedssektoren

Vi ser frem til en fremtid, hvor LLM’er kan assistere i kliniske notater, formularer til refusion og støtte læger i diagnose og behandlingsplanlægning. Dette har fanget både tech-giganter og sundhedsinstitutioners opmærksomhed.

Microsofts diskussioner med Epic, en førende softwareudbyder af elektroniske sundhedsjournaler, signalerer integrationen af LLM’er i sundhedssektoren. Initiativer er allerede i gang på UC San Diego Health og Stanford University Medical Center. Ligeledes har Googles samarbejde med Mayo Clinic og Amazon (AMZN ) Web Services’ lancering af HealthScribe, en AI-baseret klinisk dokumentationstjeneste, markerer betydelige skridt i denne retning.

Men disse hurtige udrulninger vækker bekymring om at overgive kontrol over medicin til kommercielle interesser. Den proprietære natur af disse LLM’er gør dem svære at evaluere. Deres mulige ændring eller afbrydelse af profitable årsager kunne kompromittere patientpleje, privatliv og sikkerhed.

Den presserende behov er en åben og inklusiv tilgang til LLM-udvikling i sundhedssektoren. Sundhedsinstitutioner, forskere, kliniske specialister og patienter må samarbejde globalt om at bygge open-source LLM’er til sundhedssektoren. Denne tilgang, lignende Trillion Parameter Consortium, ville tillade puljen af computermæssige, finansielle ressourcer og ekspertise.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.