Tankeledere

Benchmark til LLM’er

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

ForstÃĨ rolle og begrÃĶnsninger af benchmarks i LLM-ydelsesevaluering. Udforsk teknikker til udvikling af robuste LLM’er.

Large Language Models har fÃĨet enorm popularitet de seneste ÃĨr. Jeg mener, du har set det. LLM’ers exceptionelle evne til at forstÃĨ menneskesprog har gjort dem til den perfekte integration for virksomheder, der understÃļtter kritiske arbejdsgange og automatiserer opgaver til maksimal effektivitet. Plus, ud over den gennemsnitlige brugers forstÃĨelse, kan LLM’er gÃļre meget mere. Og da vores afhÃĶngighed af dem vokser, mÃĨ vi virkelig vÃĶre mere opmÃĶrksomme pÃĨ mÃĨder at sikre nÃļdvendig nÃļjagtighed og pÃĨlidelighed. Dette er en global opgave, der vedrÃļrer hele institutioner, men i virksomhedsverdenen findes der nu flere benchmarks, der kan bruges til at evaluere LLM’ers ydelse pÃĨ tvÃĶrs af forskellige domÃĶner. Disse kan teste modellens evner i forstÃĨelse, logisk tÃĶnkning, matematik og sÃĨ videre, og resultaterne afgÃļr, om en LLM er klar til virksomhedsudvikling.

I denne artikel har jeg samlet en omfattende liste over de mest populÃĶre benchmarks til LLM-evaluering. Vi vil diskutere hver benchmark i detaljer og se, hvordan forskellige LLM’er klarer sig i forhold til evalueringens kriterier. Men fÃļrst lad os forstÃĨ LLM-evaluering i mere detaljer.

Hvad er LLM-evaluering?

Ligesom andre AI-modeller har LLM’er ogsÃĨ brug for at blive evalueret i forhold til bestemte benchmarks, der vurderer forskellige aspekter af sprogmodellens ydelse: viden, nÃļjagtighed, pÃĨlidelighed og konsistens. Standarden indebÃĶrer normalt:

  1. ForstÃĨelse af brugerforespÃļrgsler: Vurdering af modellens evne til at forstÃĨ og fortolke en bred vifte af brugerinput.
  2. Verificering af output: Verificering af AI-genererede svar mod en pÃĨlidelig videnbas for at sikre, at de er korrekte og relevante.
  3. Robusthed: MÃĨling af, hvor godt modellen klarer sig med tvetydige, ufuldstÃĶndige eller stÃļjende input.

LLM-evaluering giver udviklere mulighed for at identificere og lÃļse begrÃĶnsninger effektivt, sÃĨ de kan forbedre den samlede brugeroplevelse. Hvis en LLM bliver grundigt evalueret, vil den vÃĶre nÃļjagtig og robust nok til at hÃĨndtere forskellige virkelige anvendelser, selv dem med tvetydige eller uventede input.

Benchmarks

LLM’er er en af de mest komplekse teknologier til dato og kan aktivere selv de mest komplekse applikationer. SÃĨ evalueringen skal vÃĶre lige sÃĨ kompleks og teste tankeprocessen og teknisk nÃļjagtighed.

En benchmark bruger bestemte datasÃĶt, metrikker og evalueringstasks til at teste LLM-ydelse og giver mulighed for at sammenligne forskellige LLM’er og mÃĨle deres nÃļjagtighed, hvilket driver fremgang i branchen ved forbedret ydelse.

Her er nogle af de mest typiske aspekter af LLM-ydelse:

  • Viden: Modellens viden skal testes pÃĨ tvÃĶrs af forskellige domÃĶner. Det er, hvad viden-benchmarken er til. Den vurderer, hvor effektivt modellen kan huske information fra forskellige fagomrÃĨder som fysik, programmering, geografi osv.
  • Logisk tÃĶnkning: Det indebÃĶrer at teste en modells evne til at “tÃĶnke” skridt for skridt og udlede en logisk konklusion, hvilket normalt indebÃĶrer scenarier, hvor modellen skal vÃĶlge den mest plausiblen fortsÃĶttelse eller forklaring baseret pÃĨ hverdagskundskab og logisk tÃĶnkning.
  • LÃĶseforstÃĨelse: Modellerne skal vÃĶre fremragende til at fortolke naturligt sprog og generere svar derefter. Testen ligner at besvare spÃļrgsmÃĨl baseret pÃĨ passager for at vurdere forstÃĨelse, slutning og detaljerede oplysninger. Ligesom en skolelÃĶseprÃļve.
  • ForstÃĨelse af kode: Dette er nÃļdvendigt for at mÃĨle en modells dygtighed i at forstÃĨ, skrive og fejlfinde kode. Disse benchmarks giver modellen kodningsopgaver eller problemer, som modellen skal lÃļse korrekt, ofte dÃĶkkende et bredt udvalg af programmeringssprog og paradigmer.
  • Verdenskundskab: For at vurdere modellens greb om almindelig viden om verden. Disse datasÃĶt har normalt spÃļrgsmÃĨl, der krÃĶver bred, encyklopÃĶdisk viden for at blive besvaret korrekt, hvilket gÃļr dem forskellige fra mere specifik og specialiseret viden-benchmarks.

“Viden”-benchmarks

MMLU (Multimodal Language Understanding)

Denne benchmark er designet til at teste LLM’ens greb om faktuel viden pÃĨ tvÃĶrs af forskellige emner som humaniora, samfundsvidenskab, historie, datalogi og endda jura. 57 spÃļrgsmÃĨl og 15.000 opgaver, alle rettet mod at sikre, at modellen har fremragende tÃĶnkningsevner. Dette gÃļr MMLU til et godt vÃĶrktÃļj til at vurdere en LLM’s faktuelle viden og tÃĶnkning i forhold til forskellige emner.

For nylig er det blevet en nÃļgle-benchmark for at evaluere LLM’er i ovennÃĶvnte omrÃĨder. Udviklere Ãļnsker altid at optimere deres modeller for at overgÃĨ andre i denne benchmark, hvilket gÃļr det til en de facto-standard for at evaluere avanceret tÃĶnkning og viden i LLM’er. Store, virksomheds-klasse-modeller har vist imponerende resultater pÃĨ denne benchmark, herunder GPT-4-omni pÃĨ 88,7%, Claude 3 Opus pÃĨ 86,8%, Gemini 1,5 Pro pÃĨ 85,9% og Llama-3 70B pÃĨ 82%. SmÃĨ modeller klarer sig normalt ikke sÃĨ godt pÃĨ denne benchmark, hvor de sjÃĶldent overstiger 60-65%, men den seneste prÃĶstation af Phi-3-Small-7b pÃĨ 75,3% er noget at tÃĶnke over.

Men MMLU er ikke uden ulemper: Den har kendte problemer som tvetydige spÃļrgsmÃĨl, forkerte svar og manglende kontekst. Og mange mener, at nogle af dens opgaver er for lette til en ordentlig LLM-evaluering.

Jeg vil gerne gÃļre det klart, at benchmarks som MMLU ikke perfekt afspejler virkelige scenarier. Hvis en LLM opnÃĨr et stort score pÃĨ denne, betyder det ikke altid, at den er blevet en fagekspert. Benchmarks er ret begrÃĶnsede i omfang og afhÃĶnger ofte af multiple-choice-spÃļrgsmÃĨl, som aldrig fuldt ud kan fange kompleksiteten og konteksten af virkelige interaktioner. Sand forstÃĨelse krÃĶver at kende fakta og anvende denne viden dynamisk, og det indebÃĶrer kritisk tÃĶnkning, problemlÃļsning og kontekstforstÃĨelse. Derfor skal LLM’er konstant forbedres og opdateres, sÃĨ modellen fastholder benchmarkets relevans og effektivitet.

GPQA (Graduate-Level Google-Proof Q&A Benchmark)

Denne benchmark vurderer LLM’er pÃĨ logisk tÃĶnkning ved hjÃĶlp af en datasÃĶt med kun 448 spÃļrgsmÃĨl. DomÃĶne-eksperter har udviklet det og dÃĶkker emner inden for biologi, fysik og kemi.

Hvert spÃļrgsmÃĨl gÃĨr igennem fÃļlgende valideringsproces:

  1. En ekspert i samme emne besvarer spÃļrgsmÃĨlet og giver detaljeret feedback.
  2. SpÃļrgsmÃĨlsforfatteren reviderer spÃļrgsmÃĨlet baseret pÃĨ denne feedback.
  3. En anden ekspert besvarer det reviderede spÃļrgsmÃĨl.

Denne proces kan faktisk sikre, at spÃļrgsmÃĨlene er objektive, nÃļjagtige og udfordrende for en sprogmodel. Selv erfarne PhD-studerende opnÃĨr kun en nÃļjagtighed pÃĨ 65% pÃĨ disse spÃļrgsmÃĨl, mens GPT-4-omni kun opnÃĨr 53,6%, hvilket understreger forskellen mellem menneskelig og maskin-intelligens.

PÃĨ grund af de hÃļje kvalifikationskrav er datasÃĶttet faktisk ret lille, hvilket begrÃĶnser dets statistiske kraft til at sammenligne nÃļjagtighed og krÃĶver store effektstÃļrrelser. Eksperterne, der skabte og validerede disse spÃļrgsmÃĨl, kom fra Upwork, sÃĨ de introducerede potentielt fordomme baseret pÃĨ deres ekspertise og de dÃĶkkede emner.

Kode-benchmarks

HumanEval

164 programmeringsopgaver, en rigtig test for LLM’ers kodnings-evner. Det er HumanEval. Det er designet til at teste grundlÃĶggende kodningsfÃĶrdigheder hos store sprogmodeller (LLM’er). Det bruger pass@k-metrikken til at vurdere den funktionelle nÃļjagtighed af den genererede kode, som udgangspunkt for sandsynligheden for, at mindst en af de top k LLM-genererede kodeeksempler passerer testtilfÃĶldene.

Selvom HumanEval-datasÃĶttet inkluderer funktions-signaturer, docstrings, kodekroppe og flere enhedstests, dÃĶkker det ikke det fulde udvalg af virkelige kodningsopgaver, hvilket ikke kan teste en modells evne til at generere korrekt kode for forskellige scenarier.

MBPP (Mostly Basic Python Programming)

Mbpp-benchmark bestÃĨr af 1.000 crowdsourced Python-programmeringsopgaver. Disse er indgangsniveau-opgaver og fokuserer pÃĨ grundlÃĶggende programmeringsfÃĶrdigheder. Det bruger few-shot og finjusteringstilgange til at evaluere modellens ydelse, hvor stÃļrre modeller normalt klarer sig bedre pÃĨ denne datasÃĶt. Men da datasÃĶttet kun indeholder indgangsniveau-programmer, reprÃĶsenterer det ikke fuldt ud kompleksiteten og udfordringerne i virkelige applikationer.

Matematik-benchmarks

Selvom de fleste LLM’er er ret gode til at strukturere standard-svar, er matematisk tÃĶnkning et langt stÃļrre problem for dem. Hvorfor? Fordi det krÃĶver fÃĶrdigheder relateret til spÃļrgsmÃĨlsforstÃĨelse, en skridt-for-skridt logisk tilgang med matematisk tÃĶnkning og udledning af det korrekte svar.

“Chain of Thought” (CoT)-metoden er designet til at evaluere LLM’er pÃĨ matematik-relaterede benchmarks, hvilket indebÃĶrer at prompte modeller til at forklare deres skridt-for-skridt tÃĶnkning under lÃļsningen af et problem. Der er flere fordele ved dette. Det gÃļr tÃĶnkningen mere gennemsigtig, hjÃĶlper med at identificere fejl i modellens logik og giver mulighed for en mere detaljeret vurdering af problemlÃļsningsevner. Ved at bryde komplekse problemer ned i en rÃĶkke enklere skridt kan CoT forbedre modellens ydelse pÃĨ matematik-benchmarks og give dybere indsigt i dens tÃĶnkningsevner.

GSM8K: En populÃĶr matematik-benchmark

En af de velkendte benchmarks til at evaluere matematiske evner i LLM’er er GSM8K-datasÃĶttet. GSM8K bestÃĨr af 8.500 mellem-skole-matematik-opgaver, som krÃĶver flere skridt for at lÃļse, og lÃļsningerne indebÃĶrer primÃĶrt udfÃļrelse af en rÃĶkke grundlÃĶggende beregninger. Typisk klarer stÃļrre modeller eller de, der er specifikt trÃĶnet til matematisk tÃĶnkning, sig bedre pÃĨ denne benchmark, f.eks. GPT-4-modeller, der opnÃĨr en score pÃĨ 96,5%, mens DeepSeekMATH-RL-7B ligger lidt efter pÃĨ 88,2%.

Selvom GSM8K er nyttig til at vurdere en modells evne til at hÃĨndtere mellem-skole-niveau-matematik-opgaver, kan det mÃĨske ikke fuldt ud fange en modells evne til at lÃļse mere avancerede eller diverse matematiske udfordringer, hvilket begrÃĶnser dets effektivitet som en omfattende mÃĨling af matematiske evner.

Matematik-datasÃĶttet: En omfattende alternativ

Matematik-datasÃĶttet lÃļste manglerne i benchmarks som GSM8K. Dette datasÃĶt er mere omfattende og dÃĶkker grundlÃĶggende aritmetik til high school- og endda college-niveau-problemer. Det sammenlignes ogsÃĨ med menneskers prÃĶstationer, hvor en PhD-student i datalogi, der ikke kan lide matematik, opnÃĨr en nÃļjagtighed pÃĨ 40%, og en guldmedaljevinder opnÃĨr en nÃļjagtighed pÃĨ 90%.

Det giver en mere omfattende vurdering af en LLM’s matematiske evner. Det sikrer, at modellen er dygtig i grundlÃĶggende aritmetik og kompetent i komplekse omrÃĨder som algebra, geometri og kalkulus. Men den Ãļgede kompleksitet og diversitet af problemer kan gÃļre det udfordrende for modeller at opnÃĨ hÃļj nÃļjagtighed, isÃĶr for dem, der ikke er ekslicit trÃĶnet pÃĨ et bredt udvalg af matematiske begreber. Desuden kan de varierede problemformater i Matematik-datasÃĶttet introducere inkonsistenser i modellens ydelse, hvilket gÃļr det svÃĶrt at trÃĶffe definitive konklusioner om en modells overordnede matematiske dygtighed.

At bruge “Chain of Thought”-metoden med Matematik-datasÃĶttet kan forbedre evalueringen, da det afslÃļrer LLM’ers skridt-for-skridt tÃĶnkningsevner pÃĨ tvÃĶrs af et bredt spektrum af matematiske udfordringer. En kombineret tilgang som denne sikrer en mere robust og detaljeret vurdering af en LLM’s sande matematiske evner.

LÃĶseforstÃĨelses-benchmarks

En lÃĶseforstÃĨelses-vurdering evaluerer modellens evne til at forstÃĨ og bearbejde komplekst sprog, hvilket er sÃĶrlig vigtigt for applikationer som kundesupport, indholdsgenerering og informationshenting. Der findes flere benchmarks designet til at evaluere denne fÃĶrdighed, hver med unikke egenskaber, der bidrager til en omfattende vurdering af en modells evner.

RACE (LÃĶseforstÃĨelses-datasÃĶt fra eksaminationer)

RACE-benchmarks har nÃĶsten 28.000 passager og 100.000 spÃļrgsmÃĨl samlet fra engelske eksaminationer for mellem- og high school-elever i Kina i alderen 12-18 ÃĨr. Det begrÃĶnser ikke spÃļrgsmÃĨl og svar til at blive trukket ud af de givne passager, hvilket gÃļr opgaverne endnu mere udfordrende.

Det dÃĶkker et bredt udvalg af emner og spÃļrgsmÃĨlstyper, hvilket giver en grundig vurdering og inkluderer spÃļrgsmÃĨl pÃĨ forskellige svÃĶrhedsgrader. SpÃļrgsmÃĨl i RACE er specifikt designet til at teste menneskers lÃĶsefÃĶrdigheder og er skabt af domÃĶne-eksperter.

Men benchmarken har ogsÃĨ nogle ulemper. Da det er udviklet pÃĨ kinesiske uddannelsesmaterialer, er det tilbÃļjeligt til at introducere kulturelle fordomme, der ikke afspejler en global kontekst. Desuden er det hÃļje svÃĶrhedsniveau i nogle spÃļrgsmÃĨl ikke nÃļdvendigvis reprÃĶsentativt for typiske virkelige opgaver. SÃĨ ydelsesevalueringer kan vÃĶre uprÃĶcise.

DROP (Discrete Reasoning Over Paragraphs)

En anden betydelig tilgang er DROP (Discrete Reasoning Over Paragraphs), som udfordrer modeller til at udfÃļre diskret tÃĶnkning over passager. Det har 96.000 spÃļrgsmÃĨl til at teste LLM’ers tÃĶnkningsevner og spÃļrgsmÃĨlene er trukket fra Wikipedia og crowdsourced fra Amazon Mechanical Turk. DROP-spÃļrgsmÃĨl krÃĶver ofte, at modeller udfÃļrer matematiske operationer som addition, subtraktion og sammenligning baseret pÃĨ information spredt over en passage.

SpÃļrgsmÃĨlene er udfordrende. De krÃĶver, at LLM’er lokaliserer flere tal i passagen og adderer eller subtraherer dem for at fÃĨ det endelige svar. Store modeller som GPT-4 og Palm opnÃĨr 80% og 85%, mens mennesker opnÃĨr 96% pÃĨ DROP-datasÃĶttet.

FÃĶllessens-benchmarks

At teste fÃĶllessensforstÃĨelse i sprogmodeller er en interessant, men ogsÃĨ afgÃļrende opgave, da det vurderer en modells evne til at trÃĶffe domme og slutninger, der er i overensstemmelse med menneskelig tÃĶnkning. I modsÃĶtning til os, der udvikler en omfattende verdensmodel gennem praktiske erfaringer, trÃĶnes sprogmodeller pÃĨ enorme datasÃĶt uden at have en indbygget forstÃĨelse af konteksten. Dette betyder, at modellerne kÃĶmper med opgaver, der krÃĶver en intuitiv forstÃĨelse af hverdags-situationer, logisk tÃĶnkning og praktisk viden, hvilket er vigtigt for robuste og pÃĨlidelige AI-applikationer.

HellaSwag (Harder Endings, Longer contexts, and Low-shot Activities for Situations With Adversarial Generations)

Hellaswag er udviklet af Rowan Zellers og kolleger ved University of Washington og Allen Institute for Artificial Intelligence. Det er designet til at teste en modells evne til at forudsige den mest plausiblen fortsÃĶttelse af en given situation. Denne benchmark er konstrueret ved hjÃĶlp af Adversarial Filtering (AF), hvor en rÃĶkke diskrimineringstests iterativt vÃĶlger adversarielle maskin-genererede forkerte svar. Denne metode skaber en datasÃĶt med trivielle eksempler for mennesker, men udfordrende for modeller, hvilket resulterer i en “Goldilocks”-zone af svÃĶrhedsgrad.

Selvom Hellaswag har vÃĶret udfordrende for tidligere modeller, har state-of-the-art-modeller som GPT-4 opnÃĨet performancesniveauer tÃĶt pÃĨ menneskelig nÃļjagtighed, hvilket indikerer betydelig fremgang i feltet. Men disse resultater antyder behovet for kontinuerligt at udvikle benchmarks for at fÃļlge med i fremgangen i AI-kapaciteter.

Openbook

Openbook-datasÃĶttet bestÃĨr af 5.957 multiple-choice-spÃļrgsmÃĨl pÃĨ grundniveau inden for naturvidenskab. SpÃļrgsmÃĨlene er samlet fra ÃĨbne bog-eksaminationer og udviklet til at vurdere menneskers forstÃĨelse af faget.

Openbook-benchmark krÃĶver tÃĶnkningsevner ud over informationshenting. GPT-4 opnÃĨr den hÃļjeste nÃļjagtighed pÃĨ 95,9% indtil videre.

OpenbookQA er modelleret efter ÃĨbne bog-eksaminationer og bestÃĨr af 5.957 multiple-choice-spÃļrgsmÃĨl pÃĨ grundniveau inden for naturvidenskab. Disse spÃļrgsmÃĨl er designet til at teste forstÃĨelsen af 1.326 centrale naturvidenskabelige fakta og deres anvendelse i nye situationer.

Ligesom Hellaswag fandt tidligere modeller OpenbookQA udfordrende, men moderne modeller som GPT-4 har opnÃĨet nÃĶsten menneskelig performancesniveau. Denne fremgang understreger vigtigheden af at udvikle endnu mere komplekse og nuancerede benchmarks for at fortsÃĶtte med at udvide grÃĶnserne for AI-forstÃĨelse.

Er benchmarks nok til LLM-ydelsesevaluering?

Ja, selvom de giver en standardiseret tilgang til at evaluere LLM-ydelse, kan de ogsÃĨ vÃĶre misvisende. Large Model Systems Organisation siger, at en god LLM-benchmark skal vÃĶre skalerbar, i stand til at evaluere nye modeller med et relativt lille antal forsÃļg, og give en unik rangordning for alle modeller. Men der er ÃĨrsager til, at de mÃĨske ikke er nok. Her er nogle:

Benchmark-lÃĶkage

Dette er en almindelig forekomst, og det sker, nÃĨr trÃĶningsdata overlapper med testdata, hvilket giver en misvisende evaluering. Hvis en model allerede har mÃļdt nogle testspÃļrgsmÃĨl under trÃĶning, kan resultaterne ikke nÃļjagtigt afspejle dens sande evner. Men en ideal benchmark skal minimere huskning og afspejle virkelige scenarier.

Evaluations-forudindtagelse

LLM-benchmark-leaderboards bruges til at sammenligne LLM’ers ydelse pÃĨ forskellige opgaver. Men at afhÃĶnge af disse leaderboards til model-sammenligning kan vÃĶre misvisende. Simple ÃĶndringer i benchmark-test, som at ÃĶndre spÃļrgsmÃĨlsrÃĶkkefÃļlge, kan skifte modellens rangordning med op til otte positioner. Desuden kan LLM’er opfÃļre sig forskelligt afhÃĶngigt af vurderingsmetoder, hvilket understreger vigtigheden af at overveje evaluations-forudindtagelse.

Åbenhed

Virkelige LLM-interaktioner indebÃĶrer at designe prompts til at generere Ãļnskede AI-outputs. LLM-outputs afhÃĶnger af promptens effektivitet, og benchmarks er designet til at teste kontekstbevidsthed hos LLM’er. Selvom benchmarks er designet til at teste en LLM’s kontekstbevidsthed, oversÃĶtter de ikke altid direkte til virkelige performances. F.eks. en model, der opnÃĨr en score pÃĨ 100% pÃĨ en benchmark-datasÃĶt, som LSAT, garanterer ikke det samme niveau af nÃļjagtighed i praktiske anvendelser. Dette understreger vigtigheden af at overveje den ÃĨbne natur af virkelige opgaver i LLM-evaluering.

Effektiv evaluering for robuste LLM’er

SÃĨ, nu ved du, at benchmarks ikke altid er den bedste lÃļsning, fordi de ikke kan generalisere over alle problemer. Men der er andre mÃĨder.

Brugerdefinerede benchmarks

Disse er perfekte til at teste bestemte adfÃĶrd og funktioner i specifikke scenarier. Lad os sige, hvis en LLM er designet til medicinske officerer, vil datasÃĶttet samlet fra medicinske indstillinger effektivt reprÃĶsentere virkelige scenarier. Disse brugerdefinerede benchmarks kan fokusere pÃĨ domÃĶne-specifik sprogforstÃĨelse, ydelse og unikke kontekstuelle krav. Ved at tilpasse benchmarks til mulige virkelige scenarier kan du sikre, at LLM’en klarer sig godt generelt og excellerer i de specifikke opgaver, den er designet til. Dette kan hjÃĶlpe med at identificere og lÃļse huller eller svagheder i modellens evner tidligt.

Data-lÃĶkage-detektions-pipeline

Hvis du Ãļnsker, at dine evalueringer skal “vise” integritet, er det vigtigt at have en data-lÃĶkage-fri benchmark-pipeline. Data-lÃĶkage sker, nÃĨr benchmark-data er inkluderet i modellens pre-trÃĶningskorpus, hvilket resulterer i kunstigt hÃļje performancescore. For at undgÃĨ dette skal benchmarks vÃĶre krydskontrolleret mod pre-trÃĶningsdata. Plus, skridt til at undgÃĨ tidligere set information. Dette kan indebÃĶre at bruge proprietÃĶre eller nyligt kuraterede datasÃĶt, der holdes adskilt fra modellens trÃĶningspipeline – dette vil sikre, at performances-mÃĨlinger afspejler modellens evne til at generalisere godt.

Menneske-evaluering

Automatiserede metrikker alene kan ikke fange det fulde spektrum af en modells ydelse, isÃĶr nÃĨr det kommer til meget nuancerede og subjektive aspekter af sprogforstÃĨelse og generering. Her giver menneske-evaluering en langt bedre vurdering:

  • AnsÃĶttelse af professionelle, der kan give detaljerede og pÃĨlidelige vurderinger, isÃĶr for specialiserede domÃĶner.
  • Crowdsourcing! Platforme som Amazon Mechanical Turk giver mulighed for at samle diverse menneskelige vurderinger hurtigt og til lav omkostning.
  • FÃĶllesskabs-feedback: At bruge platforme som LMSYS-leaderboard-arena, hvor brugere kan stemme og sammenligne modeller, tilfÃļjer et ekstra lag af indsigt. LMSYS Chatbot Arena Hard, for eksempel, er sÃĶrlig effektiv til at fremhÃĶve subtile forskelle mellem top-modeller gennem direkte bruger-interaktioner og stemmer.

Konklusion

Uden evaluering og benchmarking ville vi ikke have nogen mÃĨde at vide, om LLM’ens evne til at hÃĨndtere virkelige opgaver er sÃĨ nÃļjagtig og anvendelig, som vi tror. Men som jeg sagde, benchmarks er ikke en fuldstÃĶndig sikker mÃĨde at kontrollere dette pÃĨ, de kan fÃļre til huller i LLM’ers ydelse. Dette kan ogsÃĨ langsommere udviklingen af LLM’er, der er virkelig robuste til arbejde.

Dette er, hvordan det bÃļr vÃĶre i en ideal verden. LLM’er forstÃĨr brugerforespÃļrgsler, identificerer fejl i prompts, fuldfÃļrer opgaver som instrueret, og genererer pÃĨlidelige outputs. Resultaterne er allerede store, men ikke ideelle. Dette er, hvor opgave-specifikke benchmarks er meget nyttige, ligesom menneske-evaluering og detektion af benchmark-lÃĶkage. Ved at bruge disse fÃĨr vi chancen for at producere virkelig robuste LLM’er.

Irina Barskaya, PhD, er en fremragende datavidenskabsmand med mere end et ÃĨrtis erfaring, der omfatter bÃĨde produktanalyse og analyse af avancerede teknologier. Hun stod i spidsen for oprettelsen og analysen af Yasmina, den fÃļrste fuldt funktionsdygtige lokaliserede AI-baserede taleassistent for Saudi-Arabien, der hÃĨndterer kompleks data-lokalisering og mÃĶrkning for Modern Standard Arabic og Saudi-dialekter. For tiden stÃĨr Irina i spidsen for kvalitetsanalyse pÃĨ Yandex, hvor hun driver fremgang i AI-teknologier.