Tankeledere
Benchmark for LLM-er
ForstÃĨ rollen og begrensningene til benchmarking i vurderingen av LLM-ytelse. Utforsk teknikkene for ÃĨ utvikle robuste LLM-er.
Store sprÃĨkmodeller har fÃĨtt stor popularitet de siste ÃĨrene. Jeg mener, du har sett det. LLM-er utmerkede evne til ÃĨ forstÃĨ menneskelige sprÃĨkkommandoer gjorde dem til den perfekte integrasjonen for bedrifter, som stÃļttet kritiske arbeidsflyter og automatiserte oppgaver for maksimal effisiens. Pluss, utover den gjennomsnittlige brukerens forstÃĨelse, er det mye mer LLM-er kan gjÃļre. Og siden vÃĨr avhengighet av dem Ãļker, mÃĨ vi virkelig legge merke til tiltak for ÃĨ sikre nÃļdvendig nÃļyaktighet og pÃĨlitelighet. Dette er en global oppgave som omfatter hele institusjoner, men i bedriftsverden er det nÃĨ flere benchmark som kan brukes til ÃĨ vurdere LLM-ytelsen over forskjellige domener. Disse kan teste modellens evner i forstÃĨelse, logisk tenkning, matematikk og sÃĨ videre, og resultater avgjÃļr om en LLM er klar for bedriftslevering.
I denne artikkelen har jeg samlet en omfattende liste over de mest populÃĶre benchmarkene for LLM-vurdering. Vi skal diskutere hver benchmark i detalj og se hvordan forskjellige LLM-er klarer seg mot vurderingskriteriene. Men fÃļrst, la oss forstÃĨ LLM-vurdering i mer detalj.
Hva er LLM-vurdering?
Liksom andre AI-modeller, trenger LLM-er ogsÃĨ ÃĨ vurderes mot bestemte benchmark som vurderer forskjellige aspekter av sprÃĨkmodellens ytelse: kunnskap, nÃļyaktighet, pÃĨlitelighet og konsistens. Standarden omfatter vanligvis:
- ForstÃĨelse av brukerforespÃļrsler: Vurdere modellens evne til ÃĨ nÃļyaktig forstÃĨ og tolke en rekke brukerinput.
- Verifisering av utdata: Verifisere AI-genererte svar mot en pÃĨlitelig kunnskapsbase for ÃĨ sikre at de er korrekte og relevante.
- Robusthet: MÃĨle hvor godt modellen utfÃļrer seg med tvetydige, ufullstendige eller stÃļyende input.
LLM-vurdering gir utviklere mulighet til ÃĨ identifisere og lÃļse begrensninger effektivt, slik at de kan forbedre den totale brukeropplevelsen. Hvis en LLM blir grundig vurdert, vil den vÃĶre nÃļyaktig og robust nok til ÃĨ hÃĨndtere forskjellige virkelige applikasjoner, ogsÃĨ de med tvetydige eller uventede input.
Benchmark
LLM-er er en av de mest kompliserte teknologiene til dags dato og kan drive selv de mest kompliserte applikasjonene. SÃĨ vurderingsprosessen mÃĨ vÃĶre like komplisert, og teste tankeprosessen og teknisk nÃļyaktighet.
En benchmark bruker bestemte datasamlinger, mÃĨlinger og vurderingsteknikker for ÃĨ teste LLM-ytelse, og tillater sammenligning av forskjellige LLM-er og mÃĨling av nÃļyaktigheten, som igjen driver fremgangen i industrien gjennom forbedret ytelse.
Her er noen av de mest typiske aspektene ved LLM-ytelse:
- Kunnskap: Modellens kunnskap mÃĨ testes over forskjellige domener. Dette er hva kunnskapsbenchmark er for. Den vurderer hvor effektivt modellen kan gjÃļre rede for informasjon fra forskjellige felt, som fysikk, programmering, geografi osv.
- Logisk tenkning: Dette innebÃĶrer ÃĨ teste modellens evne til ÃĨ ÂŦtenkeÂŧ skritt for skritt og trekke en logisk konklusjon, vanligvis i scenarier hvor modellen mÃĨ velge den mest plausibele fortsettelse eller forklaring basert pÃĨ hverdagskunnskap og logisk tenkning.
- LeseforstÃĨelse: Modellene mÃĨ vÃĶre utmerkede i ÃĨ tolke naturlig sprÃĨk og generere svar deretter. Testen ligner pÃĨ ÃĨ svare pÃĨ spÃļrsmÃĨl basert pÃĨ passasjer for ÃĨ mÃĨle forstÃĨelse, slutting og detaljbevaring. Lik en skolelesetest.
- KodeforstÃĨelse: Dette er nÃļdvendig for ÃĨ mÃĨle modellens ferdighet i ÃĨ forstÃĨ, skrive og feilsÃļke kode. Disse benchmarkene gir modellen kodeoppgaver eller problemer som modellen mÃĨ lÃļse nÃļyaktig, ofte dekkende en rekke programmeringssprÃĨk og paradigmer.
- Verdenskunnskap: For ÃĨ vurdere modellens grep om generell kunnskap om verden. Disse datasamlingene inneholder vanligvis spÃļrsmÃĨl som krever bred, encyklopedisk kunnskap for ÃĨ bli besvart korrekt, noe som gjÃļr dem forskjellige fra mer spesifikke og spesialiserte kunnskapsbenchmark.
âKunnskapâ Benchmark
MMLU (Multimodal Language Understanding)
Denne benchmarken er laget for ÃĨ teste LLM-ens grep om faktisk kunnskap over forskjellige emner som humaniora, samfunnsvitenskap, historie, datavitenskap og selv jus. 57 spÃļrsmÃĨl og 15 000 oppgaver rettet mot ÃĨ sikre at modellen har gode tenkeevner og hÃĨndtering av forskjellige emner.
Nylig har det blitt en nÃļkkelbenchmark for ÃĨ vurdere LLM-er for ovennevnte omrÃĨder. Utviklere Ãļnsker alltid ÃĨ optimalisere modellene sine for ÃĨ overgÃĨ andre i denne benchmarken, noe som gjÃļr den til en de facto-standard for ÃĨ vurdere avansert tenkning og kunnskap i LLM-er. Store bedriftsmodeller har vist imponerende resultater pÃĨ denne benchmarken, inkludert GPT-4-omni pÃĨ 88,7%, Claude 3 Opus pÃĨ 86,8%, Gemini 1,5 Pro pÃĨ 85,9% og Llama-3 70B pÃĨ 82%.
Men MMLU er ikke uten ulemper: den har kjente problemer som tvetydige spÃļrsmÃĨl, feilaktige svar og manglende kontekst. Og mange mener at noen av oppgavene er for enkle for en ordentlig LLM-vurdering.
GPQA (Graduate-Level Google-Proof Q&A Benchmark)
Denne benchmarken vurderer LLM-er pÃĨ logisk tenkning ved hjelp av en datasamling med bare 448 spÃļrsmÃĨl. Domene-eksperter har utviklet den, og den dekker emner i biologi, fysikk og kjemi.
Hvert spÃļrsmÃĨl gÃĨr gjennom fÃļlgende valideringsprosess:
- En ekspert i samme emne besvarer spÃļrsmÃĨlet og gir detaljert tilbakemelding.
- SpÃļrsmÃĨlsforfatteren reviderer spÃļrsmÃĨlet basert pÃĨ denne tilbakemeldingen.
- En annen ekspert besvarer det reviderte spÃļrsmÃĨlet.
Denne prosessen kan faktisk sikre at spÃļrsmÃĨlene er objektive, nÃļyaktige og utfordrende for en sprÃĨkmodell. Selv erfarne PhD-studenter oppnÃĨr bare en nÃļyaktighet pÃĨ 65% pÃĨ disse spÃļrsmÃĨlene, mens GPT-4-omni bare nÃĨr 53,6%, noe som understreker gapet mellom menneskelig og maskinell intelligens.
Kodebenchmark
HumanEval
164 programmeringsoppgaver, en ekte test for LLM-ens kodeevner. Det er HumanEval. Det er designet for ÃĨ teste de grunnleggende kodeevnene til store sprÃĨkmodeller (LLM-er). Det bruker pass@k-mÃĨlingen til ÃĨ vurdere den funksjonelle nÃļyaktigheten av den genererte koden, som utgangspunktet for ÃĨ se om minst en av de Ãļverste k LLM-genererte kodeeksemplene passer testtilfeller.
Mens HumanEval-datasamlingen inkluderer funksjonssignaturer, docstrings, kodekropper og flere enhetstester, inkluderer den ikke hele rekken av virkelige kodeproblemer, noe som ikke vil vÃĶre nok til ÃĨ teste en modells evne til ÃĨ lage korrekt kode for forskjellige scenarioer.
MBPP (Mostly Basic Python Programming)
MBPP-benchmark bestÃĨr av 1000 crowdsourced Python-programmeringsoppgaver. Disse er innfÃļringsoppgaver og fokuserer pÃĨ grunnleggende programmeringsferdigheter. Den bruker noen skudd- og finjusteringsteknikker for ÃĨ vurdere modellens ytelse, med stÃļrre modeller som vanligvis utfÃļrer bedre pÃĨ denne datasamlingen. Men, ettersom datasamlingen hovedsakelig bestÃĨr av innfÃļringsoppgaver, representerer den ikke fullt ut kompleksiteten og utfordringene i virkelige applikasjoner.
Matematisk benchmark
Mens de fleste LLM-er er ganske gode til ÃĨ strukturere standardrespons, er matematisk tenkning et mye stÃļrre problem for dem. Hvorfor? Fordi det krever ferdigheter relatert til spÃļrsmÃĨlsforstÃĨelse, en skritt-for-skritt logisk tilnÃĶrming med matematisk tenkning og avledning av det riktige svaret.
âChain of Thoughtâ-metoden er laget for ÃĨ vurdere LLM-er pÃĨ matematisk-relaterte benchmark, det innebÃĶrer ÃĨ fremme modellene til ÃĨ forklare deres skritt-for-skritt tenkeprosess nÃĨr de lÃļser et problem. Det er flere fordeler med dette. Det gjÃļr tenkeprosessen mer gjennomsiktig, hjelper med ÃĨ identifisere feil i modellens logikk og tillater en mer detaljert vurdering av problemlÃļsningsevner. Ved ÃĨ bryte ned komplekse problemer i en rekke enklere skritt, kan âChain of Thoughtâ-metoden forbedre modellens ytelse pÃĨ matematisk benchmark og gi dypere innsikt i dens tenkeevner.
GSM8K: En populÃĶr matematisk benchmark
En av de mest kjente benchmarkene for ÃĨ vurdere matematisk evner i LLM-er er GSM8K-datasamlingen. GSM8K bestÃĨr av 8,5 tusen midtskolematematikkoppgaver, som krever noen skritt for ÃĨ lÃļse, og lÃļsningene innebÃĶrer hovedsakelig ÃĨ utfÃļre en rekke grunnleggende beregninger. Vanligvis er stÃļrre modeller eller de som er spesifikt trent for matematisk tenkning, som utfÃļrer bedre pÃĨ denne benchmarken, f.eks. GPT-4-modeller som hevder en score pÃĨ 96,5%, mens DeepSeekMATH-RL-7B ligger litt bak pÃĨ 88,2%.
Mens GSM8K er nyttig for ÃĨ vurdere en modells evne til ÃĨ hÃĨndtere grunnskolematematikk, kan den kanskje ikke fullt ut fange en modells evne til ÃĨ lÃļse mer avanserte eller diverse matematiske utfordringer, noe som begrenser dens effektivitet som en omfattende mÃĨling av matematisk evne.
Matematikk-datasamlingen: En omfattende alternativ
Matematikk-datasamlingen tok hÃĨnd om begrensningene til benchmark som GSM8K. Denne datasamlingen er mer omfattende, dekker grunnleggende aritmetikk til videregÃĨende og selv universitetsnivÃĨ. Den sammenlignes ogsÃĨ med mennesker, med en datavitenskapsstudent som ikke liker matematikk som oppnÃĨr en nÃļyaktighet pÃĨ 40% og en gullmedaljÃļr som oppnÃĨr en nÃļyaktighet pÃĨ 90%.
Den gir en mer allsidig vurdering av en LLMs matematiske evner. Den tar vare pÃĨ ÃĨ vise at modellen er dyktig i grunnleggende aritmetikk og kompetent i komplekse omrÃĨder som algebra, geometri og kalkulus. Men den Ãļkte kompleksiteten og mangfoldet av problemer kan gjÃļre det utfordrende for modeller ÃĨ oppnÃĨ hÃļy nÃļyaktighet, spesielt de som ikke er eksplisitt trent pÃĨ et bredt spekter av matematiske konsepter. Dessuten kan de varierte problemformatene i matematikk-datasamlingen innfÃļre inkonsekvenser i modellens ytelse, noe som gjÃļr det vanskeligere ÃĨ trekke definitive konklusjoner om en modells totale matematiske evne.
Bruken av âChain of Thoughtâ-metoden med matematikk-datasamlingen kan forbedre vurderingen, da den avdekker de skritt-for-skritt tenkeevnene til LLM-er over et bredt spekter av matematiske utfordringer. En kombinasjonsmetode som denne sikrer en mer robust og detaljert vurdering av en LLMs sanne matematiske evner.
LeseforstÃĨelsesbenchmark
En lesingstest vurderer modellens evne til ÃĨ forstÃĨ og prosessere kompleks tekst, noe som er spesielt viktig for applikasjoner som kundestÃļtte, innholdsgenerering og informasjonsgjenfinning. Det finnes flere benchmark som er designet for ÃĨ vurdere denne ferdigheten, hver med unike egenskaper som bidrar til en omfattende vurdering av en modells evner.
RACE (LeseforstÃĨelsesdataset fra eksamener)
RACE-benchmark har nesten 28 000 passasjer og 100 000 spÃļrsmÃĨl samlet fra engelskeksamen for mellom- og hÃļyskoleelever i alderen 12-18 ÃĨr. Den begrenser ikke spÃļrsmÃĨl og svar til ÃĨ bli trukket fra de gitt passasjene, noe som gjÃļr oppgavene enda mer utfordrende.
Den dekker et bredt spekter av emner og spÃļrsmÃĨlstyper, noe som gjÃļr det til en grundig vurdering og inkluderer spÃļrsmÃĨl pÃĨ forskjellige vanskelighetsnivÃĨer. SpÃļrsmÃĨlene i RACE er spesifikt designet for ÃĨ teste menneskelig lesingsevne og er skapt av domene-eksperter.
Men benchmarken har noen ulemper. Ettersom den er utviklet fra kinesiske utdanningsmateriell, er den utsatt for ÃĨ innfÃļre kulturelle fordommer som ikke reflekterer en global kontekst. Dessuten er vanskelighetsnivÃĨet i noen spÃļrsmÃĨl ikke nÃļdvendigvis representative for typiske virkelige oppgaver. SÃĨ vurderingene kan vÃĶre misvisende.
DROP (Discrete Reasoning Over Paragraphs)
En annen betydelig tilnÃĶrming er DROP (Discrete Reasoning Over Paragraphs), som utfordrer modeller til ÃĨ utfÃļre diskret tenkning over passasjer. Den har 96 000 spÃļrsmÃĨl for ÃĨ teste tenkeevnene til LLM-er, og spÃļrsmÃĨlene er trukket fra Wikipedia og crowdsourcet fra Amazon Mechanical Turk. DROP-spÃļrsmÃĨl krever ofte at modellene utfÃļrer matematiske operasjoner som addisjon, subtraksjon og sammenligning basert pÃĨ informasjon spredt over en passasje.
SpÃļrsmÃĨlene er utfordrende. De krever at LLM-er finner flere tall i passasjen og adderer eller subtraherer dem for ÃĨ fÃĨ det endelige svaret. Store modeller som GPT-4 og Palm oppnÃĨr 80% og 85%, mens mennesker oppnÃĨr 96% pÃĨ DROP-datasamlingen.
Benchmark for hverdagsforstÃĨelse
à teste hverdagsforstÃĨelse i sprÃĨkmodeller er en interessant utfordring, men ogsÃĨ nÃļdvendig, da den vurderer en modells evne til ÃĨ gjÃļre dommer og slutninger som stemmer overens med vÃĨr â menneskelig tenkning. I motsetning til oss, som utvikler en omfattende verdensmodell gjennom praktisk erfaring, er sprÃĨkmodeller trent pÃĨ store datasamlinger uten ÃĨ innehaft kontekst. Dette betyr at modellene sliter med oppgaver som krever en intuitiv forstÃĨelse av hverdagslige situasjoner, logisk tenkning og praktisk kunnskap, noe som er viktig for robuste og pÃĨlitelige AI-applikasjoner.
HellaSwag (Harder Endings, Longer contexts, and Low-shot Activities for Situations With Adversarial Generations)
Hellaswag er utviklet av Rowan Zellers og kolleger ved University of Washington og Allen Institute for Artificial Intelligence. Den er designet for ÃĨ teste en modells evne til ÃĨ forutsi den mest plausibele fortsettelsen av en gitt scenario. Denne benchmarken er konstruert ved hjelp av Adversarial Filtering (AF), hvor en rekke diskriminatorene iterativt velger adversarial maskin-genererte feilaktige svar. Denne metoden skaper en datasamling med trivielle eksempler for mennesker, men utfordrende for modeller, noe som resulterer i en âGoldilocksâ-sone av vanskelighetsnivÃĨ.
Mens Hellaswag har vÃĶrt utfordrende for tidligere modeller, har state-of-the-art-modeller som GPT-4 oppnÃĨdd ytelsesnivÃĨer nÃĶr menneskelig nÃļyaktighet, noe som indikerer betydelig fremgang i feltet. Men disse resultater understreker behovet for kontinuerlig ÃĨ utvikle nye benchmark for ÃĨ holde pace med fremgangen i AI-evnen.
Openbook
Openbook-datasamlingen bestÃĨr av 5957 elementary-nivÃĨ vitenskapsmultiple-choice-spÃļrsmÃĨl. SpÃļrsmÃĨlene er samlet fra ÃĨpne bok-eksamener og utviklet for ÃĨ vurdere menneskelig forstÃĨelse av emnet.
Openbook-benchmark krever tenkeevne utover informasjonsgjenfinning. GPT-4 oppnÃĨr den hÃļyeste nÃļyaktigheten pÃĨ 95,9% per nÃĨ.
OpenbookQA er modellert etter ÃĨpne bok-eksamener og bestÃĨr av 5957 multiple-choice elementary-nivÃĨ vitenskaps-spÃļrsmÃĨl. Disse spÃļrsmÃĨlene er designet for ÃĨ teste forstÃĨelsen av 1326 grunnleggende vitenskapsfakta og deres anvendelse i nye situasjoner.
Lignende Hellaswag, har tidligere modeller funnet OpenbookQA utfordrende, men moderne modeller som GPT-4 har oppnÃĨdd nÃĶrmenneskelig ytelse. Denne fremgangen understreker viktigheten av ÃĨ utvikle enda mer komplekse og nyanserte benchmark for ÃĨ fortsette ÃĨ drive grensene for AI-forstÃĨelse.
Er benchmark nok for LLM-ytelsevurdering?
Ja, mens de gir en standardisert tilnÃĶrming til ÃĨ vurdere LLM-ytelse, kan de ogsÃĨ vÃĶre misvisende. Large Model Systems Organization sier at en god LLM-benchmark bÃļr vÃĶre skalerbar, i stand til ÃĨ vurdere nye modeller med et relativt lite antall forsÃļk, og gi en unik rangeringsorden for alle modeller. Men det finnes grunner til at de kanskje ikke er nok. Her er noen:
Benchmark-lÃĶkasje
Dette er en vanlig hendelse, og det skjer nÃĨr treningdata overlapper med testdata, noe som resulterer i en misvisende vurdering. Hvis en modell allerede har mÃļtt noen testspÃļrsmÃĨl under trening, kan resultatet ikke nÃļdvendigvis reflektere dens sanne evner. Men en ideal benchmark bÃļr minimere memorering og reflektere virkelige scenarioer.
Vurderingsforforstyrrelse
LLM-benchmark-ledere brukes til ÃĨ sammenligne LLM-ers ytelse pÃĨ forskjellige oppgaver. Men ÃĨ stole pÃĨ disse ledere for modell-sammenligning kan vÃĶre misvisende. Enkle endringer i benchmark-tester, som ÃĨ endre rekkefÃļlgen pÃĨ spÃļrsmÃĨlene, kan skifte modell-rangeringen med opptil ÃĨtte posisjoner. Dessuten kan LLM-er oppfÃļre seg forskjellig avhengig av vurderingsmetodene, noe som understreker viktigheten av ÃĨ vurdere vurderingsforforstyrrelser.
à penhet
Virkelige LLM-interaksjoner involverer ÃĨ designe promter for ÃĨ generere Ãļnskede AI-utdata. LLM-utdata avhenger av promtenes effektivitet, og benchmark er designet for ÃĨ teste kontekstbevisstheten til LLM-er. Mens benchmark er designet for ÃĨ teste en LLMs kontekstbevissthet, oversetter de ikke alltid direkte til virkelige ytelsesnivÃĨer. For eksempel, en modell som oppnÃĨr en 100% score pÃĨ en benchmark-datasamling, som LSAT, garanterer ikke det samme nivÃĨet av nÃļyaktighet i praktiske applikasjoner. Dette understreker viktigheten av ÃĨ vurdere den ÃĨpne naturen til virkelige oppgaver i LLM-vurdering.
Effektiv vurdering for robuste LLM-er
SÃĨ nÃĨ vet du at benchmark ikke alltid er den beste lÃļsningen, fordi de ikke alltid kan generalisere over alle problemer. Men det finnes andre mÃĨter.
Tilpassede benchmark
Disse er perfekte for ÃĨ teste spesifikke atferd og funksjoner i oppgave-spesifikke scenarioer. La oss si at hvis en LLM er designet for medisinske offiserer, vil datasamlinger fra medisinske settinger effektivt representere virkelige scenarioer. Disse tilpassede benchmark kan fokusere pÃĨ domene-spesifikke sprÃĨkforstÃĨelse, ytelse og unike kontekstuelle krav. Ved ÃĨ tilpasse benchmarkene med mulige virkelige scenarioer, kan du sikre at LLM-en utfÃļrer godt generelt og utmerker seg i de spesifikke oppgavene den er designet for. Dette kan hjelpe med ÃĨ identifisere og lÃļse eventuelle gap eller svakheter i modellens evner tidlig.
Data-lÃĶkasje-deteksjonsrÃļrledning
Hvis du Ãļnsker at vurderingene dine skal âviseâ integritet, er det viktig ÃĨ ha en data-lÃĶkasje-fri benchmark-rÃļrledning. Data-lÃĶkasje skjer nÃĨr benchmark-data er inkludert i modellens fortreningssamling, noe som resulterer i kunstig hÃļye ytelsespoeng. For ÃĨ unngÃĨ dette, bÃļr benchmarkene vÃĶre krysstestet mot fortreningssamlinger. Pluss, skritt for ÃĨ unngÃĨ tidligere sett informasjon. Dette kan innebÃĶre ÃĨ bruke proprietÃĶre eller nykurerte datasamlinger som holdes adskilt fra modellens treningssamling â dette vil sikre at ytelsespoengene du fÃĨr, reflekterer modellens evne til ÃĨ generalisere godt.
Menneskelig vurdering
Automatiserte mÃĨlinger alene kan ikke fange det fulle spekteret av en modells ytelse, spesielt nÃĨr det gjelder nyanserte og subjektive aspekter av sprÃĨkforstÃĨelse og generering. Her gir menneskelig vurdering en mye bedre vurdering:
- Anssettelse av fagfolk som kan gi detaljerte og pÃĨlitelige vurderinger, spesielt for spesialiserte domener.
- Crowdsourcing! Plattformer som Amazon Mechanical Turk lar deg samle inn diverse menneskelige vurderinger raskt og til lav kostnad.
- Samfunnsfeedback: Bruk av plattformer som LMSYS-leaderboard-arena, hvor brukere kan stemme og sammenligne modeller, legger til en ekstra lag med innsikt. LMSYS Chatbot Arena Hard, for eksempel, er spesielt effektiv i ÃĨ hÃļyde forskjellene mellom toppmodellene gjennom direkte brukerinteraksjoner og stemmer.
Konklusjon
Uten vurdering og benchmarking, ville vi ikke hatt noen mÃĨte ÃĨ vite om LLM-ens evne til ÃĨ hÃĨndtere virkelige oppgaver er like nÃļyaktig og anvendelig som vi tror det er. Men, som jeg sa, benchmark er ikke alltid en fullstendig sikker mÃĨte ÃĨ sjekke det, de kan fÃļre til gap i LLM-ens ytelse. Dette kan ogsÃĨ bremse utviklingen av LLM-er som er virkelig robuste for arbeid.
Dette er hvordan det bÃļr vÃĶre i en ideal verden. LLM-er forstÃĨr brukerforespÃļrsler, identifiserer feil i promter, fullfÃļrer oppgaver som instruert, og genererer pÃĨlitelige utdata. Resultatene er allerede gode, men ikke ideelle. Dette er der hvor oppgave-spesifikke benchmark viser seg ÃĨ vÃĶre svÃĶrt nyttige, like menneskelig vurdering og deteksjon av benchmark-lÃĶkasje. Ved ÃĨ bruke disse, fÃĨr vi en sjanse til ÃĨ produsere virkelig robuste LLM-er.












