AI-modeller og plattformer
Evaluering av store språkmodeller: En teknisk guide
Store språkmodeller (LLM) som GPT-4, Claude og LLaMA har eksplodert i popularitet. Takket være deres evne til å generere imponerende menneskelignende tekst, brukes disse AI-systemene nå til alt fra innholdsskapelse til kundeservice-chatbots.
Men hvordan vet vi om disse modellene faktisk er noen god? Med nye LLM-er som annonseres konstant, alle hevder å være større og bedre, hvordan vurderer og sammenligner vi deres ytelse?
I denne omfattende guiden vil vi utforske de beste teknikker for å evaluere store språkmodeller. Vi vil se på fordelene og ulemper ved hver tilnærming, når de er best anvendt, og hvordan du kan utnytte dem i din egen LLM-testing.
Opgave-spesifikke mål
En av de mest rett frem måtene å evaluere en LLM på er å teste den på etablerte NLP-oppgaver ved hjelp av standardiserte mål. For eksempel:
Sammendrag
For sammendragsoppgaver brukes mål som ROUGE (Recall-Oriented Understudy for Gisting Evaluation) ofte. ROUGE sammenligner modell-generert sammendrag med et menneske-skrevet “referanse” sammendrag, og teller overlapet av ord eller fraser.
Det finnes flere varianter av ROUGE, hver med sine egne fordelene og ulemper:
- ROUGE-N: Sammenligner overlap av n-grammer (sekvenser av N ord). ROUGE-1 bruker unigrammer (enkelte ord), ROUGE-2 bruker bigrammer, osv. Fordelen er at det fanger ordrekkefølge, men det kan være for strengt.
- ROUGE-L: Basert på lengste felles subsekvens (LCS). Mer fleksibelt med ordrekkefølge, men fokuserer på hovedpoengene.
- ROUGE-W: Vekter LCS-matcher med deres betydning. Forsøker å forbedre ROUGE-L.
Generelt er ROUGE-mål rask, automatisk og fungerer godt for å rangere system-sammendrag. Men de måler ikke kohensjon eller mening. Et sammendrag kan få høy ROUGE-poeng og likevel være meningsløst.
Formelen for ROUGE-N er:
ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑
Hvor:
Count_{match}(gram_n)er tellingen av n-grammer i både generert og referanse-sammendrag.Count(gram_n)er tellingen av n-grammer i referanse-sammendraget.
For eksempel, for ROUGE-1 (unigrammer):
- Generert sammendrag: “Katten satt.”
- Referanse-sammendrag: “Katten satt på matta.”
- Overlappende unigrammer: “Katten”, “satt”
- ROUGE-1-poeng = 3/5 = 0,6
ROUGE-L bruker lengste felles subsekvens (LCS). Det er mer fleksibelt med ordrekkefølge. Formelen er:
ROUGE-L=���(generated,reference)max(length(generated), length(reference))
Hvor LCS er lengden av den lengste felles subsekvensen.
ROUGE-W vekter LCS-matcher. Det tar hensyn til betydningen av hver match i LCS.
Øversettelse
For maskinoversettelse-oppgaver er BLEU (Bilingual Evaluation Understudy) et populært mål. BLEU måler likheten mellom modellens utgangs-oversettelse og profesjonelle menneske-oversettelser, ved hjelp av n-gram presisjon og en straffefaktor.
Nøkkelaspekter ved hvordan BLEU fungerer:
- Sammenligner overlap av n-grammer for n opptil 4 (unigrammer, bigrammer, trigrammer, 4-grammer).
- Beregner en geometrisk gjennomsnitt av n-gram presisjonene.
- Bruker en straffefaktor hvis oversettelsen er mye kortere enn referansen.
- Vanligvis varierer det fra 0 til 1, med 1 som perfekt match til referansen.
BLEU korrelerer rimelig godt med menneskelige vurderinger av oversettelses kvalitet. Men det har likevel begrensninger:
- Måler bare presisjon mot referanser, ikke rekall eller F1.
- Har problemer med kreative oversettelser som bruker forskjellige ord.
- Er utsatt for “gaming” med oversettelse-tricks.
Andre oversettelse-mål som METEOR og TER forsøker å forbedre BLEU sine svakheter. Men generelt måler ikke automatiske mål fullt ut oversettelses kvalitet.
Andre oppgaver
I tillegg til sammendrag og oversettelse, kan mål som F1, nøyaktighet, MSE og mer brukes til å evaluere LLM-ytelse på oppgaver som:
- Tekstklassifisering
- Informasjonsutvinning
- Spørsmål-svar
- Stemningsanalyse
- Grammatisk feil-detteksjon
Fordelen med oppgave-spesifikke mål er at evaluering kan være fullstendig automatisert ved hjelp av standardiserte datasett som SQuAD for QA og GLUE-benchmark for en rekke oppgaver. Resultatene kan lett spores over tid når modellene forbedres.
Men disse målene er smalt fokusert og kan ikke måle helhetlig språkkvalitet. LLM-er som utfører godt på mål for en enkelt oppgave kan feile i å generere koherent, logisk, nyttig tekst i generell.
Forsknings-benchmark
En populær måte å evaluere LLM-er på er å teste dem mot omfattende forsknings-benchmark som dekker diverse tema og ferdigheter. Disse benchmarkene tillater modellene å bli raskt testet i stor skala.
Noen kjente benchmark inkluderer:
- SuperGLUE – En utfordrende samling av 11 diverse språkoppgaver.
- GLUE – En samling av 9 setninger-forståelse-oppgaver. Enklere enn SuperGLUE.
- MMLU – 57 forskjellige STEM, samfunnsvitenskap og humanistiske oppgaver. Tester kunnskap og resonnerings-evne.
- Winograd Schema Challenge – Pronomen-resolusjons-problemer som krever vanlig fornuft.
- ARC – Utfordrende naturlig språk-resonnerings-oppgaver.
- Hellaswag – Vanlig fornuft-resonnering om situasjoner.
- PIQA – Fysikk-spørsmål som krever diagrammer.
Ved å evaluere på benchmark som disse, kan forskere raskt teste modellene på deres evne til å utføre matematikk, logikk, resonnering, kode, vanlig fornuft og mye mer. Prosenten av spørsmål som blir svart korrekt blir et benchmark-mål for å sammenligne modellene.
Men et stort problem med benchmark er trening-data-forurensning. Mange benchmark inneholder eksempler som allerede er sett av modellene under fortrening. Dette gjør det mulig for modellene å “huske” svarene på bestemte spørsmål og utføre bedre enn deres egentlige evner.
Forsøk gjøres for å “rense” benchmarkene ved å fjerne overlappende eksempler. Men dette er vanskelig å gjøre omfattende, spesielt når modellene kan ha sett omformulerte eller oversatte versjoner av spørsmål.
Så mens benchmark kan teste en bred samling av ferdigheter effektivt, kan de ikke pålitelig måle sanne resonnerings-evner eller unngå poeng-inflasjon på grunn av forurensning. Komplementære evaluering-metoder er nødvendige.
LLM-selv-evaluering
En interessant tilnærming er å la en LLM evaluere en annen LLMs utgang. Ideen er å utnytte den “enklere” oppgaven:
- Å produsere en høykvalitets-utgang kan være vanskelig for en LLM.
- Men å bestemme om en gitt utgang er av høy kvalitet kan være en enklere oppgave.
For eksempel, mens en LLM kan streve med å generere en faktisk, koherent paragraf fra scratch, kan den mer enkelt dømme om en gitt paragraf har logisk mening og passer konteksten.
Så prosessen er:
- Send innledning til første LLM for å generere utgang.
- Send innledning + generert utgang til andre “evaluerer” LLM.
- Spør evaluerer LLM et spørsmål for å vurdere utgangskvalitet. f.eks. “Gjør ovennevnte svar logisk mening?”
Dette tilnærmingen er rask å implementere og automatiserer LLM-evaluering. Men det finnes noen utfordringer:
- Ytelse avhenger sterkt av valg av evaluerer LLM og innlednings-ordlyd.
- Begrenset av vanskelighetsgraden til den opprinnelige oppgaven. Å evaluere kompleks resonnering er fortsatt vanskelig for LLM-er.
- Kan være datamessig dyrt hvis man bruker API-basert LLM-er.
Selv-evaluering er spesielt lovende for å vurdere hentet informasjon i RAG (retrieval-augmented generation)-systemer. Ekstra LLM-spørsmål kan validere om hentet kontekst blir brukt på en passende måte.
Overhodet er selv-evaluering lovende, men krever omsorg i implementeringen. Det komplementerer, i stedet for å erstatte, menneskelig evaluering.
Menneskelig evaluering
Gitt begrensningene til automatiske mål og benchmark, er menneskelig evaluering fortsatt gullstandarden for å strengt vurdere LLM-kvalitet.
Eksperter kan gi detaljerte kvalitative vurderinger på:
- Nøyaktighet og faktisk korrekthet
- Logikk, resonnering og vanlig fornuft
- Koherens, konsistens og lesbarhet
- Passende tone, stil og stemme
- Grammatisk korrekthet og flyt
- Kreativitet og nuanser
For å evaluere en modell, får mennesker en samling av innledninger og LLM-genererte svar. De vurderer kvaliteten på svarene, ofte ved hjelp av vurderingsskalaer og rubrikker.
Ulemper er at manuell menneskelig evaluering er dyrt, tregt og vanskelig å skala. Det krever også å utvikle standardiserte kriterier og trene vurderere til å bruke dem konsekvent.
Noen forskere har utforsket kreative måter å crowdfunde menneskelig LLM-evaluering ved hjelp av turnerings-stil-systemer hvor mennesker tipper og vurderer sammenligninger mellom modeller. Men dekningen er fortsatt begrenset sammenlignet med full manuell evaluering.
For bedrifts-sammenhenger hvor kvalitet betyr mer enn rå skala, forblir ekspert-menneskelig testing gullstandarden til tross for kostnadene. Dette er spesielt sant for risikofylte anvendelser av LLM-er.
Konklusjon
Å evaluere store språkmodeller grundig krever å bruke en divers verktøykasse av komplementære metoder, i stedet for å avhenge av en enkelt teknikk.
Ved å kombinere automatiske tilnærminger for hastighet med streng menneskelig tilsyn for nøyaktighet, kan vi utvikle pålitelige testmetoder for store språkmodeller. Med robust evaluering kan vi låse opp det enorme potensialet til LLM-er samtidig som vi håndterer deres risiko ansvarlig.












