AI-modellen en platforms
Evaluatie van grote taalmodellen: een technische gids
Grote taalmodellen (LLM’s) zoals GPT-4, Claude en LLaMA zijn enorm populair geworden. Dankzij hun vermogen om indrukwekkend menselijke tekst te genereren, worden deze AI-systemen nu gebruikt voor alles, van contentcreatie tot klantenservicechatbots.
Maar hoe weten we of deze modellen eigenlijk goed zijn? Met nieuwe LLM’s die constant worden aangekondigd, allemaal bewerend dat ze groter en beter zijn, hoe kunnen we hun prestaties evalueren en vergelijken?
In deze uitgebreide gids zullen we de beste technieken voor het evalueren van grote taalmodellen onderzoeken. We zullen naar de voor- en nadelen van elke benadering kijken, wanneer ze het beste worden toegepast en hoe u ze in uw eigen LLM-testen kunt gebruiken.
Taakspecifieke metrieken
Een van de meest rechttoe rechtaan manieren om een LLM te evalueren is door het te testen op gevestigde NLP-taken met behulp van gestandaardiseerde metrieken. Bijvoorbeeld:
Samenvatting
Voor samenvattingsTaken worden metrieken zoals ROUGE (Recall-Oriented Understudy for Gisting Evaluation) vaak gebruikt. ROUGE vergelijkt de door het model gegenereerde samenvatting met een door een mens geschreven “referentie”samenvatting, waarbij de overlap van woorden of zinnen wordt geteld.
Er zijn verschillende varianten van ROUGE, elk met hun eigen voor- en nadelen:
- ROUGE-N: Vergelijkt de overlap van n-grammen (reeksen van N woorden). ROUGE-1 gebruikt unigrammen (enkelvoudige woorden), ROUGE-2 gebruikt bigrammen, enz. Het voordeel is dat het de woordvolgorde vastlegt, maar het kan te streng zijn.
- ROUGE-L: Gebaseerd op de langste gemeenschappelijke subreeks (LCS). Meer flexibel in woordvolgorde, maar richt zich op de belangrijkste punten.
- ROUGE-W: Weegt de LCS-overeenkomsten. Probeert ROUGE-L te verbeteren.
In het algemeen zijn ROUGE-metrieken snel, automatisch en werken ze goed voor het rangschikken van systeemsamenvattingen. Echter, ze meten geen coherentie of betekenis. Een samenvatting kan een hoge ROUGE-score krijgen en toch nonsensicaal zijn.
De formule voor ROUGE-N is:
ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑
Waar:
Count_{match}(gram_n)is het aantal n-grammen in zowel de gegenereerde als de referentiesamenvatting.Count(gram_n)is het aantal n-grammen in de referentiesamenvatting.
Voorbeeld voor ROUGE-1 (unigrammen):
- Gegenereerde samenvatting: “De kat zat.”
- Referentiesamenvatting: “De kat zat op de mat.”
- Overlappende unigrammen: “De”, “kat”, “zat”
- ROUGE-1-score = 3/5 = 0,6
ROUGE-L gebruikt de langste gemeenschappelijke subreeks (LCS). Het is flexibeler in woordvolgorde. De formule is:
ROUGE-L=���(generated,reference)max(length(generated), length(reference))
Waar LCS de lengte van de langste gemeenschappelijke subreeks is.
ROUGE-W weegt de LCS-overeenkomsten. Het houdt rekening met de significantie van elke overeenkomst in de LCS.
Vertaling
Voor machinetaakvertalingtaken is BLEU (Bilingual Evaluation Understudy) een populaire metriek. BLEU meet de gelijkenis tussen de uitvoer van het model en professionele menselijke vertalingen, met behulp van n-gramprecisie en een straf voor kortere vertalingen.
Sleutelaspecten van hoe BLEU werkt:
- Vergelijkt overlappende n-grammen voor n tot 4 (unigrammen, bigrammen, trigrammen, 4-grammen).
- Berekent een meetkundig gemiddelde van de n-gramprecisies.
- Past een straf toe als de vertaling veel korter is dan de referentie.
- Varieert meestal tussen 0 en 1, waarbij 1 een perfecte overeenkomst met de referentie is.
BLEU correleert redelijk goed met menselijke oordelen over de kwaliteit van de vertaling. Maar het heeft nog steeds beperkingen:
- Meet alleen precisie tegenover referenties, niet recall of F1.
- Heeft moeite met creatieve vertalingen met andere woorden.
- Gevolg voor “gaming” met vertalingstrucs.
Andere vertaalmetrieken zoals METEOR en TER proberen de zwakheden van BLEU te verbeteren. Maar in het algemeen vangen automatische metrieken de kwaliteit van de vertaling niet volledig.
Andere taken
Naast samenvatting en vertaling kunnen metrieken zoals F1, nauwkeurigheid, MSE en meer worden gebruikt om de prestaties van LLM’s te evalueren op taken zoals:
- Tekstclassificatie
- Informatie-extractie
- Vraagbeantwoording
- Sentimentanalyse
- Grammaticale foutdetectie
Het voordeel van taakspecifieke metrieken is dat de evaluatie volledig geautomatiseerd kan worden met behulp van gestandaardiseerde datasets zoals SQuAD voor QA en GLUE benchmark voor een reeks taken. Resultaten kunnen gemakkelijk over tijd worden gevolgd naarmate modellen verbeteren.
Echter, deze metrieken zijn smal gefocust en kunnen de algehele taalkwaliteit niet meten. LLM’s die goed presteren op metrieken voor één taak kunnen falen bij het genereren van coherente, logische, nuttige tekst in het algemeen.
Onderzoeksbenchmarks
Een populaire manier om LLM’s te evalueren is door ze te testen tegen brede onderzoeksbenchmarks die diverse onderwerpen en vaardigheden dekken. Deze benchmarks stellen modellen in staat om snel op grote schaal te worden getest.
Enkele bekende benchmarks zijn:
- SuperGLUE – Een uitdagende set van 11 diverse taaltaken.
- GLUE – Een collectie van 9 zinbegripsopdrachten. Eenvoudiger dan SuperGLUE.
- MMLU – 57 verschillende STEM-, sociaalwetenschappelijke en geesteswetenschappelijke taken. Test kennis en redeneervaardigheid.
- Winograd Schema Challenge – Pronomenresolutieproblemen die alledaagse redeneervaardigheid vereisen.
- ARC – Uitdagende natuurlijke taalredeneertaken.
- Hellaswag – Alledaagse redeneervaardigheid over situaties.
- PIQA – Fysieke vragen die diagrammen vereisen.
Door te evalueren op benchmarks zoals deze, kunnen onderzoekers snel modellen testen op hun vermogen om wiskunde, logica, redeneervaardigheid, codering, alledaagse redeneervaardigheid en veel meer te doen. Het percentage correct beantwoorde vragen wordt een benchmarkmetriek voor het vergelijken van modellen.
Echter, een groot probleem met benchmarks is trainingsgegevensverontreiniging. Veel benchmarks bevatten voorbeelden die al door modellen zijn gezien tijdens de voorafgaande training. Dit stelt modellen in staat om “antwoorden” op specifieke vragen te “onthouden” en beter te presteren dan hun werkelijke capaciteiten.
Pogingen worden gedaan om benchmarks te “decontamineren” door overlappende voorbeelden te verwijderen. Maar dit is moeilijk om uitgebreid te doen, vooral wanneer modellen mogelijk parafraseerde of vertaalde versies van vragen hebben gezien.
Dus, terwijl benchmarks een brede set vaardigheden efficiënt kunnen testen, kunnen ze de werkelijke redeneervaardigheid of scoreinflatie door verontreiniging niet betrouwbaar meten. Aanvullende evaluatiemethoden zijn nodig.
LLM-zelfevaluatie
Een intrigerende benadering is om een LLM de uitvoer van een andere LLM te laten evalueren. Het idee is om de “eenvoudigere” taakconcepten te benutten:
- Het produceren van een hoogwaardige uitvoer kan moeilijk zijn voor een LLM.
- Maar bepalen of een gegeven uitvoer van hoge kwaliteit is, kan een eenvoudigere taak zijn.
Bijvoorbeeld, terwijl een LLM moeite kan hebben om een feitelijke, coherente alinea van scratch te genereren, kan het gemakkelijker beoordelen of een gegeven alinea logisch is en in de context past.
Dus het proces is:
- Geef de invoerprompt door aan de eerste LLM om uitvoer te genereren.
- Geef de invoerprompt + gegenereerde uitvoer door aan de tweede “evaluator” LLM.
- Vraag de evaluator LLM een vraag om de kwaliteit van de uitvoer te beoordelen. Bijv. “Maakt de bovenstaande reactie logische zin?”
Deze benadering is snel te implementeren en automatiseert de evaluatie van LLM’s. Maar er zijn enkele uitdagingen:
- Prestaties zijn sterk afhankelijk van de keuze van de evaluator LLM en de formulering van de prompt.
- Beperkt door de moeilijkheid van de oorspronkelijke taak. Het evalueren van complexe redeneervaardigheid is nog steeds moeilijk voor LLM’s.
- Kan computationeel duur zijn als API-gebaseerde LLM’s worden gebruikt.
Zelfevaluatie is vooral veelbelovend voor het beoordelen van opgehaalde informatie in RAG (retrieval-augmented generation) systemen. Aanvullende LLM-vragen kunnen valideren of opgehaalde context op een adequate manier wordt gebruikt.
Al met al toont zelfevaluatie potentieel, maar vereist zorgvuldige implementatie. Het vult de menselijke evaluatie aan, maar vervangt deze niet.
Menselijke evaluatie
Gezien de beperkingen van geautomatiseerde metrieken en benchmarks, is menselijke evaluatie nog steeds de gouden standaard voor het grondig beoordelen van de kwaliteit van LLM’s.
Deskundigen kunnen gedetailleerde kwalitatieve beoordelingen geven over:
- Accuratesse en feitelijke correctheid
- Logica, redeneervaardigheid en alledaagse redeneervaardigheid
- Coherentie, consistentie en leesbaarheid
- Passendheid van toon, stijl en stem
- Grammaticaliteit en vloeiendheid
- Creativiteit en nuances
Om een model te evalueren, krijgen mensen een set invoerprompt en de LLM-gegenereerde antwoorden. Ze beoordelen de kwaliteit van de antwoorden, vaak met behulp van beoordelingsschalen en rubrieken.
Het nadeel is dat handmatige menselijke evaluatie duur, langzaam en moeilijk te schalen is. Het vereist ook het ontwikkelen van gestandaardiseerde criteria en het trainen van beoordelaars om deze consistent toe te passen.
Sommige onderzoekers hebben creatieve manieren onderzocht om menselijke LLM-evaluaties te crowdfunden met behulp van toernooi-achtige systemen waarin mensen inzetten op en beoordelen welke modellen het beste presteren. Maar de dekking is nog steeds beperkt in vergelijking met volledige handmatige evaluaties.
Voor bedrijfsgevallen waarin kwaliteit belangrijker is dan pure schaal, blijft expertbeoordeling de gouden standaard, ondanks de kosten. Dit is vooral waar voor riskantere toepassingen van LLM’s.
Conclusie
Het grondig evalueren van grote taalmodellen vereist het gebruik van een gevarieerd gereedschap van complementaire methoden, in plaats van te vertrouwen op één enkele techniek.
Door geautomatiseerde benaderingen voor snelheid te combineren met grondige menselijke toezicht voor nauwkeurigheid, kunnen we betrouwbare testmethoden voor grote taalmodellen ontwikkelen. Met robuuste evaluatie kunnen we het enorme potentieel van LLM’s ontsluiten en hun risico’s verantwoordelijk beheren.












