Tankeledare

Benchmark för LLM

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Förstå rollen och begränsningarna för benchmarking i utvärdering av LLM-prestanda. Utforska tekniker för att utveckla robusta LLM.

Stora språkmodeller har blivit mycket populära under de senaste åren. Jag menar, du har sett det. LLM:s exceptionella förmåga att förstå mänskliga språkkommandon gjorde dem till den perfekta integrationen för företag, som stöder kritiska arbetsflöden och automatiserar uppgifter för maximal effektivitet. Plus, bortom den genomsnittliga användarens förståelse, finns det så mycket mer som LLM kan göra. Och när vår tillit till dem växer, måste vi verkligen fokusera mer på åtgärder för att säkerställa nödvändig noggrannhet och tillförlitlighet. Detta är en global uppgift som berör hela institutioner, men i affärsvärlden finns det nu flera benchmarking-verktyg som kan användas för att utvärdera LLM:s prestanda över olika domäner. Dessa kan testa modellens förmågor i förståelse, logiskt resonemang, matematik och så vidare, och resultaten avgör om en LLM är redo för affärsdistribution.

I den här artikeln har jag samlat en omfattande lista över de mest populära benchmarking-verktygen för LLM-utvärdering. Vi kommer att diskutera varje benchmark i detalj och se hur olika LLM:s presterar mot utvärderingskriterierna. Men först, låt oss förstå LLM-utvärdering i mer detalj.

Vad är LLM-utvärdering?

Liksom andra AI-modeller behöver LLM också utvärderas mot specifika benchmarking-verktyg som bedömer olika aspekter av språkmodellens prestanda: kunskap, noggrannhet, tillförlitlighet och konsekvens. Standarden innehåller vanligtvis:

  1. Förståelse av användarfrågor: Bedömning av modellens förmåga att korrekt förstå och tolka en mängd olika användarindata.
  2. Verifiering av utdata: Verifiering av AI-genererade svar mot en tillförlitlig kunskapsbas för att säkerställa att de är korrekta och relevanta.
  3. Robusthet: Mätning av hur väl modellen presterar med tvetydiga, ofullständiga eller brusiga indata.

LLM-utvärdering ger utvecklare möjlighet att identifiera och åtgärda begränsningar effektivt, så att de kan förbättra den övergripande användarupplevelsen. Om en LLM utvärderas grundligt, kommer den att vara tillräckligt noggrann och robust för att hantera olika realvärldstillämpningar, även de med tvetydiga eller oväntade indata.

Benchmarking

LLM är en av de mest komplicerade teknologierna hittills och kan driva till och med de mest krävande applikationerna. Så utvärderingsprocessen måste vara lika komplex, genom att testa dess tankeprocess och tekniska noggrannhet.

En benchmark använder specifika dataset, mått och utvärderingsuppgifter för att testa LLM-prestanda, och möjliggör jämförelse av olika LLM och mätning av deras noggrannhet, vilket i sin tur driver framsteg i branschen genom förbättrad prestanda.

Här är några av de vanligaste aspekterna av LLM-prestanda:

  • Kunskap: Modellens kunskap måste testas över olika domäner. Det är vad kunskapsbenchmark är till för. Det utvärderar hur effektivt modellen kan återkalla information från olika områden, som fysik, programmering, geografi och så vidare.
  • Logiskt resonemang: Det innebär att testa en modells förmåga att “tänka” steg för steg och dra en logisk slutsats, vilket vanligtvis involverar scenarier där modellen måste välja det mest sannolika fortsättningen eller förklaringen baserat på vardaglig kunskap och logiskt resonemang.
  • Läsförståelse: Modeller måste vara utmärkta på att tolka naturligt språk och generera svar därefter. Testet liknar att svara på frågor baserat på texter för att bedöma förståelse, inferens och detaljbevarande. Som ett skolprov.
  • Kodförståelse: Detta behövs för att mäta en modells färdighet i att förstå, skriva och felsöka kod. Dessa benchmarking-verktyg ger modellen koduppgifter eller problem som modellen måste lösa korrekt, ofta täckande en mängd programmeringsspråk och paradigm.
  • Världskunskap: För att utvärdera modellens grepp om allmän kunskap om världen. Dessa dataset innehåller vanligtvis frågor som kräver bred, encyklopedisk kunskap för att besvaras korrekt, vilket gör dem annorlunda än mer specifik och specialiserad kunskapsbenchmark.

“Kunskap” Benchmark

MMLU (Multimodal Language Understanding)

Denna benchmark är utformad för att testa LLM:s grepp om faktisk kunskap över olika ämnen som humaniora, samhällsvetenskap, historia, datavetenskap och till och med juridik. 57 frågor och 15 000 uppgifter, allt inriktat på att säkerställa att modellen har utmärkta resonemangsförmågor. Detta gör MMLU till ett bra verktyg för att utvärdera en LLM:s faktiska kunskap och resonemang när det gäller olika ämnen.

Nyligen har det blivit en nyckelbenchmark för utvärdering av LLM för ovan nämnda områden. Utvecklare vill alltid optimera sina modeller för att överträffa andra i denna benchmark, vilket gör det till en de facto-standard för utvärdering av avancerat resonemang och kunskap i LLM. Stora företagsmodeller har visat imponerande resultat på denna benchmark, inklusive GPT-4-omni på 88,7 %, Claude 3 Opus på 86,8 %, Gemini 1,5 Pro på 85,9 % och Llama-3 70B på 82 %. Små modeller presterar vanligtvis inte lika bra på denna benchmark, vanligtvis inte överstigande 60-65 %, men den senaste prestationen av Phi-3-Small-7b på 75,3 % är något att fundera på.

Men MMLU är inte utan nackdelar: det har kända problem som tvetydiga frågor, felaktiga svar och saknad kontext. Och många anser att vissa av dess uppgifter är för lätta för korrekt LLM-utvärdering.

Jag vill poängtera att benchmarking-verktyg som MMLU inte perfekt återger realvärldsscenarier. Om en LLM uppnår ett bra resultat på detta, betyder det inte alltid att den har blivit en ämnesexpert. Benchmarking-verktyg är verkligen begränsade till omfång och ofta baserade på flervalsfrågor, vilket inte kan fullt ut fånga komplexiteten och kontexten i realvärldssamspel. Sann förståelse kräver kunskap om fakta och tillämpning av den kunskapen dynamiskt, vilket innefattar kritiskt tänkande, problemlösning och kontextuell förståelse. Av dessa skäl måste LLM ständigt förfinas och uppdateras så att modellen behåller benchmarkens relevans och effektivitet.

GPQA (Graduate-Level Google-Proof Q&A Benchmark)

Denna benchmark utvärderar LLM på logiskt resonemang med hjälp av en dataset med bara 448 frågor. Domänexperter utvecklade det och det täcker ämnen inom biologi, fysik och kemi.

Varje fråga går igenom följande valideringsprocess:

  1. En expert inom samma ämne besvarar frågan och tillhandahåller detaljerad feedback.
  2. Frågeskaparen reviderar frågan baserat på denna feedback.
  3. En andra expert besvarar den reviderade frågan.

Denna process kan faktiskt säkerställa att frågorna är objektiva, korrekta och utmanande för en språkmodell. Även erfarna PhD-studenter uppnår bara en noggrannhet på 65 % på dessa frågor, medan GPT-4-omni når 53,6 %, vilket betonar gapet mellan mänsklig och maskinell intelligens.

På grund av de höga kvalifikationskraven är datasetet faktiskt ganska litet, vilket något begränsar dess statistiska kraft för att jämföra noggrannhet och kräver stora effektstorlekar. Experterna som skapade och validerade dessa frågor kom från Upwork, så de introducerade potentiellt bias baserat på sin expertis och de täckta ämnena.

Kodbenchmark

HumanEval

164 programmeringsuppgifter, en riktig utmaning för LLM:s kodningsförmåga. Det är HumanEval. Det är utformat för att testa de grundläggande kodningsförmågorna hos stora språkmodeller (LLM). Det använder pass@k-måttet för att bedöma den funktionella noggrannheten hos den genererade koden, vilket utdata sannolikheten för att minst en av de topp k LLM-genererade kodexemplen passerar testfallen.

Medan HumanEval-datasetet innehåller funktions-signaturer, docstrings, kodkroppar och flera enhetstester, innehåller det inte hela omfånget av realvärldscodingsproblem, vilket inte tillräckligt testar en modells förmåga att skapa korrekt kod för olika scenarier.

MBPP (Mostly Basic Python Programming)

Mbpp-benchmark består av 1 000 crowd-sourcade Python-programmeringsuppgifter. Dessa är ingångsnivåproblem och de fokuserar på grundläggande programmeringsfärdigheter. Det använder en few-shot och finjusteringsansats för att utvärdera modellprestanda, med större modeller som vanligtvis presterar bättre på detta dataset. Men eftersom datasetet innehåller främst ingångsnivåprogram, representerar det inte fullt ut komplexiteten och utmaningarna i realvärldstillämpningar.

Mattebenchmark

Medan de flesta LLM är ganska bra på att strukturera standardiserade svar, är matematiskt resonemang ett mycket större problem för dem. Varför? Eftersom det kräver färdigheter relaterade till frågeförståelse, ett steg-för-steg-logiskt tillvägagångssätt med matematiskt resonemang och att dra den korrekta slutsatsen.

“Chain of Thought” (CoT)-metoden är utformad för att utvärdera LLM på matte-relaterade benchmarking-verktyg, det involverar att uppmana modeller att förklara sin steg-för-steg resonemangsprocess när de löser ett problem. Det finns flera fördelar med detta. Det gör resonemangsprocessen mer transparent, hjälper till att identifiera brister i modellens logik och möjliggör en mer detaljerad bedömning av problemlösningsförmåga. Genom att bryta ned komplexa problem i en serie enklare steg kan CoT förbättra modellens prestanda på mattebenchmark och ge djupare insikter i dess resonemangsförmåga.

GSM8K: En populär mattebenchmark

En av de välkända benchmarking-verktygen för att utvärdera matteförmåga i LLM är GSM8K-datasetet. GSM8K består av 8 500 mellanstadiematematiska problem, som kräver flera steg för att lösas, och lösningar som främst involverar att utföra en sekvens av grundläggande beräkningar. Vanligtvis presterar större modeller eller de som specifikt tränats för matematiskt resonemang bättre på denna benchmark, t.ex. GPT-4-modeller som har en poäng på 96,5 %, medan DeepSeekMATH-RL-7B ligger strax efter på 88,2 %.

Medan GSM8K är användbart för att bedöma en modells förmåga att hantera grundskolenivås matematikproblem, fångar det kanske inte fullt ut en modells förmåga att lösa mer avancerade eller varierade matematiska utmaningar, vilket begränsar dess effektivitet som en omfattande måttstock för matteförmåga.

Matte-dataset: En omfattande alternativ

Matte-datasetet hanterade bristerna i benchmarking-verktyg som GSM8K. Detta dataset är mer omfattande, täcker grundläggande aritmetik till gymnasie- och till och med universitetsnivå. Det jämförs också med mänskliga prestationer, med en datavetenskaps-PhD-student som inte gillar matematik som uppnår en noggrannhet på 40 % och en guldmedaljör som uppnår en noggrannhet på 90 %.

Det ger en mer allsidig bedömning av en LLM:s matematiska förmåga. Det ser till att modellen är kompetent i grundläggande aritmetik och kapabel i komplexa områden som algebra, geometri och kalkyl. Men den ökade komplexiteten och mångfalden av problem kan göra det utmanande för modeller att uppnå hög noggrannhet, särskilt de som inte uttryckligen tränats på en mängd matematiska begrepp. Dessutom kan de varierande problemformaten i matte-datasetet introducera inkonsekvenser i modellprestanda, vilket gör det svårt att dra definitiva slutsatser om en modells övergripande matematiska förmåga.

Att använda CoT-metoden med matte-datasetet kan förbättra utvärderingen eftersom det avslöjar de steg-för-steg resonemangsförmågorna hos LLM över ett brett spektrum av matematiska utmaningar. En kombinerad ansats som denna säkerställer att det finns en mer robust och detaljerad utvärdering av en LLM:s sanna matematiska förmåga.

Läsförståelsebenchmark

En läsförståelseutvärdering bedömer modellens förmåga att förstå och bearbeta komplex text, vilket är särskilt viktigt för tillämpningar som kundsupport, innehållsgenerering och informationsåtervinning. Det finns flera benchmarking-verktyg utformade för att bedöma denna färdighet, var och en med unika egenskaper som bidrar till en omfattande utvärdering av en modells förmågor.

RACE (Läsförståelse-dataset från examinationer)

RACE-benchmark har nästan 28 000 passager och 100 000 frågor samlade från engelska prov för mellan- och högstadieelever i Kina i åldrarna 12-18. Det begränsar inte frågorna och svaren till att extraheras från de givna passagerna, vilket gör uppgifterna ännu mer utmanande.

Det täcker ett brett spektrum av ämnen och frågetyper, vilket gör det till en grundlig utvärdering och inkluderar frågor på olika svårighetsnivåer. Dessutom är frågorna i RACE specifikt utformade för att testa mänskliga läsfärdigheter och skapade av domänexperter.

Men benchmarken har några nackdelar. Eftersom det utvecklats från kinesiska utbildningsmaterial, är det benäget att introducera kulturella bias som inte återspeglar en global kontext. Dessutom är den höga svårighetsnivån i vissa frågor inte representativ för typiska realvärldsuppgifter. Så prestandautvärderingar kan vara inte så exakta.

DROP (Diskret resonemang över stycken)

En annan betydande ansats är DROP (Diskret resonemang över stycken), som utmanar modeller att utföra diskret resonemang över stycken. Det har 96 000 frågor för att testa resonemangsförmågorna hos LLM och frågorna är extraherade från Wikipedia och crowdsourcade från Amazon Mechanical Turk. DROP-frågor kräver ofta att modeller utför matematiska operationer som addition, subtraktion och jämförelse baserat på information spridd över en passage.

Frågorna är utmanande. De kräver att LLM lokalisera flera tal i passagen och addera eller subtrahera dem för att få det slutliga svaret. Stora modeller som GPT-4 och Palm uppnår 80 % respektive 85 %, medan mänskliga prestationer uppnår 96 % på DROP-datasetet.

Allmänbildningsbenchmark

Att testa allmänbildning i språkmodeller är en intressant men också viktig uppgift, eftersom det utvärderar en modells förmåga att göra bedömningar och inferenser som stämmer överens med mänskligt resonemang. Till skillnad från oss, som utvecklar en omfattande världsbild genom praktiska erfarenheter, tränas språkmodeller på stora dataset utan att inneboende förstå kontexten. Detta betyder att modeller kämpar med uppgifter som kräver en intuitiv förståelse av vardagliga situationer, logiskt resonemang och praktisk kunskap, som är viktiga för robusta och tillförlitliga AI-tillämpningar.

HellaSwag (Svårare slut, längre sammanhang och lågskottaktiviteter för situationer med adversariala generationer)

Hellaswag utvecklades av Rowan Zellers och kollegor vid University of Washington och Allen Institute for Artificial Intelligence. Det är utformat för att testa en modells förmåga att förutsäga den mest sannolika fortsättningen av en given scenario. Denna benchmark konstrueras med hjälp av Adversarial Filtering (AF), där en serie diskriminatörer iterativt väljer adversarialt maskin-genererade felaktiga svar. Denna metod skapar ett dataset med triviala exempel för människor men utmanande för modeller, vilket resulterar i en “Goldilocks”-zon av svårighet.

Medan Hellaswag tidigare utgjorde en utmaning för modeller, har state-of-the-art-modeller som GPT-4 uppnått prestandanivåer nära mänsklig noggrannhet, vilket indikerar betydande framsteg inom området. Men dessa resultat tyder på behovet av att kontinuerligt utveckla benchmarking-verktyg för att hålla jämna steg med framstegen inom AI-förmågor.

Openbook

Openbook-datasetet består av 5 957 grundskolenivås naturvetenskapsfrågor i flervalsform. Frågorna samlades in från öppna böcker och utvecklades för att bedöma mänsklig förståelse av ämnet.

Openbook-benchmark kräver resonemangsförmåga utöver informationsåtervinning. GPT-4 uppnår den högsta noggrannheten på 95,9 % hittills.

OpenbookQA är modellerad efter öppna böcker och består av 5 957 flervalsfrågor i grundskolenivås naturvetenskap. Dessa frågor är utformade för att testa förståelsen av 1 326 centrala naturvetenskapsfakta och deras tillämpning i nya situationer.

Liksom Hellaswag fann tidigare modeller OpenbookQA utmanande, men moderna modeller som GPT-4 har uppnått nästan mänsklig prestanda. Denna utveckling understryker vikten av att utveckla ännu mer komplexa och nyanserade benchmarking-verktyg för att fortsätta driva gränserna för AI-förståelse.

Räcker benchmarking-verktyg för LLM-prestandautvärdering?

Ja, medan de ger en standardiserad ansats för att utvärdera LLM-prestanda, kan de också vara vilseledande. Large Model Systems Organization säger att en bra LLM-benchmark bör vara skalbar, kunna utvärdera nya modeller med ett relativt litet antal försök och ge en unik rangordning för alla modeller. Men det finns skäl till varför de kanske inte räcker. Här är några:

Benchmark-läckage

Detta är ett vanligt problem, och det inträffar när träningsdata överlappar testdata, vilket leder till en vilseledande utvärdering. Om en modell redan har stött på vissa testfrågor under träningsprocessen, kan dess resultat inte alltid återspegla dess sanna förmågor. Men en idealisk benchmark bör minimera memorering och återspegla realvärldsscenarier.

Utvärderingsbias

LLM-benchmarking-ledartavlor används för att jämföra LLM:s prestanda på olika uppgifter. Men att förlita sig på dessa ledartavlor för modelljämförelse kan vara vilseledande. Enkla förändringar i benchmark-tester, som att ändra ordningen på frågorna, kan förskjuta modellernas rangordning med upp till åtta positioner. Dessutom kan LLM presterar olika beroende på poängsättningsmetoderna, vilket betonar vikten av att överväga utvärderingsbias.

Öppenhet

Realvärldssamspel med LLM involverar att utforma frågor för att generera önskade AI-utdata. LLM-utdata beror på frågornas effektivitet, och benchmarking-verktyg är utformade för att testa modellens kontextmedvetenhet. Medan benchmarking-verktyg är utformade för att testa en LLM:s kontextmedvetenhet, översätter de inte alltid direkt till realvärldprestanda. Till exempel, en modell som uppnår en 100 % poäng på en benchmark-dataset, som LSAT, garanterar inte samma nivå av noggrannhet i praktiska tillämpningar. Detta understryker vikten av att överväga den öppna karaktären hos realvärldsuppgifter i LLM-utvärdering.

Effektiv utvärdering för robusta LLM

Så, nu vet du att benchmarking-verktyg inte alltid är den bästa lösningen, eftersom de inte alltid kan generaliseras över alla problem. Men det finns andra sätt.

Anpassade benchmarking-verktyg

Dessa är perfekta för att testa specifika beteenden och funktioner i uppgiftsspecifika scenarier. Till exempel, om en LLM är utformad för medicinska officerare, kommer dataset samlade från medicinska miljöer att effektivt representera realvärldsscenarier. Dessa anpassade benchmarking-verktyg kan fokusera på domänspecifik språkförståelse, prestanda och unika kontextuella krav. Genom att anpassa benchmarking-verktygen till möjliga realvärldsscenarier kan du säkerställa att LLM presterar bra i allmänhet och utmärkt i de specifika uppgifter den är avsedd för. Detta kan hjälpa till att identifiera och åtgärda eventuella luckor eller svagheter i modellens förmågor i tid.

Data-läckage-detektionspipeline

Om du vill att dina utvärderingar ska “visa” integritet, är det viktigt att ha en data-läckage-fri benchmark-pipeline. Data-läckage inträffar när benchmark-data ingår i modellens förträningskorpus, vilket resulterar i konstgjorda höga prestandapoäng. För att undvika detta bör benchmarking-verktyg korsreferenseras mot förträningsdata. Dessutom bör steg tas för att undvika all tidigare sedd information. Detta kan innefatta att använda proprietära eller nyligen kuraterade dataset som hålls separata från modellens träningspipeline – detta kommer att säkerställa att prestandamåtten du får återspeglar modellens förmåga att generalisera väl.

Mänsklig utvärdering

Automatiserade mått på egen hand kan inte fånga hela spektrumet av en modells prestanda, särskilt när det gäller mycket nyanserade och subjektiva aspekter av språkförståelse och generering. Här ger mänsklig utvärdering en mycket bättre bedömning:

  • Anställa proffs som kan ge detaljerad och tillförlitlig utvärdering, särskilt för specialiserade domäner.
  • Crowdsourcing! Plattformar som Amazon Mechanical Turk tillåter dig att samla in många mänskliga bedömningar snabbt och till låg kostnad.
  • Community-återkoppling: Att använda plattformar som LMSYS-ledartavla-arena, där användare kan rösta och jämföra modeller, lägger till en extra lager av insikt. LMSYS Chatbot Arena Hard, till exempel, är särskilt effektivt i att belysa subtila skillnader mellan toppmodeller genom direkt användarinteraktion och röster.

Slutsats

Utan utvärdering och benchmarking skulle vi inte ha något sätt att veta om LLM:s förmåga att hantera realvärldsuppgifter är så noggrann och tillämplig som vi tror att den är. Men som jag sa, benchmarking-verktyg är inte alltid det perfekta sättet att kontrollera detta, de kan leda till luckor i LLM:s prestanda. Detta kan också bromsa utvecklingen av LLM som är verkligen robusta för arbete.

Detta är hur det bör vara i en ideal värld. LLM förstår användarfrågor, identifierar fel i frågor, slutför uppgifter som instruerats och genererar tillförlitliga utdata. Resultaten är redan bra men inte ideala. Här är där uppgiftsspecifika benchmarking-verktyg visar sig vara mycket användbara, liksom mänsklig utvärdering och detektering av benchmark-läckage. Genom att använda dessa får vi chansen att producera verkligen robusta LLM.

Irina Barskaya, PhD, är en framstående dataforskare med över ett decennium av erfarenhet, som omfattar både produktanalys och analys för banbrytande teknologier. Hon ledde skapandet och analysen av Yasmina, den första fullt fungerande lokala AI-baserade röstassistenten för Saudiarabien, som hanterar komplex datalokalisering och märkning för modern standardarabiska och saudiska dialekter. För närvarande leder Irina kvalitetsanalysen på Yandex, som driver framsteg inom AI-teknologier.