Tankeledare
Benchmark fÃķr LLM
FÃķrstÃĨ rollen och begrÃĪnsningarna fÃķr benchmarking i utvÃĪrdering av LLM-prestanda. Utforska tekniker fÃķr att utveckla robusta LLM.
Stora sprÃĨkmodeller har blivit mycket populÃĪra under de senaste ÃĨren. Jag menar, du har sett det. LLM:s exceptionella fÃķrmÃĨga att fÃķrstÃĨ mÃĪnskliga sprÃĨkkommandon gjorde dem till den perfekta integrationen fÃķr fÃķretag, som stÃķder kritiska arbetsflÃķden och automatiserar uppgifter fÃķr maximal effektivitet. Plus, bortom den genomsnittliga anvÃĪndarens fÃķrstÃĨelse, finns det sÃĨ mycket mer som LLM kan gÃķra. Och nÃĪr vÃĨr tillit till dem vÃĪxer, mÃĨste vi verkligen fokusera mer pÃĨ ÃĨtgÃĪrder fÃķr att sÃĪkerstÃĪlla nÃķdvÃĪndig noggrannhet och tillfÃķrlitlighet. Detta ÃĪr en global uppgift som berÃķr hela institutioner, men i affÃĪrsvÃĪrlden finns det nu flera benchmarking-verktyg som kan anvÃĪndas fÃķr att utvÃĪrdera LLM:s prestanda Ãķver olika domÃĪner. Dessa kan testa modellens fÃķrmÃĨgor i fÃķrstÃĨelse, logiskt resonemang, matematik och sÃĨ vidare, och resultaten avgÃķr om en LLM ÃĪr redo fÃķr affÃĪrsdistribution.
I den hÃĪr artikeln har jag samlat en omfattande lista Ãķver de mest populÃĪra benchmarking-verktygen fÃķr LLM-utvÃĪrdering. Vi kommer att diskutera varje benchmark i detalj och se hur olika LLM:s presterar mot utvÃĪrderingskriterierna. Men fÃķrst, lÃĨt oss fÃķrstÃĨ LLM-utvÃĪrdering i mer detalj.
Vad ÃĪr LLM-utvÃĪrdering?
Liksom andra AI-modeller behÃķver LLM ocksÃĨ utvÃĪrderas mot specifika benchmarking-verktyg som bedÃķmer olika aspekter av sprÃĨkmodellens prestanda: kunskap, noggrannhet, tillfÃķrlitlighet och konsekvens. Standarden innehÃĨller vanligtvis:
- FÃķrstÃĨelse av anvÃĪndarfrÃĨgor: BedÃķmning av modellens fÃķrmÃĨga att korrekt fÃķrstÃĨ och tolka en mÃĪngd olika anvÃĪndarindata.
- Verifiering av utdata: Verifiering av AI-genererade svar mot en tillfÃķrlitlig kunskapsbas fÃķr att sÃĪkerstÃĪlla att de ÃĪr korrekta och relevanta.
- Robusthet: MÃĪtning av hur vÃĪl modellen presterar med tvetydiga, ofullstÃĪndiga eller brusiga indata.
LLM-utvÃĪrdering ger utvecklare mÃķjlighet att identifiera och ÃĨtgÃĪrda begrÃĪnsningar effektivt, sÃĨ att de kan fÃķrbÃĪttra den Ãķvergripande anvÃĪndarupplevelsen. Om en LLM utvÃĪrderas grundligt, kommer den att vara tillrÃĪckligt noggrann och robust fÃķr att hantera olika realvÃĪrldstillÃĪmpningar, ÃĪven de med tvetydiga eller ovÃĪntade indata.
Benchmarking
LLM ÃĪr en av de mest komplicerade teknologierna hittills och kan driva till och med de mest krÃĪvande applikationerna. SÃĨ utvÃĪrderingsprocessen mÃĨste vara lika komplex, genom att testa dess tankeprocess och tekniska noggrannhet.
En benchmark anvÃĪnder specifika dataset, mÃĨtt och utvÃĪrderingsuppgifter fÃķr att testa LLM-prestanda, och mÃķjliggÃķr jÃĪmfÃķrelse av olika LLM och mÃĪtning av deras noggrannhet, vilket i sin tur driver framsteg i branschen genom fÃķrbÃĪttrad prestanda.
HÃĪr ÃĪr nÃĨgra av de vanligaste aspekterna av LLM-prestanda:
- Kunskap: Modellens kunskap mÃĨste testas Ãķver olika domÃĪner. Det ÃĪr vad kunskapsbenchmark ÃĪr till fÃķr. Det utvÃĪrderar hur effektivt modellen kan ÃĨterkalla information frÃĨn olika omrÃĨden, som fysik, programmering, geografi och sÃĨ vidare.
- Logiskt resonemang: Det innebÃĪr att testa en modells fÃķrmÃĨga att âtÃĪnkaâ steg fÃķr steg och dra en logisk slutsats, vilket vanligtvis involverar scenarier dÃĪr modellen mÃĨste vÃĪlja det mest sannolika fortsÃĪttningen eller fÃķrklaringen baserat pÃĨ vardaglig kunskap och logiskt resonemang.
- LÃĪsfÃķrstÃĨelse: Modeller mÃĨste vara utmÃĪrkta pÃĨ att tolka naturligt sprÃĨk och generera svar dÃĪrefter. Testet liknar att svara pÃĨ frÃĨgor baserat pÃĨ texter fÃķr att bedÃķma fÃķrstÃĨelse, inferens och detaljbevarande. Som ett skolprov.
- KodfÃķrstÃĨelse: Detta behÃķvs fÃķr att mÃĪta en modells fÃĪrdighet i att fÃķrstÃĨ, skriva och felsÃķka kod. Dessa benchmarking-verktyg ger modellen koduppgifter eller problem som modellen mÃĨste lÃķsa korrekt, ofta tÃĪckande en mÃĪngd programmeringssprÃĨk och paradigm.
- VÃĪrldskunskap: FÃķr att utvÃĪrdera modellens grepp om allmÃĪn kunskap om vÃĪrlden. Dessa dataset innehÃĨller vanligtvis frÃĨgor som krÃĪver bred, encyklopedisk kunskap fÃķr att besvaras korrekt, vilket gÃķr dem annorlunda ÃĪn mer specifik och specialiserad kunskapsbenchmark.
âKunskapâ Benchmark
MMLU (Multimodal Language Understanding)
Denna benchmark ÃĪr utformad fÃķr att testa LLM:s grepp om faktisk kunskap Ãķver olika ÃĪmnen som humaniora, samhÃĪllsvetenskap, historia, datavetenskap och till och med juridik. 57 frÃĨgor och 15 000 uppgifter, allt inriktat pÃĨ att sÃĪkerstÃĪlla att modellen har utmÃĪrkta resonemangsfÃķrmÃĨgor. Detta gÃķr MMLU till ett bra verktyg fÃķr att utvÃĪrdera en LLM:s faktiska kunskap och resonemang nÃĪr det gÃĪller olika ÃĪmnen.
Nyligen har det blivit en nyckelbenchmark fÃķr utvÃĪrdering av LLM fÃķr ovan nÃĪmnda omrÃĨden. Utvecklare vill alltid optimera sina modeller fÃķr att ÃķvertrÃĪffa andra i denna benchmark, vilket gÃķr det till en de facto-standard fÃķr utvÃĪrdering av avancerat resonemang och kunskap i LLM. Stora fÃķretagsmodeller har visat imponerande resultat pÃĨ denna benchmark, inklusive GPT-4-omni pÃĨ 88,7 %, Claude 3 Opus pÃĨ 86,8 %, Gemini 1,5 Pro pÃĨ 85,9 % och Llama-3 70B pÃĨ 82 %. SmÃĨ modeller presterar vanligtvis inte lika bra pÃĨ denna benchmark, vanligtvis inte Ãķverstigande 60-65 %, men den senaste prestationen av Phi-3-Small-7b pÃĨ 75,3 % ÃĪr nÃĨgot att fundera pÃĨ.
Men MMLU ÃĪr inte utan nackdelar: det har kÃĪnda problem som tvetydiga frÃĨgor, felaktiga svar och saknad kontext. Och mÃĨnga anser att vissa av dess uppgifter ÃĪr fÃķr lÃĪtta fÃķr korrekt LLM-utvÃĪrdering.
Jag vill poÃĪngtera att benchmarking-verktyg som MMLU inte perfekt ÃĨterger realvÃĪrldsscenarier. Om en LLM uppnÃĨr ett bra resultat pÃĨ detta, betyder det inte alltid att den har blivit en ÃĪmnesexpert. Benchmarking-verktyg ÃĪr verkligen begrÃĪnsade till omfÃĨng och ofta baserade pÃĨ flervalsfrÃĨgor, vilket inte kan fullt ut fÃĨnga komplexiteten och kontexten i realvÃĪrldssamspel. Sann fÃķrstÃĨelse krÃĪver kunskap om fakta och tillÃĪmpning av den kunskapen dynamiskt, vilket innefattar kritiskt tÃĪnkande, problemlÃķsning och kontextuell fÃķrstÃĨelse. Av dessa skÃĪl mÃĨste LLM stÃĪndigt fÃķrfinas och uppdateras sÃĨ att modellen behÃĨller benchmarkens relevans och effektivitet.
GPQA (Graduate-Level Google-Proof Q&A Benchmark)
Denna benchmark utvÃĪrderar LLM pÃĨ logiskt resonemang med hjÃĪlp av en dataset med bara 448 frÃĨgor. DomÃĪnexperter utvecklade det och det tÃĪcker ÃĪmnen inom biologi, fysik och kemi.
Varje frÃĨga gÃĨr igenom fÃķljande valideringsprocess:
- En expert inom samma ÃĪmne besvarar frÃĨgan och tillhandahÃĨller detaljerad feedback.
- FrÃĨgeskaparen reviderar frÃĨgan baserat pÃĨ denna feedback.
- En andra expert besvarar den reviderade frÃĨgan.
Denna process kan faktiskt sÃĪkerstÃĪlla att frÃĨgorna ÃĪr objektiva, korrekta och utmanande fÃķr en sprÃĨkmodell. Ãven erfarna PhD-studenter uppnÃĨr bara en noggrannhet pÃĨ 65 % pÃĨ dessa frÃĨgor, medan GPT-4-omni nÃĨr 53,6 %, vilket betonar gapet mellan mÃĪnsklig och maskinell intelligens.
PÃĨ grund av de hÃķga kvalifikationskraven ÃĪr datasetet faktiskt ganska litet, vilket nÃĨgot begrÃĪnsar dess statistiska kraft fÃķr att jÃĪmfÃķra noggrannhet och krÃĪver stora effektstorlekar. Experterna som skapade och validerade dessa frÃĨgor kom frÃĨn Upwork, sÃĨ de introducerade potentiellt bias baserat pÃĨ sin expertis och de tÃĪckta ÃĪmnena.
Kodbenchmark
HumanEval
164 programmeringsuppgifter, en riktig utmaning fÃķr LLM:s kodningsfÃķrmÃĨga. Det ÃĪr HumanEval. Det ÃĪr utformat fÃķr att testa de grundlÃĪggande kodningsfÃķrmÃĨgorna hos stora sprÃĨkmodeller (LLM). Det anvÃĪnder pass@k-mÃĨttet fÃķr att bedÃķma den funktionella noggrannheten hos den genererade koden, vilket utdata sannolikheten fÃķr att minst en av de topp k LLM-genererade kodexemplen passerar testfallen.
Medan HumanEval-datasetet innehÃĨller funktions-signaturer, docstrings, kodkroppar och flera enhetstester, innehÃĨller det inte hela omfÃĨnget av realvÃĪrldscodingsproblem, vilket inte tillrÃĪckligt testar en modells fÃķrmÃĨga att skapa korrekt kod fÃķr olika scenarier.
MBPP (Mostly Basic Python Programming)
Mbpp-benchmark bestÃĨr av 1 000 crowd-sourcade Python-programmeringsuppgifter. Dessa ÃĪr ingÃĨngsnivÃĨproblem och de fokuserar pÃĨ grundlÃĪggande programmeringsfÃĪrdigheter. Det anvÃĪnder en few-shot och finjusteringsansats fÃķr att utvÃĪrdera modellprestanda, med stÃķrre modeller som vanligtvis presterar bÃĪttre pÃĨ detta dataset. Men eftersom datasetet innehÃĨller frÃĪmst ingÃĨngsnivÃĨprogram, representerar det inte fullt ut komplexiteten och utmaningarna i realvÃĪrldstillÃĪmpningar.
Mattebenchmark
Medan de flesta LLM ÃĪr ganska bra pÃĨ att strukturera standardiserade svar, ÃĪr matematiskt resonemang ett mycket stÃķrre problem fÃķr dem. VarfÃķr? Eftersom det krÃĪver fÃĪrdigheter relaterade till frÃĨgefÃķrstÃĨelse, ett steg-fÃķr-steg-logiskt tillvÃĪgagÃĨngssÃĪtt med matematiskt resonemang och att dra den korrekta slutsatsen.
âChain of Thoughtâ (CoT)-metoden ÃĪr utformad fÃķr att utvÃĪrdera LLM pÃĨ matte-relaterade benchmarking-verktyg, det involverar att uppmana modeller att fÃķrklara sin steg-fÃķr-steg resonemangsprocess nÃĪr de lÃķser ett problem. Det finns flera fÃķrdelar med detta. Det gÃķr resonemangsprocessen mer transparent, hjÃĪlper till att identifiera brister i modellens logik och mÃķjliggÃķr en mer detaljerad bedÃķmning av problemlÃķsningsfÃķrmÃĨga. Genom att bryta ned komplexa problem i en serie enklare steg kan CoT fÃķrbÃĪttra modellens prestanda pÃĨ mattebenchmark och ge djupare insikter i dess resonemangsfÃķrmÃĨga.
GSM8K: En populÃĪr mattebenchmark
En av de vÃĪlkÃĪnda benchmarking-verktygen fÃķr att utvÃĪrdera mattefÃķrmÃĨga i LLM ÃĪr GSM8K-datasetet. GSM8K bestÃĨr av 8 500 mellanstadiematematiska problem, som krÃĪver flera steg fÃķr att lÃķsas, och lÃķsningar som frÃĪmst involverar att utfÃķra en sekvens av grundlÃĪggande berÃĪkningar. Vanligtvis presterar stÃķrre modeller eller de som specifikt trÃĪnats fÃķr matematiskt resonemang bÃĪttre pÃĨ denna benchmark, t.ex. GPT-4-modeller som har en poÃĪng pÃĨ 96,5 %, medan DeepSeekMATH-RL-7B ligger strax efter pÃĨ 88,2 %.
Medan GSM8K ÃĪr anvÃĪndbart fÃķr att bedÃķma en modells fÃķrmÃĨga att hantera grundskolenivÃĨs matematikproblem, fÃĨngar det kanske inte fullt ut en modells fÃķrmÃĨga att lÃķsa mer avancerade eller varierade matematiska utmaningar, vilket begrÃĪnsar dess effektivitet som en omfattande mÃĨttstock fÃķr mattefÃķrmÃĨga.
Matte-dataset: En omfattande alternativ
Matte-datasetet hanterade bristerna i benchmarking-verktyg som GSM8K. Detta dataset ÃĪr mer omfattande, tÃĪcker grundlÃĪggande aritmetik till gymnasie- och till och med universitetsnivÃĨ. Det jÃĪmfÃķrs ocksÃĨ med mÃĪnskliga prestationer, med en datavetenskaps-PhD-student som inte gillar matematik som uppnÃĨr en noggrannhet pÃĨ 40 % och en guldmedaljÃķr som uppnÃĨr en noggrannhet pÃĨ 90 %.
Det ger en mer allsidig bedÃķmning av en LLM:s matematiska fÃķrmÃĨga. Det ser till att modellen ÃĪr kompetent i grundlÃĪggande aritmetik och kapabel i komplexa omrÃĨden som algebra, geometri och kalkyl. Men den Ãķkade komplexiteten och mÃĨngfalden av problem kan gÃķra det utmanande fÃķr modeller att uppnÃĨ hÃķg noggrannhet, sÃĪrskilt de som inte uttryckligen trÃĪnats pÃĨ en mÃĪngd matematiska begrepp. Dessutom kan de varierande problemformaten i matte-datasetet introducera inkonsekvenser i modellprestanda, vilket gÃķr det svÃĨrt att dra definitiva slutsatser om en modells Ãķvergripande matematiska fÃķrmÃĨga.
Att anvÃĪnda CoT-metoden med matte-datasetet kan fÃķrbÃĪttra utvÃĪrderingen eftersom det avslÃķjar de steg-fÃķr-steg resonemangsfÃķrmÃĨgorna hos LLM Ãķver ett brett spektrum av matematiska utmaningar. En kombinerad ansats som denna sÃĪkerstÃĪller att det finns en mer robust och detaljerad utvÃĪrdering av en LLM:s sanna matematiska fÃķrmÃĨga.
LÃĪsfÃķrstÃĨelsebenchmark
En lÃĪsfÃķrstÃĨelseutvÃĪrdering bedÃķmer modellens fÃķrmÃĨga att fÃķrstÃĨ och bearbeta komplex text, vilket ÃĪr sÃĪrskilt viktigt fÃķr tillÃĪmpningar som kundsupport, innehÃĨllsgenerering och informationsÃĨtervinning. Det finns flera benchmarking-verktyg utformade fÃķr att bedÃķma denna fÃĪrdighet, var och en med unika egenskaper som bidrar till en omfattande utvÃĪrdering av en modells fÃķrmÃĨgor.
RACE (LÃĪsfÃķrstÃĨelse-dataset frÃĨn examinationer)
RACE-benchmark har nÃĪstan 28 000 passager och 100 000 frÃĨgor samlade frÃĨn engelska prov fÃķr mellan- och hÃķgstadieelever i Kina i ÃĨldrarna 12-18. Det begrÃĪnsar inte frÃĨgorna och svaren till att extraheras frÃĨn de givna passagerna, vilket gÃķr uppgifterna ÃĪnnu mer utmanande.
Det tÃĪcker ett brett spektrum av ÃĪmnen och frÃĨgetyper, vilket gÃķr det till en grundlig utvÃĪrdering och inkluderar frÃĨgor pÃĨ olika svÃĨrighetsnivÃĨer. Dessutom ÃĪr frÃĨgorna i RACE specifikt utformade fÃķr att testa mÃĪnskliga lÃĪsfÃĪrdigheter och skapade av domÃĪnexperter.
Men benchmarken har nÃĨgra nackdelar. Eftersom det utvecklats frÃĨn kinesiska utbildningsmaterial, ÃĪr det benÃĪget att introducera kulturella bias som inte ÃĨterspeglar en global kontext. Dessutom ÃĪr den hÃķga svÃĨrighetsnivÃĨn i vissa frÃĨgor inte representativ fÃķr typiska realvÃĪrldsuppgifter. SÃĨ prestandautvÃĪrderingar kan vara inte sÃĨ exakta.
DROP (Diskret resonemang Ãķver stycken)
En annan betydande ansats ÃĪr DROP (Diskret resonemang Ãķver stycken), som utmanar modeller att utfÃķra diskret resonemang Ãķver stycken. Det har 96 000 frÃĨgor fÃķr att testa resonemangsfÃķrmÃĨgorna hos LLM och frÃĨgorna ÃĪr extraherade frÃĨn Wikipedia och crowdsourcade frÃĨn Amazon Mechanical Turk. DROP-frÃĨgor krÃĪver ofta att modeller utfÃķr matematiska operationer som addition, subtraktion och jÃĪmfÃķrelse baserat pÃĨ information spridd Ãķver en passage.
FrÃĨgorna ÃĪr utmanande. De krÃĪver att LLM lokalisera flera tal i passagen och addera eller subtrahera dem fÃķr att fÃĨ det slutliga svaret. Stora modeller som GPT-4 och Palm uppnÃĨr 80 % respektive 85 %, medan mÃĪnskliga prestationer uppnÃĨr 96 % pÃĨ DROP-datasetet.
AllmÃĪnbildningsbenchmark
Att testa allmÃĪnbildning i sprÃĨkmodeller ÃĪr en intressant men ocksÃĨ viktig uppgift, eftersom det utvÃĪrderar en modells fÃķrmÃĨga att gÃķra bedÃķmningar och inferenser som stÃĪmmer Ãķverens med mÃĪnskligt resonemang. Till skillnad frÃĨn oss, som utvecklar en omfattande vÃĪrldsbild genom praktiska erfarenheter, trÃĪnas sprÃĨkmodeller pÃĨ stora dataset utan att inneboende fÃķrstÃĨ kontexten. Detta betyder att modeller kÃĪmpar med uppgifter som krÃĪver en intuitiv fÃķrstÃĨelse av vardagliga situationer, logiskt resonemang och praktisk kunskap, som ÃĪr viktiga fÃķr robusta och tillfÃķrlitliga AI-tillÃĪmpningar.
HellaSwag (SvÃĨrare slut, lÃĪngre sammanhang och lÃĨgskottaktiviteter fÃķr situationer med adversariala generationer)
Hellaswag utvecklades av Rowan Zellers och kollegor vid University of Washington och Allen Institute for Artificial Intelligence. Det ÃĪr utformat fÃķr att testa en modells fÃķrmÃĨga att fÃķrutsÃĪga den mest sannolika fortsÃĪttningen av en given scenario. Denna benchmark konstrueras med hjÃĪlp av Adversarial Filtering (AF), dÃĪr en serie diskriminatÃķrer iterativt vÃĪljer adversarialt maskin-genererade felaktiga svar. Denna metod skapar ett dataset med triviala exempel fÃķr mÃĪnniskor men utmanande fÃķr modeller, vilket resulterar i en âGoldilocksâ-zon av svÃĨrighet.
Medan Hellaswag tidigare utgjorde en utmaning fÃķr modeller, har state-of-the-art-modeller som GPT-4 uppnÃĨtt prestandanivÃĨer nÃĪra mÃĪnsklig noggrannhet, vilket indikerar betydande framsteg inom omrÃĨdet. Men dessa resultat tyder pÃĨ behovet av att kontinuerligt utveckla benchmarking-verktyg fÃķr att hÃĨlla jÃĪmna steg med framstegen inom AI-fÃķrmÃĨgor.
Openbook
Openbook-datasetet bestÃĨr av 5 957 grundskolenivÃĨs naturvetenskapsfrÃĨgor i flervalsform. FrÃĨgorna samlades in frÃĨn Ãķppna bÃķcker och utvecklades fÃķr att bedÃķma mÃĪnsklig fÃķrstÃĨelse av ÃĪmnet.
Openbook-benchmark krÃĪver resonemangsfÃķrmÃĨga utÃķver informationsÃĨtervinning. GPT-4 uppnÃĨr den hÃķgsta noggrannheten pÃĨ 95,9 % hittills.
OpenbookQA ÃĪr modellerad efter Ãķppna bÃķcker och bestÃĨr av 5 957 flervalsfrÃĨgor i grundskolenivÃĨs naturvetenskap. Dessa frÃĨgor ÃĪr utformade fÃķr att testa fÃķrstÃĨelsen av 1 326 centrala naturvetenskapsfakta och deras tillÃĪmpning i nya situationer.
Liksom Hellaswag fann tidigare modeller OpenbookQA utmanande, men moderna modeller som GPT-4 har uppnÃĨtt nÃĪstan mÃĪnsklig prestanda. Denna utveckling understryker vikten av att utveckla ÃĪnnu mer komplexa och nyanserade benchmarking-verktyg fÃķr att fortsÃĪtta driva grÃĪnserna fÃķr AI-fÃķrstÃĨelse.
RÃĪcker benchmarking-verktyg fÃķr LLM-prestandautvÃĪrdering?
Ja, medan de ger en standardiserad ansats fÃķr att utvÃĪrdera LLM-prestanda, kan de ocksÃĨ vara vilseledande. Large Model Systems Organization sÃĪger att en bra LLM-benchmark bÃķr vara skalbar, kunna utvÃĪrdera nya modeller med ett relativt litet antal fÃķrsÃķk och ge en unik rangordning fÃķr alla modeller. Men det finns skÃĪl till varfÃķr de kanske inte rÃĪcker. HÃĪr ÃĪr nÃĨgra:
Benchmark-lÃĪckage
Detta ÃĪr ett vanligt problem, och det intrÃĪffar nÃĪr trÃĪningsdata Ãķverlappar testdata, vilket leder till en vilseledande utvÃĪrdering. Om en modell redan har stÃķtt pÃĨ vissa testfrÃĨgor under trÃĪningsprocessen, kan dess resultat inte alltid ÃĨterspegla dess sanna fÃķrmÃĨgor. Men en idealisk benchmark bÃķr minimera memorering och ÃĨterspegla realvÃĪrldsscenarier.
UtvÃĪrderingsbias
LLM-benchmarking-ledartavlor anvÃĪnds fÃķr att jÃĪmfÃķra LLM:s prestanda pÃĨ olika uppgifter. Men att fÃķrlita sig pÃĨ dessa ledartavlor fÃķr modelljÃĪmfÃķrelse kan vara vilseledande. Enkla fÃķrÃĪndringar i benchmark-tester, som att ÃĪndra ordningen pÃĨ frÃĨgorna, kan fÃķrskjuta modellernas rangordning med upp till ÃĨtta positioner. Dessutom kan LLM presterar olika beroende pÃĨ poÃĪngsÃĪttningsmetoderna, vilket betonar vikten av att ÃķvervÃĪga utvÃĪrderingsbias.
Ãppenhet
RealvÃĪrldssamspel med LLM involverar att utforma frÃĨgor fÃķr att generera Ãķnskade AI-utdata. LLM-utdata beror pÃĨ frÃĨgornas effektivitet, och benchmarking-verktyg ÃĪr utformade fÃķr att testa modellens kontextmedvetenhet. Medan benchmarking-verktyg ÃĪr utformade fÃķr att testa en LLM:s kontextmedvetenhet, ÃķversÃĪtter de inte alltid direkt till realvÃĪrldprestanda. Till exempel, en modell som uppnÃĨr en 100 % poÃĪng pÃĨ en benchmark-dataset, som LSAT, garanterar inte samma nivÃĨ av noggrannhet i praktiska tillÃĪmpningar. Detta understryker vikten av att ÃķvervÃĪga den Ãķppna karaktÃĪren hos realvÃĪrldsuppgifter i LLM-utvÃĪrdering.
Effektiv utvÃĪrdering fÃķr robusta LLM
SÃĨ, nu vet du att benchmarking-verktyg inte alltid ÃĪr den bÃĪsta lÃķsningen, eftersom de inte alltid kan generaliseras Ãķver alla problem. Men det finns andra sÃĪtt.
Anpassade benchmarking-verktyg
Dessa ÃĪr perfekta fÃķr att testa specifika beteenden och funktioner i uppgiftsspecifika scenarier. Till exempel, om en LLM ÃĪr utformad fÃķr medicinska officerare, kommer dataset samlade frÃĨn medicinska miljÃķer att effektivt representera realvÃĪrldsscenarier. Dessa anpassade benchmarking-verktyg kan fokusera pÃĨ domÃĪnspecifik sprÃĨkfÃķrstÃĨelse, prestanda och unika kontextuella krav. Genom att anpassa benchmarking-verktygen till mÃķjliga realvÃĪrldsscenarier kan du sÃĪkerstÃĪlla att LLM presterar bra i allmÃĪnhet och utmÃĪrkt i de specifika uppgifter den ÃĪr avsedd fÃķr. Detta kan hjÃĪlpa till att identifiera och ÃĨtgÃĪrda eventuella luckor eller svagheter i modellens fÃķrmÃĨgor i tid.
Data-lÃĪckage-detektionspipeline
Om du vill att dina utvÃĪrderingar ska âvisaâ integritet, ÃĪr det viktigt att ha en data-lÃĪckage-fri benchmark-pipeline. Data-lÃĪckage intrÃĪffar nÃĪr benchmark-data ingÃĨr i modellens fÃķrtrÃĪningskorpus, vilket resulterar i konstgjorda hÃķga prestandapoÃĪng. FÃķr att undvika detta bÃķr benchmarking-verktyg korsreferenseras mot fÃķrtrÃĪningsdata. Dessutom bÃķr steg tas fÃķr att undvika all tidigare sedd information. Detta kan innefatta att anvÃĪnda proprietÃĪra eller nyligen kuraterade dataset som hÃĨlls separata frÃĨn modellens trÃĪningspipeline â detta kommer att sÃĪkerstÃĪlla att prestandamÃĨtten du fÃĨr ÃĨterspeglar modellens fÃķrmÃĨga att generalisera vÃĪl.
MÃĪnsklig utvÃĪrdering
Automatiserade mÃĨtt pÃĨ egen hand kan inte fÃĨnga hela spektrumet av en modells prestanda, sÃĪrskilt nÃĪr det gÃĪller mycket nyanserade och subjektiva aspekter av sprÃĨkfÃķrstÃĨelse och generering. HÃĪr ger mÃĪnsklig utvÃĪrdering en mycket bÃĪttre bedÃķmning:
- AnstÃĪlla proffs som kan ge detaljerad och tillfÃķrlitlig utvÃĪrdering, sÃĪrskilt fÃķr specialiserade domÃĪner.
- Crowdsourcing! Plattformar som Amazon Mechanical Turk tillÃĨter dig att samla in mÃĨnga mÃĪnskliga bedÃķmningar snabbt och till lÃĨg kostnad.
- Community-ÃĨterkoppling: Att anvÃĪnda plattformar som LMSYS-ledartavla-arena, dÃĪr anvÃĪndare kan rÃķsta och jÃĪmfÃķra modeller, lÃĪgger till en extra lager av insikt. LMSYS Chatbot Arena Hard, till exempel, ÃĪr sÃĪrskilt effektivt i att belysa subtila skillnader mellan toppmodeller genom direkt anvÃĪndarinteraktion och rÃķster.
Slutsats
Utan utvÃĪrdering och benchmarking skulle vi inte ha nÃĨgot sÃĪtt att veta om LLM:s fÃķrmÃĨga att hantera realvÃĪrldsuppgifter ÃĪr sÃĨ noggrann och tillÃĪmplig som vi tror att den ÃĪr. Men som jag sa, benchmarking-verktyg ÃĪr inte alltid det perfekta sÃĪttet att kontrollera detta, de kan leda till luckor i LLM:s prestanda. Detta kan ocksÃĨ bromsa utvecklingen av LLM som ÃĪr verkligen robusta fÃķr arbete.
Detta ÃĪr hur det bÃķr vara i en ideal vÃĪrld. LLM fÃķrstÃĨr anvÃĪndarfrÃĨgor, identifierar fel i frÃĨgor, slutfÃķr uppgifter som instruerats och genererar tillfÃķrlitliga utdata. Resultaten ÃĪr redan bra men inte ideala. HÃĪr ÃĪr dÃĪr uppgiftsspecifika benchmarking-verktyg visar sig vara mycket anvÃĪndbara, liksom mÃĪnsklig utvÃĪrdering och detektering av benchmark-lÃĪckage. Genom att anvÃĪnda dessa fÃĨr vi chansen att producera verkligen robusta LLM.












