Liderzy opinii
Benchmarki dla LLM
Zrozumienie roli i ograniczeÅ benchmarkÃģw w ocenie wydajnoÅci LLM. Poznanie technik rozwoju solidnych LLM.
DuÅže modele jÄzykowe zyskaÅy ogromnÄ popularnoÅÄ w ostatnich latach. WidzieliÅmy to. WyjÄ tkowa zdolnoÅÄ LLM do zrozumienia poleceÅ jÄzykowych czyni je idealnymi do integracji z firmami, wspierajÄ cymi krytyczne przepÅywy pracy i automatyzujÄ cymi zadania do maksymalnej wydajnoÅci. Ponadto, poza zrozumieniem przeciÄtnego uÅžytkownika, istnieje wiele wiÄcej, co LLM moÅže zrobiÄ. A gdy nasza zaleÅžnoÅÄ od nich roÅnie, musimy zwrÃģciÄ wiÄkszÄ uwagÄ na Årodki zapewniajÄ ce potrzebnÄ dokÅadnoÅÄ i niezawodnoÅÄ. Jest to zadanie globalne, ktÃģre dotyczy caÅych instytucji, ale w dziedzinie firm istniejÄ juÅž kilka benchmarkÃģw, ktÃģre moÅžna wykorzystaÄ do oceny wydajnoÅci LLM w rÃģÅžnych dziedzinach. MogÄ one testowaÄ zdolnoÅci modelu w zakresie zrozumienia, logiki, matematyki itd., a wyniki okreÅlajÄ , czy LLM jest gotowy do wdroÅženia w firmie.
W tym artykule zgromadziÅem kompletnÄ listÄ najpopularniejszych benchmarkÃģw do oceny LLM. OmÃģwimy kaÅždy benchmark szczegÃģÅowo i zobaczymy, jak rÃģÅžne LLM radzÄ sobie z kryteriami oceny. Ale najpierw, zrozumijmy ocenÄ LLM bardziej szczegÃģÅowo.
Co to jest ocena LLM?
Podobnie jak inne modele AI, LLM rÃģwnieÅž wymagajÄ oceny w oparciu o okreÅlone benchmarki, ktÃģre oceniajÄ rÃģÅžne aspekty wydajnoÅci modelu jÄzykowego: wiedzÄ, dokÅadnoÅÄ, niezawodnoÅÄ i spÃģjnoÅÄ. Standardowe wymagania obejmujÄ :
- Zrozumienie zapytaÅ uÅžytkownika: Ocena zdolnoÅci modelu do dokÅadnego zrozumienia i interpretacji szerokiego zakresu wejÅÄ uÅžytkownika.
- Weryfikacja wyjÅcia: Weryfikacja odpowiedzi wygenerowanych przez AI w oparciu o zaufany zbiÃģr wiedzy, aby upewniÄ siÄ, Åže sÄ one poprawne i istotne.
- WytrzymaÅoÅÄ: Pomiar, jak dobrze model radzi sobie z niejasnymi, niepeÅnymi lub szumowymi wejÅciami.
Ocena LLM daje deweloperom moÅžliwoÅÄ identyfikacji i skutecznego rozwiÄ zywania ograniczeÅ, aby poprawiÄ ogÃģlne doÅwiadczenie uÅžytkownika. JeÅli LLM jest starannie oceniony, bÄdzie wystarczajÄ co dokÅadny i wytrzymaÅy, aby obsÅuÅžyÄ rÃģÅžne aplikacje Åwiata rzeczywistego, w tym te z niejasnymi lub nieoczekiwanymi wejÅciami.
Benchmarki
LLM to jeden z najbardziej skomplikowanych fragmentÃģw technologii do tej pory i moÅže napÄdzaÄ nawet najtrudniejsze aplikacje. Zatem proces oceny musi byÄ rÃģwnie zÅoÅžony, testujÄ c jego myÅlenie i technicznÄ dokÅadnoÅÄ.
Benchmark wykorzystuje okreÅlone zestawy danych, metryki i zadania oceny, aby przetestowaÄ wydajnoÅÄ LLM, umoÅžliwiajÄ c porÃģwnanie rÃģÅžnych LLM i pomiar ich dokÅadnoÅci, co z kolei napÄdza postÄp w branÅžy poprzez poprawÄ wydajnoÅci.
Oto niektÃģre z najbardziej typowych aspektÃģw wydajnoÅci LLM:
- Wiedza: Wiedza modelu musi byÄ przetestowana w rÃģÅžnych dziedzinach. Dlatego wÅaÅnie istnieje benchmark wiedzy. Ocena, jak skutecznie model moÅže przypominaÄ sobie informacje z rÃģÅžnych dziedzin, takich jak fizyka, programowanie, geografia itd.
- Logiczne rozumowanie: Oznacza testowanie zdolnoÅci modelu do âmyÅleniaâ krok po kroku i wyprowadzania logicznego wniosku, zwykle obejmujÄ cego scenariusze, w ktÃģrych model musi wybraÄ najbardziej prawdopodobne kontynuowanie lub wyjaÅnienie na podstawie codziennej wiedzy i logicznego rozumowania.
- Zrozumienie czytania: Modele muszÄ byÄ doskonaÅe w interpretacji jÄzyka naturalnego, a nastÄpnie generowaniu odpowiedzi odpowiednio. Test wyglÄ da jak odpowiedzi na pytania oparte na fragmentach, aby oceniÄ zrozumienie, inferencjÄ i pamiÄÄ szczegÃģÅÃģw. Jak test czytania w szkole.
- Zrozumienie kodu: Jest to konieczne do pomiaru biegÅoÅci modelu w zrozumieniu, pisaniu i debugowaniu kodu. Te benchmarki dajÄ modelowi zadania programistyczne lub problemy, ktÃģre model musi rozwiÄ zaÄ dokÅadnie, czÄsto obejmujÄ c rÃģÅžne jÄzyki programowania i paradygmaty.
- Wiedza o Åwiecie: Aby oceniÄ zrozumienie modelu ogÃģlnej wiedzy o Åwiecie. Te zestawy danych zwykle zawierajÄ pytania, ktÃģre wymagajÄ szerokiej, encyklopedycznej wiedzy, aby odpowiedzieÄ poprawnie, co odrÃģÅžnia je od bardziej specyficznych i wyspecjalizowanych benchmarkÃģw wiedzy.
Benchmarki âwiedzyâ
MMLU (Multimodal Language Understanding)
Ten benchmark jest zaprojektowany do testowania zrozumienia LLM wiedzy faktograficznej w rÃģÅžnych tematach, takich jak humanistyka, nauki spoÅeczne, historia, informatyka i prawo. 57 pytaÅ i 15 000 zadaÅ, wszystkie skierowane na zapewnienie, Åže model ma doskonaÅe zdolnoÅci rozumowania.
Ostatnio staÅ siÄ kluczowym benchmarkiem do oceny LLM w powyÅžszych dziedzinach. Deweloperzy zawsze chcÄ zoptymalizowaÄ swoje modele, aby przewyÅžszyÄ inne w tym benchmarku, co czyni go de facto standardem dla oceny zaawansowanego rozumowania i wiedzy w LLM.
DuÅže, przedsiÄbiorcze modele pokazaÅy imponujÄ ce wyniki w tym benchmarku, w tym GPT-4-omni z wynikiem 88,7%, Claude 3 Opus z wynikiem 86,8%, Gemini 1.5 Pro z wynikiem 85,9% i Llama-3 70B z wynikiem 82%. MaÅe modele zwykle nie radzÄ sobie tak dobrze w tym benchmarku, zwykle nie przekraczajÄ c 60-65%, ale ostatnie osiÄ gniÄcie Phi-3-Small-7b z wynikiem 75,3% jest godne uwagi.
GPQA (Graduate-Level Google-Proof Q&A Benchmark)
Ten benchmark ocenia LLM w zakresie logicznego rozumowania przy uÅžyciu zestawu danych z 448 pytaniami. Eksperci z dziedziny opracowali go, a on obejmuje tematy z biologii, fizyki i chemii.
KaÅžde pytanie przechodzi przez nastÄpujÄ cy proces weryfikacji:
- Ekspert z tej samej dziedziny odpowiada na pytanie i zapewnia szczegÃģÅowÄ informacjÄ zwrotnÄ .
- Osoba tworzÄ ca pytanie modyfikuje pytanie na podstawie tej informacji zwrotnej.
- Drugi ekspert odpowiada na zmodyfikowane pytanie.
Ten proces moÅže rzeczywiÅcie zapewniÄ, Åže pytania sÄ obiektywne, dokÅadne i wymagajÄ ce dla modelu jÄzykowego. Nawet doÅwiadczeni studenci doktoranccy osiÄ gajÄ tylko 65% dokÅadnoÅci na tych pytaniach, podczas gdy GPT-4-omni osiÄ ga tylko 53,6%, co podkreÅla lukÄ miÄdzy ludzkÄ a maszynowÄ inteligencjÄ .
Benchmarki kodu
HumanEval
164 problemy programistyczne, prawdziwy test zdolnoÅci programistycznych LLM. To HumanEval. ZostaÅ zaprojektowany do testowania podstawowych zdolnoÅci programistycznych duÅžych modeli jÄzykowych.
Zestaw danych HumanEval obejmuje sygnatury funkcji, docstringi, ciaÅa kodu i kilka testÃģw jednostkowych, ale nie obejmuje peÅnego zakresu problemÃģw programistycznych w Åwiecie rzeczywistym, co nie wystarczajÄ co testuje zdolnoÅci modelu do generowania poprawnego kodu w rÃģÅžnych scenariuszach.
MBPP (Mostly Basic Python Programming)
Benchmark MBPP skÅada siÄ z 1000 crowdsourced pytaÅ programistycznych w Pythonie. SÄ to problemy podstawowe i koncentrujÄ siÄ na podstawowych umiejÄtnoÅciach programistycznych.
Benchmarki matematyczne
Podczas gdy wiÄkszoÅÄ LLM jest dobra w tworzeniu standardowych odpowiedzi, rozumowanie matematyczne jest o wiele wiÄkszym problemem dla nich. Dlaczego? PoniewaÅž wymaga umiejÄtnoÅci zwiÄ zanych z zrozumieniem pytaÅ, logicznym podejÅciem z rozumowaniem matematycznym i wyprowadzeniem poprawnej odpowiedzi.
Metoda âÅaÅcucha myÅliâ (CoT) zostaÅa opracowana w celu oceny LLM w zadaniach zwiÄ zanych z matematykÄ , polega na tym, Åže modele sÄ proszone o wyjaÅnienie swojego procesu myÅlowego podczas rozwiÄ zywania problemu.
GSM8K: Popularny benchmark matematyczny
Jednym z popularnych benchmarkÃģw do oceny umiejÄtnoÅci matematycznych w LLM jest zestaw danych GSM8K. GSM8K skÅada siÄ z 8,5 tys. problemÃģw matematycznych na poziomie szkoÅy Åredniej, ktÃģre wymagajÄ kilku krokÃģw do rozwiÄ zania, a rozwiÄ zania obejmujÄ wykonywanie sekwencji podstawowych obliczeÅ.
Zwykle wiÄksze modele lub te specjalnie przeszkolone do rozumowania matematycznego radzÄ sobie lepiej w tym benchmarku, np. modele GPT-4 osiÄ gajÄ wynik 96,5%, podczas gdy DeepSeekMATH-RL-7B osiÄ ga 88,2%.
Zestaw danych matematyczny: CaÅkowita alternatywa
Zestaw danych matematyczny rozwiÄ zuje ograniczenia benchmarkÃģw takich jak GSM8K. Ten zestaw danych jest bardziej obszerny, obejmujÄ c arytmetykÄ elementarnÄ , matematykÄ na poziomie szkoÅy Åredniej i nawet collegeâu.
Dostarcza bardziej wszechstronnÄ ocenÄ umiejÄtnoÅci matematycznych LLM. Zapewnia, Åže model jest biegÅy w podstawowej arytmetyce i kompetentny w zÅoÅžonych dziedzinach, takich jak algebra, geometria i rachunek.
Benchmarki zrozumienia czytania
Ocena zrozumienia czytania jest kluczowa, zwÅaszcza w aplikacjach takich jak obsÅuga klienta, generowanie treÅci i odzyskiwanie informacji.
RACE (Zestaw danych zrozumienia czytania z egzaminÃģw)
Benchmark RACE zawiera prawie 28 000 fragmentÃģw i 100 000 pytaÅ zebranych z egzaminÃģw angielskich dla uczniÃģw szkÃģÅ Årednich w Chinach w wieku od 12 do 18 lat.
Obejmuje szeroki zakres tematÃģw i typÃģw pytaÅ, co zapewnia gruntownÄ ocenÄ i zawiera pytania na rÃģÅžnych poziomach trudnoÅci.
DROP (Rozumowanie dyskretne nad akapitami)
Innym waÅžnym podejÅciem jest DROP, ktÃģry wyzwala modele do wykonania dyskretnego rozumowania nad akapitami.
DROP zawiera 96 000 pytaÅ, aby przetestowaÄ zdolnoÅci rozumowania LLM, a pytania sÄ wyodrÄbnione z Wikipedii i crowdsourced z Amazon Mechanical Turk.
Benchmarki zdrowego rozsÄ dku
Testowanie zdrowego rozsÄ dku w modelach jÄzykowych jest interesujÄ ce, ale takÅže kluczowe, poniewaÅž ocenia zdolnoÅÄ modelu do podejmowania osÄ dÃģw i wnioskowaÅ zgodnych z ludzkim rozumowaniem.
HellaSwag (Trudniejsze zakoÅczenia, dÅuÅžsze konteksty i niskie aktywnoÅci dla sytuacji z generacjami przeciwnymi)
HellaSwag zostaÅ opracowany przez Rowana Zellersa i jego kolegÃģw z Uniwersytetu Waszyngtonu i Instytutu Sztucznej Inteligencji Allena.
ZostaÅ zaprojektowany do testowania zdolnoÅci modelu do przewidywania najbardziej prawdopodobnego kontynuowania danego scenariusza.
Openbook
Zestaw danych Openbook skÅada siÄ z 5957 pytaÅ wielokrotnego wyboru na poziomie szkoÅy podstawowej.
Pytania sÄ zebrane z egzaminÃģw otwartych i opracowane w celu oceny zrozumienia przez ludzi.
Czy benchmarki sÄ wystarczajÄ ce dla oceny wydajnoÅci LLM?
Tak, podczas gdy zapewniajÄ standaryzowany sposÃģb oceny wydajnoÅci LLM, mogÄ byÄ rÃģwnieÅž mylÄ ce.
Wyciek benchmarku
Jest to powszechne zjawisko, ktÃģre wystÄpuje, gdy dane treningowe pokrywajÄ siÄ z danymi testowymi, co prowadzi do mylÄ cej oceny.
Sesja oceny
Listy rankingowe benchmarkÃģw LLM sÄ wykorzystywane do porÃģwnania wydajnoÅci LLM w rÃģÅžnych zadaniach.
OtwartoÅÄ
W interakcjach z LLM w Åwiecie rzeczywistym projektowanie prompty do generowania poÅžÄ danych wyjÅÄ AI jest kluczowe.
Skuteczna ocena dla solidnych LLM
Wiemy teraz, Åže benchmarki nie sÄ zawsze najlepszym rozwiÄ zaniem, poniewaÅž nie zawsze mogÄ uogÃģlniaÄ na wszystkie problemy.
Niestandardowe benchmarki
SÄ one idealne do testowania okreÅlonych zachowaÅ i funkcjonalnoÅci w okreÅlonych scenariuszach.
Potok wykrywania wycieku danych
JeÅli chcesz, aby Twoje oceny âpokazaÅyâ integralnoÅÄ, posiadanie potoku benchmarkowego wolnego od wycieku danych jest bardzo waÅžne.
Ocena ludzka
Automatyczne metryki same w sobie nie mogÄ uchwyciÄ peÅnego spektrum wydajnoÅci modelu, zwÅaszcza w przypadku bardzo subtelnych i subiektywnych aspektÃģw zrozumienia i generowania jÄzyka.
Wnioski
Bez oceny i benchmarkingu nie mielibyÅmy sposobu, aby wiedzieÄ, czy zdolnoÅÄ LLM do radzenia sobie z zadaniami Åwiata rzeczywistego jest tak dokÅadna i stosowalna, jak siÄ wydaje.
To jest sposÃģb, w jaki powinno to dziaÅaÄ w idealnym Åwiecie. LLM rozumie zapytania uÅžytkownika, identyfikuje bÅÄdy w promptach, wykonuje zadania zgodnie z instrukcjami i generuje niezawodne dane wyjÅciowe. Wyniki sÄ juÅž bardzo dobre, ale nie idealne. To jest miejsce, w ktÃģrym benchmarki okreÅlonego zadania sÄ bardzo pomocne, podobnie jak ocena ludzka i wykrywanie wycieku benchmarku. UÅžywajÄ c ich, mamy szansÄ na wytworzenie naprawdÄ solidnych LLM.












