Liderzy opinii
Benchmarki dla LLM
Zrozumienie roli i ograniczeń benchmarków w ocenie wydajności LLM. Poznanie technik rozwoju solidnych LLM.
Duże modele językowe zyskały ogromną popularność w ostatnich latach. Widzieliśmy to. Wyjątkowa zdolność LLM do zrozumienia poleceń językowych czyni je idealnymi do integracji z firmami, wspierającymi krytyczne przepływy pracy i automatyzującymi zadania do maksymalnej wydajności. Ponadto, poza zrozumieniem przeciętnego użytkownika, istnieje wiele więcej, co LLM może zrobić. A gdy nasza zależność od nich rośnie, musimy zwrócić większą uwagę na środki zapewniające potrzebną dokładność i niezawodność. Jest to zadanie globalne, które dotyczy całych instytucji, ale w dziedzinie firm istnieją już kilka benchmarków, które można wykorzystać do oceny wydajności LLM w różnych dziedzinach. Mogą one testować zdolności modelu w zakresie zrozumienia, logiki, matematyki itd., a wyniki określają, czy LLM jest gotowy do wdrożenia w firmie.
W tym artykule zgromadziłem kompletną listę najpopularniejszych benchmarków do oceny LLM. Omówimy każdy benchmark szczegółowo i zobaczymy, jak różne LLM radzą sobie z kryteriami oceny. Ale najpierw, zrozumijmy ocenę LLM bardziej szczegółowo.
Co to jest ocena LLM?
Podobnie jak inne modele AI, LLM również wymagają oceny w oparciu o określone benchmarki, które oceniają różne aspekty wydajności modelu językowego: wiedzę, dokładność, niezawodność i spójność. Standardowe wymagania obejmują:
- Zrozumienie zapytań użytkownika: Ocena zdolności modelu do dokładnego zrozumienia i interpretacji szerokiego zakresu wejść użytkownika.
- Weryfikacja wyjścia: Weryfikacja odpowiedzi wygenerowanych przez AI w oparciu o zaufany zbiór wiedzy, aby upewnić się, że są one poprawne i istotne.
- Wytrzymałość: Pomiar, jak dobrze model radzi sobie z niejasnymi, niepełnymi lub szumowymi wejściami.
Ocena LLM daje deweloperom możliwość identyfikacji i skutecznego rozwiązywania ograniczeń, aby poprawić ogólne doświadczenie użytkownika. Jeśli LLM jest starannie oceniony, będzie wystarczająco dokładny i wytrzymały, aby obsłużyć różne aplikacje świata rzeczywistego, w tym te z niejasnymi lub nieoczekiwanymi wejściami.
Benchmarki
LLM to jeden z najbardziej skomplikowanych fragmentów technologii do tej pory i może napędzać nawet najtrudniejsze aplikacje. Zatem proces oceny musi być równie złożony, testując jego myślenie i techniczną dokładność.
Benchmark wykorzystuje określone zestawy danych, metryki i zadania oceny, aby przetestować wydajność LLM, umożliwiając porównanie różnych LLM i pomiar ich dokładności, co z kolei napędza postęp w branży poprzez poprawę wydajności.
Oto niektóre z najbardziej typowych aspektów wydajności LLM:
- Wiedza: Wiedza modelu musi być przetestowana w różnych dziedzinach. Dlatego właśnie istnieje benchmark wiedzy. Ocena, jak skutecznie model może przypominać sobie informacje z różnych dziedzin, takich jak fizyka, programowanie, geografia itd.
- Logiczne rozumowanie: Oznacza testowanie zdolności modelu do „myślenia” krok po kroku i wyprowadzania logicznego wniosku, zwykle obejmującego scenariusze, w których model musi wybrać najbardziej prawdopodobne kontynuowanie lub wyjaśnienie na podstawie codziennej wiedzy i logicznego rozumowania.
- Zrozumienie czytania: Modele muszą być doskonałe w interpretacji języka naturalnego, a następnie generowaniu odpowiedzi odpowiednio. Test wygląda jak odpowiedzi na pytania oparte na fragmentach, aby ocenić zrozumienie, inferencję i pamięć szczegółów. Jak test czytania w szkole.
- Zrozumienie kodu: Jest to konieczne do pomiaru biegłości modelu w zrozumieniu, pisaniu i debugowaniu kodu. Te benchmarki dają modelowi zadania programistyczne lub problemy, które model musi rozwiązać dokładnie, często obejmując różne języki programowania i paradygmaty.
- Wiedza o świecie: Aby ocenić zrozumienie modelu ogólnej wiedzy o świecie. Te zestawy danych zwykle zawierają pytania, które wymagają szerokiej, encyklopedycznej wiedzy, aby odpowiedzieć poprawnie, co odróżnia je od bardziej specyficznych i wyspecjalizowanych benchmarków wiedzy.
Benchmarki „wiedzy”
MMLU (Multimodal Language Understanding)
Ten benchmark jest zaprojektowany do testowania zrozumienia LLM wiedzy faktograficznej w różnych tematach, takich jak humanistyka, nauki społeczne, historia, informatyka i prawo. 57 pytań i 15 000 zadań, wszystkie skierowane na zapewnienie, że model ma doskonałe zdolności rozumowania.
Ostatnio stał się kluczowym benchmarkiem do oceny LLM w powyższych dziedzinach. Deweloperzy zawsze chcą zoptymalizować swoje modele, aby przewyższyć inne w tym benchmarku, co czyni go de facto standardem dla oceny zaawansowanego rozumowania i wiedzy w LLM.
Duże, przedsiębiorcze modele pokazały imponujące wyniki w tym benchmarku, w tym GPT-4-omni z wynikiem 88,7%, Claude 3 Opus z wynikiem 86,8%, Gemini 1.5 Pro z wynikiem 85,9% i Llama-3 70B z wynikiem 82%. Małe modele zwykle nie radzą sobie tak dobrze w tym benchmarku, zwykle nie przekraczając 60-65%, ale ostatnie osiągnięcie Phi-3-Small-7b z wynikiem 75,3% jest godne uwagi.
GPQA (Graduate-Level Google-Proof Q&A Benchmark)
Ten benchmark ocenia LLM w zakresie logicznego rozumowania przy użyciu zestawu danych z 448 pytaniami. Eksperci z dziedziny opracowali go, a on obejmuje tematy z biologii, fizyki i chemii.
Każde pytanie przechodzi przez następujący proces weryfikacji:
- Ekspert z tej samej dziedziny odpowiada na pytanie i zapewnia szczegółową informację zwrotną.
- Osoba tworząca pytanie modyfikuje pytanie na podstawie tej informacji zwrotnej.
- Drugi ekspert odpowiada na zmodyfikowane pytanie.
Ten proces może rzeczywiście zapewnić, że pytania są obiektywne, dokładne i wymagające dla modelu językowego. Nawet doświadczeni studenci doktoranccy osiągają tylko 65% dokładności na tych pytaniach, podczas gdy GPT-4-omni osiąga tylko 53,6%, co podkreśla lukę między ludzką a maszynową inteligencją.
Benchmarki kodu
HumanEval
164 problemy programistyczne, prawdziwy test zdolności programistycznych LLM. To HumanEval. Został zaprojektowany do testowania podstawowych zdolności programistycznych dużych modeli językowych.
Zestaw danych HumanEval obejmuje sygnatury funkcji, docstringi, ciała kodu i kilka testów jednostkowych, ale nie obejmuje pełnego zakresu problemów programistycznych w świecie rzeczywistym, co nie wystarczająco testuje zdolności modelu do generowania poprawnego kodu w różnych scenariuszach.
MBPP (Mostly Basic Python Programming)
Benchmark MBPP składa się z 1000 crowdsourced pytań programistycznych w Pythonie. Są to problemy podstawowe i koncentrują się na podstawowych umiejętnościach programistycznych.
Benchmarki matematyczne
Podczas gdy większość LLM jest dobra w tworzeniu standardowych odpowiedzi, rozumowanie matematyczne jest o wiele większym problemem dla nich. Dlaczego? Ponieważ wymaga umiejętności związanych z zrozumieniem pytań, logicznym podejściem z rozumowaniem matematycznym i wyprowadzeniem poprawnej odpowiedzi.
Metoda „łańcucha myśli” (CoT) została opracowana w celu oceny LLM w zadaniach związanych z matematyką, polega na tym, że modele są proszone o wyjaśnienie swojego procesu myślowego podczas rozwiązywania problemu.
GSM8K: Popularny benchmark matematyczny
Jednym z popularnych benchmarków do oceny umiejętności matematycznych w LLM jest zestaw danych GSM8K. GSM8K składa się z 8,5 tys. problemów matematycznych na poziomie szkoły średniej, które wymagają kilku kroków do rozwiązania, a rozwiązania obejmują wykonywanie sekwencji podstawowych obliczeń.
Zwykle większe modele lub te specjalnie przeszkolone do rozumowania matematycznego radzą sobie lepiej w tym benchmarku, np. modele GPT-4 osiągają wynik 96,5%, podczas gdy DeepSeekMATH-RL-7B osiąga 88,2%.
Zestaw danych matematyczny: Całkowita alternatywa
Zestaw danych matematyczny rozwiązuje ograniczenia benchmarków takich jak GSM8K. Ten zestaw danych jest bardziej obszerny, obejmując arytmetykę elementarną, matematykę na poziomie szkoły średniej i nawet college’u.
Dostarcza bardziej wszechstronną ocenę umiejętności matematycznych LLM. Zapewnia, że model jest biegły w podstawowej arytmetyce i kompetentny w złożonych dziedzinach, takich jak algebra, geometria i rachunek.
Benchmarki zrozumienia czytania
Ocena zrozumienia czytania jest kluczowa, zwłaszcza w aplikacjach takich jak obsługa klienta, generowanie treści i odzyskiwanie informacji.
RACE (Zestaw danych zrozumienia czytania z egzaminów)
Benchmark RACE zawiera prawie 28 000 fragmentów i 100 000 pytań zebranych z egzaminów angielskich dla uczniów szkół średnich w Chinach w wieku od 12 do 18 lat.
Obejmuje szeroki zakres tematów i typów pytań, co zapewnia gruntowną ocenę i zawiera pytania na różnych poziomach trudności.
DROP (Rozumowanie dyskretne nad akapitami)
Innym ważnym podejściem jest DROP, który wyzwala modele do wykonania dyskretnego rozumowania nad akapitami.
DROP zawiera 96 000 pytań, aby przetestować zdolności rozumowania LLM, a pytania są wyodrębnione z Wikipedii i crowdsourced z Amazon Mechanical Turk.
Benchmarki zdrowego rozsądku
Testowanie zdrowego rozsądku w modelach językowych jest interesujące, ale także kluczowe, ponieważ ocenia zdolność modelu do podejmowania osądów i wnioskowań zgodnych z ludzkim rozumowaniem.
HellaSwag (Trudniejsze zakończenia, dłuższe konteksty i niskie aktywności dla sytuacji z generacjami przeciwnymi)
HellaSwag został opracowany przez Rowana Zellersa i jego kolegów z Uniwersytetu Waszyngtonu i Instytutu Sztucznej Inteligencji Allena.
Został zaprojektowany do testowania zdolności modelu do przewidywania najbardziej prawdopodobnego kontynuowania danego scenariusza.
Openbook
Zestaw danych Openbook składa się z 5957 pytań wielokrotnego wyboru na poziomie szkoły podstawowej.
Pytania są zebrane z egzaminów otwartych i opracowane w celu oceny zrozumienia przez ludzi.
Czy benchmarki są wystarczające dla oceny wydajności LLM?
Tak, podczas gdy zapewniają standaryzowany sposób oceny wydajności LLM, mogą być również mylące.
Wyciek benchmarku
Jest to powszechne zjawisko, które występuje, gdy dane treningowe pokrywają się z danymi testowymi, co prowadzi do mylącej oceny.
Sesja oceny
Listy rankingowe benchmarków LLM są wykorzystywane do porównania wydajności LLM w różnych zadaniach.
Otwartość
W interakcjach z LLM w świecie rzeczywistym projektowanie prompty do generowania pożądanych wyjść AI jest kluczowe.
Skuteczna ocena dla solidnych LLM
Wiemy teraz, że benchmarki nie są zawsze najlepszym rozwiązaniem, ponieważ nie zawsze mogą uogólniać na wszystkie problemy.
Niestandardowe benchmarki
Są one idealne do testowania określonych zachowań i funkcjonalności w określonych scenariuszach.
Potok wykrywania wycieku danych
Jeśli chcesz, aby Twoje oceny „pokazały” integralność, posiadanie potoku benchmarkowego wolnego od wycieku danych jest bardzo ważne.
Ocena ludzka
Automatyczne metryki same w sobie nie mogą uchwycić pełnego spektrum wydajności modelu, zwłaszcza w przypadku bardzo subtelnych i subiektywnych aspektów zrozumienia i generowania języka.
Wnioski
Bez oceny i benchmarkingu nie mielibyśmy sposobu, aby wiedzieć, czy zdolność LLM do radzenia sobie z zadaniami świata rzeczywistego jest tak dokładna i stosowalna, jak się wydaje.
To jest sposób, w jaki powinno to działać w idealnym świecie. LLM rozumie zapytania użytkownika, identyfikuje błędy w promptach, wykonuje zadania zgodnie z instrukcjami i generuje niezawodne dane wyjściowe. Wyniki są już bardzo dobre, ale nie idealne. To jest miejsce, w którym benchmarki określonego zadania są bardzo pomocne, podobnie jak ocena ludzka i wykrywanie wycieku benchmarku. Używając ich, mamy szansę na wytworzenie naprawdę solidnych LLM.












