Liderzy opinii

Benchmarki dla LLM

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Zrozumienie roli i ograniczeń benchmarkÃģw w ocenie wydajności LLM. Poznanie technik rozwoju solidnych LLM.

DuÅže modele językowe zyskały ogromną popularność w ostatnich latach. Widzieliśmy to. Wyjątkowa zdolność LLM do zrozumienia poleceń językowych czyni je idealnymi do integracji z firmami, wspierającymi krytyczne przepływy pracy i automatyzującymi zadania do maksymalnej wydajności. Ponadto, poza zrozumieniem przeciętnego uÅžytkownika, istnieje wiele więcej, co LLM moÅže zrobić. A gdy nasza zaleÅžność od nich rośnie, musimy zwrÃģcić większą uwagę na środki zapewniające potrzebną dokładność i niezawodność. Jest to zadanie globalne, ktÃģre dotyczy całych instytucji, ale w dziedzinie firm istnieją juÅž kilka benchmarkÃģw, ktÃģre moÅžna wykorzystać do oceny wydajności LLM w rÃģÅžnych dziedzinach. Mogą one testować zdolności modelu w zakresie zrozumienia, logiki, matematyki itd., a wyniki określają, czy LLM jest gotowy do wdroÅženia w firmie.

W tym artykule zgromadziłem kompletną listę najpopularniejszych benchmarkÃģw do oceny LLM. OmÃģwimy kaÅždy benchmark szczegÃģłowo i zobaczymy, jak rÃģÅžne LLM radzą sobie z kryteriami oceny. Ale najpierw, zrozumijmy ocenę LLM bardziej szczegÃģłowo.

Co to jest ocena LLM?

Podobnie jak inne modele AI, LLM rÃģwnieÅž wymagają oceny w oparciu o określone benchmarki, ktÃģre oceniają rÃģÅžne aspekty wydajności modelu językowego: wiedzę, dokładność, niezawodność i spÃģjność. Standardowe wymagania obejmują:

  1. Zrozumienie zapytań uÅžytkownika: Ocena zdolności modelu do dokładnego zrozumienia i interpretacji szerokiego zakresu wejść uÅžytkownika.
  2. Weryfikacja wyjścia: Weryfikacja odpowiedzi wygenerowanych przez AI w oparciu o zaufany zbiÃģr wiedzy, aby upewnić się, Åže są one poprawne i istotne.
  3. Wytrzymałość: Pomiar, jak dobrze model radzi sobie z niejasnymi, niepełnymi lub szumowymi wejściami.

Ocena LLM daje deweloperom moÅžliwość identyfikacji i skutecznego rozwiązywania ograniczeń, aby poprawić ogÃģlne doświadczenie uÅžytkownika. Jeśli LLM jest starannie oceniony, będzie wystarczająco dokładny i wytrzymały, aby obsłuÅžyć rÃģÅžne aplikacje świata rzeczywistego, w tym te z niejasnymi lub nieoczekiwanymi wejściami.

Benchmarki

LLM to jeden z najbardziej skomplikowanych fragmentÃģw technologii do tej pory i moÅže napędzać nawet najtrudniejsze aplikacje. Zatem proces oceny musi być rÃģwnie złoÅžony, testując jego myślenie i techniczną dokładność.

Benchmark wykorzystuje określone zestawy danych, metryki i zadania oceny, aby przetestować wydajność LLM, umoÅžliwiając porÃģwnanie rÃģÅžnych LLM i pomiar ich dokładności, co z kolei napędza postęp w branÅžy poprzez poprawę wydajności.

Oto niektÃģre z najbardziej typowych aspektÃģw wydajności LLM:

  • Wiedza: Wiedza modelu musi być przetestowana w rÃģÅžnych dziedzinach. Dlatego właśnie istnieje benchmark wiedzy. Ocena, jak skutecznie model moÅže przypominać sobie informacje z rÃģÅžnych dziedzin, takich jak fizyka, programowanie, geografia itd.
  • Logiczne rozumowanie: Oznacza testowanie zdolności modelu do „myślenia” krok po kroku i wyprowadzania logicznego wniosku, zwykle obejmującego scenariusze, w ktÃģrych model musi wybrać najbardziej prawdopodobne kontynuowanie lub wyjaśnienie na podstawie codziennej wiedzy i logicznego rozumowania.
  • Zrozumienie czytania: Modele muszą być doskonałe w interpretacji języka naturalnego, a następnie generowaniu odpowiedzi odpowiednio. Test wygląda jak odpowiedzi na pytania oparte na fragmentach, aby ocenić zrozumienie, inferencję i pamięć szczegÃģłÃģw. Jak test czytania w szkole.
  • Zrozumienie kodu: Jest to konieczne do pomiaru biegłości modelu w zrozumieniu, pisaniu i debugowaniu kodu. Te benchmarki dają modelowi zadania programistyczne lub problemy, ktÃģre model musi rozwiązać dokładnie, często obejmując rÃģÅžne języki programowania i paradygmaty.
  • Wiedza o świecie: Aby ocenić zrozumienie modelu ogÃģlnej wiedzy o świecie. Te zestawy danych zwykle zawierają pytania, ktÃģre wymagają szerokiej, encyklopedycznej wiedzy, aby odpowiedzieć poprawnie, co odrÃģÅžnia je od bardziej specyficznych i wyspecjalizowanych benchmarkÃģw wiedzy.

Benchmarki „wiedzy”

MMLU (Multimodal Language Understanding)

Ten benchmark jest zaprojektowany do testowania zrozumienia LLM wiedzy faktograficznej w rÃģÅžnych tematach, takich jak humanistyka, nauki społeczne, historia, informatyka i prawo. 57 pytań i 15 000 zadań, wszystkie skierowane na zapewnienie, Åže model ma doskonałe zdolności rozumowania.

Ostatnio stał się kluczowym benchmarkiem do oceny LLM w powyÅžszych dziedzinach. Deweloperzy zawsze chcą zoptymalizować swoje modele, aby przewyÅžszyć inne w tym benchmarku, co czyni go de facto standardem dla oceny zaawansowanego rozumowania i wiedzy w LLM.

DuÅže, przedsiębiorcze modele pokazały imponujące wyniki w tym benchmarku, w tym GPT-4-omni z wynikiem 88,7%, Claude 3 Opus z wynikiem 86,8%, Gemini 1.5 Pro z wynikiem 85,9% i Llama-3 70B z wynikiem 82%. Małe modele zwykle nie radzą sobie tak dobrze w tym benchmarku, zwykle nie przekraczając 60-65%, ale ostatnie osiągnięcie Phi-3-Small-7b z wynikiem 75,3% jest godne uwagi.

GPQA (Graduate-Level Google-Proof Q&A Benchmark)

Ten benchmark ocenia LLM w zakresie logicznego rozumowania przy uÅžyciu zestawu danych z 448 pytaniami. Eksperci z dziedziny opracowali go, a on obejmuje tematy z biologii, fizyki i chemii.

KaÅžde pytanie przechodzi przez następujący proces weryfikacji:

  1. Ekspert z tej samej dziedziny odpowiada na pytanie i zapewnia szczegÃģłową informację zwrotną.
  2. Osoba tworząca pytanie modyfikuje pytanie na podstawie tej informacji zwrotnej.
  3. Drugi ekspert odpowiada na zmodyfikowane pytanie.

Ten proces moÅže rzeczywiście zapewnić, Åže pytania są obiektywne, dokładne i wymagające dla modelu językowego. Nawet doświadczeni studenci doktoranccy osiągają tylko 65% dokładności na tych pytaniach, podczas gdy GPT-4-omni osiąga tylko 53,6%, co podkreśla lukę między ludzką a maszynową inteligencją.

Benchmarki kodu

HumanEval

164 problemy programistyczne, prawdziwy test zdolności programistycznych LLM. To HumanEval. Został zaprojektowany do testowania podstawowych zdolności programistycznych duÅžych modeli językowych.

Zestaw danych HumanEval obejmuje sygnatury funkcji, docstringi, ciała kodu i kilka testÃģw jednostkowych, ale nie obejmuje pełnego zakresu problemÃģw programistycznych w świecie rzeczywistym, co nie wystarczająco testuje zdolności modelu do generowania poprawnego kodu w rÃģÅžnych scenariuszach.

MBPP (Mostly Basic Python Programming)

Benchmark MBPP składa się z 1000 crowdsourced pytań programistycznych w Pythonie. Są to problemy podstawowe i koncentrują się na podstawowych umiejętnościach programistycznych.

Benchmarki matematyczne

Podczas gdy większość LLM jest dobra w tworzeniu standardowych odpowiedzi, rozumowanie matematyczne jest o wiele większym problemem dla nich. Dlaczego? PoniewaÅž wymaga umiejętności związanych z zrozumieniem pytań, logicznym podejściem z rozumowaniem matematycznym i wyprowadzeniem poprawnej odpowiedzi.

Metoda „łańcucha myśli” (CoT) została opracowana w celu oceny LLM w zadaniach związanych z matematyką, polega na tym, Åže modele są proszone o wyjaśnienie swojego procesu myślowego podczas rozwiązywania problemu.

GSM8K: Popularny benchmark matematyczny

Jednym z popularnych benchmarkÃģw do oceny umiejętności matematycznych w LLM jest zestaw danych GSM8K. GSM8K składa się z 8,5 tys. problemÃģw matematycznych na poziomie szkoły średniej, ktÃģre wymagają kilku krokÃģw do rozwiązania, a rozwiązania obejmują wykonywanie sekwencji podstawowych obliczeń.

Zwykle większe modele lub te specjalnie przeszkolone do rozumowania matematycznego radzą sobie lepiej w tym benchmarku, np. modele GPT-4 osiągają wynik 96,5%, podczas gdy DeepSeekMATH-RL-7B osiąga 88,2%.

Zestaw danych matematyczny: Całkowita alternatywa

Zestaw danych matematyczny rozwiązuje ograniczenia benchmarkÃģw takich jak GSM8K. Ten zestaw danych jest bardziej obszerny, obejmując arytmetykę elementarną, matematykę na poziomie szkoły średniej i nawet college’u.

Dostarcza bardziej wszechstronną ocenę umiejętności matematycznych LLM. Zapewnia, Åže model jest biegły w podstawowej arytmetyce i kompetentny w złoÅžonych dziedzinach, takich jak algebra, geometria i rachunek.

Benchmarki zrozumienia czytania

Ocena zrozumienia czytania jest kluczowa, zwłaszcza w aplikacjach takich jak obsługa klienta, generowanie treści i odzyskiwanie informacji.

RACE (Zestaw danych zrozumienia czytania z egzaminÃģw)

Benchmark RACE zawiera prawie 28 000 fragmentÃģw i 100 000 pytań zebranych z egzaminÃģw angielskich dla uczniÃģw szkÃģł średnich w Chinach w wieku od 12 do 18 lat.

Obejmuje szeroki zakres tematÃģw i typÃģw pytań, co zapewnia gruntowną ocenę i zawiera pytania na rÃģÅžnych poziomach trudności.

DROP (Rozumowanie dyskretne nad akapitami)

Innym waÅžnym podejściem jest DROP, ktÃģry wyzwala modele do wykonania dyskretnego rozumowania nad akapitami.

DROP zawiera 96 000 pytań, aby przetestować zdolności rozumowania LLM, a pytania są wyodrębnione z Wikipedii i crowdsourced z Amazon Mechanical Turk.

Benchmarki zdrowego rozsądku

Testowanie zdrowego rozsądku w modelach językowych jest interesujące, ale takÅže kluczowe, poniewaÅž ocenia zdolność modelu do podejmowania osądÃģw i wnioskowań zgodnych z ludzkim rozumowaniem.

HellaSwag (Trudniejsze zakończenia, dłuÅžsze konteksty i niskie aktywności dla sytuacji z generacjami przeciwnymi)

HellaSwag został opracowany przez Rowana Zellersa i jego kolegÃģw z Uniwersytetu Waszyngtonu i Instytutu Sztucznej Inteligencji Allena.

Został zaprojektowany do testowania zdolności modelu do przewidywania najbardziej prawdopodobnego kontynuowania danego scenariusza.

Openbook

Zestaw danych Openbook składa się z 5957 pytań wielokrotnego wyboru na poziomie szkoły podstawowej.

Pytania są zebrane z egzaminÃģw otwartych i opracowane w celu oceny zrozumienia przez ludzi.

Czy benchmarki są wystarczające dla oceny wydajności LLM?

Tak, podczas gdy zapewniają standaryzowany sposÃģb oceny wydajności LLM, mogą być rÃģwnieÅž mylące.

Wyciek benchmarku

Jest to powszechne zjawisko, ktÃģre występuje, gdy dane treningowe pokrywają się z danymi testowymi, co prowadzi do mylącej oceny.

Sesja oceny

Listy rankingowe benchmarkÃģw LLM są wykorzystywane do porÃģwnania wydajności LLM w rÃģÅžnych zadaniach.

Otwartość

W interakcjach z LLM w świecie rzeczywistym projektowanie prompty do generowania poŞądanych wyjść AI jest kluczowe.

Skuteczna ocena dla solidnych LLM

Wiemy teraz, Åže benchmarki nie są zawsze najlepszym rozwiązaniem, poniewaÅž nie zawsze mogą uogÃģlniać na wszystkie problemy.

Niestandardowe benchmarki

Są one idealne do testowania określonych zachowań i funkcjonalności w określonych scenariuszach.

Potok wykrywania wycieku danych

Jeśli chcesz, aby Twoje oceny „pokazały” integralność, posiadanie potoku benchmarkowego wolnego od wycieku danych jest bardzo waÅžne.

Ocena ludzka

Automatyczne metryki same w sobie nie mogą uchwycić pełnego spektrum wydajności modelu, zwłaszcza w przypadku bardzo subtelnych i subiektywnych aspektÃģw zrozumienia i generowania języka.

Wnioski

Bez oceny i benchmarkingu nie mielibyśmy sposobu, aby wiedzieć, czy zdolność LLM do radzenia sobie z zadaniami świata rzeczywistego jest tak dokładna i stosowalna, jak się wydaje.

To jest sposÃģb, w jaki powinno to działać w idealnym świecie. LLM rozumie zapytania uÅžytkownika, identyfikuje błędy w promptach, wykonuje zadania zgodnie z instrukcjami i generuje niezawodne dane wyjściowe. Wyniki są juÅž bardzo dobre, ale nie idealne. To jest miejsce, w ktÃģrym benchmarki określonego zadania są bardzo pomocne, podobnie jak ocena ludzka i wykrywanie wycieku benchmarku. UÅžywając ich, mamy szansę na wytworzenie naprawdę solidnych LLM.

Irina Barskaya, PhD, to wybitny naukowiec danych z ponad dekadą doświadczenia, obejmującym zarÃģwno analitykę produktÃģw, jak i analitykę dla najnowocześniejszych technologii. Kierowała tworzeniem i analityką Yasminy, pierwszego w pełni funkcjonalnego lokalizowanego asystenta głosowego opartego na sztucznej inteligencji dla Arabii Saudyjskiej, zajmując się złoÅžoną lokalizacją danych i etykietowaniem dla języka arabskiego i dialektÃģw saudyjskich. Obecnie Irina kieruje analityką jakości w Yandex, napędzając postępy w technologiach sztucznej inteligencji.