Modele i platformy AI
Ocena duÅžych modeli jÄzykowych: PodrÄcznik techniczny
DuÅže modele jÄzykowe (LLM) takie jak GPT-4, Claude i LLaMA zyskaÅy na popularnoÅci. DziÄki ich zdolnoÅci do generowania tekstÃģw, ktÃģre sÄ niezwykle podobne do ludzkich, te systemy AI sÄ teraz wykorzystywane do wszystkiego, od tworzenia treÅci po chatboty obsÅugujÄ ce klientÃģw.
Ale jak moÅžemy siÄ upewniÄ, Åže te modele sÄ naprawdÄ dobre? Z nowymi LLMami, ktÃģre sÄ ogÅaszane ciÄ gle, wszystkie twierdzÄ , Åže sÄ wiÄksze i lepsze, jak moÅžemy oceniÄ i porÃģwnaÄ ich wydajnoÅÄ?
W tym kompleksowym przewodniku, bÄdziemy badaÄ najlepsze techniki oceny duÅžych modeli jÄzykowych. BÄdziemy przyglÄ daÄ siÄ zaletom i wadom kaÅždego podejÅcia, kiedy sÄ one najlepiej stosowane i jak moÅžesz wykorzystaÄ je w swoich wÅasnych testach LLM.
Task-Specific Metrics
Jednym z najbardziej prostych sposobÃģw oceny LLM jest przetestowanie go na ustanowionych zadaniach NLP przy uÅžyciu standaryzowanych metryk. Na przykÅad:
Summarization
Dla zadaÅ podsumowujÄ cych, metryki takie jak ROUGE (Recall-Oriented Understudy for Gisting Evaluation) sÄ powszechnie uÅžywane. ROUGE porÃģwnuje podsumowanie wygenerowane przez model z ludzkim âodniesieniemâ podsumowaniem, liczÄ c nachodzenie sÅÃģw lub fraz.
Istnieje kilka odmian ROUGE, kaÅžda z wÅasnymi zaletami i wadami:
- ROUGE-N: PorÃģwnuje nachodzenie n-gramÃģw (sekwencji N sÅÃģw). ROUGE-1 uÅžywa unigramÃģw (jednego sÅowa), ROUGE-2 uÅžywa bigramÃģw itd. ZaletÄ jest to, Åže ujmuje kolejnoÅÄ sÅÃģw, ale moÅže byÄ zbyt surowy.
- ROUGE-L: Opiera siÄ na najdÅuÅžszej wspÃģlnej sekwencji (LCS). Bardziej elastyczny w kwestii kolejnoÅci sÅÃģw, ale koncentruje siÄ na gÅÃģwnych punktach.
- ROUGE-W: Waguje dopasowania LCS ich znaczeniem. PrÃģbuje poprawiÄ ROUGE-L.
OgÃģlnie, metryki ROUGE sÄ szybkie, automatyczne i dziaÅajÄ dobrze dla oceny podsumowaÅ systemÃģw. Jednak nie mierzÄ spÃģjnoÅci ani znaczenia. Podsumowanie moÅže uzyskaÄ wysoki wynik ROUGE i nadal byÄ nonsensem.
WzÃģr dla ROUGE-N to:
ROUGE-N=ââ{Reference Summaries}ââïŋ―â{Reference Summaries}â
Gdzie:
Count_{match}(gram_n)to liczba n-gramÃģw w podsumowaniu wygenerowanym i odniesieniowym.Count(gram_n)to liczba n-gramÃģw w odniesieniowym podsumowaniu.
Na przykÅad, dla ROUGE-1 (unigramÃģw):
- Podsumowanie wygenerowane: âKot siedziaÅ.â
- Podsumowanie odniesieniowe: âKot siedziaÅ na macie.â
- NachodzÄ ce unigramy: âKotâ, âsiedziaÅâ
- Wynik ROUGE-1 = 2/3 = 0,67
ROUGE-L uÅžywa najdÅuÅžszej wspÃģlnej sekwencji (LCS). Jest bardziej elastyczny w kwestii kolejnoÅci sÅÃģw. WzÃģr to:
ROUGE-L=ïŋ―ïŋ―ïŋ―(generated,reference)max(length(generated), length(reference))
Gdzie LCS to dÅugoÅÄ najdÅuÅžszej wspÃģlnej sekwencji.
ROUGE-W waguje dopasowania LCS. UwzglÄdnia znaczenie kaÅždego dopasowania w LCS.
TÅumaczenie
Dla zadaÅ tÅumaczenia maszynowego, BLEU (Bilingual Evaluation Understudy) jest popularnÄ metrykÄ . BLEU mierzy podobieÅstwo miÄdzy wyjÅciem modelu a tÅumaczeniami wykonanymi przez ludzi, przy uÅžyciu precyzji n-gramÃģw i kary za krÃģtkoÅÄ.
Kluczowe aspekty, jak BLEU dziaÅa:
- PorÃģwnuje nachodzenie n-gramÃģw dla n do 4 (unigramÃģw, bigramÃģw, trigramÃģw, 4-gramÃģw).
- Oblicza ÅredniÄ geometrycznÄ precyzji n-gramÃģw.
- Stosuje karÄ za krÃģtkoÅÄ, jeÅli tÅumaczenie jest znacznie krÃģtsze niÅž odniesienie.
- OgÃģlnie mieÅci siÄ w zakresie od 0 do 1, przy czym 1 oznacza idealne dopasowanie do odniesienia.
BLEU koreluje rozsÄ dnie dobrze z ludzkimi ocenami jakoÅci tÅumaczenia. Ale ma ograniczenia:
- Mierzy tylko precyzjÄ wobec odniesieÅ, a nie recall ani F1.
- MiaÅkuje z kreatywnymi tÅumaczeniami, ktÃģre uÅžywajÄ rÃģÅžnych sÅÃģw.
- Podatny na âoszukiwanieâ z sztuczkami tÅumaczeniowymi.
Inne metryki tÅumaczeniowe, takie jak METEOR i TER, prÃģbujÄ poprawiÄ sÅaboÅci BLEU. Ale ogÃģlnie, automatyczne metryki nie w peÅni ujmujÄ jakoÅÄ tÅumaczenia.
Inne zadania
OprÃģcz podsumowania i tÅumaczenia, metryki takie jak F1, dokÅadnoÅÄ, MSE i wiÄcej mogÄ byÄ uÅžywane do oceny wydajnoÅci LLM w zadaniach takich jak:
- Klasyfikacja tekstu
- Ekstrakcja informacji
- Odpowiadanie na pytania
- Analiza sentimentu
- Wykrywanie bÅÄdÃģw gramatycznych
Zaleta metryk zaleÅžnych od zadania jest to, Åže ocena moÅže byÄ w peÅni zautomatyzowana przy uÅžyciu standardowych zestawÃģw danych, takich jak SQuAD dla QA i GLUE benchmark dla szeregu zadaÅ. Wyniki mogÄ byÄ Åatwo Åledzone w czasie, gdy modele sÄ ulepszane.
Jednak te metryki sÄ wÄ sko ukierunkowane i nie mogÄ mierzyÄ ogÃģlnej jakoÅci jÄzyka. LLM, ktÃģre wykonujÄ dobrze na metrykach dla jednego zadania, mogÄ zawieÅÄ w generowaniu spÃģjnych, logicznych, pomocnych tekstÃģw w ogÃģle.
Badawcze punkty odniesienia
Popularnym sposobem oceny LLM jest testowanie ich wobec szeroko zakrojonych badaÅ punktÃģw odniesienia, pokrywajÄ cych rÃģÅžnorodne tematy i umiejÄtnoÅci. Te punkty odniesienia pozwalajÄ modelom byÄ szybko testowanymi na duÅžÄ skalÄ.
NiektÃģre znane punkty odniesienia to:
- SuperGLUE â Wyzwania zestaw 11 rÃģÅžnorodnych zadaÅ jÄzykowych.
- GLUE â ZbiÃģr 9 zadaÅ zrozumienia zdania. Prostszy niÅž SuperGLUE.
- MMLU â 57 rÃģÅžnych zadaÅ z dziedziny STEM, nauk spoÅecznych i humanistycznych. Testuje wiedzÄ i zdolnoÅÄ rozumowania.
- Winograd Schema Challenge â Zadania rozwiÄ zywania pronomenÃģw wymagajÄ ce zdroworozsÄ dkowego rozumowania.
- ARC â Wyzwania zadania jÄzykowego wymagajÄ cego naturalnego rozumowania.
- Hellaswag â Zadania wymagajÄ ce zdroworozsÄ dkowego rozumowania w sytuacjach.
- PIQA â Zadania fizyczne wymagajÄ ce diagramÃģw.
Przez ocenÄ na punktach odniesienia, takich jak te, badacze mogÄ szybko testowaÄ modele na ich zdolnoÅÄ do wykonywania matematyki, logiki, rozumowania, kodowania, zdroworozsÄ dkowego myÅlenia i wiele wiÄcej. Procent poprawnie odpowiedzianych pytaÅ staje siÄ metrykÄ porÃģwnawczÄ dla modeli.
Jednak gÅÃģwnym problemem z punktami odniesienia jest zanieczyszczenie danych szkoleniowych. Wiele punktÃģw odniesienia zawiera przykÅady, ktÃģre byÅy juÅž widziane przez modele podczas pre-trenowania. To pozwala modelom âzapamiÄtaÄâ odpowiedzi na okreÅlone pytania i wykonywaÄ lepiej niÅž ich rzeczywiste moÅžliwoÅci.
Podejmowane sÄ prÃģby âoczyszczeniaâ punktÃģw odniesienia poprzez usuniÄcie nakÅadajÄ cych siÄ przykÅadÃģw. Ale jest to trudne do wykonania w sposÃģb kompleksowy, zwÅaszcza gdy modele mogÅy zobaczyÄ przeredagowane lub przetÅumaczone wersje pytaÅ.
WiÄc chociaÅž punkty odniesienia mogÄ testowaÄ szeroki zakres umiejÄtnoÅci wydajnie, nie mogÄ niezawodnie mierzyÄ prawdziwych zdolnoÅci rozumowania ani uniknÄ Ä inflacji wynikÃģw z powodu zanieczyszczenia. Wymagane sÄ uzupeÅniajÄ ce metody oceny.
Ocena LLM
IntrygujÄ cym podejÅciem jest ocena jednego LLM przez inny LLM. PomysÅ polega na wykorzystaniu âÅatwiejszegoâ zadania:
- Wytwarzanie wysokiej jakoÅci wyjÅcia moÅže byÄ trudne dla LLM.
- Ale okreÅlenie, czy dane wyjÅcie jest wysokiej jakoÅci, moÅže byÄ Åatwiejszym zadaniem.
Na przykÅad, podczas gdy LLM moÅže mieÄ trudnoÅci z wygenerowaniem faktualnego, spÃģjnego akapitu od podstaw, moÅže Åatwiej oceniÄ, czy dany akapit ma logiczny sens i pasuje do kontekstu.
WiÄc proces jest:
- Przekazujesz wejÅciowy sygnaÅ do pierwszego LLM, aby wygenerowaÄ wyjÅcie.
- Przekazujesz wejÅciowy sygnaÅ + wygenerowane wyjÅcie do drugiego âoceniajÄ cegoâ LLM.
- Zadajesz oceniajÄ cemu LLM pytanie, aby oceniÄ jakoÅÄ wyjÅcia. Na przykÅad: âCzy powyÅžsza odpowiedÅš ma logiczny sens?â
To podejÅcie jest szybkie do wdroÅženia i automatyzuje ocenÄ LLM. Ale sÄ pewne wyzwania:
- WydajnoÅÄ zaleÅžy silnie od wyboru oceniajÄ cego LLM i sformuÅowania sygnaÅu.
- Ograniczony przez trudnoÅÄ oryginalnego zadania. Ocena zÅoÅžonego rozumowania jest nadal trudna dla LLM.
- MoÅže byÄ obciÄ ÅžajÄ ce obliczeniowo, jeÅli uÅžywa siÄ LLM opartych na API.
Ocena wÅasna jest szczegÃģlnie obiecujÄ ca do oceny informacji pobranych w systemach RAG (retrieval-augmented generation). Dodatkowe zapytania LLM mogÄ potwierdziÄ, czy pobrany kontekst jest uÅžywany odpowiednio.
OgÃģlnie, ocena wÅasna pokazuje potencjaÅ, ale wymaga starannoÅci w wdroÅženiu. UzupeÅnia, a nie zastÄpuje, ocenÄ ludzkÄ .
Ocena ludzka
BiorÄ c pod uwagÄ ograniczenia automatycznych metryk i punktÃģw odniesienia, ocena ludzka jest nadal zÅotym standardem dla rygorystycznej oceny jakoÅci LLM.
Eksperci mogÄ dostarczyÄ szczegÃģÅowe oceny jakoÅci na:
- DokÅadnoÅÄ i poprawnoÅÄ faktÃģw
- Logika, rozumowanie i zdrowy rozsÄ dek
- SpÃģjnoÅÄ, konsekwencja i czytelnoÅÄ
- OdpowiednioÅÄ tonu, stylu i gÅosu
- Gramatyka i pÅynnoÅÄ
- KreatywnoÅÄ i nuans
Aby oceniÄ model, ludzie otrzymujÄ zestaw sygnaÅÃģw wejÅciowych i odpowiedzi wygenerowane przez LLM. OceniÄ jakoÅÄ odpowiedzi, czÄsto uÅžywajÄ c skal oceny i arkuszy.
WadÄ jest to, Åže rÄczna ocena ludzka jest droga, powolna i trudna do skalowania. Wymaga rÃģwnieÅž opracowania standardowych kryteriÃģw i szkolenia oceniajÄ cych, aby stosowali je w sposÃģb spÃģjny.
NiektÃģrzy badacze prÃģbowali znaleÅšÄ kreatywne sposoby na crowdfundowanie oceny LLM przez ludzi, uÅžywajÄ c systemÃģw turniejowych, w ktÃģrych ludzie obstawiajÄ i oceniajÄ mecze miÄdzy modelami. Ale pokrycie jest nadal ograniczone w porÃģwnaniu z peÅnymi rÄcznymi ocenami.
Dla przypadkÃģw biznesowych, w ktÃģrych jakoÅÄ ma znaczenie bardziej niÅž surowa skala, ekspertowa ocena ludzka pozostaje zÅotym standardem, pomimo kosztÃģw. Jest to szczegÃģlnie prawdziwe w przypadku ryzykownych zastosowaÅ LLM.
Wnioski
Ocena duÅžych modeli jÄzykowych wymaga uÅžycia zrÃģÅžnicowanego zestawu narzÄdzi komplementarnych, a nie polegania na jednej technice.
ÅÄ czÄ c podejÅcia automatyczne dla szybkoÅci z rygorystycznym nadzorem ludzkim dla dokÅadnoÅci, moÅžemy opracowaÄ godne zaufania metody testowania dla duÅžych modeli jÄzykowych. Z solidnÄ ocenÄ , moÅžemy odblokowaÄ ogromny potencjaÅ LLM, jednoczeÅnie zarzÄ dzajÄ c ich ryzykiem w sposÃģb odpowiedzialny.












