Modele i platformy AI

Ocena duÅžych modeli językowych: Podręcznik techniczny

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

DuÅže modele językowe (LLM) takie jak GPT-4, Claude i LLaMA zyskały na popularności. Dzięki ich zdolności do generowania tekstÃģw, ktÃģre są niezwykle podobne do ludzkich, te systemy AI są teraz wykorzystywane do wszystkiego, od tworzenia treści po chatboty obsługujące klientÃģw.

Ale jak moÅžemy się upewnić, Åže te modele są naprawdę dobre? Z nowymi LLMami, ktÃģre są ogłaszane ciągle, wszystkie twierdzą, Åže są większe i lepsze, jak moÅžemy ocenić i porÃģwnać ich wydajność?

W tym kompleksowym przewodniku, będziemy badać najlepsze techniki oceny duÅžych modeli językowych. Będziemy przyglądać się zaletom i wadom kaÅždego podejścia, kiedy są one najlepiej stosowane i jak moÅžesz wykorzystać je w swoich własnych testach LLM.

Task-Specific Metrics

Jednym z najbardziej prostych sposobÃģw oceny LLM jest przetestowanie go na ustanowionych zadaniach NLP przy uÅžyciu standaryzowanych metryk. Na przykład:

Summarization

Dla zadań podsumowujących, metryki takie jak ROUGE (Recall-Oriented Understudy for Gisting Evaluation) są powszechnie uÅžywane. ROUGE porÃģwnuje podsumowanie wygenerowane przez model z ludzkim “odniesieniem” podsumowaniem, licząc nachodzenie słÃģw lub fraz.

Istnieje kilka odmian ROUGE, kaÅžda z własnymi zaletami i wadami:

  • ROUGE-N: PorÃģwnuje nachodzenie n-gramÃģw (sekwencji N słÃģw). ROUGE-1 uÅžywa unigramÃģw (jednego słowa), ROUGE-2 uÅžywa bigramÃģw itd. Zaletą jest to, Åže ujmuje kolejność słÃģw, ale moÅže być zbyt surowy.
  • ROUGE-L: Opiera się na najdłuÅžszej wspÃģlnej sekwencji (LCS). Bardziej elastyczny w kwestii kolejności słÃģw, ale koncentruje się na głÃģwnych punktach.
  • ROUGE-W: Waguje dopasowania LCS ich znaczeniem. PrÃģbuje poprawić ROUGE-L.

OgÃģlnie, metryki ROUGE są szybkie, automatyczne i działają dobrze dla oceny podsumowań systemÃģw. Jednak nie mierzą spÃģjności ani znaczenia. Podsumowanie moÅže uzyskać wysoki wynik ROUGE i nadal być nonsensem.

WzÃģr dla ROUGE-N to:

ROUGE-N=∑∈{Reference Summaries}∑∑ïŋ―∈{Reference Summaries}∑

Gdzie:

  • Count_{match}(gram_n) to liczba n-gramÃģw w podsumowaniu wygenerowanym i odniesieniowym.
  • Count(gram_n) to liczba n-gramÃģw w odniesieniowym podsumowaniu.

Na przykład, dla ROUGE-1 (unigramÃģw):

  • Podsumowanie wygenerowane: “Kot siedział.”
  • Podsumowanie odniesieniowe: “Kot siedział na macie.”
  • Nachodzące unigramy: “Kot”, “siedział”
  • Wynik ROUGE-1 = 2/3 = 0,67

ROUGE-L uÅžywa najdłuÅžszej wspÃģlnej sekwencji (LCS). Jest bardziej elastyczny w kwestii kolejności słÃģw. WzÃģr to:

ROUGE-L=ïŋ―ïŋ―ïŋ―(generated,reference)max(length(generated), length(reference))

Gdzie LCS to długość najdłuÅžszej wspÃģlnej sekwencji.

ROUGE-W waguje dopasowania LCS. Uwzględnia znaczenie kaÅždego dopasowania w LCS.

Tłumaczenie

Dla zadań tłumaczenia maszynowego, BLEU (Bilingual Evaluation Understudy) jest popularną metryką. BLEU mierzy podobieństwo między wyjściem modelu a tłumaczeniami wykonanymi przez ludzi, przy uÅžyciu precyzji n-gramÃģw i kary za krÃģtkość.

Kluczowe aspekty, jak BLEU działa:

  • PorÃģwnuje nachodzenie n-gramÃģw dla n do 4 (unigramÃģw, bigramÃģw, trigramÃģw, 4-gramÃģw).
  • Oblicza średnią geometryczną precyzji n-gramÃģw.
  • Stosuje karę za krÃģtkość, jeśli tłumaczenie jest znacznie krÃģtsze niÅž odniesienie.
  • OgÃģlnie mieści się w zakresie od 0 do 1, przy czym 1 oznacza idealne dopasowanie do odniesienia.

BLEU koreluje rozsądnie dobrze z ludzkimi ocenami jakości tłumaczenia. Ale ma ograniczenia:

  • Mierzy tylko precyzję wobec odniesień, a nie recall ani F1.
  • Miałkuje z kreatywnymi tłumaczeniami, ktÃģre uÅžywają rÃģÅžnych słÃģw.
  • Podatny na “oszukiwanie” z sztuczkami tłumaczeniowymi.

Inne metryki tłumaczeniowe, takie jak METEOR i TER, prÃģbują poprawić słabości BLEU. Ale ogÃģlnie, automatyczne metryki nie w pełni ujmują jakość tłumaczenia.

Inne zadania

OprÃģcz podsumowania i tłumaczenia, metryki takie jak F1, dokładność, MSE i więcej mogą być uÅžywane do oceny wydajności LLM w zadaniach takich jak:

  • Klasyfikacja tekstu
  • Ekstrakcja informacji
  • Odpowiadanie na pytania
  • Analiza sentimentu
  • Wykrywanie błędÃģw gramatycznych

Zaleta metryk zaleÅžnych od zadania jest to, Åže ocena moÅže być w pełni zautomatyzowana przy uÅžyciu standardowych zestawÃģw danych, takich jak SQuAD dla QA i GLUE benchmark dla szeregu zadań. Wyniki mogą być łatwo śledzone w czasie, gdy modele są ulepszane.

Jednak te metryki są wąsko ukierunkowane i nie mogą mierzyć ogÃģlnej jakości języka. LLM, ktÃģre wykonują dobrze na metrykach dla jednego zadania, mogą zawieść w generowaniu spÃģjnych, logicznych, pomocnych tekstÃģw w ogÃģle.

Badawcze punkty odniesienia

Popularnym sposobem oceny LLM jest testowanie ich wobec szeroko zakrojonych badań punktÃģw odniesienia, pokrywających rÃģÅžnorodne tematy i umiejętności. Te punkty odniesienia pozwalają modelom być szybko testowanymi na duŞą skalę.

NiektÃģre znane punkty odniesienia to:

  • SuperGLUE – Wyzwania zestaw 11 rÃģÅžnorodnych zadań językowych.
  • GLUE – ZbiÃģr 9 zadań zrozumienia zdania. Prostszy niÅž SuperGLUE.
  • MMLU – 57 rÃģÅžnych zadań z dziedziny STEM, nauk społecznych i humanistycznych. Testuje wiedzę i zdolność rozumowania.
  • Winograd Schema Challenge – Zadania rozwiązywania pronomenÃģw wymagające zdroworozsądkowego rozumowania.
  • ARC – Wyzwania zadania językowego wymagającego naturalnego rozumowania.
  • Hellaswag – Zadania wymagające zdroworozsądkowego rozumowania w sytuacjach.
  • PIQA – Zadania fizyczne wymagające diagramÃģw.

Przez ocenę na punktach odniesienia, takich jak te, badacze mogą szybko testować modele na ich zdolność do wykonywania matematyki, logiki, rozumowania, kodowania, zdroworozsądkowego myślenia i wiele więcej. Procent poprawnie odpowiedzianych pytań staje się metryką porÃģwnawczą dla modeli.

Jednak głÃģwnym problemem z punktami odniesienia jest zanieczyszczenie danych szkoleniowych. Wiele punktÃģw odniesienia zawiera przykłady, ktÃģre były juÅž widziane przez modele podczas pre-trenowania. To pozwala modelom “zapamiętać” odpowiedzi na określone pytania i wykonywać lepiej niÅž ich rzeczywiste moÅžliwości.

Podejmowane są prÃģby “oczyszczenia” punktÃģw odniesienia poprzez usunięcie nakładających się przykładÃģw. Ale jest to trudne do wykonania w sposÃģb kompleksowy, zwłaszcza gdy modele mogły zobaczyć przeredagowane lub przetłumaczone wersje pytań.

Więc chociaÅž punkty odniesienia mogą testować szeroki zakres umiejętności wydajnie, nie mogą niezawodnie mierzyć prawdziwych zdolności rozumowania ani uniknąć inflacji wynikÃģw z powodu zanieczyszczenia. Wymagane są uzupełniające metody oceny.

Ocena LLM

Intrygującym podejściem jest ocena jednego LLM przez inny LLM. Pomysł polega na wykorzystaniu “łatwiejszego” zadania:

  • Wytwarzanie wysokiej jakości wyjścia moÅže być trudne dla LLM.
  • Ale określenie, czy dane wyjście jest wysokiej jakości, moÅže być łatwiejszym zadaniem.

Na przykład, podczas gdy LLM moÅže mieć trudności z wygenerowaniem faktualnego, spÃģjnego akapitu od podstaw, moÅže łatwiej ocenić, czy dany akapit ma logiczny sens i pasuje do kontekstu.

Więc proces jest:

  1. Przekazujesz wejściowy sygnał do pierwszego LLM, aby wygenerować wyjście.
  2. Przekazujesz wejściowy sygnał + wygenerowane wyjście do drugiego “oceniającego” LLM.
  3. Zadajesz oceniającemu LLM pytanie, aby ocenić jakość wyjścia. Na przykład: “Czy powyÅžsza odpowiedÅš ma logiczny sens?”

To podejście jest szybkie do wdroÅženia i automatyzuje ocenę LLM. Ale są pewne wyzwania:

  • Wydajność zaleÅžy silnie od wyboru oceniającego LLM i sformułowania sygnału.
  • Ograniczony przez trudność oryginalnego zadania. Ocena złoÅžonego rozumowania jest nadal trudna dla LLM.
  • MoÅže być obciÄ…Åžające obliczeniowo, jeśli uÅžywa się LLM opartych na API.

Ocena własna jest szczegÃģlnie obiecująca do oceny informacji pobranych w systemach RAG (retrieval-augmented generation). Dodatkowe zapytania LLM mogą potwierdzić, czy pobrany kontekst jest uÅžywany odpowiednio.

OgÃģlnie, ocena własna pokazuje potencjał, ale wymaga staranności w wdroÅženiu. Uzupełnia, a nie zastępuje, ocenę ludzką.

Ocena ludzka

Biorąc pod uwagę ograniczenia automatycznych metryk i punktÃģw odniesienia, ocena ludzka jest nadal złotym standardem dla rygorystycznej oceny jakości LLM.

Eksperci mogą dostarczyć szczegÃģłowe oceny jakości na:

  • Dokładność i poprawność faktÃģw
  • Logika, rozumowanie i zdrowy rozsądek
  • SpÃģjność, konsekwencja i czytelność
  • Odpowiedniość tonu, stylu i głosu
  • Gramatyka i płynność
  • Kreatywność i nuans

Aby ocenić model, ludzie otrzymują zestaw sygnałÃģw wejściowych i odpowiedzi wygenerowane przez LLM. Ocenią jakość odpowiedzi, często uÅžywając skal oceny i arkuszy.

Wadą jest to, Åže ręczna ocena ludzka jest droga, powolna i trudna do skalowania. Wymaga rÃģwnieÅž opracowania standardowych kryteriÃģw i szkolenia oceniających, aby stosowali je w sposÃģb spÃģjny.

NiektÃģrzy badacze prÃģbowali znaleŚć kreatywne sposoby na crowdfundowanie oceny LLM przez ludzi, uÅžywając systemÃģw turniejowych, w ktÃģrych ludzie obstawiają i oceniają mecze między modelami. Ale pokrycie jest nadal ograniczone w porÃģwnaniu z pełnymi ręcznymi ocenami.

Dla przypadkÃģw biznesowych, w ktÃģrych jakość ma znaczenie bardziej niÅž surowa skala, ekspertowa ocena ludzka pozostaje złotym standardem, pomimo kosztÃģw. Jest to szczegÃģlnie prawdziwe w przypadku ryzykownych zastosowań LLM.

Wnioski

Ocena duÅžych modeli językowych wymaga uÅžycia zrÃģÅžnicowanego zestawu narzędzi komplementarnych, a nie polegania na jednej technice.

Łącząc podejścia automatyczne dla szybkości z rygorystycznym nadzorem ludzkim dla dokładności, moÅžemy opracować godne zaufania metody testowania dla duÅžych modeli językowych. Z solidną oceną, moÅžemy odblokować ogromny potencjał LLM, jednocześnie zarządzając ich ryzykiem w sposÃģb odpowiedzialny.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 rÃģÅžnorodnych projektach inÅžynierii oprogramowania, ze szczegÃģlnym uwzględnieniem AI/ML. Moja nieustanna ciekawość rÃģwnieÅž skierowała mnie w stronę Natural Language Processing, dziedziny, ktÃģrą chcę dalej eksplorować.