Modele i platformy AI

Ocena dużych modeli językowych: Podręcznik techniczny

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Duże modele językowe (LLM) takie jak GPT-4, Claude i LLaMA zyskały na popularności. Dzięki ich zdolności do generowania tekstów, które są niezwykle podobne do ludzkich, te systemy AI są teraz wykorzystywane do wszystkiego, od tworzenia treści po chatboty obsługujące klientów.

Ale jak możemy się upewnić, że te modele są naprawdę dobre? Z nowymi LLMami, które są ogłaszane ciągle, wszystkie twierdzą, że są większe i lepsze, jak możemy ocenić i porównać ich wydajność?

W tym kompleksowym przewodniku, będziemy badać najlepsze techniki oceny dużych modeli językowych. Będziemy przyglądać się zaletom i wadom każdego podejścia, kiedy są one najlepiej stosowane i jak możesz wykorzystać je w swoich własnych testach LLM.

Task-Specific Metrics

Jednym z najbardziej prostych sposobów oceny LLM jest przetestowanie go na ustanowionych zadaniach NLP przy użyciu standaryzowanych metryk. Na przykład:

Summarization

Dla zadań podsumowujących, metryki takie jak ROUGE (Recall-Oriented Understudy for Gisting Evaluation) są powszechnie używane. ROUGE porównuje podsumowanie wygenerowane przez model z ludzkim “odniesieniem” podsumowaniem, licząc nachodzenie słów lub fraz.

Istnieje kilka odmian ROUGE, każda z własnymi zaletami i wadami:

  • ROUGE-N: Porównuje nachodzenie n-gramów (sekwencji N słów). ROUGE-1 używa unigramów (jednego słowa), ROUGE-2 używa bigramów itd. Zaletą jest to, że ujmuje kolejność słów, ale może być zbyt surowy.
  • ROUGE-L: Opiera się na najdłuższej wspólnej sekwencji (LCS). Bardziej elastyczny w kwestii kolejności słów, ale koncentruje się na głównych punktach.
  • ROUGE-W: Waguje dopasowania LCS ich znaczeniem. Próbuje poprawić ROUGE-L.

Ogólnie, metryki ROUGE są szybkie, automatyczne i działają dobrze dla oceny podsumowań systemów. Jednak nie mierzą spójności ani znaczenia. Podsumowanie może uzyskać wysoki wynik ROUGE i nadal być nonsensem.

Wzór dla ROUGE-N to:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

Gdzie:

  • Count_{match}(gram_n) to liczba n-gramów w podsumowaniu wygenerowanym i odniesieniowym.
  • Count(gram_n) to liczba n-gramów w odniesieniowym podsumowaniu.

Na przykład, dla ROUGE-1 (unigramów):

  • Podsumowanie wygenerowane: “Kot siedział.”
  • Podsumowanie odniesieniowe: “Kot siedział na macie.”
  • Nachodzące unigramy: “Kot”, “siedział”
  • Wynik ROUGE-1 = 2/3 = 0,67

ROUGE-L używa najdłuższej wspólnej sekwencji (LCS). Jest bardziej elastyczny w kwestii kolejności słów. Wzór to:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

Gdzie LCS to długość najdłuższej wspólnej sekwencji.

ROUGE-W waguje dopasowania LCS. Uwzględnia znaczenie każdego dopasowania w LCS.

Tłumaczenie

Dla zadań tłumaczenia maszynowego, BLEU (Bilingual Evaluation Understudy) jest popularną metryką. BLEU mierzy podobieństwo między wyjściem modelu a tłumaczeniami wykonanymi przez ludzi, przy użyciu precyzji n-gramów i kary za krótkość.

Kluczowe aspekty, jak BLEU działa:

  • Porównuje nachodzenie n-gramów dla n do 4 (unigramów, bigramów, trigramów, 4-gramów).
  • Oblicza średnią geometryczną precyzji n-gramów.
  • Stosuje karę za krótkość, jeśli tłumaczenie jest znacznie krótsze niż odniesienie.
  • Ogólnie mieści się w zakresie od 0 do 1, przy czym 1 oznacza idealne dopasowanie do odniesienia.

BLEU koreluje rozsądnie dobrze z ludzkimi ocenami jakości tłumaczenia. Ale ma ograniczenia:

  • Mierzy tylko precyzję wobec odniesień, a nie recall ani F1.
  • Miałkuje z kreatywnymi tłumaczeniami, które używają różnych słów.
  • Podatny na “oszukiwanie” z sztuczkami tłumaczeniowymi.

Inne metryki tłumaczeniowe, takie jak METEOR i TER, próbują poprawić słabości BLEU. Ale ogólnie, automatyczne metryki nie w pełni ujmują jakość tłumaczenia.

Inne zadania

Oprócz podsumowania i tłumaczenia, metryki takie jak F1, dokładność, MSE i więcej mogą być używane do oceny wydajności LLM w zadaniach takich jak:

  • Klasyfikacja tekstu
  • Ekstrakcja informacji
  • Odpowiadanie na pytania
  • Analiza sentimentu
  • Wykrywanie błędów gramatycznych

Zaleta metryk zależnych od zadania jest to, że ocena może być w pełni zautomatyzowana przy użyciu standardowych zestawów danych, takich jak SQuAD dla QA i GLUE benchmark dla szeregu zadań. Wyniki mogą być łatwo śledzone w czasie, gdy modele są ulepszane.

Jednak te metryki są wąsko ukierunkowane i nie mogą mierzyć ogólnej jakości języka. LLM, które wykonują dobrze na metrykach dla jednego zadania, mogą zawieść w generowaniu spójnych, logicznych, pomocnych tekstów w ogóle.

Badawcze punkty odniesienia

Popularnym sposobem oceny LLM jest testowanie ich wobec szeroko zakrojonych badań punktów odniesienia, pokrywających różnorodne tematy i umiejętności. Te punkty odniesienia pozwalają modelom być szybko testowanymi na dużą skalę.

Niektóre znane punkty odniesienia to:

  • SuperGLUE – Wyzwania zestaw 11 różnorodnych zadań językowych.
  • GLUE – Zbiór 9 zadań zrozumienia zdania. Prostszy niż SuperGLUE.
  • MMLU – 57 różnych zadań z dziedziny STEM, nauk społecznych i humanistycznych. Testuje wiedzę i zdolność rozumowania.
  • Winograd Schema Challenge – Zadania rozwiązywania pronomenów wymagające zdroworozsądkowego rozumowania.
  • ARC – Wyzwania zadania językowego wymagającego naturalnego rozumowania.
  • Hellaswag – Zadania wymagające zdroworozsądkowego rozumowania w sytuacjach.
  • PIQA – Zadania fizyczne wymagające diagramów.

Przez ocenę na punktach odniesienia, takich jak te, badacze mogą szybko testować modele na ich zdolność do wykonywania matematyki, logiki, rozumowania, kodowania, zdroworozsądkowego myślenia i wiele więcej. Procent poprawnie odpowiedzianych pytań staje się metryką porównawczą dla modeli.

Jednak głównym problemem z punktami odniesienia jest zanieczyszczenie danych szkoleniowych. Wiele punktów odniesienia zawiera przykłady, które były już widziane przez modele podczas pre-trenowania. To pozwala modelom “zapamiętać” odpowiedzi na określone pytania i wykonywać lepiej niż ich rzeczywiste możliwości.

Podejmowane są próby “oczyszczenia” punktów odniesienia poprzez usunięcie nakładających się przykładów. Ale jest to trudne do wykonania w sposób kompleksowy, zwłaszcza gdy modele mogły zobaczyć przeredagowane lub przetłumaczone wersje pytań.

Więc chociaż punkty odniesienia mogą testować szeroki zakres umiejętności wydajnie, nie mogą niezawodnie mierzyć prawdziwych zdolności rozumowania ani uniknąć inflacji wyników z powodu zanieczyszczenia. Wymagane są uzupełniające metody oceny.

Ocena LLM

Intrygującym podejściem jest ocena jednego LLM przez inny LLM. Pomysł polega na wykorzystaniu “łatwiejszego” zadania:

  • Wytwarzanie wysokiej jakości wyjścia może być trudne dla LLM.
  • Ale określenie, czy dane wyjście jest wysokiej jakości, może być łatwiejszym zadaniem.

Na przykład, podczas gdy LLM może mieć trudności z wygenerowaniem faktualnego, spójnego akapitu od podstaw, może łatwiej ocenić, czy dany akapit ma logiczny sens i pasuje do kontekstu.

Więc proces jest:

  1. Przekazujesz wejściowy sygnał do pierwszego LLM, aby wygenerować wyjście.
  2. Przekazujesz wejściowy sygnał + wygenerowane wyjście do drugiego “oceniającego” LLM.
  3. Zadajesz oceniającemu LLM pytanie, aby ocenić jakość wyjścia. Na przykład: “Czy powyższa odpowiedź ma logiczny sens?”

To podejście jest szybkie do wdrożenia i automatyzuje ocenę LLM. Ale są pewne wyzwania:

  • Wydajność zależy silnie od wyboru oceniającego LLM i sformułowania sygnału.
  • Ograniczony przez trudność oryginalnego zadania. Ocena złożonego rozumowania jest nadal trudna dla LLM.
  • Może być obciążające obliczeniowo, jeśli używa się LLM opartych na API.

Ocena własna jest szczególnie obiecująca do oceny informacji pobranych w systemach RAG (retrieval-augmented generation). Dodatkowe zapytania LLM mogą potwierdzić, czy pobrany kontekst jest używany odpowiednio.

Ogólnie, ocena własna pokazuje potencjał, ale wymaga staranności w wdrożeniu. Uzupełnia, a nie zastępuje, ocenę ludzką.

Ocena ludzka

Biorąc pod uwagę ograniczenia automatycznych metryk i punktów odniesienia, ocena ludzka jest nadal złotym standardem dla rygorystycznej oceny jakości LLM.

Eksperci mogą dostarczyć szczegółowe oceny jakości na:

  • Dokładność i poprawność faktów
  • Logika, rozumowanie i zdrowy rozsądek
  • Spójność, konsekwencja i czytelność
  • Odpowiedniość tonu, stylu i głosu
  • Gramatyka i płynność
  • Kreatywność i nuans

Aby ocenić model, ludzie otrzymują zestaw sygnałów wejściowych i odpowiedzi wygenerowane przez LLM. Ocenią jakość odpowiedzi, często używając skal oceny i arkuszy.

Wadą jest to, że ręczna ocena ludzka jest droga, powolna i trudna do skalowania. Wymaga również opracowania standardowych kryteriów i szkolenia oceniających, aby stosowali je w sposób spójny.

Niektórzy badacze próbowali znaleźć kreatywne sposoby na crowdfundowanie oceny LLM przez ludzi, używając systemów turniejowych, w których ludzie obstawiają i oceniają mecze między modelami. Ale pokrycie jest nadal ograniczone w porównaniu z pełnymi ręcznymi ocenami.

Dla przypadków biznesowych, w których jakość ma znaczenie bardziej niż surowa skala, ekspertowa ocena ludzka pozostaje złotym standardem, pomimo kosztów. Jest to szczególnie prawdziwe w przypadku ryzykownych zastosowań LLM.

Wnioski

Ocena dużych modeli językowych wymaga użycia zróżnicowanego zestawu narzędzi komplementarnych, a nie polegania na jednej technice.

Łącząc podejścia automatyczne dla szybkości z rygorystycznym nadzorem ludzkim dla dokładności, możemy opracować godne zaufania metody testowania dla dużych modeli językowych. Z solidną oceną, możemy odblokować ogromny potencjał LLM, jednocześnie zarządzając ich ryzykiem w sposób odpowiedzialny.

Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.