Modely a platformy AI

Hodnocení velkých jazykových modelů: Technický průvodce

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké jazykové modely (LLM) jako GPT-4, Claude a LLaMA získaly obrovskou popularitu. Díky své schopnosti generovat velmi lidsky vypadající text jsou tyto systémy umělých inteligencí nyní používány pro všechno od tvorby obsahu až po chatboty pro zákaznickou podporu.

Ale jak víme, zda tyto modely jsou skutečně dobré? S novými LLM, které jsou neustále oznamovány, všechny tvrdí, že jsou větší a lepší, jak je možné vyhodnotit a porovnat jejich výkon?

V tomto komplexním průvodci prozkoumáme nejlepší techniky pro hodnocení velkých jazykových modelů. Podíváme se na výhody a nevýhody každého přístupu, kdy jsou nejlépe aplikovány a jak je můžete využít ve svých vlastních testech LLM.

Úkoly specifické metriky

Jedním z nejvíce přímých způsobů, jak vyhodnotit LLM, je testovat jej na standardizovaných úkolech NLP pomocí standardizovaných metrik. Například:

Shrnutí

Pro úkoly shrnutí se metriky jako ROUGE (Recall-Oriented Understudy for Gisting Evaluation) běžně používají. ROUGE porovnává souhrn generovaný modelem s lidsky psaným “referenčním” souhrnem, přičemž počítá překryv slov nebo frází.

Existuje několik verzí ROUGE, každá se svými vlastními výhody a nevýhodami:

  • ROUGE-N: Porovnává překryv n-gramů (posloupností N slov). ROUGE-1 používá unigramy (jednotlivá slova), ROUGE-2 používá bigramy atd. Výhodou je, že zachycuje pořadí slov, ale může být příliš přísný.
  • ROUGE-L: Založeno na nejdelší společné posloupnosti (LCS). Flexibilnější pro pořadí slov, ale zaměřuje se na hlavní body.
  • ROUGE-W: Váží LCS shody podle jejich významu. Pokouší se zlepšit ROUGE-L.

Obecně jsou metriky ROUGE rychlé, automatické a fungují dobře pro hodnocení souhrnů systémů. Nicméně, nezachycují soudržnost nebo význam. Souhrn může získat vysokou hodnotu ROUGE a přesto být nesmyslný.

Formule pro ROUGE-N je:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

Kde:

  • Count_{match}(gram_n) je počet n-gramů v obou generovaných a referenčních souhrnech.
  • Count(gram_n) je počet n-gramů v referenčním souhrnu.

Například pro ROUGE-1 (unigramy):

  • Generovaný souhrn: “Kočka seděla.”
  • Referenční souhrn: “Kočka seděla na matraci.”
  • Překryv unigramů: “Kočka”, “seděla”
  • Hodnota ROUGE-1 = 2/4 = 0,5

ROUGE-L používá nejdelší společnou posloupnost (LCS). Je flexibilnější pro pořadí slov. Formule je:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

Kde LCS je délka nejdelší společné posloupnosti.

ROUGE-W váží shody LCS. Zvažuje význam každé shody v LCS.

Překlad

Pro úkoly překladu je BLEU (Bilingual Evaluation Understudy) oblíbenou metrikou. BLEU měří podobnost mezi výstupem modelu a profesionálními lidskými překlady, pomocí přesnosti n-gramů a penalty za krátkost.

Klíčové aspekty, jak BLEU funguje:

  • Porovnává překryv n-gramů pro n až 4 (unigramy, bigramy, trigramy, 4-gramy).
  • Vypočítává geometrický průměr přesností n-gramů.
  • Používá penalty za krátkost, pokud je překlad mnohem kratší než referenční.
  • Obecně se pohybuje od 0 do 1, přičemž 1 je dokonalá shoda s referencí.

BLEU koreluje rozumně s lidskými úsudky o kvalitě překladu. Ale stále má omezení:

  • Měří pouze přesnost proti referencím, ne recall nebo F1.
  • Má potíže s kreativními překlady, které používají odlišné formulace.
  • Je náchylný k “herním” trikům s překladem.

Další překladové metriky, jako METEOR a TER, se snaží zlepšit slabiny BLEU. Ale obecně, automatické metriky plně nezachycují kvalitu překladu.

Jiné úkoly

Kromě shrnutí a překladu lze použít metriky jako F1, přesnost, MSE a další pro hodnocení výkonu LLM na úkolech, jako jsou:

  • Klasifikace textu
  • Extrahování informací
  • Zodpovězení otázek
  • Analýza sentimentu
  • Detekce gramatických chyb

Výhodou úkolově specifických metrik je, že hodnocení lze plně automatizovat pomocí standardizovaných datových sad, jako je SQuAD pro QA a GLUE benchmark pro řadu úkolů. Výsledky lze snadno sledovat v čase, jak se modely zlepšují.

Nicméně, tyto metriky jsou úzce zaměřeny a nemohou měřit celkovou kvalitu jazyka. LLM, které fungují dobře na metrikách pro jeden úkol, mohou selhat při generování soudržného, logického a užitečného textu obecně.

Výzkumové benchmarky

Populárním způsobem, jak vyhodnotit LLM, je testovat je proti širokým výzkumům benchmarků, pokrývajících různé téma a dovednosti. Tyto benchmarky umožňují modelům být rychle testovány v měřítku.

Některé dobře známé benchmarky zahrnují:

  • SuperGLUE – Výzvou je sada 11 rozmanitých jazykových úkolů.
  • GLUE – Sbírka 9 úkolů porozumění větám. Jednodušší než SuperGLUE.
  • MMLU – 57 různých úkolů STEM, sociálních věd a humanitních oborů. Testuje znalosti a schopnost rozumět.
  • Winograd Schema Challenge – Úkoly pro rozřešení zájmenných vazeb vyžadující běžný smysl.
  • ARC – Výzvou jsou přirozené jazykové úkoly.
  • Hellaswag – Úkoly pro běžný smysl o situacích.
  • PIQA – Fyzikální otázky vyžadující diagramy.

Hodnotící se na těchto benchmarcích, výzkumníci mohou rychle testovat modely na jejich schopnost provádět matematiku, logiku, rozumění, kódování, běžný smysl a mnohem více. Procento správně zodpovězených otázek se stává metrikou pro srovnání modelů.

Nicméně, velkou otázkou u benchmarcích je kontaminace trénovacích dat. Mnoho benchmarcích obsahuje příklady, které byly již viděny modely během předběžného trénování. To umožňuje modelům “pamatovat” si odpovědi na konkrétní otázky a fungovat lépe, než jejich skutečné schopnosti.

Pokouší se “dekontaminovat” benchmarcích odstraněním překrývajících se příkladů. Ale je to obtížné udělat komplexně, zejména když modely mohly vidět parafrázované nebo přeložené verze otázek.

Takže zatímco benchmarcích mohou testovat širokou škálu dovedností efektivně, nemohou spolehlivě měřit skutečné rozumové schopnosti nebo se vyhnout inflaci skóre kvůli kontaminaci. Doplňkové metody hodnocení jsou potřebné.

Samo-hodnocení LLM

Zajímavý přístup je nechat LLM vyhodnotit výstup jiného LLM. Nápad je využít “snazší” úkol:

  • Vytvořit kvalitní výstup může být pro LLM obtížné.
  • Ale určit, zda je dán výstup kvalitní, může být snazší úkol.

Například, zatímco LLM může mít potíže s generováním faktického, soudržného odstavce z ničeho, může snáze posoudit, zda je dán odstavec logicky smysluplný a zda se hodí do kontextu.

Takže proces je:

  1. Předat vstupní podnět prvnímu LLM pro generování výstupu.
  2. Předat vstupní podnět + generovaný výstup druhému “evaluačnímu” LLM.
  3. Zeptat se evaluačního LLM na otázku, aby zhodnotil kvalitu výstupu. Například “Má výše uvedená odpověď logický smysl?”

Tento přístup je rychlý na implementaci a automatizuje hodnocení LLM. Ale existují některé výzvy:

  • Výkon závisí silně na výběru evaluačního LLM a formulaci podnětu.
  • Omezený obtížností původního úkolu. Hodnocení komplexního rozumění je stále obtížné pro LLM.
  • Může být výpočetně nákladné, pokud se používají API-založené LLM.

Samo-hodnocení je zejména slibné pro hodnocení načtených informací v RAG (retrieval-augmented generation) systémech. Další dotazy LLM mohou ověřit, zda je načtený kontext použit vhodně.

Celkově, samo-hodnocení ukazuje potenciál, ale vyžaduje pečlivé implementaci. Doporučuje se jako doplněk, nikoli náhrada, lidského hodnocení.

Lidské hodnocení

Vzhledem k omezením automatizovaných metrik a benchmarcích, lidské hodnocení je stále zlatým standardem pro důkladné hodnocení kvality LLM.

Odborníci mohou poskytnout podrobné kvalitativní hodnocení na:

  • Přesnost a faktickou správnost
  • Logiku, rozumění a běžný smysl
  • Soudržnost, konzistenci a čitelnost
  • Přiměřenost tónu, stylu a hlasu
  • Gramatickou správnost a plynulost
  • Kreativitu a nuance

Pro vyhodnocení modelu jsou lidem předloženy sadou vstupních podnětů a odpovědí LLM. Hodnotí kvalitu odpovědí, často pomocí ratingových škál a rubrik.

Nevýhodou je, že manuální lidské hodnocení je drahé, pomalé a obtížně škálovatelné. Také vyžaduje vývoj standardizovaných kritérií a školení hodnotitelů, aby je aplikovali konzistentně.

Někteří výzkumníci prozkoumali kreativní způsoby, jak crowdfundovat lidská hodnocení LLM pomocí turnajového systému, kde lidé sázejí a hodnotí zápasy mezi modely. Ale pokrytí je stále omezené ve srovnání s plným manuálním hodnocením.

Pro obchodní případy, kde kvalita záleží více než surová škála, expertní lidské testování zůstává zlatým standardem, navzdory nákladům. To je zejména pravda pro rizikovější aplikace LLM.

Závěr

Důkladné hodnocení velkých jazykových modelů vyžaduje použití rozmanité sady komplementárních metod, spíše než spoléhání se na jedinou techniku.

Kombinací automatizovaných přístupů pro rychlost s důkladným lidským dohledem pro přesnost, můžeme vyvinout důvěryhodné testovací metodologie pro velké jazykové modely. S robustním hodnocením, můžeme odemknout enormní potenciál LLM a současně spravovat jejich rizika odpovědně.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.