Prompt engineering

Přístup k halucinacím ve velkých jazykových modelech: Přehled nejnovějších technik

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Velké jazykové modely (LLM) jako GPT-4, PaLM a Llama umožnily pozoruhodný pokrok v generování přirozeného jazyka. Nicméně, jednou zersistentní výzvou, která omezuje jejich spolehlivost a bezpečné nasazení, je jejich tendence halucinovat – generovat obsah, který se zdá koherentní, ale je fakticky nesprávný nebo nezávislý na vstupním kontextu.

Jak LLM pokračují v růstu a jsou stále více používány v reálných aplikacích, řešení halucinací se stává nezbytným. Tento článek poskytuje komplexní přehled nejnovějších technik, které výzkumníci představili pro detekci, kvantifikaci a zmírnění halucinací v LLM.

Pochopení halucinací v LLM

Halucinace se týkají faktických nesprávností nebo fabrikací generovaných LLM, které nejsou založeny na realitě nebo poskytovaném kontextu. Některé příklady zahrnují:

  • Vynález biografických detailů nebo událostí, které nejsou doloženy ve zdrojovém materiálu, při generování textu o osobě.
  • Poskytování vadného lékařského poradenství prostřednictvím konfabulace vedlejších účinků léků nebo postupů léčby.
  • Vynález neexistujících dat, studií nebo zdrojů pro podporu tvrzení.

Toto jev nastává, protože LLM jsou trénovány na velkém množství online textových dat. Zatímco to umožňuje dosáhnout silných jazykových modelovacích schopností, také znamená, že se naučí extrapolovat informace, dělat logické skoky a vyplňovat mezery způsobem, který se zdá přesvědčivý, ale může být matoucí nebo nesprávný.

Některé klíčové faktory odpovědné za halucinace zahrnují:

  • Generalizace vzorců – LLM identifikují a rozšiřují vzorce v trénovacích datech, které nemusí dobře obecně platit.
  • Staré znalosti – Statické předtrénování brání integraci nových informací.
  • Ambiguity – Nejasné výzvy umožňují prostor pro nesprávné předpoklady.
  • Předpojatosti – Modely prodlužují a zesilují zkreslené perspektivy.
  • Nedostatečné zakotvení – Chybí pochopení a rozumění znamená, že modely generují obsah, který plně nerozumí.

Řešení halucinací je kritické pro důvěryhodné nasazení v citlivých oblastech, jako je medicína, právo, finance a vzdělávání, kde generování nesprávných informací může vést ke škodě.

Taxonomie technik pro zmírnění halucinací

Výzkumníci představili různé techniky pro boj proti halucinacím v LLM, které lze kategorizovat do:

1. Inženýrství výzev

To zahrnuje pečlivé vytváření výzev pro poskytnutí kontextu a vedení LLM směrem k faktickým, zakotveným odpovědím.

  • Doplňující vyhledávání – Vyhledání externích důkazů pro zakotvení obsahu.
  • Smůlové smyčky – Iterativní poskytování zpětné vazby pro rafinaci odpovědí.
  • Úprava výzev – Úprava výzev během jemného ladění pro požadované chování.

2. Vývoj modelu

Vytvoření modelů, které jsou inherentně méně náchylné k halucinacím prostřednictvím architektonických změn.

  • Strategie dekódování – Generování textu způsoby, které zvyšují věrnost.
  • Zakotvení znalostí – Začlenění externích znalostních bází.
  • Nové funkce ztrát – Optimalizace pro věrnost během trénování.
  • Dozorované jemné ladění – Použití lidsky označených dat pro zlepšení fakticity.

Další, budeme zkoumat prominentní techniky pod každým přístupem.

Příznivé techniky pro zmírnění halucinací

Doplňující generace

Doplňující generace zlepšuje LLM tím, že vyhledává a kondicionuje generování textu na externí důkazové dokumenty, místo aby se spoléhal pouze na implicitní znalosti modelu. To zakotví obsah v aktuálních, ověřitelných informacích, snižuje halucinace.

Příznivé techniky zahrnují:

  • RAG – Používá modul vyhledávače, který poskytuje relevantní pasáže pro model seq2seq pro generování z nich. Oba komponenty jsou trénovány koncově.
  • RARR – Používá LLM pro výzkum neatribuovaných tvrzení v generovaném textu a revizi jejich souladu s vyhledanými důkazy.
  • Vyhledávání znalostí – Ověřuje nejisté generace pomocí vyhledaných znalostí před produkcí textu.
  • LLM-Augmenter – Iterativně vyhledává znalosti pro konstrukci důkazových řetězců pro výzvy LLM.

Zpětná vazba a rozumění

Využití iterativní přirozené jazykové zpětné vazby nebo sebe-rozumění umožňuje LLM rafinovat a zlepšit jejich počáteční výstupy, snižuje halucinace.

CoVe employs techniku řetězce verifikace. LLM nejprve vypracuje odpověď na uživatelskou otázku. Poté generuje potenciální verifikační otázky pro faktické ověření své vlastní odpovědi, na základě své důvěry v různých prohlášeních. Například pro odpověď popisující novou lékařskou léčbu, CoVe může vygenerovat otázky, jako “Jaká je účinnost léčby?”, “Získala regulační schválení?”, “Jaké jsou potenciální vedlejší účinky?”. Zásadně, LLM pak pokusí nezávisle odpovědět na tyto verifikační otázky bez zkreslení své počáteční odpovědi. Pokud odpovědi na verifikační otázky popírají nebo nemohou podporovat prohlášení učiněná v původní odpovědi, systém identifikuje tyto jako pravděpodobné halucinace a rafinuje odpověď, než ji předloží uživateli.

DRESS se zaměřuje na úpravu LLM pro lepší soulad s lidskými preferencemi prostřednictvím přirozené jazykové zpětné vazby. Tento přístup umožňuje neexpertním uživatelům poskytovat volné kritiky na generace modelu, jako “Uvedené vedlejší účinky se zdají přehnané” nebo úpravné instrukce, jako “Prosím, diskutujte také o nákladové efektivitě”. DRESS používá učení s posilováním pro trénování modelů generovat odpovědi podmíněné touto zpětnou vazbou, které lépe odpovídají lidským preferencím. To zlepšuje interaktivitu, zatímco snižuje nereálná nebo nepodporovaná prohlášení.

MixAlign se zabývá situacemi, kdy uživatelé kladou otázky, které přímo nekorespondují s důkazovými pasážemi vyhledanými systémem. Například uživatel může zeptat “Zhorší se znečištění v Číně?” zatímco vyhledané pasáže diskutují o globálních trendech znečištění. Aby se zabránilo halucinacím s nedostatečným kontextem, MixAlign explicitně vyjasňuje s uživatelem, když je nejistý, jak relacionovat jejich otázku na vyhledané informace. Tento mechanismus “člověk v smyčce” umožňuje získání zpětné vazby pro správné zakotvení a kontextualizaci důkazů, předcházející nezávislým odpovědím.

Technika Sebe-odraz trénuje LLM, aby vyhodnotily, poskytly zpětnou vazbu a iterativně rafinovaly své vlastní odpovědi pomocí víceuživatelského přístupu. Například, pro odpověď vygenerovanou pro lékařskou otázku, model se naučí ohodnotit faktickou přesnost, identifikovat jakékoli protichůdná nebo nepodporovaná prohlášení a editovat je vyhledáním relevantních znalostí. Učením LLM této zpětné vazby pro kontrolu, kritiku a iterativní zlepšování svých vlastních výstupů, přístup snižuje slepé halucinace.

Úprava výzev

Úprava výzev umožňuje úpravu instrukčních výzev poskytnutých LLM během jemného ladění pro požadované chování.

Metoda SynTra používá syntetickou sumarizační úlohu pro minimalizaci halucinace před přenosem modelu na reálné sumarizační datové sady. Syntetická úloha poskytuje vstupní pasáže a žádá model, aby je sumarizoval pouze prostřednictvím vyhledávání, bez abstrakce. To trénuje modely, aby se plně spoléhaly na zdrojový obsah, místo aby halucinovaly nové informace během sumarizace. SynTra se ukazuje jako efektivní pro snížení problémů s halucinacemi, když jsou jemně laděné modely nasazeny na cílové úlohy.

UPRISE trénuje univerzální vyhledávač výzev, který poskytuje optimální měkkou výzvu pro few-shot učení na nevídaných downstream úlohách. Vyhledáváním efektivní výzvy upravené na různých úlohách, model se naučí generalizovat a přizpůsobovat se novým úlohám, kde chybí trénovací příklady. To zlepšuje výkon bez potřeby úlohově specifického ladění.

Nové architektury modelu

FLEEK je systém zaměřený na pomoc lidským faktorům a validátorům. Automaticky identifikuje potenciálně ověřitelná faktická tvrzení učiněná v daném textu. FLEEK transformuje tato tvrzení na dotazy, vyhledává související důkazy z znalostních bází a poskytuje tuto kontextuální informaci lidským validátorům pro efektivní ověření dokumentu a revize.

Přístup CAD ke dekódování snižuje halucinaci v jazykové generaci prostřednictvím kontextově-aware dekódování. Konkrétně, CAD zvyšuje rozdíly mezi výstupním rozložením LLM, když je podmíněno kontextem, ve srovnání s generovaným nezávisle. To odrazuje odporující kontextové důkazy, směruje model směrem k zakotveným generacím.

DoLA zmírňuje faktické halucinace kontrastováním logitů z různých vrstev transformátorových sítí. Jelikož faktické znalosti tendují být lokalizovány v určitých středních vrstvách, zesilování signálů z těch faktických vrstev prostřednictvím kontrastu logitů DoLA snižuje nesprávné faktické generace.

Rámec THAM představuje regulační termín během trénování pro minimalizaci vzájemné informace mezi vstupy a halucinovanými výstupy. To pomáhá zvýšit závislost modelu na poskytnutém vstupním kontextu, místo aby se spoléhal na nevázanou fantazii, snižuje slepé halucinace.

Zakotvení znalostí

Zakotvení generací LLM v strukturovaných znalostech brání nekontrolované spekulaci a fabrikaci.

Model RHO identifikuje entity v konverzačním kontextu a propojuje je se znalostní bází (KB). Související fakta a vztahy o těchto entitách jsou vyhledány z KB a sloučeny do kontextové reprezentace poskytnuté LLM. Toto znalostně obohacené řízení snižuje halucinace v dialogu, udržuje odpovědi spojené se zakotvenými fakty o zmíněných entitách/událostech.

HAR vytváří kontrafaktické trénovací datové sady obsahující modelově generované halucinace pro lepší učení zakotvení. Daný faktický pasáž, modely jsou vyzvány k zavedení halucinací nebo zkreslení, generující alterovanou kontrafaktickou verzi. Jemné ladění na tomto datu nutí modely lépe zakotvit obsah v původních faktických zdrojích, snižuje improvizaci.

Dozorované jemné ladění

  • Coach – Interaktivní rámec, který odpovídá na uživatelské otázky, ale také žádá o korekce pro zlepšení.
  • R-Tuning – Odmítnutí-aware ladění odmítá nepodporovaná otázky identifikované prostřednictvím znalostních mezer v trénovacích datech.
  • TWEAK – Metoda dekódování, která řadí generace na základě toho, jak dobře hypotézy podporují vstupní fakta.

Výzvy a omezení

Navzdory slibnému pokroku, některé klíčové výzvy zůstávají při zmírnění halucinací:

  • Techniky často obchodují kvalitu, koherenci a kreativitu za věrnost.
  • Obtížnost v rigorózním hodnocení za hranicemi omezených domén. Metriky nezachycují všechny nuance.
  • Mnohé metody jsou výpočetně náročné, vyžadující rozsáhlé vyhledávání nebo sebe-rozumění.
  • Silně závisí na kvalitě trénovacích dat a externích znalostních zdrojů.
  • Těžko zajišťovat obecně platnost napříč doménami a modalitami.
  • Základní kořeny halucinace, jako je nadměrná extrapolace, zůstávají nevyřešené.

Řešení těchto výzev pravděpodobně vyžaduje vícesměrný přístup kombinující vylepšení trénovacích dat, architektonická vylepšení, ztrátové funkce zvyšující věrnost a techniky na úrovni inference.

Cesta vpřed

Zmírnění halucinací pro LLM zůstává otevřeným výzkumným problémem s aktivním pokrokem. Některé slibné budoucí směry zahrnují:

  • Hybridní techniky – Kombinace komplementárních přístupů, jako je vyhledávání, zakotvení znalostí a zpětná vazba.
  • Kauzalita modelování – Vylepšení pochopení a rozumění.
  • Online integrace znalostí – Udržení světových znalostí aktuálních.
  • Formální verifikace – Poskytnutí matematických záruk o chování modelu.
  • Interpretovatelnost – Stavění transparentnosti do technik zmírnění.

Jak LLM pokračují v proliferaci napříč high-stakes doménami, vývoj robustních řešení pro omezení halucinací bude klíčový pro zajištění jejich bezpečného, etického a spolehlivého nasazení. Techniky přehlednuté v tomto článku poskytují přehled technik navržených dosud, kde více otevřených výzkumných výzev zůstává. Celkově existuje pozitivní trend směrem k vylepšení fakticity modelu, ale pokračující pokrok vyžaduje řešení omezení a zkoumání nových směrů, jako je kauzalita, verifikace a hybridní metody. S pečlivými úsilími výzkumníků napříč disciplínami, sen o silných, ale důvěryhodných LLM může být přeložen do reality.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.