Myslitelé
3 způsoby, jak udržet zastaralá fakta čerstvá v velkých jazykových modelech

Velké jazykové modely (LLM) jako GPT3, ChatGPT a BARD jsou v současnosti velmi populární. Každý má názor na to, zda tyto nástroje jsou pro společnost dobré nebo špatné a co znamenají pro budoucnost umělé inteligence. Google dostal mnoho kritiky za to, že jeho nový model BARD odpověděl na složitou otázku nesprávně (mírně). Když byl dotázán „Jaká nová objevná zjištění z dalekohledu Jamese Webba můžete říci mému 9letému dítěti?“ – chatbot poskytl tři odpovědi, z nichž dvě byly správné a jedna nesprávná. Nesprávná odpověď zněla, že první „exoplanetární“ snímek byl pořízen dalekohledem JWST, což bylo nesprávné. Zjednodušeně řečeno, model měl v své znalostní bázi nesprávnou informaci. Aby velké jazykové modely byly efektivní, potřebujeme způsob, jak tyto informace aktualizovat nebo doplnit novými znalostmi.
Podívejme se nejprve na to, jak jsou fakta uložena uvnitř velkého jazykového modelu (LLM). Velké jazykové modely neukládají informace a fakta v tradičním smyslu, jako jsou databáze nebo soubory. Místo toho byly vyškoleny na obrovském množství textových dat a naučily se vzory a vztahy v těchto datech. To jim umožňuje generovat lidsky podobné odpovědi na otázky, ale nemají specifické místo pro uložení naučených informací. Když odpovídají na otázku, model používá své školení k vygenerování odpovědi na základě vstupních dat. Informace a znalosti, které má jazykový model, jsou výsledkem vzorů, které se naučil v datech, na kterých byl vyškolěn, a ne výsledkem explicitního uložení v paměti modelu. Architektura Transformer, na které jsou založeny většina moderních LLM, má vnitřní kódování fakt, které se používá pro odpovědi na otázky v promptu.

Pokud jsou tedy fakta uvnitř vnitřní paměti LLM nesprávná nebo zastaralá, je třeba poskytnout nové informace prostřednictvím promptu. Prompt je text, který se posílá do LLM spolu s dotazem a podpůrnými důkazy, které mohou být některé nové nebo opravené fakta. Zde jsou 3 způsoby, jak toho dosáhnout.
1. Jedním ze způsobů, jak opravit zakódovaná fakta LLM, je poskytnout nové fakta relevantní k kontextu pomocí externí znalostní báze. Tato znalostní báze může být API volání pro získání relevantních informací nebo vyhledávání v SQL, No-SQL nebo vektorové databázi. Pokročilejší znalosti lze extrahovat ze znalostního grafu, který ukládá datové entity a vztahy mezi nimi. V závislosti na informacích, které uživatel dotazuje, lze relevantní kontextové informace získat a poskytnout jako další fakta LLM. Tyto fakta lze také formátovat tak, aby vypadaly jako tréninkové příklady, aby se zlepšil proces učení. Například můžete předat sadu otázek a odpovědí, aby model naučil, jak poskytovat odpovědi.

2. Více inovativní (a dražší) způsob, jak rozšířit LLM, je skutečné jemné ladění pomocí tréninkových dat. Místo dotazování znalostní báze pro konkrétní fakta k přidání sestavíme tréninkovou sadu dat výběrem ze znalostní báze. Používáme dohledované učení, jako je jemné ladění, abychom vytvořili novou verzi LLM, která je vyškolena na těchto dalších znalostech. Tento proces je obvykle drahý a může stát několik tisíc dolarů na vytvoření a údržbu jemně laděného modelu v OpenAI. Samozřejmě se očekává, že náklady se v budoucnu sníží.
3. Další možností je použít metody, jako je učení s posilováním (RL), k výcviku agenta s lidskou zpětnou vazbou a naučení se politice, jak odpovědět na otázky. Tato metoda se ukázala jako velmi účinná při budování menších modelů, které se stávají dobrými v konkrétních úkolech. Například slavný ChatGPT, který vydal OpenAI, byl vyškolován na kombinaci dohledovaného učení a RL s lidskou zpětnou vazbou.

Shrnutí: toto je velmi dynamicky se vyvíjející prostor, ve kterém každá velká společnost chce být a ukázat svou odlišnost. Brzy uvidíme velké LLM nástroje ve většině oblastí, jako je maloobchod, zdravotnictví a bankovnictví, které mohou reagovat způsobem podobným lidskému a chápat nuance jazyka. Tyto LLM nástroje integrované s firemními daty mohou zjednodušit přístup a zpřístupnit správná data správným lidem ve správný čas.












