Prompt engineering
Analogické a krok zpět: Prompting: Ponořte se do nedávných pokroků od Google DeepMind

Úvod
Inženýrství promptů se zaměřuje na vytvoření účinných promptů, které budou Large Language Models (LLM) jako GPT-4 vést k generování požadovaných odpovědí. Dobře vytvořený prompt může být rozdílem mezi vágní nebo nepřesnou odpovědí a přesnou, hlubokou odpovědí.
V širším ekosystému AI je inženýrství promptů jednou z několika metod, které se používají k získání více přesných a kontextuálně relevantních informací z jazykových modelů. Dalšími metodami jsou techniky, jako je few-shot learning, kde je modelu dáno několik příkladů, aby mu pomohly pochopit úkol, a fine-tuning, kde je model dále trénován na menší datové sadě, aby specializoval své odpovědi.
Google DeepMind (GOOGL ) nedávno publikoval dvě studie, které se zabývají inženýrstvím promptů a jeho potenciálem ke zlepšení odpovědí v různých situacích.
Tyto studie jsou součástí probíhajícího výzkumu v komunitě AI, jehož cílem je vylepšit a optimalizovat, jak komunikujeme s jazykovými modely, a poskytují nové poznatky o struktuře promptů pro lepší zpracování dotazů a interakci s databází.
Tento článek se zabývá detaily těchto výzkumných studií, vysvětluje koncepty, metodologie a implikace navrhovaných technik, aby byly přístupné i čtenářům s omezenými znalostmi v oblasti AI a NLP.
Studie 1: Large Language Models jako analogičtí řešitelé
První studie, nazvaná “Large Language Models jako analogičtí řešitelé”, představuje novou metodu promptingu nazvanou Analogical Prompting. Autoři, Michihiro Yasunaga, Xinyun Chen a další, čerpají inspiraci z analogického uvažování – kognitivního procesu, při kterém lidé využívají minulých zkušeností k řešení nových problémů.
Klíčové koncepty a metodologie
Analogical Prompting podporuje LLM, aby samy generovaly relevantní příklady nebo znalosti v kontextu, než se pokusí vyřešit daný problém. Tato metoda eliminuje potřebu označených příkladů, nabízí obecnost a pohodlí, a přizpůsobuje generované příklady každému konkrétnímu problému, zajišťuje přizpůsobivost.

Vlevo: Tradiční metody promptingu LLM závisí na obecných vstupních datech (0-shot CoT) nebo vyžadují označené příklady (few-shot CoT). Vpravo: Nová metoda podporuje LLM, aby samy vytvořily relevantní příklady před řešením problému, odstraňuje potřebu označení a přizpůsobuje příklady každému jedinečnému problému
Samostatně generované příklady
První technika představená ve studii je samostatně generované příklady. Nápad spočívá v tom, že využije rozsáhlé znalosti, které LLM získaly během svého tréninku, aby jim pomohly vyřešit nové problémy. Proces zahrnuje doplnění cílového problému o instrukce, které podporují model, aby si vzpomněl nebo vygeneroval relevantní problémy a řešení.
Příklad: Daný problém, model je instruován, aby si vzpomněl na tři různé a relevantní problémy, popsal je a vysvětlil jejich řešení. Tento proces je navržen tak, aby se udál v jednom kroku, umožňující LLM vygenerovat relevantní příklady a vyřešit počáteční problém bezproblémově. Použití ‘#’ symbolů v promptech pomáhá ve struktuře odpovědi, činí ji více organizovanou a snazší pro model, aby ji následoval.
Klíčová technická rozhodnutí zdůrazněná ve studii zahrnují zdůraznění generování relevantních a rozmanitých příkladů, přijetí jednoho kroku pro větší pohodlí a zjištění, že generování tří až pěti příkladů vede k nejlepšímu výsledku.
Samostatně generované znalosti + příklady
Druhá technika, samostatně generované znalosti + příklady, je představena pro řešení složitějších úkolů, jako je generování kódu. V těchto scénářích mohou LLM příliš záviset na nízkoúrovňových příkladech a mít potíže s generalizací při řešení cílových problémů. Aby se tomuto problému zabránilo, autoři navrhují doplnění promptu o další instrukci, která podporuje model, aby identifikoval základní koncepty v problému a poskytl tutoriál nebo vysokou úroveň přehledu.
Jedním z kritických hledisek je pořadí, v jakém jsou generovány znalosti a příklady. Autoři zjistili, že generování znalostí před příklady vede k lepšímu výsledku, protože pomáhá LLM soustředit se na fundamentální přístupy k řešení problémů, spíše než pouze na povrchové podobnosti.
Výhody a aplikace
Analogical Prompting nabízí několik výhod. Poskytuje podrobné příklady uvažování bez potřeby ručního označení, řeší výzvy spojené s 0-shot a few-shot chain-of-thought (CoT) metodami. Kromě toho jsou generované příklady přizpůsobeny jednotlivým problémům, nabízejí více relevantní vedení než tradiční few-shot CoT, které používá pevné příklady.
Studie demonstruje účinnost této metody napříč různými úkoly uvažování, včetně řešení matematických problémů, generování kódu a dalších úkolu uvažování v BIG-Bench.
Níže uvedené tabulky představují metriky výkonu různých metod promptingu napříč různými architekturami modelů. Značně se ukazuje, že metoda “Samostatně generované příklady” konzistentně převyšuje ostatní metody z hlediska přesnosti. V GSM8K přesnosti tato metoda dosahuje nejvyššího výkonu na modelu PaLM2 s 81,7%. Podobně pro MATH přesnost je na vrcholu na modelu GPT3.5-turbo s 37,3%.
V druhé tabulce pro modely GPT3.5-turbo-16k a GPT4 ukazuje “Samostatně generované znalosti + příklady” nejlepší výkon.
Studie 2: Krok zpět: Vzbuzení uvažování prostřednictvím abstrakce v Large Language Modelech
Přehled
Druhá studie, “Krok zpět: Vzbuzení uvažování prostřednictvím abstrakce v Large Language Modelech“, představuje metodu promptingu nazvanou Step-Back Prompting, která podporuje LLM, aby abstrahovaly vysoké koncepty a principy z detailních instancí. Autoři, Huaixiu Steven Zheng, Swaroop Mishra a další, cílí na zlepšení uvažování LLM tím, že je vedou k následování správné cesty uvažování směrem k řešení.

Zobrazení STEP-BACK PROMPTINGU prostřednictvím dvou fází Abstrakce a Uvažování, řízené klíčovými koncepty a principy.
Podívejme se na jednoduchý příklad pomocí základní matematické otázky, abychom demonstrovali techniku “Stepback Question”:
Původní otázka: Pokud vlak jede rychlostí 60 km/h a ujede vzdálenost 120 km, jak dlouho to bude trvat?
Možnosti:
3 hodiny
2 hodiny
1 hodina
4 hodiny
Původní odpověď [Nesprávná]: Správná odpověď je 1).
Stepback otázka: Jaká je základní formula pro výpočet času, pokud je známa rychlost a vzdálenost?
Principy:
Pro výpočet času používáme formula:
Čas = Vzdálenost / Rychlost
Konečná odpověď:
Používáním formule, Čas = 120 km / 60 km/h = 2 hodiny.
Správná odpověď je 2) 2 hodiny.
Ačkoli LLM mohou snadno odpovědět na výše uvedenou otázku, tento příklad je pouze demonstrací, jak by technika “stepback” fungovala. Pro složitější scénáře lze použít stejnou techniku, aby se systematicky rozložil a vyřešil problém. Níže je ukázka složitějšího případu, který je demonstrován ve studii:
Klíčové koncepty a metodologie
Podstatou Step-Back Promptingu je schopnost LLM udělat metaforický krok zpět, podporovat je, aby se dívaly na širší obraz, spíše než aby se ztratily v detailech. To je dosaženo prostřednictvím série pečlivě vytvořených promptů, které vedou LLM k abstrakci informací, odvození vysokých konceptů a aplikaci těchto konceptů na řešení daného problému.
Proces začíná tím, že LLM je podporován k abstrakci detailů z daných instancí, podporuje ho, aby se zaměřil na základní koncepty a principy. Tento krok je zásadní, protože nastavuje scénu pro LLM, aby se přiblížil problému z více informovaného a principiálního pohledu.
Jakmile jsou odvozeny vysoké koncepty, jsou použity k vedení LLM skrze kroky uvažování směrem k řešení. Toto vedení zajišťuje, že LLM zůstává na správné cestě, následuje logickou a koherentní cestu, která je založena na abstrahovaných konceptech a principech.
Autoři provádějí řadu experimentů, aby ověřili účinnost Step-Back Promptingu, používají modely PaLM-2L napříč řadou náročných úkolů uvažování. Tyto úkoly zahrnují úkoly STEM, Knowledge QA a Multi-Hop Reasoning, poskytují komplexní testovací sadu pro hodnocení této techniky.
Substantiální zlepšení napříč úkoly
Výsledky jsou působivé, s Step-Back Promptingem, který vede k podstatnému zlepšení výkonu napříč všemi úkoly. Například tato technika zlepšuje výkon modelu PaLM-2L na MMLU Physics a Chemistry o 7% a 11%, resp. Podobně zvyšuje výkon na TimeQA o 27% a na MuSiQue o 7%.
Tyto výsledky podtrhují potenciál Step-Back Promptingu, aby podstatně zlepšil uvažování LLM.
Závěr
Obě studie od Google DeepMind představují inovativní přístupy k inženýrství promptů, jejichž cílem je zlepšit uvažování velkých jazykových modelů. Analogical Prompting využívá konceptu analogického uvažování, podporuje modely, aby samy generovaly příklady a znalosti, vedoucí k více přizpůsobivému a efektivnímu řešení problémů. Na druhé straně se Step-Back Prompting zaměřuje na abstrakci, podporuje modely, aby odvodily vysoké koncepty a principy, které následně zlepšují jejich uvažování.
Tyto výzkumné studie poskytují cenné poznatky a metodologie, které lze aplikovat napříč různými doménami, vedoucí k více inteligentním a schopným jazykovým modelům. Jak pokračujeme ve výzkumu a porozumění jemnostem inženýrství promptů, tyto přístupy slouží jako zásadní kroky směrem k dosažení více pokročilých a sofistikovaných systémů AI.
















