Prompt engineering

Seneste moderne fremskridt i prompt-teknik: En omfattende vejledning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Prompt-teknik, kunsten og videnskaben om at udforme prompts, der fremkalder ønskede svar fra LLM’er, er blevet et afgørende område for forskning og udvikling.

Fra at forbedre resonanskapaciteter til at muliggøre en problemfri integration med eksterne værktøjer og programmer, er de seneste fremskridt i prompt-teknik åbnet nye grænser for kunstig intelligens. Herunder diskuterer vi de seneste avancerede teknikker og strategier, der former fremtiden for prompt-teknik.

Prompt-teknik

Prompt-teknik

Avancerede prompt-strategier for komplekse problemløsninger

Selvom CoT-promptning har vist sig at være effektiv for mange resonansopgaver, har forskere udforsket mere avancerede prompt-strategier for at tackle endnu mere komplekse problemer. En sådan tilgang er Least-to-Most-promptning, som bryder et komplekst problem ned i mindre, mere håndterbare underproblemer, der løses uafhængigt og derefter kombineres for at nå den endelige løsning.

En anden innovativ teknik er Tree of Thoughts (ToT)-promptning, som tillader LLM’en at generere multiple resonanslinjer eller “tanker” i parallel, evaluere sin egen fremgang mod løsningen og gå tilbage eller udforske alternative veje efter behov. Denne tilgang udnytter søgealgoritmer som bredde-først eller dybde-først søgning, hvilket giver LLM’en mulighed for at engagere sig i lookahead og backtracking under problemløsningen.

Integration af LLM’er med eksterne værktøjer og programmer

Selvom LLM’er er utroligt kraftfulde, har de indbyggede begrænsninger, såsom en manglende evne til at få adgang til opdateret information eller udføre præcis matematisk resonans. For at løse disse ulemper har forskere udviklet teknikker, der giver LLM’er mulighed for at integrere problemfrit med eksterne værktøjer og programmer.

Et bemærkelsesværdigt eksempel er Toolformer, som lærer LLM’er at identificere scenarier, der kræver brug af eksterne værktøjer, specificere hvilket værktøj der skal bruges, give relevant input og inkorporere værktøjets output i den endelige respons. Denne tilgang indebærer opbygning af en syntetisk træningsdataset, der demonstrerer den korrekte brug af forskellige tekst-til-tekst-API’er.

En anden innovativ ramme, Chameleon, tager en “plug-and-play”-tilgang, som giver en central LLM-baseret controller mulighed for at generere naturlige sprogprogrammer, der komponerer og udfører en bred vifte af værktøjer, herunder LLM’er, visionmodeller, websøgeingeniører og Python-funktioner. Denne modulære tilgang giver Chameleon mulighed for at tackle komplekse, multimodale resonansopgaver ved at udnytte styrkerne hos forskellige værktøjer og modeller.

Fundamentale prompt-strategier

Zero-Shot-promptning

Zero-Shot-promptning indebærer at beskrive opgaven i prompten og bede modellen om at løse den uden nogen eksempler. For eksempel kan en zero-shot-prompt til at oversætte “ost” til fransk være:

Oversæt følgende engelsk ord til fransk: ost.

Denne tilgang er direkte, men kan være begrænset af opgavens beskrivelses tvetydighed.

Few-Shot-promptning

Few-Shot-promptning forbedrer zero-shot-promptning ved at inkludere flere eksempler på opgaven. For eksempel:

Oversæt følgende engelske ord til fransk:
1. æble => pomme
2. hus => maison
3. ost => fromage

Denne metode reducerer tvetydigheden og giver en klarere vejledning for modellen, udnyttende LLM’ernes evne til at lære i kontekst.

Instruction-promptning

Instruction-promptning beskriver explicit den ønskede output, hvilket er særligt effektivt med modeller, der er trænet til at følge instruktioner. For eksempel:

Oversæt ordet "ost" til fransk. Den korrekte oversættelse er "fromage."

Modeller som GPT-4 er blevet specifikt finjusteret til at følge sådanne instruktioner nøjagtigt.

Avancerede prompt-teknikker

Forbedring af resonanskapaciteter med Chain-of-Thought-promptning

En af de mest betydningsfulde gennembrud i prompt-teknik har været udviklingen af Chain-of-Thought (CoT)-promptning. Denne teknik sigter mod at fremkalde og forbedre resonanskapaciteterne hos LLM’er ved at opmuntre dem til at generere en trin-for-trin tænkeproces eller rationel før de giver den endelige respons.

Venstre: Traditionelle metoder til at prompte LLM'er afhænger af generiske input (0-shot CoT) eller kræver labelede eksempler (few-shot CoT). Højre: Den nye tilgang prompter LLM'er til at selv-oprette relevante eksempler før problemløsning, fjerner behovet for labeling og tilpasser eksemplerne til hvert enkelt unikt problem

Venstre: Traditionelle metoder til at prompte LLM’er afhænger af generiske input (0-shot CoT) eller kræver labelede eksempler (few-shot CoT). Højre: Den nye tilgang prompter LLM’er til at selv-oprette relevante eksempler før problemløsning, fjerner behovet for labeling og tilpasser eksemplerne til hvert enkelt unikt problem

CoT-promptning fungerer ved at præsentere LLM’en for eksempler, der inkluderer ikke kun input og output, men også de mellemste resonanstrin eller “tankerække”, der fører til løsningen. Ved at lære fra disse eksempler kan LLM’en derefter generere sin egen tankekedde, når den præsenteres for nye problemer, og forbedre sin evne til at tackle komplekse resonansopgaver.

Eksempel:

Input: Natalie har 3 æbler, og hun vil dele dem ligeligt med sine 2 venner. Hvad får hver person? Tankerække: Okay, lad os bryde det ned trin for trin:

  1. Natalie har 3 æbler
  2. Hun vil dele dem ligeligt med 2 venner
  3. Der er så 3 personer i alt (Natalie og hendes 2 venner)
  4. For at dele æblerne ligeligt, deler vi det totale antal æbler (3) med antallet af personer (3)
  5. 3 divideret med 3 er 1
  6. Derfor får hver person 1 æble. Output: Hver person får 1 æble.

Ved at generere tænkeprocessen explicit, har LLM’er som GPT-3 og Codex demonstreret betydelige forbedringer i aritmetik, sund fornuft og symbolisk resonans.

Selv-konsistens

Selv-konsistens forbedrer pålideligheden af CoT-promptning ved at generere multiple tankekedder og tage en flertalsafstemning på den endelige respons. Denne metode formindsker virkningen af en enkelt forkert resonansvej.

Least-to-Most-promptning

Least-to-Most-promptning bryder komplekse problemer ned i enkle underproblemer, løser hvert underproblem sekventielt og bruger konteksten fra tidligere løsninger til at informere efterfølgende trin. Denne tilgang er fordelagtig for multi-trins resonansopgaver.

Seneste fremskridt i prompt-teknik

Prompt-teknik udvikler sig hurtigt, og flere innovative teknikker er opstået for at forbedre præstationen af store sprogmodeller (LLM’er). Lad os udforske nogle af disse avancerede metoder i detaljer:

Auto-CoT (Automatisk Chain-of-Thought-promptning)

Hvad det er: Auto-CoT er en metode, der automatiserer genereringen af resonanskedder for LLM’er, og eliminerer således behovet for manuelt udformede eksempler. Denne teknik bruger zero-shot Chain-of-Thought (CoT)-promptning, hvor modellen guidet til at tænke trin for trin for at generere sin egen resonanskedde.

Hvordan det fungerer:

  1. Zero-Shot CoT-promptning: Modellen præsenteres for en simpel prompt som “Lad os tænke trin for trin” for at opmuntre detaljeret resonans.
  2. Mangfoldighed i demonstrationer: Auto-CoT vælger diverse spørgsmål og genererer resonanskedder for disse spørgsmål, sikrer en variation af problemtyper og resonansmønstre.

Fordele:

  • Automatisering: Reducerer det manuelle arbejde, der kræves for at oprette resonansdemonstrationer.
  • Præstation: På forskellige resonansopgaver har Auto-CoT matchet eller overgået præstationen af manuel CoT-promptning.

Kompleksitetsbaseret promptning

Hvad det er: Denne teknik vælger eksempler med den højeste kompleksitet (dvs. flest resonanstrin) til at inkludere i prompten. Den sigter mod at forbedre modellens præstation på opgaver, der kræver multiple resonanstrin.

Hvordan det fungerer:

  1. Eksempelvalg: Prompts vælges baseret på antallet af resonanstrin, de indeholder.
  2. Kompleksitetsbaseret konsistens: Under afkodning samles multiple resonanskedder, og flertalsafstemningen tages fra de mest komplekse kedder.

Fordele:

  • Forbedret præstation: Betragteligt bedre nøjagtighed på multi-trins resonansopgaver.
  • Robusthed: Effektiv selv under forskellige promptfordelinger og støjende data.

Progressiv-Hint-promptning (PHP)

Hvad det er: PHP itererer modellens svar ved at bruge tidligere genererede rationaler som hints. Denne metode udnytter modellens tidligere svar til at guide den mod den korrekte respons gennem multiple iterationer.

Hvordan det fungerer:

  1. Initialt svar: Modellen genererer et basis-svar ved hjælp af en standardprompt.
  2. Hints og forbedringer: Dette basis-svar bruges derefter som en hint i efterfølgende prompts for at forbedre svaret.
  3. Iterativ proces: Denne proces fortsætter, indtil svaret stabiliserer sig over pågældende iterationer.

Fordele:

  • Nøjagtighed: Betydelige forbedringer i resonansnøjagtighed.
  • Effektivitet: Reducerer antallet af sti-punkter, der kræves, og forbedrer således beregnings-effektiviteten.

Decomponeret promptning (DecomP)

Hvad det er: DecomP bryder komplekse opgaver ned i enkle underopgaver, hver håndteret af en specifik prompt eller model. Denne modulære tilgang giver mulighed for en mere effektiv håndtering af komplekse problemer.

Hvordan det fungerer:

  1. Opgave-dekomposition: Hovedopgaven deles op i enkle underopgaver.
  2. Underopgave-håndtering: Hver underopgave håndteres af en dedikeret model eller prompt.
  3. Modulær integration: Disse håndteringsfunktioner kan optimeres, erstattes eller kombineres efter behov for at løse den komplekse opgave.

Fordele:

  • Fleksibilitet: Let at fejlfinde og forbedre specifikke underopgaver.
  • Skalbarhed: Håndterer opgaver med lange kontekster og komplekse underopgaver effektivt.

Hypoteser-til-Teorier (HtT)-promptning

Hvad det er: HtT bruger en videnskabelig opdagelsesproces, hvor modellen genererer og verificerer hypoteser for at løse komplekse problemer. Denne metode indebærer opbygning af en regelbibliotek fra verificerede hypoteser, som modellen bruger til resonans.

Hvordan det fungerer:

  1. Induktionsfase: Modellen genererer potentielle regler og verificerer dem mod trænings eksempler.
  2. Regelbibliotek-opbygning: Verificerede regler samles for at danne et regelbibliotek.
  3. Deduktionsfase: Modellen anvender disse regler til nye problemer, ved at bruge regelbiblioteket til at guide sin resonans.

Fordele:

  • Nøjagtighed: Reducerer sandsynligheden for fejl ved at afhænge af en verificeret samling af regler.
  • Overførbarhed: De lærede regler kan overføres mellem forskellige modeller og problemformer.

Værktøjsforbedrede prompt-teknikker

Toolformer

Toolformer integrerer LLM’er med eksterne værktøjer via tekst-til-tekst-API’er, hvilket giver modellen mulighed for at bruge disse værktøjer til at løse problemer, den ellers ikke kunne.

Chameleon

Chameleon bruger en central LLM-baseret controller til at generere et program, der komponerer og udfører en bred vifte af værktøjer, herunder visionmodeller og websøgeingeniører, for at forbedre problemløsningsevnen.

GPT4Tools

GPT4Tools finjusterer åbne LLM’er til at bruge multimodale værktøjer via en selv-instruerende tilgang, demonstrerende, at selv ikke-propriære modeller kan effektivt udnytte eksterne værktøjer til forbedret præstation.

Gorilla og HuggingGPT

Både Gorilla og HuggingGPT integrerer LLM’er med specialiserede dyb-læringsmodeller, der er tilgængelige online. Disse systemer bruger en retrieval-bevidst finjustering og en planlægnings- og koordinerings-tilgang for at løse komplekse opgaver, der involverer multiple modeller.

Program-Aided Language Models (PALs) og Programs of Thoughts (PoTs)

Ud over at integrere med eksterne værktøjer har forskere udforsket måder at forbedre LLM’ers problemløsningsevne ved at kombinere naturligt sprog med programmeringskonstruktioner. Program-Aided Language Models (PALs) og Programs of Thoughts (PoTs) er to sådanne tilgange, der udnytter kode til at forbedre LLM’ens resonansproces.

PALs prompter LLM’en til at generere en rationel, der afbryder naturligt sprog med kode (f.eks. Python), som derefter kan køres for at producere den endelige løsning. Denne tilgang løser et almindeligt fejltilfælde, hvor LLM’er genererer korrekt resonans, men producerer en forkert endelig respons.

Ligesom PoTs anvender en symbolisk matematik-bibliotek som SymPy, hvilket giver LLM’en mulighed for at definere matematiske symboler og udtryk, der kan kombineres og vurderes ved hjælp af SymPys solve-funktion. Ved at overdrage komplekse beregninger til en kodefortolker, giver disse teknikker LLM’er mulighed for at tackle mere komplekse problemer effektivt.

Forståelse og udnyttelse af kontekstvinduer

LLM’ers præstation afhænger stærkt af deres evne til at behandle og udnytte konteksten i prompten. Forskere har undersøgt, hvordan LLM’er håndterer lange kontekster og virkningen af irrelevant eller distraherende information på deres output.

Fænomenet “Lost in the Middle” understreger, hvordan LLM’er tenderer til at fokusere mere på information i begyndelsen og slutningen af deres kontekst, mens information i midten ofte overses eller “tabes.” Denne indsigt har implikationer for prompt-teknik, da en omhyggelig placering af relevant information inden for konteksten kan have en betydelig indvirkning på præstationen.

En anden forskningsretning fokuserer på at mindske de skadelige effekter af irrelevant kontekst, som kan nedbryde LLM’ers præstation betydeligt. Teknikker som selv-konsistens, eksplicitte instruktioner til at ignorere irrelevant information og inklusion af eksempler, der demonstrerer løsning af problemer med irrelevant kontekst, kan hjælpe LLM’er til at fokusere på den mest pertinente information.

Forbedring af skrivefærdigheder med prompt-strategier

Selvom LLM’er excellerer i at generere menneske-lignende tekst, kan deres skrivefærdigheder yderligere forbedres gennem specialiserede prompt-strategier. En sådan teknik er Skeleton-of-Thought (SoT)-promptning, som sigter mod at reducere latent tiden for sekventiel afkodning ved at efterligne den menneskelige skriveproces.

SoT-promptning indebærer at prompte LLM’en til at generere en skelet eller kontur af dens svar først, efterfulgt af parallele API-kald for at udfylde detaljerne i hver konturelement. Denne tilgang forbedrer ikke kun inferens-latencen, men kan også forbedre skrivekvaliteten ved at opmuntre LLM’en til at planlægge og strukturere sin output mere effektivt.

En anden prompt-strategi, Chain of Density (CoD)-promptning, fokuserer på at forbedre informations-tætheden i LLM-genererede sammenfattelser. Ved at iterativt tilføje enheder til sammenfattelsen, mens længden holdes fast, giver CoD-promptning brugerne mulighed for at udforske kompromisset mellem korthed og fuldstændighed, og producerer således mere informative og læselige sammenfattelser.

Fremvoksende retninger og fremtidsperspektiver

ChatGPT & Avanceret prompt-teknik

Avanceret prompt-teknik

Feltet for prompt-teknik udvikler sig hurtigt, og forskere udforsker kontinuerligt nye grænser og skyder med what’s muligt med LLM’er. Nogle fremvoksende retninger inkluderer:

  1. Aktiv promptning: Teknikker, der udnytter usikkerhedsbaserede aktiv læring til at identificere og annotere de mest nyttige eksempler for at løse bestemte resonansopgaver.
  2. Flervalgs-promptning: Udvidelse af prompt-strategier til at håndtere flervalgs-input, der kombinerer tekst, billeder og andre data-modaliteter.
  3. Automatisk prompt-generering: Udvikling af optimeringsteknikker til automatisk at generere effektive prompts tilpasset til bestemte opgaver eller domæner.
  4. Fortolkning og forklarbarhed: Udforskning af prompt-metoder, der forbedrer fortolkningen og forklarbarheden af LLM’ers output, hvilket giver bedre gennemsigtighed og tillid til deres beslutningsprocesser.

Da LLM’er fortsætter med at udvikle sig og finder anvendelse i forskellige domæner, vil prompt-teknik spille en afgørende rolle i at låse deres fulde potentiale op. Ved at udnytte de seneste prompt-teknikker og strategier kan forskere og praktikere udvikle mere kraftfulde, pålidelige og opgave-specifikke AI-løsninger, der skyder med grænserne for hvad der er muligt med naturligt sprogbehandling.

Konklusion

Feltet for prompt-teknik for store sprogmodeller udvikler sig hurtigt, og forskere skyder kontinuerligt med grænserne for hvad der er muligt. Fra at forbedre resonanskapaciteter med teknikker som Chain-of-Thought-promptning til at integrere LLM’er med eksterne værktøjer og programmer, er de seneste fremskridt i prompt-teknik åbnet nye grænser for kunstig intelligens.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.