AI-modeller og platforme
Hvorfor store sprogmodeller springer instruktioner over og hvordan man løser problemet

Store sprogmodeller (LLM) er blevet uundværlige kunstig intelligens (AI)-værktøjer, der driver applikationer fra chatbots og indholdsskabelse til kodestøtte. Trods deres imponerende evner møder brugerne ofte udfordringen, at disse modeller nogle gange springer dele af instruktionerne over, især når instruktionerne er lange eller involverer flere trin. Dette springer fører til ufuldstændige eller ukorrekte output, hvilket kan forårsage forvirring og underminere tilliden til AI-systemer. At forstå, hvorfor LLM springer instruktioner over, og hvordan man løser dette problem, er afgørende for brugere, der afhænger af disse modeller til præcise og pålidelige resultater.
Hvorfor springer LLM instruktioner over?
LLM’er fungerer ved at læse inputtekst som en sekvens af tokens. Tokens er de små dele, som teksten deles op i. Modellen behandler disse tokens én efter én, fra start til slut. Dette betyder, at instruktioner i begyndelsen af inputtet tenderer til at få mere opmærksomhed. Senere instruktioner kan modtage mindre fokus og kan blive ignoreret.
Dette sker, fordi LLM’er har en begrænset opmærksomheds kapacitet. Opmærksomhed er den mekanisme, modellerne bruger til at afgøre, hvilke inputdele er essentielle, når de genererer svar. Når inputtet er kort, fungerer opmærksomhed godt. Men opmærksomhed bliver svagere, når inputtet bliver længere eller instruktionerne bliver komplekse. Dette svækker fokus på senere dele, hvilket fører til springer.
Dertil kommer, at mange instruktioner på én gang øger kompleksiteten. Når instruktioner overlapper eller er i konflikt, kan modellerne blive forvirrede. De kan prøve at svare på alt, men producere vagt eller modstridende svar. Dette resulterer ofte i, at nogle instruktioner bliver sprunget over.
LLM’er deler også nogle menneskelige begrænsninger. For eksempel kan mennesker tabe fokus, når de læser lange eller gentagne tekster. Ligesom mennesker kan LLM’er glemme senere instruktioner, mens de behandler flere tokens. Denne tab af fokus er en del af modellens design og begrænsninger.
En anden årsag er, hvordan LLM’er er trænet. De ser mange eksempler på simple instruktioner, men færre komplekse, multi-trins instruktioner. Fordi de ser færre komplekse instruktioner, tenderer modellerne til at foretrække at følge simple instruktioner, der er mere almindelige i deres træningsdata. Denne bias får dem til at springe komplekse instruktioner over. Desuden begrænser token-grænserne mængden af input, modellen kan behandle. Når input overskrider disse grænser, bliver instruktionerne ud over grænsen ignoreret.
Eksempel: Antag, at du giver en LLM fem instruktioner i en enkelt prompt. Modellen kan fokusere primært på de første to instruktioner og delvist eller fuldstændigt ignorere de sidste tre. Dette påvirker direkte, hvordan modellen behandler tokens sekventielt og dens opmærksomhedsbegrænsninger.
Hvor godt LLM’er følger sekventielle instruktioner baseret på SIFo 2024-fund
Nylige studier har undersøgt, hvor godt LLM’er følger flere instruktioner, der gives én efter én. En vigtig studie er Sekventielle Instruktioner Følger (SIFo)-benchmark 2024. Denne benchmark tester modeller på opgaver, der kræver trin-for-trin-fuldførelse af instruktioner, såsom tekstmodifikation, spørgsmålssvar, matematik og sikkerhedsregler. Hver instruktion i sekvensen afhænger af den korrekte fuldførelse af den foregående. Denne tilgang hjælper med at kontrollere, om modellen har følgt hele sekvensen korrekt.
Resultaterne fra SIFo viser, at selv de bedste LLM’er, som GPT-4 og Claude-3, ofte har svært ved at fuldføre alle instruktioner korrekt. Dette er især sandt, når instruktionerne er lange eller komplekse. Forskningen peger på tre hovedproblemer, som LLM’er står over for, når de følger instruktioner:
Forståelse: Fuldstændigt at forstå, hvad hver instruktion betyder.
Resonnering: At sammenkæde flere instruktioner logisk for at holde svaret klart.
Pålidelig output: At producere fuldstændige og præcise svar, der dækker alle instruktioner.
Teknikker som prompt-teknik og finjustering hjælper med at forbedre, hvor godt modeller følger instruktioner. Men disse metoder hjælper ikke fuldstændigt med problemet om at springe instruktioner over. Brug af Reinforcement Learning med menneskelig feedback (RLHF) forbedrer yderligere modellens evne til at svare passende. Alligevel har modellerne svært ved at følge instruktioner, der kræver mange trin eller er meget komplekse.
Studiet viser også, at LLM’er fungerer bedst, når instruktionerne er simple, tydeligt adskilt og godt organiseret. Når opgaver kræver lange resonneringskæder eller mange trin, falder modellens nøjagtighed. Disse fund hjælper med at foreslå bedre måder at bruge LLM’er på og viser behovet for at bygge stærkere modeller, der kan følge instruktioner én efter én.
Hvorfor LLM’er springer instruktioner over: Tekniske udfordringer og praktiske overvejelser
LLM’er kan springe instruktioner over på grund af flere tekniske og praktiske faktorer, der er rod i, hvordan de behandler og kodificerer inputtekst.
Begrænset opmærksomheds kapacitet og informationsdilution
LLM’er afhænger af opmærksomheds mekanismer til at tildele vigtighed til forskellige inputdele. Når prompts er korte, er modellens opmærksomhed fokuseret og effektiv. Men når prompten bliver længere eller mere gentagen, bliver opmærksomheden dilueret, og senere tokens eller instruktioner modtager mindre fokus, hvilket øger sandsynligheden for, at de bliver overset. Denne fenomen, kendt som informationsdilution, er især problematisk for instruktioner, der viser sig sent i en prompt. Desuden har modellerne faste token-grænser (f.eks. 2048 tokens); enhver tekst ud over denne grænse bliver afkortet og ignoreret, hvilket får instruktionerne til at blive sprunget over helt.
Output-kompleksitet og tvetydighed
LLM’er kan have svært ved at producere klare og fuldstændige svar, når de står over for multiple eller modstridende instruktioner. Modellen kan generere delvise eller vagt svar for at undgå modstrid eller forvirring, hvilket effektivt udelader nogle instruktioner. Tvetydighed i, hvordan instruktioner er formuleret, stiller også udfordringer: Uklare eller upræcise prompts gør det svært for modellen at bestemme de ønskede handlinger, hvilket øger risikoen for at springe eller misforstå dele af inputtet.
Prompt-design og formateringssensitivitet
Promptens struktur og formatering spiller også en kritisk rolle i instruktionsfølgen. Forskning viser, at selv små ændringer i, hvordan instruktioner er skrevet eller formateret, kan have en betydelig indvirkning på, om modellen følger dem.
Dårligt strukturerede prompts, der mangler tydelig adskillelse, punktnummer eller nummerering, gør det svært for modellen at skelne mellem trin, hvilket øger chancen for at sammenflette eller udelade instruktioner. Modellens interne repræsentation af prompten er meget følsom over for disse variationer, hvilket forklarer, hvorfor prompt-teknik (omformulering eller omstrukturering af prompts) kan forbedre instruktionsfølgen betydeligt, selvom den underliggende indhold forbliver den samme.
Hvordan man løser instruktions-springer i LLM’er
At forbedre LLM’ers evne til at følge instruktioner korrekt er afgørende for at producere pålidelige og præcise resultater. Følgende bedste praksis skal overvejes for at minimere instruktions-springer og forbedre kvaliteten af AI-genererede svar:
Opgaver skal brydes ned i mindre dele
Lange eller multi-trins prompts skal brydes ned i mindre, mere fokuserede segmenter. At give én eller to instruktioner ad gangen tillader modellen at fastholde bedre opmærksomhed og reducerer sandsynligheden for at springe nogen trin over.
Eksempel
I stedet for at kombinere alle instruktioner i en enkelt prompt, såsom “Sammenfatter teksten, lister hovedpunkterne, foreslår forbedringer og oversætter den til fransk”, skal hver instruktion præsenteres separat eller i mindre grupper.
Instruktioner skal formateres med nummererede lister eller punktnummer
At organisere instruktioner med eksplicit formatering, såsom nummererede lister eller punktnummer, hjælper med at indikere, at hver punkt er en enkelt opgave. Denne klarethed øger chancen for, at svaret vil dække alle instruktioner.
Eksempel
- Sammenfatter følgende tekst.
- Lister hovedpunkterne.
- Foreslår forbedringer.
En sådan formatering giver visuelle signaler, der hjælper modellen med at genkende og adskille forskellige opgaver i en prompt.
Instruktioner skal være eksplicitte og ubestemte
Det er afgørende, at instruktionerne tydeligt angiver kravet om at fuldføre hver trin. Tvetydig eller vag sprog skal undgås. Prompten skal eksplicit angive, at ingen trin må springes over.
Eksempel
“Venligst fuldfør alle tre opgaver nedenfor. At springe over nogen trin er ikke acceptabelt.”
Direkte udsagn som dette reducerer forvirring og opmuntrer modellen til at give fuldstændige svar.
Separate prompts skal bruges til højrisiko- eller kritiske opgaver
Hver instruktion skal indsendes som en enkelt prompt for opgaver, hvor nøjagtighed og fuldstændighed er kritiske. Selvom denne tilgang kan øge interaktionstiden, forbedrer den betydeligt sandsynligheden for at få fuldstændige og præcise output. Denne metode sikrer, at modellen fokuserer fuldstændigt på én opgave ad gangen, hvilket reducerer risikoen for oversete instruktioner.
Avancerede strategier til at balancere fuldstændighed og effektivitet
At vente på et svar efter hver enkelt instruktion kan være tidskrævende for brugere. For at forbedre effektiviteten, mens man fastholder klarethed og reducerer oversete instruktioner, kan følgende avancerede prompt-teknikker være effektive:
Batch-instruktioner med klar formatering og eksplicitte mærker
Multiple relaterede instruktioner kan kombineres i en enkelt prompt, men hver skal adskilles ved hjælp af nummerering eller overskrifter. Prompten skal også instruere modellen til at svare på alle instruktioner fuldstændigt og i rækkefølge.
Eksempel-prompt
Venligst fuldfør alle følgende opgaver omhyggeligt uden at springe over nogen:
- Sammenfatter teksten nedenfor.
- Lister hovedpunkterne fra din sammenfatning.
- Foreslår forbedringer baseret på hovedpunkterne.
- Oversætter den forbedrede tekst til fransk.
Chain-of-thought-stil prompts
Chain-of-thought-promptning vejleder modellen til at resonere gennem hver opgave, før den giver et svar. At opmuntre modellen til at behandle instruktioner sekventielt inden for en enkelt svar hjælper med at sikre, at ingen trin bliver overset, hvilket reducerer sandsynligheden for at springe instruktioner over og forbedrer fuldstændigheden.
Eksempel-prompt
Læs teksten nedenfor og udfør følgende opgaver i rækkefølge. Vis dit arbejde tydeligt:
- Sammenfatter teksten.
- Identifierer hovedpunkterne fra din sammenfatning.
- Foreslår forbedringer til teksten.
- Oversætter den forbedrede tekst til fransk.
Venligst svare på alle opgaver fuldstændigt og separat i ét svar.
Tilføj fuldførelse-instruktioner og påmindelser
Eksplicit påmind modellen til:
- “Svar på hver opgave fuldstændigt.”
- “Spring ikke over nogen instruktion.”
- “Adskil dine svar tydeligt.”
Sådanne påmindelser hjælper modellen med at fokusere på fuldstændighed, når multiple instruktioner kombineres.
Forskellige modeller og parameterindstillinger skal testes
Ikke alle LLM’er performer lige godt, når det kommer til at følge multiple instruktioner. Det er rådeligt at evaluere forskellige modeller for at identificere dem, der excellerer i multi-trins opgaver. Desuden kan justering af parametre som temperatur, maksimum tokens og systemprompts yderligere forbedre fokus og fuldstændighed af svarene. At teste disse indstillinger hjælper med at tilpasse modellens adfærd til specifikke opgavekrav.
Finjustering af modeller og brug af eksterne værktøjer skal overvejes
Modeller skal finjusteres på datasæt, der inkluderer multi-trins eller sekventielle instruktioner for at forbedre deres overholdelse af komplekse prompts. Teknikker som RLHF kan yderligere forbedre instruktionsfølgen.
For avancerede brugstilfælde kan integration af eksterne værktøjer som API’er, opgave-specifikke plugins eller Retrieval Augmented Generation (RAG)-systemer give yderligere kontekst og kontrol, hvilket forbedrer pålideligheden og nøjagtigheden af output.
Det endelige punkt
LLM’er er kraftfulde værktøjer, men kan springe instruktioner over, når prompts er lange eller komplekse. Dette sker på grund af, hvordan de læser input og fokuserer deres opmærksomhed. Instruktioner skal være klare, simple og godt organiseret for bedre og mere pålidelige resultater. At bryde opgaver ned i mindre dele, bruge lister og give direkte instruktioner hjælper modellerne med at følge trin fuldstændigt.
Separate prompts kan forbedre nøjagtigheden for kritiske opgaver, selvom de tager mere tid. Desuden hjælper avancerede prompt-metoder som chain-of-thought og klar formatering med at balancere hastighed og præcision. Yderligere kan test af forskellige modeller og finjustering forbedre resultaterne. Disse ideer vil hjælpe brugere med at få konsekvente, fuldstændige svar og gøre AI-værktøjer mere nyttige i rigtigt arbejde.












