AI-modeller och plattformar

Varför stora språkmodeller hoppar över instruktioner och hur man åtgärdar problemet

mm
Lägg till Unite.AI bland dina föredragna källor på Google
LLM instruction skipping fix

Stora språkmodeller (LLM) har snabbt blivit oumbärliga Artificiell Intelligens (AI)-verktyg, som driver applikationer från chattbotar och innehållsskapande till kodhjälp. Trots deras imponerande förmågor möter användare ofta utmaningen att dessa modeller ibland hoppar över delar av de instruktioner de får, särskilt när instruktionerna är långa eller innehåller flera steg. Detta hoppar över leder till ofullständiga eller felaktiga utdata, vilket kan orsaka förvirring och urholka förtroendet för AI-system. Att förstå varför LLM hoppar över instruktioner och hur man åtgärdar detta problem är avgörande för användare som förlitar sig på dessa modeller för precisa och tillförlitliga resultat.

Varför hoppar LLM över instruktioner? 

LLM fungerar genom att läsa indata-text som en sekvens av token. Token är de små delar som texten delas in i. Modellen bearbetar dessa token en efter en, från början till slut. Detta innebär att instruktioner i början av indata tenderar att få mer uppmärksamhet. Senare instruktioner kan få mindre fokus och kan försummas.

Detta sker eftersom LLM har en begränsad uppmärksamhetsförmåga. Uppmärksamhet är den mekanism som modellerna använder för att bestämma vilka delar av indata som är viktiga när de genererar svar. När indata är kort fungerar uppmärksamheten bra. Men uppmärksamheten minskar när indata blir längre eller instruktioner blir komplexa. Detta försvagar fokuset på senare delar, vilket orsakar hoppar över.

Dessutom ökar komplexiteten när det finns många instruktioner på en gång. När instruktioner överlappar eller motsäger varandra kan modellerna bli förvirrade. De kan försöka svara på allt men producera suddiga eller motsägelsefulla svar. Detta resulterar ofta i att vissa instruktioner saknas.

LLM delar också vissa mänskliga begränsningar. Till exempel kan människor förlora fokus när de läser långa eller upprepade texter. På samma sätt kan LLM “glömma” senare instruktioner när de bearbetar fler token. Förlusten av fokus är en del av modellens design och begränsningar.

En annan anledning är hur LLM tränas. De ser många exempel på enkla instruktioner men färre komplexa, flerstegs-instruktioner. På grund av detta tenderar modellerna att föredra att följa enklare instruktioner som är vanligare i deras träningsdata. Denna bias gör att de hoppar över komplexa instruktioner. Dessutom begränsar token-gränserna mängden indata som modellen kan bearbeta. När indata överskrider dessa gränser försummas instruktioner bortom gränsen.

Exempel: Anta att du ger en LLM fem instruktioner i en enda prompt. Modellen kan fokusera främst på de två första instruktionerna och delvis eller fullständigt försumma de tre sista. Detta påverkar direkt hur modellen bearbetar token sekventiellt och dess uppmärksamhetsbegränsningar.

Hur väl LLM hanterar sekventiella instruktioner baserat på SIFo 2024-resultat

Nyliga studier har undersökt noggrant hur väl LLM följer flera instruktioner som ges en efter en. En viktig studie är Sekventiella Instruktionsföljande (SIFo)-benchmark 2024. Denna benchmark testar modeller på uppgifter som kräver steg-för-steg-slutförande av instruktioner, såsom textmodifiering, frågesvar, matematik och säkerhetsregel-följande. Varje instruktion i sekvensen är beroende av den korrekta slutförandet av den föregående. Detta tillvägagångssätt hjälper till att kontrollera om modellen har följt hela sekvensen korrekt.

Resultaten från SIFo visar att även de bästa LLM, som GPT-4 och Claude-3, ofta har svårt att slutföra alla instruktioner korrekt. Detta är särskilt sant när instruktionerna är långa eller komplicerade. Forskningen pekar ut tre huvudsakliga problem som LLM står inför när det gäller att följa instruktioner:

Förståelse: Fullständigt förstå vad varje instruktion betyder.

Resonemang: Koppla flera instruktioner logiskt för att hålla svaret tydligt.

Tillförlitlig utdata: Produktion av fullständiga och precisa svar, som täcker alla instruktioner.

Tekniker som prompt-engineering och finjustering hjälper till att förbättra hur modeller följer instruktioner. Men dessa metoder löser inte helt problemet med att hoppa över instruktioner. Användning av Reinforcement Learning med mänsklig återkoppling (RLHF) förbättrar ytterligare modellens förmåga att svara lämpligt. Men modellerna har fortfarande svårt när instruktioner kräver många steg eller är mycket komplexa.

Studien visar också att LLM fungerar bäst när instruktioner är enkla, tydligt separerade och välorganiserade. När uppgifter kräver långa resonemangskedjor eller många steg minskar modellens noggrannhet. Dessa resultat hjälper till att föreslå bättre sätt att använda LLM på ett bra sätt och visar behovet av att bygga starkare modeller som kan följa instruktioner en efter en.

Varför LLM hoppar över instruktioner: Tekniska utmaningar och praktiska överväganden

LLM kan hoppa över instruktioner på grund av flera tekniska och praktiska faktorer som har sin rot i hur de bearbetar och kodar indata-text.

Begränsad uppmärksamhetsförmåga och informationsutspädning

LLM förlitar sig på uppmärksamhetsmekanismer för att tilldela vikt till olika delar av indata. När prompten är koncis är modellens uppmärksamhet fokuserad och effektiv. Men när prompten växer längre eller blir mer upprepad, blir uppmärksamheten utspädd, och senare token eller instruktioner får mindre fokus, vilket ökar sannolikheten att de kommer att försummas. Detta fenomen, känt som informationsutspädning, är särskilt problematiskt för instruktioner som visas sent i en prompt. Dessutom har modellerna fasta token-gränser (t.ex. 2048 token); all text bortom denna gräns trunkeras och försummas, vilket orsakar att instruktioner i slutet försummas helt.

Utdata-komplexitet och tvetydighet

LLM kan ha svårt att producera tydliga och fullständiga svar när de ställs inför flera eller motsägelsefulla instruktioner. Modellen kan generera partiella eller suddiga svar för att undvika motsägelser eller förvirring, vilket effektivt utelämnar vissa instruktioner. Tvetydighet i hur instruktioner är formulerade utgör också utmaningar: otydliga eller ofullständiga prompten gör det svårt för modellen att bestämma de avsedda åtgärderna, vilket ökar risken för att hoppa över eller missförstå delar av indata.

Prompt-design och formateringssensitivitet

Promptens struktur och formulering spelar också en avgörande roll i instruktionsföljandet. Forskning visar att även små förändringar i hur instruktioner skrivs eller formateras kan ha en betydande inverkan på om modellen följer dem.

Dåligt strukturerade prompten, som saknar tydlig separation, punktlistor eller numrering, gör det svårare för modellen att skilja mellan steg, vilket ökar chansen att instruktioner sammanfogas eller försummas. Modellens interna representation av prompten är mycket känslig för dessa variationer, vilket förklarar varför prompt-engineering (omformulering eller omstrukturering av prompten) kan förbättra instruktionsföljandet avsevärt, även om den underliggande innehållet förblir detsamma.

Hur man åtgärdar instruktionshopp i LLM

Förbättring av LLM:s förmåga att följa instruktioner korrekt är avgörande för att producera tillförlitliga och precisa resultat. Följande bästa metoder bör övervägas för att minimera instruktionshopp och förbättra kvaliteten på AI-genererade svar:

Uppgifter bör delas upp i mindre delar

Långa eller flerstegs-prompten bör delas upp i mindre, mer fokuserade segment. Att tillhandahålla en eller två instruktioner åt gången tillåter modellen att upprätthålla bättre uppmärksamhet och minskar sannolikheten för att missa några steg.

Exempel

I stället för att kombinera alla instruktioner i en enda prompt, såsom “Sammanfatta texten, lista huvudpunkterna, föreslå förbättringar och översätt den till franska”, bör varje instruktion presenteras separat eller i mindre grupper.

Instruktioner bör formateras med numrerade listor eller punktlistor

Organisering av instruktioner med explicit formatering, såsom numrerade listor eller punktlistor, hjälper till att indikera att varje punkt är en individuell uppgift. Denna tydlighet ökar chansen att svaret kommer att behandla alla instruktioner.

Exempel

  • Sammanfatta följande text.
  • Lista huvudpunkterna.
  • Föreslå förbättringar.

Sådan formatering tillhandahåller visuella signaler som hjälper modellen att känna igen och separera olika uppgifter inom en prompt.

Instruktioner bör vara explicita och entydiga

Det är viktigt att instruktioner tydligt anger kravet på att slutföra varje steg. Tvetydig eller vag språk bör undvikas. Prompten bör explicit ange att inga steg får försummas.

Exempel

“Vänligen slutför alla tre uppgifter nedan. Att hoppa över några steg är inte acceptabelt.”

Direkta uttalanden som detta minskar förvirring och uppmuntrar modellen att ge fullständiga svar.

Separata prompten bör användas för högrisk- eller kritiska uppgifter

Varje instruktion bör skickas in som en individuell prompt för uppgifter där noggrannhet och fullständighet är kritiska. Även om detta tillvägagångssätt kan öka interaktionstiden, förbättrar det avsevärt sannolikheten för att få fullständiga och precisa utdata. Denna metod säkerställer att modellen fokuserar helt på en uppgift åt gången, vilket minskar risken för att instruktioner försummas.

Avancerade strategier för att balansera fullständighet och effektivitet

Att vänta på ett svar efter varje enskild instruktion kan vara tidskrävande för användare. För att förbättra effektiviteten samtidigt som man upprätthåller tydlighet och minskar antalet försummade instruktioner, kan följande avancerade prompt-tekniker vara effektiva:

Batch-instruktioner med tydlig formatering och explicita etiketter

Flera relaterade instruktioner kan kombineras i en enda prompt, men var och en bör separeras med numrering eller rubriker. Prompten bör också instruera modellen att svara på alla instruktioner fullständigt och i ordning.

Exempel-prompt

Vänligen slutför alla följande uppgifter noggrant utan att hoppa över några:

  1. Sammanfatta texten nedan.
  2. Lista huvudpunkterna från din sammanfattning.
  3. Föreslå förbättringar baserat på huvudpunkterna.
  4. Översätt den förbättrade texten till franska.

Chain-of-Thought-stil-prompt

Chain-of-Thought-prompt guidar modellen att resonera genom varje uppgift steg för steg innan den ger ett svar. Att uppmuntra modellen att bearbeta instruktioner sekventiellt inom ett enda svar hjälper till att säkerställa att inga steg försummas, vilket minskar risken för att hoppa över instruktioner och förbättrar fullständigheten.

Exempel-prompt

Läs texten nedan och gör följande uppgifter i ordning. Visa ditt arbete tydligt:

  • Sammanfatta texten.
  • Identifiera huvudpunkterna från din sammanfattning.
  • Föreslå förbättringar av texten.
  • Översätt den förbättrade texten till franska.

Vänligen svara på alla uppgifter fullständigt och separat i ett svar.

Lägg till slutföringsinstruktioner och påminnelser

Explicit påminn modellen att:

  • “Svara på varje uppgift fullständigt.”
  • “Hoppa inte över någon instruktion.”
  • “Separera dina svar tydligt.”

Sådana påminnelser hjälper modellen att fokusera på fullständighet när flera instruktioner kombineras.

Olika modeller och parametrinställningar bör testas

Inte alla LLM presterar lika bra när det gäller att följa flera instruktioner. Det är klokt att utvärdera olika modeller för att identifiera de som excellerar i flerstegs-uppgifter. Dessutom kan justering av parametrar som temperatur, maximala token och system-prompten ytterligare förbättra fokus och fullständighet i svaren. Att testa dessa inställningar hjälper till att anpassa modellbeteendet till de specifika uppgiftskraven.

Finjustering av modeller och användning av externa verktyg bör övervägas

Modeller bör finjusteras på dataset som innehåller flerstegs- eller sekventiella instruktioner för att förbättra deras följsamhet till komplexa prompten. Tekniker som RLHF kan ytterligare förbättra instruktionsföljandet.

För avancerade användningsfall kan integration av externa verktyg som API:er, uppgiftsspecifika plugin-moduler eller Retrieval Augmented Generation (RAG)-system tillhandahålla ytterligare kontext och kontroll, vilket förbättrar tillförlitligheten och noggrannheten i utdata.

Slutsatsen

LLM är kraftfulla verktyg men kan hoppa över instruktioner när prompten är lång eller komplex. Detta sker på grund av hur de läser indata och fokuserar sin uppmärksamhet. Instruktioner bör vara tydliga, enkla och välorganiserade för bättre och mer tillförlitliga resultat. Att dela upp uppgifter i mindre delar, använda listor och ge direkta instruktioner hjälper modellerna att följa steg fullständigt.

Separata prompten kan förbättra noggrannheten för kritiska uppgifter, även om de tar mer tid. Dessutom hjälper avancerade prompt-metoder som chain-of-thought och tydlig formatering till att balansera hastighet och precision. Dessutom kan testning av olika modeller och finjustering förbättra resultaten. Dessa idéer kommer att hjälpa användare att få konsekventa, fullständiga svar och göra AI-verktyg mer användbara i verkligt arbete.

Dr. Assad Abbas, en fast anställd biträdande professor vid COMSATS University Islamabad, Pakistan, avlade sin doktorsexamen från North Dakota State University, USA. Hans forskning fokuserar på avancerad teknik, inklusive moln-, dimma- och edge-beräkning, big data-analys och AI. Dr. Abbas har gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter och konferenser. Han är också grundare av MyFastingBuddy.