AI-modeller og plattformer

Hvorfor store språkmodeller hopper over instruksjoner og hvordan man løser problemet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
LLM instruction skipping fix

Store språkmodeller (LLM) har raskt blitt uunnværlige kunstig intelligens (AI)-verktøy, som driver applikasjoner fra chatboter og innholdsskapelse til kodehjelp. Til tross for deres imponerende evner, møter brukerne ofte en vanlig utfordring: disse modellene hopper av og til over deler av instruksjonene de mottar, spesielt når instruksjonene er lange eller involverer flere trinn. Dette hoppingen fører til ufullstendige eller uriktige utdata, som kan forårsake forvirring og underminere tilliten til AI-systemer. Å forstå hvorfor LLM hopper over instruksjoner og hvordan man løser dette problemet, er essensielt for brukere som avhenger av disse modellene for presise og pålitelige resultater.

Hvorfor hopper LLM over instruksjoner? 

LLM fungerer ved å lese inn tekst som en sekvens av token. Token er de små delene tekst blir delt inn i. Modellen prosesserer disse tokenene ett etter ett, fra start til slutt. Dette betyr at instruksjoner i begynnelsen av innputt tenderer til å få mer oppmerksomhet. Senere instruksjoner kan motta mindre fokus og kan bli ignorert.

Dette skjer fordi LLM har en begrenset oppmerksomhetskapasitet. Oppmerksomhet er mekanismen modellene bruker for å bestemme hvilke deler av innputt som er essensielle når de genererer svar. Når innputt er kort, fungerer oppmerksomhet godt. Men oppmerksomhet blir mindre når innputt blir lengre eller instruksjoner blir komplekse. Dette svekker fokuset på senere deler, og øker sjansen for at de hopper over instruksjoner.

I tillegg øker mange instruksjoner på en gang kompleksiteten. Når instruksjoner overlapper eller er i konflikt, kan modellene bli forvirret. De kan prøve å svare på alt, men produsere vag eller motsigende svar. Dette resulterer ofte i at de hopper over instruksjoner.

LLM deler også noen menneskelige begrensninger. For eksempel kan mennesker miste fokus når de leser lange eller repetitive tekster. Tilsvarende kan LLM glemme senere instruksjoner når de prosesserer flere token. Denne tapet av fokus er en del av modellens design og begrensninger.

En annen årsak er hvordan LLM er trent. De ser mange eksempler på enkle instruksjoner, men færre komplekse, flertrinns instruksjoner. På grunn av dette, tenderer modellene til å foretrekke å følge enklere instruksjoner som er mer vanlige i deres treningsdata. Denne forutinntakten gjør at de hopper over komplekse instruksjoner. I tillegg begrenser token-grensene mengden innputt modellen kan prosessere. Når innputt overstiger disse grensene, blir instruksjoner utover grensen ignorert.

Eksempel: Anta at du gir en LLM fem instruksjoner i en enkelt forespørsel. Modellen kan fokusere hovedsakelig på de to første instruksjonene og delvis eller fullstendig ignorere de tre siste. Dette påvirker direkte hvordan modellen prosesserer token sekvensielt og dens oppmerksomhetsbegrensninger.

Hvor godt LLM håndterer sekvensielle instruksjoner basert på SIFo 2024-funn

Nyere studier har undersøkt hvordan godt LLM følger flere instruksjoner gitt ett etter ett. En viktig studie er Sekvensielle Instruksjoner Følging (SIFo)-Benchmark 2024. Denne benchmarken tester modeller på oppgaver som krever sekvensiell fullføring av instruksjoner, som tekstmodifisering, spørsmålssvar, matematikk og sikkerhetsregelfølging. Hver instruksjon i sekvensen avhenger av korrekt fullføring av den foregående instruksjonen. Dette hjelper å sjekke om modellen har fulgt hele sekvensen korrekt.

Resultatene fra SIFo viser at selv de beste LLM, som GPT-4 og Claude-3, ofte har vanskelig for å fullføre alle instruksjoner korrekt. Dette er spesielt sant når instruksjonene er lange eller kompliserte. Forskningen peker på tre hovedproblemer som LLM møter når de følger instruksjoner:

Forståelse: Fullstendig forståelse av hva hver instruksjon betyr.

Resonnement: Å koble flere instruksjoner logisk sammen for å holde svaret klart.

Pålitelig utdata: Å produsere fullstendige og nøyaktige svar, som dekker alle instruksjoner gitt.

Teknikker som promptingeniørkunst og finjustering hjelper å forbedre hvordan modellene følger instruksjoner. Likevel hjelper disse metodene ikke fullstendig med problemet med å hoppe over instruksjoner. Å bruke Forsterkning med menneskelig tilbakemelding (RLHF) forbedrer ytterligere modellens evne til å svare korrekt. Likevel har modellene vanskelig når instruksjoner krever mange trinn eller er svært komplekse.

Studien viser også at LLM fungerer best når instruksjoner er enkle, tydelig adskilte og godt organiserte. Når oppgaver krever lange resonemingskjeder eller mange trinn, synker modellens nøyaktighet. Disse funnene hjelper å foreslå bedre måter å bruke LLM på og viser behovet for å bygge sterkere modeller som kan følge instruksjoner ett etter ett.

Hvorfor LLM hopper over instruksjoner: Tekniske utfordringer og praktiske overveielser

LLM kan hoppe over instruksjoner på grunn av flere tekniske og praktiske faktorer som har å gjøre med hvordan de prosesserer og koder inn tekst.

Begrenset oppmerksomhetsomfang og informasjonsutspredning

LLM avhenger av oppmerksomhetsmekanismer for å tildele viktighet til ulike deler av innputt. Når forespørsler er konsise, er modellens oppmerksomhet fokusert og effektiv. Likevel, når forespørselen vokser lengre eller mer repetitiv, blir oppmerksomheten utspredt, og senere token eller instruksjoner mottar mindre fokus, og øker sjansen for at de hopper over dem. Dette fenomenet, kjent som informasjonsutspredning, er spesielt problematisk for instruksjoner som dukker opp sent i en forespørsel. I tillegg har modellene fikse token-grensene (f.eks. 2048 token); enhver tekst utover denne grensen blir trunkert og ignorert, og instruksjoner mot slutten hopper fullstendig over.

Utdatakompleksitet og tvetydighet

LLM kan ha vanskelig for å produsere klare og fullstendige svar når de møter flere eller motsigende instruksjoner. Modellen kan generere delvis eller vagt svar for å unngå motsigelser eller forvirring, og effektivt utelate noen instruksjoner. Tvetydighet i hvordan instruksjoner er formulert stiller også utfordringer: uklare eller upresise forespørsler gjør det vanskelig for modellen å bestemme de ønskede handlingene, og øker risikoen for å hoppe over eller misforstå deler av innputt.

Forespørselsdesign og formateringssensitivitet

Strukturen og formuleringen av forespørsler spiller også en kritisk rolle i instruksjonsfølging. Forskning viser at selv små endringer i hvordan instruksjoner er skrevet eller formatert, kan ha en betydelig innvirkning på om modellen følger dem.

Dårlig strukturerte forespørsler, som mangler tydelig adskillelse, punktummer eller nummerering, gjør det vanskeligere for modellen å skille mellom trinn, og øker sjansen for å slå sammen eller utelate instruksjoner. Modellens interne representasjon av forespørselen er svært sensitiv for disse variasjonene, og forklarer hvorfor promptingeniørkunst (omformulering eller omstrukturering av forespørsler) kan forbedre instruksjonsfølgingen betydelig, selv om den underliggende innholdet forblir den samme.

Hvordan fikse instruksjonshopping i LLM

Å forbedre LLMs evne til å følge instruksjoner nøyaktig er essensielt for å produsere pålitelige og presise resultater. Følgende beste praksis bør være aktuelle for å minimere instruksjonshopping og forbedre kvaliteten på AI-genererte svar:

Oppgaver bør deles inn i mindre deler

Lange eller flertrinns forespørsler bør deles inn i mindre, mer fokuserte segmenter. Å gi en eller to instruksjoner om gangen, lar modellen opprettholde bedre oppmerksomhet og reduserer sjansen for å hoppe over trinn.

Eksempel

I stedet for å kombinere alle instruksjoner i en enkelt forespørsel, som “Summer tekst, list opp hovedpunktene, foreslå forbedringer og oversett til fransk”, bør hver instruksjon presenteres separat eller i mindre grupper.

Instruksjoner bør formateres med nummererte lister eller punktummer

Å organisere instruksjoner med eksplisitt formatering, som nummererte lister eller punktummer, hjelper å indikere at hver post er en individuell oppgave. Denne klarenheten øker sjansen for at svaret vil omfatte alle instruksjoner.

Eksempel

  • Summer følgende tekst.
  • List opp hovedpunktene.
  • Foreslå forbedringer.

Slik formatering gir visuelle signaler som hjelper modellen å gjenkjenne og skille ulike oppgaver i en forespørsel.

Instruksjoner bør være eksplisitte og ubestemte

Det er essensielt at instruksjoner tydelig angir kravet om å fullføre hver trinn. Tvetydig eller vag språk bør unngås. Forespørselen bør eksplisitt indikere at ingen trinn kan hoppe over.

Eksempel

“Vær vennlig og fullfør alle tre oppgavene under. Hopping over noen trinn er ikke akseptabelt.”

Direkte uttalelser som denne reduserer forvirring og oppmuntrer modellen til å gi fullstendige svar.

Separate forespørsler bør brukes for høyrisk eller kritiske oppgaver

Hver instruksjon bør sendes som en individuell forespørsel for oppgaver der nøyaktighet og fullstendighet er kritisk. Selv om denne tilnærmingen kan øke interaksjonstiden, forbedrer den betydelig sjansen for å få fullstendige og presise utdata. Denne metoden sikrer at modellen fokuserer fullstendig på en oppgave om gangen, og reduserer risikoen for å hoppe over instruksjoner.

Avanserte strategier for å balansere fullstendighet og effisiens

Å vente på et svar etter hver enkelt instruksjon kan være tidskrevende for brukere. For å forbedre effisiensen samtidig som man opprettholder klarethet og reduserer instruksjonshopping, kan følgende avanserte forespørselsteknikker være effektive:

Batch-instruksjoner med klart formatering og eksplisitte etiketter

Flere relaterte instruksjoner kan kombineres i en enkelt forespørsel, men hver bør skilles med nummerering eller overskrifter. Forespørselen bør også instruere modellen til å svare på alle instruksjoner fullstendig og i rekkefølge.

Eksempel forespørsel

Vær vennlig og fullfør alle følgende oppgaver nøye uten å hoppe over noen:

  1. Summer tekst nedenfor.
  2. List opp hovedpunktene fra din sammenfatning.
  3. Foreslå forbedringer basert på hovedpunktene.
  4. Oversett den forbedrede teksten til fransk.

Kjede-tenkning-stil forespørsler

Kjede-tenkning-stil forespørsler guider modellen til å tenke gjennom hver oppgave sekvensielt før den gir et svar. Å oppmuntre modellen til å prosessere instruksjoner sekvensielt innenfor ett enkelt svar, hjelper å sikre at ingen trinn blir oversett, og reduserer sjansen for instruksjonshopping og forbedrer fullstendigheten.

Eksempel forespørsel

Les teksten nedenfor og gjør følgende oppgaver i rekkefølge. Vis ditt arbeid tydelig:

  • Summer teksten.
  • Identifiser hovedpunktene fra din sammenfatning.
  • Foreslå forbedringer til teksten.
  • Oversett den forbedrede teksten til fransk.

Vær vennlig og svare på alle oppgaver fullstendig og separat i ett svar.

Legg til fullføringsinstruksjoner og påminnelser

Å eksplisitt minne modellen på å:

  • “Svar på hver oppgave fullstendig.”
  • “Hopp ikke over noen instruksjoner.”
  • “Skil dine svar tydelig.”

Slike påminnelser hjelper modellen til å fokusere på fullstendighet når flere instruksjoner kombineres.

Forskjellige modeller og parameterinnstillinger bør testes

Ikke alle LLM utfører like godt når det gjelder å følge flere instruksjoner. Det er råd å evaluere ulike modeller for å identifisere de som excellerer i flertrinns oppgaver. I tillegg kan justering av parametre som temperatur, maksimum token og systemforespørsler ytterligere forbedre fokus og fullstendighet i svarene. Å teste disse innstillingene hjelper å tilpasse modellens atferd til de spesifikke oppgavekravene.

Finjustering av modeller og bruk av eksterne verktøy bør vurderes

Modeller bør finjusteres på datasett som inkluderer flertrinns eller sekvensielle instruksjoner for å forbedre deres instruksjonsfølging. Teknikker som RLHF kan ytterligere forbedre instruksjonsfølging.

For avanserte brukstilfeller kan integrering av eksterne verktøy som API-er, oppgave-spesifikke tillegg eller Henting-augmentert generering (RAG)-systemer gi ytterligere kontekst og kontroll, og forbedre påliteligheten og nøyaktigheten i utdataene.

Bunnpunktet

LLM er kraftfulle verktøy, men kan hoppe over instruksjoner når forespørsler er lange eller komplekse. Dette skjer på grunn av hvordan de leser innputt og fokuserer sin oppmerksomhet. Instruksjoner bør være klare, enkle og godt organiserte for bedre og mer pålitelige resultater. Å dele oppgaver inn i mindre deler, bruke lister og gi direkte instruksjoner hjelper modellene til å følge trinn fullstendig.

Separate forespørsler kan forbedre nøyaktigheten for kritiske oppgaver, selv om de tar mer tid. Likevel hjelper avanserte forespørselsmetoder som kjede-tenkning og klart formatering å balansere hastighet og presisjon. Videre kan testing av ulike modeller og finjustering også forbedre resultater. Disse idéene vil hjelpe brukere til å få konsistente, fullstendige svar og gjøre AI-verktøy mer nyttige i virkelig arbeid.

Dr. Assad Abbas, en fast ansatt associate professor ved COMSATS University Islamabad, Pakistan, oppnådde sin Ph.D. fra North Dakota State University, USA. Hans forskning fokuserer på avanserte teknologier, inkludert sky, fog og edge computing, big data analytics og AI. Dr. Abbas har gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter og konferanser. Han er også grunnleggeren av MyFastingBuddy.