Prompt engineering

Bekämpning av hallucinationer i stora språkmodeller: En översikt av banbrytande tekniker

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Stora språkmodeller (LLM) som GPT-4, PaLM och Llama har möjliggjort anmärkningsvärda framsteg inom generering av naturligt språk. Men en varaktig utmaning som begränsar deras tillförlitlighet och säkra distribution är deras tendens att hallucinera – generera innehåll som verkar sammanhängande men är faktamässigt inkorrekt eller otillförlitligt i förhållande till ingångssammanhanget.

Medan LLM fortsätter att växa i kraft och bli allmänt använda i verkliga tillämpningar, blir det allt viktigare att hantera hallucinationer. Den här artikeln ger en omfattande översikt av de senaste teknikerna som forskare har introducerat för att upptäcka, kvantifiera och mildra hallucinationer i LLM.

Förstå hallucinationer i LLM

Hallucinationer refererar till faktamässiga inkonsekvenser eller fabriceringar som genereras av LLM som inte är grundade i verkligheten eller det tillhandahållna sammanhanget. Exempel inkluderar:

  • Uppfinning av biografiska detaljer eller händelser som inte stöds av källmaterialet när man genererar text om en person.
  • Tillhandahållande av felaktiga medicinska råd genom att fabricera biverkningar av läkemedel eller behandlingsförfaranden.
  • Uppfinning av icke-existerande data, studier eller källor för att stödja ett påstående.

Detta fenomen uppstår eftersom LLM tränas på stora mängder textdata online. Medan detta möjliggör starka språkmodelleringsegenskaper, innebär det också att de lär sig att extrapolera information, göra logiska språng och fylla i luckor på ett sätt som verkar övertygande men kan vara vilseledande eller felaktigt.

Vissa nyckelfaktorer som bidrar till hallucinationer inkluderar:

  • Mönstergeneralisering – LLM identifierar och utökar mönster i träningsdata som kanske inte generaliserar väl.
  • Föråldrad kunskap – Statisk förträning förhindrar integration av ny information.
  • Tvetydighet – Vaga instruktioner tillåter utrymme för felaktiga antaganden.
  • Fördomar – Modeller förstärker och förstärker snedvridna perspektiv.
  • Otillräcklig grund – Brist på förståelse och resonemang innebär att modeller genererar innehåll som de inte fullständigt förstår.

Att hantera hallucinationer är avgörande för tillförlitlig distribution i känsliga områden som medicin, juridik, finans och utbildning, där generering av felaktig information kan leda till skada.

Taxonomi av tekniker för att mildra hallucinationer

Forskare har introducerat olika tekniker för att bekämpa hallucinationer i LLM, som kan kategoriseras i:

1. Instruktionsutformning

Detta innebär att man noggrant utformar instruktioner för att tillhandahålla sammanhang och vägleda LLM mot faktamässiga och grundade svar.

  • Retrieval-förstärkning – Hämtning av externa bevis för att grunda innehåll.
  • Återkopplingsloopar – Iterativ tillhandahållande av återkoppling för att finslipa svar.
  • Instruktionsfinjustering – Justering av instruktioner under finjustering för önskade beteenden.

2. Modellutveckling

Skapande av modeller som är mindre benägna att hallucinera via arkitekturförändringar.

  • Avkodningsstrategier – Generering av text på sätt som ökar tillförlitlighet.
  • Kunskapsgrundering – Inkorporering av externa kunskapsbaser.
  • Nya förlustfunktioner – Optimering för tillförlitlighet under träningsprocessen.
  • Övervakad finjustering – Användning av mänskligt märkt data för att förbättra faktamässighet.

Nästa steg är att undersöka framstående tekniker under varje tillvägagångssätt.

Framstående tekniker för att mildra hallucinationer

Retrieval-förstärkt generering

Retrieval-förstärkt generering förbättrar LLM genom att hämta och konditionera textgenerering på externa bevisdokument, snarare än att enbart förlita sig på modellens implicita kunskap. Detta grundar innehåll i uppdaterad, verificerbar information, vilket minskar hallucinationer.

Framstående tekniker inkluderar:

  • RAG – Använder en hämtaremodul som tillhandahåller relevanta passager för en sekvens-till-sekvens-modell att generera från. Båda komponenterna tränas slutna.
  • RARR – Använder LLM för att undersöka oattribuerade påståenden i genererad text och revidera dem för att överensstämma med hämtade bevis.
  • Kunskapshämtning – Validerar osäkra generationer med hjälp av hämtad kunskap innan text genereras.
  • LLM-Augmenter – Iterativt söker kunskap för att konstruera beviskedjor för LLM-instruktioner.

Återkoppling och resonemang

Användning av iterativ naturlig språkåterkoppling eller självresonemang tillåter LLM att finslipa och förbättra sina initiala utdata, vilket minskar hallucinationer.

CoVe använder en kedja av verifikationsteknik. LLM utarbetar först ett svar på användarens fråga. Den genererar sedan potentiella verifikationsfrågor för att faktakontrollera sitt eget svar, baserat på dess förtroende för olika uttalanden som gjorts. Till exempel, för ett svar som beskriver en ny medicinsk behandling, kan CoVe generera frågor som “Vad är effektivitetsgraden för behandlingen?”, “Har den fått regulatoriskt godkännande?”, “Vilka är de potentiella biverkningarna?”. Avgörande är att LLM sedan försöker att oberoende besvara dessa verifikationsfrågor utan att påverkas av sitt initiala svar. Om svaren på verifikationsfrågorna motsäger eller inte kan stödja uttalanden som gjorts i det ursprungliga svaret, identifierar systemet dessa som sannolika hallucinationer och finslipar svaret innan det presenteras för användaren.

DRESS fokuserar på att justera LLM för att bättre överensstämma med mänskliga preferenser genom naturlig språkåterkoppling. Tillvägagångssättet tillåter icke-experter att tillhandahålla fria kritiker på modellgenerationer, såsom “Biverkningarna som nämns verkar överdrivna” eller finslipningsinstruktioner som “Var vänlig diskutera också kostnadseffektivitet”. DRESS använder förstärkt inlärning för att träna modeller att generera svar som är villkorade av sådan återkoppling som bättre överensstämmer med mänskliga preferenser. Detta förbättrar interaktivitet samtidigt som det minskar orealistiska eller ostödda uttalanden.

MixAlign hanterar situationer där användare ställer frågor som inte direkt motsvarar de bevispassager som hämtats av systemet. Till exempel kan en användare fråga “Kommer föroreningarna att bli värre i Kina?” medan hämtade passager diskuterar föroreningsmönster globalt. För att undvika hallucinationer med otillräckligt sammanhang, förtydligar MixAlign explicit när den är osäker på hur den ska relatera användarens fråga till den hämtade informationen. Denna mänskliga-i-loopen-mekanism tillåter att återkoppling erhålls för att korrekt grunda och kontextualisera bevis, vilket förhindrar ogrundade svar.

Tekniken Självreflektion tränar LLM att utvärdera, tillhandahålla återkoppling på och iterativt finslipa sina egna svar med ett multi-uppgiftstillvägagångssätt. Till exempel, givet ett svar genererat för en medicinsk fråga, lär sig modellen att poängsätta dess faktamässiga korrekthet, identifiera eventuella motsägande eller ostödda uttalanden och redigera dem genom att hämta relevant kunskap. Genom att lära LLM denna återkopplingsloop av att kontrollera, kritisera och iterativt förbättra sina egna utdata, minskar tillvägagångssättet blinda hallucinationer.

Instruktionsfinjustering

Instruktionsfinjustering tillåter justering av instruktionsprompten som tillhandahålls till LLM under finjustering för önskade beteenden.

Metoden SynTra använder en syntetisk sammanfattningsuppgift för att minimera hallucinationer innan modellen överförs till riktiga sammanfattningsdataset. Den syntetiska uppgiften tillhandahåller indata-passager och ber modeller att sammanfatta dem genom hämtning endast, utan abstraktion. Detta tränar modeller att förlita sig helt på källinnehåll snarare än att hallucinera ny information under sammanfattning. SynTra visar sig minska hallucinationsproblem när finjusterade modeller distribueras på måluppgifter.

UPRISE tränar en universell prompt-hämtare som tillhandahåller den optimala mjuka prompten för få-skott-inlärning på osedda nedströmsuppgifter. Genom att hämta effektiva promptrar som har justerats på en mångfald uppgifter, lär sig modellen att generalisera och anpassa sig till nya uppgifter där den saknar träningsexempel. Detta förbättrar prestanda utan att kräva uppgiftsspecifik justering.

Nya modellarkitekturer

FLEEK är ett system som fokuserar på att assistera mänskliga faktakontrollanter och validerare. Det identifierar automatiskt potentiellt verificerbara faktamässiga påståenden som gjorts i en given text. FLEEK omvandlar dessa kontrollerbara uttalanden till frågor, hämtar relaterad bevis från kunskapsbaser och tillhandahåller denna kontextuella information till mänskliga validerare för att effektivt verifiera dokumentets korrekthet och revideringsbehov.

Tillvägagångssättet CAD minskar hallucinationer i språkgenerering genom kontextmedveten avkodning. Specifikt förstärker CAD skillnaderna mellan en LLM:s utdatadistribution när den är villkorad av ett sammanhang jämfört med när den genereras oberoende. Detta uppmuntrar till att motsäga kontextuella bevis, vilket styr modellen mot grundade generationer.

DoLA mildrar faktamässiga hallucinationer genom att kontrastera logitvärden från olika lager i transformer-nätverk. Eftersom faktamässig kunskap tenderar att vara lokaliserad i vissa mellanlager, förstärker DoLA:s logit-kontrastering signaler från dessa faktamässiga lager, vilket minskar felaktiga faktamässiga generationer.

Ramverket THAM introducerar en regleringsterm under träningsprocessen för att minimera den ömsesidiga informationen mellan indata och hallucinerade utdata. Detta hjälper till att öka modellens tillförlitlighet på den givna indatakontexten snarare än oberoende fantasi, vilket minskar blinda hallucinationer.

Kunskapsgrundering

Grundande LLM-generationer i strukturerad kunskap förhindrar otyglad spekulation och fabricering.

Modellen RHO identifierar entiteter i en konversationskontext och länkar dem till en kunskapsgraf (KG). Relaterade fakta och relationer om dessa entiteter hämtas från KG och integreras i kontextrepresentationen som tillhandahålls till LLM. Denna kunskapsberikade kontextstyrning minskar hallucinationer i dialog genom att hålla svar kopplade till grundade fakta om nämnda entiteter/händelser.

HAR skapar kontrafaktiska träningsdataset som innehåller modellgenererade hallucinationer för att bättre lära ut grundering. Givet en faktamässig passage, uppmanas modeller att införa hallucinationer eller förvrängningar som genererar en ändrad kontrafaktisk version. Finjustering på denna data tvingar modeller att bättre grunda innehåll i de ursprungliga faktamässiga källorna, vilket minskar improvisation.

Övervakad finjustering

  • Coach – Interaktiv ram som svarar på användarfrågor men också ber om korrektioner för att förbättra.
  • R-Tuning – Vägran-medveten justering vägrar ostödda frågor identifierade genom träningsdata-kunskapsluckor.
  • TWEAK – Avkodningsmetod som rangordnar generationer baserat på hur väl hypoteser stöder indatafakta.

Utmaningar och begränsningar

Trots lovande framsteg kvarstår vissa nyckelutmaningar i att mildra hallucinationer:

  • Tekniker handlar ofta om kvalitet, sammanhang och kreativitet för veracitet.
  • Svårighet i rigorös utvärdering bortom begränsade domäner. Mått fångar inte alla nyanser.
  • Många metoder är beräkningsmässigt dyra, kräver omfattande hämtning eller självresonemang.
  • De är starkt beroende av träningsdatakvalitet och externa kunskapskällor.
  • Det är svårt att garantera generaliserbarhet över domäner och modaliteter.
  • De grundläggande rötterna till hallucinationer som över-extrapolering förblir olösta.

Att hantera dessa utmaningar kräver sannolikt ett flerskiktat tillvägagångssätt som kombinerar träningsdataförbättringar, modellarkitekturförbättringar, trohetsförbättrande förluster och inferenstidstekniker.

Vägen framåt

Hallucinationsmildring för LLM förblir ett öppet forskningsproblem med aktiv framsteg. Några lovande framtida riktningar inkluderar:

  • Hybridtekniker: Kombinera kompletterande tillvägagångssätt som hämtning, kunskapsgrundering och återkoppling.
  • Kausalitetmodellering: Förbättra förståelse och resonemang.
  • Onlinekunskapsintegration: Håll världskunskap uppdaterad.
  • Formell verifikation: Tillhandahåll matematiska garantier för modellbeteende.
  • Tolkningsbarhet: Bygg transparens in i mildringstekniker.

Medan LLM fortsätter att spridas över högriskdomäner, kommer utveckling av robusta lösningar för att begränsa hallucinationer att vara avgörande för att säkerställa deras säkra, etiska och tillförlitliga distribution. Teknikerna som undersökts i den här artikeln ger en översikt av de tekniker som har föreslagits hittills, där fler öppna forskningsutmaningar kvarstår. Sammantaget finns en positiv trend mot att förbättra modellens faktamässighet, men fortsatt framsteg kräver att man hanterar begränsningar och utforskar nya riktningar som kausalitet, verifikation och hybridmetoder. Med noggranna ansträngningar från forskare över discipliner kan drömmen om kraftfulla men tillförlitliga LLM bli verklighet.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.