AI-modeller og plattformer
Overvinning av LLM-hallusinasjoner ved hjelp av Retrieval Augmented Generation (RAG)
Store språkmodeller (LLM) revolusjonerer måten vi prosesserer og genererer språk, men de er ikke perfekte. Liksom mennesker kan se former i skyer eller ansikter på månen, kan LLM-er også “hallusinere” og skape informasjon som ikke er nøyaktig. Dette fenomenet, kjent som LLM-hallusinasjoner, utgjør en økende bekymring ettersom bruken av LLM-er utvides.
Feil kan forvirre brukerne og kan i noen tilfeller sogar føre til juridiske problemer for selskaper. For eksempel saksøkte en tidligere luftforsvars-veteran, Jeffery Battle (kjent som The Aerospace Professor), Microsoft (MSFT ) i 2023, da han fant ut at Microsofts ChatGPT-drevne Bing-søk noen ganger gir faktisk uriktige og skadelige opplysninger om hans navnesøk. Søkemotoren forveksler ham med en dømt forbryter, Jeffery Leon Battle.
For å takle hallusinasjoner har Retrieval-Augmented Generation (RAG) dukket opp som en løftende løsning. Den inkorporerer kunnskap fra eksterne databaser for å forbedre nøyaktigheten og troverdigheten til LLM-ene. La oss se nærmere på hvordan RAG gjør LLM-ene mer nøyaktige og pålitelige. Vi skal også diskutere om RAG kan motvirke LLM-hallusinasjonsproblemet effektivt.
Forståelse av LLM-hallusinasjoner: Årsaker og eksempler
LLM-er, inkludert kjente modeller som ChatGPT, ChatGLM og Claude, er trent på omfattende tekstbaserte datasett, men er ikke immune mot å produsere faktisk uriktige utdata, et fenomen kalt “hallusinasjoner”. Hallusinasjoner skjer fordi LLM-er er trent for å skape meningsfulle svar basert på underliggende språkregler, uavhengig av deres faktiske nøyaktighet.
En Tidio-studie fant ut at mens 72% av brukerne mener at LLM-er er pålitelige, har 75% mottatt feil informasjon fra AI minst en gang. Selv de mest lovende LLM-modellene, som GPT-3.5 og GPT-4, kan noen ganger produsere uriktige eller meningsløse innhold.
Her er en kort oversikt over vanlige typer LLM-hallusinasjoner:
Vanlige AI-hallusinasjonstyper:
- Kildekonfusjon: Dette skjer når en modell kombinerer detaljer fra ulike kilder, noe som kan føre til motstridende eller til og med fabrikkerte kilder.
- Faktiske feil: LLM-er kan generere innhold med uriktige faktiske grunnlag, særlig gitt internettets innebygde uriktigheter.
- Meningsløs informasjon: LLM-er kan forutsi neste ord basert på sannsynlighet. Dette kan resultere i grammatisk korrekt, men meningsløs tekst, som kan mislede brukerne om innholdets autoritet.
I fjor møtte to advokater mulige sanktioner for å ha referert til seks ikke-eksisterende saker i sine rettsdokumenter, misledet av ChatGPT-generert informasjon. Dette eksemplet understreker viktigheten av å nærme seg LLM-generert innhold med en kritisk øye, og understreker behovet for verifisering for å sikre pålitelighet. Mens dens kreative kapasitet er nyttig i applikasjoner som fortelling, stiller det utfordringer for oppgaver som krever streng overholdelse av fakta, som gjennomføring av akademisk forskning, skriving av medisinske og finansielle analyserapporter og givning av juridisk råd.
Utforskning av løsningen for LLM-hallusinasjoner: Hvordan Retrieval Augmented Generation (RAG) fungerer
I 2020 introduserte LLM-forskere en teknikk kalt Retrieval-Augmented Generation (RAG) for å mildne LLM-hallusinasjoner ved å integrere en ekstern datakilde. I motsetning til tradisjonelle LLM-er som bare baserer seg på deres forhåndstrening, genererer RAG-baserte LLM-modeller faktisk nøyaktige svar ved å dynamisk hente relevante informasjon fra en ekstern database før de besvarer spørsmål eller genererer tekst.
RAG-prosess nedbrytning:

RAG-trinn: Kilde
Trinn 1: Henting
Systemet søker i en bestemt kunnskapsbase etter informasjon relatert til brukerens spørsmål. For eksempel, hvis noen spør om den siste fotball-VM-vinneren, søker det etter den mest relevante fotballinformasjonen.
Trinn 2: Utvidelse
Det opprinnelige spørsmålet utvides deretter med informasjonen som er funnet. Ved å bruke fotball-eksemplet, oppdateres spørsmålet “Hvem vant fotball-VM?” med spesifikke detaljer som “Argentina vant fotball-VM.”
Trinn 3: Generering
Med det utvidede spørsmålet genererer LLM-en en detaljert og nøyaktig respons. I vårt tilfelle ville det skape en respons basert på den utvidede informasjonen om Argentina som vinner av VM.
Denne metoden hjelper med å redusere uriktigheter og sikrer at LLM-ene sine svar er mer pålitelige og basert på nøyaktig data.
Fordeler og ulemper ved RAG i reduksjon av hallusinasjoner
RAG har vist løfte i å reducere hallusinasjoner ved å fikse genereringsprosessen. Denne mekanismen tillater RAG-modellene å gi mer nøyaktig, oppdatert og kontekstuell relevant informasjon.
Det er uten tvil at diskusjonen om Retrieval Augmented Generation (RAG) i en mer generell forstand tillater en bredere forståelse av dens fordeler og begrensninger over ulike implementeringer.
Fordeler med RAG:
- Bedre informasjonssøk: RAG finner raskt nøyaktig informasjon fra store datakilder.
- Forbedret innhold: Den skaper tydelig og godt tilpasset innhold for hva brukerne trenger.
- Fleksibel bruk: Brukerne kan tilpasse RAG til å møte deres spesifikke krav, som å bruke deres egne datakilder, og øke effektiviteten.
Ulemper med RAG:
- Trenger spesifikke data: Det kan være vanskelig å forstå spørsmålets kontekst nøyaktig for å gi relevante og presise opplysninger.
- Skalabilitet: Å utvide modellen for å håndtere store datasett og spørsmål samtidig som man opprettholder ytelsen, er vanskelig.
- Kontinuerlig oppdatering: Automatisk oppdatering av kunnskapsdatasettet med den siste informasjonen er ressurskrevende.
Utforskning av alternativer til RAG
Foruten RAG finnes det noen andre løftende metoder som gjør det mulig for LLM-forskere å redusere hallusinasjoner:
- G-EVAL: Verifiserer generert innholds nøyaktighet med en pålitelig datasett, og øker påliteligheten.
- SelfCheckGPT: Sjekker og korrigerer automatisk sine egne feil for å holde utdata nøyaktige og konsistente.
- Prompt Engineering: Hjelper brukerne med å designe presise inndata-prompts for å lede modellene mot nøyaktige og relevante svar.
- Finjustering: Justerer modellen til oppgave-spesifikke datasett for å forbedre domene-spesifikke ytelse.
- LoRA (Low-Rank Adaptation): Denne metoden modifiserer en liten del av modellens parametre for oppgave-spesifikke tilpasninger, og øker effektiviteten.
Utforskningen av RAG og dets alternativer understreker den dynamiske og flerfacetterte tilnærmingen til å forbedre LLM-nøyaktigheten og påliteligheten. Ettersom vi fremover, er kontinuerlig innovasjon i teknologier som RAG essensiell for å møte de innebygde utfordringene med LLM-hallusinasjoner.
For å holde deg oppdatert med de siste utviklingene i AI og maskinlæring, inkludert dybdeanalyser og nyheter, besøk unite.ai.












