AI-modeller og plattformer

Overvinning av LLM-hallusinasjoner ved hjelp av Retrieval Augmented Generation (RAG)

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Store sprÃĨkmodeller (LLM) revolusjonerer mÃĨten vi prosesserer og genererer sprÃĨk, men de er ikke perfekte. Liksom mennesker kan se former i skyer eller ansikter pÃĨ mÃĨnen, kan LLM-er ogsÃĨ “hallusinere” og skape informasjon som ikke er nÃļyaktig. Dette fenomenet, kjent som LLM-hallusinasjoner, utgjÃļr en Ãļkende bekymring ettersom bruken av LLM-er utvides.

Feil kan forvirre brukerne og kan i noen tilfeller sogar fÃļre til juridiske problemer for selskaper. For eksempel saksÃļkte en tidligere luftforsvars-veteran, Jeffery Battle (kjent som The Aerospace Professor), Microsoft (MSFT ) i 2023, da han fant ut at Microsofts ChatGPT-drevne Bing-sÃļk noen ganger gir faktisk uriktige og skadelige opplysninger om hans navnesÃļk. SÃļkemotoren forveksler ham med en dÃļmt forbryter, Jeffery Leon Battle.

For ÃĨ takle hallusinasjoner har Retrieval-Augmented Generation (RAG) dukket opp som en lÃļftende lÃļsning. Den inkorporerer kunnskap fra eksterne databaser for ÃĨ forbedre nÃļyaktigheten og troverdigheten til LLM-ene. La oss se nÃĶrmere pÃĨ hvordan RAG gjÃļr LLM-ene mer nÃļyaktige og pÃĨlitelige. Vi skal ogsÃĨ diskutere om RAG kan motvirke LLM-hallusinasjonsproblemet effektivt.

ForstÃĨelse av LLM-hallusinasjoner: Årsaker og eksempler

LLM-er, inkludert kjente modeller som ChatGPT, ChatGLM og Claude, er trent pÃĨ omfattende tekstbaserte datasett, men er ikke immune mot ÃĨ produsere faktisk uriktige utdata, et fenomen kalt “hallusinasjoner”. Hallusinasjoner skjer fordi LLM-er er trent for ÃĨ skape meningsfulle svar basert pÃĨ underliggende sprÃĨkregler, uavhengig av deres faktiske nÃļyaktighet.

En Tidio-studie fant ut at mens 72% av brukerne mener at LLM-er er pÃĨlitelige, har 75% mottatt feil informasjon fra AI minst en gang. Selv de mest lovende LLM-modellene, som GPT-3.5 og GPT-4, kan noen ganger produsere uriktige eller meningslÃļse innhold.

Her er en kort oversikt over vanlige typer LLM-hallusinasjoner:

Vanlige AI-hallusinasjonstyper:

  1. Kildekonfusjon: Dette skjer nÃĨr en modell kombinerer detaljer fra ulike kilder, noe som kan fÃļre til motstridende eller til og med fabrikkerte kilder.
  2. Faktiske feil: LLM-er kan generere innhold med uriktige faktiske grunnlag, sÃĶrlig gitt internettets innebygde uriktigheter.
  3. MeningslÃļs informasjon: LLM-er kan forutsi neste ord basert pÃĨ sannsynlighet. Dette kan resultere i grammatisk korrekt, men meningslÃļs tekst, som kan mislede brukerne om innholdets autoritet.

I fjor mÃļtte to advokater mulige sanktioner for ÃĨ ha referert til seks ikke-eksisterende saker i sine rettsdokumenter, misledet av ChatGPT-generert informasjon. Dette eksemplet understreker viktigheten av ÃĨ nÃĶrme seg LLM-generert innhold med en kritisk Ãļye, og understreker behovet for verifisering for ÃĨ sikre pÃĨlitelighet. Mens dens kreative kapasitet er nyttig i applikasjoner som fortelling, stiller det utfordringer for oppgaver som krever streng overholdelse av fakta, som gjennomfÃļring av akademisk forskning, skriving av medisinske og finansielle analyserapporter og givning av juridisk rÃĨd.

Utforskning av lÃļsningen for LLM-hallusinasjoner: Hvordan Retrieval Augmented Generation (RAG) fungerer

I 2020 introduserte LLM-forskere en teknikk kalt Retrieval-Augmented Generation (RAG) for ÃĨ mildne LLM-hallusinasjoner ved ÃĨ integrere en ekstern datakilde. I motsetning til tradisjonelle LLM-er som bare baserer seg pÃĨ deres forhÃĨndstrening, genererer RAG-baserte LLM-modeller faktisk nÃļyaktige svar ved ÃĨ dynamisk hente relevante informasjon fra en ekstern database fÃļr de besvarer spÃļrsmÃĨl eller genererer tekst.

RAG-prosess nedbrytning:

RAG-trinn

RAG-trinn: Kilde

Trinn 1: Henting

Systemet sÃļker i en bestemt kunnskapsbase etter informasjon relatert til brukerens spÃļrsmÃĨl. For eksempel, hvis noen spÃļr om den siste fotball-VM-vinneren, sÃļker det etter den mest relevante fotballinformasjonen.

Trinn 2: Utvidelse

Det opprinnelige spÃļrsmÃĨlet utvides deretter med informasjonen som er funnet. Ved ÃĨ bruke fotball-eksemplet, oppdateres spÃļrsmÃĨlet “Hvem vant fotball-VM?” med spesifikke detaljer som “Argentina vant fotball-VM.”

Trinn 3: Generering

Med det utvidede spÃļrsmÃĨlet genererer LLM-en en detaljert og nÃļyaktig respons. I vÃĨrt tilfelle ville det skape en respons basert pÃĨ den utvidede informasjonen om Argentina som vinner av VM.

Denne metoden hjelper med ÃĨ redusere uriktigheter og sikrer at LLM-ene sine svar er mer pÃĨlitelige og basert pÃĨ nÃļyaktig data.

Fordeler og ulemper ved RAG i reduksjon av hallusinasjoner

RAG har vist lÃļfte i ÃĨ reducere hallusinasjoner ved ÃĨ fikse genereringsprosessen. Denne mekanismen tillater RAG-modellene ÃĨ gi mer nÃļyaktig, oppdatert og kontekstuell relevant informasjon.

Det er uten tvil at diskusjonen om Retrieval Augmented Generation (RAG) i en mer generell forstand tillater en bredere forstÃĨelse av dens fordeler og begrensninger over ulike implementeringer.

Fordeler med RAG:

  • Bedre informasjonssÃļk: RAG finner raskt nÃļyaktig informasjon fra store datakilder.
  • Forbedret innhold: Den skaper tydelig og godt tilpasset innhold for hva brukerne trenger.
  • Fleksibel bruk: Brukerne kan tilpasse RAG til ÃĨ mÃļte deres spesifikke krav, som ÃĨ bruke deres egne datakilder, og Ãļke effektiviteten.

Ulemper med RAG:

  • Trenger spesifikke data: Det kan vÃĶre vanskelig ÃĨ forstÃĨ spÃļrsmÃĨlets kontekst nÃļyaktig for ÃĨ gi relevante og presise opplysninger.
  • Skalabilitet: Å utvide modellen for ÃĨ hÃĨndtere store datasett og spÃļrsmÃĨl samtidig som man opprettholder ytelsen, er vanskelig.
  • Kontinuerlig oppdatering: Automatisk oppdatering av kunnskapsdatasettet med den siste informasjonen er ressurskrevende.

Utforskning av alternativer til RAG

Foruten RAG finnes det noen andre lÃļftende metoder som gjÃļr det mulig for LLM-forskere ÃĨ redusere hallusinasjoner:

  • G-EVAL: Verifiserer generert innholds nÃļyaktighet med en pÃĨlitelig datasett, og Ãļker pÃĨliteligheten.
  • SelfCheckGPT: Sjekker og korrigerer automatisk sine egne feil for ÃĨ holde utdata nÃļyaktige og konsistente.
  • Prompt Engineering: Hjelper brukerne med ÃĨ designe presise inndata-prompts for ÃĨ lede modellene mot nÃļyaktige og relevante svar.
  • Finjustering: Justerer modellen til oppgave-spesifikke datasett for ÃĨ forbedre domene-spesifikke ytelse.
  • LoRA (Low-Rank Adaptation): Denne metoden modifiserer en liten del av modellens parametre for oppgave-spesifikke tilpasninger, og Ãļker effektiviteten.

Utforskningen av RAG og dets alternativer understreker den dynamiske og flerfacetterte tilnÃĶrmingen til ÃĨ forbedre LLM-nÃļyaktigheten og pÃĨliteligheten. Ettersom vi fremover, er kontinuerlig innovasjon i teknologier som RAG essensiell for ÃĨ mÃļte de innebygde utfordringene med LLM-hallusinasjoner.

For ÃĨ holde deg oppdatert med de siste utviklingene i AI og maskinlÃĶring, inkludert dybdeanalyser og nyheter, besÃļk unite.ai.

Haziqa er en dataforsker med omfattende erfaring med ÃĨ skrive teknisk innhold for AI- og SaaS-selskaper.