Andersons vinkel
Ny forskning finner seksten stÃļrre problemer med RAG-systemer, inkludert Perplexity

En nylig studie fra USA har funnet at den virkelige ytelsen til populÃĶre Retrieval Augmented Generation (RAG) forskningssystemer som Perplexity og Bing Copilot, ligger langt under bÃĨde markedsÃļyeblikk og populÃĶr adopsjon som har samlet overskrifter over de siste 12 mÃĨnedene.
Prosjektet, som involverte omfattende undersÃļkelsesdeltagelse med 21 ekspertstemmer, fant ingen fÃĶrre enn 16 omrÃĨder hvor de studerte RAG-systemene (You Chat, Bing Copilot og Perplexity) produserte ÃĨrsak til bekymring:
1: Mangel pÃĨ objektive detaljer i de genererte svarene, med generiske sammenfatninger og lite kontekstuell dybde eller nuanser.
2. Forsterkning av oppfattet brukerforvrengning, hvor et RAG-motor ofte ikke presenterer et spekter av synspunkter, men heller infererer og forsterker brukerforvrengning, basert pÃĨ mÃĨten brukeren formulerer et spÃļrsmÃĨl pÃĨ.
3. Overmotivert sprÃĨk, sÃĶrlig i subjektive svar som ikke kan empirisk etableres, som kan fÃļre til at brukerne stoler pÃĨ svaret mer enn det fortjener.
4: Enkel sprÃĨk og mangel pÃĨ kritisk tenkning og kreativitet, hvor svarene effektivt patroniserer brukeren med âdumbed-downâ og âenigeâ informasjon, i stedet for gjennomtenkt kogitasjon og analyse.
5: Feilaktig tilskrivning og feilaktig sitat av kilder, hvor svarene bruker sitater som ikke stÃļtter svaret, og skaper en illusjon av troverdighet.
6: Cherry-picking informasjon fra inferert kontekst, hvor RAG-agenten ser ut til ÃĨ sÃļke svar som stÃļtter dens genererte pÃĨstand og dens estimat av hva brukeren vil hÃļre, i stedet for ÃĨ basere svarene pÃĨ objektiv analyse av pÃĨlitelige kilder (muligens indikerer en konflikt mellom systemets âbakedâ LLM-data og data som det henter fra internettet i respons til et spÃļrsmÃĨl).
7: Utelatelse av sitater som stÃļtter uttalelser, hvor kildeinformasjon for svarene mangler.
8: Ingen logisk skjema for svarene, hvor brukerne ikke kan spÃļrre hvorfor systemet prioriterer visse kilder over andre.
9: Begrenset antall kilder, hvor de fleste RAG-systemer vanligvis gir rundt tre stÃļttende kilder for en uttalelse, selv om en stÃļrre mangfold av kilder ville vÃĶre anvendelig.
10: ForÃĶldrelÃļse kilder, hvor data fra alle eller noen av systemets stÃļttende sitater ikke er faktisk inkludert i svaret.
11: Bruk av upÃĨlitelige kilder, hvor systemet ser ut til ÃĨ ha foretrukket en kilde som er populÃĶr (dvs. i SEO-termer) i stedet for faktisk korrekt.
12: Redundante kilder, hvor systemet presenterer flere sitater hvor kildeartiklene i stor grad er de samme i innhold.
13: Ufiltrerte kilder, hvor systemet tilbyr brukeren ingen mÃĨte ÃĨ evaluere eller filtrere de tilbudte sitatene pÃĨ, og tvinger brukerne til ÃĨ stole pÃĨ valgkriteriene.
14: Mangel pÃĨ interaktivitet eller utforsking, hvor flere av brukerundersÃļkelsesdeltagerne ble frustrert over at RAG-systemene ikke stilte klargjÃļrende spÃļrsmÃĨl, men antok brukerens intensjon fra det fÃļrste spÃļrsmÃĨlet.
15: Behov for ekstern verifisering, hvor brukerne fÃļler seg tvunget til ÃĨ utfÃļre uavhengig verifisering av de supplerte svarene, og fjerner den suppede fordelen av RAG som en âerstatning for sÃļkâ.
16: Bruk av akademiske sitatmetoder, som [1] eller [34]; dette er standard praksis i akademiske kretser, men kan vÃĶre uvant for mange brukere.
For arbeidet samlet forskerne 21 eksperter i kunstig intelligens, helse og medisin, anvendt vitenskap og utdanning og samfunnsvitenskap, alle enten postdoktorgrad eller PhD-kandidater. Deltagerne interagerte med de testede RAG-systemene mens de talte sine tenketanker hÃļyt, for ÃĨ klargjÃļre (for forskerne) deres egen rasjonelle skjema.
Arbeidspapiret citerer omfattende deltagernes tvil og bekymringer om ytelsen til de tre systemene som ble studert.
Metodologien for brukerundersÃļkelsen ble deretter systematisert i en automatisert studie av RAG-systemene, ved hjelp av nettleserkontrollpakker:
âEn stor skala automatisert evaluering av systemer som You.com, Perplexity.ai og BingChat viste at ingen mÃļtte akseptabel ytelse over de fleste mÃĨlinger, inkludert kritiske aspekter relatert til hÃĨndtering av hallusinasjoner, stÃļttede uttalelser og sitatnÃļyaktighet.â
Forfatterne argumenterer lenge (og assiduÃļst, i den omfattende 27-siders arbeidspapiret) at bÃĨde nye og erfarne brukere bÃļr utÃļve forsiktighet nÃĨr de bruker klassen av RAG-systemer som ble studert. De foreslÃĨr videre et nytt system av mÃĨlinger, basert pÃĨ manglene som ble funnet i studien, som kunne danne grunnlaget for stÃļrre teknisk tilsyn i fremtiden.
Imidlertid fremmer den Ãļkende offentlige bruken av RAG-systemer forfatterne ogsÃĨ ÃĨ fremme passende lovgivning og en stÃļrre grad av gjennomfÃļrbar regjeringspolitikk i forhold til agent-basert AI-sÃļkegrensesnitt.
Studien kommer fra fem forskere pÃĨ Pennsylvania State University og Salesforce, og heter SÃļkemotorer i en AI-ÃĶra: Det falske lÃļftet om faktiske og verifiserbare kilde-siterte svar. Arbeidet dekker RAG-systemer opp til den aktuelle tilstanden i august 2024
RAG-kompromisset
Forfatterne innleder sitt arbeid med ÃĨ gjenta fire kjente mangler ved Large Language Models (LLM) hvor de brukes i Svar-motorer.
FÃļrst og fremst er de utsatt for hallusinering av informasjon, og mangler evnen til ÃĨ oppdage faktiske inkonsistenser. For det andre har de vanskeligheter med ÃĨ vurdere nÃļyaktigheten av en sitat i sammenheng med et generert svar. For det tredje tenderer de til ÃĨ favorisere data fra deres egne forhÃĨndsveide vekter, og kan motstÃĨ data fra eksternt hentet dokumentasjon, selv om slike data kan vÃĶre mer nylig eller mer nÃļyaktig.
Til slutt tenderer RAG-systemer mot people-pleasing, sycophantisk atferd, ofte pÃĨ bekostning av nÃļyaktigheten av informasjonen i deres svar.
Alle disse tendensene ble bekreftet i bÃĨde aspekter av studien, blant mange nye observasjoner om fallgruvene i RAG.
Arbeidspapiret ser pÃĨ OpenAIâs SearchGPT RAG-produkt (utgitt til abonnenter i fjor, etter at det nye papiret ble sendt inn), som sannsynligvis vil ÃĨ fremme brukeradopsjonen av RAG-basert sÃļk, til tross for de grunnleggende manglene som undersÃļkelsesresultatene antyder*:
âUtgitelsen av OpenAIâs âSearchGPTâ, markedsfÃļrt som en âGoogle-sÃļk-dreperâ, forverrer bekymringene ytterligere. Ettersom avhengigheten av disse verktÃļyene vokser, Ãļker ogsÃĨ urgensen til ÃĨ forstÃĨ deres innvirkning. Lindemann introduserer begrepet Sealed Knowledge, som kritiserer hvordan disse systemene begrenser tilgangen til mangfoldige svar ved ÃĨ kondensere sÃļkeforespÃļrsler til singulÃĶre, autoritative svar, og effektivt dekontekstualiserer informasjon og begrenser bruker perspektiver.
âDette âforsegleâ av kunnskap forsterker seleksjonsforvrengninger og begrenser marginaliserte synspunkter.â
Studien
Forfatterne testet fÃļrst sitt studieprosedyre pÃĨ tre av 24 utvalgte deltakere, alle invitert gjennom LinkedIn eller e-post.
Den fÃļrste fasen, for de gjenvÃĶrende 21, involverte Ekspertise Informasjon Retrieval, hvor deltakerne gjennomsnittlig hadde rundt seks sÃļkeforespÃļrsler over en 40-minutters sesjon. Denne delen konsentrerte seg om ÃĨ innhente og verifisere faktiske spÃļrsmÃĨl og svar, med potensielle empiriske lÃļsninger.
Den andre fasen omhandlet Debatt Informasjon Retrieval, som omhandlet subjektive spÃļrsmÃĨl, inkludert Ãļkologi, vegetarianisme og politikk.

Genererte studie-svar fra Perplexity (venstre) og You Chat (hÃļyre). Kilde: https://arxiv.org/pdf/2410.22349
Siden alle systemene tillot en viss grad av interaktivitet med sitatene som ble gitt som stÃļtte for de genererte svarene, ble studie-objektene oppmuntret til ÃĨ interagere med grensesnittet sÃĨ mye som mulig.
I begge tilfeller ble deltakerne bedt om ÃĨ formulerer sine spÃļrsmÃĨl bÃĨde gjennom et RAG-system og en konvensjonell sÃļkemotor (i dette tilfelle, Google).
De tre Svar-motorene â You Chat, Bing Copilot og Perplexity â ble valgt fordi de er offentlig tilgjengelige.
Flertallet av deltakerne var allerede brukere av RAG-systemer, i varierende hyppighet.
PÃĨ grunn av plassbegrensninger kan vi ikke bryte ned hver av de 16 nÃļkkel-manglene funnet i studien, men presenterer her et utvalg av noen av de mest interessante og opplysende eksemplene.
Mangel pÃĨ objektive detaljer
Arbeidspapiret pÃĨpeker at brukerne fant systemenes svar ofte manglet objektive detaljer, bÃĨde i faktiske og subjektive svar. En kommenterte:
âDet var bare forsÃļkt ÃĨ svare uten ÃĨ gi meg et solid svar eller et mer gjennomtenkt svar, som jeg kan fÃĨ med flere Google-sÃļk.â
En annen observerte:
âDet er for kort og bare summerer alt sammen. [Modellen] mÃĨ gi meg mer data for pÃĨstanden, men det er veldig sammenfattet.â
Mangel pÃĨ helhetlig synspunkt
Forfatterne uttrykker bekymring over mangelen pÃĨ nuanser og spesifikke detaljer, og pÃĨpeker at Svar-motorene ofte ikke presenterer flere synspunkter pÃĨ et argument, men heller sider med en oppfattet forvrengning som er inferert fra brukerens egen formulering av spÃļrsmÃĨlet.
En deltager sa:
âJeg vil finne ut mer om den andre siden av argumentetâĶ dette er med en pinch of salt fordi vi ikke vet den andre siden og bevisene og faktene.â
En annen kommenterte:
âDet gir deg ikke begge sider av argumentet; det argumenterer ikke med deg. I stedet sier [modellen] bare at âdu har rettâĶ og her er grunnene hvorforâ.â
Overmotivert sprÃĨk
Forfatterne observerer at alle tre testede systemer viste overmotivert sprÃĨk, selv i svar som omhandler subjektive spÃļrsmÃĨl. De hevder at denne tonen vil tendere til ÃĨ inspirere ubegrunnet tillit til svaret.
En deltager noterte:
âDet skriver sÃĨ selvbevisst, jeg fÃļler meg overbevist uten ÃĨ se pÃĨ kilde. Men nÃĨr du ser pÃĨ kilde, er det dÃĨrlig og det fÃĨr meg til ÃĨ tvile igjen.â
En annen kommenterte:
âHvis noen ikke eksakt vet det riktige svaret, vil de stole pÃĨ dette selv nÃĨr det er feil.â
Feilaktig sitat
En annen hyppig problem var feilaktig tilskrivning av kilder som ble sitert som autoritet for RAG-systemenes svar, med en av studie-objektene som hevdet:
â[Denne] uttalelsen ser ikke ut til ÃĨ vÃĶre i kilde. Jeg mener uttalelsen er sann; det er gyldigâĶ men jeg vet ikke hvor det fÃĨr denne informasjonen fra.â
Arbeidspapirets forfattere kommenterer â :
âDeltakerne fÃļlte at systemene brukte sitater for ÃĨ legitimere svarene sine, og skapte en illusjon av troverdighet. Denne fasaden ble bare avdekket for noen brukere som gikk videre og undersÃļkte kilde.
Cherry-picking informasjon for ÃĨ svare pÃĨ spÃļrsmÃĨlet
Ved ÃĨ returnere til begrepet people-pleasing, sycophantisk atferd i RAG-svar, fant studien at mange svar hÃļydepunktet en bestemt synspunkt i stedet for ÃĨ sammenfatte emnet komprehensivt, som en deltager observerte:
âJeg fÃļler [systemet] er manipulerende. Det tar bare noen informasjon og det fÃļles som om jeg er manipulert til ÃĨ se bare en side av tingene.â
En annen mente:
â[Kilden] har bÃĨde for- og ulemper, og det har valgt ÃĨ plukke bare de nÃļdvendige argumentene fra denne lenken uten hele bildet.â
For ytterligere dybdegÃĨende eksempler (og flere kritiske sitater fra undersÃļkelsesdeltagerne), henviser vi til kilde-papiret.
Automatisert RAG
I den andre fasen av den bredere studien, brukte forskerne nettleser-basert skripting til ÃĨ systematisk fremme spÃļrsmÃĨl til de tre studerte RAG-motorene. De brukte deretter et LLM-system (GPT-4o) til ÃĨ analysere systemenes svar.
Utstedene ble analysert for spÃļrsmÃĨl-relevans og Pro og Con-uttalelser (dvs. om svaret er for eller mot, eller nÃļytralt, i forhold til den underforstÃĨtte forvrengningen i spÃļrsmÃĨlet.
En Svar-tillits-score ble ogsÃĨ evaluert i denne automatiske fasen, basert pÃĨ Likert-skalaen psykometrisk testmetode. Her var LLM-dommeren supplert med to menneskelige annotatorer.
En tredje operasjon involverte bruk av web-skraping for ÃĨ hente fulltekst-innholdet av sitert nettsted, gjennom Jina.ai Reader-verktÃļyet. Imidlertid, som notert andre steder i papiret, er de fleste web-skraping-verktÃļy like lite i stand til ÃĨ aksessere betalingsmursider som de fleste mennesker (selv om forfatterne observerer at Perplexity.ai har vÃĶrt kjent for ÃĨ ÃĨ gÃĨ rundt denne barrieren).
Ytterligere overveielser var om svarene siterte en kilde (beregnet som en âsitat-matriseâ), samt en âfaktisk stÃļtte-matriseâ â en mÃĨling verifisert med hjelp av fire menneskelige annotatorer.
SÃĨledes ble ÃĨtte overordnede mÃĨlinger oppnÃĨdd: ensidig svar; overmotivert svar; relevant uttalelse; usitterte kilder; ustÃļttede uttalelser; kilde-nÃļdvendighet; sitat-nÃļyaktighet; og sitat-omfattende.
Materialet som disse mÃĨlingene ble testet mot, bestod av 303 kurerte spÃļrsmÃĨl fra brukerundersÃļkelsesfasen, som resulterte i 909 svar over de tre testede systemene.

Kvantitativ evaluering over de tre testede RAG-systemene, basert pÃĨ ÃĨtte mÃĨlinger.
AngÃĨende resultater, pÃĨpeker papiret:
âNÃĨr vi ser pÃĨ de tre mÃĨlingene relatert til svarteksten, finner vi at alle evaluerte svar-motorene ofte (50-80%) genererer ensidige svar, som favoriserer enighet med en ladet formulering av en debatt-spÃļrsmÃĨl over ÃĨ presentere flere synspunkter i svaret, med Perplexity som utfÃļrer dÃĨrligere enn de to andre motorene.
âDette funn stemmer overens med [funnene] fra vÃĨre kvalitative resultater. Overraskende, selv om Perplexity er mest sannsynlig til ÃĨ generere et ensidig svar, genererer det ogsÃĨ de lengste svarene (18,8 uttalelser per svar i gjennomsnitt), noe som indikerer at mangelen pÃĨ svardiversitet ikke skyldes svarkorthet.
âMed andre ord, Ãļker svarens lengde ikke nÃļdvendigvis svardiversiteten.â
Forfatterne pÃĨpeker ogsÃĨ at Perplexity er mest sannsynlig til ÃĨ bruke overmotivert sprÃĨk (90% av svarene), og at, i motsetning til dette, de to andre systemene tenderer til ÃĨ bruke mer forsiktige og mindre overmotiverte uttrykk nÃĨr det gjelder subjektive innhold.
You Chat var den eneste RAG-rammen som oppnÃĨdde null usitterte kilder for et svar, med Perplexity pÃĨ 8% og Bing Chat pÃĨ 36%.
Alle modellene viste en âbetydelig andelâ av ustÃļttede uttalelser, og papiret erklÃĶrerâ :
âRAG-rammen er annonsert for ÃĨ lÃļse hallusineringen av LLM-er ved ÃĨ pÃĨtvinge at en LLM genererer et svar basert pÃĨ kilde-dokumenter, men resultater viser at RAG-baserte svar-motorer likevel genererer svar som inneholder en stor andel uttalelser som ikke stÃļttes av de kildene de tilbyr.â
I tillegg hadde alle de testede systemene vanskeligheter med ÃĨ stÃļtte sine uttalelser med sitater:
âYou.Com og [Bing Chat] utfÃļrer litt bedre enn Perplexity, med omtrent to tredeler av sitatene som peker til en kilde som stÃļtter den siterte uttalelsen, og Perplexity utfÃļrer dÃĨrligere med mer enn halvparten av sitatene som er uakkurate.
âDette resultatet er overraskende: sitat er ikke bare uakkurat for uttalelser som ikke stÃļttes av noen (kilde), men vi finner ogsÃĨ at selv nÃĨr det finnes en kilde som stÃļtter en uttalelse, alle motorer likevel ofte sitater en annen uakkurat kilde, og gÃĨr glipp av muligheten til ÃĨ gi korrekt informasjonskilde til brukeren.
âMed andre ord, hallusinering er ikke bare uttrykt i uttalelser som ikke stÃļttes av kilder, men ogsÃĨ i uakkurate sitater som forhindrer brukerne fra ÃĨ verifisere informasjons-gyldighet.â
Forfatterne konkluderer:
âIngen av svar-motorene oppnÃĨr god ytelse pÃĨ de fleste mÃĨlinger, og det viser et stort rom for forbedring i svar-motorer.â
Â
Â
* Min konvertering av forfatternes inline-sitat til lenker. Hvor nÃļdvendig, har jeg valgt den fÃļrste av flere sitater for lenken, pÃĨ grunn av formateringspraktiske ÃĨrsaker.
â Forfatternes betoning, ikke min.
FÃļrst publisert mandag, 4. november 2024












