Andersons vinkel

Ny forskning finner seksten stÃļrre problemer med RAG-systemer, inkludert Perplexity

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

En nylig studie fra USA har funnet at den virkelige ytelsen til populÃĶre Retrieval Augmented Generation (RAG) forskningssystemer som Perplexity og Bing Copilot, ligger langt under bÃĨde markedsÃļyeblikk og populÃĶr adopsjon som har samlet overskrifter over de siste 12 mÃĨnedene.

Prosjektet, som involverte omfattende undersÃļkelsesdeltagelse med 21 ekspertstemmer, fant ingen fÃĶrre enn 16 omrÃĨder hvor de studerte RAG-systemene (You Chat, Bing Copilot og Perplexity) produserte ÃĨrsak til bekymring:

1: Mangel pÃĨ objektive detaljer i de genererte svarene, med generiske sammenfatninger og lite kontekstuell dybde eller nuanser.

2. Forsterkning av oppfattet brukerforvrengning, hvor et RAG-motor ofte ikke presenterer et spekter av synspunkter, men heller infererer og forsterker brukerforvrengning, basert pÃĨ mÃĨten brukeren formulerer et spÃļrsmÃĨl pÃĨ.

3. Overmotivert sprÃĨk, sÃĶrlig i subjektive svar som ikke kan empirisk etableres, som kan fÃļre til at brukerne stoler pÃĨ svaret mer enn det fortjener.

4: Enkel sprÃĨk og mangel pÃĨ kritisk tenkning og kreativitet, hvor svarene effektivt patroniserer brukeren med “dumbed-down” og “enige” informasjon, i stedet for gjennomtenkt kogitasjon og analyse.

5: Feilaktig tilskrivning og feilaktig sitat av kilder, hvor svarene bruker sitater som ikke stÃļtter svaret, og skaper en illusjon av troverdighet.

6: Cherry-picking informasjon fra inferert kontekst, hvor RAG-agenten ser ut til ÃĨ sÃļke svar som stÃļtter dens genererte pÃĨstand og dens estimat av hva brukeren vil hÃļre, i stedet for ÃĨ basere svarene pÃĨ objektiv analyse av pÃĨlitelige kilder (muligens indikerer en konflikt mellom systemets “baked” LLM-data og data som det henter fra internettet i respons til et spÃļrsmÃĨl).

7: Utelatelse av sitater som stÃļtter uttalelser, hvor kildeinformasjon for svarene mangler.

8: Ingen logisk skjema for svarene, hvor brukerne ikke kan spÃļrre hvorfor systemet prioriterer visse kilder over andre.

9: Begrenset antall kilder, hvor de fleste RAG-systemer vanligvis gir rundt tre stÃļttende kilder for en uttalelse, selv om en stÃļrre mangfold av kilder ville vÃĶre anvendelig.

10: ForÃĶldrelÃļse kilder, hvor data fra alle eller noen av systemets stÃļttende sitater ikke er faktisk inkludert i svaret.

11: Bruk av upÃĨlitelige kilder, hvor systemet ser ut til ÃĨ ha foretrukket en kilde som er populÃĶr (dvs. i SEO-termer) i stedet for faktisk korrekt.

12: Redundante kilder, hvor systemet presenterer flere sitater hvor kildeartiklene i stor grad er de samme i innhold.

13: Ufiltrerte kilder, hvor systemet tilbyr brukeren ingen mÃĨte ÃĨ evaluere eller filtrere de tilbudte sitatene pÃĨ, og tvinger brukerne til ÃĨ stole pÃĨ valgkriteriene.

14: Mangel pÃĨ interaktivitet eller utforsking, hvor flere av brukerundersÃļkelsesdeltagerne ble frustrert over at RAG-systemene ikke stilte klargjÃļrende spÃļrsmÃĨl, men antok brukerens intensjon fra det fÃļrste spÃļrsmÃĨlet.

15: Behov for ekstern verifisering, hvor brukerne fÃļler seg tvunget til ÃĨ utfÃļre uavhengig verifisering av de supplerte svarene, og fjerner den suppede fordelen av RAG som en “erstatning for sÃļk”.

16: Bruk av akademiske sitatmetoder, som [1] eller [34]; dette er standard praksis i akademiske kretser, men kan vÃĶre uvant for mange brukere.

For arbeidet samlet forskerne 21 eksperter i kunstig intelligens, helse og medisin, anvendt vitenskap og utdanning og samfunnsvitenskap, alle enten postdoktorgrad eller PhD-kandidater. Deltagerne interagerte med de testede RAG-systemene mens de talte sine tenketanker hÃļyt, for ÃĨ klargjÃļre (for forskerne) deres egen rasjonelle skjema.

Arbeidspapiret citerer omfattende deltagernes tvil og bekymringer om ytelsen til de tre systemene som ble studert.

Metodologien for brukerundersÃļkelsen ble deretter systematisert i en automatisert studie av RAG-systemene, ved hjelp av nettleserkontrollpakker:

‘En stor skala automatisert evaluering av systemer som You.com, Perplexity.ai og BingChat viste at ingen mÃļtte akseptabel ytelse over de fleste mÃĨlinger, inkludert kritiske aspekter relatert til hÃĨndtering av hallusinasjoner, stÃļttede uttalelser og sitatnÃļyaktighet.’

Forfatterne argumenterer lenge (og assiduÃļst, i den omfattende 27-siders arbeidspapiret) at bÃĨde nye og erfarne brukere bÃļr utÃļve forsiktighet nÃĨr de bruker klassen av RAG-systemer som ble studert. De foreslÃĨr videre et nytt system av mÃĨlinger, basert pÃĨ manglene som ble funnet i studien, som kunne danne grunnlaget for stÃļrre teknisk tilsyn i fremtiden.

Imidlertid fremmer den Ãļkende offentlige bruken av RAG-systemer forfatterne ogsÃĨ ÃĨ fremme passende lovgivning og en stÃļrre grad av gjennomfÃļrbar regjeringspolitikk i forhold til agent-basert AI-sÃļkegrensesnitt.

Studien kommer fra fem forskere pÃĨ Pennsylvania State University og Salesforce, og heter SÃļkemotorer i en AI-ÃĶra: Det falske lÃļftet om faktiske og verifiserbare kilde-siterte svar. Arbeidet dekker RAG-systemer opp til den aktuelle tilstanden i august 2024

RAG-kompromisset

Forfatterne innleder sitt arbeid med ÃĨ gjenta fire kjente mangler ved Large Language Models (LLM) hvor de brukes i Svar-motorer.

FÃļrst og fremst er de utsatt for hallusinering av informasjon, og mangler evnen til ÃĨ oppdage faktiske inkonsistenser. For det andre har de vanskeligheter med ÃĨ vurdere nÃļyaktigheten av en sitat i sammenheng med et generert svar. For det tredje tenderer de til ÃĨ favorisere data fra deres egne forhÃĨndsveide vekter, og kan motstÃĨ data fra eksternt hentet dokumentasjon, selv om slike data kan vÃĶre mer nylig eller mer nÃļyaktig.

Til slutt tenderer RAG-systemer mot people-pleasing, sycophantisk atferd, ofte pÃĨ bekostning av nÃļyaktigheten av informasjonen i deres svar.

Alle disse tendensene ble bekreftet i bÃĨde aspekter av studien, blant mange nye observasjoner om fallgruvene i RAG.

Arbeidspapiret ser pÃĨ OpenAI’s SearchGPT RAG-produkt (utgitt til abonnenter i fjor, etter at det nye papiret ble sendt inn), som sannsynligvis vil ÃĨ fremme brukeradopsjonen av RAG-basert sÃļk, til tross for de grunnleggende manglene som undersÃļkelsesresultatene antyder*:

‘Utgitelsen av OpenAI’s “SearchGPT”, markedsfÃļrt som en “Google-sÃļk-dreper”, forverrer bekymringene ytterligere. Ettersom avhengigheten av disse verktÃļyene vokser, Ãļker ogsÃĨ urgensen til ÃĨ forstÃĨ deres innvirkning. Lindemann introduserer begrepet Sealed Knowledge, som kritiserer hvordan disse systemene begrenser tilgangen til mangfoldige svar ved ÃĨ kondensere sÃļkeforespÃļrsler til singulÃĶre, autoritative svar, og effektivt dekontekstualiserer informasjon og begrenser bruker perspektiver.

‘Dette “forsegle” av kunnskap forsterker seleksjonsforvrengninger og begrenser marginaliserte synspunkter.’

Studien

Forfatterne testet fÃļrst sitt studieprosedyre pÃĨ tre av 24 utvalgte deltakere, alle invitert gjennom LinkedIn eller e-post.

Den fÃļrste fasen, for de gjenvÃĶrende 21, involverte Ekspertise Informasjon Retrieval, hvor deltakerne gjennomsnittlig hadde rundt seks sÃļkeforespÃļrsler over en 40-minutters sesjon. Denne delen konsentrerte seg om ÃĨ innhente og verifisere faktiske spÃļrsmÃĨl og svar, med potensielle empiriske lÃļsninger.

Den andre fasen omhandlet Debatt Informasjon Retrieval, som omhandlet subjektive spÃļrsmÃĨl, inkludert Ãļkologi, vegetarianisme og politikk.

Genererte studie-svar fra Perplexity (venstre) og You Chat (hÃļyre). Kilde: https://arxiv.org/pdf/2410.22349

Genererte studie-svar fra Perplexity (venstre) og You Chat (hÃļyre). Kilde: https://arxiv.org/pdf/2410.22349

Siden alle systemene tillot en viss grad av interaktivitet med sitatene som ble gitt som stÃļtte for de genererte svarene, ble studie-objektene oppmuntret til ÃĨ interagere med grensesnittet sÃĨ mye som mulig.

I begge tilfeller ble deltakerne bedt om ÃĨ formulerer sine spÃļrsmÃĨl bÃĨde gjennom et RAG-system og en konvensjonell sÃļkemotor (i dette tilfelle, Google).

De tre Svar-motorene – You Chat, Bing Copilot og Perplexity – ble valgt fordi de er offentlig tilgjengelige.

Flertallet av deltakerne var allerede brukere av RAG-systemer, i varierende hyppighet.

PÃĨ grunn av plassbegrensninger kan vi ikke bryte ned hver av de 16 nÃļkkel-manglene funnet i studien, men presenterer her et utvalg av noen av de mest interessante og opplysende eksemplene.

Mangel pÃĨ objektive detaljer

Arbeidspapiret pÃĨpeker at brukerne fant systemenes svar ofte manglet objektive detaljer, bÃĨde i faktiske og subjektive svar. En kommenterte:

‘Det var bare forsÃļkt ÃĨ svare uten ÃĨ gi meg et solid svar eller et mer gjennomtenkt svar, som jeg kan fÃĨ med flere Google-sÃļk.’

En annen observerte:

‘Det er for kort og bare summerer alt sammen. [Modellen] mÃĨ gi meg mer data for pÃĨstanden, men det er veldig sammenfattet.’

Mangel pÃĨ helhetlig synspunkt

Forfatterne uttrykker bekymring over mangelen pÃĨ nuanser og spesifikke detaljer, og pÃĨpeker at Svar-motorene ofte ikke presenterer flere synspunkter pÃĨ et argument, men heller sider med en oppfattet forvrengning som er inferert fra brukerens egen formulering av spÃļrsmÃĨlet.

En deltager sa:

‘Jeg vil finne ut mer om den andre siden av argumentetâ€Ķ dette er med en pinch of salt fordi vi ikke vet den andre siden og bevisene og faktene.’

En annen kommenterte:

‘Det gir deg ikke begge sider av argumentet; det argumenterer ikke med deg. I stedet sier [modellen] bare at “du har rettâ€Ķ og her er grunnene hvorfor”.’

Overmotivert sprÃĨk

Forfatterne observerer at alle tre testede systemer viste overmotivert sprÃĨk, selv i svar som omhandler subjektive spÃļrsmÃĨl. De hevder at denne tonen vil tendere til ÃĨ inspirere ubegrunnet tillit til svaret.

En deltager noterte:

‘Det skriver sÃĨ selvbevisst, jeg fÃļler meg overbevist uten ÃĨ se pÃĨ kilde. Men nÃĨr du ser pÃĨ kilde, er det dÃĨrlig og det fÃĨr meg til ÃĨ tvile igjen.’

En annen kommenterte:

‘Hvis noen ikke eksakt vet det riktige svaret, vil de stole pÃĨ dette selv nÃĨr det er feil.’

Feilaktig sitat

En annen hyppig problem var feilaktig tilskrivning av kilder som ble sitert som autoritet for RAG-systemenes svar, med en av studie-objektene som hevdet:

‘[Denne] uttalelsen ser ikke ut til ÃĨ vÃĶre i kilde. Jeg mener uttalelsen er sann; det er gyldigâ€Ķ men jeg vet ikke hvor det fÃĨr denne informasjonen fra.’

Arbeidspapirets forfattere kommenterer †:

‘Deltakerne fÃļlte at systemene brukte sitater for ÃĨ legitimere svarene sine, og skapte en illusjon av troverdighet. Denne fasaden ble bare avdekket for noen brukere som gikk videre og undersÃļkte kilde.

Cherry-picking informasjon for ÃĨ svare pÃĨ spÃļrsmÃĨlet

Ved ÃĨ returnere til begrepet people-pleasing, sycophantisk atferd i RAG-svar, fant studien at mange svar hÃļydepunktet en bestemt synspunkt i stedet for ÃĨ sammenfatte emnet komprehensivt, som en deltager observerte:

‘Jeg fÃļler [systemet] er manipulerende. Det tar bare noen informasjon og det fÃļles som om jeg er manipulert til ÃĨ se bare en side av tingene.’

En annen mente:

‘[Kilden] har bÃĨde for- og ulemper, og det har valgt ÃĨ plukke bare de nÃļdvendige argumentene fra denne lenken uten hele bildet.’

For ytterligere dybdegÃĨende eksempler (og flere kritiske sitater fra undersÃļkelsesdeltagerne), henviser vi til kilde-papiret.

Automatisert RAG

I den andre fasen av den bredere studien, brukte forskerne nettleser-basert skripting til ÃĨ systematisk fremme spÃļrsmÃĨl til de tre studerte RAG-motorene. De brukte deretter et LLM-system (GPT-4o) til ÃĨ analysere systemenes svar.

Utstedene ble analysert for spÃļrsmÃĨl-relevans og Pro og Con-uttalelser (dvs. om svaret er for eller mot, eller nÃļytralt, i forhold til den underforstÃĨtte forvrengningen i spÃļrsmÃĨlet.

En Svar-tillits-score ble ogsÃĨ evaluert i denne automatiske fasen, basert pÃĨ Likert-skalaen psykometrisk testmetode. Her var LLM-dommeren supplert med to menneskelige annotatorer.

En tredje operasjon involverte bruk av web-skraping for ÃĨ hente fulltekst-innholdet av sitert nettsted, gjennom Jina.ai Reader-verktÃļyet. Imidlertid, som notert andre steder i papiret, er de fleste web-skraping-verktÃļy like lite i stand til ÃĨ aksessere betalingsmursider som de fleste mennesker (selv om forfatterne observerer at Perplexity.ai har vÃĶrt kjent for ÃĨ ÃĨ gÃĨ rundt denne barrieren).

Ytterligere overveielser var om svarene siterte en kilde (beregnet som en “sitat-matrise”), samt en “faktisk stÃļtte-matrise” – en mÃĨling verifisert med hjelp av fire menneskelige annotatorer.

SÃĨledes ble ÃĨtte overordnede mÃĨlinger oppnÃĨdd: ensidig svar; overmotivert svar; relevant uttalelse; usitterte kilder; ustÃļttede uttalelser; kilde-nÃļdvendighet; sitat-nÃļyaktighet; og sitat-omfattende.

Materialet som disse mÃĨlingene ble testet mot, bestod av 303 kurerte spÃļrsmÃĨl fra brukerundersÃļkelsesfasen, som resulterte i 909 svar over de tre testede systemene.

Kvantitativ evaluering over de tre testede RAG-systemene, basert pÃĨ ÃĨtte mÃĨlinger.

Kvantitativ evaluering over de tre testede RAG-systemene, basert pÃĨ ÃĨtte mÃĨlinger.

AngÃĨende resultater, pÃĨpeker papiret:

‘NÃĨr vi ser pÃĨ de tre mÃĨlingene relatert til svarteksten, finner vi at alle evaluerte svar-motorene ofte (50-80%) genererer ensidige svar, som favoriserer enighet med en ladet formulering av en debatt-spÃļrsmÃĨl over ÃĨ presentere flere synspunkter i svaret, med Perplexity som utfÃļrer dÃĨrligere enn de to andre motorene.

‘Dette funn stemmer overens med [funnene] fra vÃĨre kvalitative resultater. Overraskende, selv om Perplexity er mest sannsynlig til ÃĨ generere et ensidig svar, genererer det ogsÃĨ de lengste svarene (18,8 uttalelser per svar i gjennomsnitt), noe som indikerer at mangelen pÃĨ svardiversitet ikke skyldes svarkorthet.

‘Med andre ord, Ãļker svarens lengde ikke nÃļdvendigvis svardiversiteten.’

Forfatterne pÃĨpeker ogsÃĨ at Perplexity er mest sannsynlig til ÃĨ bruke overmotivert sprÃĨk (90% av svarene), og at, i motsetning til dette, de to andre systemene tenderer til ÃĨ bruke mer forsiktige og mindre overmotiverte uttrykk nÃĨr det gjelder subjektive innhold.

You Chat var den eneste RAG-rammen som oppnÃĨdde null usitterte kilder for et svar, med Perplexity pÃĨ 8% og Bing Chat pÃĨ 36%.

Alle modellene viste en “betydelig andel” av ustÃļttede uttalelser, og papiret erklÃĶrer†:

‘RAG-rammen er annonsert for ÃĨ lÃļse hallusineringen av LLM-er ved ÃĨ pÃĨtvinge at en LLM genererer et svar basert pÃĨ kilde-dokumenter, men resultater viser at RAG-baserte svar-motorer likevel genererer svar som inneholder en stor andel uttalelser som ikke stÃļttes av de kildene de tilbyr.‘

I tillegg hadde alle de testede systemene vanskeligheter med ÃĨ stÃļtte sine uttalelser med sitater:

‘You.Com og [Bing Chat] utfÃļrer litt bedre enn Perplexity, med omtrent to tredeler av sitatene som peker til en kilde som stÃļtter den siterte uttalelsen, og Perplexity utfÃļrer dÃĨrligere med mer enn halvparten av sitatene som er uakkurate.

‘Dette resultatet er overraskende: sitat er ikke bare uakkurat for uttalelser som ikke stÃļttes av noen (kilde), men vi finner ogsÃĨ at selv nÃĨr det finnes en kilde som stÃļtter en uttalelse, alle motorer likevel ofte sitater en annen uakkurat kilde, og gÃĨr glipp av muligheten til ÃĨ gi korrekt informasjonskilde til brukeren.

‘Med andre ord, hallusinering er ikke bare uttrykt i uttalelser som ikke stÃļttes av kilder, men ogsÃĨ i uakkurate sitater som forhindrer brukerne fra ÃĨ verifisere informasjons-gyldighet.‘

Forfatterne konkluderer:

‘Ingen av svar-motorene oppnÃĨr god ytelse pÃĨ de fleste mÃĨlinger, og det viser et stort rom for forbedring i svar-motorer.’

 

 

* Min konvertering av forfatternes inline-sitat til lenker. Hvor nÃļdvendig, har jeg valgt den fÃļrste av flere sitater for lenken, pÃĨ grunn av formateringspraktiske ÃĨrsaker.

† Forfatternes betoning, ikke min.

FÃļrst publisert mandag, 4. november 2024

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]