AI-modeller og plattformer

Ny forskning finner seksten større problemer med RAG-systemer, inkludert Perplexity

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

En nylig studie fra USA har funnet at den virkelige ytelsen til populære Retrieval Augmented Generation (RAG) forskningssystemer som Perplexity og Bing Copilot, ligger langt under både markedsøyeblikk og populær adopsjon som har samlet overskrifter over de siste 12 månedene.

Prosjektet, som involverte omfattende undersøkelsesdeltagelse med 21 ekspertstemmer, fant ingen færre enn 16 områder hvor de studerte RAG-systemene (You Chat, Bing Copilot og Perplexity) produserte årsak til bekymring:

1: Mangel på objektive detaljer i de genererte svarene, med generiske sammenfatninger og lite kontekstuell dybde eller nuanser.

2. Forsterkning av oppfattet brukerforvrengning, hvor et RAG-motor ofte ikke presenterer et spekter av synspunkter, men heller infererer og forsterker brukerforvrengning, basert på måten brukeren formulerer et spørsmål på.

3. Overmotivert språk, særlig i subjektive svar som ikke kan empirisk etableres, som kan føre til at brukerne stoler på svaret mer enn det fortjener.

4: Enkel språk og mangel på kritisk tenkning og kreativitet, hvor svarene effektivt patroniserer brukeren med “dumbed-down” og “enige” informasjon, i stedet for gjennomtenkt kogitasjon og analyse.

5: Feilaktig tilskrivning og feilaktig sitat av kilder, hvor svarene bruker sitater som ikke støtter svaret, og skaper en illusjon av troverdighet.

6: Cherry-picking informasjon fra inferert kontekst, hvor RAG-agenten ser ut til å søke svar som støtter dens genererte påstand og dens estimat av hva brukeren vil høre, i stedet for å basere svarene på objektiv analyse av pålitelige kilder (muligens indikerer en konflikt mellom systemets “baked” LLM-data og data som det henter fra internettet i respons til et spørsmål).

7: Utelatelse av sitater som støtter uttalelser, hvor kildeinformasjon for svarene mangler.

8: Ingen logisk skjema for svarene, hvor brukerne ikke kan spørre hvorfor systemet prioriterer visse kilder over andre.

9: Begrenset antall kilder, hvor de fleste RAG-systemer vanligvis gir rundt tre støttende kilder for en uttalelse, selv om en større mangfold av kilder ville være anvendelig.

10: Forældreløse kilder, hvor data fra alle eller noen av systemets støttende sitater ikke er faktisk inkludert i svaret.

11: Bruk av upålitelige kilder, hvor systemet ser ut til å ha foretrukket en kilde som er populær (dvs. i SEO-termer) i stedet for faktisk korrekt.

12: Redundante kilder, hvor systemet presenterer flere sitater hvor kildeartiklene i stor grad er de samme i innhold.

13: Ufiltrerte kilder, hvor systemet tilbyr brukeren ingen måte å evaluere eller filtrere de tilbudte sitatene på, og tvinger brukerne til å stole på valgkriteriene.

14: Mangel på interaktivitet eller utforsking, hvor flere av brukerundersøkelsesdeltagerne ble frustrert over at RAG-systemene ikke stilte klargjørende spørsmål, men antok brukerens intensjon fra det første spørsmålet.

15: Behov for ekstern verifisering, hvor brukerne føler seg tvunget til å utføre uavhengig verifisering av de supplerte svarene, og fjerner den suppede fordelen av RAG som en “erstatning for søk”.

16: Bruk av akademiske sitatmetoder, som [1] eller [34]; dette er standard praksis i akademiske kretser, men kan være uvant for mange brukere.

For arbeidet samlet forskerne 21 eksperter i kunstig intelligens, helse og medisin, anvendt vitenskap og utdanning og samfunnsvitenskap, alle enten postdoktorgrad eller PhD-kandidater. Deltagerne interagerte med de testede RAG-systemene mens de talte sine tenketanker høyt, for å klargjøre (for forskerne) deres egen rasjonelle skjema.

Arbeidspapiret citerer omfattende deltagernes tvil og bekymringer om ytelsen til de tre systemene som ble studert.

Metodologien for brukerundersøkelsen ble deretter systematisert i en automatisert studie av RAG-systemene, ved hjelp av nettleserkontrollpakker:

‘En stor skala automatisert evaluering av systemer som You.com, Perplexity.ai og BingChat viste at ingen møtte akseptabel ytelse over de fleste målinger, inkludert kritiske aspekter relatert til håndtering av hallusinasjoner, støttede uttalelser og sitatnøyaktighet.’

Forfatterne argumenterer lenge (og assiduøst, i den omfattende 27-siders arbeidspapiret) at både nye og erfarne brukere bør utøve forsiktighet når de bruker klassen av RAG-systemer som ble studert. De foreslår videre et nytt system av målinger, basert på manglene som ble funnet i studien, som kunne danne grunnlaget for større teknisk tilsyn i fremtiden.

Imidlertid fremmer den økende offentlige bruken av RAG-systemer forfatterne også å fremme passende lovgivning og en større grad av gjennomførbar regjeringspolitikk i forhold til agent-basert AI-søkegrensesnitt.

Studien kommer fra fem forskere på Pennsylvania State University og Salesforce (CRM ), og heter Søkemotorer i en AI-æra: Det falske løftet om faktiske og verifiserbare kilde-siterte svar. Arbeidet dekker RAG-systemer opp til den aktuelle tilstanden i august 2024

RAG-kompromisset

Forfatterne innleder sitt arbeid med å gjenta fire kjente mangler ved Large Language Models (LLM) hvor de brukes i Svar-motorer.

Først og fremst er de utsatt for hallusinering av informasjon, og mangler evnen til å oppdage faktiske inkonsistenser. For det andre har de vanskeligheter med å vurdere nøyaktigheten av en sitat i sammenheng med et generert svar. For det tredje tenderer de til å favorisere data fra deres egne forhåndsveide vekter, og kan motstå data fra eksternt hentet dokumentasjon, selv om slike data kan være mer nylig eller mer nøyaktig.

Til slutt tenderer RAG-systemer mot people-pleasing, sycophantisk atferd, ofte på bekostning av nøyaktigheten av informasjonen i deres svar.

Alle disse tendensene ble bekreftet i både aspekter av studien, blant mange nye observasjoner om fallgruvene i RAG.

Arbeidspapiret ser på OpenAI’s SearchGPT RAG-produkt (utgitt til abonnenter i fjor, etter at det nye papiret ble sendt inn), som sannsynligvis vil å fremme brukeradopsjonen av RAG-basert søk, til tross for de grunnleggende manglene som undersøkelsesresultatene antyder*:

‘Utgitelsen av OpenAI’s “SearchGPT”, markedsført som en “Google-søk-dreper”, forverrer bekymringene ytterligere. Ettersom avhengigheten av disse verktøyene vokser, øker også urgensen til å forstå deres innvirkning. Lindemann introduserer begrepet Sealed Knowledge, som kritiserer hvordan disse systemene begrenser tilgangen til mangfoldige svar ved å kondensere søkeforespørsler til singulære, autoritative svar, og effektivt dekontekstualiserer informasjon og begrenser bruker perspektiver.

‘Dette “forsegle” av kunnskap forsterker seleksjonsforvrengninger og begrenser marginaliserte synspunkter.’

Studien

Forfatterne testet først sitt studieprosedyre på tre av 24 utvalgte deltakere, alle invitert gjennom LinkedIn eller e-post.

Den første fasen, for de gjenværende 21, involverte Ekspertise Informasjon Retrieval, hvor deltakerne gjennomsnittlig hadde rundt seks søkeforespørsler over en 40-minutters sesjon. Denne delen konsentrerte seg om å innhente og verifisere faktiske spørsmål og svar, med potensielle empiriske løsninger.

Den andre fasen omhandlet Debatt Informasjon Retrieval, som omhandlet subjektive spørsmål, inkludert økologi, vegetarianisme og politikk.

Genererte studie-svar fra Perplexity (venstre) og You Chat (høyre). Kilde: https://arxiv.org/pdf/2410.22349

Genererte studie-svar fra Perplexity (venstre) og You Chat (høyre). Kilde: https://arxiv.org/pdf/2410.22349

Siden alle systemene tillot en viss grad av interaktivitet med sitatene som ble gitt som støtte for de genererte svarene, ble studie-objektene oppmuntret til å interagere med grensesnittet så mye som mulig.

I begge tilfeller ble deltakerne bedt om å formulerer sine spørsmål både gjennom et RAG-system og en konvensjonell søkemotor (i dette tilfelle, Google).

De tre Svar-motorene – You Chat, Bing Copilot og Perplexity – ble valgt fordi de er offentlig tilgjengelige.

Flertallet av deltakerne var allerede brukere av RAG-systemer, i varierende hyppighet.

På grunn av plassbegrensninger kan vi ikke bryte ned hver av de 16 nøkkel-manglene funnet i studien, men presenterer her et utvalg av noen av de mest interessante og opplysende eksemplene.

Mangel på objektive detaljer

Arbeidspapiret påpeker at brukerne fant systemenes svar ofte manglet objektive detaljer, både i faktiske og subjektive svar. En kommenterte:

‘Det var bare forsøkt å svare uten å gi meg et solid svar eller et mer gjennomtenkt svar, som jeg kan få med flere Google-søk.’

En annen observerte:

‘Det er for kort og bare summerer alt sammen. [Modellen] må gi meg mer data for påstanden, men det er veldig sammenfattet.’

Mangel på helhetlig synspunkt

Forfatterne uttrykker bekymring over mangelen på nuanser og spesifikke detaljer, og påpeker at Svar-motorene ofte ikke presenterer flere synspunkter på et argument, men heller sider med en oppfattet forvrengning som er inferert fra brukerens egen formulering av spørsmålet.

En deltager sa:

‘Jeg vil finne ut mer om den andre siden av argumentet… dette er med en pinch of salt fordi vi ikke vet den andre siden og bevisene og faktene.’

En annen kommenterte:

‘Det gir deg ikke begge sider av argumentet; det argumenterer ikke med deg. I stedet sier [modellen] bare at “du har rett… og her er grunnene hvorfor”.’

Overmotivert språk

Forfatterne observerer at alle tre testede systemer viste overmotivert språk, selv i svar som omhandler subjektive spørsmål. De hevder at denne tonen vil tendere til å inspirere ubegrunnet tillit til svaret.

En deltager noterte:

‘Det skriver så selvbevisst, jeg føler meg overbevist uten å se på kilde. Men når du ser på kilde, er det dårlig og det får meg til å tvile igjen.’

En annen kommenterte:

‘Hvis noen ikke eksakt vet det riktige svaret, vil de stole på dette selv når det er feil.’

Feilaktig sitat

En annen hyppig problem var feilaktig tilskrivning av kilder som ble sitert som autoritet for RAG-systemenes svar, med en av studie-objektene som hevdet:

‘[Denne] uttalelsen ser ikke ut til å være i kilde. Jeg mener uttalelsen er sann; det er gyldig… men jeg vet ikke hvor det får denne informasjonen fra.’

Arbeidspapirets forfattere kommenterer †:

‘Deltakerne følte at systemene brukte sitater for å legitimere svarene sine, og skapte en illusjon av troverdighet. Denne fasaden ble bare avdekket for noen brukere som gikk videre og undersøkte kilde.

Cherry-picking informasjon for å svare på spørsmålet

Ved å returnere til begrepet people-pleasing, sycophantisk atferd i RAG-svar, fant studien at mange svar høydepunktet en bestemt synspunkt i stedet for å sammenfatte emnet komprehensivt, som en deltager observerte:

‘Jeg føler [systemet] er manipulerende. Det tar bare noen informasjon og det føles som om jeg er manipulert til å se bare en side av tingene.’

En annen mente:

‘[Kilden] har både for- og ulemper, og det har valgt å plukke bare de nødvendige argumentene fra denne lenken uten hele bildet.’

For ytterligere dybdegående eksempler (og flere kritiske sitater fra undersøkelsesdeltagerne), henviser vi til kilde-papiret.

Automatisert RAG

I den andre fasen av den bredere studien, brukte forskerne nettleser-basert skripting til å systematisk fremme spørsmål til de tre studerte RAG-motorene. De brukte deretter et LLM-system (GPT-4o) til å analysere systemenes svar.

Utstedene ble analysert for spørsmål-relevans og Pro og Con-uttalelser (dvs. om svaret er for eller mot, eller nøytralt, i forhold til den underforståtte forvrengningen i spørsmålet.

En Svar-tillits-score ble også evaluert i denne automatiske fasen, basert på Likert-skalaen psykometrisk testmetode. Her var LLM-dommeren supplert med to menneskelige annotatorer.

En tredje operasjon involverte bruk av web-skraping for å hente fulltekst-innholdet av sitert nettsted, gjennom Jina.ai Reader-verktøyet. Imidlertid, som notert andre steder i papiret, er de fleste web-skraping-verktøy like lite i stand til å aksessere betalingsmursider som de fleste mennesker (selv om forfatterne observerer at Perplexity.ai har vært kjent for å å gå rundt denne barrieren).

Ytterligere overveielser var om svarene siterte en kilde (beregnet som en “sitat-matrise”), samt en “faktisk støtte-matrise” – en måling verifisert med hjelp av fire menneskelige annotatorer.

Således ble åtte overordnede målinger oppnådd: ensidig svar; overmotivert svar; relevant uttalelse; usitterte kilder; ustøttede uttalelser; kilde-nødvendighet; sitat-nøyaktighet; og sitat-omfattende.

Materialet som disse målingene ble testet mot, bestod av 303 kurerte spørsmål fra brukerundersøkelsesfasen, som resulterte i 909 svar over de tre testede systemene.

Kvantitativ evaluering over de tre testede RAG-systemene, basert på åtte målinger.

Kvantitativ evaluering over de tre testede RAG-systemene, basert på åtte målinger.

Angående resultater, påpeker papiret:

‘Når vi ser på de tre målingene relatert til svarteksten, finner vi at alle evaluerte svar-motorene ofte (50-80%) genererer ensidige svar, som favoriserer enighet med en ladet formulering av en debatt-spørsmål over å presentere flere synspunkter i svaret, med Perplexity som utfører dårligere enn de to andre motorene.

‘Dette funn stemmer overens med [funnene] fra våre kvalitative resultater. Overraskende, selv om Perplexity er mest sannsynlig til å generere et ensidig svar, genererer det også de lengste svarene (18,8 uttalelser per svar i gjennomsnitt), noe som indikerer at mangelen på svardiversitet ikke skyldes svarkorthet.

‘Med andre ord, øker svarens lengde ikke nødvendigvis svardiversiteten.’

Forfatterne påpeker også at Perplexity er mest sannsynlig til å bruke overmotivert språk (90% av svarene), og at, i motsetning til dette, de to andre systemene tenderer til å bruke mer forsiktige og mindre overmotiverte uttrykk når det gjelder subjektive innhold.

You Chat var den eneste RAG-rammen som oppnådde null usitterte kilder for et svar, med Perplexity på 8% og Bing Chat på 36%.

Alle modellene viste en “betydelig andel” av ustøttede uttalelser, og papiret erklærer†:

‘RAG-rammen er annonsert for å løse hallusineringen av LLM-er ved å påtvinge at en LLM genererer et svar basert på kilde-dokumenter, men resultater viser at RAG-baserte svar-motorer likevel genererer svar som inneholder en stor andel uttalelser som ikke støttes av de kildene de tilbyr.‘

I tillegg hadde alle de testede systemene vanskeligheter med å støtte sine uttalelser med sitater:

‘You.Com og [Bing Chat] utfører litt bedre enn Perplexity, med omtrent to tredeler av sitatene som peker til en kilde som støtter den siterte uttalelsen, og Perplexity utfører dårligere med mer enn halvparten av sitatene som er uakkurate.

‘Dette resultatet er overraskende: sitat er ikke bare uakkurat for uttalelser som ikke støttes av noen (kilde), men vi finner også at selv når det finnes en kilde som støtter en uttalelse, alle motorer likevel ofte sitater en annen uakkurat kilde, og går glipp av muligheten til å gi korrekt informasjonskilde til brukeren.

‘Med andre ord, hallusinering er ikke bare uttrykt i uttalelser som ikke støttes av kilder, men også i uakkurate sitater som forhindrer brukerne fra å verifisere informasjons-gyldighet.‘

Forfatterne konkluderer:

‘Ingen av svar-motorene oppnår god ytelse på de fleste målinger, og det viser et stort rom for forbedring i svar-motorer.’

 

 

* Min konvertering av forfatternes inline-sitat til lenker. Hvor nødvendig, har jeg valgt den første av flere sitater for lenken, på grunn av formateringspraktiske årsaker.

† Forfatternes betoning, ikke min.

Først publisert mandag, 4. november 2024

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai