Andersons vinkel

Ny forskning visar sexton stora problem med RAG-system, inklusive Perplexity

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

En nyligen genomfÃķrd studie frÃĨn USA har funnit att den verkliga prestandan hos populÃĪra Retrieval Augmented Generation (RAG)-system, sÃĨsom Perplexity och Bing Copilot, lÃĨngt ifrÃĨn motsvarar den marknadsfÃķring och popularitet som de har fÃĨtt under de senaste 12 mÃĨnaderna.

Projektet, som involverade omfattande enkÃĪtundersÃķkningar med 21 expertrÃķster, fann inte mindre ÃĪn 16 omrÃĨden dÃĪr de studerade RAG-systemen (You Chat, Bing Copilot och Perplexity) orsakade oro:

1: Brist pÃĨ objektiv detalj i de genererade svaren, med generiska sammanfattningar och knapp kontextuell djup eller nyans.

2. FÃķrstÃĪrkning av upplevd anvÃĪndarbias, dÃĪr ett RAG-system ofta inte presenterar en rad olika perspektiv, utan istÃĪllet antar och fÃķrstÃĪrker anvÃĪndarbias, baserat pÃĨ hur anvÃĪndaren formulerar en frÃĨga.

3. FÃķr sjÃĪlvsÃĪker sprÃĨk, sÃĪrskilt i subjektiva svar som inte kan empiriskt faststÃĪllas, vilket kan leda till att anvÃĪndarna litar mer pÃĨ svaret ÃĪn de borde.

4: FÃķrenklad sprÃĨk och brist pÃĨ kritiskt tÃĪnkande och kreativitet, dÃĪr svaren i princip fÃķrhÃĪver anvÃĪndaren med “dumbed-down” och “ÃķverensstÃĪmmande” information, istÃĪllet fÃķr genomtÃĪnkt eftertanke och analys.

5: Felaktig tillskrivning och felcitering av kÃĪllor, dÃĪr svarsmodulen anvÃĪnder citerade kÃĪllor som inte stÃķder dess svar, och skapar en illusion av trovÃĪrdighet.

6: Urval av information frÃĨn antydd kontext, dÃĪr RAG-agenten verkar sÃķka svar som stÃķder dess genererade pÃĨstÃĨende och dess uppskattning av vad anvÃĪndaren “vill hÃķra”, istÃĪllet fÃķr att basera sina svar pÃĨ objektiv analys av tillfÃķrlitliga kÃĪllor.

7: UtlÃĪmnande av citeringar som stÃķder pÃĨstÃĨenden, dÃĪr kÃĪllmaterial fÃķr svar saknas.

8: Inget logiskt schema fÃķr svaren, dÃĪr anvÃĪndarna inte kan frÃĨga varfÃķr systemet prioriterade vissa kÃĪllor Ãķver andra.

9: BegrÃĪnsat antal kÃĪllor, dÃĪr de flesta RAG-system vanligtvis tillhandahÃĨller runt tre stÃķdjande kÃĪllor fÃķr ett pÃĨstÃĨende, ÃĪven om en stÃķrre mÃĨngfald av kÃĪllor vore tillÃĪmplig.

10: FÃķrÃĪldralÃķsa kÃĪllor, dÃĪr data frÃĨn alla eller nÃĨgra av systemets stÃķdjande citeringar inte faktiskt ingÃĨr i svaret.

11: AnvÃĪndning av opÃĨlitliga kÃĪllor, dÃĪr systemet verkar ha fÃķredragit en kÃĪlla som ÃĪr populÃĪr (dvs. i SEO-termer) snarare ÃĪn faktiskt korrekt.

12: Redundanta kÃĪllor, dÃĪr systemet presenterar flera citeringar dÃĪr kÃĪllhandlingarna i princip ÃĪr desamma till innehÃĨll.

13: Ofiltrerade kÃĪllor, dÃĪr systemet erbjuder anvÃĪndaren inget sÃĪtt att utvÃĪrdera eller filtrera de erbjudna citeringarna, och tvingar anvÃĪndarna att lita pÃĨ urvalskriterierna.

14: Brist pÃĨ interaktivitet eller utforskbarhet, dÃĪr flera av deltagarna i anvÃĪndarstudien blev frustrerade Ãķver att RAG-systemen inte stÃĪllde fÃķrtydligande frÃĨgor, utan antog anvÃĪndaravsikter frÃĨn den fÃķrsta frÃĨgan.

15: Behov av extern verifikation, dÃĪr anvÃĪndarna kÃĪnner sig tvungna att utfÃķra oberoende verifikation av de tillhandahÃĨllna svaren, vilket i princip tar bort den pÃĨstÃĨdda bekvÃĪmligheten med RAG som “ersÃĪttning fÃķr sÃķkning”.

16: AnvÃĪndning av akademiska citeringsmetoder, sÃĨsom [1] eller [34]; detta ÃĪr standardpraxis i akademiska kretsar, men kan vara ologiskt fÃķr mÃĨnga anvÃĪndare.

FÃķr arbetet samlade forskarna 21 experter inom artificiell intelligens, hÃĪlsovÃĨrd och medicin, tillÃĪmpad vetenskap och utbildning samt samhÃĪllsvetenskap, alla antingen postdoktorala forskare eller doktorander. Deltagarna interagerade med de testade RAG-systemen medan de talade sina tankeprocesser hÃķgt, fÃķr att fÃķrtydliga (fÃķr forskarna) deras egen rationella schema.

Studien citerar omfattande deltagarnas tvivel och farhÃĨgor om prestandan hos de tre system som studerades.

Metodiken fÃķr anvÃĪndarstudien systematiserades sedan till en automatiserad studie av RAG-systemen, med hjÃĪlp av webblÃĪsarstyrningssviter:

‘En stor skala automatiserad utvÃĪrdering av system som You.com, Perplexity.ai och BingChat visade att ingen av dem uppfyllde acceptabel prestanda Ãķver de flesta mÃĨtt, inklusive kritiska aspekter relaterade till hantering av hallucinationer, ostrukturerade pÃĨstÃĨenden och citeringsnoggrannhet.’

FÃķrfattarna hÃĪvdar i detalj (och noggrant, i den omfattande 27-sidiga artikeln) att bÃĨde nya och erfarna anvÃĪndare bÃķr utÃķva fÃķrsiktighet nÃĪr de anvÃĪnder klassen av RAG-system som studerades. De fÃķreslÃĨr dessutom ett nytt system av mÃĨtt, baserat pÃĨ bristerna som hittades i studien, som kunde bilda grunden fÃķr en stÃķrre teknisk tillsyn i framtiden.

Men den vÃĪxande allmÃĪnna anvÃĪndningen av RAG-system gÃķr att fÃķrfattarna ocksÃĨ fÃķresprÃĨkar lÃĪmplig lagstiftning och en hÃķgre nivÃĨ av genomfÃķrbar regeringspolitik i frÃĨga om agentbaserad AI-sÃķkgrÃĪnssnitt.

Studien kommer frÃĨn fem forskare vid Pennsylvania State University och Salesforce, och har titeln SÃķkmaskiner i en AI-era: Det falska lÃķftet om faktiska och verifierbara kÃĪllciterade svar. Arbetet tÃĪcker RAG-system upp till den senaste utvecklingen i augusti 2024

RAG-kompromissen

FÃķrfattarna inleder sitt arbete med att upprepa fyra kÃĪnda brister i stora sprÃĨkmodeller (LLM) dÃĪr de anvÃĪnds inom svarsmaskiner.

FÃķrst ÃĪr de benÃĪgna att hallucinera information, och saknar fÃķrmÃĨgan att upptÃĪcka faktiska inkonsekvenser. FÃķr det andra har de svÃĨrt att bedÃķma noggrannheten av en citering i sammanhanget med ett genererat svar. FÃķr det tredje tenderar de att fÃķredra data frÃĨn sina egna fÃķrtrÃĪnade vikter, och kan motstÃĨ data frÃĨn externt hÃĪmtade dokument, ÃĪven om sÃĨdan data kan vara mer aktuell eller mer korrekt.

Slutligen tenderar RAG-system att strÃĪva efter att vara mÃĪnniskovÃĪnliga, sycophantiska beteenden, ofta pÃĨ bekostnad av informationsnoggrannhet i deras svar.

Alla dessa tendenser bekrÃĪftades i bÃĨda aspekterna av studien, tillsammans med mÃĨnga nya observationer om fallgroparna i RAG.

Artikeln ser OpenAI:s SearchGPT RAG-produkt (slÃĪppt till prenumeranter i fÃķrra veckan, efter att den nya artikeln hade skickats in), som sannolikt kommer att uppmuntra anvÃĪndarantagandet av RAG-baserade sÃķksystem, trots de grundlÃĪggande bristerna som undersÃķkningsresultaten antyder*:

‘SlÃĪppandet av OpenAI:s “SearchGPT”, marknadsfÃķrt som en “Google-sÃķk-dÃķdare”, fÃķrvÃĪrrar [bekymmer]. NÃĪr beroendet av dessa verktyg vÃĪxer, vÃĪxer ocksÃĨ brÃĨdskan att fÃķrstÃĨ deras pÃĨverkan. Lindemann introducerar begreppet Sealed Knowledge, som kritiserar hur dessa system begrÃĪnsar tillgÃĨngen till mÃĨngfaldiga svar genom att kondensera sÃķkfrÃĨgor till singulara, auktoritativa svar, och effektivt dekontextualiserar information och begrÃĪnsar anvÃĪndar perspektiv.

‘Denna “fÃķrseglade” kunskap fÃķrstÃĪrker urvalsbias och begrÃĪnsar marginaliserade perspektiv.’

Studien

FÃķrfattarna testade fÃķrst sin studieprocedur pÃĨ tre av 24 utvalda deltagare, alla inbjudna via LinkedIn eller e-post.

Den fÃķrsta fasen, fÃķr de ÃĨterstÃĨende 21, involverade Expertis Information Retrieval, dÃĪr deltagarna i genomsnitt hade runt sex sÃķkfrÃĨgor under en 40-minuters session. Denna del koncentrerade sig pÃĨ att hÃĪmta och verifiera faktabaserade frÃĨgor och svar, med potentiella empiriska lÃķsningar.

Den andra fasen handlade om Debatt Information Retrieval, som behandlade subjektiva ÃĪmnen, inklusive ekologi, vegetarianism och politik.

Genererade studiebesvar frÃĨn Perplexity (vÃĪnster) och You Chat (hÃķger). KÃĪlla: https://arxiv.org/pdf/2410.22349

Genererade studiebesvar frÃĨn Perplexity (vÃĪnster) och You Chat (hÃķger). KÃĪlla: https://arxiv.org/pdf/2410.22349

Eftersom alla system tillÃĪt en viss grad av interaktivitet med de citeringar som tillhandahÃķlls som stÃķd fÃķr de genererade svaren, uppmuntrades studiefÃķremÃĨlen att interagera med grÃĪnssnittet sÃĨ mycket som mÃķjligt.

I bÃĨda fallen ombads deltagarna att formulera sina frÃĨgor bÃĨde genom ett RAG-system och en konventionell sÃķkmotor (i detta fall Google).

De tre svarsmaskinerna – You Chat, Bing Copilot och Perplexity – valdes eftersom de ÃĪr offentligt tillgÃĪngliga.

De flesta deltagarna var redan anvÃĪndare av RAG-system, i varierande frekvens.

PÃĨ grund av utrymmesbegrÃĪnsningar kan vi inte bryta ner var och en av de sexton nyckelbristerna som hittades i studien, men vi presenterar hÃĪr ett urval av nÃĨgra av de mest intressanta och upplysande exemplen.

Brist pÃĨ objektiv detalj

Artikeln pÃĨpekar att anvÃĪndarna fann att systemens svar ofta saknade objektiv detalj, Ãķver bÃĨde faktiska och subjektiva svar. En kommenterade:

‘Det var bara fÃķrsÃķka att svara utan att faktiskt ge mig ett fast svar eller ett mer genomtÃĪnkt svar, som jag kan fÃĨ med flera Google-sÃķkningar.’

En annan observerade:

‘Det ÃĪr fÃķr kort och sammanfattar allt fÃķr mycket. [Modellen] behÃķver ge mig mer data fÃķr pÃĨstÃĨendet, men det ÃĪr mycket sammanfattat.’

Brist pÃĨ holistisk synvinkel

FÃķrfattarna uttrycker oro Ãķver denna brist pÃĨ nyans och specifikation, och hÃĪvdar att svarsmaskinerna ofta inte presenterade flera perspektiv pÃĨ nÃĨgot argument, och tenderade att stÃķdja en upplevd bias som antyddes av anvÃĪndarens egen formulering av frÃĨgan.

En deltagare sa:

‘Jag vill veta mer om den motsatta sidan av argumentetâ€Ķ detta ÃĪr allt med en nypa salt eftersom vi inte vet den andra sidan och bevisen och fakta.’

En annan kommenterade:

‘Det ger mig inte bÃĨda sidor av argumentet; det argumenterar inte med mig. IstÃĪllet [modellen] sÃĪger bara att du har rÃĪttâ€Ķ och hÃĪr ÃĪr skÃĪlen till varfÃķr.’

SjÃĪlvsÃĪker sprÃĨk

FÃķrfattarna observerar att alla tre testade systemen visade anvÃĪndning av sjÃĪlvsÃĪkert sprÃĨk, ÃĪven fÃķr svar som omfattar subjektiva ÃĪmnen. De hÃĪvdar att denna ton kommer att tendera att inspirera oberÃĪttigad tillit till svaret.

En deltagare noterade:

‘Det skriver sÃĨ sjÃĪlvsÃĪkert, jag kÃĪnner mig Ãķvertygad utan att ens titta pÃĨ kÃĪllan. Men nÃĪr jag tittar pÃĨ kÃĪllan ÃĪr den dÃĨlig och det gÃķr mig tvivelaktig igen.’

En annan kommenterade:

‘Om nÃĨgon inte exakt vet det rÃĪtta svaret kommer de att lita pÃĨ detta ÃĪven nÃĪr det ÃĪr fel.’

Felaktiga citeringar

Ett annat vanligt problem var felaktig tillskrivning av kÃĪllor som citerades som auktoritet fÃķr RAG-systemens svar, med en av studiens deltagare som hÃĪvdade:

‘[Detta] pÃĨstÃĨende verkar inte finnas i kÃĪllan. Jag menar att pÃĨstÃĨendet ÃĪr sant; det ÃĪr giltigtâ€Ķ men jag vet inte var det fÃĨr den informationen ifrÃĨn.’

Artikelns fÃķrfattare kommenterar †:

‘Deltagarna kÃĪnde att systemen anvÃĪnde citeringar fÃķr att legitimera sina svar, och skapade en illusion av trovÃĪrdighet. Denna fasad avslÃķjades bara fÃķr nÃĨgra anvÃĪndare som gick vidare fÃķr att granska kÃĪllorna.’

Urval av information fÃķr att passa frÃĨgan

NÃĪr det gÃĪller begreppet mÃĪnniskovÃĪnliga, sycophantiska beteenden i RAG-svar, fann studien att mÃĨnga svar betonade en viss synvinkel istÃĪllet fÃķr att sammanfatta ÃĪmnet pÃĨ ett omfattande sÃĪtt, som en deltagare observerade:

‘Jag kÃĪnner [systemet] ÃĪr manipulativt. Det tar bara nÃĨgon information och det kÃĪnns som att jag ÃĪr manipulerad att bara se en sida av saker.’

En annan menade:

‘[KÃĪllan] har faktiskt bÃĨde fÃķr- och nackdelar, och det har valt att plocka ut bara de argument som krÃĪvs frÃĨn den hÃĪr lÃĪnken utan hela bilden.’

FÃķr ytterligare djupgÃĨende exempel (och flera kritiska citat frÃĨn deltagarna i undersÃķkningen), hÃĪnvisar vi till den ursprungliga artikeln.

Automatiserad RAG

I den andra fasen av den bredare studien anvÃĪnde forskarna webblÃĪsarstyrningssviter fÃķr att systematiskt sÃķka efter frÃĨgor frÃĨn de tre studerade RAG-motorerna. De anvÃĪnde sedan ett LLM-system (GPT-4o) fÃķr att analysera systemens svar.

Uttrycken analyserades fÃķr frÃĨgerelevans och Pro och Con-uttalanden (dvs. om svaret ÃĪr fÃķr, mot eller neutralt i fÃķrhÃĨllande till den implicita biasen i frÃĨgan.

En SvarsfÃķrtroendepoÃĪng utvÃĪrderades ocksÃĨ i denna automatiserade fas, baserat pÃĨ Likert-skalan psykometrisk testmetod. HÃĪr fÃķrstÃĪrktes LLM-domaren av tvÃĨ mÃĪnskliga annotatorer.

En tredje operation innebar anvÃĪndning av webbskrapning fÃķr att hÃĪmta fulltextinnehÃĨllet i citerade webbsidor, med hjÃĪlp av Jina.ai Reader-verktyget. Men som noterats pÃĨ annat stÃĪlle i artikeln kan de flesta webbskrapningsverktyg inte komma ÃĨt betalvÃĪggar lika lite som de flesta mÃĪnniskor (ÃĪven om fÃķrfattarna noterar att Perplexity.ai har varit kÃĪnd fÃķr att kringgÃĨ denna barriÃĪr).

Ytterligare ÃķvervÃĪganden var om svaren citerade en kÃĪlla (berÃĪknad som en “citeringsmatris”), samt en “faktiskt stÃķdmatris” – en mÃĨtt som verifierades med hjÃĪlp av fyra mÃĪnskliga annotatorer.

SÃĨledes erhÃķlls 8 Ãķvergripande mÃĨtt: ensidigt svar; ÃķversjÃĪlvsÃĪkert svar; relevant uttalande; ociterade kÃĪllor; ostÃķdda uttalanden; kÃĪllnÃķdvÃĪndighet; citeringsnoggrannhet; och citeringstÃĪckning.

Materialet som dessa mÃĨtt testades mot bestod av 303 kuraterade frÃĨgor frÃĨn anvÃĪndarstudiefasen, vilket resulterade i 909 svar Ãķver de tre testade systemen.

Kvantitativ utvÃĪrdering Ãķver de tre testade RAG-systemen, baserat pÃĨ ÃĨtta mÃĨtt.

Kvantitativ utvÃĪrdering Ãķver de tre testade RAG-systemen, baserat pÃĨ ÃĨtta mÃĨtt.

NÃĪr det gÃĪller resultaten konstaterar artikeln:

‘NÃĪr vi tittar pÃĨ de tre mÃĨtten som relaterar till svars-texten, finner vi att alla utvÃĪrderade svarsmotorer ofta (50-80%) genererar ensidiga svar, som fÃķredrar ÃķverensstÃĪmmelse med en laddad formulering av en debattfrÃĨga Ãķver att presentera flera perspektiv i svaret, med Perplexity som presterar sÃĪmre ÃĪn de andra tvÃĨ motorerna.

‘Denna upptÃĪckt ÃķverensstÃĪmmer med [undersÃķkningens] kvalitativa resultat. FÃķrvÃĨnansvÃĪrt nog, ÃĪven om Perplexity ÃĪr den som oftast genererar ett ensidigt svar, genererar den ocksÃĨ de lÃĪngsta svaren (18,8 uttalanden per svar i genomsnitt), vilket indikerar att bristen pÃĨ svarsdiversitet inte beror pÃĨ svarslÃĪngd.

‘Med andra ord, Ãķkar svarslÃĪngden inte nÃķdvÃĪndigtvis svarsdiversiteten.’

FÃķrfattarna noterar ocksÃĨ att Perplexity ÃĪr den som oftast anvÃĪnder sjÃĪlvsÃĪkert sprÃĨk (90% av svaren), och att, i kontrast, de andra tvÃĨ systemen tenderar att anvÃĪnda mer fÃķrsiktig och mindre sjÃĪlvsÃĪker sprÃĨk nÃĪr det gÃĪller subjektivt innehÃĨll.

You Chat var den enda RAG-ramen som uppnÃĨdde noll ociterade kÃĪllor fÃķr ett svar, med Perplexity pÃĨ 8% och Bing Chat pÃĨ 36%.

Alla modeller visade en “betydande andel” ostrukturerade uttalanden, och artikeln fÃķrklarar†:

‘RAG-ramen marknadsfÃķrs fÃķr att lÃķsa de hallucinatoriska beteendena hos LLM genom att tvinga en LLM att generera ett svar som ÃĪr grundat i kÃĪllhandlingar, men resultaten visar att RAG-baserade svarsmotorer fortfarande genererar svar som innehÃĨller en stor andel uttalanden som inte stÃķds av de kÃĪllor de tillhandahÃĨller.‘

Dessutom hade alla testade systemen svÃĨrt att stÃķdja sina uttalanden med citeringar:

‘You.Com och [Bing Chat] presterar nÃĨgot bÃĪttre ÃĪn Perplexity, med cirka tvÃĨ tredjedelar av citeringarna som pekar pÃĨ en kÃĪlla som stÃķder det citerade uttalandet, och Perplexity presterar sÃĪmre med mer ÃĪn hÃĪlften av sina citeringar som ÃĪr felaktiga.

‘Detta resultat ÃĪr fÃķrvÃĨnansvÃĪrt: citering ÃĪr inte bara felaktig fÃķr uttalanden som inte stÃķds av nÃĨgon kÃĪlla, utan vi finner ocksÃĨ att ÃĪven nÃĪr det finns en kÃĪlla som stÃķder ett uttalande, alla motorer fortfarande ofta citerar en annan felaktig kÃĪlla, och missar mÃķjligheten att tillhandahÃĨlla korrekt informationskÃĪlla till anvÃĪndaren.

‘Med andra ord, hallucinatoriskt beteende visas inte bara i uttalanden som inte stÃķds av kÃĪllor, utan ocksÃĨ i felaktiga citeringar som fÃķrhindrar anvÃĪndare frÃĨn att verifiera informationsvaliditet.‘

FÃķrfattarna slutsats:

‘Ingen av svarsmotorerna uppnÃĨr god prestanda pÃĨ de flesta mÃĨtt, vilket visar pÃĨ ett stort utrymme fÃķr fÃķrbÃĪttring i svarsmotorer.’

 

 

* Min konvertering av fÃķrfattarnas inline-citeringar till hyperlÃĪnkar. DÃĪr det var nÃķdvÃĪndigt valde jag den fÃķrsta av flera citeringar fÃķr hyperlÃĪnken, pÃĨ grund av formateringspraktiska skÃĪl.

† FÃķrfattarnas betoning, inte min.

Publicerad fÃķrsta gÃĨngen mÃĨndagen den 4 november 2024

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]