AI-modeller och plattformar
Ny forskning visar sexton stora problem med RAG-system, inklusive Perplexity

En nyligen genomförd studie från USA har funnit att den verkliga prestandan hos populära Retrieval Augmented Generation (RAG)-system, såsom Perplexity och Bing Copilot, långt ifrån motsvarar den marknadsföring och popularitet som de har fått under de senaste 12 månaderna.
Projektet, som involverade omfattande enkätundersökningar med 21 expertröster, fann inte mindre än 16 områden där de studerade RAG-systemen (You Chat, Bing Copilot och Perplexity) orsakade oro:
1: Brist på objektiv detalj i de genererade svaren, med generiska sammanfattningar och knapp kontextuell djup eller nyans.
2. Förstärkning av upplevd användarbias, där ett RAG-system ofta inte presenterar en rad olika perspektiv, utan istället antar och förstärker användarbias, baserat på hur användaren formulerar en fråga.
3. För självsäker språk, särskilt i subjektiva svar som inte kan empiriskt fastställas, vilket kan leda till att användarna litar mer på svaret än de borde.
4: Förenklad språk och brist på kritiskt tänkande och kreativitet, där svaren i princip förhäver användaren med “dumbed-down” och “överensstämmande” information, istället för genomtänkt eftertanke och analys.
5: Felaktig tillskrivning och felcitering av källor, där svarsmodulen använder citerade källor som inte stöder dess svar, och skapar en illusion av trovärdighet.
6: Urval av information från antydd kontext, där RAG-agenten verkar söka svar som stöder dess genererade påstående och dess uppskattning av vad användaren “vill höra”, istället för att basera sina svar på objektiv analys av tillförlitliga källor.
7: Utlämnande av citeringar som stöder påståenden, där källmaterial för svar saknas.
8: Inget logiskt schema för svaren, där användarna inte kan fråga varför systemet prioriterade vissa källor över andra.
9: Begränsat antal källor, där de flesta RAG-system vanligtvis tillhandahåller runt tre stödjande källor för ett påstående, även om en större mångfald av källor vore tillämplig.
10: Föräldralösa källor, där data från alla eller några av systemets stödjande citeringar inte faktiskt ingår i svaret.
11: Användning av opålitliga källor, där systemet verkar ha föredragit en källa som är populär (dvs. i SEO-termer) snarare än faktiskt korrekt.
12: Redundanta källor, där systemet presenterar flera citeringar där källhandlingarna i princip är desamma till innehåll.
13: Ofiltrerade källor, där systemet erbjuder användaren inget sätt att utvärdera eller filtrera de erbjudna citeringarna, och tvingar användarna att lita på urvalskriterierna.
14: Brist på interaktivitet eller utforskbarhet, där flera av deltagarna i användarstudien blev frustrerade över att RAG-systemen inte ställde förtydligande frågor, utan antog användaravsikter från den första frågan.
15: Behov av extern verifikation, där användarna känner sig tvungna att utföra oberoende verifikation av de tillhandahållna svaren, vilket i princip tar bort den påstådda bekvämligheten med RAG som “ersättning för sökning”.
16: Användning av akademiska citeringsmetoder, såsom [1] eller [34]; detta är standardpraxis i akademiska kretsar, men kan vara ologiskt för många användare.
För arbetet samlade forskarna 21 experter inom artificiell intelligens, hälsovård och medicin, tillämpad vetenskap och utbildning samt samhällsvetenskap, alla antingen postdoktorala forskare eller doktorander. Deltagarna interagerade med de testade RAG-systemen medan de talade sina tankeprocesser högt, för att förtydliga (för forskarna) deras egen rationella schema.
Studien citerar omfattande deltagarnas tvivel och farhågor om prestandan hos de tre system som studerades.
Metodiken för användarstudien systematiserades sedan till en automatiserad studie av RAG-systemen, med hjälp av webbläsarstyrningssviter:
‘En stor skala automatiserad utvärdering av system som You.com, Perplexity.ai och BingChat visade att ingen av dem uppfyllde acceptabel prestanda över de flesta mått, inklusive kritiska aspekter relaterade till hantering av hallucinationer, ostrukturerade påståenden och citeringsnoggrannhet.’
Författarna hävdar i detalj (och noggrant, i den omfattande 27-sidiga artikeln) att både nya och erfarna användare bör utöva försiktighet när de använder klassen av RAG-system som studerades. De föreslår dessutom ett nytt system av mått, baserat på bristerna som hittades i studien, som kunde bilda grunden för en större teknisk tillsyn i framtiden.
Men den växande allmänna användningen av RAG-system gör att författarna också förespråkar lämplig lagstiftning och en högre nivå av genomförbar regeringspolitik i fråga om agentbaserad AI-sökgränssnitt.
Studien kommer från fem forskare vid Pennsylvania State University och Salesforce (CRM ), och har titeln Sökmaskiner i en AI-era: Det falska löftet om faktiska och verifierbara källciterade svar. Arbetet täcker RAG-system upp till den senaste utvecklingen i augusti 2024
RAG-kompromissen
Författarna inleder sitt arbete med att upprepa fyra kända brister i stora språkmodeller (LLM) där de används inom svarsmaskiner.
Först är de benägna att hallucinera information, och saknar förmågan att upptäcka faktiska inkonsekvenser. För det andra har de svårt att bedöma noggrannheten av en citering i sammanhanget med ett genererat svar. För det tredje tenderar de att föredra data från sina egna förtränade vikter, och kan motstå data från externt hämtade dokument, även om sådan data kan vara mer aktuell eller mer korrekt.
Slutligen tenderar RAG-system att sträva efter att vara människovänliga, sycophantiska beteenden, ofta på bekostnad av informationsnoggrannhet i deras svar.
Alla dessa tendenser bekräftades i båda aspekterna av studien, tillsammans med många nya observationer om fallgroparna i RAG.
Artikeln ser OpenAI:s SearchGPT RAG-produkt (släppt till prenumeranter i förra veckan, efter att den nya artikeln hade skickats in), som sannolikt kommer att uppmuntra användarantagandet av RAG-baserade söksystem, trots de grundläggande bristerna som undersökningsresultaten antyder*:
‘Släppandet av OpenAI:s “SearchGPT”, marknadsfört som en “Google-sök-dödare”, förvärrar [bekymmer]. När beroendet av dessa verktyg växer, växer också brådskan att förstå deras påverkan. Lindemann introducerar begreppet Sealed Knowledge, som kritiserar hur dessa system begränsar tillgången till mångfaldiga svar genom att kondensera sökfrågor till singulara, auktoritativa svar, och effektivt dekontextualiserar information och begränsar användar perspektiv.
‘Denna “förseglade” kunskap förstärker urvalsbias och begränsar marginaliserade perspektiv.’
Studien
Författarna testade först sin studieprocedur på tre av 24 utvalda deltagare, alla inbjudna via LinkedIn eller e-post.
Den första fasen, för de återstående 21, involverade Expertis Information Retrieval, där deltagarna i genomsnitt hade runt sex sökfrågor under en 40-minuters session. Denna del koncentrerade sig på att hämta och verifiera faktabaserade frågor och svar, med potentiella empiriska lösningar.
Den andra fasen handlade om Debatt Information Retrieval, som behandlade subjektiva ämnen, inklusive ekologi, vegetarianism och politik.

Genererade studiebesvar från Perplexity (vänster) och You Chat (höger). Källa: https://arxiv.org/pdf/2410.22349
Eftersom alla system tillät en viss grad av interaktivitet med de citeringar som tillhandahölls som stöd för de genererade svaren, uppmuntrades studieföremålen att interagera med gränssnittet så mycket som möjligt.
I båda fallen ombads deltagarna att formulera sina frågor både genom ett RAG-system och en konventionell sökmotor (i detta fall Google).
De tre svarsmaskinerna – You Chat, Bing Copilot och Perplexity – valdes eftersom de är offentligt tillgängliga.
De flesta deltagarna var redan användare av RAG-system, i varierande frekvens.
På grund av utrymmesbegränsningar kan vi inte bryta ner var och en av de sexton nyckelbristerna som hittades i studien, men vi presenterar här ett urval av några av de mest intressanta och upplysande exemplen.
Brist på objektiv detalj
Artikeln påpekar att användarna fann att systemens svar ofta saknade objektiv detalj, över både faktiska och subjektiva svar. En kommenterade:
‘Det var bara försöka att svara utan att faktiskt ge mig ett fast svar eller ett mer genomtänkt svar, som jag kan få med flera Google-sökningar.’
En annan observerade:
‘Det är för kort och sammanfattar allt för mycket. [Modellen] behöver ge mig mer data för påståendet, men det är mycket sammanfattat.’
Brist på holistisk synvinkel
Författarna uttrycker oro över denna brist på nyans och specifikation, och hävdar att svarsmaskinerna ofta inte presenterade flera perspektiv på något argument, och tenderade att stödja en upplevd bias som antyddes av användarens egen formulering av frågan.
En deltagare sa:
‘Jag vill veta mer om den motsatta sidan av argumentet… detta är allt med en nypa salt eftersom vi inte vet den andra sidan och bevisen och fakta.’
En annan kommenterade:
‘Det ger mig inte båda sidor av argumentet; det argumenterar inte med mig. Istället [modellen] säger bara att du har rätt… och här är skälen till varför.’
Självsäker språk
Författarna observerar att alla tre testade systemen visade användning av självsäkert språk, även för svar som omfattar subjektiva ämnen. De hävdar att denna ton kommer att tendera att inspirera oberättigad tillit till svaret.
En deltagare noterade:
‘Det skriver så självsäkert, jag känner mig övertygad utan att ens titta på källan. Men när jag tittar på källan är den dålig och det gör mig tvivelaktig igen.’
En annan kommenterade:
‘Om någon inte exakt vet det rätta svaret kommer de att lita på detta även när det är fel.’
Felaktiga citeringar
Ett annat vanligt problem var felaktig tillskrivning av källor som citerades som auktoritet för RAG-systemens svar, med en av studiens deltagare som hävdade:
‘[Detta] påstående verkar inte finnas i källan. Jag menar att påståendet är sant; det är giltigt… men jag vet inte var det får den informationen ifrån.’
Artikelns författare kommenterar †:
‘Deltagarna kände att systemen använde citeringar för att legitimera sina svar, och skapade en illusion av trovärdighet. Denna fasad avslöjades bara för några användare som gick vidare för att granska källorna.’
Urval av information för att passa frågan
När det gäller begreppet människovänliga, sycophantiska beteenden i RAG-svar, fann studien att många svar betonade en viss synvinkel istället för att sammanfatta ämnet på ett omfattande sätt, som en deltagare observerade:
‘Jag känner [systemet] är manipulativt. Det tar bara någon information och det känns som att jag är manipulerad att bara se en sida av saker.’
En annan menade:
‘[Källan] har faktiskt både för- och nackdelar, och det har valt att plocka ut bara de argument som krävs från den här länken utan hela bilden.’
För ytterligare djupgående exempel (och flera kritiska citat från deltagarna i undersökningen), hänvisar vi till den ursprungliga artikeln.
Automatiserad RAG
I den andra fasen av den bredare studien använde forskarna webbläsarstyrningssviter för att systematiskt söka efter frågor från de tre studerade RAG-motorerna. De använde sedan ett LLM-system (GPT-4o) för att analysera systemens svar.
Uttrycken analyserades för frågerelevans och Pro och Con-uttalanden (dvs. om svaret är för, mot eller neutralt i förhållande till den implicita biasen i frågan.
En Svarsförtroendepoäng utvärderades också i denna automatiserade fas, baserat på Likert-skalan psykometrisk testmetod. Här förstärktes LLM-domaren av två mänskliga annotatorer.
En tredje operation innebar användning av webbskrapning för att hämta fulltextinnehållet i citerade webbsidor, med hjälp av Jina.ai Reader-verktyget. Men som noterats på annat ställe i artikeln kan de flesta webbskrapningsverktyg inte komma åt betalväggar lika lite som de flesta människor (även om författarna noterar att Perplexity.ai har varit känd för att kringgå denna barriär).
Ytterligare överväganden var om svaren citerade en källa (beräknad som en “citeringsmatris”), samt en “faktiskt stödmatris” – en mått som verifierades med hjälp av fyra mänskliga annotatorer.
Således erhölls 8 övergripande mått: ensidigt svar; översjälvsäkert svar; relevant uttalande; ociterade källor; ostödda uttalanden; källnödvändighet; citeringsnoggrannhet; och citeringstäckning.
Materialet som dessa mått testades mot bestod av 303 kuraterade frågor från användarstudiefasen, vilket resulterade i 909 svar över de tre testade systemen.

Kvantitativ utvärdering över de tre testade RAG-systemen, baserat på åtta mått.
När det gäller resultaten konstaterar artikeln:
‘När vi tittar på de tre måtten som relaterar till svars-texten, finner vi att alla utvärderade svarsmotorer ofta (50-80%) genererar ensidiga svar, som föredrar överensstämmelse med en laddad formulering av en debattfråga över att presentera flera perspektiv i svaret, med Perplexity som presterar sämre än de andra två motorerna.
‘Denna upptäckt överensstämmer med [undersökningens] kvalitativa resultat. Förvånansvärt nog, även om Perplexity är den som oftast genererar ett ensidigt svar, genererar den också de längsta svaren (18,8 uttalanden per svar i genomsnitt), vilket indikerar att bristen på svarsdiversitet inte beror på svarslängd.
‘Med andra ord, ökar svarslängden inte nödvändigtvis svarsdiversiteten.’
Författarna noterar också att Perplexity är den som oftast använder självsäkert språk (90% av svaren), och att, i kontrast, de andra två systemen tenderar att använda mer försiktig och mindre självsäker språk när det gäller subjektivt innehåll.
You Chat var den enda RAG-ramen som uppnådde noll ociterade källor för ett svar, med Perplexity på 8% och Bing Chat på 36%.
Alla modeller visade en “betydande andel” ostrukturerade uttalanden, och artikeln förklarar†:
‘RAG-ramen marknadsförs för att lösa de hallucinatoriska beteendena hos LLM genom att tvinga en LLM att generera ett svar som är grundat i källhandlingar, men resultaten visar att RAG-baserade svarsmotorer fortfarande genererar svar som innehåller en stor andel uttalanden som inte stöds av de källor de tillhandahåller.‘
Dessutom hade alla testade systemen svårt att stödja sina uttalanden med citeringar:
‘You.Com och [Bing Chat] presterar något bättre än Perplexity, med cirka två tredjedelar av citeringarna som pekar på en källa som stöder det citerade uttalandet, och Perplexity presterar sämre med mer än hälften av sina citeringar som är felaktiga.
‘Detta resultat är förvånansvärt: citering är inte bara felaktig för uttalanden som inte stöds av någon källa, utan vi finner också att även när det finns en källa som stöder ett uttalande, alla motorer fortfarande ofta citerar en annan felaktig källa, och missar möjligheten att tillhandahålla korrekt informationskälla till användaren.
‘Med andra ord, hallucinatoriskt beteende visas inte bara i uttalanden som inte stöds av källor, utan också i felaktiga citeringar som förhindrar användare från att verifiera informationsvaliditet.‘
Författarna slutsats:
‘Ingen av svarsmotorerna uppnår god prestanda på de flesta mått, vilket visar på ett stort utrymme för förbättring i svarsmotorer.’
* Min konvertering av författarnas inline-citeringar till hyperlänkar. Där det var nödvändigt valde jag den första av flera citeringar för hyperlänken, på grund av formateringspraktiska skäl.
† Författarnas betoning, inte min.
Publicerad första gången måndagen den 4 november 2024












