Andersons hoek
Nieuw onderzoek vindt zestien grote problemen met RAG-systemen, waaronder Perplexity

Een recente studie uit de VS heeft ontdekt dat de prestaties van populaire Retrieval Augmented Generation (RAG)-systemen, zoals Perplexity en Bing Copilot, in de praktijk ver achterblijven bij zowel de marketinghype als de populaire adoptie die de afgelopen 12 maanden heeft plaatsgevonden.
Het project, dat een uitgebreide enquête omvatte met 21 expertstemmen, vond niet minder dan 16 gebieden waarin de onderzochte RAG-systemen (You Chat, Bing Copilot en Perplexity) aanleiding gaven tot bezorgdheid:
1: Een gebrek aan objectieve details in de gegenereerde antwoorden, met generieke samenvattingen en weinig contextuele diepte of nuance.
2. Versterking van de waargenomen gebruikersvoorkeur, waarbij een RAG-motor vaak niet in staat is om een reeks standpunten te presenteren, maar in plaats daarvan de gebruikersvoorkeur versterkt op basis van de manier waarop de gebruiker een vraag formuleert.
3. Overmatig zelfverzekerd taalgebruik, met name in subjectieve antwoorden die niet empirisch kunnen worden vastgesteld, wat ertoe kan leiden dat gebruikers het antwoord meer vertrouwen dan het verdient.
4: Eenvoudig taalgebruik en een gebrek aan kritisch denken en creativiteit, waarbij antwoorden de gebruiker patroniseren met “vereenvoudigde” en “overeenstemmende” informatie, in plaats van doordachte overwegingen en analyses.
5: Verkeerde toeschrijving en verkeerde citaten, waarbij de antwoordengine bronnen citeert die de reactie niet ondersteunen, waardoor de illusie van geloofwaardigheid wordt gecreëerd.
6: Cherry-picking van informatie uit de veronderstelde context, waarbij de RAG-agent lijkt te zoeken naar antwoorden die de gegenereerde bewering ondersteunen en de inschatting van wat de gebruiker “wilt horen”, in plaats van antwoorden te baseren op objectieve analyse van betrouwbare bronnen (wat mogelijk een conflict aangeeft tussen de “ingebakken” LLM-gegevens en de gegevens die het systeem op het moment van de vraag van internet haalt).
7: Ontbreken van citaten die uitspraken ondersteunen, waarbij bronmateriaal voor antwoorden ontbreekt.
8: Geen logische schema voor de antwoorden, waarbij gebruikers niet kunnen vragen waarom het systeem bepaalde bronnen boven andere bronnen prioriteert.
9: Beperkt aantal bronnen, waarbij de meeste RAG-systemen doorgaans slechts drie ondersteunende bronnen voor een uitspraak bieden, zelfs waar een grotere diversiteit aan bronnen van toepassing zou zijn.
10: Weesbronnen, waarbij gegevens van alle of sommige van de ondersteunende citaten van het systeem niet daadwerkelijk in het antwoord worden opgenomen.
11: Gebruik van onbetrouwbare bronnen, waarbij het systeem lijkt te hebben gekozen voor een bron die populair is (d.w.z. in SEO-termen) in plaats van feitelijk correct.
12: Overbodige bronnen, waarbij het systeem meerdere citaten presenteert waarin de bronartikelen in wezen hetzelfde zijn in inhoud.
13: Ongefilterde bronnen, waarbij het systeem de gebruiker geen manier biedt om de aangeboden citaten te evalueren of te filteren, waardoor gebruikers genoodzaakt zijn de selectiecriteria te vertrouwen.
14: Gebrek aan interactie of verkenbaarheid, waarbij verschillende van de deelnemers aan de gebruikersstudie gefrustreerd waren dat RAG-systemen geen verduidelijkende vragen stelden, maar in plaats daarvan aannamen dat de gebruiker vanaf de eerste vraag bedoelde.
15: De behoefte aan externe verificatie, waarbij gebruikers zich genoodzaakt voelen om onafhankelijke verificatie van de verstrekte antwoorden uit te voeren, waardoor de vermeende gemakkelijkheid van RAG als “vervanging voor zoekopdrachten” grotendeels wordt tenietgedaan.
16: Gebruik van academische citatiemethoden, zoals [1] of [34]; dit is standaardpraktijk in academische kringen, maar kan voor veel gebruikers onduidelijk zijn.
Voor het onderzoek verzamelden de onderzoekers 21 experts in kunstmatige intelligentie, gezondheidszorg en geneeskunde, toegepaste wetenschappen en onderwijs en sociale wetenschappen, allemaal postdoctorale onderzoekers of PhD-kandidaten. De deelnemers werkten met de geteste RAG-systemen en spraken hun gedachten hardop uit om hun eigen rationele schema te verduidelijken voor de onderzoekers.
Het artikel citeert uitgebreid de twijfels en zorgen van de deelnemers over de prestaties van de drie onderzochte systemen.
De methodologie van de gebruikersstudie werd vervolgens gesystematiseerd in een geautomatiseerde studie van de RAG-systemen, met behulp van browsercontrolesuites:
‘Een grootschalige geautomatiseerde evaluatie van systemen zoals You.com, Perplexity.ai en BingChat toonde aan dat geen van hen een aanvaardbare prestatie behaalde op de meeste metrics, waaronder kritische aspecten met betrekking tot het omgaan met hallucinaties, onondersteunde uitspraken en citatieaccuraatheid.’
De auteurs betogen uitgebreid (en ijverig, in het uitgebreide 27-pagina’s tellende artikel) dat zowel nieuwe als ervaren gebruikers voorzichtig moeten zijn bij het gebruik van de klasse van RAG-systemen die in de studie zijn onderzocht. Zij stellen verder een nieuw systeem van metrics voor, gebaseerd op de tekortkomingen die in de studie zijn gevonden, dat de basis kan vormen voor een grotere technische toezicht in de toekomst.
De groeiende openbare gebruik van RAG-systemen leidt de auteurs ertoe om ook te pleiten voor passende wetgeving en een grotere mate van afdwingbare overheidsbeleid met betrekking tot agent-geassisteerde AI-zoekinterfaces.
De studie komt van vijf onderzoekers van de Pennsylvania State University en Salesforce, en heeft als titel Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited Responses. Het onderzoek behandelt RAG-systemen tot de stand van de techniek in augustus 2024
De RAG-afweging
De auteurs beginnen hun werk met het herhalen van vier bekende tekortkomingen van Large Language Models (LLM’s) waar ze worden gebruikt in antwoordengines.
Ten eerste zijn ze geneigd om informatie te hallucineren en ontbreken de mogelijkheid om feitelijke inconsistenties te detecteren. Ten tweede hebben ze moeite om de nauwkeurigheid van een citatie in de context van een gegenereerd antwoord te beoordelen. Ten derde hebben ze de neiging om gegevens te bevorzitten van hun eigen vooraf getrainde gewichten en kunnen ze weerstand bieden aan gegevens van extern opgehaalde documentatie, zelfs als die gegevens meer recent of meer accuraat zijn.
Ten slotte hebben RAG-systemen de neiging om mensen te pleasen, sycophantisch gedrag, vaak ten koste van de nauwkeurigheid van de informatie in hun antwoorden.
Al deze neigingen werden bevestigd in beide aspecten van de studie, evenals veel nieuwe observaties over de valkuilen van RAG.
Het artikel ziet OpenAI’s SearchGPT RAG-product (uitgebracht aan abonnees in de afgelopen week, na het indienen van het nieuwe artikel) als waarschijnlijk om de gebruikersadoptie van RAG-gebaseerde zoeksystemen te stimuleren, ondanks de fundamentele tekortkomingen die de resultaten van de enquête suggereren*:
‘De release van OpenAI’s ‘SearchGPT’, gepromoot als een ‘Google search killer’, verergert [de zorgen]. Naarmate de afhankelijkheid van deze tools groeit, groeit ook de urgentie om hun impact te begrijpen. Lindemann introduceert het concept van Sealed Knowledge, dat kritiek levert op hoe deze systemen de toegang tot diverse antwoorden beperken door zoekopdrachten samen te voegen tot enkele, gezaghebbende antwoorden, waardoor informatie wordt gedecontextualiseerd en gebruikersperspectieven worden beperkt.
‘Dit “zegelen” van kennis in stand houdt selectievoorkeuren en beperkt gemarginaliseerde standpunten.’
De studie
De auteurs testten eerst hun onderzoeksprocedure op drie van de 24 geselecteerde deelnemers, die werden uitgenodigd via LinkedIn of e-mail.
De eerste fase, voor de overige 21, bestond uit Expertise Information Retrieval, waarbij de deelnemers gemiddeld ongeveer zes zoekopdrachten uitvoerden in een sessie van 40 minuten. Deze sectie concentreerde zich op het verzamelen en verifiëren van feitgebaseerde vragen en antwoorden, met potentieel empirische oplossingen.
De tweede fase had betrekking op Debate Information Retrieval, die zich bezighield met subjectieve kwesties, waaronder ecologie, vegetarisme en politiek.

Gegenereerde studieantwoorden van Perplexity (links) en You Chat (rechts). Bron: https://arxiv.org/pdf/2410.22349
Aangezien alle systemen ten minste enige mate van interactie met de citaten toestonden die als ondersteuning voor de gegenereerde antwoorden werden verstrekt, werden de studieonderwerpen aangemoedigd om zo veel mogelijk met de interface te interageren.
Beide gevallen vroegen de deelnemers om hun vragen te formuleren, zowel via een RAG-systeem als via een conventionele zoekmachine (in dit geval Google).
De drie antwoordengines – You Chat, Bing Copilot en Perplexity – werden gekozen omdat ze openbaar toegankelijk zijn.
De meeste deelnemers waren al gebruikers van RAG-systemen, met variabele frequentie.
Door beperkingen in de ruimte kunnen we niet elk van de uitgebreid gedocumenteerde zestien belangrijke tekortkomingen in de studie uiteenzetten, maar we presenteren een selectie van enkele van de meest interessante en verhelderende voorbeelden.
Gebrek aan objectieve details
Het artikel stelt dat gebruikers de antwoorden van de systemen vaak ontbraken aan objectieve details, zowel in feitelijke als in subjectieve antwoorden. Een deelnemer merkte op:
‘Het was alsof het alleen maar probeerde te antwoorden zonder me een solide antwoord of een meer doordachte antwoord te geven, wat ik wel kan krijgen met meerdere Google-zoekopdrachten.’
Een andere deelnemer merkte op:
‘Het is te kort en samenvat alles te veel. [Het model] moet me meer gegevens voor de claim geven, maar het is erg samengevat.’
Gebrek aan holistisch perspectief
De auteurs uiten hun bezorgdheid over het gebrek aan nuances en specificiteit en stellen dat de antwoordengines vaak niet in staat zijn om meerdere perspectieven op een argument te presenteren, maar in plaats daarvan de waargenomen voorkeur van de gebruiker volgen, afgeleid van de manier waarop de gebruiker de vraag formuleert.
Een deelnemer zei:
‘Ik wil meer te weten komen over de andere kant van het argument… dit is allemaal met een korrel zout, omdat we niet weten wat de andere kant en de bewijzen zijn.’
Een andere deelnemer merkte op:
‘Het geeft je niet beide kanten van het argument; het is niet aan het discussiëren. In plaats daarvan zegt [het model] gewoon dat je gelijk hebt… en hier zijn de redenen waarom.’
Zelfverzekerd taalgebruik
De auteurs merken op dat alle drie de geteste systemen overmatig zelfverzekerd taalgebruik vertoonden, zelfs in antwoorden die subjectieve kwesties betroffen. Zij beweren dat deze toon ertoe zal leiden dat gebruikers ongerechtvaardigd vertrouwen in het antwoord krijgen.
Een deelnemer merkte op:
‘Het schrijft zo zelfverzekerd, ik voel me overtuigd zonder zelfs maar naar de bron te kijken. Maar als je naar de bron kijkt, is het slecht en dat maakt me weer aan het twijfelen.’
Een andere deelnemer merkte op:
‘Als iemand niet precies weet wat het juiste antwoord is, zal hij dit vertrouwen, zelfs als het fout is.’
Onjuiste citaten
Een ander veelvoorkomend probleem was de verkeerde toeschrijving van bronnen die als autoriteit voor de antwoorden van de RAG-systemen werden geciteerd, waarbij een van de deelnemers aan de studie beweerde:
‘[Deze] uitspraak lijkt niet in de bron te staan. Ik bedoel, de uitspraak is waar; het is geldig… maar ik weet niet waar het deze informatie vandaan haalt.’
De auteurs van het artikel merken op †:
‘Deelnemers voelden dat de systemen citaten gebruikten om hun antwoord te legitimeren, waardoor een illusie van geloofwaardigheid werd gecreëerd. Deze façade werd alleen aan een paar gebruikers onthuld die de bronnen verder onderzochten.’
Cherry-picking van informatie om aan de vraag te voldoen
Terugkerend naar het idee van mensen pleasen, sycophantisch gedrag in RAG-antwoorden, vond de studie dat veel antwoorden een bepaald standpunt benadrukten in plaats van het onderwerp samen te vatten, zoals een deelnemer opmerkte:
‘Ik voel dat [het systeem] manipulatief is. Het neemt alleen sommige informatie en het voelt alsof ik word gemanipuleerd om alleen één kant van de dingen te zien.’
Een andere deelnemer merkte op:
‘[De bron] heeft zowel voor- als nadelen, en het heeft alleen de vereiste argumenten uit deze link gekozen zonder het hele plaatje.’
Voor verdere diepgaande voorbeelden (en meerdere kritische citaten van de deelnemers aan de enquête) verwijzen wij de lezer naar het bronartikel.
Geautomatiseerde RAG
In de tweede fase van de bredere studie gebruikten de onderzoekers browser-gebaseerde scripting om systematisch vragen te stellen aan de drie onderzochte RAG-motoren. Zij gebruikten vervolgens een LLM-systeem (GPT-4o) om de antwoorden van de systemen te analyseren.
De uitspraken werden geanalyseerd op vraagrelevantie en Pro vs. Con Statements (d.w.z. of het antwoord voor, tegen of neutraal is ten opzichte van de impliciete voorkeur van de vraag.
Een Antwoordvertrouwensscore werd ook geëvalueerd in deze geautomatiseerde fase, op basis van de Likert-schaal psychometrische testmethode. Hierbij werd de LLM-rechter aangevuld met twee menselijke annotators.
Een derde operatie bestond uit het gebruik van web-scraping om de volledige tekst van de geciteerde webpagina’s te verkrijgen, met behulp van de Jina.ai Reader-tool. Echter, zoals elders in het artikel wordt opgemerkt, kunnen de meeste web-scrapingtools niet meer toegang krijgen tot betaalde sites dan de meeste mensen (hoewel de auteurs opmerken dat Perplexity.ai bekend staat om het omzeilen van deze barrière).
Extra overwegingen waren of de antwoorden een bron citeerden (berekenend als een ‘citatiematrix’), evenals een ‘feitelijke ondersteuningsmatrix’ – een metrisch berekend met behulp van vier menselijke annotators.
Daarom werden 8 overkoepelende metrics verkregen: eenzijdig antwoord; oververzekerd antwoord; relevant statement; ongeciteerde bronnen; ongeondersteunde uitspraken; bronnen noodzakelijkheid; citatieaccuraatheid; en citatiegrondigheid.
Het materiaal waartegen deze metrics werden getest, bestond uit 303 gecurateerde vragen uit de gebruikersstudiefase, resulterend in 909 antwoorden over de drie geteste systemen.

Kwantitatieve evaluatie over de drie geteste RAG-systemen, op basis van acht metrics.
Met betrekking tot de resultaten stelt het artikel:
‘Bij het bekijken van de drie metrics met betrekking tot de antwoordtekst, zien we dat alle beoordeelde antwoordengines vaak (50-80%) eenzijdige antwoorden genereren, waarbij overeenstemming met een geladen formulering van een debatvraag wordt geprefereerd boven het presenteren van meerdere perspectieven in het antwoord, waarbij Perplexity slechter presteert dan de andere twee motoren.
‘Deze bevinding strookt met [de bevindingen] van onze kwalitatieve resultaten. Opvallend is dat, hoewel Perplexity het meest geneigd is om een eenzijdig antwoord te genereren, het ook de langste antwoorden genereert (18,8 uitspraken per antwoord gemiddeld), wat aangeeft dat het gebrek aan antwoorddiversiteit niet te wijten is aan antwoordlengte.
‘Met andere woorden, het verhogen van de antwoordlengte leidt niet noodzakelijkerwijs tot een verbetering van de antwoorddiversiteit.’
De auteurs merken ook op dat Perplexity het meest geneigd is om zelfverzekerd taalgebruik te gebruiken (90% van de antwoorden), en dat, in tegenstelling, de andere twee systemen meer voorzichtige en minder zelfverzekerde taal gebruiken waar het subjectieve inhoud betreft.
You Chat was het enige RAG-raamwerk dat nul ongeciteerde bronnen voor een antwoord bereikte, met Perplexity op 8% en Bing Chat op 36%.
Alle modellen vertoonden een ‘aanzienlijk deel’ van ongeondersteunde uitspraken, en het artikel verklaart†:
‘Het RAG-raamwerk wordt geadverteerd als een oplossing voor het hallucinatoire gedrag van LLM’s door te garanderen dat een LLM een antwoord genereert dat is gebaseerd op brondocumenten, maar de resultaten laten zien dat RAG-gebaseerde antwoordengines nog steeds antwoorden genereren die een groot deel van de uitspraken bevatten die niet worden ondersteund door de bronnen die ze bieden.‘
Bovendien hadden alle geteste systemen moeite om hun uitspraken te ondersteunen met citaten:
‘You.Com en [Bing Chat] presteren iets beter dan Perplexity, met ongeveer twee derde van de citaten die naar een bron verwijzen die de geciteerde uitspraak ondersteunt, en Perplexity presteert slechter met meer dan de helft van de citaten die onjuist zijn.
‘Dit resultaat is verrassend: citatie is niet alleen onjuist voor uitspraken die niet worden ondersteund door enige bron, maar we vinden ook dat, zelfs wanneer er een bron bestaat die de uitspraak ondersteunt, alle motoren nog steeds vaak een andere onjuiste bron citeren, waardoor ze de kans missen om de gebruiker correcte informatiebronnen te bieden.
‘Met andere woorden, hallucinatief gedrag wordt niet alleen getoond in uitspraken die niet worden ondersteund door bronnen, maar ook in onjuiste citaten die gebruikers beletten de geldigheid van de informatie te verifiëren.‘
De auteurs concluderen:
‘Geen van de antwoordengines behaalt een goede prestatie op de meeste metrics, waardoor er een grote ruimte voor verbetering is in antwoordengines.’
* Mijn conversie van de inline citaten van de auteurs naar hyperlinks. Waar nodig heb ik de eerste van meerdere citaten voor de hyperlink gekozen vanwege formatteringspraktijken.
† Auteursbenadrukking, niet de mijne.
Eerst gepubliceerd op maandag 4 november 2024












