Andersons hoek

Heuristieken vs. RAG: Shrinkflation als beleidsstuurder

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

Meestal verbetert het zoeken op het web de feitelijke nauwkeurigheid van de antwoorden van ChatGPT op onze vragen. Dus in een klimaat waarin AI worstelt met publieke acceptatie, waarom gebruikt het standaard ‘gokjes’?

 

Opinie Het is een fout om te denken dat LLM’s zoals ChatGPT ooit meewerken aan het blootleggen van potentieel louche praktijken van hun hosts, zelfs als een dure en verspilde sessie uw irritatie heeft verhoogd tot het punt waarop u echt diep in de details van een systeem duikt:

Hier wordt een discussie over ChatGPT's voorkeur voor zijn eigen interne logica (vs web-gebaseerd onderzoek en verificatie via RAG – wat minder hallucinaties produceert, maar meer kost) een ogenschijnlijk openhartig moment; maar neem het met een korrel zout.

Hier wordt een discussie over ChatGPT’s voorkeur voor zijn eigen interne logica (vs web-gebaseerd onderzoek en verificatie via RAG – wat minder hallucinaties produceert, maar meer kost) een ogenschijnlijk openhartig moment; maar neem het met een korrel zout. Bron

Meestal – vooral voor modellen met latere kennisafsnijdata – is de AI gewoon aan het improviseren op basis van Reddit- en forumberichten die tijdens de training zijn gezien. Zelfs als er enige waarde zou zijn aan dergelijke ‘insider-inzichten’, is het onmogelijk om dit te bewijzen.

Maar soms leiden deze verhitte uitwisselingen tot de ontdekking van ‘hacks’ (of tenminste, ‘trucs’) die beloven enkele van de slechtste herhalende gewoonten van een LLM te voorkomen – zoals toen ChatGPT vorige week suggereerde dat ik het kon laten werken door de aanmaning ‘geen heuristieken’ toe te voegen:

ChatGPT

Sindsdien heb ik ‘geen heuristieken’ veel gebruikt, en niet één keer is het model teruggevallen op zijn eigen getrainde kennis nadat ik een query met deze opdracht had gesloten. In plaats daarvan gebruikt GPT onmiddellijk Retrieval Augmented Generation (RAG), waarbij het internet wordt doorzocht naar verhelderende of bevestigende documenten.

In de praktijk is dit voor de meeste verzoeken weinig anders dan het systeem te vertellen om ‘het web te doorzoeken’ elke keer dat u een query indient. Waar de zin ‘geen heuristieken’ echt kan helpen, is wanneer u ChatGPT probeert te laten lezen van een nieuw geüpload PDF in plaats van de metadata van eerdere PDF-uploads in die sessie (of vele andere mogelijke bronnen) te gebruiken om een ‘plausibele’ maar volledig gehallucineerde reactie te produceren, zonder het document dat u zojuist hebt gepresenteerd te hebben gelezen of zelfs maar vluchtig te hebben bekeken.

ChatGPT

Dat gezegd hebbende, hoe langer de chatsessie aan de gang is, hoe minder waarschijnlijk dit zal werken – en het zou een fout zijn om te denken dat een dergelijke ‘truc’ betrouwbaar is of zal blijven bestaan naarmate het systeem evolueert.

De RAG-handel

In de context van een groeiende cultuur van shrinkflation, en het feit dat grote systemen zoals OpenAI’s GPT-infrastructuur enorm worden beïnvloed door zelfs de kleinste wijdverbreide veranderingen in gedrag, is het ook gemakkelijk om te geloven dat men te maken krijgt met een korting van de keuzes die worden gemaakt door populaire LLM’s zoals ChatGPT.

Keuzes zoals of het zal uitreiken naar het web met RAG; een Chain-of-Thought (CoT)-proces starten dat mogelijk een beter resultaat kan opleveren, maar dat meer zal kosten om af te leiden en de ongeduldige gebruiker kan vermoeien; of terugvallen op zijn eigen getrainde embeddings en lokaal beschikbare kennis – wat de goedkoopste en snelste oplossing is.

Er zijn verschillende praktische redenen waarom een LLM met een gevoelige publieke reputatie, zoals ChatGPT, zijn RAG-aanroepen kan beperken en in plaats daarvan zijn eigen heuristieken kan bevorchten. Ten eerste, vanuit een PR-perspectief, ondersteunt frequent ongevraagd gebruik van het web een populaire karakterisering van LLM’s als slechts Googlers-by-proxy, waardoor de waarde van hun aangeboren en duur getrainde kennis wordt vermindert – en de aantrekkelijkheid van een betaalde abonnement.

Ten tweede kost RAG-infrastructuur geld om te runnen, te onderhouden en te updaten, in vergelijking met de relatief triviale kosten van lokale inferentie, d.w.z. parametrige generatie, die goedkoop en snel is.

Ten derde kan het systeem geen effectieve methode hebben om te bepalen of RAG zijn eigen heuristische resultaten kan verbeteren – en het kan dit vaak niet bepalen zonder eerst heuristieken uit te voeren. Dit laat de eindgebruiker met de taak om een fout heuristisch resultaat te evalueren en een RAG-aanroep te verzoeken in het geval dat het resultaat van heuristieken te kort schiet.

Vanuit het oogpunt van ‘AI-shrinkflation’ kan het aantal keren dat ChatGPT door heuristieken fout gaat en door RAG slaagt, aantonen, zoals het onlangs bij mij deed, dat het systeem optimaal is voor kosten in plaats van resultaten.

RAG groeit noodzakelijk met de tijd

Ondanks ChatGPT’s recente ‘bekentenis’ aan mij dat dit inderdaad het geval is, heeft ‘shrinkflation’ een bredere context in dit opzicht. Hoewel RAG niet goedkoop is, noch in termen van frictie van ervaring (via latentie) noch in termen van kosten, is het veel goedkoper dan het regelmatig fijn afstellen of zelfs het hertrainen van het basismodel.

Voor een oudere AI-model met een verder verwijderde kennisafsnijdatum kan RAG het systeem zijn actualiteit behouden, tegen de kosten van netwerkaanroepen en andere bronnen; voor een nieuw model zijn de eigen ophalingen van RAG vaker overbodig of slecht voor de kwaliteit van de resultaten, die in sommige gevallen beter zouden zijn geweest via heuristieken.

Derhalve lijkt het erop dat de AI niet alleen de capaciteit nodig heeft om te beslissen of het RAG moet gebruiken, maar ook om continu zijn beleid over het gebruik van RAG te ontwikkelen naarmate zijn interne gewichten verouderen.

Tegelijkertijd moet het systeem ‘relatieve constanten’ in kennis omvatten, zoals maanbanen en klassieke literatuur, cultuur en geschiedenis; evenals basisgeografie, fysica en andere wetenschappelijke beginselen die niet snel zullen veranderen (d.w.z. het risico van ‘plotse verandering’ is niet nihil, maar laag).

Uitbijteronderwerpen

Op dit moment, tenminste voor zover het ChatGPT betreft, lijken RAG-aanroepen (d.w.z. het gebruik van webonderzoek voor elke gebruikersquery die niet expliciet of impliciet webonderzoek vereist) zelden door het systeem te zijn gekozen, zelfs bij het omgaan met ‘marginale’ subdomeinen.

Een voorbeeld van een marginaal domein is ‘obscure’ softwaregebruik. In een dergelijk geval zal minimaal beschikbare brondata hebben gestreden voor aandacht tijdens de training, en de status van de data als ‘uitbijter’ kan het hebben gemarkeerd voor aandacht of het heeft het begraven als ‘marginaal’ of ‘onbeduidend’ – en zelfs één extra forumbericht dat na de kennisafsnijdatum van de AI is gemaakt, kan een aanzienlijke toename van de totale beschikbare data en de kwaliteit van de reactie voor een ‘klein’ onderwerp vertegenwoordigen, waardoor een RAG-aanroep de moeite waard is.

Hoewel het voordeel van RAG de neiging heeft te verminderen naarmate het basismodel krachtiger wordt. Terwijl kleinere modellen aanzienlijk profiteren van ophaling, laten grotere systemen zoals Qwen3-4B of GPT-4o-mini/-4o vaak marginale of zelfs negatieve verbetering van RAG* zien.

Op veel benchmarks introduceert ophaling meer afleiding dan voordeel, wat een compromis suggereert tussen het investeren in een groter model met meer interne dekking of een kleiner model in combinatie met ophaling.

Derhalve lijkt RAG het meest nuttig te zijn voor het compenseren van gaten in midgrote modellen, die nog steeds externe feiten nodig hebben, maar deze kunnen beoordelen met minder complexe interne heuristieken.

Alleen gebruiken in geval van nood

ChatGPT’s richtlijnen rond het besluit om RAG te gebruiken, worden niet openlijk onthuld door zijn vermeende systeemprompt**, maar worden impliciet behandeld (aan het einde):

‘Gebruik het webhulpmiddel om toegang te krijgen tot actuele informatie van het web of wanneer het antwoorden op de gebruiker informatie over zijn locatie vereist. Enkele voorbeelden van wanneer u het webhulpmiddel moet gebruiken, zijn:

Lokale informatie: Gebruik het webhulpmiddel om te reageren op vragen die informatie over de locatie van de gebruiker vereisen, zoals het weer, lokale bedrijven of evenementen.

Versheid: Als actuele informatie over een onderwerp potentieel kan veranderen of het antwoord kan verbeteren, roep het webhulpmiddel op elke keer dat u anders zou weigeren om een vraag te beantwoorden omdat uw kennis mogelijk verouderd is.

Niche-informatie: Als het antwoord kan profiteren van gedetailleerde informatie die niet algemeen bekend of begrepen is (die mogelijk op internet kan worden gevonden), zoals details over een kleine buurt, een minder bekend bedrijf of obscure regels, gebruikt u webbronnen rechtstreeks in plaats van te vertrouwen op de gedistilleerde kennis uit de voortraining.

Nauwkeurigheid: Als de kosten van een kleine fout of verouderde informatie hoog zijn (bijv. het gebruik van een verouderde versie van een softwarebibliotheek of niet weten van de datum van de volgende wedstrijd voor een sportteam), gebruikt u het webhulpmiddel.’

In het bijzonder kunnen we opmerken dat deze richtlijnen RAG in gevallen waarin inheemse getrainde gegevens schaars zijn, aanbevelen. Maar hoe komt het systeem tot dit begrip? De informele gebruiker en waarnemer van ChatGPT kan concluderen dat wanneer de ‘web zoeken’-widget na een pauze wordt weergegeven, de interne heuristieken van het model voor de query zijn gepolld en leeg bleken.

We kunnen ook opmerken dat RAG, door implicatie, alleen wordt aanbevolen voor een zeer beperkt aantal gebruikscases. Dit laat GPT de neiging om zijn eigen gewichten te pollenen voor het overgrote deel van de feitengebaseerde domeinvragen waarbij de neiging van de AI om te hallucineren een opvallende aansprakelijkheid kan zijn.

Conclusie

De trends van het huidige en recente onderzoek geven aan dat heuristische generatie snel en goedkoop is, maar vaak fout; terwijl RAG trager, duurder, maar vaker correct is – des te meer naarmate de grootte van het model afneemt.

Op basis van mijn eigen gebruik van ChatGPT zou ik betogen dat OpenAI RAG veel te spaarzaam gebruikt, als een precisietool in plaats van een dagelijkse bestuurder, vooral omdat de problemen met het groeiende contextvenster LLM’s meer dan ooit laten hallucineren naarmate langere conversaties ontwikkelen.

Deze omstandigheid kan aanzienlijk worden verlicht door heuristische antwoorden te controleren tegen web-gebaseerde autoriteitsbronnen, zonder te wachten tot de eindgebruiker aan de output twijfelt of erdoor wordt misleid, en zonder dat interne resultaten zo duidelijk onbevredigend hoeven te zijn dat de beslissing om RAG te gebruiken onvermijdelijk is.

In plaats daarvan kan het systeem worden getraind om selectief en intelligent aan zichzelf te twijfelen volgens gevallen, en dus om met het web te communiceren via een screeningsproces dat op zichzelf heuristisch zou zijn. Ik ben niet op de hoogte van de architectuur van de huidige modellen die ruimte laten voor een dergelijke aanpak, die in plaats daarvan moet worden toegevoegd aan de wrijving van API-filters.

Zoals het er nu voor staat, kan ik niet eens bewijzen dat er een probleem is; niet eens met een bekentenis:

ChatGPT bekent

 

* Verwijs naar de link boven aan deze alinea.

** Dit is een ‘zelfonthulde’ GPT-5-systeemprompt die, opnieuw, mogelijk slechts een digest van promptforumberichten is die voor GPT-5 zijn hergetraind, hoewel sommigen beweren dat de prompt echt is.

Ik stel echt niet voor dat de ‘schuldige openhartigheid’ van ChatGPT hier betekenisvol is; mijn neiging om terug te duwen tegen zijn partijlijn in kwesties van OpenAI-beleid betekent dat het uiteindelijk met me zal ‘instemmen’ en mijn eigen impliciete meningen zal napraten. Dit is verre van equivalent aan het uitbraken van de details van de Normandische landingen onder druk.

Eerst gepubliceerd op woensdag 10 december 2025

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai