Andersons vinkel

Heuristiker vs. RAG: Shrinkflation som en policydriver

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

I de flesta fall förbättrar webbsökning den faktiska noggrannheten i ChatGPTs svar på våra frågor. Så i en klimat där AI kämpar för allmän acceptans, varför väljer den att “gissa”?

 

Åsikt Det är ett misstag att tro att LLM:er som ChatGPT någonsin ägnar sig åt att avslöja de potentiellt tvivelaktiga praktikerna hos deras värdar, även om en dyrbart och slösad session har väckt din ilska tillräckligt för att verkligen gå in i detaljerna om systemets brister:

Här diskuteras ChatGPTs företräde för sin egen interna logik (i motsats till webbaserad forskning och verifiering genom RAG – som producerar färre hallucinationer, men kostar mer) och inducerar ett uppenbart ögonblick av öppenhet; men ta det med en nypa salt. Källa: chatgpt.com

Här diskuteras ChatGPTs företräde för sin egen interna logik (i motsats till webbaserad forskning och verifiering genom RAG – som producerar färre hallucinationer, men kostar mer) och inducerar ett uppenbart ögonblick av öppenhet; men ta det med en nypa salt. Källa

Främst – särskilt för modeller med senare kunskapsavsnitt – är AI:n bara improviserar på Reddit- och foruminlägg som setts under utbildning. Även om det fanns något riktigt värde i sådana “insiderinsikter”, är det omöjligt att bevisa.

Emellertid leder dessa upphettade utbyten ibland till upptäckten av “hacker” (eller åtminstone “tricks”) som lovar att förhindra några av de värsta upprepade vanorna hos en LLM – som när ChatGPT föreslog att jag kunde få den att arbeta hårdare och hallucinera mindre genom att inkludera adjurationen ‘ingen heuristik’:

ChatGPT

Jag har använt ‘ingen heuristik’ mycket sedan dess, och inte en enda gång har modellen återgått till sin egen utbildade kunskap efter att jag stängt en fråga med detta kommando. Istället använder GPT omedelbart Retrieval Augmented Generation (RAG), som söker på internet efter upplysande eller bekräftande dokument.

I praktiken, för de flesta förfrågningar, är detta lite annorlunda än att tala om för systemet att “söka på webben” varje gång du skickar en fråga. Där ‘ingen heuristik’-frasen verkligen kan hjälpa är när du försöker få ChatGPT att faktiskt läsa en ny uppladdad PDF istället för att använda metadata från tidigare PDF-uppladdningar i den sessionen (eller många andra möjliga källor), för att producera ett “plausibelt” men helt hallucinerat svar, utan att ha läst eller ens skummat igenom dokumentet som du just presenterade.

ChatGPT

Det sagt, ju längre chatsessionen har pågått, desto mindre sannolikt att detta kommer att fungera – och det vore ett misstag att tro att någon sådan “trick” är tillförlitlig eller kommer att förbli tillgänglig när systemet utvecklas.

RAG-branschen

I sammanhanget med en växande kultur av shrinkflation, och det faktum att stora system som OpenAIs GPT-infrastruktur är enormt påverkade av även de minsta spridda förändringarna i beteende, är det också lätt att tro att man får kort vägt av de val som görs av populära LLM:er som ChatGPT.

Val som om den ska nå ut till webben med RAG; starta en Chain-of-Thought (CoT)-process som kan ge ett bättre resultat, men som kommer att kosta mer att härleda och kan trötta den otåliga användaren; eller återgå till sin egen utbildade kunskap – som är den billigaste och snabbaste lösningen som är möjlig.

Det finns flera praktiska skäl till varför en LLM med en känslig offentlig profil, som ChatGPT, kan föredra att begränsa sina RAG-samtal, och istället föredra sin egen heuristik. Först och främst, från ett PR-perspektiv, stöder ett ofta ogenererat användande av webben en populär karakterisering av LLM:er som bara Googlers-by-proxy, vilket minskar värdet av deras medfödda och dyrt utbildade kunskap – och attraktionen hos en betald prenumeration.

Andra, RAG-infrastruktur kostar pengar att köra, underhålla och uppdatera, jämfört med den relativt obetydliga kostnaden för lokal inferens, d.v.s. parametrisk generering, som är billig och snabb.

Tredje, systemet kan inte ha en effektiv metod för att bestämma om RAG kan förbättra sina egna heuristiska resultat – och det kan ofta inte bestämma detta utan att först köra heuristiken. Detta lämnar slutanvändaren med uppgiften att utvärdera ett defekt heuristiskt resultat och begära en RAG-samtalet om resultatet från heuristiken verkar ha fallit kort.

Från synsättet “AI-shrinkflation” kan antalet gånger ChatGPT felar genom heuristik och lyckas genom RAG indikera, som det nyligen gjorde för mig, att systemet optimerar för kostnad snarare än resultat.

RAG växer nödvändigt över tiden

Trots ChatGPTs nyliga “bekännelse” till mig att detta faktiskt är fallet, har “shrinkflation” en bredare kontext i detta avseende. Även om RAG inte är billigt, antingen i termer av friktion i upplevelsen (genom latency) eller kostnad att köra, är det mycket billigare än att regelbundet finjustera eller till och med omträna grundmodellen.

För en äldre AI-modell med ett mer avlägset avsnittsdatum kan RAG upprätthålla systemets aktualitet, till kostnaden av nätverkssamtal och andra resurser; för en nyare modell är RAGs egna återvinningar mer benägna att vara redundanta eller skadliga för kvaliteten på resultaten, som i vissa fall skulle ha varit bättre genom heuristik.

Därför verkar AI:n behöva förmågan att inte bara avgöra om den ska återgå till RAG, utan också att ständigt utveckla sin policy för att använda RAG allteftersom dess interna vikter blir mer och mer föråldrade.

Samtidigt behöver systemet ringa in “relativa konstanter” i kunskap, såsom månbanor och klassisk litteratur, kultur och historia; samt grundläggande geografi, fysik och andra vetenskapliga principer som är osannolika att utvecklas mycket över tiden (d.v.s. risken för “plötslig förändring” är inte obefintlig, men låg).

Udda ämnen

För tillfället, åtminstone när det gäller ChatGPT, verkar RAG-samtal (d.v.s. användning av webbforskning för alla användarfrågor som inte uttryckligen eller underförstått kräver webbforskning) sällan autonomt valda av systemet, även när det gäller “marginella” underdomäner.

Ett sådant exempel på en marginal domän är “obskur” programvaruanvändning. I ett sådant fall kommer minimal tillgänglig källdata att ha kämpat för uppmärksamhet under utbildning, och datans ‘outlier’-status kan antingen ha flaggat det för uppmärksamhet eller också begraver det som “marginellt” eller “obetydligt” – och även ett enda tillägg av ett foruminlägg som gjorts efter AI:s kunskapsavsnitt kunde representera en betydande ökning av total tillgänglig data och kvalitet på svaret för ett “litet” ämne, vilket gör ett RAG-samtal värt att genomföra.

Emellertid tenderar RAGs fördel att minska när basmodellen blir mer kraftfull. Medan mindre modeller drar nytta av återvinning, visar större system som Qwen3-4B eller GPT-4o-mini/-4o ofta marginell eller till och med negativ förbättring från RAG*.

På många benchmark-tester introducerar återvinning mer distraktion än nytta, vilket tyder på en avvägning mellan att investera i en större modell med mer intern täckning eller en mindre modell parat med återvinning.

Därför verkar RAG mest användbart för att kompensera för luckor i mittstora modeller, som fortfarande behöver externa fakta, men kan bedöma dem med mindre komplexa interna heuristik.

Använd endast i nödfall

ChatGPTs ledande principer kring beslutet att använda RAG är inte öppet exponerade av dess påstådda systemprompt**, men är implicit adresserad (mot slutet):

‘Använd webbverktyget för att komma åt uppdaterad information från webben eller när du svarar på användarens fråga kräver information om deras plats. Några exempel på när du ska använda webbverktyget är:

Lokal information: Använd webbverktyget för att svara på frågor som kräver information om användarens plats, såsom vädret, lokala företag eller evenemang.

Freshness: Om uppdaterad information om ett ämne potentiellt kan förändra eller förbättra svaret, ring webbverktyget varje gång du annars skulle vägra att svara på en fråga eftersom din kunskap kan vara föråldrad.

Nischinformation: Om svaret skulle dra nytta av detaljerad information som inte är allmänt känd eller förstådd (vilket kan hittas på internet), såsom detaljer om ett litet grannskap, ett mindre känt företag eller arkaiska regler, använd webbkällor direkt istället för att förlita dig på den destillerade kunskapen från förutbildning.

Noggrannhet: Om kostnaden för ett litet misstag eller föråldrad information är hög (t.ex. att använda en föråldrad version av ett programvarubibliotek eller inte veta datum för nästa match för ett sportlag), använd webbverktyget.’

I synnerhet kan vi notera att dessa instruktioner främjar RAG i fall där naturligt tränad data är knapphändig. Men hur kommer systemet till denna förståelse? Den ovanliga användaren och observatören av ChatGPT kan dra slutsatsen att när “sök på webben”-widgeten visas efter en paus, har modellens interna heuristik just pollats för frågan och kommit tom.

Vi kan också notera att RAG implicit rekommenderas endast för ett mycket begränsat antal användningsfall. Detta lämnar GPT rekommenderat att polla sin egen vikt i alla fall utom i en “kritisk” kontingens (‘Noggrannhet’, i botten av ovanstående citat), för det stora antalet faktabaserade domänfrågor där AI:s naturliga tendens att hallucinera kunde vara en noterbar skuld.

Slutsats

Trenderna i nuvarande och nyligen forskning tyder på att heuristisk generering är snabb och billig, men fel för ofta; medan RAG är långsammare, dyrare, men mycket mer korrekt – ju mer modellens storlek minskar.

Baserat på min egen användning av ChatGPT skulle jag hävda att OpenAI använder RAG alldeles för sällan, som ett precisionsverktyg snarare än en daglig förare, särskilt eftersom problemen med växande kontextfönster gör LLM:er mer benägna att hallucinera allteftersom långa samtal utvecklas.

Denna omständighet kunde avsevärt lindras genom att kontrollera heuristiska svar mot webbaserade auktoritativa källor, utan att vänta på att slutanvändaren tvivlar på utdata eller blir hindrad av det, och utan att interna resultat behöver vara så uppenbart otillfredsställande att beslutet att använda RAG är oundvikligt.

Snarare kunde systemet tränas för att selektivt och intelligent tvivla på sig själv enligt fall, och därmed engagera sig med webben genom en skärningsprocess som i sig skulle vara heuristisk. Jag är inte medveten om att arkitekturen i nuvarande modeller lämnar utrymme för ett tillvägagångssätt av detta slag, som istället skulle behöva läggas till friktionen av API-filtrar.

Som det är nu kan jag inte ens bevisa att det finns ett problem; inte ens med en bekännelse†:

ChatGPT bekänner

 

* Vänligen se länken i början av denna punkt.

** Detta är en “självexponerad” GPT-5-systemprompt som, återigen, kan vara en sammanfattning från promptforum-inlägg som omtränats för GPT-5, även om vissa hävdar att prompten är äkta.

† Jag föreslår verkligen inte att ChatGPTs “skyldig öppenhet” är meningsfull här; min tendens att stå emot dess partilinje i frågor om OpenAI:s policy innebär att det kommer att “samtycka” med mig och upprepa mina egna underförstådda åsikter ändå. Detta är långt ifrån ekvivalent med att yppa detaljerna om Normandies landstigning under tryck.  

Publicerad första gången onsdag, 10 december 2025

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai