Andersons vinkel
Heuristiker vs. RAG: Shrinkflation som en policydriver

I de flesta fall fÃķrbÃĪttrar webbsÃķkning den faktiska noggrannheten i ChatGPTs svar pÃĨ vÃĨra frÃĨgor. SÃĨ i en klimat dÃĪr AI kÃĪmpar fÃķr allmÃĪn acceptans, varfÃķr vÃĪljer den att âgissaâ?
Â
à sikt Det ÃĪr ett misstag att tro att LLM:er som ChatGPT nÃĨgonsin ÃĪgnar sig ÃĨt att avslÃķja de potentiellt tvivelaktiga praktikerna hos deras vÃĪrdar, ÃĪven om en dyrbart och slÃķsad session har vÃĪckt din ilska tillrÃĪckligt fÃķr att verkligen gÃĨ in i detaljerna om systemets brister:

HÃĪr diskuteras ChatGPTs fÃķretrÃĪde fÃķr sin egen interna logik (i motsats till webbaserad forskning och verifiering genom RAG â som producerar fÃĪrre hallucinationer, men kostar mer) och inducerar ett uppenbart Ãķgonblick av Ãķppenhet; men ta det med en nypa salt. KÃĪlla
FrÃĪmst â sÃĪrskilt fÃķr modeller med senare kunskapsavsnitt â ÃĪr AI:n bara improviserar pÃĨ Reddit- och foruminlÃĪgg som setts under utbildning. Ãven om det fanns nÃĨgot riktigt vÃĪrde i sÃĨdana âinsiderinsikterâ, ÃĪr det omÃķjligt att bevisa.
Emellertid leder dessa upphettade utbyten ibland till upptÃĪckten av âhackerâ (eller ÃĨtminstone âtricksâ) som lovar att fÃķrhindra nÃĨgra av de vÃĪrsta upprepade vanorna hos en LLM â som nÃĪr ChatGPT fÃķreslog att jag kunde fÃĨ den att arbeta hÃĨrdare och hallucinera mindre genom att inkludera adjurationen âingen heuristikâ:

Jag har anvÃĪnt âingen heuristikâ mycket sedan dess, och inte en enda gÃĨng har modellen ÃĨtergÃĨtt till sin egen utbildade kunskap efter att jag stÃĪngt en frÃĨga med detta kommando. IstÃĪllet anvÃĪnder GPT omedelbart Retrieval Augmented Generation (RAG), som sÃķker pÃĨ internet efter upplysande eller bekrÃĪftande dokument.
I praktiken, fÃķr de flesta fÃķrfrÃĨgningar, ÃĪr detta lite annorlunda ÃĪn att tala om fÃķr systemet att âsÃķka pÃĨ webbenâ varje gÃĨng du skickar en frÃĨga. DÃĪr âingen heuristikâ-frasen verkligen kan hjÃĪlpa ÃĪr nÃĪr du fÃķrsÃķker fÃĨ ChatGPT att faktiskt lÃĪsa en ny uppladdad PDF istÃĪllet fÃķr att anvÃĪnda metadata frÃĨn tidigare PDF-uppladdningar i den sessionen (eller mÃĨnga andra mÃķjliga kÃĪllor), fÃķr att producera ett âplausibeltâ men helt hallucinerat svar, utan att ha lÃĪst eller ens skummat igenom dokumentet som du just presenterade.

Det sagt, ju lÃĪngre chatsessionen har pÃĨgÃĨtt, desto mindre sannolikt att detta kommer att fungera â och det vore ett misstag att tro att nÃĨgon sÃĨdan âtrickâ ÃĪr tillfÃķrlitlig eller kommer att fÃķrbli tillgÃĪnglig nÃĪr systemet utvecklas.
RAG-branschen
I sammanhanget med en vÃĪxande kultur av shrinkflation, och det faktum att stora system som OpenAIs GPT-infrastruktur ÃĪr enormt pÃĨverkade av ÃĪven de minsta spridda fÃķrÃĪndringarna i beteende, ÃĪr det ocksÃĨ lÃĪtt att tro att man fÃĨr kort vÃĪgt av de val som gÃķrs av populÃĪra LLM:er som ChatGPT.
Val som om den ska nÃĨ ut till webben med RAG; starta en Chain-of-Thought (CoT)-process som kan ge ett bÃĪttre resultat, men som kommer att kosta mer att hÃĪrleda och kan trÃķtta den otÃĨliga anvÃĪndaren; eller ÃĨtergÃĨ till sin egen utbildade kunskap â som ÃĪr den billigaste och snabbaste lÃķsningen som ÃĪr mÃķjlig.
Det finns flera praktiska skÃĪl till varfÃķr en LLM med en kÃĪnslig offentlig profil, som ChatGPT, kan fÃķredra att begrÃĪnsa sina RAG-samtal, och istÃĪllet fÃķredra sin egen heuristik. FÃķrst och frÃĪmst, frÃĨn ett PR-perspektiv, stÃķder ett ofta ogenererat anvÃĪndande av webben en populÃĪr karakterisering av LLM:er som bara Googlers-by-proxy, vilket minskar vÃĪrdet av deras medfÃķdda och dyrt utbildade kunskap â och attraktionen hos en betald prenumeration.
Andra, RAG-infrastruktur kostar pengar att kÃķra, underhÃĨlla och uppdatera, jÃĪmfÃķrt med den relativt obetydliga kostnaden fÃķr lokal inferens, d.v.s. parametrisk generering, som ÃĪr billig och snabb.
Tredje, systemet kan inte ha en effektiv metod fÃķr att bestÃĪmma om RAG kan fÃķrbÃĪttra sina egna heuristiska resultat â och det kan ofta inte bestÃĪmma detta utan att fÃķrst kÃķra heuristiken. Detta lÃĪmnar slutanvÃĪndaren med uppgiften att utvÃĪrdera ett defekt heuristiskt resultat och begÃĪra en RAG-samtalet om resultatet frÃĨn heuristiken verkar ha fallit kort.
FrÃĨn synsÃĪttet âAI-shrinkflationâ kan antalet gÃĨnger ChatGPT felar genom heuristik och lyckas genom RAG indikera, som det nyligen gjorde fÃķr mig, att systemet optimerar fÃķr kostnad snarare ÃĪn resultat.
RAG vÃĪxer nÃķdvÃĪndigt Ãķver tiden
Trots ChatGPTs nyliga âbekÃĪnnelseâ till mig att detta faktiskt ÃĪr fallet, har âshrinkflationâ en bredare kontext i detta avseende. Ãven om RAG inte ÃĪr billigt, antingen i termer av friktion i upplevelsen (genom latency) eller kostnad att kÃķra, ÃĪr det mycket billigare ÃĪn att regelbundet finjustera eller till och med omtrÃĪna grundmodellen.
FÃķr en ÃĪldre AI-modell med ett mer avlÃĪgset avsnittsdatum kan RAG upprÃĪtthÃĨlla systemets aktualitet, till kostnaden av nÃĪtverkssamtal och andra resurser; fÃķr en nyare modell ÃĪr RAGs egna ÃĨtervinningar mer benÃĪgna att vara redundanta eller skadliga fÃķr kvaliteten pÃĨ resultaten, som i vissa fall skulle ha varit bÃĪttre genom heuristik.
DÃĪrfÃķr verkar AI:n behÃķva fÃķrmÃĨgan att inte bara avgÃķra om den ska ÃĨtergÃĨ till RAG, utan ocksÃĨ att stÃĪndigt utveckla sin policy fÃķr att anvÃĪnda RAG allteftersom dess interna vikter blir mer och mer fÃķrÃĨldrade.
Samtidigt behÃķver systemet ringa in ârelativa konstanterâ i kunskap, sÃĨsom mÃĨnbanor och klassisk litteratur, kultur och historia; samt grundlÃĪggande geografi, fysik och andra vetenskapliga principer som ÃĪr osannolika att utvecklas mycket Ãķver tiden (d.v.s. risken fÃķr âplÃķtslig fÃķrÃĪndringâ ÃĪr inte obefintlig, men lÃĨg).
Udda ÃĪmnen
FÃķr tillfÃĪllet, ÃĨtminstone nÃĪr det gÃĪller ChatGPT, verkar RAG-samtal (d.v.s. anvÃĪndning av webbforskning fÃķr alla anvÃĪndarfrÃĨgor som inte uttryckligen eller underfÃķrstÃĨtt krÃĪver webbforskning) sÃĪllan autonomt valda av systemet, ÃĪven nÃĪr det gÃĪller âmarginellaâ underdomÃĪner.
Ett sÃĨdant exempel pÃĨ en marginal domÃĪn ÃĪr âobskurâ programvaruanvÃĪndning. I ett sÃĨdant fall kommer minimal tillgÃĪnglig kÃĪlldata att ha kÃĪmpat fÃķr uppmÃĪrksamhet under utbildning, och datans âoutlierâ-status kan antingen ha flaggat det fÃķr uppmÃĪrksamhet eller ocksÃĨ begraver det som âmarginelltâ eller âobetydligtâ â och ÃĪven ett enda tillÃĪgg av ett foruminlÃĪgg som gjorts efter AI:s kunskapsavsnitt kunde representera en betydande Ãķkning av total tillgÃĪnglig data och kvalitet pÃĨ svaret fÃķr ett âlitetâ ÃĪmne, vilket gÃķr ett RAG-samtal vÃĪrt att genomfÃķra.
Emellertid tenderar RAGs fÃķrdel att minska nÃĪr basmodellen blir mer kraftfull. Medan mindre modeller drar nytta av ÃĨtervinning, visar stÃķrre system som Qwen3-4B eller GPT-4o-mini/-4o ofta marginell eller till och med negativ fÃķrbÃĪttring frÃĨn RAG*.
PÃĨ mÃĨnga benchmark-tester introducerar ÃĨtervinning mer distraktion ÃĪn nytta, vilket tyder pÃĨ en avvÃĪgning mellan att investera i en stÃķrre modell med mer intern tÃĪckning eller en mindre modell parat med ÃĨtervinning.
DÃĪrfÃķr verkar RAG mest anvÃĪndbart fÃķr att kompensera fÃķr luckor i mittstora modeller, som fortfarande behÃķver externa fakta, men kan bedÃķma dem med mindre komplexa interna heuristik.
AnvÃĪnd endast i nÃķdfall
ChatGPTs ledande principer kring beslutet att anvÃĪnda RAG ÃĪr inte Ãķppet exponerade av dess pÃĨstÃĨdda systemprompt**, men ÃĪr implicit adresserad (mot slutet):
âAnvÃĪnd webbverktyget fÃķr att komma ÃĨt uppdaterad information frÃĨn webben eller nÃĪr du svarar pÃĨ anvÃĪndarens frÃĨga krÃĪver information om deras plats. NÃĨgra exempel pÃĨ nÃĪr du ska anvÃĪnda webbverktyget ÃĪr:
Lokal information: AnvÃĪnd webbverktyget fÃķr att svara pÃĨ frÃĨgor som krÃĪver information om anvÃĪndarens plats, sÃĨsom vÃĪdret, lokala fÃķretag eller evenemang.
Freshness: Om uppdaterad information om ett ÃĪmne potentiellt kan fÃķrÃĪndra eller fÃķrbÃĪttra svaret, ring webbverktyget varje gÃĨng du annars skulle vÃĪgra att svara pÃĨ en frÃĨga eftersom din kunskap kan vara fÃķrÃĨldrad.
Nischinformation: Om svaret skulle dra nytta av detaljerad information som inte ÃĪr allmÃĪnt kÃĪnd eller fÃķrstÃĨdd (vilket kan hittas pÃĨ internet), sÃĨsom detaljer om ett litet grannskap, ett mindre kÃĪnt fÃķretag eller arkaiska regler, anvÃĪnd webbkÃĪllor direkt istÃĪllet fÃķr att fÃķrlita dig pÃĨ den destillerade kunskapen frÃĨn fÃķrutbildning.
Noggrannhet: Om kostnaden fÃķr ett litet misstag eller fÃķrÃĨldrad information ÃĪr hÃķg (t.ex. att anvÃĪnda en fÃķrÃĨldrad version av ett programvarubibliotek eller inte veta datum fÃķr nÃĪsta match fÃķr ett sportlag), anvÃĪnd webbverktyget.â
I synnerhet kan vi notera att dessa instruktioner frÃĪmjar RAG i fall dÃĪr naturligt trÃĪnad data ÃĪr knapphÃĪndig. Men hur kommer systemet till denna fÃķrstÃĨelse? Den ovanliga anvÃĪndaren och observatÃķren av ChatGPT kan dra slutsatsen att nÃĪr âsÃķk pÃĨ webbenâ-widgeten visas efter en paus, har modellens interna heuristik just pollats fÃķr frÃĨgan och kommit tom.
Vi kan ocksÃĨ notera att RAG implicit rekommenderas endast fÃķr ett mycket begrÃĪnsat antal anvÃĪndningsfall. Detta lÃĪmnar GPT rekommenderat att polla sin egen vikt i alla fall utom i en âkritiskâ kontingens (âNoggrannhetâ, i botten av ovanstÃĨende citat), fÃķr det stora antalet faktabaserade domÃĪnfrÃĨgor dÃĪr AI:s naturliga tendens att hallucinera kunde vara en noterbar skuld.
Slutsats
Trenderna i nuvarande och nyligen forskning tyder pÃĨ att heuristisk generering ÃĪr snabb och billig, men fel fÃķr ofta; medan RAG ÃĪr lÃĨngsammare, dyrare, men mycket mer korrekt â ju mer modellens storlek minskar.
Baserat pÃĨ min egen anvÃĪndning av ChatGPT skulle jag hÃĪvda att OpenAI anvÃĪnder RAG alldeles fÃķr sÃĪllan, som ett precisionsverktyg snarare ÃĪn en daglig fÃķrare, sÃĪrskilt eftersom problemen med vÃĪxande kontextfÃķnster gÃķr LLM:er mer benÃĪgna att hallucinera allteftersom lÃĨnga samtal utvecklas.
Denna omstÃĪndighet kunde avsevÃĪrt lindras genom att kontrollera heuristiska svar mot webbaserade auktoritativa kÃĪllor, utan att vÃĪnta pÃĨ att slutanvÃĪndaren tvivlar pÃĨ utdata eller blir hindrad av det, och utan att interna resultat behÃķver vara sÃĨ uppenbart otillfredsstÃĪllande att beslutet att anvÃĪnda RAG ÃĪr oundvikligt.
Snarare kunde systemet trÃĪnas fÃķr att selektivt och intelligent tvivla pÃĨ sig sjÃĪlv enligt fall, och dÃĪrmed engagera sig med webben genom en skÃĪrningsprocess som i sig skulle vara heuristisk. Jag ÃĪr inte medveten om att arkitekturen i nuvarande modeller lÃĪmnar utrymme fÃķr ett tillvÃĪgagÃĨngssÃĪtt av detta slag, som istÃĪllet skulle behÃķva lÃĪggas till friktionen av API-filtrar.
Som det ÃĪr nu kan jag inte ens bevisa att det finns ett problem; inte ens med en bekÃĪnnelseâ :

Â
* VÃĪnligen se lÃĪnken i bÃķrjan av denna punkt.
** Detta ÃĪr en âsjÃĪlvexponeradâ GPT-5-systemprompt som, ÃĨterigen, kan vara en sammanfattning frÃĨn promptforum-inlÃĪgg som omtrÃĪnats fÃķr GPT-5, ÃĪven om vissa hÃĪvdar att prompten ÃĪr ÃĪkta.
â Jag fÃķreslÃĨr verkligen inte att ChatGPTs âskyldig Ãķppenhetâ ÃĪr meningsfull hÃĪr; min tendens att stÃĨ emot dess partilinje i frÃĨgor om OpenAI:s policy innebÃĪr att det kommer att âsamtyckaâ med mig och upprepa mina egna underfÃķrstÃĨdda ÃĨsikter ÃĪndÃĨ. Detta ÃĪr lÃĨngt ifrÃĨn ekvivalent med att yppa detaljerna om Normandies landstigning under tryck. Â
Publicerad fÃķrsta gÃĨngen onsdag, 10 december 2025












