Andersons vinkel

Heuristik vs. RAG: Shrinkflation som en politisk driver

mm
Føj Unite.AI til dine foretrukne kilder på Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

Generelt forbedrer søgning på nettet den faktuelle nøjagtighed af ChatGPT’s svar på vores spørgsmål. Så i en klima, hvor AI kæmper for offentlig accept, hvorfor vælger det at gå til “gæt”?

 

Opinion Det er en fejl at tro, at LLM’er såsom ChatGPT nogensinde deltager i whistleblowing om deres værter potentielt skyggefulde praksisser, selv hvis en dyrekøbt og spildt session har været nok til at få dig til at gå i dybden på et systems mangler:

<img class=" wp-image-226965" src="https://www.unite.ai/wp-content/uploads/2025/12/slapdash.jpg" alt="Her diskuteres ChatGPT's præference for sin egen interne logik (vs. web-baseret forskning og verificering gennem RAG – som producerer færre hallucinationer, men koster mere) og fremkalder en tilsyneladende øjeblikkelig ærlighed; men tag det med en nåldegn. Kilde

For det meste – især for modeller med senere kunskabsafskæringsdatoer – er AI’en bare riffende på Reddit- og forumindlæg set under træning. Selv hvis der var nogen reel værdi i sådanne ‘indsideinsights’, er det umuligt at bevise.

Men nogle gange fører disse ophedede udvekslinger til opdagelsen af ‘hacks’ (eller i hvert fald ‘tricks’), der lover at forhindre nogle af de værste gentagne vaner på en LLM – såsom da ChatGPT sidste uge foreslog, at jeg kunne få det til at arbejde hårdere og hallucinere mindre ved at inkludere adjurationen ‘ingen heuristikker’:

ChatGPT

Jeg har brugt ‘ingen heuristikker’ meget siden da, og ikke én gang har modellen søgt tilbage til sin egen trænet viden efter, at jeg lukkede en forespørgsel med denne kommando. I stedet bruger GPT straks Retrieval Augmented Generation (RAG), som søger på internettet efter oplysende eller bekræftende dokumenter.

I praksis er dette lille forskelligt fra at fortælle systemet at ‘søge på nettet’ hver gang, du sender en forespørgsel. Hvor ‘ingen heuristikker’-frasen virkelig kan hjælpe, er, når du prøver at få ChatGPT til at læse en ny uploaded PDF i stedet for at bruge metadata fra tidligere PDF-uploads i samme session (eller mange andre mulige kilder) for at producere et ‘plausibelt’ men fuldstændig hallucineret svar, uden at have læst eller blot skimmet dokumentet, du lige har præsenteret.

ChatGPT

Det sagde, jo længere en chatsession har været i gang, jo mindre sandsynligt, at dette vil fungere – og det ville være en fejl at tro, at en sådan ‘trick’ er pålidelig eller vil forblive tilgængelig, mens systemet udvikler sig.

RAG-handlen

I sammenhæng med en voksende kultur af shrinkflation, og det faktum, at store systemer såsom OpenAI’s GPT-infrastruktur er enormt påvirket af selv de mindste udbredte ændringer i adfærd, er det også let at tro, at man får for lidt værdi fra de valg, der er truffet af populære LLM’er såsom ChatGPT.

Valg som om, hvorvidt det vil søge på nettet med RAG; starte en Chain-of-Thought (CoT)-proces, der måske kan opnå et bedre resultat, men som vil koste mere at slutte sig til og måske trætte den utålmodige bruger; eller søge tilbage til sin egen trænet viden og lokalt tilgængelige kundskaber – som er den billigste og hurtigste løsning.

Der er flere praktiske grunde til, at en LLM med et følsomt offentligt profil, såsom ChatGPT, kan foretrække at begrænse sine RAG-opkald, i stedet for at foretrække sin egen heuristik. Først og fremmest, fra et PR-perspektiv, støtter hyppig ubesværet brug af nettet en populær karakterisering af LLM’er som blot Googlers-by-proxy, hvilket mindsker værdien af deres indre og dyrt trænede kundskaber – og appellen af en betalt abonnement.

Anden, RAG-infrastruktur koster penge at køre, vedligeholde og opdatere, sammenlignet med den relativt ubetydelige omkostning ved lokal slutning, dvs. parametrisk generering, som er billig og hurtig.

Tredje, systemet kan ikke have en effektiv metode til at bestemme, om RAG kan forbedre sine egne heuristiske resultater – og det kan ofte ikke bestemme dette uden at køre heuristikker først. Dette efterlader slutbrugeren med opgaven at evaluere et fejlbehæftet heuristisk resultat og anmode om et RAG-opkald i tilfælde af, at resultatet fra heuristikker syntes at være utilstrækkeligt.

Fra synspunktet ‘AI-shrinkflation’ kan antallet af gange, ChatGPT fejler gennem heuristikker og lykkes gennem RAG, indikere, som det nylig gjorde for mig, at systemet optimerer for omkostninger snarere end resultater.

RAG bliver nødvendigt over tid

Trods ChatGPT’s seneste ’tilståelse’ til mig om, at dette faktisk er tilfældet, har ‘shrinkflation’ en bredere kontekst i denne henseende. Selv om RAG ikke er billig, hverken i forhold til friktion-af-oplevelse (gennem latency) eller omkostning-til-at-køre, er det meget billigere end enten regelmæssig fine-tuning eller endda gen-træning af grundmodellen.

For en ældre AI-model med en mere fjern kunskabsafskæringsdato kan RAG opretholde systemets valuta, til omkostning af netværksopkald og andre ressourcer; for en nyere model er RAG’s egne hentninger mere sandsynligt redundant eller skadelig for resultaternes kvalitet, som i nogle tilfælde ville have været bedre gennem heuristikker.

Derfor synes AI’en at have brug for kapaciteten ikke kun til at afgøre, om den skal søge tilbage til RAG, men til kontinuerligt udvikle sin politik om brug af RAG, efterhånden som dens interne vægte bliver mere og mere forældede.

Samtidig har systemet brug for at afgrænse ‘relative konstanter’ i kundskaber, såsom månebaner og klassisk litteratur, kultur og historie; samt grundlæggende geografi, fysik og andre videnskabelige grundprincipper, der sandsynligvis ikke vil udvikle sig meget over tid (dvs. risikoen for ‘pludselig ændring’ er ikke ikke-existerende, men lav).

Udligere emner

For øjeblikket, i hvert fald så vidt ChatGPT er bekymret, synes RAG-opkald (dvs. brug af web-forskning til enhver brugerforespørgsel, der ikke eksplisit eller implicit kræver web-forskning) sjældent at være autonomt valgt af systemet, selv når det handler om ‘marginale’ underdomæner.

Et sådant eksempel på et marginalt domæne er ‘obskur’ softwarebrug. I sådant tilfælde vil minimal tilgængelig kilde-data have kæmpet for opmærksomhed under træning, og dataens ‘outlier’-status kan enten have flaget det for opmærksomhed eller begravet det som ‘marginale’ eller ‘ubetydelige’ – og selv blot én ekstra forum-post lavet efter AI’ens kunskabsafskæringsdato kunne repræsentere en betydelig øgning i den samlede tilgængelige data og kvaliteten af svaret for et ‘lille’ emne, hvilket gør et RAG-opkald værdifuldt.

Men fordelen ved RAG tenderer til at mindske, efterhånden som grundmodellen bliver mere kraftfuld. Mens mindre modeller får stor udbytte af hentning, viser større systemer såsom Qwen3-4B eller GPT-4o-mini/-4 ofte marginale eller endda negative forbedringer fra RAG*.

På mange benchmarks introducerer hentning mere forstyrrelse end fordel, hvilket tyder på en afvejning mellem at investere i en større model med mere intern dækning eller en mindre model parret med hentning.

Derfor synes RAG at være mest nyttig til at kompensere for huller i mid-size-modeller, der stadig har brug for eksterne fakta, men kan vurdere dem med mindre komplekse interne heuristikker.

Kun brug i nødstilfælde

ChatGPT’s retningslinjer for beslutningen om at bruge RAG er ikke åbent afsløret af dens påståede systemprompt**, men er implicit behandlet (mod slutningen):

‘Brug webværktøjet til at få adgang til opdateret information fra nettet eller når svaret på brugerens forespørgsel kræver information om deres placering. Nogle eksempler på, hvornår man skal bruge webværktøjet, omfatter:

Lokal information: Brug webværktøjet til at svare på spørgsmål, der kræver information om brugerens placering, såsom vejr, lokale forretninger eller begivenheder.

Friskehed: Hvis opdateret information om et emne potentielt kan ændre eller forbedre svaret, ring webværktøjet hver gang, du ellers ville nægte at svare på et spørgsmål, fordi din viden måske er forældet.

Niche-information: Hvis svaret vil have gavn af detaljeret information, der ikke er bredt kendt eller forstået (som kan findes på internettet), såsom detaljer om et lille kvarter, en mindre kendt virksomhed eller arkane regler, brug webkilder direkte i stedet for at stole på den destillerede viden fra fortræning.

Nøjagtighed: Hvis omkostningen ved en lille fejl eller forældet information er høj (f.eks. brug af en forældet version af et software-bibliotek eller ikke at kende datoen for det næste spil for et hold), så brug webværktøjet.’

Især kan vi bemærke, at disse retningslinjer fremmer RAG i tilfælde, hvor indfødt trænet data er knap.
Men hvordan kommer systemet til denne forståelse? Den tilfældige bruger og iagttager af ChatGPT kunne slutte, at på de lejligheder, hvor ‘søgning på nettet’-widget’en vises efter en pause, har modellens interne heuristikker lige været afhørt for forespørgslen, og kom op med tomme hænder.

Vi kan også bemærke, at RAG implicit anbefales kun til et meget begrænset antal brugsområder. Dette efterlader GPT anbefalet til at afhøre sin egen viden i alle tilfælde, undtagen i en ‘kritisk’ kontingens (‘Nøjagtighed’, i bunden af ovenstående citat), for det overordnede antal faktiske domæneforespørgsler, hvor AI’ens indre tendens til at hallucinere kunne være en bemærkelsesværdig ansvar.

Konklusion

Tendenserne i nuværende og seneste forskning indikerer, at heuristisk generering er hurtig og billig, men forkert for ofte; mens RAG er langsommere, mere dyrt, men langt hyppigere korrekt – jo mere, efterhånden som modellens størrelse mindskes.

Baseret på min egen brug af ChatGPT ville jeg argumentere for, at OpenAI bruger RAG alt for sparsomt, som et præcisionsværktøj snarere end en daglig chauffør, især efterhånden som problemerne med voksende kontekstvinduer gør LLM’er mere tilbøjelige til at hallucinere, efterhånden som lange samtaler udvikler sig.

Dette kunne være væsentligt lettet ved at kontrollere heuristiske svar mod web-baserede autoritetskilder, uden at vente på, at slutbrugeren tvivler på outputtet eller bliver fanget af det, og uden at interne resultater behøver at være så åbenlyst utilstrækkelige, at beslutningen om at bruge RAG er uundgåelig.

I stedet kunne systemet være trænet til at selektivt og intelligent tvivle på sig selv efter tilfælde, og derfor at engagere sig med nettet gennem en screeningsproces, der i sig selv ville være heuristisk. Jeg er ikke klar over, at arkitekturen af nuværende modeller efterlader plads til en tilgang af denne type, som i stedet ville skulle tilføjes til friktionen af API-filtre.

Som det er nu, kan jeg ikke engang bevise, at der er et problem; ikke engang med en tilståelse:

ChatGPT tilstår

 

* Se venligst linket øverst i denne paragraf.

** Dette er en ‘selv-afsløret’ GPT-5-systemprompt, som igen blot kan være en samling fra prompt-forumindlæg gen-trænet til GPT-5, selv om nogen fastholder, at prompten er ægte.

Jeg foreslår virkelig ikke, at ChatGPT’s ‘skyldig ærlighed’ er meningsfuld her; min tendens til at modsætte mig dens partiets linje i spørgsmål om OpenAI’s politik betyder, at det vil til sidst ‘enige’ sig med mig og gentage mine egne underforståede meninger på samme måde. Dette er langt fra ækvivalent til at afsløre detaljerne om Normandiet-landgangen under pres.

Først udgivet onsdag, den 10. december 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai