Andersons vinkel

Heuristikk vs. RAG: Shrinkflation som en politisk driver

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

I de fleste tilfeller forbedrer søking på nettet den faktiske nøyaktigheten av ChatGPTs svar på våre spørsmål. Så i en klima hvor AI sliter med å få offentlig aksept, hvorfor er det standard å bruke “gjettninger”?

 

Mening Det er en feil å tro at LLMer som ChatGPT noen gang engasjerer seg i whistleblowing på potensielt skumle praksiser fra deres vertselskaper, selv om en kostbar og bortkastet sesjon har økt iren din nok til å virkelig komme inn i detaljene på et systems mangler:

Her en diskusjon om ChatGPTs preferanse for sin egen interne logikk (i motsetning til nettbasert forskning og verifisering gjennom RAG – som produserer færre hallucinasjoner, men koster mer) inducerer et åpenbart øyeblikk av åpenhet; men ta det med en pinch salt. Kilde: chatgpt.com

Her en diskusjon om ChatGPTs preferanse for sin egen interne logikk (i motsetning til nettbasert forskning og verifisering gjennom RAG – som produserer færre hallucinasjoner, men koster mer) inducerer et åpenbart øyeblikk av åpenhet; men ta det med en pinch salt. Kilde

For det meste – spesielt for modeller med senere kunnskapsavkortedatoer – er AIen bare improviserende på Reddit- og foruminnlegg sett under trening. Selv om det var noen virkelig verdi i slike “insiderinnsikt”, er det umulig å bevise.

Likevel kan disse varme utvekslingene noen ganger føre til oppdagelsen av “hacker” (eller i det minste “triks”) som lover å forhindre noen av de verste repetitive vanene på en LLM – som da ChatGPT foreslo at jeg kunne få det til å jobbe harder og hallucinere mindre ved å inkludere adjurasjonen ‘ingen heuristikk’:

ChatGPT

Jeg har brukt ‘ingen heuristikk’ mye siden da, og ikke en gang har modellen gått tilbake til sin egen trent kunnskap etter at jeg lukket en forespørsel med denne kommandoen. I stedet bruker GPT umiddelbart Retrieval Augmented Generation (RAG), som søker på internettet etter opplysende eller bekreftende dokumenter.

I praksis, for de fleste forespørsler, er dette lite forskjellig fra å si systemet å “søke på nettet” hver gang du sender en forespørsel. Hvor ‘ingen heuristikk’-frasen virkelig kan hjelpe, er når du prøver å få ChatGPT til å faktisk lese en ny lastet opp PDF i stedet for å bruke metadata fra tidligere PDF- lastinger i samme sesjon (eller mange andre mulige kilder), for å produsere et “plausibelt” men helt hallucinert svar, uten å ha lest eller skummet dokumentet du nettopp presenterte.

ChatGPT

Det sagt, jo lenger chatsesjonen har pågått, jo mindre sannsynlig er det at dette vil fungere – og det ville være en feil å tro at noen slik “triks” er pålitelig eller vil forbli tilgjengelig mens systemet utvikler seg.

RAG-bransjen

I sammenheng med en voksende kultur av shrinkflation, og det faktum at store systemer som OpenAIs GPT-infrastruktur er enormt berørt av selv de minste utbredte endringer i atferd, er det også lett å tro at man får kort vei fra valgene gjort av populære LLMer som ChatGPT.

Valg som om det vil nå ut til nettet med RAG; starte en Chain-of-Thought (CoT)-prosess som kan gi et bedre resultat, men som vil koste mer å slutte og kan være slitende for den uventede brukeren; eller gå tilbake til sin egen trent kunnskap – som er den billigste og raskeste løsningen mulig.

Det er flere praktiske grunner til at en LLM med en sensitiv offentlig profil, som ChatGPT, kan foretrekke å begrense sine RAG-oppkall, i stedet for å favorisere sin egen heuristikk. Først og fremst, fra et PR-perspektiv, støtter hyppig uoppfordret bruk av nettet en populær karakterisering av LLMer som bare Googlers-by-proxy, som minsker verdien av deres innfødt og dyrt trent kunnskap – og appell av en betalt abonnement.

For det andre koster RAG-infrastruktur penger å kjøre, vedlikeholde og oppdatere, sammenlignet med den relativt trivielle kostnaden av lokal inferens, dvs. parametrisk generering, som er billig og rask.

Tredje, systemet kan ikke ha en effektiv metode for å bestemme om RAG kan forbedre sine egne heuristiske resultater – og det kan ofte ikke bestemme dette uten å kjøre heuristikk først. Dette etterlater sluttbrukeren med oppgaven å evaluere et feilaktig heuristisk resultat og be om en RAG-oppkall i tilfelle at resultatet fra heuristikk syntes å ha kommet til kort.

Fra synspunktet “AI-shrinkflation” kan antallet ganger ChatGPT feiler gjennom heuristikk og lykkes gjennom RAG indikere, som det nylig gjorde til meg, at systemet optimerer for kostnad i stedet for resultater.

RAG vokser nødvendig over tid

Til tross for ChatGPTs nylige “tilståelse” til meg om at dette faktisk er tilfelle, har “shrinkflation” en videre kontekst i denne sammenhengen. Selv om RAG ikke er billig, heller ikke i termer av friksjon-av-erfaring (gjennom latency) eller kostnad-å-kjøre, er det mye billigere enn å fine-tune eller sogar re-treine grunnmodellen.

For en eldre AI-modell med en mer fjernt kunnskapsavkortedato, kan RAG vedlikeholde systemets valuta, til en kostnad av nettverksoppkall og andre ressurser; for en nyere modell er RAGs egne innhenting mer sannsynlig å være redundant eller skadelig for kvaliteten på resultater, som i noen tilfeller ville ha vært bedre gjennom heuristikk.

Derfor ser AIen ut til å trenge evnen ikke bare til å dømme om det skal gå til RAG, men til å kontinuerlig utvikle sin politikk på å bruke RAG mens dens interne vekter blir mer og mer utdatert.

Samtidig trenger systemet å avgi “relative konstanter” i kunnskap, som lunare baner og klassisk litteratur, kultur og historie; samt grunnleggende geografi, fysikk og andre vitenskapelige prinsipper som er usannsynlig å utvikle seg mye over tid (dvs. risikoen for “plutselig endring” er ikke ikke-eksisterende, men lav).

Outsider-temaer

For øyeblikket, i det minste så langt ChatGPT angår, ser RAG-oppkall (dvs. bruk av nettbasert forskning for enhver brukerforespørsel som ikke eksplisitt eller implisitt krever nettbasert forskning) ut til å sjelden være autonomt valgt av systemet, selv når det handler om “marginale” underdomener.

Ett slikt eksempel på et marginalt domene er “obskur” programvarebruk. I et slikt tilfelle vil minimal tilgjengelig kildekodestriving ha kjempet for oppmerksomhet under trening, og dataens ‘outsider-status’ kan enten ha flagget det for oppmerksomhet eller begravd det som “marginale” eller “uviktige” – og selv ett ekstra foruminnlegg lagt etter AIens kunnskapsavkortedato kunne representere en betydelig økning i total tilgjengelig data og kvalitet på svar for et “lite” tema, gjør et RAG-oppkall verdifullt.

Likevel tenderer RAGs fordel å krympe når grunnmodellen blir mer kraftig. Mens mindre modeller drar stor nytte av innhenting, viser større systemer som Qwen3-4B eller GPT-4o-mini/-4o ofte marginale eller til og med negative forbedringer fra RAG*.

På mange benchmark, introduserer innhenting mer distraksjon enn fordel, og antyder en avveining mellom å investere i en større modell med mer intern dekning, eller en mindre modell kombinert med innhenting.

Derfor ser RAG ut til å være mest nyttig for å kompensere for hull i mid-sized modeller, som fortsatt trenger eksterne fakta, men kan vurdere dem med mindre komplekse interne heuristikk.

Bruk kun i nødstilfeller

ChatGPTs styrende prinsipper rundt avgjørelsen om å bruke RAG er ikke åpenbart eksponert av dens påståtte systemprompt**, men er implisitt adressert (mot slutten):

‘Bruk nettverktøyet for å få tilgang til oppdatert informasjon fra nettet eller når du svarer på brukerens forespørsel om informasjon om deres lokasjon. Noen eksempler på når å bruke nettverktøyet inkluderer:

Lokal informasjon: Bruk nettverktøyet for å svare på spørsmål som krever informasjon om brukerens lokasjon, som vær, lokale bedrifter eller hendelser.

Freshness: Hvis oppdatert informasjon om et tema kunne potensielt endre eller forbedre svaret, ring nettverktøyet hver gang du ellers ville nektet å svare på et spørsmål fordi din kunnskap kanskje er utdatert.

Niche-informasjon: Hvis svaret ville dra nytte av detaljert informasjon som ikke er vidt kjent eller forstått (som kan finnes på internettet), som detaljer om et lite nabolag, et mindre kjent selskap eller arkane regler, bruk nett-kilder direkte i stedet for å stole på den destillerte kunnskapen fra fortrening.

Nøyaktighet: Hvis kostnaden av en liten feil eller utdatert informasjon er høy (f.eks. å bruke en utdatert versjon av et programbibliotek eller ikke å kjenne til datoen for neste spill for et idrettslag), så bruk nettverktøyet.’

Spesielt kan vi merke disse instruksjonene som fremmer RAG i tilfeller hvor naturlig trent data er sjeldent. Men hvordan kommer systemet til denne forståelsen? Den uventede brukeren og observatøren av ChatGPT kan konkludere at på de tilfeller hvor “søk på nettet”-widgeten vises etter en pause, har modellens interne heuristikk nettopp blitt avhørt for forespørselen, og kommet tom.

Vi kan også merke at implisitt anbefaler RAG kun for en svært begrenset mengde brukstilfeller. Dette etterlater GPT anbefalt å avhøre sin egen vekt i alle tilfeller, bortsett fra en “kritisk” kontingens (‘Nøyaktighet’, nederst i ovennevnte sitat), for det store antallet faktabaserte domene-spørsmål hvor AIens naturlige tendens til å hallucinere kunne være en merkbart ansvar.

Konklusjon

Trendene i nåværende og nylig forskning indikerer at heuristisk generering er rask og billig, men feil for ofte; mens RAG er langsommere, mer kostbar, men mye oftere riktig – jo mer modellens størrelse avtar.

Basert på min egen bruk av ChatGPT, ville jeg argumentere for at OpenAI bruker RAG langt for sparsomt, som et presisjonsverktøy i stedet for en daglig sjåfør, spesielt siden problemer med voksende kontekstvinduer gjør LLMer mer sannsynlig til å hallucinere jo lengre samtaler utvikler seg.

Dette omstændighetene kunne være betydelig lettet ved å sjekke heuristiske svar mot nettbaserte autoritetskilder, uten å vente på at sluttbrukeren tviler på utgangen eller blir hindret av det, og uten at interne resultater trenger å være så åpenbart utilfredsstillende at avgjørelsen om å bruke RAG er uunngåelig.

I stedet kunne systemet være trent til å selektivt og intelligent tvile på seg selv ifølge tilfeller, og derfor å engasjere seg med nettet gjennom en skjermingsprosess som ville være, i seg selv, heuristisk. Jeg er ikke klar over om arkitekturen til nåværende modeller lar plass til en tilnærming av denne typen, som i stedet ville måtte legges til friksjonen av API-filtre.

Som det står nå, kan jeg ikke engang bevise at det er et problem; ikke engang med en tilståelse:

ChatGPT tilstår

 

* Vennligst se på lenken øverst i denne paragrafen.

** Dette er en ‘selv-eksponert’ GPT-5 systemprompt som, igjen, kan være en fordøyning fra prompt-foruminnlegg re-trent for GPT-5, selv om noen hevder at prompten er ekte.

Jeg foreslår virkelig ikke at ChatGPTs “skyldig åpenhet” er meningsfull her; min tendens til å motsette meg dens partilinje i saker om OpenAI-politikk betyr at det vil til slutt “enige” seg med meg, og gjenta mine egne implisitte meninger likevel. Dette er langt fra å være ekvivalent med å avsløre detaljene om Normandie-landingen under press.  

Først publisert onsdag, 10. desember 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskildringssyntese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, inntil det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]