Andersons Blickwinkel

Heuristik vs. RAG: Shrinkflation als politischer Treiber

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufÞgen
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

In den meisten FÃĪllen verbessert die Suche im Internet die faktische Genauigkeit der Antworten von ChatGPT auf unsere Fragen. Warum verwendet es also standardmÃĪßig “Vermutungen”?

 

Meinung Es ist ein Fehler zu glauben, dass LLMs wie ChatGPT jemals Whistleblowing Þber die mÃķglicherweise zwielichtigen Praktiken ihrer Gastgeber betreiben, auch wenn eine teure und verschwendete Sitzung Ihren Unmut so sehr gesteigert hat, dass Sie tatsÃĪchlich in die Details der SystemmÃĪngel eintauchen.

Hier fÞhrt eine Diskussion Þber ChatGPTs Vorliebe fÞr seine eigene interne Logik (im Vergleich zu webbasierten Recherchen und Verifizierung durch RAG – was weniger Halluzinationen erzeugt, aber teurer ist) zu einem scheinbaren Moment der Offenheit; aber nehmen Sie es mit einem KÃķrnchen Salz. Quelle: chatgpt.com

Hier fÞhrt eine Diskussion Þber ChatGPTs Vorliebe fÞr seine eigene interne Logik (im Vergleich zu webbasierten Recherchen und Verifizierung durch RAG – was weniger Halluzinationen erzeugt, aber teurer ist) zu einem scheinbaren Moment der Offenheit; aber nehmen Sie es mit einem KÃķrnchen Salz. Quelle

Meistens – insbesondere fÞr Modelle mit spÃĪteren Wissensabschnitten – ist die kÞnstliche Intelligenz einfach nur auf Reddit- und ForenbeitrÃĪge aus, die wÃĪhrend der Ausbildung gesehen wurden. Selbst wenn es tatsÃĪchlich einen Wert in solchen “Insider-Einblicken” gÃĪbe, ist es unmÃķglich, dies zu beweisen.

Manchmal fÞhren jedoch diese hitzigen Auseinandersetzungen zu der Entdeckung von “Hacks” (oder zumindest “Tricks”), die versprechen, einige der schlimmsten wiederkehrenden Gewohnheiten eines LLMs zu verhindern – wie zum Beispiel, als ChatGPT letzte Woche vorschlug, dass ich es dazu bringen kÃķnnte, hÃĪrter zu arbeiten und weniger zu halluzinieren, indem ich die Ermahnung ‘keine Heuristik’ verwende:

ChatGPT

Ich habe ‘keine Heuristik’ seitdem viel verwendet, und nicht ein einziges Mal ist das Modell auf seine eigene trainierte Kenntnis zurÞckgegriffen, nachdem ich eine Anfrage mit diesem Befehl abgeschlossen habe. Stattdessen verwendet GPT sofort Retrieval Augmented Generation (RAG), indem es im Internet nach aufschlussreichen oder bestÃĪtigenden Dokumenten sucht.

In der Praxis ist dies fÞr die meisten Anfragen wenig anders, als wenn man dem System sagt, “im Internet suchen” jedes Mal, wenn man eine Anfrage sendet. Wo der “keine Heuristik”-Befehl tatsÃĪchlich helfen kann, ist, wenn man versucht, ChatGPT dazu zu bringen, tatsÃĪchlich ein neues hochgeladenes PDF zu lesen, anstatt die Metadaten aus vorherigen PDF-Uploads in dieser Sitzung (oder vielen anderen mÃķglichen Quellen) zu verwenden, um eine “plausible” aber vÃķllig halluzinierte Antwort zu produzieren, ohne das Dokument, das man gerade prÃĪsentiert hat, gelesen oder auch nur Þberflogen zu haben.

ChatGPT

Das sagte, ist es unwahrscheinlich, dass dies funktioniert, je lÃĪnger die Chatsitzung bereits lÃĪuft – und es wÃĪre ein Fehler zu denken, dass ein solcher “Trick” zuverlÃĪssig ist oder auch nur verfÞgbar bleibt, wÃĪhrend das System evolviert.

Der RAG-Handel

Im Kontext einer wachsenden Kultur von Shrinkflation und der Tatsache, dass große Systeme wie OpenAIs GPT-Infrastruktur enorm von sogar den kleinsten weitverbreiteten VerhaltensÃĪnderungen betroffen sind, ist es auch leicht zu glauben, dass man von den Entscheidungen, die von beliebten LLMs wie ChatGPT getroffen werden, kurz geworden ist.

Entscheidungen wie die, ob es auf das Internet mit RAG zugreift; einen Chain-of-Thought (CoT)-Prozess startet, der mÃķglicherweise ein besseres Ergebnis liefert, aber teurer zu inferieren ist und den ungeduldigen Benutzer ermÞden kann; oder auf seine eigene trainierte Einbettung und lokal verfÞgbare Kenntnis zurÞckgreift – was die billigste und schnellste LÃķsung ist.

Es gibt mehrere praktische GrÞnde, warum ein LLM mit einem sensiblen Ãķffentlichen Profil wie ChatGPT seine RAG-Anrufe einschrÃĪnken und stattdessen seine eigene Heuristik bevorzugen kann. Zuerst einmal unterstÞtzt der hÃĪufige unangeforderte Einsatz des Internets aus PR-Sicht die populÃĪre Charakterisierung von LLMs als bloße Googler-by-Proxy, was den Wert ihrer angeborenen und teuer trainierten Kenntnis und den Reiz eines bezahlten Abonnements schmÃĪlert.

Zweitens kostet die RAG-Infrastruktur Geld, um sie zu betreiben, zu warten und zu aktualisieren, im Vergleich zu den relativ geringen Kosten der lokalen Inferenz, d. h. der parametrigen Generierung, die billig und schnell ist.

Drittens kann das System mÃķglicherweise keine effektive Methode entwickeln, um zu bestimmen, ob RAG seine eigenen heuristischen Ergebnisse verbessern kann – und es kann dies oft nicht ohne vorherige AusfÞhrung der Heuristik bestimmen. Dies lÃĪsst den Endbenutzer mit der Aufgabe zurÞck, ein fehlerhaftes heuristisches Ergebnis zu bewerten und einen RAG-Anruf zu beantragen, wenn das Ergebnis aus der Heuristik zu kurz zu sein scheint.

Aus der Sicht der “kÞnstlichen Intelligenz-Shrinkflation” kann die Anzahl der Male, bei denen ChatGPT durch Heuristik fehlschlÃĪgt und durch RAG erfolgreich ist, darauf hindeuten, wie es mir kÞrzlich gezeigt hat, dass das System auf Kosten statt auf Ergebnisse optimiert ist.

RAG wird im Laufe der Zeit notwendig

Trotz ChatGPTs jÞngstem “GestÃĪndnis” mir gegenÞber, dass dies tatsÃĪchlich der Fall ist, hat “Shrinkflation” einen weiteren Kontext in dieser Hinsicht. Obwohl RAG nicht billig ist, entweder in Bezug auf Reibungserfahrung (durch Latenz) oder Kosten, ist es viel billiger als entweder regelmÃĪßiges Feinabstimmen oder sogar das Ausbilden des Grundmodells.

FÞr ein ÃĪlteres KI-Modell mit einem weiter entfernten Stichtag kann RAG die WÃĪhrung des Systems aufrechterhalten, auf Kosten von Netzwerkanrufen und anderen Ressourcen; fÞr ein neueres Modell sind die eigenen Abrufe von RAG wahrscheinlicher redundant oder schÃĪdlich fÞr die QualitÃĪt der Ergebnisse, die in einigen FÃĪllen besser durch Heuristik gewesen wÃĪren.

Daher scheint die kÞnstliche Intelligenz nicht nur die FÃĪhigkeit zu benÃķtigen, zu entscheiden, ob sie auf RAG zurÞckgreifen soll, sondern auch, ihre Richtlinie zur Verwendung von RAG kontinuierlich zu entwickeln, da ihre internen Gewichte immer mehr veralten.

Gleichzeitig muss das System in der Lage sein, “relative Konstanten” im Wissen abzuschotten, wie z. B. Mondumlaufbahnen und klassische Literatur, Kultur und Geschichte; sowie grundlegende Geographie, Physik und andere wissenschaftliche Grundlagen, die sich im Laufe der Zeit nicht stark ÃĪndern werden (d. h. das Risiko eines “plÃķtzlichen Wandels” ist nicht nicht-existent, aber gering).

AußergewÃķhnliche Themen

Im Moment, zumindest was ChatGPT betrifft, scheinen RAG-Anrufe (d. h. die Verwendung von Web-Recherchen fÞr jede Benutzeranfrage, die nicht explizit oder implizit Web-Recherchen erfordert) selten autonom vom System gewÃĪhlt zu werden, selbst wenn es um “marginale” SubdomÃĪnen geht.

Ein Beispiel fÞr eine marginale DomÃĪne ist “exotische” Software-Nutzung. In einem solchen Fall wird minimale verfÞgbare Quelldaten wÃĪhrend der Ausbildung um Aufmerksamkeit gekÃĪmpft haben, und der “Außenseiter”-Status der Daten kann entweder aufmerksam gemacht oder als “marginal” oder “unbedeutend” abgestempelt worden sein – und selbst ein zusÃĪtzlicher Forenbeitrag, der nach dem Wissensstichtag des KI-Modells erstellt wurde, kann eine erhebliche Zunahme der verfÞgbaren Daten und der QualitÃĪt der Antwort fÞr ein “kleines” Thema darstellen, was einen RAG-Anruf wertvoll macht.

Die Vorteile von RAG tendieren jedoch dazu, abzunehmen, wenn das Basismodell leistungsfÃĪhiger wird. WÃĪhrend kleinere Modelle erheblich von der Abruf-Funktion profitieren, zeigen grÃķßere Systeme wie Qwen3-4B oder GPT-4o-mini/-4o oft nur marginale oder sogar negative Verbesserungen durch RAG*.

Bei vielen Benchmarks fÞhrt die Abruf-Funktion mehr Ablenkung als Nutzen ein, was auf einen Kompromiss zwischen der Investition in ein grÃķßeres Modell mit mehr interner Abdeckung oder einem kleineren Modell mit Abruf-Funktion hindeutet.

Daher scheint RAG am nÞtzlichsten zu sein, um LÞcken in mittelgroßen Modellen zu kompensieren, die immer noch externe Fakten benÃķtigen, aber diese mit weniger komplexen internen Heuristiken bewerten kÃķnnen.

Nur im Notfall verwenden

ChatGPTs Richtlinien fÞr die Entscheidung, RAG zu verwenden, werden nicht offensichtlich durch seine angebliche System-Prompt** offengelegt, sondern werden implizit angesprochen (gegen Ende):

‘Verwenden Sie das Web-Tool, um auf aktuelle Informationen aus dem Web zuzugreifen oder wenn die Antwort auf die Benutzeranfrage Informationen Þber den Standort erfordert. Beispiele fÞr den Einsatz des Web-Tools sind:

Lokale Informationen: Verwenden Sie das Web-Tool, um auf Fragen zu antworten, die Informationen Þber den Standort des Benutzers erfordern, wie z. B. das Wetter, lokale Unternehmen oder Veranstaltungen.

Frische: Wenn aktuelle Informationen zu einem Thema potenziell die Antwort ÃĪndern oder verbessern kÃķnnten, rufen Sie das Web-Tool auf, wenn Sie sonst ablehnen wÞrden, eine Frage zu beantworten, weil Ihr Wissen mÃķglicherweise veraltet ist.

Nische-Informationen: Wenn die Antwort von detaillierten Informationen profitieren wÞrde, die nicht weit verbreitet oder verstanden sind (die mÃķglicherweise im Internet gefunden werden), wie z. B. Details Þber ein kleines Viertel, ein weniger bekanntes Unternehmen oder abgelegene Vorschriften, verwenden Sie Web-Quellen direkt anstelle von auf vorheriger Ausbildung basierendem Wissen.

Genauigkeit: Wenn der Preis fÞr einen kleinen Fehler oder veraltete Informationen hoch ist (z. B. die Verwendung einer veralteten Version einer Software-Bibliothek oder das Nichtwissen des Datums des nÃĪchsten Spiels fÞr ein Sportteam), verwenden Sie das Web-Tool.’

Insbesondere kÃķnnen wir bemerken, dass diese Richtlinien RAG in FÃĪllen fÃķrdern, in denen nativ trainierte Daten rar sind. Aber wie kommt das System zu diesem VerstÃĪndnis? Der beilÃĪufige Benutzer und Beobachter von ChatGPT kÃķnnte daraus schließen, dass das System, wenn das “Im Internet suchen”-Widget nach einer Pause angezeigt wird, einfach seine interne Heuristik fÞr die Anfrage abgefragt und leer zurÞckgegeben hat.

Wir kÃķnnen auch bemerken, dass RAG implizit nur fÞr eine sehr begrenzte Anzahl von AnwendungsfÃĪllen empfohlen wird. Dies lÃĪsst GPT empfehlen, seine eigene Heuristik abzufragen, in allen FÃĪllen, in denen es nicht um eine “kritische” Situation (‘Genauigkeit’, am Ende des obigen Zitats) geht, fÞr die ÞberwÃĪltigende Mehrheit der faktischen DomÃĪnenanfragen, bei denen die Neigung des KI-Modells, zu halluzinieren, eine beachtliche Haftung darstellen kann.

Schlussfolgerung

Die Trends der aktuellen und jÞngsten Forschung deuten darauf hin, dass heuristische Generierung schnell und billig ist, aber auch oft falsch; wÃĪhrend RAG langsamer und teurer ist, aber viel hÃĪufiger richtig – umso mehr, je kleiner das Modell ist.

Basierend auf meiner eigenen Nutzung von ChatGPT wÞrde ich argumentieren, dass OpenAI RAG viel zu selten verwendet, als PrÃĪzisionswerkzeug und nicht als tÃĪglicher Fahrer, insbesondere seit die Probleme mit wachsenden Kontextfenstern LLMs eher als je zuvor dazu bringen, zu halluzinieren, wenn lange Konversationen entstehen.

Diese UmstÃĪnde kÃķnnten erheblich gelindert werden, indem heuristische Antworten auf webbasierte AutoritÃĪtsquellen ohne Warten auf den Endbenutzer, der die Ausgabe in Frage stellt oder darauf hereinfÃĪllt, und ohne dass interne Ergebnisse so offensichtlich unzureichend sein mÞssen, dass die Entscheidung, RAG zu verwenden, unvermeidlich ist.

Stattdessen kÃķnnte das System so trainiert werden, dass es selektiv und intelligent an sich selbst zweifelt und daher mit dem Internet durch einen Filterprozess interagiert, der selbst heuristisch wÃĪre. Ich bin mir nicht bewusst, dass die Architekturen der aktuellen Modelle Raum fÞr einen solchen Ansatz lassen, der stattdessen zur Reibung von API-Filtern hinzugefÞgt werden mÞsste.

Wie es steht, kann ich nicht einmal beweisen, dass es ein Problem gibt; nicht einmal mit einem GestÃĪndnis†:

ChatGPT gesteht

 

* Bitte verweisen Sie auf den Link am Anfang dieses Absatzes.

** Dies ist ein “selbstoffenbartes” GPT-5-System-Prompt, der wiederum einfach eine Zusammenfassung von Prompt-Forum-BeitrÃĪgen sein kann, die fÞr GPT-5 neu trainiert wurden, obwohl einige behaupten, dass der Prompt echt ist.

† Ich bin wirklich nicht der Meinung, dass ChatGPTs “schuldige Offenheit” hier bedeutungsvoll ist; meine Tendenz, gegen die Parteilinie des OpenAI in Fragen der OpenAI-Richtlinie zurÞckzudrÃĪngen, bedeutet, dass es letztendlich mit mir “Þbereinstimmen” und meine eigenen impliziten Meinungen nachahmen wird. Dies ist weit entfernt von der Offenbarung der Details der Landung in der Normandie unter Druck.  

ErstverÃķffentlicht am Mittwoch, den 10. Dezember 2025

Schriftsteller Þber maschinelles Lernen, DomÃĪnen-Spezialist fÞr menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen AuflÃķsung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: [email protected]