Andersons Blickwinkel

Heuristik vs. RAG: Shrinkflation als politischer Treiber

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

In den meisten Fällen verbessert die Suche im Internet die faktische Genauigkeit der Antworten von ChatGPT auf unsere Fragen. Warum verwendet es also standardmäßig “Vermutungen”?

 

Meinung Es ist ein Fehler zu glauben, dass LLMs wie ChatGPT jemals Whistleblowing über die möglicherweise zwielichtigen Praktiken ihrer Gastgeber betreiben, auch wenn eine teure und verschwendete Sitzung Ihren Unmut so sehr gesteigert hat, dass Sie tatsächlich in die Details der Systemmängel eintauchen.

Hier führt eine Diskussion über ChatGPTs Vorliebe für seine eigene interne Logik (im Vergleich zu webbasierten Recherchen und Verifizierung durch RAG – was weniger Halluzinationen erzeugt, aber teurer ist) zu einem scheinbaren Moment der Offenheit; aber nehmen Sie es mit einem Körnchen Salz. Quelle: chatgpt.com

Hier führt eine Diskussion über ChatGPTs Vorliebe für seine eigene interne Logik (im Vergleich zu webbasierten Recherchen und Verifizierung durch RAG – was weniger Halluzinationen erzeugt, aber teurer ist) zu einem scheinbaren Moment der Offenheit; aber nehmen Sie es mit einem Körnchen Salz. Quelle

Meistens – insbesondere für Modelle mit späteren Wissensabschnitten – ist die künstliche Intelligenz einfach nur auf Reddit- und Forenbeiträge aus, die während der Ausbildung gesehen wurden. Selbst wenn es tatsächlich einen Wert in solchen “Insider-Einblicken” gäbe, ist es unmöglich, dies zu beweisen.

Manchmal führen jedoch diese hitzigen Auseinandersetzungen zu der Entdeckung von “Hacks” (oder zumindest “Tricks”), die versprechen, einige der schlimmsten wiederkehrenden Gewohnheiten eines LLMs zu verhindern – wie zum Beispiel, als ChatGPT letzte Woche vorschlug, dass ich es dazu bringen könnte, härter zu arbeiten und weniger zu halluzinieren, indem ich die Ermahnung ‘keine Heuristik’ verwende:

ChatGPT

Ich habe ‘keine Heuristik’ seitdem viel verwendet, und nicht ein einziges Mal ist das Modell auf seine eigene trainierte Kenntnis zurückgegriffen, nachdem ich eine Anfrage mit diesem Befehl abgeschlossen habe. Stattdessen verwendet GPT sofort Retrieval Augmented Generation (RAG), indem es im Internet nach aufschlussreichen oder bestätigenden Dokumenten sucht.

In der Praxis ist dies für die meisten Anfragen wenig anders, als wenn man dem System sagt, “im Internet suchen” jedes Mal, wenn man eine Anfrage sendet. Wo der “keine Heuristik”-Befehl tatsächlich helfen kann, ist, wenn man versucht, ChatGPT dazu zu bringen, tatsächlich ein neues hochgeladenes PDF zu lesen, anstatt die Metadaten aus vorherigen PDF-Uploads in dieser Sitzung (oder vielen anderen möglichen Quellen) zu verwenden, um eine “plausible” aber völlig halluzinierte Antwort zu produzieren, ohne das Dokument, das man gerade präsentiert hat, gelesen oder auch nur überflogen zu haben.

ChatGPT

Das sagte, ist es unwahrscheinlich, dass dies funktioniert, je länger die Chatsitzung bereits läuft – und es wäre ein Fehler zu denken, dass ein solcher “Trick” zuverlässig ist oder auch nur verfügbar bleibt, während das System evolviert.

Der RAG-Handel

Im Kontext einer wachsenden Kultur von Shrinkflation und der Tatsache, dass große Systeme wie OpenAIs GPT-Infrastruktur enorm von sogar den kleinsten weitverbreiteten Verhaltensänderungen betroffen sind, ist es auch leicht zu glauben, dass man von den Entscheidungen, die von beliebten LLMs wie ChatGPT getroffen werden, kurz geworden ist.

Entscheidungen wie die, ob es auf das Internet mit RAG zugreift; einen Chain-of-Thought (CoT)-Prozess startet, der möglicherweise ein besseres Ergebnis liefert, aber teurer zu inferieren ist und den ungeduldigen Benutzer ermüden kann; oder auf seine eigene trainierte Einbettung und lokal verfügbare Kenntnis zurückgreift – was die billigste und schnellste Lösung ist.

Es gibt mehrere praktische Gründe, warum ein LLM mit einem sensiblen öffentlichen Profil wie ChatGPT seine RAG-Anrufe einschränken und stattdessen seine eigene Heuristik bevorzugen kann. Zuerst einmal unterstützt der häufige unangeforderte Einsatz des Internets aus PR-Sicht die populäre Charakterisierung von LLMs als bloße Googler-by-Proxy, was den Wert ihrer angeborenen und teuer trainierten Kenntnis und den Reiz eines bezahlten Abonnements schmälert.

Zweitens kostet die RAG-Infrastruktur Geld, um sie zu betreiben, zu warten und zu aktualisieren, im Vergleich zu den relativ geringen Kosten der lokalen Inferenz, d. h. der parametrigen Generierung, die billig und schnell ist.

Drittens kann das System möglicherweise keine effektive Methode entwickeln, um zu bestimmen, ob RAG seine eigenen heuristischen Ergebnisse verbessern kann – und es kann dies oft nicht ohne vorherige Ausführung der Heuristik bestimmen. Dies lässt den Endbenutzer mit der Aufgabe zurück, ein fehlerhaftes heuristisches Ergebnis zu bewerten und einen RAG-Anruf zu beantragen, wenn das Ergebnis aus der Heuristik zu kurz zu sein scheint.

Aus der Sicht der “künstlichen Intelligenz-Shrinkflation” kann die Anzahl der Male, bei denen ChatGPT durch Heuristik fehlschlägt und durch RAG erfolgreich ist, darauf hindeuten, wie es mir kürzlich gezeigt hat, dass das System auf Kosten statt auf Ergebnisse optimiert ist.

RAG wird im Laufe der Zeit notwendig

Trotz ChatGPTs jüngstem “Geständnis” mir gegenüber, dass dies tatsächlich der Fall ist, hat “Shrinkflation” einen weiteren Kontext in dieser Hinsicht. Obwohl RAG nicht billig ist, entweder in Bezug auf Reibungserfahrung (durch Latenz) oder Kosten, ist es viel billiger als entweder regelmäßiges Feinabstimmen oder sogar das Ausbilden des Grundmodells.

Für ein älteres KI-Modell mit einem weiter entfernten Stichtag kann RAG die Währung des Systems aufrechterhalten, auf Kosten von Netzwerkanrufen und anderen Ressourcen; für ein neueres Modell sind die eigenen Abrufe von RAG wahrscheinlicher redundant oder schädlich für die Qualität der Ergebnisse, die in einigen Fällen besser durch Heuristik gewesen wären.

Daher scheint die künstliche Intelligenz nicht nur die Fähigkeit zu benötigen, zu entscheiden, ob sie auf RAG zurückgreifen soll, sondern auch, ihre Richtlinie zur Verwendung von RAG kontinuierlich zu entwickeln, da ihre internen Gewichte immer mehr veralten.

Gleichzeitig muss das System in der Lage sein, “relative Konstanten” im Wissen abzuschotten, wie z. B. Mondumlaufbahnen und klassische Literatur, Kultur und Geschichte; sowie grundlegende Geographie, Physik und andere wissenschaftliche Grundlagen, die sich im Laufe der Zeit nicht stark ändern werden (d. h. das Risiko eines “plötzlichen Wandels” ist nicht nicht-existent, aber gering).

Außergewöhnliche Themen

Im Moment, zumindest was ChatGPT betrifft, scheinen RAG-Anrufe (d. h. die Verwendung von Web-Recherchen für jede Benutzeranfrage, die nicht explizit oder implizit Web-Recherchen erfordert) selten autonom vom System gewählt zu werden, selbst wenn es um “marginale” Subdomänen geht.

Ein Beispiel für eine marginale Domäne ist “exotische” Software-Nutzung. In einem solchen Fall wird minimale verfügbare Quelldaten während der Ausbildung um Aufmerksamkeit gekämpft haben, und der “Außenseiter”-Status der Daten kann entweder aufmerksam gemacht oder als “marginal” oder “unbedeutend” abgestempelt worden sein – und selbst ein zusätzlicher Forenbeitrag, der nach dem Wissensstichtag des KI-Modells erstellt wurde, kann eine erhebliche Zunahme der verfügbaren Daten und der Qualität der Antwort für ein “kleines” Thema darstellen, was einen RAG-Anruf wertvoll macht.

Die Vorteile von RAG tendieren jedoch dazu, abzunehmen, wenn das Basismodell leistungsfähiger wird. Während kleinere Modelle erheblich von der Abruf-Funktion profitieren, zeigen größere Systeme wie Qwen3-4B oder GPT-4o-mini/-4o oft nur marginale oder sogar negative Verbesserungen durch RAG*.

Bei vielen Benchmarks führt die Abruf-Funktion mehr Ablenkung als Nutzen ein, was auf einen Kompromiss zwischen der Investition in ein größeres Modell mit mehr interner Abdeckung oder einem kleineren Modell mit Abruf-Funktion hindeutet.

Daher scheint RAG am nützlichsten zu sein, um Lücken in mittelgroßen Modellen zu kompensieren, die immer noch externe Fakten benötigen, aber diese mit weniger komplexen internen Heuristiken bewerten können.

Nur im Notfall verwenden

ChatGPTs Richtlinien für die Entscheidung, RAG zu verwenden, werden nicht offensichtlich durch seine angebliche System-Prompt** offengelegt, sondern werden implizit angesprochen (gegen Ende):

‘Verwenden Sie das Web-Tool, um auf aktuelle Informationen aus dem Web zuzugreifen oder wenn die Antwort auf die Benutzeranfrage Informationen über den Standort erfordert. Beispiele für den Einsatz des Web-Tools sind:

Lokale Informationen: Verwenden Sie das Web-Tool, um auf Fragen zu antworten, die Informationen über den Standort des Benutzers erfordern, wie z. B. das Wetter, lokale Unternehmen oder Veranstaltungen.

Frische: Wenn aktuelle Informationen zu einem Thema potenziell die Antwort ändern oder verbessern könnten, rufen Sie das Web-Tool auf, wenn Sie sonst ablehnen würden, eine Frage zu beantworten, weil Ihr Wissen möglicherweise veraltet ist.

Nische-Informationen: Wenn die Antwort von detaillierten Informationen profitieren würde, die nicht weit verbreitet oder verstanden sind (die möglicherweise im Internet gefunden werden), wie z. B. Details über ein kleines Viertel, ein weniger bekanntes Unternehmen oder abgelegene Vorschriften, verwenden Sie Web-Quellen direkt anstelle von auf vorheriger Ausbildung basierendem Wissen.

Genauigkeit: Wenn der Preis für einen kleinen Fehler oder veraltete Informationen hoch ist (z. B. die Verwendung einer veralteten Version einer Software-Bibliothek oder das Nichtwissen des Datums des nächsten Spiels für ein Sportteam), verwenden Sie das Web-Tool.’

Insbesondere können wir bemerken, dass diese Richtlinien RAG in Fällen fördern, in denen nativ trainierte Daten rar sind. Aber wie kommt das System zu diesem Verständnis? Der beiläufige Benutzer und Beobachter von ChatGPT könnte daraus schließen, dass das System, wenn das “Im Internet suchen”-Widget nach einer Pause angezeigt wird, einfach seine interne Heuristik für die Anfrage abgefragt und leer zurückgegeben hat.

Wir können auch bemerken, dass RAG implizit nur für eine sehr begrenzte Anzahl von Anwendungsfällen empfohlen wird. Dies lässt GPT empfehlen, seine eigene Heuristik abzufragen, in allen Fällen, in denen es nicht um eine “kritische” Situation (‘Genauigkeit’, am Ende des obigen Zitats) geht, für die überwältigende Mehrheit der faktischen Domänenanfragen, bei denen die Neigung des KI-Modells, zu halluzinieren, eine beachtliche Haftung darstellen kann.

Schlussfolgerung

Die Trends der aktuellen und jüngsten Forschung deuten darauf hin, dass heuristische Generierung schnell und billig ist, aber auch oft falsch; während RAG langsamer und teurer ist, aber viel häufiger richtig – umso mehr, je kleiner das Modell ist.

Basierend auf meiner eigenen Nutzung von ChatGPT würde ich argumentieren, dass OpenAI RAG viel zu selten verwendet, als Präzisionswerkzeug und nicht als täglicher Fahrer, insbesondere seit die Probleme mit wachsenden Kontextfenstern LLMs eher als je zuvor dazu bringen, zu halluzinieren, wenn lange Konversationen entstehen.

Diese Umstände könnten erheblich gelindert werden, indem heuristische Antworten auf webbasierte Autoritätsquellen ohne Warten auf den Endbenutzer, der die Ausgabe in Frage stellt oder darauf hereinfällt, und ohne dass interne Ergebnisse so offensichtlich unzureichend sein müssen, dass die Entscheidung, RAG zu verwenden, unvermeidlich ist.

Stattdessen könnte das System so trainiert werden, dass es selektiv und intelligent an sich selbst zweifelt und daher mit dem Internet durch einen Filterprozess interagiert, der selbst heuristisch wäre. Ich bin mir nicht bewusst, dass die Architekturen der aktuellen Modelle Raum für einen solchen Ansatz lassen, der stattdessen zur Reibung von API-Filtern hinzugefügt werden müsste.

Wie es steht, kann ich nicht einmal beweisen, dass es ein Problem gibt; nicht einmal mit einem Geständnis†:

ChatGPT gesteht

 

* Bitte verweisen Sie auf den Link am Anfang dieses Absatzes.

** Dies ist ein “selbstoffenbartes” GPT-5-System-Prompt, der wiederum einfach eine Zusammenfassung von Prompt-Forum-Beiträgen sein kann, die für GPT-5 neu trainiert wurden, obwohl einige behaupten, dass der Prompt echt ist.

† Ich bin wirklich nicht der Meinung, dass ChatGPTs “schuldige Offenheit” hier bedeutungsvoll ist; meine Tendenz, gegen die Parteilinie des OpenAI in Fragen der OpenAI-Richtlinie zurückzudrängen, bedeutet, dass es letztendlich mit mir “übereinstimmen” und meine eigenen impliziten Meinungen nachahmen wird. Dies ist weit entfernt von der Offenbarung der Details der Landung in der Normandie unter Druck.  

Erstveröffentlicht am Mittwoch, den 10. Dezember 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai