Kąt Andersona
Heurystyki vs. RAG: Shrinkflation jako czynnik kształtujący politykę

W większości przypadków wyszukiwanie w sieci poprawia dokładność faktów w odpowiedziach ChatGPT na nasze pytania. Dlaczego więc w klimacie, w którym AI stara się o publiczną akceptację, ChatGPT domyślnie używa “przypuszczeń”?
Opinia To błąd sądzić, że LLM, takie jak ChatGPT, angażują się w ujawnianie potencjalnie niejasnych praktyk swoich gospodarzy, nawet jeśli kosztowna i zmarnowana sesja wywołała Twoją złość na tyle, aby naprawdę zajrzeć w głąb systemu i jego wad:

Tu dyskusja na temat preferencji ChatGPT dla jego własnej logiki wewnętrznej (w przeciwieństwie do badań internetowych i weryfikacji za pomocą RAG – co daje mniej halucynacji, ale kosztuje więcej) wywołuje pozorny moment szczerości; ale weź to z przymrużeniem oka. Źródło
Przeważnie – szczególnie dla modeli z późniejszymi datami granicznymi wiedzy – AI po prostu improwizuje na podstawie postów na Reddit i forach widzianych podczas szkolenia. Nawet gdyby istniała jakakolwiek prawdziwa wartość takich “wglądów”, niemożliwe jest to udowodnić.
Jednak czasami te gorące wymiany prowadzą do odkrycia “sztuczek” (lub przynajmniej “trików”), które obiecują zapobiec niektórym z najgorszych nawyków powtarzalności w LLM – takich jak wtedy, gdy w zeszłym tygodniu ChatGPT zasugerował, że mogę go nakłonić do pracy ciężej i mniej halucynować, włączając adjurację ‘no heuristics’:

Użyłem ‘no heuristics’ wiele razy od tego czasu, i nie raz model nie ulegał swojej własnej wiedzy po zamknięciu zapytania z tym poleceniem. Zamiast tego GPT natychmiast używa Retrieval Augmented Generation (RAG), wyszukując w internecie dokumenty oświetlające lub potwierdzające.
W praktyce, dla większości żądań, nie jest to różne od nakazania systemowi “wyszukiwania w sieci” za każdym razem, gdy wysyłasz zapytanie. Gdzie fraza “no heuristics” naprawdę może pomóc, to wtedy, gdy próbujesz nakłonić ChatGPT do przeczytania nowo przesłanego pliku PDF zamiast używania metadanych z poprzednich przesłanych plików PDF w tej sesji (lub innych możliwych źródeł), aby wyprodukować “prawdopodobną” ale całkowicie halucynowaną odpowiedź, nie czytając ani nie przeglądając dokumentu, który właśnie przedstawiłeś.

Mówiąc krótko, im dłużej trwa sesja rozmowy, tym mniej prawdopodobne jest, że to zadziała – i byłoby błędem myśleć, że jakikolwiek “trik” jest niezawodny lub pozostanie dostępny, gdy system ewoluuje.
Handel RAG
W kontekście rozwijającej się kultury shrinkflation, oraz faktu, że duże systemy, takie jak infrastruktura GPT OpenAI, są ogromnie dotknięte nawet przez najmniejsze powszechne zmiany w zachowaniu, łatwo jest uwierzyć, że jeden otrzymuje krótkie ważenie z wyborów podejmowanych przez popularne LLM, takie jak ChatGPT.
Wybory, takie jak to, czy będzie sięgał do sieci z RAG; czy rozpocznie Chain-of-Thought (CoT) proces, który może uzyskać lepszy wynik, ale który będzie kosztował więcej do wnioskowania i może zmęczyć niecierpliwego użytkownika; czy sięgnie po swoje własne wgrane osadzenia i lokalnie dostępną wiedzę – co jest najtańszym i najszybszym rozwiązaniem możliwym.
Istnieją kilka praktycznych powodów, dla których LLM z wrażliwym profilem publicznym, takim jak ChatGPT, może preferować ograniczać swoje wywołania RAG, faworyzując swoje własne heurystyki. Po pierwsze, z punktu widzenia PR, częste niezainicjowane użycie sieci wspiera popularną charakterystykę LLM jako zwykłych Googlerów-by-proxy, zmniejszając wartość ich wrodzonej i drogo wytrenowanej wiedzy – oraz atrakcyjność płatnej subskrypcji.
Po drugie, infrastruktura RAG kosztuje pieniądze, aby ją uruchomić, utrzymać i zaktualizować, w porównaniu z relatywnie trywialnym kosztem wnioskowania lokalnego, tj. generacji parametrycznej, która jest tania i szybka.
Po trzecie, system może nie mieć skutecznej metody określania, czy RAG może poprawić wyniki swoich własnych heurystyk – i często nie może określić tego bez uruchomienia heurystyk najpierw. To pozostawia użytkownikowi końcowemu zadanie oceny wyniku heurystycznego i żądania wywołania RAG w przypadku, gdy wynik z heurystyk wydaje się nie spełniać oczekiwań.
Z punktu widzenia “shrinkflation AI”, liczba razy, gdy ChatGPT popełnia błędy za pomocą heurystyk i odnosi sukcesy za pomocą RAG, może wskazywać, jak to niedawno zrobiło dla mnie, że system optymalizuje koszty zamiast wyników.
RAG staje się konieczny z czasem
Pomimo niedawnego “przyznania się” ChatGPT do mnie, że tak jest w istocie, “shrinkflation” ma szerszy kontekst w tym zakresie. Chociaż RAG nie jest tani, ani pod względem tarcia doświadczenia (przez opóźnienia), ani kosztów, jest znacznie tańszy niż regularne dostosowywanie lub nawet ponowne szkolenie modelu podstawowego.
Dla starszego modelu AI z bardziej odległym datą graniczną, RAG może utrzymać bieżącość systemu, przy koszcie połączeń sieciowych i innych zasobów; dla nowszego modelu, własne pobieranie RAG jest bardziej prawdopodobne, aby być zbędne lub uszkadzające jakości wyników, które w niektórych przypadkach byłyby lepsze dzięki heurystykom.
Dlatego AI wydaje się potrzebować zdolności nie tylko do rozstrzygania, czy powinno sięgać po RAG, ale także do ciągłego ewoluowania swojej polityki dotyczącej użycia RAG, gdy jego wewnętrzne wagi stają się coraz bardziej przestarzałe.
Jednocześnie system musi chronić “względne stałe” w wiedzy, takie jak orbity księżycowe i klasyczna literatura, kultura i historia; a także podstawową geografię, fizykę i inne naukowe założenia, które nie są prawdopodobne do ewolucji w czasie (tj. ryzyko “nagłej zmiany” nie jest nieistotne, ale niskie).
Tematy outliera
W tym momencie, przynajmniej jeśli chodzi o ChatGPT, wywołania RAG (tj. użycie badań internetowych dla dowolnego zapytania użytkownika, które nie wymaga explicite lub implicite badań internetowych) wydają się rzadko wybierane przez system, nawet w przypadku “marginalnych” poddomen.
Jednym z takich przykładów jest “obscure” użycie oprogramowania. W takim przypadku minimalnie dostępne dane źródłowe mogłyby z trudnością przyciągnąć uwagę podczas szkolenia, a status “outliera” danych mogłyby albo oznaczyć je jako godne uwagi, albo pogrzebać je jako “marginalne” lub “nieważne” – a nawet jeden dodatkowy post na forum, opublikowany po dacie granicznej wiedzy AI, mógłby reprezentować znaczny wzrost ogólnych dostępnych danych i jakości odpowiedzi dla “małego” tematu, sprawiając, że wywołanie RAG jest warte.
Jednakże zaleta RAG tendencja do malejącej wraz ze wzrostem mocy modelu podstawowego. Podczas gdy mniejsze modele korzystają znacznie z pobierania, większe systemy, takie jak Qwen3-4B lub GPT-4o-mini/-4o, często wykazują niewielką lub nawet ujemną poprawę z RAG*.
Na wielu benchmarkach, pobieranie wprowadza więcej rozpraszających czynników niż korzyści, sugerując kompromis między inwestowaniem w większy model z większym wewnętrznym pokryciem, a mniejszym modelem połączonym z pobieraniem.
Dlatego RAG wydaje się najbardziej przydatny do rekompensaty luk w połowie–sized models, które nadal potrzebują zewnętrznych faktów, ale mogą je ocenić przy użyciu mniej złożonych heurystyk wewnętrznych.
Używaj tylko w przypadku awaryjnym
Polityka kierująca ChatGPT w podejmowaniu decyzji o użyciu RAG nie jest jawnie ujawniona przez jego systemowe polecenie**, ale jest implicite adresowana (ku końcowi):
‘Użyj narzędzia sieciowego, aby uzyskać dostęp do bieżących informacji z sieci lub gdy odpowiedź na zapytanie użytkownika wymaga informacji o jego lokalizacji. Przykłady, kiedy należy użyć narzędzia sieciowego, obejmują:
Informacje lokalne: Użyj narzędzia sieciowego, aby odpowiedzieć na pytania, które wymagają informacji o lokalizacji użytkownika, takich jak pogoda, lokalne firmy lub wydarzenia.
Świeżość: Jeśli bieżące informacje na temat mogą potencjalnie zmienić lub poprawić odpowiedź, wywołaj narzędzie sieciowe w każdym przypadku, gdy odmówiłbyś odpowiedzi na pytanie, ponieważ Twoja wiedza mogłaby być nieaktualna.
Informacje nisza: Jeśli odpowiedź mogłaby skorzystać na szczegółowych informacjach, które nie są powszechnie znane lub rozumiane (które mogą być znalezione w internecie), takich jak szczegóły na temat małej dzielnicy, mniej znanej firmy lub arkaicznych przepisów, użyj źródeł sieciowych bezpośrednio zamiast polegać na wiedzy destylowanej z pre-trenowania.
Dokładność: Jeśli koszt małego błędu lub nieaktualnych informacji jest wysoki (np. używanie przestarzałej wersji biblioteki oprogramowania lub nieznajomość daty następnego meczu dla drużyny sportowej), użyj narzędzia sieciowego.’
W szczególności możemy zauważyć, że te kierunki promują RAG w przypadkach, gdy rodzime dane szkoleniowe są rzadkie. Ale jak system dochodzi do tego zrozumienia? Użytkownik końcowy i obserwator ChatGPT może wnioskować, że w tych przypadkach, gdy “wyszukiwanie w sieci” widget jest wyświetlany po pauzie, wewnętrzne heurystyki modelu zostały właśnie przypomniane dla zapytania i okazały się puste.
Możemy również zauważyć, że implicite, RAG jest zalecany tylko dla bardzo ograniczonej liczby przypadków użycia. To pozostawia GPT zalecane, aby przypomnieć swoje własne wagi we wszystkich przypadkach, z wyjątkiem “krytycznej” kontyngencji (‘Dokładność’, na dole powyższego cytatu), dla ogromnej liczby fakticznych zapytań domenowych, gdzie tendencja AI do halucynacji mogłaby być znaczącą wadą.
Podsumowanie
Trendy bieżących i niedawnych badań wskazują, że generacja heurystyczna jest szybka i tania, ale często błędna; podczas gdy RAG jest wolniejszy, droższy, ale znacznie częściej prawidłowy – tym bardziej w miarę malejącej wielkości modelu.
Na podstawie mojego własnego użycia ChatGPT, argumentowałbym, że OpenAI używa RAG zbyt rzadko, jako precyzyjnego narzędzia, a nie codziennego kierowcy, szczególnie od czasu problemów ze wzrostem okien kontekstowych sprawia, że LLM są bardziej skłonne do halucynacji, gdy rozwijają się długie rozmowy.
Okoliczność ta mogłaby być znacznie złagodzona przez sprawdzenie odpowiedzi heurystycznych zgodnie z autorytatywnymi źródłami internetowymi, bez oczekiwania, aż użytkownik końcowy zakwestionuje dane wyjściowe lub zostanie potknięty przez nie, i bez potrzeby, aby wewnętrzne wyniki były tak oczywiście niezadowalające, że decyzja o użyciu RAG jest nieunikniona.
Zamiast tego system mógłby być szkolony, aby selektywnie i inteligentnie wątpić w siebie według przypadków, i tym samym angażować się w sieć za pomocą procesu, który byłby sam w sobie heurystyczny. Nie jestem świadomy, czy architektury bieżących modeli pozostawiają miejsce na podejście tego typu, które musiałoby być dodane do tarcia filtrów API.
Jak jest, nie mogę nawet udowodnić, że istnieje problem; nawet z †:

* Proszę odnieść się do linku na górze tego akapitu.
** To jest “samoujawniony” systemowy prompt GPT-5, który, ponownie, może być po prostu podsumowaniem z forum postów przeszkolonych dla GPT-5, chociaż niektórzy utrzymują, że prompt jest autentyczny.
† Nie sugeruję naprawdę, że “winna szczerość” ChatGPT jest znacząca tutaj; moja tendencja do sprzeciwiania się linii partii w sprawach polityki OpenAI oznacza, że w końcu “zgodzi się” ze mną i powtórzy moje własne implicite opinie w każdym przypadku. To jest daleko od równoznacznego z wyjawieniem szczegółów lądowania w Normandii pod presją.
Pierwotnie opublikowane w środę, 10 grudnia 2025












