Kąt Andersona

Heurystyki vs. RAG: Shrinkflation jako czynnik kształtujący politykę

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

W większości przypadkÃģw wyszukiwanie w sieci poprawia dokładność faktÃģw w odpowiedziach ChatGPT na nasze pytania. Dlaczego więc w klimacie, w ktÃģrym AI stara się o publiczną akceptację, ChatGPT domyślnie uÅžywa “przypuszczeń”?

 

Opinia To błąd sądzić, Åže LLM, takie jak ChatGPT, angaÅžują się w ujawnianie potencjalnie niejasnych praktyk swoich gospodarzy, nawet jeśli kosztowna i zmarnowana sesja wywołała Twoją złość na tyle, aby naprawdę zajrzeć w głąb systemu i jego wad:

Tu dyskusja na temat preferencji ChatGPT dla jego własnej logiki wewnętrznej (w przeciwieństwie do badań internetowych i weryfikacji za pomocą RAG – co daje mniej halucynacji, ale kosztuje więcej) wywołuje pozorny moment szczerości; ale weÅš to z przymruÅženiem oka. ÅđrÃģdło: chatgpt.com

Tu dyskusja na temat preferencji ChatGPT dla jego własnej logiki wewnętrznej (w przeciwieństwie do badań internetowych i weryfikacji za pomocą RAG – co daje mniej halucynacji, ale kosztuje więcej) wywołuje pozorny moment szczerości; ale weÅš to z przymruÅženiem oka. ÅđrÃģdło

PrzewaÅžnie – szczegÃģlnie dla modeli z pÃģÅšniejszymi datami granicznymi wiedzy – AI po prostu improwizuje na podstawie postÃģw na Reddit i forach widzianych podczas szkolenia. Nawet gdyby istniała jakakolwiek prawdziwa wartość takich “wglądÃģw”, niemoÅžliwe jest to udowodnić.

Jednak czasami te gorące wymiany prowadzą do odkrycia “sztuczek” (lub przynajmniej “trikÃģw”), ktÃģre obiecują zapobiec niektÃģrym z najgorszych nawykÃģw powtarzalności w LLM – takich jak wtedy, gdy w zeszłym tygodniu ChatGPT zasugerował, Åže mogę go nakłonić do pracy cięŞej i mniej halucynować, włączając adjurację ‘no heuristics’:

ChatGPT

UÅžyłem ‘no heuristics’ wiele razy od tego czasu, i nie raz model nie ulegał swojej własnej wiedzy po zamknięciu zapytania z tym poleceniem. Zamiast tego GPT natychmiast uÅžywa Retrieval Augmented Generation (RAG), wyszukując w internecie dokumenty oświetlające lub potwierdzające.

W praktyce, dla większości Şądań, nie jest to rÃģÅžne od nakazania systemowi “wyszukiwania w sieci” za kaÅždym razem, gdy wysyłasz zapytanie. Gdzie fraza “no heuristics” naprawdę moÅže pomÃģc, to wtedy, gdy prÃģbujesz nakłonić ChatGPT do przeczytania nowo przesłanego pliku PDF zamiast uÅžywania metadanych z poprzednich przesłanych plikÃģw PDF w tej sesji (lub innych moÅžliwych ÅšrÃģdeł), aby wyprodukować “prawdopodobną” ale całkowicie halucynowaną odpowiedÅš, nie czytając ani nie przeglądając dokumentu, ktÃģry właśnie przedstawiłeś.

ChatGPT

MÃģwiąc krÃģtko, im dłuÅžej trwa sesja rozmowy, tym mniej prawdopodobne jest, Åže to zadziała – i byłoby błędem myśleć, Åže jakikolwiek “trik” jest niezawodny lub pozostanie dostępny, gdy system ewoluuje.

Handel RAG

W kontekście rozwijającej się kultury shrinkflation, oraz faktu, Åže duÅže systemy, takie jak infrastruktura GPT OpenAI, są ogromnie dotknięte nawet przez najmniejsze powszechne zmiany w zachowaniu, łatwo jest uwierzyć, Åže jeden otrzymuje krÃģtkie waÅženie z wyborÃģw podejmowanych przez popularne LLM, takie jak ChatGPT.

Wybory, takie jak to, czy będzie sięgał do sieci z RAG; czy rozpocznie Chain-of-Thought (CoT) proces, ktÃģry moÅže uzyskać lepszy wynik, ale ktÃģry będzie kosztował więcej do wnioskowania i moÅže zmęczyć niecierpliwego uÅžytkownika; czy sięgnie po swoje własne wgrane osadzenia i lokalnie dostępną wiedzę – co jest najtańszym i najszybszym rozwiązaniem moÅžliwym.

Istnieją kilka praktycznych powodÃģw, dla ktÃģrych LLM z wraÅžliwym profilem publicznym, takim jak ChatGPT, moÅže preferować ograniczać swoje wywołania RAG, faworyzując swoje własne heurystyki. Po pierwsze, z punktu widzenia PR, częste niezainicjowane uÅžycie sieci wspiera popularną charakterystykę LLM jako zwykłych GooglerÃģw-by-proxy, zmniejszając wartość ich wrodzonej i drogo wytrenowanej wiedzy – oraz atrakcyjność płatnej subskrypcji.

Po drugie, infrastruktura RAG kosztuje pieniądze, aby ją uruchomić, utrzymać i zaktualizować, w porÃģwnaniu z relatywnie trywialnym kosztem wnioskowania lokalnego, tj. generacji parametrycznej, ktÃģra jest tania i szybka.

Po trzecie, system moÅže nie mieć skutecznej metody określania, czy RAG moÅže poprawić wyniki swoich własnych heurystyk – i często nie moÅže określić tego bez uruchomienia heurystyk najpierw. To pozostawia uÅžytkownikowi końcowemu zadanie oceny wyniku heurystycznego i Şądania wywołania RAG w przypadku, gdy wynik z heurystyk wydaje się nie spełniać oczekiwań.

Z punktu widzenia “shrinkflation AI”, liczba razy, gdy ChatGPT popełnia błędy za pomocą heurystyk i odnosi sukcesy za pomocą RAG, moÅže wskazywać, jak to niedawno zrobiło dla mnie, Åže system optymalizuje koszty zamiast wynikÃģw.

RAG staje się konieczny z czasem

Pomimo niedawnego “przyznania się” ChatGPT do mnie, Åže tak jest w istocie, “shrinkflation” ma szerszy kontekst w tym zakresie. ChociaÅž RAG nie jest tani, ani pod względem tarcia doświadczenia (przez opÃģÅšnienia), ani kosztÃģw, jest znacznie tańszy niÅž regularne dostosowywanie lub nawet ponowne szkolenie modelu podstawowego.

Dla starszego modelu AI z bardziej odległym datą graniczną, RAG moÅže utrzymać bieŞącość systemu, przy koszcie połączeń sieciowych i innych zasobÃģw; dla nowszego modelu, własne pobieranie RAG jest bardziej prawdopodobne, aby być zbędne lub uszkadzające jakości wynikÃģw, ktÃģre w niektÃģrych przypadkach byłyby lepsze dzięki heurystykom.

Dlatego AI wydaje się potrzebować zdolności nie tylko do rozstrzygania, czy powinno sięgać po RAG, ale takÅže do ciągłego ewoluowania swojej polityki dotyczącej uÅžycia RAG, gdy jego wewnętrzne wagi stają się coraz bardziej przestarzałe.

Jednocześnie system musi chronić “względne stałe” w wiedzy, takie jak orbity księŞycowe i klasyczna literatura, kultura i historia; a takÅže podstawową geografię, fizykę i inne naukowe załoÅženia, ktÃģre nie są prawdopodobne do ewolucji w czasie (tj. ryzyko “nagłej zmiany” nie jest nieistotne, ale niskie).

Tematy outliera

W tym momencie, przynajmniej jeśli chodzi o ChatGPT, wywołania RAG (tj. uÅžycie badań internetowych dla dowolnego zapytania uÅžytkownika, ktÃģre nie wymaga explicite lub implicite badań internetowych) wydają się rzadko wybierane przez system, nawet w przypadku “marginalnych” poddomen.

Jednym z takich przykładÃģw jest “obscure” uÅžycie oprogramowania. W takim przypadku minimalnie dostępne dane ÅšrÃģdłowe mogłyby z trudnością przyciągnąć uwagę podczas szkolenia, a status “outliera” danych mogłyby albo oznaczyć je jako godne uwagi, albo pogrzebać je jako “marginalne” lub “niewaÅžne” – a nawet jeden dodatkowy post na forum, opublikowany po dacie granicznej wiedzy AI, mÃģgłby reprezentować znaczny wzrost ogÃģlnych dostępnych danych i jakości odpowiedzi dla “małego” tematu, sprawiając, Åže wywołanie RAG jest warte.

JednakÅže zaleta RAG tendencja do malejącej wraz ze wzrostem mocy modelu podstawowego. Podczas gdy mniejsze modele korzystają znacznie z pobierania, większe systemy, takie jak Qwen3-4B lub GPT-4o-mini/-4o, często wykazują niewielką lub nawet ujemną poprawę z RAG*.

Na wielu benchmarkach, pobieranie wprowadza więcej rozpraszających czynnikÃģw niÅž korzyści, sugerując kompromis między inwestowaniem w większy model z większym wewnętrznym pokryciem, a mniejszym modelem połączonym z pobieraniem.

Dlatego RAG wydaje się najbardziej przydatny do rekompensaty luk w połowie–sized models, ktÃģre nadal potrzebują zewnętrznych faktÃģw, ale mogą je ocenić przy uÅžyciu mniej złoÅžonych heurystyk wewnętrznych.

UÅžywaj tylko w przypadku awaryjnym

Polityka kierująca ChatGPT w podejmowaniu decyzji o uÅžyciu RAG nie jest jawnie ujawniona przez jego systemowe polecenie**, ale jest implicite adresowana (ku końcowi):

‘UÅžyj narzędzia sieciowego, aby uzyskać dostęp do bieŞących informacji z sieci lub gdy odpowiedÅš na zapytanie uÅžytkownika wymaga informacji o jego lokalizacji. Przykłady, kiedy naleÅžy uÅžyć narzędzia sieciowego, obejmują:

Informacje lokalne: UÅžyj narzędzia sieciowego, aby odpowiedzieć na pytania, ktÃģre wymagają informacji o lokalizacji uÅžytkownika, takich jak pogoda, lokalne firmy lub wydarzenia.

ŚwieÅžość: Jeśli bieŞące informacje na temat mogą potencjalnie zmienić lub poprawić odpowiedÅš, wywołaj narzędzie sieciowe w kaÅždym przypadku, gdy odmÃģwiłbyś odpowiedzi na pytanie, poniewaÅž Twoja wiedza mogłaby być nieaktualna.

Informacje nisza: Jeśli odpowiedÅš mogłaby skorzystać na szczegÃģłowych informacjach, ktÃģre nie są powszechnie znane lub rozumiane (ktÃģre mogą być znalezione w internecie), takich jak szczegÃģły na temat małej dzielnicy, mniej znanej firmy lub arkaicznych przepisÃģw, uÅžyj ÅšrÃģdeł sieciowych bezpośrednio zamiast polegać na wiedzy destylowanej z pre-trenowania.

Dokładność: Jeśli koszt małego błędu lub nieaktualnych informacji jest wysoki (np. uÅžywanie przestarzałej wersji biblioteki oprogramowania lub nieznajomość daty następnego meczu dla druÅžyny sportowej), uÅžyj narzędzia sieciowego.’

W szczegÃģlności moÅžemy zauwaÅžyć, Åže te kierunki promują RAG w przypadkach, gdy rodzime dane szkoleniowe są rzadkie. Ale jak system dochodzi do tego zrozumienia? UÅžytkownik końcowy i obserwator ChatGPT moÅže wnioskować, Åže w tych przypadkach, gdy “wyszukiwanie w sieci” widget jest wyświetlany po pauzie, wewnętrzne heurystyki modelu zostały właśnie przypomniane dla zapytania i okazały się puste.

MoÅžemy rÃģwnieÅž zauwaÅžyć, Åže implicite, RAG jest zalecany tylko dla bardzo ograniczonej liczby przypadkÃģw uÅžycia. To pozostawia GPT zalecane, aby przypomnieć swoje własne wagi we wszystkich przypadkach, z wyjątkiem “krytycznej” kontyngencji (‘Dokładność’, na dole powyÅžszego cytatu), dla ogromnej liczby fakticznych zapytań domenowych, gdzie tendencja AI do halucynacji mogłaby być znaczącą wadą.

Podsumowanie

Trendy bieŞących i niedawnych badań wskazują, Åže generacja heurystyczna jest szybka i tania, ale często błędna; podczas gdy RAG jest wolniejszy, droÅžszy, ale znacznie częściej prawidłowy – tym bardziej w miarę malejącej wielkości modelu.

Na podstawie mojego własnego uÅžycia ChatGPT, argumentowałbym, Åže OpenAI uÅžywa RAG zbyt rzadko, jako precyzyjnego narzędzia, a nie codziennego kierowcy, szczegÃģlnie od czasu problemÃģw ze wzrostem okien kontekstowych sprawia, Åže LLM są bardziej skłonne do halucynacji, gdy rozwijają się długie rozmowy.

Okoliczność ta mogłaby być znacznie złagodzona przez sprawdzenie odpowiedzi heurystycznych zgodnie z autorytatywnymi ÅšrÃģdłami internetowymi, bez oczekiwania, aÅž uÅžytkownik końcowy zakwestionuje dane wyjściowe lub zostanie potknięty przez nie, i bez potrzeby, aby wewnętrzne wyniki były tak oczywiście niezadowalające, Åže decyzja o uÅžyciu RAG jest nieunikniona.

Zamiast tego system mÃģgłby być szkolony, aby selektywnie i inteligentnie wątpić w siebie według przypadkÃģw, i tym samym angaÅžować się w sieć za pomocą procesu, ktÃģry byłby sam w sobie heurystyczny. Nie jestem świadomy, czy architektury bieŞących modeli pozostawiają miejsce na podejście tego typu, ktÃģre musiałoby być dodane do tarcia filtrÃģw API.

Jak jest, nie mogę nawet udowodnić, Åže istnieje problem; nawet z †:

ChatGPT confesses

 

* Proszę odnieść się do linku na gÃģrze tego akapitu.

** To jest “samoujawniony” systemowy prompt GPT-5, ktÃģry, ponownie, moÅže być po prostu podsumowaniem z forum postÃģw przeszkolonych dla GPT-5, chociaÅž niektÃģrzy utrzymują, Åže prompt jest autentyczny.

† Nie sugeruję naprawdę, Åže “winna szczerość” ChatGPT jest znacząca tutaj; moja tendencja do sprzeciwiania się linii partii w sprawach polityki OpenAI oznacza, Åže w końcu “zgodzi się” ze mną i powtÃģrzy moje własne implicite opinie w kaÅždym przypadku. To jest daleko od rÃģwnoznacznego z wyjawieniem szczegÃģłÃģw lądowania w Normandii pod presją.  

Pierwotnie opublikowane w środę, 10 grudnia 2025

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]