KÄ t Andersona
Heurystyki vs. RAG: Shrinkflation jako czynnik ksztaÅtujÄ cy politykÄ

W wiÄkszoÅci przypadkÃģw wyszukiwanie w sieci poprawia dokÅadnoÅÄ faktÃģw w odpowiedziach ChatGPT na nasze pytania. Dlaczego wiÄc w klimacie, w ktÃģrym AI stara siÄ o publicznÄ akceptacjÄ, ChatGPT domyÅlnie uÅžywa âprzypuszczeÅâ?
Â
Opinia To bÅÄ d sÄ dziÄ, Åže LLM, takie jak ChatGPT, angaÅžujÄ siÄ w ujawnianie potencjalnie niejasnych praktyk swoich gospodarzy, nawet jeÅli kosztowna i zmarnowana sesja wywoÅaÅa TwojÄ zÅoÅÄ na tyle, aby naprawdÄ zajrzeÄ w gÅÄ b systemu i jego wad:

Tu dyskusja na temat preferencji ChatGPT dla jego wÅasnej logiki wewnÄtrznej (w przeciwieÅstwie do badaÅ internetowych i weryfikacji za pomocÄ RAG â co daje mniej halucynacji, ale kosztuje wiÄcej) wywoÅuje pozorny moment szczeroÅci; ale weÅš to z przymruÅženiem oka. ÅđrÃģdÅo
PrzewaÅžnie â szczegÃģlnie dla modeli z pÃģÅšniejszymi datami granicznymi wiedzy â AI po prostu improwizuje na podstawie postÃģw na Reddit i forach widzianych podczas szkolenia. Nawet gdyby istniaÅa jakakolwiek prawdziwa wartoÅÄ takich âwglÄ dÃģwâ, niemoÅžliwe jest to udowodniÄ.
Jednak czasami te gorÄ ce wymiany prowadzÄ do odkrycia âsztuczekâ (lub przynajmniej âtrikÃģwâ), ktÃģre obiecujÄ zapobiec niektÃģrym z najgorszych nawykÃģw powtarzalnoÅci w LLM â takich jak wtedy, gdy w zeszÅym tygodniu ChatGPT zasugerowaÅ, Åže mogÄ go nakÅoniÄ do pracy ciÄÅžej i mniej halucynowaÄ, wÅÄ czajÄ c adjuracjÄ âno heuristicsâ:

UÅžyÅem âno heuristicsâ wiele razy od tego czasu, i nie raz model nie ulegaÅ swojej wÅasnej wiedzy po zamkniÄciu zapytania z tym poleceniem. Zamiast tego GPT natychmiast uÅžywa Retrieval Augmented Generation (RAG), wyszukujÄ c w internecie dokumenty oÅwietlajÄ ce lub potwierdzajÄ ce.
W praktyce, dla wiÄkszoÅci ÅžÄ daÅ, nie jest to rÃģÅžne od nakazania systemowi âwyszukiwania w sieciâ za kaÅždym razem, gdy wysyÅasz zapytanie. Gdzie fraza âno heuristicsâ naprawdÄ moÅže pomÃģc, to wtedy, gdy prÃģbujesz nakÅoniÄ ChatGPT do przeczytania nowo przesÅanego pliku PDF zamiast uÅžywania metadanych z poprzednich przesÅanych plikÃģw PDF w tej sesji (lub innych moÅžliwych ÅšrÃģdeÅ), aby wyprodukowaÄ âprawdopodobnÄ â ale caÅkowicie halucynowanÄ odpowiedÅš, nie czytajÄ c ani nie przeglÄ dajÄ c dokumentu, ktÃģry wÅaÅnie przedstawiÅeÅ.

MÃģwiÄ c krÃģtko, im dÅuÅžej trwa sesja rozmowy, tym mniej prawdopodobne jest, Åže to zadziaÅa â i byÅoby bÅÄdem myÅleÄ, Åže jakikolwiek âtrikâ jest niezawodny lub pozostanie dostÄpny, gdy system ewoluuje.
Handel RAG
W kontekÅcie rozwijajÄ cej siÄ kultury shrinkflation, oraz faktu, Åže duÅže systemy, takie jak infrastruktura GPT OpenAI, sÄ ogromnie dotkniÄte nawet przez najmniejsze powszechne zmiany w zachowaniu, Åatwo jest uwierzyÄ, Åže jeden otrzymuje krÃģtkie waÅženie z wyborÃģw podejmowanych przez popularne LLM, takie jak ChatGPT.
Wybory, takie jak to, czy bÄdzie siÄgaÅ do sieci z RAG; czy rozpocznie Chain-of-Thought (CoT) proces, ktÃģry moÅže uzyskaÄ lepszy wynik, ale ktÃģry bÄdzie kosztowaÅ wiÄcej do wnioskowania i moÅže zmÄczyÄ niecierpliwego uÅžytkownika; czy siÄgnie po swoje wÅasne wgrane osadzenia i lokalnie dostÄpnÄ wiedzÄ â co jest najtaÅszym i najszybszym rozwiÄ zaniem moÅžliwym.
IstniejÄ kilka praktycznych powodÃģw, dla ktÃģrych LLM z wraÅžliwym profilem publicznym, takim jak ChatGPT, moÅže preferowaÄ ograniczaÄ swoje wywoÅania RAG, faworyzujÄ c swoje wÅasne heurystyki. Po pierwsze, z punktu widzenia PR, czÄste niezainicjowane uÅžycie sieci wspiera popularnÄ charakterystykÄ LLM jako zwykÅych GooglerÃģw-by-proxy, zmniejszajÄ c wartoÅÄ ich wrodzonej i drogo wytrenowanej wiedzy â oraz atrakcyjnoÅÄ pÅatnej subskrypcji.
Po drugie, infrastruktura RAG kosztuje pieniÄ dze, aby jÄ uruchomiÄ, utrzymaÄ i zaktualizowaÄ, w porÃģwnaniu z relatywnie trywialnym kosztem wnioskowania lokalnego, tj. generacji parametrycznej, ktÃģra jest tania i szybka.
Po trzecie, system moÅže nie mieÄ skutecznej metody okreÅlania, czy RAG moÅže poprawiÄ wyniki swoich wÅasnych heurystyk â i czÄsto nie moÅže okreÅliÄ tego bez uruchomienia heurystyk najpierw. To pozostawia uÅžytkownikowi koÅcowemu zadanie oceny wyniku heurystycznego i ÅžÄ dania wywoÅania RAG w przypadku, gdy wynik z heurystyk wydaje siÄ nie speÅniaÄ oczekiwaÅ.
Z punktu widzenia âshrinkflation AIâ, liczba razy, gdy ChatGPT popeÅnia bÅÄdy za pomocÄ heurystyk i odnosi sukcesy za pomocÄ RAG, moÅže wskazywaÄ, jak to niedawno zrobiÅo dla mnie, Åže system optymalizuje koszty zamiast wynikÃģw.
RAG staje siÄ konieczny z czasem
Pomimo niedawnego âprzyznania siÄâ ChatGPT do mnie, Åže tak jest w istocie, âshrinkflationâ ma szerszy kontekst w tym zakresie. ChociaÅž RAG nie jest tani, ani pod wzglÄdem tarcia doÅwiadczenia (przez opÃģÅšnienia), ani kosztÃģw, jest znacznie taÅszy niÅž regularne dostosowywanie lub nawet ponowne szkolenie modelu podstawowego.
Dla starszego modelu AI z bardziej odlegÅym datÄ granicznÄ , RAG moÅže utrzymaÄ bieÅžÄ coÅÄ systemu, przy koszcie poÅÄ czeÅ sieciowych i innych zasobÃģw; dla nowszego modelu, wÅasne pobieranie RAG jest bardziej prawdopodobne, aby byÄ zbÄdne lub uszkadzajÄ ce jakoÅci wynikÃģw, ktÃģre w niektÃģrych przypadkach byÅyby lepsze dziÄki heurystykom.
Dlatego AI wydaje siÄ potrzebowaÄ zdolnoÅci nie tylko do rozstrzygania, czy powinno siÄgaÄ po RAG, ale takÅže do ciÄ gÅego ewoluowania swojej polityki dotyczÄ cej uÅžycia RAG, gdy jego wewnÄtrzne wagi stajÄ siÄ coraz bardziej przestarzaÅe.
JednoczeÅnie system musi chroniÄ âwzglÄdne staÅeâ w wiedzy, takie jak orbity ksiÄÅžycowe i klasyczna literatura, kultura i historia; a takÅže podstawowÄ geografiÄ, fizykÄ i inne naukowe zaÅoÅženia, ktÃģre nie sÄ prawdopodobne do ewolucji w czasie (tj. ryzyko ânagÅej zmianyâ nie jest nieistotne, ale niskie).
Tematy outliera
W tym momencie, przynajmniej jeÅli chodzi o ChatGPT, wywoÅania RAG (tj. uÅžycie badaÅ internetowych dla dowolnego zapytania uÅžytkownika, ktÃģre nie wymaga explicite lub implicite badaÅ internetowych) wydajÄ siÄ rzadko wybierane przez system, nawet w przypadku âmarginalnychâ poddomen.
Jednym z takich przykÅadÃģw jest âobscureâ uÅžycie oprogramowania. W takim przypadku minimalnie dostÄpne dane ÅšrÃģdÅowe mogÅyby z trudnoÅciÄ przyciÄ gnÄ Ä uwagÄ podczas szkolenia, a status âoutlieraâ danych mogÅyby albo oznaczyÄ je jako godne uwagi, albo pogrzebaÄ je jako âmarginalneâ lub âniewaÅžneâ â a nawet jeden dodatkowy post na forum, opublikowany po dacie granicznej wiedzy AI, mÃģgÅby reprezentowaÄ znaczny wzrost ogÃģlnych dostÄpnych danych i jakoÅci odpowiedzi dla âmaÅegoâ tematu, sprawiajÄ c, Åže wywoÅanie RAG jest warte.
JednakÅže zaleta RAG tendencja do malejÄ cej wraz ze wzrostem mocy modelu podstawowego. Podczas gdy mniejsze modele korzystajÄ znacznie z pobierania, wiÄksze systemy, takie jak Qwen3-4B lub GPT-4o-mini/-4o, czÄsto wykazujÄ niewielkÄ lub nawet ujemnÄ poprawÄ z RAG*.
Na wielu benchmarkach, pobieranie wprowadza wiÄcej rozpraszajÄ cych czynnikÃģw niÅž korzyÅci, sugerujÄ c kompromis miÄdzy inwestowaniem w wiÄkszy model z wiÄkszym wewnÄtrznym pokryciem, a mniejszym modelem poÅÄ czonym z pobieraniem.
Dlatego RAG wydaje siÄ najbardziej przydatny do rekompensaty luk w poÅowieâsized models, ktÃģre nadal potrzebujÄ zewnÄtrznych faktÃģw, ale mogÄ je oceniÄ przy uÅžyciu mniej zÅoÅžonych heurystyk wewnÄtrznych.
UÅžywaj tylko w przypadku awaryjnym
Polityka kierujÄ ca ChatGPT w podejmowaniu decyzji o uÅžyciu RAG nie jest jawnie ujawniona przez jego systemowe polecenie**, ale jest implicite adresowana (ku koÅcowi):
âUÅžyj narzÄdzia sieciowego, aby uzyskaÄ dostÄp do bieÅžÄ cych informacji z sieci lub gdy odpowiedÅš na zapytanie uÅžytkownika wymaga informacji o jego lokalizacji. PrzykÅady, kiedy naleÅžy uÅžyÄ narzÄdzia sieciowego, obejmujÄ :
Informacje lokalne: UÅžyj narzÄdzia sieciowego, aby odpowiedzieÄ na pytania, ktÃģre wymagajÄ informacji o lokalizacji uÅžytkownika, takich jak pogoda, lokalne firmy lub wydarzenia.
ÅwieÅžoÅÄ: JeÅli bieÅžÄ ce informacje na temat mogÄ potencjalnie zmieniÄ lub poprawiÄ odpowiedÅš, wywoÅaj narzÄdzie sieciowe w kaÅždym przypadku, gdy odmÃģwiÅbyÅ odpowiedzi na pytanie, poniewaÅž Twoja wiedza mogÅaby byÄ nieaktualna.
Informacje nisza: JeÅli odpowiedÅš mogÅaby skorzystaÄ na szczegÃģÅowych informacjach, ktÃģre nie sÄ powszechnie znane lub rozumiane (ktÃģre mogÄ byÄ znalezione w internecie), takich jak szczegÃģÅy na temat maÅej dzielnicy, mniej znanej firmy lub arkaicznych przepisÃģw, uÅžyj ÅšrÃģdeÅ sieciowych bezpoÅrednio zamiast polegaÄ na wiedzy destylowanej z pre-trenowania.
DokÅadnoÅÄ: JeÅli koszt maÅego bÅÄdu lub nieaktualnych informacji jest wysoki (np. uÅžywanie przestarzaÅej wersji biblioteki oprogramowania lub nieznajomoÅÄ daty nastÄpnego meczu dla druÅžyny sportowej), uÅžyj narzÄdzia sieciowego.â
W szczegÃģlnoÅci moÅžemy zauwaÅžyÄ, Åže te kierunki promujÄ RAG w przypadkach, gdy rodzime dane szkoleniowe sÄ rzadkie. Ale jak system dochodzi do tego zrozumienia? UÅžytkownik koÅcowy i obserwator ChatGPT moÅže wnioskowaÄ, Åže w tych przypadkach, gdy âwyszukiwanie w sieciâ widget jest wyÅwietlany po pauzie, wewnÄtrzne heurystyki modelu zostaÅy wÅaÅnie przypomniane dla zapytania i okazaÅy siÄ puste.
MoÅžemy rÃģwnieÅž zauwaÅžyÄ, Åže implicite, RAG jest zalecany tylko dla bardzo ograniczonej liczby przypadkÃģw uÅžycia. To pozostawia GPT zalecane, aby przypomnieÄ swoje wÅasne wagi we wszystkich przypadkach, z wyjÄ tkiem âkrytycznejâ kontyngencji (âDokÅadnoÅÄâ, na dole powyÅžszego cytatu), dla ogromnej liczby fakticznych zapytaÅ domenowych, gdzie tendencja AI do halucynacji mogÅaby byÄ znaczÄ cÄ wadÄ .
Podsumowanie
Trendy bieÅžÄ cych i niedawnych badaÅ wskazujÄ , Åže generacja heurystyczna jest szybka i tania, ale czÄsto bÅÄdna; podczas gdy RAG jest wolniejszy, droÅžszy, ale znacznie czÄÅciej prawidÅowy â tym bardziej w miarÄ malejÄ cej wielkoÅci modelu.
Na podstawie mojego wÅasnego uÅžycia ChatGPT, argumentowaÅbym, Åže OpenAI uÅžywa RAG zbyt rzadko, jako precyzyjnego narzÄdzia, a nie codziennego kierowcy, szczegÃģlnie od czasu problemÃģw ze wzrostem okien kontekstowych sprawia, Åže LLM sÄ bardziej skÅonne do halucynacji, gdy rozwijajÄ siÄ dÅugie rozmowy.
OkolicznoÅÄ ta mogÅaby byÄ znacznie zÅagodzona przez sprawdzenie odpowiedzi heurystycznych zgodnie z autorytatywnymi ÅšrÃģdÅami internetowymi, bez oczekiwania, aÅž uÅžytkownik koÅcowy zakwestionuje dane wyjÅciowe lub zostanie potkniÄty przez nie, i bez potrzeby, aby wewnÄtrzne wyniki byÅy tak oczywiÅcie niezadowalajÄ ce, Åže decyzja o uÅžyciu RAG jest nieunikniona.
Zamiast tego system mÃģgÅby byÄ szkolony, aby selektywnie i inteligentnie wÄ tpiÄ w siebie wedÅug przypadkÃģw, i tym samym angaÅžowaÄ siÄ w sieÄ za pomocÄ procesu, ktÃģry byÅby sam w sobie heurystyczny. Nie jestem Åwiadomy, czy architektury bieÅžÄ cych modeli pozostawiajÄ miejsce na podejÅcie tego typu, ktÃģre musiaÅoby byÄ dodane do tarcia filtrÃģw API.
Jak jest, nie mogÄ nawet udowodniÄ, Åže istnieje problem; nawet z â :

Â
* ProszÄ odnieÅÄ siÄ do linku na gÃģrze tego akapitu.
** To jest âsamoujawnionyâ systemowy prompt GPT-5, ktÃģry, ponownie, moÅže byÄ po prostu podsumowaniem z forum postÃģw przeszkolonych dla GPT-5, chociaÅž niektÃģrzy utrzymujÄ , Åže prompt jest autentyczny.
â Nie sugerujÄ naprawdÄ, Åže âwinna szczeroÅÄâ ChatGPT jest znaczÄ ca tutaj; moja tendencja do sprzeciwiania siÄ linii partii w sprawach polityki OpenAI oznacza, Åže w koÅcu âzgodzi siÄâ ze mnÄ i powtÃģrzy moje wÅasne implicite opinie w kaÅždym przypadku. To jest daleko od rÃģwnoznacznego z wyjawieniem szczegÃģÅÃģw lÄ dowania w Normandii pod presjÄ . Â
Pierwotnie opublikowane w ÅrodÄ, 10 grudnia 2025












