Andersonův úhel

Heuristika vs. RAG: Shrinkflation jako řídící politikum

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A tiny robot tries to type on a full-size laptop by using a pencil. Z-Image V1.

Většinou vede vyhledávání na webu ke zvýšení faktické přesnosti odpovědí ChatGPT na naše otázky. Proč tedy v době, kdy AI zápasí o veřejnou akceptaci, ChatGPT defaultně používá “odhady”?

 

Opinion Je chyba předpokládat, že LLM, jako je ChatGPT, se někdy zabývají whistleblowingem ohledně potenciálně pochybných praktik svých hostitelů, i když nákladná a zbytečná relace vyvolala váš hněv natolik, abyste se skutečně ponořili do nedostatků systému:

Zde diskuse o preferenci ChatGPT pro jeho vlastní interní logiku (oproti web-based výzkumu a verifikaci prostřednictvím RAG – které produkuje méně halucinací, ale stojí více) vyvolává zdánlivý moment upřímnosti; ale vezměte si to s rezervou. Zdroj: chatgpt.com

Zde diskuse o preferenci ChatGPT pro jeho vlastní interní logiku (oproti web-based výzkumu a verifikaci prostřednictvím RAG – které produkuje méně halucinací, ale stojí více) vyvolává zdánlivý moment upřímnosti; ale vezměte si to s rezervou. Zdroj

Většinou – zejména pro modely s pozdějšími daty omezení znalostí – je AI jednoduše improvizuje na základě příspěvků z Redditu a fór, které viděla během trénování. I kdyby existovala nějaká skutečná hodnota těchto “vnitřních informací”, je nemožné to prokázat.

Jednak tyto vášnivé výměny někdy vedou k objevu “hacků” (nebo alespoň “triků”), které slibují zabránit některým z nejhorších opakujících se návyků LLM – jako když ChatGPT navrhl, že bych ho mohl donutit pracovat tvrději a halucinovat méně tím, že bych zahrnul adjuraci ‘bez heuristiky’:

ChatGPT

Používám ‘bez heuristiky’ hodně od té doby a ani jednou se model neodvolal na své vlastní trénované znalosti po uzavření dotazu s tímto příkazem. Místo toho ChatGPT okamžitě používá Retrieval Augmented Generation (RAG), který prohledává internet pro osvětlující nebo potvrzující dokumenty.

V praxi je to pro většinu požadavků málo odlišné od toho, aby systém byl instruován “prohledat web” pokaždé, když je podán dotaz. Kde skutečně může pomoci fráze “bez heuristiky”, je když se snažíme donutit ChatGPT, aby skutečně přečetl nově nahráný PDF místo toho, aby používal metadata z předchozích PDF nahrávek v relaci (nebo mnoha dalších možných zdrojů), aby produkoval “přípustnou” ale zcela halucinovanou odpověď, aniž by přečetl nebo alespoň prolétl dokument, který jste právě představili.

ChatGPT

To řečeno, čím déle trvá chatovací relace, tím méně pravděpodobné, že to bude fungovat – a bylo by chybou předpokládat, že takový “trik” je spolehlivý nebo zůstane k dispozici, jakmile se systém vyvine.

Obchod s RAG

V kontextu rostoucí kultury shrinkflation a skutečnosti, že velké systémy, jako je infrastruktura GPT od OpenAI, jsou enormně ovlivněny i malými změnami v chování, je také snadné uvěřit, že jeden dostává krátkou váhu z voleb provedených populárními LLM, jako je ChatGPT.

Volby, jako je zda bude využívat web s RAG; zda zahájí Chain-of-Thought (CoT) proces, který by mohl získat lepší výsledek, ale který by stál více na inferenci a mohl by unavit netrpělivého uživatele; nebo zda se bude odvolávat na své vlastní trénované vložené znalosti – což je nejlevnější a nejrychlejší řešení možné.

Existuje několik praktických důvodů, proč by LLM s citlivým veřejným profilem, jako je ChatGPT, mohl omezit své volání RAG, místo toho preferující své vlastní heuristiky. První z nich je z hlediska PR perspektivy, kdy časté nepromptované použití webu podporuje populární charakterizaci LLM jako pouhých Googlerů-by-proxy, snižující hodnotu jejich vrozených a drahých trénovaných znalostí – a atraktivitu placené předplatného.

Druhý důvod je, že infrastruktura RAG stojí peníze na běh, údržbu a aktualizaci, ve srovnání s relativně zanedbatelnými náklady na lokální inferenci, tj. parametrickou generaci, která je levná a rychlá.

Třetí důvod je, že systém nemusí mít efektivní metodu pro určení, zda by RAG mohl zlepšit své vlastní heuristické výsledky – a často nemůže určit to bez spuštění heuristiky nejdříve. To zanechává koncového uživatele s úkolem vyhodnotit chybný heuristický výsledek a požadovat volání RAG v případě, že výsledek z heuristiky se zdál nedostatečný.

Z pohledu “AI shrinkflation” může počet chyb ChatGPT prostřednictvím heuristik a úspěchů prostřednictvím RAG naznačit, jako to nedávno naznačilo mně, že systém optimalizuje náklady spíše než výsledky.

RAG roste nezbytný s časem

Navzdory nedávnému “příznání” ChatGPT, že tomu tak skutečně je, “shrinkflation” má širší kontext v tomto ohledu. Ačkoli RAG není levný, ani z hlediska tření-zkušenosti (prostřednictvím latency) nebo nákladů na běh, je mnohem levnější než pravidelné jemné ladění nebo dokonce přetrénování základního modelu.

Pro starší model AI s vzdálenějším datem omezení znalostí může RAG udržet aktuálnost systému, za cenu síťových volání a dalších zdrojů; pro novější model jsou vlastní načtení RAG více pravděpodobně redundadní nebo poškozující kvalitu výsledků, které by v některých případech byly lepší prostřednictvím heuristik.

Proto by se zdálo, že AI potřebuje kapacitu nejen rozhodnout, zda se má odvolat na RAG, ale kontinuálně vyvíjet svou politiku pro použití RAG, jakmile jeho vnitřní váhy budou více a více zastaralé.

Současně potřebuje systém vymezit “relativní konstanty” v znalostech, jako jsou lunární orbity a klasická literatura, kultura a historie; stejně jako základní geografii, fyziku a další vědecké principy, které se nebudou měnit příliš s časem (tj. riziko “náhle změny” není nulové, ale nízké).

Outlier témata

V současné době, alespoň pokud jde o ChatGPT, se zdá, že volání RAG (tj. použití webu pro výzkum pro jakoukoli uživatelskou otázku, která nevyžaduje explicitně nebo implicitně web výzkum) málokdy jsou autonomně zvolena systémem, i když se jedná o “okrajová” subdomény.

Jedním z takových příkladů okrajové domény je “nepřehledné” použití softwaru. V takovém případě minimální dostupná zdrojová data bojovala o pozornost během trénování, a “outlier” status dat mohl buď upozornit na pozornost, nebo je pohřbít jako “okrajové” nebo “nepodstatné” – a dokonce jeden další fórum příspěvek po datu omezení znalostí AI by mohl reprezentovat podstatné zvýšení celkové dostupné datové kvality a odpovědi pro “malé” téma, dělající volání RAG smysluplným.

Avšak výhoda RAG téměř mizí, jakmile se základní model stává silnějším. Zatímco menší modely profitují významně z načtení, větší systémy, jako je Qwen3-4B nebo GPT-4o-mini/-4o, často ukazují marginální nebo dokonce negativní zlepšení z RAG*.

Na mnoha testech zavedení načtení více rozptyluje než prospívá, naznačující kompromis mezi investicí do většího modelu s více interními pokrytími nebo menšího modelu spojeného s načtením.

Proto se RAG zdá být nejvíce užitečný pro kompenzaci mezer ve středně velkýchmodelech, které stále potřebují externí fakta, ale mohou je vyhodnotit s méně složitými interními heuristikami.

Použijte pouze v případě nouze

Směrnice ChatGPT pro rozhodnutí o použití RAG nejsou explicitně uvedeny v jeho údajném systémovém promptu**, ale jsou implicitně řešeny (ke konci):

‘Použijte nástroj pro přístup k aktuálnímu informacím z webu nebo když odpověď na uživatele vyžaduje informace o jeho poloze. Některé příklady, kdy použít nástroj pro web, zahrnují:

Místní informace: Použijte nástroj pro web k odpovědi na otázky, které vyžadují informace o poloze uživatele, jako je počasí, místní podniky nebo události.

Čistota: Pokud by aktuální informace na téma mohly potenciálně změnit nebo vylepšit odpověď, zavolejte nástroj pro web pokaždé, kdy byste jinak odmítli odpovědět na otázku, protože vaše znalosti by mohly být zastaralé.

Niche informace: Pokud by odpověď profitovala z podrobných informací, které nejsou široce známy nebo chovány (které by mohly být nalezeny na internetu), jako jsou podrobnosti o malé čtvrti, méně známé společnosti nebo arcáněných regulacích, použijte zdroje webu přímo místo spoléhání se na destilované znalosti z předběžného trénování.

Přesnost: Pokud by cena malé chyby nebo zastaralé informace byla vysoká (například použití zastaralé verze softwarové knihovny nebo neznalosti data následujícího zápasu pro sportovní tým), pak použijte nástroj pro web.’

Zejména můžeme si všimnout, že tyto směrnice podporují RAG v případech, kdy jsou nativní trénované data vzácná. Ale jak systém dospěje k tomuto pochopení? Neformální uživatel a pozorovatel ChatGPT by mohl dospět k závěru, že v těch případech, kdy se “prohledávání webu” zobrazí po pauze, vnitřní heuristiky modelu byly právě dotázány pro dotaz a nepřišly s ničím.

Také si můžeme všimnout, že implicitně se RAG doporučuje pouze pro velmi omezený počet případů použití. To zanechává GPT doporučenému pro dotazování svých vlastních vah ve všech případech, kromě “kritické” kontingence (‘Přesnost’, na konci výše uvedené citace), pro obrovské množství fakticky založených dotazů, kde by tendence AI k halucinacím mohla být značnou vadou.

Závěr

Trendy současné a nedávné výzkumu naznačují, že heuristická generace je rychlá a levná, ale často chybná; zatímco RAG je pomalejší, dražší, ale mnohem častěji správný – čím více, tím menší je velikost modelu.

Založeno na mém vlastním použití ChatGPT, bych argumentoval, že OpenAI používá RAG příliš málo, jako přesnou nástroj spíše než denního řidiče, zejména protože problémy s rostoucími okny kontextu dělají LLM více náchylnými k halucinacím, jakmile se dlouhé konverzace vyvíjejí.

Tato okolnost by mohla být značně zmírněna kontrolou heuristických odpovědí proti web-based autoritativním zdrojům, bez čekání na to, až koncový uživatel pochybuje o výstupu nebo je trikován jím, a bez toho, aby vnitřní výsledky musely být tak zjevně uspokojivé, že rozhodnutí o použití RAG je nevyhnutelné.

Rather, systém by mohl být trénován, aby selektivně a inteligentně pochyboval o sobě podle případů, a proto aby se zapojil do webu prostřednictvím screeningového procesu, který by byl sám o sobě heuristický. Nejsem si vědom, zda architektury současných modelů zanechávají prostor pro přístup tohoto typu, který by musel být přidán k tření API filtrů.

Jak tomu je, nemohu ani prokázat, že existuje problém; ani s †:

ChatGPT se 'přízná'

 

* Prosím, odkážete se na odkaz na začátku tohoto odstavce.

** To je ‘sebeexponovaný’ systémový prompt GPT-5, který, opět, může být pouze souhrnem z prompt fóra příspěvků retrained pro GPT-5, i když někteří tvrdí, že prompt je skutečný.

† Skutečně nemám na mysli, že ‘vinná upřímnost’ ChatGPT je zde významná; moje tendence tlačit proti jeho stranické linii ve věcech OpenAI politiky znamená, že bude nakonec ‘souhlasit’ se mnou, a opakovat mé vlastní implicitní názory stejně. To je daleko od ekvivalentu k vyřknutí detailů vylodění v Normandii pod tlakem.

První publikace středa, 10. prosince 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai