Myslitelé

Skutečný důvod, proč vaše RAG potrubí stále halucinuje

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Víte rituál. Potrubí halucinovalo před zákazníkem, takže jste vyměnili model vkládání. Pak jste aktualizovali LLM. Pak jste přidali systémový prompt, který říká, v stále zoufalejších velkých písmenech, POUŽÍVEJTE POUZE POSKYTNUTÝ KONTEXT. A dnes ráno to s jistotou citovalo politický dokument, který neexistuje.

Jste ve dobré společnosti. Když výzkumníci z RegLab a HAI ze Stanfordu auditovali nástroje pro právní výzkum AI prodávané LexisNexis a Thomson Reuters (TRI ), produkty, které byly marketingově označeny jako “bez halucinací” díky generaci s podporou vyhledávání, našli míru halucinací mezi 17% a 34% u předem registrovaných právních dotazů. RAG skutečně pomohl: syrový GPT-4 halucinoval mnohem více. Ale mezera mezi “sníženou” a “eliminovanou” je tam, kde žijí produkční systémy, a tato mezera má strukturu.

Halucinace v RAG potrubí je zřídka jeden selhání. Je to tři, spiknutí: vyhledávání selhává tiše, model byl vyškolen, aby odpověděl stejně, a nic v potrubí neměří prostor mezi těmito dvěma skutečnostmi. Výměna modelů řeší žádnou z nich.

Spiklenec jeden: vyhledávání selhává častěji, než si myslíte

Nejčerstvější důkaz zde je také nejnesnesitelnější. V listopadu 2025 vytvořila skupina včetně 18 lékařských odborníků 80 502 anotací napříč 800 výstupy RAG na skutečných dotazech pacientů a USMLE-style dotazech. Standardní RAG nejenže nedodalo; degradovalo fakticitu až o 6% a úplnost o 5% ve srovnání se stejnými modely běhajícími bez vyhledávání. Kořenové příčiny seděly nad model LLM úplně: pouze 22% z top-16 vyhledaných pasáží byly relevantní pro dotaz.

Než budete odmítat to jako tvrdý doménový problém, Anthropic měřil selhání vyhledávání na čistých, kurátorovaných korpusech, zatímco vyvíjel svou kontextuální vyhledávací techniku, a našel standardní vyhledávání embedding selhání, aby našel potřebný kus v top 20 výsledcích 5,7% času. Jeden dotaz z osmnácti, na dobře upravených datech, s ničím exotickým se neděje.

To je důvod, proč klasická inženýrská taxonomie selhání RAG, Barnett et al.’s sedm bodů selhání, tolik záleží: tři z sedmi (chybějící obsah, vynechání top-rankovaných dokumentů a selhání konsolidace kontextu) se vyskytují předtím, než jazykový model vygeneruje jediný token. Unite.AI publikoval podrobný průchod této taxonomie a rámce hodnocení, které na ni mapují, takže jej zde nebudu znovu budovat. Bod, který tento článek přidává, se týká incentiv: podobnost vkládání je proxy pro relevanci, nikoli záruku jí, a recentní teoretická práce z Google DeepMind ukazuje, že jednovektorové vkládání má tvrdé matematické limity, pro které kombinace relevantních dokumentů mohou být reprezentovány vůbec. Vyhledávač, který vrací pravděpodobné, ale špatné kusy, dělá přesně to, co dělá kosinová podobnost.

Spiklenec dva: model byl vyškolen, aby hádal

Nyní dejte tuto vadnou kontext modelu a zeptejte se, co modelovo školení naučilo dělat s mezerami.

OpenAI odpověděl přímo ve své září 2025 práci Proč jazykové modely halucinují: standardní školení a hodnocení odměňují hádání nad uznáním nejistoty. Benchmarky skórují binární přesnost, zdržení skóruje nulu, a tak modely se učí, že sebevědomé hádání poráží prázdné. Práce sama dělá srovnání konkrétní: na SimpleQA, jeden model zdržel 1% času a byl špatný 75% času, zatímco jinak naladěný sourozenec zdržel 52% času a snížil chybovou míru na 26%.

RAG-specifické benchmarky ukazují, co tato incentiva dělají uvnitř potrubí. RGB benchmark testoval, zda modely odmítají odpovědět, když jim byly dány pouze irelevantní dokumenty. Nejlepší negativní odmítnutí napříč všemi testovanými modely bylo 45%, což znamená, že i nejlepší model, daný pouze odpadnímu kontextu, odpověděl stejně více než polovinu času. ClashEval našel zrcadlové selhání: když vyhledané obsahy popíraly znalosti, které model již měl správné, modely opustily svou vlastní správnou odpověď ve prospěch špatného kontextu více než 60% času. Víra selhává v obou směrech, a Salesforce’s FaithEval přidává znepokojivou pointu, že větší modely nejsou spolehlivě věrnější.

Anthropic’s interpretability tým dokonce stopnul mechanismus. Ve své analýze je odmítnutí výchozím obvodem modelu; “známá entita” funkce potlačuje to odmítnutí, když model rozpozná něco. Halucinace se vyskytují, když funkce selhává, když model rozpozná tvar vaší otázky, postrádá substance a konfabuluje do mezer.

A pokud doufáte, že hranice prostě poroste nad toto: Vectara’s halucinační leaderboard měří něco mnohem jednoduššího než RAG, shrnující jediný dokument umístěný přímo před modelem, a k jeho květnové aktualizaci 2026 GPT-4o stále vyráběl v 9,6% souhrnů a Claude Opus 4 v 12%. I když je vyhledávání dokonale vyřešeno, generace prosakuje.

Instinktivní oprava to zhoršuje

Čelíte všemu tomuto, většina týmů sahá po objemu. Vyhledávejte více kusů. Kupte si větší kontextové okno. Nacpejte všechno, co by mohlo pomoci, a nechte model, aby to rozdělil.

Důkazy běží tvrdě opačným směrem. Chroma’s kontextová studie testovala 18 modelů, včetně GPT-4.1, Claude 4 a Gemini 2.5, a našla, že výkon roste “stále méně spolehlivě, jak délka vstupu roste”, s jedním odvráceným dokumentem měřitelně snižujícím přesnost a čtyřmi odvrácenými dokumenty snižujícím ji podstatně. Dřívější Lost in the Middle výzkum našel slavnou U-křivku: informace pohřbené uprostřed kontextu jsou ignorovány i dlouhými kontextovými modely. A lékařská kontrola výše je to, jak tyto dynamiky vypadají od začátku do konce, systém, který vyhledává šestnáct pasáží, z nichž dvanáct a více jsou irelevantní, a pak předává hromadu modelu, který byl vyškolen, aby nikdy neříkal “nevím.”

Více vyhledávání bez větší přesnosti prostě vyrábí odvrácené dokumenty. Přesnost poráží recall v zakotvené generaci, a to není blízko.

Spiklenec tři: nikdo neměří mezeru

Barnett et al. umístili operativní pravdu do jedné řádky: “ověření RAG systému je možné pouze během provozu.” Nemůžete podepsat RAG potrubí ve fázi stagingu, protože jeho režimy selhání jsou společnou vlastností vašeho korpusu, vašich dotazů a vašich uživatelů, z nichž žádný se nezastaví.

Přesto většina produkčních potrubí sleduje kvalitu odpovědi na konci, což spojuje dva výše uvedené spiklence do jednoho nevysvětlitelného čísla. Standardní dekompozice, někdy nazývaná RAG triáda, odděluje relevanci kontextu (našel vyhledávání správný materiál?), zakotvenost (drží se odpověď na tomto materiálu?) a relevanci odpovědi (zabývá se odpověď dotazem?). Rámce, jako RAGAS a TruLens, implementují to. Budu upřímný, že neexistuje žádný přísný průzkum, který by kvantifikoval, kolik produkčních týmů běží tyto; co existuje, je záznam praktiků, a většina z nich popisuje hodnocení podle nálad. Pokud váš tým nemá žádný dashboard, který rozlišuje selhání vyhledávání od selhání víry, každá halucinace bude vypadat jako problém modelu, a budete pokračovat v nákupu oprav modelu.

Co skutečně funguje, v pořadí

Měřte vyhledávání odděleně od generace. Neokázalé opravy, které všichni přeskočí, a podle mého názoru nejvyšší priorita v tomto seznamu, protože převádí argument o tom, který model koupit, na diagnózu. Pokud je relevanci kontextu špatná, žádný generátor nemůže vás zachránit. Pokud je zakotvenost špatná s dobrým kontextem, žádný vyhledávač nemůže.

Postavte přesnostní zásobník. Anthropic’s publikované čísla jsou nejčistším demonstrací opraveného vyhledávání, které existuje: kontextuální chunk vkládání snížilo selhání vyhledávání v top 20 výsledcích z 5,7% na 3,7%, přidání BM25 hybridního vyhledávání (klasického klíčového vyhledávání vedle vektorového vyhledávání) jej snížilo na 2,9%, a přidání re-rankera, druhého modelu, který re-scores kandidátské kusy pro skutečnou relevanci, dosáhlo 1,9%, celkové snížení o 67%. Unite.AI pokryl proč dvoufázové vyhledávání funguje lépe, než jeho váha v detailu.

Odměňte zdržení. OpenAI’s předpis je penalizovat sebevědomé chyby více než vyjádřenou nejistotu, a můžete implementovat lokální verzi dnes: promptujte a hodnotíte “nevím” odpovědi, a přidáte kontrolu zakotvení, modelu implikace (NLI), který ověřuje každou generovanou tvrzení, zda je podporována vyhledaným textem, než odpověď odešle. RAGTruth práce ukázala, že malý fine-tuned detektor může odpovídat GPT-4 založenému promptování na chycení nepodporovaných tvrzení.

Přepište dotazy a filtrovejte důkazy. V lékařské kontrole, reformulace dotazu plus filtrování důkazů obnovilo až 12 bodů fakticity. Levné, nudné, efektivní.

Připomeňte si agentic vyhledávání jako poslední. Více-fázové vyhledávání, které uvažuje o tom, co stáhnout dál (primer zde) skutečně pomáhá tvrdým multi-hop dotazům, ale přidává latenci, náklady a nové režimy selhání. Je to korunovační kámen, ne základ.

Model byl nejméně poškozenou částí

Podívejte se zpět na rituál z otevření. Každý krok z něj, výměna vkládání, aktualizace modelu, křik systémového promptu, zacházel s halucinací jako s vadou generátoru. Důkazy říkají, že generátor dělal to, co jeho školení odměňuje, s materiály, které vaše vyhledávač předal, nezpozorované žádným metrikou, která by mohla říci, který z nich selhal.

Vaše RAG potrubí není rozbité. Je poslušné. Dělá přesně to, co jeho incentiva odměňují, a dokud nebudete měřit vyhledávání a generaci odděleně a nebudete dělat “nevím” skórovací kategorií místo selhání, tyto incentiva říkají: hádej.

Gary je odborný spisovatel s více než 10 lety zkušeností v oblasti softwarového vývoje, webového vývoje a strategie obsahu. Specializuje se na vytváření vysoce kvalitního, přitažlivého obsahu, který generuje konverze a buduje loajalitu značek. Má vášeň pro vytváření příběhů, které fascinují a informují publikum, a vždy hledá nové způsoby, jak zapojit uživatele.