Základy AI

Proč váš biomedicínský RAG skrývá rozporuplnosti před vámi

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Standardní biomedicínský RAG řeší rozporuplné důkazy potichu v přibližně třech ze čtyř dotazů. Oprava je strukturální, ne informační – a většina komplexity, kterou přidávají týmy, nepomůže.

Zeptejte se asistenta s retrieval-augmented klinickým asistentem na jednoduchou otázku – pomáhá melatonin s jet lag? – a literatura, kterou načte, nebude souhlasit sama se sebou.

Přehled Cochrane dospěl k závěru, že melatonin je pozoruhodně účinný, s osmi z deseti zahrnutých studií, které ukazují snížení jet lagu u letů, které překračují pět nebo více časových zón. Randomizovaná, dvojitě zaslepená studie 257 norských lékařů v American Journal of Psychiatry nezjistila žádný benefit z melatoninu.

Oba dokumenty jsou skutečné. Obě jsou metodologicky vážné. Jakýkoli klinický pracovník, který rozhoduje, co doporučit, potřebuje vědět, že se liší.

V kontrolovaném testování syntéza obvykle neřekla nic. Vytvořila plynulý, správně citovaný odstavec, který se přiklonil na jednu stranu a nikdy neznačil, že existuje druhá strana.

To je kontradikční slepota. Na kontradikční-párové biomedicínské benchmarku se to stalo v 72,6 procentech dotazů (95% CI 0,697–0,755). Výstup vypadal normálně. Citace byly řešeny správně. Standardní kontrolní testy prošly. Rozpor prostě zmizel.

Režim selhání, který vypadá jako úspěch

Zatímco neexistuje přímá konvergence v biomedicínsky souvisejících důkazech, studie ukazují rozporuplné výsledky mezi použitím observačních studií a randomizovaných kontrolovaných studií (RCT) a také různé metody používané pro různé populace pacientů; nicméně, studie může zahrnovat jak silnou, tak slabou metodologii, což by se zdálo, že má stejnou váhu.

To není jedinečný případ. Ioannidisova analýza vysoce citovaných klinických výzkumů nalezla, že 16 procent nejvíce citovaných studií bylo později vyvráceno, a že observační studie byly mnohem více pravděpodobné než randomizované studie, aby byly vyvráceny nebo aby jejich účinky byly revidovány dolů – pět ze šesti, proti devíti z třiceti devíti. Tímto se problém nestává pouze nesouhlasem mezi studiemi, ale spíše strukturální součástí literatury samotné.

Proto je jako kritická funkce každého biomedicínského retrieval-augmented generátoru, generování důkazů o nesouhlasech mezi studiemi by mělo být primárním cílem. Nicméně, většina systémů selhává při splnění této úkolu. Použití HealthContradict benchmarku s 920 kontradikčními párovými příklady prokázalo, že standardní retrieval-augmented generátor (RAG) selhal při generování nesouhlasů v přibližně 73 procentech testovaných párů. Problém není v načtení. Systém načte obě strany. Poté potichu vyřeší konflikt ve prospěch jedné z nich.

Ruční prohlížení 50 stratifikovaných případů selhání produkovalo vzorec, který jsem nazval epistemologickým zploštěním. Obě dokumenty jsou citovány jednotlivě modelem a jeho rendering konfliktu je popsán v termínech confidence gradientů („anekdotické důkazy … vědecké studie ukazují…“) jako by žádný konflikt neexistoval. Méně než 5 procent těchto případů selhání použilo slova „kontradikce“, „konflikt“ nebo „nesouhlas“ vůbec. Výstup generovaný měl citační přesnost 0,99. To je přesně ten bod: citační přesnost neznamená kontradikční povědomí. Systém může připsat každý odstavec dokonale a přesto říci klinickému pracovníkovi něco, co důkazová základna nepodporuje.

Tři funkce RAG „syntézy“ vytvářejí nebezpečné klinické prostředí.

Invertování hodnoty. Účelem RAG je zobrazit důkazy relevantní pro klinické pracovníky. Protože tím, že odstraní aspekt(y) těch důkazů, které jsou nejvíce důležité pro klinické pracovníky, aby je prohlédli, vlastně dosáhne svého opaku.

Vytvoření neviditelnosti. Pоскольку neexistuje žádný hedge, nebo truncation, nebo formátový artifact; „zploštělá“ syntéza a věrná syntéza vypadají na obrazovce nerozeznatelně.

Tiché sčítání ve velkém měřítku. Nic v standardním evaluačním balíčku to neznačí, takže systém může běžet v produkci po měsíce, zatímco každý konfliktní dotaz je potichu vyřešen v jednom směru.

Informace nejsou pákou

Zjevným řešením tohoto problému by bylo informovat model. Zjevně, pokud byl režim selhání takový, že model neidentifikoval, že dva dokumenty jsou kontradikční, můžete jednoduše přidat „SUPPORT“ nebo „CONTRADICT“ stance label k каждému z načtených dokumentů. To by mělo zjevně zlepšit výkon modelu. To se nestalo.

V experimentu, kde jsme přidali stance labely (pomocí anotací) explicitně dát modelu informaci, že dva dokumenty kontradikují, jsme zjistili, že explicitní stance anotace posunula kontradikční slepotu z 93,8 procent v neanotovaném kontrolním rameni na 91,4 procent – rozdíl s překrývajícími se intervaly spolehlivosti a žádným praktickým významem. Ačkoli model obdržel informaci, že dva dokumenty kontradikují, jeho výchozí odezva zůstala nezměněna.

Porozumění mechanismu je zde užitečné. Informace přidány pasivně do promptu nezmění výchozí odezvu modelu. Pro kontradikční biomedicínské otázky ta distribuce silně preferuje jeden konsolidovaný postoj. Stance labely se stávají dalšími tokeny – často recyklovány do sekčních záhlaví – zatímco próza se vrací k typu.

Struktura je pákou

Co fungovalo, bylo strukturální, nikoli informační; místo toho, aby se modelu poskytly všechny faktické nebo správné informace o dokumentech, struktura vyžadovala, aby syntéza byla konstruována v termínech možných nesouhlasů (Dohoda, Nesouhlas, Kvalita důkazů, Závěr). Scaffolded prompt poskytuje modelu žádnou další informaci než neanotovaný kontrolní model. Jediný rozdíl je v tom, co model musí udělat.

Byly redukce přibližně devatenáctinásobné – z 93,8 procent na 4,9 procent – kontradikční slepoty bez jakéhokoli přeškolování, bez jakýchkoli úprav pipeline, bez jakýchkoli zvýšení latence a bez jakýchkoli zvýšení nákladů na dotaz.

To není zlepšené myšlení. To je prostě vynucená alokace. Jakmile model musí poskytnout sekci Nesouhlas, vrátí se zpět k dokumentům, které původně načetl, a hledá něco, co by mohl zahrnout do této sekce.

Kontradikční slepota pod třemi syntetickými podmínkami v kontrolovaném ablation. Přidání stance informací posunulo rychlost o 2,4 bodu; změna požadované výstupní struktury posunula ji o 86,5.

Strukturované prompting je méně o zlepšení modelu schopnosti myslet a více o poskytování lehké governance nad tím, jak generuje model výstupní prostor. Vynucuje model, aby strávil část svého výstupního prostoru na nesouhlas (rozdíl mezi dostupnými informacemi a informacemi, které potřebují být zobrazeny, aby splnily požadavky).

To mění společnou architektonickou domněnku. Většina navrhovaných RAG vylepšení přidává informace do kontextu: více dokumentů, hodnocení načtení, stance tagy, metadata důkazů. Pokud syntetická prompt nemá specifické požadavky na tyto informace, aby formovala výstupní strukturu, většina z nich nezmění chování modelu. Změna vstupu posouvá hmotu na okrajích; změna požadované výstupní struktury mění distribuce přímo

Proč očekávaní pomocníci nepomáhají

Dva prvky, které jsou obecně považovány za nezbytné pro kontradikční biomedicínský RAG, poskytly velmi málo, když byly testovány s kontrolním ablationem.

1) PICO Dekompozice. PICO (Populace, Intervence, Srovnání, Výsledek) je organizovaným způsobem, jak rozložit klinické otázky na komponentní části pro použití v důkazech založených na medicíně. Hypotéza byla, že dekompozice tvrzení do PICO polí by omezila drift rozsahu a zlepšila kontradikční detekci napříč heterogenními důkazy. Odstranění této úrovně vedlo k výstupu, který byl téměř nerozeznatelný od toho, který byl vygenerován kompletním systémem. Ačkoli PICO může být užitečné pro organizaci vašich myšlenek během klinického rozhodování; jako inferovaná vstupní data v době analýzy pro podporu kontradikční detekce, nemá žádný měřitelný příspěvek.

2) Explicitní Stance Classification. Na rozdíl od odstranění PICO, explicitní stance klasifikace fungovala špatně, ale jinak. Na čistých akademických korporátních datech produkovala malé zisky na některých metrikách. Nicméně, při analýze šumu webového textu – který je typicky tím, jak spotřebitelsky orientované zdravotnické aplikace budou mít přístup k informacím – klasifikátor vrátil NOT_ENOUGH_INFO pro většinu dokumentů, primárně protože autoři spotřebitelsky orientovaného zdravotnického obsahu obvykle nevyjadřují svou pozici pomocí deklarativní jazykové expectancy klasifikátoru. V důsledku toho byly tyto labely jako neinformativní poté propagovány do syntetického kontextu jako šum. Odstranění této fáze pro šumové korporátní údaje marginálně zlepšilo kontradikční detekci.

Skutečná úzká místa jsou v kvalitě signálu

Největší závěr této studie je, že schopnost rozpoznat kontradikce v zdrojích je omezena tím, jak přesné jsou informace (data) o těchto zdrojích, více než tím, jak byly postaveny nebo strukturovány.

Využití kvality důkazů – podíl případů, kdy syntéza preferenčně cituje vyšší kvalitní zdroj, když jsou oba dostupné – bylo 0,83 na čistých vědeckých abstraktech a kleslo pod 0,15 na šumovém webovém načtení. Semantická citační věrnost následovala stejný vzorec, z 0,66 na abstraktech na 0,45 na spotřebitelsky orientovaném zdravotnickém obsahu.

Identické potrubí, různé korporátní údaje. Kontradikční zpracování je omezeno explicitností signálů v zdrojových dokumentech.

Existuje strukturální důvod pro to. Skutečné načtené dokumenty často postrádají signály, na které se klasifikátor nebo vážení mechanismus spoléhá: metadata typu publikace, explicitní prohlášení o postoji, popisy metodologie. Abstrakty peer-reviewed článků činí tvrzení deklarativně týkající se specifických populací, metodologií a výsledků. Stejné tvrzení jsou učiněna v anekdotických, přesvědčivých a zdrženlivých jazycích v spotřebitelsky orientovaných zdravotnických článcích. Proto stejné systémy produkují dramaticky odlišné chování po proudu na základě toho, co obdrží jako vstup.

To je také podporováno největší odbornou evaluací medicínského RAG, která byla kdy zveřejněna, ve které osmnáct medicínských odborníků přispělo 80 502 anotací napříč 800 modelovými výstupy. Pouze 22 procent z top-16 načtených pasáží bylo relevantních. Standardní RAG zhoršila fakticitu a úplnost ve srovnání s ne-RAG bazálními úrovněmi. Načtení a výběr důkazů, ne generování, byly dominantními body selhání – ozvěna toho, co benchmarková práce na medicínském RAG hlásila po dva roky.

Ačkoli existuje relativně omezený dopad tohoto zjištění z hlediska aplikace, lze říci definitivně, že schopnost vašeho systému zpracovat kontradikce, když načte z PubMed abstraktů, nelze přenést na spotřebitelsky orientovanou webovou stránku, bez ohledu na to, jak pokročilý je zbytek vašeho systému.

Vlastní slepá místa evaluace

Měření kontradikčního zpracování je složitější, než se zdá, a dokonce i standardní přístup k měření kontradikčního zpracování má své vlastní problémy.

LLM-judge scoring reprezentuje nejčastější způsob, jakým se otevřené RAG výstupy skórují pro konfliktové zpracování, a také se liší od strukturálních uznávacích kontrol v tom, jak jsou vyvinuty. Prompt strategie, které organizují syntézu do PICO polí, získávají vysoké skóre od soudců, zatímco selhávají explicitní uznávací testy zcela. To je očekávané: LLM soudci byli dokumentováni jako preferující delší, více propracované odpovědi a také budou považovat zakopaný caveat v outcome sekci za důkladnost, když nic v úrovni prózy neodkazuje na konflikt.

Načtení strategie představuje druhou past. Náhodné načtení produkuje kontradikční slepotu rychlostí nula – syntéza nemůže selhat uznat kontradikci, kterou její načtená sada neobsahuje. Maximální marginální relevance načtení, na druhé straně, snížilo semantickou citační věrnost na 0,11. Každý vypadá přijatelně pod jedním kontradikčním zpracováním metriky, ale oba selhávají pod párovou evaluací.

Takže spárujte metriky. Spusťte tři kontroly na každé syntéze: deterministickou strukturální kontrolu pro vyjádřený jazyk, který uznává konflikt; LLM soudce pro hloubku a vyváženost; a semantickou citační kontrolu potvrzující, že citované obsahy odpovídají svým zdrojům. Každý identifikuje to, co ostatní ne. Žádný z nich nemůže být důvěryhodný sám o sobě jako benchmark pro kontradikční zpracování.

Čtyři akce pro tento kvartál

  1. Otestujte svou bazální úroveň. Každý biomedicínský, klinický, regulační RAG systém v produkci musí být otestován na kontradikční slepotu před dalším nasazením. K provedení testu potřebujete kontradikční párové testovací sadu a kontrolu na dotaz, zda výstup signalizuje podstatný nesouhlas. 72,6procentní bazální úroveň není zaokrouhlovací chyba.
  2. Implementujte strukturované syntetické prompty. Čtyři (požadované) sekce – dohoda, nesouhlas, kvalita důkazů, závěr – vynucují výstupní pásmo na nesouhlasech. Není vyžadována žádná nová infrastruktura; žádné přeškolování; žádné zvýšení latence; žádné zvýšení nákladů na dotaz; jedna změna produkovala devatenáctinásobné snížení!
  3. Nepoužívejte MMR načtení pro kontradikční citlivé dotazy. Ačkoli MMR používá diverzifikované dokumenty pro topické pokrytí, neoptimalizuje pro postojové pokrytí – které je nesprávné, když cílem je načíst obě strany nesouhlasu. Proto by mělo být použito bm25 plus embedding načtení jako bezpečnější výchozí hodnota. Nicméně, postojově citlivé diverzifikace by byla směr, kterým by tato práce směřovala.
  4. Spárujte své evaluační metriky. Odejděte od jediného LLM-soudcovského skóre. Kombinujte ho se strukturální kontrolou pro podstatný obsah pod uznávacími záhlavími a semantickou citační kontrolou, která potvrzuje, že citované důkazy podporují tvrzený nárok.

Širší bod

Dominantní instinkt ve vývoji RAG je aditivní: lepší načtení, lepší re-rankery, bohatější metadata, delší kontextová okna. Průmyslová konverzace o tom, proč RAG potrubí stále selhávají v produkci, většinou následovala stejný tvar. Pro kontradikční zpracování byl účinný tah odstraněný – omezující to, co je systémovi dovoleno vyprodukovat, spíše než rozšiřování toho, co je mu dáno. Jeden čtyřčástný syntetický prompt překonal pětistupňové potrubí. To se stalo změnou toho, co model musel produkovat, ne tím, co model mohl vidět.

To nečiní architekturu irelevantní. Načtení nastavuje strop, náhodné načtení činí syntézu bezvýznamnou, a špatná kvalita důkazů omezuje vše po proudu. To je důvod, proč otázka zda RAG systémy řeší problém spolehlivosti, pokračuje v opětovném objevování. Nicméně, co určuje, zda se kontradikční důkazy zobrazí jako kontradikční, se ukázalo být později v potrubí a levnější na změnu než mnoho dalších komponent, což znamená, že změny potřebné ke zlepšení spolehlivosti mohou nastat dříve.

Drahá práce – lepší kontradikční sady, explicitní nesouhlasné tréninkové signály, postojově citlivé načtení, kontradikční benchmarky – stále potřebují být provedeny a budou trvat podstatně déle.

Proto, pokud chcete vědět, zda váš systém zobrazuje kontradikční důkazy jako kontradikční, měli byste si položit nepříjemnou otázku a najít odpověď tento týden: Zobrazí váš systém uživatelům, když jeho důkazy kontradikují?

Himanshu Goel je AI/ML výzkumník specializující se na generaci s využitím načtení pro oblasti s vysokými zárukami, včetně biomedicínských, finančních a regulačních pracovních postupů dokumentů.