Podstawy AI
Dlaczego TwÃģj Biomedyczny RAG Ukrywa Przed TobÄ SprzecznoÅci

Standardowy biomedyczny RAG rozwiÄ zuje sprzeczne dowody w milczeniu w przybliÅženiu trzech na cztery zapytania. Naprawa jest strukturalna, a nie informacyjna â i wiÄkszoÅÄ zÅoÅžonoÅci, ktÃģrÄ dodajÄ zespoÅy, nie pomaga.
Zadaj pytanie asystentowi klinicznemu z funkcjÄ retrieval-augmented â czy melatonina pomaga w leczeniu jet lagu? â i literatura, ktÃģrÄ pobiera, nie bÄdzie zgadzaÄ siÄ sama z sobÄ .
PrzeglÄ d Cochrane wnioskowaÅ, Åže melatonina jest niezwykle skuteczna, a osiem na dziesiÄÄ wÅÄ czonych badaÅ wykazaÅo zmniejszenie objawÃģw jet lagu na lotach przekraczajÄ cych piÄÄ stref czasowych. Losowy, podwÃģjnie Ålepy test 257 norweskich lekarzy opublikowany w American Journal of Psychiatry nie wykazaÅ Åžadnych korzyÅci z Åžadnego z trzech schematÃģw melatoniny.
Oba dokumenty sÄ prawdziwe. Obie sÄ metodologicznie powaÅžne. KaÅždy klinicysta decydujÄ cy, co zaleciÄ, musi wiedzieÄ, Åže siÄ nie zgadzajÄ .
W kontrolowanych testach synteza zwykle nie mÃģwiÅa o tym. WyprodukowaÅa pÅynnie, poprawnie cytowany akapit, ktÃģry opowiedziaÅ siÄ po jednej stronie i nigdy nie sygnalizowaÅ, Åže istnieje inna strona.
To jest Ålepota sprzecznoÅci. Na benchmarku parze sprzecznoÅci biomedycznych wystÄ piÅo to w 72,6 procentach zapytaÅ (95% CI 0,697â0,755). WyjÅcie byÅo normalne. Cytaty byÅy rozwiÄ zane poprawnie. Standardowe kontrole jakoÅci przeszÅy. SprzecznoÅÄ po prostu zniknÄÅa.
Tryb awarii, ktÃģry wyglÄ da jak sukces
ChociaÅž nie ma bezpoÅredniej konwergencji w dowodach zwiÄ zanych z biomedycynÄ , badania pokazujÄ sprzeczne wyniki miÄdzy uÅžyciem badaÅ obserwacyjnych a randomizowanymi badaniami kontrolowanymi (RCT) oraz rÃģÅžnymi metodami stosowanymi dla rÃģÅžnych populacji pacjentÃģw; jednakÅže badanie moÅže rÃģwnieÅž zawieraÄ zarÃģwno silnÄ , jak i sÅabÄ metodologiÄ, co wydaje siÄ mieÄ takie same znaczenie.
To nie jest wyjÄ tkowy przypadek. Analiza Ioannidisa najczÄÅciej cytowanych badaÅ klinicznych wykazaÅa, Åže 16 procent najczÄÅciej cytowanych badaÅ zostaÅo pÃģÅšniej caÅkowicie obalone, a badania obserwacyjne byÅy znacznie bardziej prawdopodobne niÅž badania randomizowane do obalenia lub zmiany efektÃģw w dÃģÅ â piÄÄ na szeÅÄ, w przeciwieÅstwie do dziewiÄciu na trzydzieÅci dziewiÄÄ. Zatem problem nie leÅžy tylko w sprzecznoÅci miÄdzy badaniami, ale raczej w strukturalnej czÄÅci samej literatury.
Dlatego jako krytyczna funkcja kaÅždego biomedycznego systemu generacji z funkcjÄ retrieval-augmented generowanie dowodÃģw na sprzecznoÅci miÄdzy badaniami powinno byÄ gÅÃģwnym celem. Jednak wiÄkszoÅÄ systemÃģw nie wykonuje tego zadania. UÅžycie benchmarku HealthContradict z 920 parami sprzecznoÅci wykazaÅo, Åže standardowy system generacji z funkcjÄ retrieval-augmented nie generowaÅ sprzecznoÅci w przybliÅženiu 73 procentach par. Problem nie leÅžy w pobieraniu. System pobiera obie strony. NastÄpnie rozwiÄ zuje konflikt w milczeniu, na korzyÅÄ jednej ze stron.
RÄczne badanie 50 przypadkÃģw awarii wykazaÅo wzorzec, ktÃģry nazwaÅem epistemologicznym spÅaszczaniem. Obie dokumenty sÄ cytowane indywidualnie przez model, a jego przedstawienie konfliktu jest opisane w kategoriach gradientÃģw ufnoÅci (âdowody anegdotyczne âĶ naukowe badania wskazujÄ âĶâ) tak, jakby nie istniaÅ Åžaden konflikt. Mniej niÅž 5 procent tych przypadkÃģw awarii uÅžywaÅo sÅÃģw âsprzecznoÅÄâ, âkonfliktâ lub âniezgodnoÅÄâ w ogÃģle. Wygenerowany tekst miaÅ wskaÅšnik dokÅadnoÅci cytowania 0,99. To jest wÅaÅnie punkt: dokÅadnoÅÄ cytowania nie implikuje ÅwiadomoÅci sprzecznoÅci. System moÅže przypisaÄ kaÅžde zdanie doskonale i nadal powiedzieÄ klinicystce coÅ, czego nie wspiera podstawa dowodowa.
Trzy cechy âsyntezyâ RAG tworzÄ niebezpieczne Årodowisko kliniczne.
Odwrotna wartoÅÄ propozycji. Celem RAG jest wyÅwietlanie dowodÃģw istotnych dla klinicystÃģw. Dlatego przez usuniÄcie aspektu (aspektÃģw) tych dowodÃģw, ktÃģre sÄ najwaÅžniejsze dla klinicystÃģw do przeglÄ du, w rzeczywistoÅci wykonuje swoje przeciwieÅstwo.
Tworzenie niewidzialnoÅci. PoniewaÅž nie ma zastrzeÅženia, skrÃģcenia, artefaktu formatu; âspÅaszczonaâ synteza i wierna synteza wyglÄ dajÄ nieodrÃģÅžnialnie na ekranie.
Cichy zÅoÅžony wzrost w skali. Nic w standardowym zestawie oceny nie sygnalizuje tego, wiÄc system moÅže dziaÅaÄ w produkcji przez miesiÄ ce, podczas gdy kaÅžde zapytanie z konfliktem jest cicho rozwiÄ zywane w jednym kierunku.
Informacja nie jest dÅšwigniÄ
Oczywistym rozwiÄ zaniem tego problemu byÅoby poinformowanie modelu. WyraÅšnie, jeÅli tryb awarii polegaÅ na tym, Åže model nie identyfikowaÅ, Åže dwa dokumenty sÄ sprzeczne, moÅžna by po prostu dodaÄ etykietÄ âSUPPORTâ lub âCONTRADICTâ do kaÅždego z pobranych dokumentÃģw. To powinno oczywiÅcie poprawiÄ wyniki modelu. Nie poprawiÅo.
W eksperymencie, w ktÃģrym dodano etykiety stanu (poprzez adnotacjÄ), aby wyraÅšnie podaÄ modelowi informacjÄ, Åže dwa dokumenty sÄ sprzeczne, ustalono, Åže jawna adnotacja stanu przesunÄÅa ÅlepotÄ sprzecznoÅci z 93,8 procent w nieadnotowanym ramieniu kontrolnym do 91,4 procent â rÃģÅžnica z nakÅadajÄ cymi siÄ przedziaÅami ufnoÅci i brakiem praktycznego znaczenia. ChociaÅž model otrzymaÅ informacjÄ, Åže dwa dokumenty sÄ sprzeczne, jego domyÅlna odpowiedÅš pozostaÅa niezmieniona.
Zrozumienie mechanizmu jest tutaj uÅžyteczne. Informacje dodane biernie do podpowiedzi nie zmieniajÄ domyÅlnej odpowiedzi modelu. Dla sprzecznych pytaÅ biomedycznych ta odpowiedÅš silnie faworyzuje jednÄ skonsolidowanÄ pozycjÄ. Etykiety stanu stajÄ siÄ dodatkowymi tokenami â czÄsto przeksztaÅcanymi w nagÅÃģwki sekcji â podczas gdy proza powraca do swojego rodzaju.
Struktura jest dÅšwigniÄ
To, co dziaÅaÅo, byÅo strukturalne, a nie informacyjne; zamiast dostarczaÄ modelowi wszystkiego, co jest faktualne lub poprawne w dokumentach, struktura wymagaÅa, aby synteza byÅa konstruowana w kategoriach moÅžliwych sprzecznoÅci (Zgoda, Niezgoda, JakoÅÄ dowodÃģw, Wnioski). PodpowiedÅš z szkieletem dostarcza modelowi tyle samo informacji, co nieadnotowany kontrolny. JedynÄ rÃģÅžnicÄ jest to, co model musi zrobiÄ.
ByÅy redukcje okoÅo dziewiÄtnastokrotnego â z 93,8 procent do 4,9 procent â w Ålepocie sprzecznoÅci bez ponownego szkolenia, bez modyfikacji potoku, bez zwiÄkszonej latencji i bez zwiÄkszenia kosztÃģw na zapytanie.
To nie jest poprawione rozumowanie. To po prostu wymuszona alokacja. Gdy model musi dostarczyÄ sekcjÄ Niezgody, wraca do dokumentÃģw, ktÃģre poczÄ tkowo pobraÅ, szukajÄ c czegoÅ do umieszczenia w tej sekcji.

Ålepota sprzecznoÅci pod trzema warunkami syntezy w kontrolowanym ablacji. Dodanie informacji o stanie przesunÄÅo wskaÅšnik o 2,4 punkty; zmiana wymaganej struktury wyjÅciowej przesunÄÅa go o 86,5.
Strukturalne podpowiedzi sÄ mniej zwiÄ zane z polepszaniem zdolnoÅci modelu do rozumowania i bardziej z zapewnieniem lekkiej kontroli nad tym, jak zachowanie generacji modelu alokuje przestrzeÅ wyjÅciowÄ . Zmusza model do poÅwiÄcenia czÄÅci swojej przestrzeni wyjÅciowej na niezgodnoÅÄ (rÃģÅžnicÄ miÄdzy dostÄpnymi informacjami a informacjami, ktÃģre muszÄ pojawiÄ siÄ, aby speÅniÄ wymagania).
To zmienia powszechny zaÅoÅženie architektoniczne. WiÄkszoÅÄ proponowanych ulepszeÅ RAG dodaje informacje do kontekstu: wiÄcej dokumentÃģw, wyniki pobierania, etykiety stanu, metadane dowodÃģw. ChociaÅž synteza nie zmienia zachowania modelu, chyba Åže podpowiedÅš syntezy ma okreÅlone wymagania dotyczÄ ce tej informacji, aby uksztaÅtowaÄ strukturÄ wyjÅciowÄ . Zmiana wejÅcia przesuwa masÄ na obrzeÅžach; zmiana wymaganej struktury wyjÅciowej zmienia dystrybucje bezpoÅrednio
Dlaczego oczekiwane pomocnicy nie pomagajÄ
Dwa elementy powszechnie uwaÅžane za niezbÄdne dla ÅwiadomoÅci sprzecznoÅci w biomedycznym RAG okazaÅy siÄ praktycznie bezuÅžyteczne podczas testowania z kontrolowanÄ ablacjÄ .
1) RozkÅad PICO. PICO (Populacja, Interwencja, PorÃģwnanie, Wynik) to zorganizowany sposÃģb rozkÅadu pytaÅ klinicznych na czÄÅci skÅadowe do uÅžycia w medycynie opartej na dowodach. Hipoteza brzmiaÅa, Åže rozbicie twierdzeÅ na pola PICO ograniczy dryf zakresu i poprawi wykrywanie sprzecznoÅci w heterogenicznych dowodach. UsuniÄcie tego poziomu spowodowaÅo wygenerowanie wyjÅcia, ktÃģre byÅo niemal nieodrÃģÅžnialne od tego, ktÃģre wygenerowaÅ peÅny system. ChociaÅž PICO moÅže byÄ przydatne do organizowania myÅli podczas podejmowania decyzji klinicznych; jako Inferowany wejÅcie w czasie analizy w celu wspierania wykrywania sprzecznoÅci, nie ma Åžadnego wymiernego wkÅadu.
2) Jawna klasyfikacja stanu. W przeciwieÅstwie do usuniÄcia PICO, jawna klasyfikacja stanu dziaÅaÅa sÅabo, ale inaczej. W czystych korpusach akademickich wygenerowaÅa niewielkie zyski w niektÃģrych metrykach. Jednak podczas analizy szumu internetowego â co jest typowe dla tego, jak aplikacje zdrowotne dostÄpne dla konsumentÃģw bÄdÄ miaÅy dostÄp do informacji â klasyfikator zwrÃģciÅ NOT_ENOUGH_INFO dla wiÄkszoÅci dokumentÃģw, gÅÃģwnie dlatego, Åže autorzy treÅci zdrowotnej dostÄpnej dla konsumentÃģw zwykle nie deklarujÄ swojej pozycji, uÅžywajÄ c jÄzyka deklaratywnego oczekiwanego przez klasyfikator. W zwiÄ zku z tym te etykiety byÅy nieinformujÄ ce i byÅy nastÄpnie propagowane do kontekstu syntezy jako szum. UsuniÄcie tego etapu dla szumu korporacyjnego nieznacznie poprawiÅo wykrywanie sprzecznoÅci.
Prawdziwa wÄ ska garÅÄ jest w jakoÅci sygnaÅu
NajwaÅžniejszy wniosek z tego badania jest taki, Åže zdolnoÅÄ do rozpoznawania sprzecznoÅci w ÅšrÃģdÅach jest ograniczona przez to, jak dokÅadna jest informacja (dane) o tych ÅšrÃģdÅach, bardziej niÅž przez to, jak zostaÅy one zbudowane lub ustrukturyzowane.
Utylizacja jakoÅci dowodÃģw â proporcja przypadkÃģw, w ktÃģrych synteza preferencyjnie cytowaÅa ÅšrÃģdÅo o wyÅžszej jakoÅci, gdy oba byÅy dostÄpne â byÅa 0,83 na czystych abstraktach naukowych i spadÅa poniÅžej 0,15 na szumie internetowym. Semanticzna lojalnoÅÄ cytowania podÄ ÅžaÅa tym samym wzorcem, od 0,66 na abstraktach do 0,45 na treÅciach zdrowotnych dla konsumentÃģw.
ToÅžsame potoki, rÃģÅžne korpusy. ObsÅuga sprzecznoÅci jest ograniczona przez jawnoÅÄ sygnaÅÃģw w dokumentach ÅšrÃģdÅowych.
Istnieje strukturalny powÃģd. Dokumenty pobrane z rzeczywistoÅci czÄsto brakuje sygnaÅÃģw, na ktÃģre polega kaÅždy klasyfikator lub mechanizm waÅženia: metadane typu publikacji, jawne oÅwiadczenia o stanie, opisy metodologii. Abstrakty artykuÅÃģw recenzowanych oÅwiadczajÄ deklaratywnie o okreÅlonych populacjach, metodach i wynikach. Te same oÅwiadczenia sÄ robione w jÄzyku anegdotycznym, perswazyjnym i wahliwym w artykuÅach zdrowotnych dla konsumentÃģw. Dlatego teÅž identyczne systemy produkujÄ dramatycznie rÃģÅžne zachowania w dÃģÅ strumienia w zaleÅžnoÅci od tego, co otrzymujÄ jako dane wejÅciowe.
To potwierdza siÄ rÃģwnieÅž w najwiÄkszej ocenie ekspertÃģw medycznych RAG, opublikowanej kiedykolwiek, w ktÃģrej osiemnaÅcie ekspertÃģw medycznych przyczyniÅo siÄ do 80 502 adnotacji w 800 wyjÅciach modelu. Tylko 22 procent najlepszych pasaÅžÃģw pobranych byÅo istotnych. Standardowy RAG pogorszyÅ faktualnoÅÄ i kompletnoÅÄ w porÃģwnaniu z podstawowymi systemami non-RAG. Pobieranie i wybÃģr dowodÃģw, a nie generowanie, byÅy dominujÄ cymi punktami awarii â echo tego, co praca benchmarkowa nad medycznym RAG zgÅaszaÅa przez dwa lata.
ChociaÅž istnieje doÅÄ ograniczona implikacja tego odkrycia w zakresie zastosowania, moÅžna powiedzieÄ ostatecznie, Åže zdolnoÅÄ systemu do obsÅugi sprzecznoÅci podczas pobierania z abstraktÃģw PubMed nie moÅže byÄ przeniesiona na aplikacjÄ dostÄpnÄ dla konsumentÃģw, niezaleÅžnie od tego, jak zaawansowany jest reszta systemu.
Ålepa plama oceny
Pomiar obsÅugi sprzecznoÅci jest trudniejszy, niÅž siÄ wydaje, a nawet standardowy sposÃģb pomiaru obsÅugi sprzecznoÅci ma swoje wÅasne problemy.
Ocena LLM reprezentuje najczÄstszy sposÃģb oceny otwartych wynikÃģw RAG pod kÄ tem obsÅugi konfliktÃģw i rÃģwnieÅž odbiega od testÃģw potwierdzajÄ cych strukturalnych w kategoriach tego, jak sÄ one opracowane. Strategie podpowiedzi, ktÃģre organizujÄ syntezy w polach PICO, otrzymujÄ wysokie oceny od sÄdziÃģw, podczas gdy niepowodzenie testÃģw potwierdzajÄ cych wyraÅšnie. To jest oczekiwane: sÄdziowie LLM faworyzujÄ dÅuÅžsze, bardziej rozbudowane odpowiedzi i bÄdÄ rÃģwnieÅž postrzegaÄ zakopanÄ uwagÄ w sekcji wynikÃģw jako starannoÅÄ, kiedy nic w poziomie prozy nie odnosi siÄ do konfliktu.
Strategia pobierania wprowadza drugÄ puÅapkÄ. Losowe pobieranie produkuje wskaÅšnik Ålepoty sprzecznoÅci rÃģwny zero â synteza nie moÅže nie rozpoznaÄ sprzecznoÅci, ktÃģrej jej zestaw pobranych danych nie zawiera. Maksymalna istotnoÅÄ marginalna pobierania, z drugiej strony, zmniejszyÅa lojalnoÅÄ cytowania semantycznego do 0,11. KaÅždy wyglÄ da akceptowalnie pod jednÄ miarÄ obsÅugi sprzecznoÅci, ale oba zawodzÄ pod ocenÄ parami.
WiÄc sparuj miary. Uruchom trzy kontrole na kaÅždej syntezie: deterministycznÄ kontrolÄ strukturalnÄ dla jÄzyka wyraÅžonego, ktÃģry uznaje konflikt; sÄdziego LLM dla gÅÄbi i rÃģwnowagi; oraz kontrolÄ cytowania semantycznego potwierdzajÄ cÄ , Åže cytowany materiaÅ odpowiada swojemu ÅšrÃģdÅu. KaÅždy identyfikuje to, czego nie robiÄ inne. Åŧaden nie moÅže byÄ godnym zaufania samodzielnie jako benchmark dla obsÅugi sprzecznoÅci.
Cztery dziaÅania na ten kwartaÅ
- Przetestuj swojÄ liniÄ bazowÄ . KaÅždy biomedyczny, kliniczny, regulacyjny system RAG w produkcji musi byÄ przetestowany pod kÄ tem Ålepoty sprzecznoÅci przed dalszym wdroÅženiem. Aby przeprowadziÄ test, potrzebujesz zestawu testowego par sprzecznoÅci i kontroli na zapytanie, ktÃģra sygnalizuje istotnÄ niezgodnoÅÄ. Liniowa baza 72,6 procent nie jest zaokrÄ gleniem.
- WdroÅženie strukturalnych podpowiedzi syntezy. Cztery (wymagane) sekcje â Zgoda, Niezgoda, JakoÅÄ dowodÃģw, Wnioski â zmuszajÄ pasmo wyjÅciowe do niezgodnoÅci. Nie jest wymagana nowa infrastruktura; nie jest wymagane szkolenie; nie jest wymagany koszt na zapytanie; jedna zmiana wyprodukowaÅa dziewiÄtnastokrotnÄ redukcjÄ!
- Nie uÅžywaj MMR do zapytaÅ wraÅžliwych na sprzecznoÅci. ChociaÅž MMR uÅžywa zrÃģÅžnicowanych dokumentÃģw do pokrycia tematycznego, nie optymalizuje pokrycia stanu â co jest bÅÄdne, gdy celem jest pobranie obu stron sprzecznoÅci. Dlatego powinno siÄ uÅžywaÄ bm25 plus pobierania z osadzaniem jako bezpieczniejszy domyÅlny. JednakÅže dywersyfikacja Åwiadoma stanu wskazuje kierunek tej pracy.
- Sparuj swoje miary oceny. Zrezygnuj z pojedynczego wyniku sÄdziego LLM. PoÅÄ cz go z kontrolÄ strukturalnÄ dla istotnej treÅci pod nagÅÃģwkami uznania i kontrolÄ cytowania semantycznego, potwierdzajÄ cÄ , Åže cytowany dowÃģd wspiera stwierdzone twierdzenie.
Szerszy punkt
DominujÄ cy instynkt w rozwoju RAG jest addytywny: lepsi pobieracze, lepsi ponowni klasyfikatorzy, bogatsze metadane, dÅuÅžsze okna kontekstowe. PrzemysÅowa rozmowa o dlaczego potoki RAG nadal zawodzÄ w produkcji w duÅžej mierze podÄ ÅžaÅ tym samym ksztaÅtem. Dla obsÅugi sprzecznoÅci skutecznym posuniÄciem byÅo odjÄcie â ograniczenie tego, co system jest allowed do wyjÅcia, zamiast rozszerzania tego, co mu wolno zobaczyÄ.
To nie czyni architekturÄ nieistotnÄ . Pobieranie ustawia sufit, losowe pobieranie czyni syntezy bezsensownymi, a sÅaba jakoÅÄ dowodÃģw ogranicza wszystko w dÃģÅ strumienia. To jest dlaczego pytanie, czy systemy RAG rozwiÄ zujÄ problem niezawodnoÅci, nadal siÄ pojawia. Jednak to, co okreÅla, czy sprzeczne dowody sÄ reprezentowane jako sprzeczne, okazuje siÄ pÃģÅšniej w potoku i taniej w zmianie niÅž wiele innych komponentÃģw, co oznacza, Åže zmiany potrzebne do poprawy niezawodnoÅci mogÄ nastÄ piÄ wczeÅniej.
Droga praca â lepsze zestawy danych sprzecznoÅci, jawne sygnaÅy szkoleniowe niezgodnoÅci, pobieranie wraÅžliwe na stan, benchmarki rodzime sprzecznoÅci â wciÄ Åž musi byÄ wykonana i zajmie znacznie wiÄcej czasu.
Dlatego jeÅli chcesz wiedzieÄ, czy TwÃģj system ujawnia sprzeczne dowody jako sprzeczne, powinieneÅ zadaÄ sobie niekomfortowe pytanie i znaleÅšÄ odpowiedÅš w tym tygodniu: Czy TwÃģj system informuje uÅžytkownikÃģw, gdy jego dowody sÄ sprzeczne?












