Podstawy AI

Dlaczego TwÃģj Biomedyczny RAG Ukrywa Przed Tobą Sprzeczności

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

Standardowy biomedyczny RAG rozwiązuje sprzeczne dowody w milczeniu w przybliÅženiu trzech na cztery zapytania. Naprawa jest strukturalna, a nie informacyjna — i większość złoÅžoności, ktÃģrą dodają zespoły, nie pomaga.

Zadaj pytanie asystentowi klinicznemu z funkcją retrieval-augmented — czy melatonina pomaga w leczeniu jet lagu? — i literatura, ktÃģrą pobiera, nie będzie zgadzać się sama z sobą.

Przegląd Cochrane wnioskował, Åže melatonina jest niezwykle skuteczna, a osiem na dziesięć włączonych badań wykazało zmniejszenie objawÃģw jet lagu na lotach przekraczających pięć stref czasowych. Losowy, podwÃģjnie ślepy test 257 norweskich lekarzy opublikowany w American Journal of Psychiatry nie wykazał Åžadnych korzyści z Åžadnego z trzech schematÃģw melatoniny.

Oba dokumenty są prawdziwe. Obie są metodologicznie powaÅžne. KaÅždy klinicysta decydujący, co zalecić, musi wiedzieć, Åže się nie zgadzają.

W kontrolowanych testach synteza zwykle nie mÃģwiła o tym. Wyprodukowała płynnie, poprawnie cytowany akapit, ktÃģry opowiedział się po jednej stronie i nigdy nie sygnalizował, Åže istnieje inna strona.

To jest ślepota sprzeczności. Na benchmarku parze sprzeczności biomedycznych wystąpiło to w 72,6 procentach zapytań (95% CI 0,697–0,755). Wyjście było normalne. Cytaty były rozwiązane poprawnie. Standardowe kontrole jakości przeszły. Sprzeczność po prostu zniknęła.

Tryb awarii, ktÃģry wygląda jak sukces

ChociaÅž nie ma bezpośredniej konwergencji w dowodach związanych z biomedycyną, badania pokazują sprzeczne wyniki między uÅžyciem badań obserwacyjnych a randomizowanymi badaniami kontrolowanymi (RCT) oraz rÃģÅžnymi metodami stosowanymi dla rÃģÅžnych populacji pacjentÃģw; jednakÅže badanie moÅže rÃģwnieÅž zawierać zarÃģwno silną, jak i słabą metodologię, co wydaje się mieć takie same znaczenie.

To nie jest wyjątkowy przypadek. Analiza Ioannidisa najczęściej cytowanych badań klinicznych wykazała, Åže 16 procent najczęściej cytowanych badań zostało pÃģÅšniej całkowicie obalone, a badania obserwacyjne były znacznie bardziej prawdopodobne niÅž badania randomizowane do obalenia lub zmiany efektÃģw w dÃģł — pięć na sześć, w przeciwieństwie do dziewięciu na trzydzieści dziewięć. Zatem problem nie leÅžy tylko w sprzeczności między badaniami, ale raczej w strukturalnej części samej literatury.

Dlatego jako krytyczna funkcja kaÅždego biomedycznego systemu generacji z funkcją retrieval-augmented generowanie dowodÃģw na sprzeczności między badaniami powinno być głÃģwnym celem. Jednak większość systemÃģw nie wykonuje tego zadania. UÅžycie benchmarku HealthContradict z 920 parami sprzeczności wykazało, Åže standardowy system generacji z funkcją retrieval-augmented nie generował sprzeczności w przybliÅženiu 73 procentach par. Problem nie leÅžy w pobieraniu. System pobiera obie strony. Następnie rozwiązuje konflikt w milczeniu, na korzyść jednej ze stron.

Ręczne badanie 50 przypadkÃģw awarii wykazało wzorzec, ktÃģry nazwałem epistemologicznym spłaszczaniem. Obie dokumenty są cytowane indywidualnie przez model, a jego przedstawienie konfliktu jest opisane w kategoriach gradientÃģw ufności („dowody anegdotyczne â€Ķ naukowe badania wskazująâ€Ķ”) tak, jakby nie istniał Åžaden konflikt. Mniej niÅž 5 procent tych przypadkÃģw awarii uÅžywało słÃģw „sprzeczność”, „konflikt” lub „niezgodność” w ogÃģle. Wygenerowany tekst miał wskaÅšnik dokładności cytowania 0,99. To jest właśnie punkt: dokładność cytowania nie implikuje świadomości sprzeczności. System moÅže przypisać kaÅžde zdanie doskonale i nadal powiedzieć klinicystce coś, czego nie wspiera podstawa dowodowa.

Trzy cechy „syntezy” RAG tworzą niebezpieczne środowisko kliniczne.

Odwrotna wartość propozycji. Celem RAG jest wyświetlanie dowodÃģw istotnych dla klinicystÃģw. Dlatego przez usunięcie aspektu (aspektÃģw) tych dowodÃģw, ktÃģre są najwaÅžniejsze dla klinicystÃģw do przeglądu, w rzeczywistości wykonuje swoje przeciwieństwo.

Tworzenie niewidzialności. PoniewaÅž nie ma zastrzeÅženia, skrÃģcenia, artefaktu formatu; „spłaszczona” synteza i wierna synteza wyglądają nieodrÃģÅžnialnie na ekranie.

Cichy złoÅžony wzrost w skali. Nic w standardowym zestawie oceny nie sygnalizuje tego, więc system moÅže działać w produkcji przez miesiące, podczas gdy kaÅžde zapytanie z konfliktem jest cicho rozwiązywane w jednym kierunku.

Informacja nie jest dÅšwignią

Oczywistym rozwiązaniem tego problemu byłoby poinformowanie modelu. WyraÅšnie, jeśli tryb awarii polegał na tym, Åže model nie identyfikował, Åže dwa dokumenty są sprzeczne, moÅžna by po prostu dodać etykietę „SUPPORT” lub „CONTRADICT” do kaÅždego z pobranych dokumentÃģw. To powinno oczywiście poprawić wyniki modelu. Nie poprawiło.

W eksperymencie, w ktÃģrym dodano etykiety stanu (poprzez adnotację), aby wyraÅšnie podać modelowi informację, Åže dwa dokumenty są sprzeczne, ustalono, Åže jawna adnotacja stanu przesunęła ślepotę sprzeczności z 93,8 procent w nieadnotowanym ramieniu kontrolnym do 91,4 procent — rÃģÅžnica z nakładającymi się przedziałami ufności i brakiem praktycznego znaczenia. ChociaÅž model otrzymał informację, Åže dwa dokumenty są sprzeczne, jego domyślna odpowiedÅš pozostała niezmieniona.

Zrozumienie mechanizmu jest tutaj uÅžyteczne. Informacje dodane biernie do podpowiedzi nie zmieniają domyślnej odpowiedzi modelu. Dla sprzecznych pytań biomedycznych ta odpowiedÅš silnie faworyzuje jedną skonsolidowaną pozycję. Etykiety stanu stają się dodatkowymi tokenami — często przekształcanymi w nagłÃģwki sekcji — podczas gdy proza powraca do swojego rodzaju.

Struktura jest dÅšwignią

To, co działało, było strukturalne, a nie informacyjne; zamiast dostarczać modelowi wszystkiego, co jest faktualne lub poprawne w dokumentach, struktura wymagała, aby synteza była konstruowana w kategoriach moÅžliwych sprzeczności (Zgoda, Niezgoda, Jakość dowodÃģw, Wnioski). PodpowiedÅš z szkieletem dostarcza modelowi tyle samo informacji, co nieadnotowany kontrolny. Jedyną rÃģÅžnicą jest to, co model musi zrobić.

Były redukcje około dziewiętnastokrotnego — z 93,8 procent do 4,9 procent — w ślepocie sprzeczności bez ponownego szkolenia, bez modyfikacji potoku, bez zwiększonej latencji i bez zwiększenia kosztÃģw na zapytanie.

To nie jest poprawione rozumowanie. To po prostu wymuszona alokacja. Gdy model musi dostarczyć sekcję Niezgody, wraca do dokumentÃģw, ktÃģre początkowo pobrał, szukając czegoś do umieszczenia w tej sekcji.

Ślepota sprzeczności pod trzema warunkami syntezy w kontrolowanym ablacji. Dodanie informacji o stanie przesunęło wskaÅšnik o 2,4 punkty; zmiana wymaganej struktury wyjściowej przesunęła go o 86,5.

Strukturalne podpowiedzi są mniej związane z polepszaniem zdolności modelu do rozumowania i bardziej z zapewnieniem lekkiej kontroli nad tym, jak zachowanie generacji modelu alokuje przestrzeń wyjściową. Zmusza model do poświęcenia części swojej przestrzeni wyjściowej na niezgodność (rÃģÅžnicę między dostępnymi informacjami a informacjami, ktÃģre muszą pojawić się, aby spełnić wymagania).

To zmienia powszechny załoÅženie architektoniczne. Większość proponowanych ulepszeń RAG dodaje informacje do kontekstu: więcej dokumentÃģw, wyniki pobierania, etykiety stanu, metadane dowodÃģw. ChociaÅž synteza nie zmienia zachowania modelu, chyba Åže podpowiedÅš syntezy ma określone wymagania dotyczące tej informacji, aby ukształtować strukturę wyjściową. Zmiana wejścia przesuwa masę na obrzeÅžach; zmiana wymaganej struktury wyjściowej zmienia dystrybucje bezpośrednio

Dlaczego oczekiwane pomocnicy nie pomagają

Dwa elementy powszechnie uwaÅžane za niezbędne dla świadomości sprzeczności w biomedycznym RAG okazały się praktycznie bezuÅžyteczne podczas testowania z kontrolowaną ablacją.

1) Rozkład PICO. PICO (Populacja, Interwencja, PorÃģwnanie, Wynik) to zorganizowany sposÃģb rozkładu pytań klinicznych na części składowe do uÅžycia w medycynie opartej na dowodach. Hipoteza brzmiała, Åže rozbicie twierdzeń na pola PICO ograniczy dryf zakresu i poprawi wykrywanie sprzeczności w heterogenicznych dowodach. Usunięcie tego poziomu spowodowało wygenerowanie wyjścia, ktÃģre było niemal nieodrÃģÅžnialne od tego, ktÃģre wygenerował pełny system. ChociaÅž PICO moÅže być przydatne do organizowania myśli podczas podejmowania decyzji klinicznych; jako Inferowany wejście w czasie analizy w celu wspierania wykrywania sprzeczności, nie ma Åžadnego wymiernego wkładu.

2) Jawna klasyfikacja stanu. W przeciwieństwie do usunięcia PICO, jawna klasyfikacja stanu działała słabo, ale inaczej. W czystych korpusach akademickich wygenerowała niewielkie zyski w niektÃģrych metrykach. Jednak podczas analizy szumu internetowego — co jest typowe dla tego, jak aplikacje zdrowotne dostępne dla konsumentÃģw będą miały dostęp do informacji — klasyfikator zwrÃģcił NOT_ENOUGH_INFO dla większości dokumentÃģw, głÃģwnie dlatego, Åže autorzy treści zdrowotnej dostępnej dla konsumentÃģw zwykle nie deklarują swojej pozycji, uÅžywając języka deklaratywnego oczekiwanego przez klasyfikator. W związku z tym te etykiety były nieinformujące i były następnie propagowane do kontekstu syntezy jako szum. Usunięcie tego etapu dla szumu korporacyjnego nieznacznie poprawiło wykrywanie sprzeczności.

Prawdziwa wąska garść jest w jakości sygnału

NajwaÅžniejszy wniosek z tego badania jest taki, Åže zdolność do rozpoznawania sprzeczności w ÅšrÃģdłach jest ograniczona przez to, jak dokładna jest informacja (dane) o tych ÅšrÃģdłach, bardziej niÅž przez to, jak zostały one zbudowane lub ustrukturyzowane.

Utylizacja jakości dowodÃģw — proporcja przypadkÃģw, w ktÃģrych synteza preferencyjnie cytowała ÅšrÃģdło o wyÅžszej jakości, gdy oba były dostępne — była 0,83 na czystych abstraktach naukowych i spadła poniÅžej 0,15 na szumie internetowym. Semanticzna lojalność cytowania podÄ…Åžała tym samym wzorcem, od 0,66 na abstraktach do 0,45 na treściach zdrowotnych dla konsumentÃģw.

ToÅžsame potoki, rÃģÅžne korpusy. Obsługa sprzeczności jest ograniczona przez jawność sygnałÃģw w dokumentach ÅšrÃģdłowych.

Istnieje strukturalny powÃģd. Dokumenty pobrane z rzeczywistości często brakuje sygnałÃģw, na ktÃģre polega kaÅždy klasyfikator lub mechanizm waÅženia: metadane typu publikacji, jawne oświadczenia o stanie, opisy metodologii. Abstrakty artykułÃģw recenzowanych oświadczają deklaratywnie o określonych populacjach, metodach i wynikach. Te same oświadczenia są robione w języku anegdotycznym, perswazyjnym i wahliwym w artykułach zdrowotnych dla konsumentÃģw. Dlatego teÅž identyczne systemy produkują dramatycznie rÃģÅžne zachowania w dÃģł strumienia w zaleÅžności od tego, co otrzymują jako dane wejściowe.

To potwierdza się rÃģwnieÅž w największej ocenie ekspertÃģw medycznych RAG, opublikowanej kiedykolwiek, w ktÃģrej osiemnaście ekspertÃģw medycznych przyczyniło się do 80 502 adnotacji w 800 wyjściach modelu. Tylko 22 procent najlepszych pasaÅžÃģw pobranych było istotnych. Standardowy RAG pogorszył faktualność i kompletność w porÃģwnaniu z podstawowymi systemami non-RAG. Pobieranie i wybÃģr dowodÃģw, a nie generowanie, były dominującymi punktami awarii — echo tego, co praca benchmarkowa nad medycznym RAG zgłaszała przez dwa lata.

ChociaÅž istnieje dość ograniczona implikacja tego odkrycia w zakresie zastosowania, moÅžna powiedzieć ostatecznie, Åže zdolność systemu do obsługi sprzeczności podczas pobierania z abstraktÃģw PubMed nie moÅže być przeniesiona na aplikację dostępną dla konsumentÃģw, niezaleÅžnie od tego, jak zaawansowany jest reszta systemu.

Ślepa plama oceny

Pomiar obsługi sprzeczności jest trudniejszy, niÅž się wydaje, a nawet standardowy sposÃģb pomiaru obsługi sprzeczności ma swoje własne problemy.

Ocena LLM reprezentuje najczęstszy sposÃģb oceny otwartych wynikÃģw RAG pod kątem obsługi konfliktÃģw i rÃģwnieÅž odbiega od testÃģw potwierdzających strukturalnych w kategoriach tego, jak są one opracowane. Strategie podpowiedzi, ktÃģre organizują syntezy w polach PICO, otrzymują wysokie oceny od sędziÃģw, podczas gdy niepowodzenie testÃģw potwierdzających wyraÅšnie. To jest oczekiwane: sędziowie LLM faworyzują dłuÅžsze, bardziej rozbudowane odpowiedzi i będą rÃģwnieÅž postrzegać zakopaną uwagę w sekcji wynikÃģw jako staranność, kiedy nic w poziomie prozy nie odnosi się do konfliktu.

Strategia pobierania wprowadza drugą pułapkę. Losowe pobieranie produkuje wskaÅšnik ślepoty sprzeczności rÃģwny zero — synteza nie moÅže nie rozpoznać sprzeczności, ktÃģrej jej zestaw pobranych danych nie zawiera. Maksymalna istotność marginalna pobierania, z drugiej strony, zmniejszyła lojalność cytowania semantycznego do 0,11. KaÅždy wygląda akceptowalnie pod jedną miarą obsługi sprzeczności, ale oba zawodzą pod oceną parami.

Więc sparuj miary. Uruchom trzy kontrole na kaÅždej syntezie: deterministyczną kontrolę strukturalną dla języka wyraÅžonego, ktÃģry uznaje konflikt; sędziego LLM dla głębi i rÃģwnowagi; oraz kontrolę cytowania semantycznego potwierdzającą, Åže cytowany materiał odpowiada swojemu ÅšrÃģdłu. KaÅždy identyfikuje to, czego nie robią inne. Åŧaden nie moÅže być godnym zaufania samodzielnie jako benchmark dla obsługi sprzeczności.

Cztery działania na ten kwartał

  1. Przetestuj swoją linię bazową. KaÅždy biomedyczny, kliniczny, regulacyjny system RAG w produkcji musi być przetestowany pod kątem ślepoty sprzeczności przed dalszym wdroÅženiem. Aby przeprowadzić test, potrzebujesz zestawu testowego par sprzeczności i kontroli na zapytanie, ktÃģra sygnalizuje istotną niezgodność. Liniowa baza 72,6 procent nie jest zaokrągleniem.
  2. WdroÅženie strukturalnych podpowiedzi syntezy. Cztery (wymagane) sekcje — Zgoda, Niezgoda, Jakość dowodÃģw, Wnioski — zmuszają pasmo wyjściowe do niezgodności. Nie jest wymagana nowa infrastruktura; nie jest wymagane szkolenie; nie jest wymagany koszt na zapytanie; jedna zmiana wyprodukowała dziewiętnastokrotną redukcję!
  3. Nie uÅžywaj MMR do zapytań wraÅžliwych na sprzeczności. ChociaÅž MMR uÅžywa zrÃģÅžnicowanych dokumentÃģw do pokrycia tematycznego, nie optymalizuje pokrycia stanu — co jest błędne, gdy celem jest pobranie obu stron sprzeczności. Dlatego powinno się uÅžywać bm25 plus pobierania z osadzaniem jako bezpieczniejszy domyślny. JednakÅže dywersyfikacja świadoma stanu wskazuje kierunek tej pracy.
  4. Sparuj swoje miary oceny. Zrezygnuj z pojedynczego wyniku sędziego LLM. Połącz go z kontrolą strukturalną dla istotnej treści pod nagłÃģwkami uznania i kontrolą cytowania semantycznego, potwierdzającą, Åže cytowany dowÃģd wspiera stwierdzone twierdzenie.

Szerszy punkt

Dominujący instynkt w rozwoju RAG jest addytywny: lepsi pobieracze, lepsi ponowni klasyfikatorzy, bogatsze metadane, dłuÅžsze okna kontekstowe. Przemysłowa rozmowa o dlaczego potoki RAG nadal zawodzą w produkcji w duÅžej mierze podÄ…Åžał tym samym kształtem. Dla obsługi sprzeczności skutecznym posunięciem było odjęcie — ograniczenie tego, co system jest allowed do wyjścia, zamiast rozszerzania tego, co mu wolno zobaczyć.

To nie czyni architekturę nieistotną. Pobieranie ustawia sufit, losowe pobieranie czyni syntezy bezsensownymi, a słaba jakość dowodÃģw ogranicza wszystko w dÃģł strumienia. To jest dlaczego pytanie, czy systemy RAG rozwiązują problem niezawodności, nadal się pojawia. Jednak to, co określa, czy sprzeczne dowody są reprezentowane jako sprzeczne, okazuje się pÃģÅšniej w potoku i taniej w zmianie niÅž wiele innych komponentÃģw, co oznacza, Åže zmiany potrzebne do poprawy niezawodności mogą nastąpić wcześniej.

Droga praca — lepsze zestawy danych sprzeczności, jawne sygnały szkoleniowe niezgodności, pobieranie wraÅžliwe na stan, benchmarki rodzime sprzeczności — wciÄ…Åž musi być wykonana i zajmie znacznie więcej czasu.

Dlatego jeśli chcesz wiedzieć, czy TwÃģj system ujawnia sprzeczne dowody jako sprzeczne, powinieneś zadać sobie niekomfortowe pytanie i znaleŚć odpowiedÅš w tym tygodniu: Czy TwÃģj system informuje uÅžytkownikÃģw, gdy jego dowody są sprzeczne?

Himanshu Goel jest badaczem AI/ML specjalizującym się w generacji wspomaganej odzyskiwaniem w dziedzinach o wysokim ryzyku, w tym biomedycznych, finansowych i regulacyjnych przepływach pracy dokumentÃģw.