Podstawy AI

Dlaczego Twój Biomedyczny RAG Ukrywa Przed Tobą Sprzeczności

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Standardowy biomedyczny RAG rozwiązuje sprzeczne dowody w milczeniu w przybliżeniu trzech na cztery zapytania. Naprawa jest strukturalna, a nie informacyjna — i większość złożoności, którą dodają zespoły, nie pomaga.

Zadaj pytanie asystentowi klinicznemu z funkcją retrieval-augmented — czy melatonina pomaga w leczeniu jet lagu? — i literatura, którą pobiera, nie będzie zgadzać się sama z sobą.

Przegląd Cochrane wnioskował, że melatonina jest niezwykle skuteczna, a osiem na dziesięć włączonych badań wykazało zmniejszenie objawów jet lagu na lotach przekraczających pięć stref czasowych. Losowy, podwójnie ślepy test 257 norweskich lekarzy opublikowany w American Journal of Psychiatry nie wykazał żadnych korzyści z żadnego z trzech schematów melatoniny.

Oba dokumenty są prawdziwe. Obie są metodologicznie poważne. Każdy klinicysta decydujący, co zalecić, musi wiedzieć, że się nie zgadzają.

W kontrolowanych testach synteza zwykle nie mówiła o tym. Wyprodukowała płynnie, poprawnie cytowany akapit, który opowiedział się po jednej stronie i nigdy nie sygnalizował, że istnieje inna strona.

To jest ślepota sprzeczności. Na benchmarku parze sprzeczności biomedycznych wystąpiło to w 72,6 procentach zapytań (95% CI 0,697–0,755). Wyjście było normalne. Cytaty były rozwiązane poprawnie. Standardowe kontrole jakości przeszły. Sprzeczność po prostu zniknęła.

Tryb awarii, który wygląda jak sukces

Chociaż nie ma bezpośredniej konwergencji w dowodach związanych z biomedycyną, badania pokazują sprzeczne wyniki między użyciem badań obserwacyjnych a randomizowanymi badaniami kontrolowanymi (RCT) oraz różnymi metodami stosowanymi dla różnych populacji pacjentów; jednakże badanie może również zawierać zarówno silną, jak i słabą metodologię, co wydaje się mieć takie same znaczenie.

To nie jest wyjątkowy przypadek. Analiza Ioannidisa najczęściej cytowanych badań klinicznych wykazała, że 16 procent najczęściej cytowanych badań zostało później całkowicie obalone, a badania obserwacyjne były znacznie bardziej prawdopodobne niż badania randomizowane do obalenia lub zmiany efektów w dół — pięć na sześć, w przeciwieństwie do dziewięciu na trzydzieści dziewięć. Zatem problem nie leży tylko w sprzeczności między badaniami, ale raczej w strukturalnej części samej literatury.

Dlatego jako krytyczna funkcja każdego biomedycznego systemu generacji z funkcją retrieval-augmented generowanie dowodów na sprzeczności między badaniami powinno być głównym celem. Jednak większość systemów nie wykonuje tego zadania. Użycie benchmarku HealthContradict z 920 parami sprzeczności wykazało, że standardowy system generacji z funkcją retrieval-augmented nie generował sprzeczności w przybliżeniu 73 procentach par. Problem nie leży w pobieraniu. System pobiera obie strony. Następnie rozwiązuje konflikt w milczeniu, na korzyść jednej ze stron.

Ręczne badanie 50 przypadków awarii wykazało wzorzec, który nazwałem epistemologicznym spłaszczaniem. Obie dokumenty są cytowane indywidualnie przez model, a jego przedstawienie konfliktu jest opisane w kategoriach gradientów ufności („dowody anegdotyczne … naukowe badania wskazują…”) tak, jakby nie istniał żaden konflikt. Mniej niż 5 procent tych przypadków awarii używało słów „sprzeczność”, „konflikt” lub „niezgodność” w ogóle. Wygenerowany tekst miał wskaźnik dokładności cytowania 0,99. To jest właśnie punkt: dokładność cytowania nie implikuje świadomości sprzeczności. System może przypisać każde zdanie doskonale i nadal powiedzieć klinicystce coś, czego nie wspiera podstawa dowodowa.

Trzy cechy „syntezy” RAG tworzą niebezpieczne środowisko kliniczne.

Odwrotna wartość propozycji. Celem RAG jest wyświetlanie dowodów istotnych dla klinicystów. Dlatego przez usunięcie aspektu (aspektów) tych dowodów, które są najważniejsze dla klinicystów do przeglądu, w rzeczywistości wykonuje swoje przeciwieństwo.

Tworzenie niewidzialności. Ponieważ nie ma zastrzeżenia, skrócenia, artefaktu formatu; „spłaszczona” synteza i wierna synteza wyglądają nieodróżnialnie na ekranie.

Cichy złożony wzrost w skali. Nic w standardowym zestawie oceny nie sygnalizuje tego, więc system może działać w produkcji przez miesiące, podczas gdy każde zapytanie z konfliktem jest cicho rozwiązywane w jednym kierunku.

Informacja nie jest dźwignią

Oczywistym rozwiązaniem tego problemu byłoby poinformowanie modelu. Wyraźnie, jeśli tryb awarii polegał na tym, że model nie identyfikował, że dwa dokumenty są sprzeczne, można by po prostu dodać etykietę „SUPPORT” lub „CONTRADICT” do każdego z pobranych dokumentów. To powinno oczywiście poprawić wyniki modelu. Nie poprawiło.

W eksperymencie, w którym dodano etykiety stanu (poprzez adnotację), aby wyraźnie podać modelowi informację, że dwa dokumenty są sprzeczne, ustalono, że jawna adnotacja stanu przesunęła ślepotę sprzeczności z 93,8 procent w nieadnotowanym ramieniu kontrolnym do 91,4 procent — różnica z nakładającymi się przedziałami ufności i brakiem praktycznego znaczenia. Chociaż model otrzymał informację, że dwa dokumenty są sprzeczne, jego domyślna odpowiedź pozostała niezmieniona.

Zrozumienie mechanizmu jest tutaj użyteczne. Informacje dodane biernie do podpowiedzi nie zmieniają domyślnej odpowiedzi modelu. Dla sprzecznych pytań biomedycznych ta odpowiedź silnie faworyzuje jedną skonsolidowaną pozycję. Etykiety stanu stają się dodatkowymi tokenami — często przekształcanymi w nagłówki sekcji — podczas gdy proza powraca do swojego rodzaju.

Struktura jest dźwignią

To, co działało, było strukturalne, a nie informacyjne; zamiast dostarczać modelowi wszystkiego, co jest faktualne lub poprawne w dokumentach, struktura wymagała, aby synteza była konstruowana w kategoriach możliwych sprzeczności (Zgoda, Niezgoda, Jakość dowodów, Wnioski). Podpowiedź z szkieletem dostarcza modelowi tyle samo informacji, co nieadnotowany kontrolny. Jedyną różnicą jest to, co model musi zrobić.

Były redukcje około dziewiętnastokrotnego — z 93,8 procent do 4,9 procent — w ślepocie sprzeczności bez ponownego szkolenia, bez modyfikacji potoku, bez zwiększonej latencji i bez zwiększenia kosztów na zapytanie.

To nie jest poprawione rozumowanie. To po prostu wymuszona alokacja. Gdy model musi dostarczyć sekcję Niezgody, wraca do dokumentów, które początkowo pobrał, szukając czegoś do umieszczenia w tej sekcji.

Ślepota sprzeczności pod trzema warunkami syntezy w kontrolowanym ablacji. Dodanie informacji o stanie przesunęło wskaźnik o 2,4 punkty; zmiana wymaganej struktury wyjściowej przesunęła go o 86,5.

Strukturalne podpowiedzi są mniej związane z polepszaniem zdolności modelu do rozumowania i bardziej z zapewnieniem lekkiej kontroli nad tym, jak zachowanie generacji modelu alokuje przestrzeń wyjściową. Zmusza model do poświęcenia części swojej przestrzeni wyjściowej na niezgodność (różnicę między dostępnymi informacjami a informacjami, które muszą pojawić się, aby spełnić wymagania).

To zmienia powszechny założenie architektoniczne. Większość proponowanych ulepszeń RAG dodaje informacje do kontekstu: więcej dokumentów, wyniki pobierania, etykiety stanu, metadane dowodów. Chociaż synteza nie zmienia zachowania modelu, chyba że podpowiedź syntezy ma określone wymagania dotyczące tej informacji, aby ukształtować strukturę wyjściową. Zmiana wejścia przesuwa masę na obrzeżach; zmiana wymaganej struktury wyjściowej zmienia dystrybucje bezpośrednio

Dlaczego oczekiwane pomocnicy nie pomagają

Dwa elementy powszechnie uważane za niezbędne dla świadomości sprzeczności w biomedycznym RAG okazały się praktycznie bezużyteczne podczas testowania z kontrolowaną ablacją.

1) Rozkład PICO. PICO (Populacja, Interwencja, Porównanie, Wynik) to zorganizowany sposób rozkładu pytań klinicznych na części składowe do użycia w medycynie opartej na dowodach. Hipoteza brzmiała, że rozbicie twierdzeń na pola PICO ograniczy dryf zakresu i poprawi wykrywanie sprzeczności w heterogenicznych dowodach. Usunięcie tego poziomu spowodowało wygenerowanie wyjścia, które było niemal nieodróżnialne od tego, które wygenerował pełny system. Chociaż PICO może być przydatne do organizowania myśli podczas podejmowania decyzji klinicznych; jako Inferowany wejście w czasie analizy w celu wspierania wykrywania sprzeczności, nie ma żadnego wymiernego wkładu.

2) Jawna klasyfikacja stanu. W przeciwieństwie do usunięcia PICO, jawna klasyfikacja stanu działała słabo, ale inaczej. W czystych korpusach akademickich wygenerowała niewielkie zyski w niektórych metrykach. Jednak podczas analizy szumu internetowego — co jest typowe dla tego, jak aplikacje zdrowotne dostępne dla konsumentów będą miały dostęp do informacji — klasyfikator zwrócił NOT_ENOUGH_INFO dla większości dokumentów, głównie dlatego, że autorzy treści zdrowotnej dostępnej dla konsumentów zwykle nie deklarują swojej pozycji, używając języka deklaratywnego oczekiwanego przez klasyfikator. W związku z tym te etykiety były nieinformujące i były następnie propagowane do kontekstu syntezy jako szum. Usunięcie tego etapu dla szumu korporacyjnego nieznacznie poprawiło wykrywanie sprzeczności.

Prawdziwa wąska garść jest w jakości sygnału

Najważniejszy wniosek z tego badania jest taki, że zdolność do rozpoznawania sprzeczności w źródłach jest ograniczona przez to, jak dokładna jest informacja (dane) o tych źródłach, bardziej niż przez to, jak zostały one zbudowane lub ustrukturyzowane.

Utylizacja jakości dowodów — proporcja przypadków, w których synteza preferencyjnie cytowała źródło o wyższej jakości, gdy oba były dostępne — była 0,83 na czystych abstraktach naukowych i spadła poniżej 0,15 na szumie internetowym. Semanticzna lojalność cytowania podążała tym samym wzorcem, od 0,66 na abstraktach do 0,45 na treściach zdrowotnych dla konsumentów.

Tożsame potoki, różne korpusy. Obsługa sprzeczności jest ograniczona przez jawność sygnałów w dokumentach źródłowych.

Istnieje strukturalny powód. Dokumenty pobrane z rzeczywistości często brakuje sygnałów, na które polega każdy klasyfikator lub mechanizm ważenia: metadane typu publikacji, jawne oświadczenia o stanie, opisy metodologii. Abstrakty artykułów recenzowanych oświadczają deklaratywnie o określonych populacjach, metodach i wynikach. Te same oświadczenia są robione w języku anegdotycznym, perswazyjnym i wahliwym w artykułach zdrowotnych dla konsumentów. Dlatego też identyczne systemy produkują dramatycznie różne zachowania w dół strumienia w zależności od tego, co otrzymują jako dane wejściowe.

To potwierdza się również w największej ocenie ekspertów medycznych RAG, opublikowanej kiedykolwiek, w której osiemnaście ekspertów medycznych przyczyniło się do 80 502 adnotacji w 800 wyjściach modelu. Tylko 22 procent najlepszych pasażów pobranych było istotnych. Standardowy RAG pogorszył faktualność i kompletność w porównaniu z podstawowymi systemami non-RAG. Pobieranie i wybór dowodów, a nie generowanie, były dominującymi punktami awarii — echo tego, co praca benchmarkowa nad medycznym RAG zgłaszała przez dwa lata.

Chociaż istnieje dość ograniczona implikacja tego odkrycia w zakresie zastosowania, można powiedzieć ostatecznie, że zdolność systemu do obsługi sprzeczności podczas pobierania z abstraktów PubMed nie może być przeniesiona na aplikację dostępną dla konsumentów, niezależnie od tego, jak zaawansowany jest reszta systemu.

Ślepa plama oceny

Pomiar obsługi sprzeczności jest trudniejszy, niż się wydaje, a nawet standardowy sposób pomiaru obsługi sprzeczności ma swoje własne problemy.

Ocena LLM reprezentuje najczęstszy sposób oceny otwartych wyników RAG pod kątem obsługi konfliktów i również odbiega od testów potwierdzających strukturalnych w kategoriach tego, jak są one opracowane. Strategie podpowiedzi, które organizują syntezy w polach PICO, otrzymują wysokie oceny od sędziów, podczas gdy niepowodzenie testów potwierdzających wyraźnie. To jest oczekiwane: sędziowie LLM faworyzują dłuższe, bardziej rozbudowane odpowiedzi i będą również postrzegać zakopaną uwagę w sekcji wyników jako staranność, kiedy nic w poziomie prozy nie odnosi się do konfliktu.

Strategia pobierania wprowadza drugą pułapkę. Losowe pobieranie produkuje wskaźnik ślepoty sprzeczności równy zero — synteza nie może nie rozpoznać sprzeczności, której jej zestaw pobranych danych nie zawiera. Maksymalna istotność marginalna pobierania, z drugiej strony, zmniejszyła lojalność cytowania semantycznego do 0,11. Każdy wygląda akceptowalnie pod jedną miarą obsługi sprzeczności, ale oba zawodzą pod oceną parami.

Więc sparuj miary. Uruchom trzy kontrole na każdej syntezie: deterministyczną kontrolę strukturalną dla języka wyrażonego, który uznaje konflikt; sędziego LLM dla głębi i równowagi; oraz kontrolę cytowania semantycznego potwierdzającą, że cytowany materiał odpowiada swojemu źródłu. Każdy identyfikuje to, czego nie robią inne. Żaden nie może być godnym zaufania samodzielnie jako benchmark dla obsługi sprzeczności.

Cztery działania na ten kwartał

  1. Przetestuj swoją linię bazową. Każdy biomedyczny, kliniczny, regulacyjny system RAG w produkcji musi być przetestowany pod kątem ślepoty sprzeczności przed dalszym wdrożeniem. Aby przeprowadzić test, potrzebujesz zestawu testowego par sprzeczności i kontroli na zapytanie, która sygnalizuje istotną niezgodność. Liniowa baza 72,6 procent nie jest zaokrągleniem.
  2. Wdrożenie strukturalnych podpowiedzi syntezy. Cztery (wymagane) sekcje — Zgoda, Niezgoda, Jakość dowodów, Wnioski — zmuszają pasmo wyjściowe do niezgodności. Nie jest wymagana nowa infrastruktura; nie jest wymagane szkolenie; nie jest wymagany koszt na zapytanie; jedna zmiana wyprodukowała dziewiętnastokrotną redukcję!
  3. Nie używaj MMR do zapytań wrażliwych na sprzeczności. Chociaż MMR używa zróżnicowanych dokumentów do pokrycia tematycznego, nie optymalizuje pokrycia stanu — co jest błędne, gdy celem jest pobranie obu stron sprzeczności. Dlatego powinno się używać bm25 plus pobierania z osadzaniem jako bezpieczniejszy domyślny. Jednakże dywersyfikacja świadoma stanu wskazuje kierunek tej pracy.
  4. Sparuj swoje miary oceny. Zrezygnuj z pojedynczego wyniku sędziego LLM. Połącz go z kontrolą strukturalną dla istotnej treści pod nagłówkami uznania i kontrolą cytowania semantycznego, potwierdzającą, że cytowany dowód wspiera stwierdzone twierdzenie.

Szerszy punkt

Dominujący instynkt w rozwoju RAG jest addytywny: lepsi pobieracze, lepsi ponowni klasyfikatorzy, bogatsze metadane, dłuższe okna kontekstowe. Przemysłowa rozmowa o dlaczego potoki RAG nadal zawodzą w produkcji w dużej mierze podążał tym samym kształtem. Dla obsługi sprzeczności skutecznym posunięciem było odjęcie — ograniczenie tego, co system jest allowed do wyjścia, zamiast rozszerzania tego, co mu wolno zobaczyć.

To nie czyni architekturę nieistotną. Pobieranie ustawia sufit, losowe pobieranie czyni syntezy bezsensownymi, a słaba jakość dowodów ogranicza wszystko w dół strumienia. To jest dlaczego pytanie, czy systemy RAG rozwiązują problem niezawodności, nadal się pojawia. Jednak to, co określa, czy sprzeczne dowody są reprezentowane jako sprzeczne, okazuje się później w potoku i taniej w zmianie niż wiele innych komponentów, co oznacza, że zmiany potrzebne do poprawy niezawodności mogą nastąpić wcześniej.

Droga praca — lepsze zestawy danych sprzeczności, jawne sygnały szkoleniowe niezgodności, pobieranie wrażliwe na stan, benchmarki rodzime sprzeczności — wciąż musi być wykonana i zajmie znacznie więcej czasu.

Dlatego jeśli chcesz wiedzieć, czy Twój system ujawnia sprzeczne dowody jako sprzeczne, powinieneś zadać sobie niekomfortowe pytanie i znaleźć odpowiedź w tym tygodniu: Czy Twój system informuje użytkowników, gdy jego dowody są sprzeczne?

Himanshu Goel jest badaczem AI/ML specjalizującym się w retrieval-augmented generation dla domen o wysokich stawkach, w tym biomedycznych, finansowych i regulacyjnych workflow dokumentów.