Grunnleggende AI
Hvorfor din biomedisinske RAG skjuler motsigelser for deg

Standard biomedisinsk RAG løser konfliktfylt bevissthet stille i omtrent tre av hver fire forespørsler. Løsningen er strukturell, ikke informativ — og mye av den oppstrøms kompleksitet lagene legger til, hjelper ikke.
Spør en gjenvinningssykret klinisk assistent en enkel spørsmål — hjelper melatonin mot jetlag? — og litteraturen den henter vil ikke være enig med seg selv.
Den Cochrane-gjennomgangen konkluderte med at melatonin er usedvanlig effektiv, med åtte av ti inkluderte studier som viste redusert jetlag på flyreiser som krysser fem eller flere tidssoner. En tilfeldig, dobbel-blind studie av 257 norske leger i American Journal of Psychiatry fant ingen fordel med noen av de tre melatoninskjemene.
Begge dokumenter er ekte. Begge er metodisk seriøse. Enhver kliniker som bestemmer hva de skal anbefale, må vite at de er uenige.
I kontrollerte tester, syntesen sa vanligvis ikke så. Den produserte en flytende, riktig sitert paragraf som gikk på én side og aldri signaliserte at det fantes en annen side.
Dette er motsigelsesblindhet. På en motsigelsesparret biomedisinsk benchmark, skjedde det i 72,6 prosent av forespørslene (95% CI 0,697–0,755). Utdataene var normale. Sitatene ble løst riktig. Standard kvalitetskontroller ble bestått. Uenigheten forsvant bare.
Feilmodusen som ligner suksess
Det finnes ingen direkte konvergens i biomedisk relatert bevis, studier viser motsigelser mellom bruk av observasjonsstudier versus randomiserte kontrollerte studier (RCT) og også varierende metoder brukt for forskjellige pasientpopulasjoner; likevel kan en studie også inkludere både sterke og svake metoder, som ville se ut til å ha samme vekt.
Dette er ikke en unik sak. Ioannidis’ analyse av høyt sitert klinisk forskning fant at 16 prosent av de mest siterte studiene ble motsagt åpenbart, og at observasjonsstudier var langt mer sannsynlig å bli motsagt eller å ha deres effekter revisert nedover — fem av seks, mot ni av tretti. Så, problemet er ikke bare uenighet blant studier, men heller en strukturell del av litteraturen selv.
Derfor, som en kritisk funksjon av enhver biomedisinsk gjenvinningssykret generering, å generere bevis om uenigheter mellom studier, bør være et primært mål. Likevel, de fleste systemer klarer ikke å oppnå dette målet. Ved å bruke HealthContradict-benchmarkets 920 motsigelsesparrede eksempler, demonstrerte at en standard gjenvinningssykret generering (RAG) ikke klarte å generere uenighetene i omtrent 73 prosent av de testede parene. Problemet er ikke gjenvinning. Systemet henter begge sider. Det løser så konflikten stille, til fordel for en av dem.
En manuell undersøkelse av 50 stratifiserte feiltilfeller produserte en mønster som jeg har referert til som epistemologisk flattning. Begge dokumenter blir sitert individuelt av modellen, og dens rendering av konflikten beskrives i termer av konfidensgrad (“anekdotisk bevis … vitenskapelige studier indikerer…”) som om ingen konflikt eksisterte. Mindre enn 5 prosent av disse feiltilfellene brukte ordene “motsigelse”, “konflikt” eller “uenighet” overhodet. Utdataene genererte en sitatsikkerhetsrate på 0,99. Det er nettopp poenget: sitatsikkerhet impliserer ikke motsigelsesbevissthet. Et system kan tilskrive hver setning perfekt og likevel fortelle en kliniker noe bevisgrunnlaget ikke støtter.
Tre egenskaper ved RAGs “syntese” skaper en farlig klinisk miljø.
Inverterer verdiene. Formålet med RAG er å vise relevante bevis for klinikere. Derfor, ved å fjerne aspektene av bevisene som er viktigst for klinikere å se på, oppnår den motsatt.
Skaper usynlighet. Siden det ikke finnes noen hedge, eller truncering, eller formatartefakt; en “flattet” syntese og en trofast syntese ser ut til å være ubestemmelig på skjermen.
Kumulerer stille på skala. Ingenting i en standard evalueringssuite flagger det, så et system kan kjøre i produksjon i måneder mens hver konfliktfylt forespørsel blir stille løst i én retning.
Informasjon er ikke heisen
En åpenbar løsning på dette problemet ville være å informere modellen. Det er tydelig at hvis feilmodusen var at modellen ikke identifiserte at to dokumenter var i konflikt, kunne man bare legge til en “SUPPORT” eller “CONTRADICT” stillingsetikett til hvert av de hentede dokumentene. Dette burde tydelig forbedre modellens ytelse. Det gjorde det ikke.
I et eksperiment hvor vi la til stillingsetiketter (ved å annotere) for å gi modellen informasjonen om at to dokumenter var i konflikt, fant vi at eksplisitt stillingsetikett flyttet motsigelsesblindhet fra 93,8 prosent i den uannoterte kontrollarmen til 91,4 prosent — en forskjell med overlappende konfidensintervaller og ingen praktisk betydning. Selv om modellen mottok informasjonen om at to dokumenter var i konflikt, forble dens standard responsfordeling uendret.
Å forstå mekanismen er nyttig her. Informasjon som legges til passivt i en prompt endrer ikke en modells standard responsfordeling. For konfliktfylte biomedisinske spørsmål, favoriserer den fordelt en konsolidert posisjon. Stillingsetiketter blir ekstra token — ofte resirkulert til seksjonsoverskrifter — mens prosa returnerer til type.
Struktur er heisen
Hva som fungerte, var strukturelt, i motsetning til å være informativt; i stedet for å gi modellen all informasjon som er faktisk eller riktig om dokumentene, krevde strukturen at syntesen skulle konstrueres i termer av mulige uenigheter (Enighet, Uenighet, Beviskvalitet, Konklusjon). Den skjelettete prompten gir modellen ingen mer informasjon enn den uannoterte kontrollen. Den eneste forskjellen er hva modellen må gjøre.
Det var reduksjoner på omtrent nitten fold — fra 93,8 prosent til 4,9 prosent — i motsigelsesblindhet uten noen omtrening, uten noen pipeline-modifiseringer, uten noen økt latency, og uten noen økning i kostnader per forespørsel.
Dette er ikke forbedret resonnering. Dette er bare tvunget allokering. Når modellen må gi en Uenighet-seksjon, går den tilbake til dokumentene den opprinnelig hentet og søker etter noe å inkludere i denne seksjonen.

Motsigelsesblindhet under tre syntetiske forhold i kontrollert ablasjon. Tilføyelse av stillingsetikett flyttet raten med 2,4 poeng; endring av den påkrevde utgangsstrukturen flyttet den med 86,5.
Strukturert prompting er mindre om å forbedre modellens evne til å resonere og mer om å gi lett styring over hvordan genereringsatferden til modellen allokerer utgangsrom. Den tvinger modellen til å bruke en viss del av sitt utgangsrom på uenighet (forskjellen mellom informasjon som er tilgjengelig og informasjon som må dukke opp for å møte kravene).
Dette endrer en vanlig arkitektonisk antagelse. De fleste foreslåtte RAG-forbedringer legger til informasjon til konteksten: flere dokumenter, gjenvinningspoeng, stillingsetiketter, bevisgradmetadata. Med mindre syntetisk prompt har spesifikke krav til at informasjonen former utgangsstrukturen, vil de fleste ikke endre modellens atferd. Endring av inndata flytter masse på randen; endring av påkrevde utgangsstrukturer endrer fordelinger direkte
Hvorfor de forventede hjelperne ikke hjelper
To elementer som vanligvis sees på som essensielle for motsigelsesbevisst biomedisinsk RAG, ga lite når de ble testet med kontrollert ablasjon.
1) PICO-dekomposisjon. PICO (Populasjon, Intervensjon, Sammenligning, Resultat) er en organisert måte å bryte ned kliniske spørsmål i komponenter for bruk i bevisbasert medisin. Hypotesen var at dekomponering av krav i PICO-felt ville begrense scope-drift og forbedre motsigelsesdeteksjon over heterogene bevis. Fjerning av denne nivået resulterte i utgang som var nesten ubestemmelig fra det genererte av det komplette systemet. Selv om PICO kan være nyttig for å organisere tankene under klinisk beslutning; som en inferert inndata ved analyse til å støtte motsigelsesdeteksjon, har den ingen målbare bidrag.
2) Eksplisitt stillingklassifisering. I motsetning til PICO-fjerning, utførte eksplisitt stillingklassifisering dårlig, men annerledes. På rene akademiske korpus, produserte den små gevinster på noen mål. Likevel, når det ble analysert støyende nett-tekst — som vanligvis er hvordan forbruker-orienterte helseapper får tilgang til informasjon — returnerte klassifisatoren NOT_ENOUGH_INFO for de fleste dokumenter, hovedsakelig fordi forfattere av forbruker-orientert helseinnhold vanligvis ikke erklærer sin posisjon ved hjelp av deklarativ språk som forventes av klassifisatoren. Derfor ble disse etikettene som uinformativt propagert inn i syntetisk kontekst som støy.
Den virkelige flaskehalsen er oppstrøms signal kvalitet
Den viktigste konklusjonen av denne studien er at evnen til å gjenkjenne motsigelser i kilder er begrenset av hvor nøyaktig informasjonen (data) om disse kildene er, mer enn hvordan de ble bygget eller strukturert.
Beviskvalitetsutnyttelse — andelen av tilfeller hvor syntesen foretrukket å sitere den høyere kvalitetskilden når begge var tilgjengelige — var 0,83 på rene vitenskapelige abstrakter og falt under 0,15 på støyende nett-tilgang. Semantisk sitatsikkerhet fulgte samme mønster, fra 0,66 på abstrakter til 0,45 på forbruker-helseinnhold.

Identiske rørledninger, forskjellige korpus. Motsigelseshåndtering er avgrenset av den eksplisitte uttrykket av signaler i kilde-dokumentene.
Det finnes en strukturell årsak til dette. Virkelige hentede dokumenter mangler ofte de kildene som hver klassifisering eller vektingmekanisme avhenger av: publikasjonstype-metadata, eksplisitte stillingserklæringer, metodiske beskrivelser. Abstrakter av fagfellevurderte artikler gjør påstander deklarativt om bestemte populasjoner, metoder og resultater. De samme påstandene gjøres i anekdotisk, overtalelsesfull og forsiktig språk i forbruker-helseartikler. Derfor produserer identiske systemer dramatisk forskjellig atferd nedstrøms basert på hva de mottar som inndata.
Dette støttes også av den største ekspertvurderingen av medisinsk RAG noensinne publisert, hvor attten medisinske eksperter bidro med 80 502 annotasjoner over 800 modell-utdata. Bare 22 prosent av de øverste 16 hentede passasjene var relevante. Standard RAG forringet faktualitet og fullstendighet i forhold til ikke-RAG-baselinjer. Gjenvinning og bevisvalg, ikke generering, var de dominerende feilpunktene — et ekko av hva benchmark-arbeid på medisinsk RAG har rapportert i to år.
Selv om det finnes en relativt begrenset implikasjon av denne funn i termer av anvendelse, kan det konkluderes at evnen til å håndtere motsigelser når det hentes fra PubMed-abstrakter ikke kan overføres til en forbruker-orientert nettside, uavhengig av hvor avansert resten av systemet er.
Evalueringens egen blindhet
Å måle motsigelseshåndtering er mer vanskelig enn det ser ut til, og selv en standard tilnærming til å måle motsigelseshåndtering har sine egne problemer.
LLM-dommerpoeng representerer den vanligste måten å score åpne RAG-utdata for konfliktbehandling og avviker fra strukturelle anerkjennelseskontroller i termer av hvordan de utvikles. Prompt-strategier som organiserer syntese i PICO-felt mottar høye poeng fra dommere mens de feiler eksplisitte anerkjennelseskontroller åpenbart. Dette er forventet: LLM-dommere har blitt dokumentert som favoriserende lengre, mer omfattende svar og vil også se en begravd forbehold i resultatsammenfattningen som grundighet når ingenting i prosa-nivået refererer til konflikten.
Gjenvinningsstrategi introduserer en annen felle. Tilfeldig gjenvinning produserer en motsigelsesblindhetsrate på null — en syntese kan ikke feile å anerkjenne en motsigelse som dens hentede sett ikke inneholder. Maksimal marginal relevans-gjenvinning, på den annen side, reduserte semantisk sitatsikkerhet ned til 0,11. Hver ser ut til å være akseptabel under én enkelt motsigelseshåndtering-måling, men begge faller kort under par-måling.
Så par målingene. Kjør tre kontroller på hver syntese: en deterministisk strukturell kontroll for uttrykt språk som anerkjenner en konflikt; en LLM-dommer for dybde og balanse; og en semantisk sitatsjekk som bekrefter at sitert innhold matcher kilde. Hver identifiserer hva de andre ikke gjør. Ingen kan være troværdig på egen hånd som en benchmark for motsigelseshåndtering.
Fire handlinger for dette kvartalet
- Test din baseline. Hvert biomedisinsk, klinisk, regulatorisk RAG-system i produksjon må testes for motsigelsesblindhet før videre distribusjon. For å utføre testen, trenger du en motsigelsesparret testsett og en per forespørsel-kontroll som utgangssignalerer substantiell uenighet. En 72,6 prosent baseline er ikke en avrundingsfeil.
- Implementer strukturert syntetisk prompting. De fire (påkrevde) seksjonene — enighet, uenighet, beviskvalitet, konklusjon — tvinger utgangsbandbredde på uenigheter. Det krever ingen ny infrastruktur; ingen omstrening; ingen per forespørsel-kostnad; en endring produserte en nittenfoldig reduksjon!
- Ikke bruk MMR-gjenvinning for motsigelsesensitive forespørsler. Selv om MMR bruker diversifiserte dokumenter for topisk dekning, optimaliserer den ikke for stillingsdekning — som er feil når målet er å hente begge sider av en uenighet. Derfor bør bm25 pluss innledning-gjenvinning brukes som en tryggere standard. Likevel, stillingsbevisst diversifisering ville være retningen dette arbeidet peker mot.
- Par dine evaluering-målinger. Pensjonér den enkelte LLM-dommer-poeng. Kombiner den med en strukturell kontroll for substantiell innhold under anerkjennelsesoverskrifter og en semantisk sitatsjekk som bekrefter at sitert bevis støtter den erklærte påstanden.
Den videre punkt
Den dominerende instinkt i RAG-utvikling er additiv: bedre gjenvinninger, bedre om-rangering, rikere metadata, lengre kontekstvinduer. Industrikonversasjonen om hvorfor RAG-rørledninger fortsatt feiler i produksjon har i stor grad fulgt samme mønster. For motsigelseshåndtering, var den effektive bevegelsen subtraktiv — å begrense hva systemet er tillatt å produsere, snarere enn å utvide hva det er gitt. En enkelt fire-delt syntetisk prompt overgikk en fem-trinns rørledning. Den gjorde det ved å endre hva modellen måtte produsere, ikke hva modellen kunne se.
Dette gjør ikke arkitektur irrelevant. Gjenvinning setter en tak, tilfeldig gjenvinning gjør syntese meningsløs, og dårlig beviskvalitet kapper alt nedstrøms. Dette er hvorfor spørsmålet om om RAG-systemer løser problemet med pålitelighet fortsatt dukker opp. Likevel, hva som bestemmer om konfliktfylt bevis presenteres som konfliktfylt, viser seg å være senere i rørledningen og billigere å endre enn mange av de andre komponentene, noe som betyr at endringer som trengs for å forbedre pålitelighet kan skje tidligere.
Det dyre arbeidet — bedre motsigelsesdatasett, eksplisitte uenighets-treningssignaler, stillingsbevisst gjenvinning, motsigelsesnativ benchmark — må fortsatt gjøres, og vil ta betraktelig lengre tid.
Derfor, hvis du ønsker å vite om ditt system presenterer konfliktfylt bevis som konfliktfylt, bør du stille deg selv det ubehagelige spørsmålet og finne svaret denne uken: Forteller ditt system brukerne når dens bevis motsier hverandre?












