Grundlæggende AI
Hvorfor dit biomedicinske RAG gemmer modstridende oplysninger for dig

Standard biomedicinsk RAG løser konfliktende beviser stille i omtrent tre af hver fire forespørgsler. Løsningen er strukturel, ikke informativ – og det meste af den kompleksitet, som teams tilføjer, hjælper ikke.
Spørg en retrieval-augmenteret klinisk assistent en simpel spørgsmål – hjælper melatonin mod jetlag? – og litteraturen, den henter, vil ikke være enig med sig selv.
Den Cochrane-review konkluderede, at melatonin er bemærkelsesværdigt effektiv, med otte af ti inkluderede forsøg, der viste reduceret jetlag på fly, der krydsede fem eller flere tidszoner. En randomiseret, dobbeltblindt forsøg med 257 norske læger i American Journal of Psychiatry fandt ingen fordel ved nogen af tre melatonin-regimer.
Begge dokumenter er ægte. Begge er metodisk seriøse. Enhver kliniker, der skal beslutte, hvad han skal anbefale, har brug for at vide, at de er uenige.
I kontrolleret testning gjorde syntesen normalt ikke det. Den producerede en flydende, korrekt citeret afsnit, der kom ned på den ene side og aldrig signalerede, at der eksisterede en anden side.
Det er modstridende blindhed. På en modstridende-parret biomedicinsk benchmark, skete det i 72,6 procent af forespørgslerne (95% CI 0,697–0,755). Udgangen læste normalt. Citationerne blev løst korrekt. Standardkvalitetskontrollerne blev bestået. Uenigheden forsvandt blot.
Fejlmodus, der ligner succes
Der er ingen direkte konvergens i biomedicinsk relateret bevis, studier viser konfliktende resultater mellem brugen af observationsstudier versus randomiserede kontrollerede forsøg (RCT) og også varierende metoder, der bruges til forskellige patientpopulationer; dog kan en studie også inkludere både stærk og svag metodik, hvilket ville synes at have samme vægt.
Dette er ikke en unik sag. Ioannidis’s analyse af højt citeret klinisk forskning fandt, at 16 procent af de mest citerede studier blev modsagt direkte, og at observationsstudier var langt mere sandsynlige end randomiserede forsøg til at blive modsagt eller have deres effekter revideret nedad – fem af seks, imod ni af niogfyrre. Således er problemet ikke kun uenighed mellem studier, men snarere en strukturel del af litteraturen selv.
Derfor, som en kritisk funktion af enhver biomedicinsk retrieval-augmenteret generation system, skal generering af beviser om uenigheder mellem studier være et primært mål. Men de fleste systemer klarer ikke at opnå dette mål. Ved at bruge HealthContradict benchmarkets 920 modstridende-parrede eksempler demonstrerede, at en standard retrieval-augmenteret generation (RAG) ikke kunne generere uenighederne i omtrent 73% af de testede par. Problemet er ikke retrieval. Systemet henter begge sider. Det løser så konflikten stille, til fordel for en af dem.
En manuel undersøgelse af 50 stratificerede fejltilfælde producerede en mønster, som jeg har omtalt som epistemologisk fladning. Begge dokumenter citeres individuelt af modellen, og dens rendering af konflikten beskrives i termer af tillidsgrader (“anekdotisk bevis … videnskabelige studier indikerer…”) som om ingen konflikt eksisterede. Mindre end 5% af disse fejltilfælde brugte ordene “modstrid”, “konflikt” eller “uenighed” overhovedet. Udgangen, der blev genereret, havde en citationssikkerhedsrate på 0,99. Det er præcis pointen: citationssikkerhed implicerer ikke modstridende bevidsthed. Et system kan tilskrive hver sætning perfekt og alligevel fortælle en kliniker noget, som bevisgrundlaget ikke understøtter.
Tre funktioner af RAG’s “syntese” skaber en farlig klinisk omgang.
Invertering af værdipropositionen. Formålet med RAG er at vise beviser, der er relevante for klinikere. Derfor fjerner det aspekterne af disse beviser, som er mest vigtige for klinikere at gennemgå, og opnår dermed det modsatte.
Skabelse af usynlighed. Da der ikke er nogen hedge eller truncering eller formatartefakt; en “flad” syntese og en trofast syntese ser ud som indistinguishable på skærmen.
Stille forstærkning i skala. Intet i en standard evalueringssuite markerer det, så et system kan køre i produktion i måneder, mens hver konfliktende forespørgsel stille løses i én retning.
Information er ikke værktøjet
En åbenlys løsning på dette problem ville være at informere modellen. Det er tydeligt, at hvis fejlmodusen var, at modellen ikke identificerede, at to dokumenter var i modstrid, kunne man blot tilføje en “SUPPORT” eller “CONTRADICT” stance-mærke til hvert af de hentede dokumenter. Dette burde åbenbart forbedre modellens præstation. Det gjorde det ikke.
I et eksperiment, hvor vi tilføjede stance-mærker (ved at annotere) for at give modellen informationen om, at to dokumenter var i modstrid, fandt vi, at eksplicit stance-annotation flyttede modstridende blindhed fra 93,8 procent i den ikke-annoterede kontrolarm til 91,4 procent – en forskel med overlappende tillidsintervaller og ingen praktisk betydning. Selv om modellen modtog informationen om, at to dokumenter var i modstrid, forblev dens standard responsfordeling uændret.
Forståelse af mekanismen er nyttig her. Information, der tilføjes passivt til en prompt, ændrer ikke en modells standard responsfordeling. For modstridende-ladede biomedicinske spørgsmål favoriserer den distribution stærkt en enkelt konsolideret position. Stance-mærker bliver ekstra tokens – ofte genbrugt til sektionsoverskrifter – mens prosen vender tilbage til type.
Struktur er værktøjet
Hvad der virkede, var strukturelt, modsat at være informativt; i stedet for at give modellen alle fakta eller korrekte oplysninger om dokumenterne, krævede strukturen, at syntesen skulle konstrueres i termer af mulige uenigheder (Enighed, Uenighed, Beviskvalitet, Konklusion). Den scaffoldede prompt giver modellen ingen flere oplysninger end den ikke-annoterede kontrol. Den eneste forskel er, hvad modellen har brug for at gøre.
Der var reduceringer på omtrent nitten fold – fra 93,8 procent til 4,9 procent – i modstridende blindhed uden nogen genoptræning, uden nogen pipeline-modifikationer, uden nogen øget latency, og uden nogen øgede omkostninger pr. forespørgsel.
Dette er ikke forbedret resonnering. Dette er blot tvungen tildeling. Når modellen skal give en Uenighed-sektion, går den tilbage til de dokumenter, den oprindeligt hentede, og søger efter noget at inkludere i denne sektion.

Modstridende blindhed under tre syntesebetingelser i kontrolleret ablation. Tilføjelse af stance-information flyttede raten med 2,4 punkter; ændring af den krævede output-struktur flyttede den med 86,5.
Struktureret prompting er mindre om at forbedre modellens evne til at resonere og mere om at give let-governance over, hvordan modellens generationsadfærd allocator output-rum. Det tvinger modellen til at bruge en vis mængde af output-rummet på uenighed (forskellen mellem den information, der er tilgængelig, og den information, der har brug for at dukke op for at opfylde kravene).
Dette ændrer en almindelig arkitektonisk antagelse. De fleste foreslåede RAG-forbedringer tilføjer information til konteksten: flere dokumenter, retrieval-scores, stance-tags, evidence-grade-metadata. Medmindre syntese-prompten har bestemte krav til, at denne information former output-strukturen, vil de fleste ikke ændre modellens adfærd. Ændring af input flytter masse ved marginerne; ændring af krævede output-strukturer ændrer fordelinger direkte
Hvorfor de forventede hjælpere ikke hjælper
To elementer, der normalt anses for at være essentielle for modstridende-bevidst biomedicinsk RAG, gav meget lidt, da de blev testet med kontrolleret ablation.
1) PICO-dekomposition. PICO (Population, Intervention, Comparison, Outcome) er en organiseret måde at bryde kliniske spørgsmål ned i komponentdelene til brug i evidensbaseret medicin. Hypotesen var, at dekomposition af påstande i PICO-felter ville begrænse scope-drift og forbedre modstridende-opsporing over heterogene bevis. Fjernelse af dette niveau resulterede i output, der var næsten umulig at skelne fra det, der blev genereret af det komplette system. Selv om PICO kan være nyttigt til at organisere dine tanker under klinisk beslutningstagning; som en antaget input på analysens tidspunkt for at understøtte modstridende-opsporing, har det ingen målbart bidrag.
2) Eksplicit Stance-klassificering. I modsætning til PICO-fjernelse, fungerede eksplicit stance-klassificering dårligt, men anderledes. På rene akademiske korpora producerede det små gevinster på nogle metrikker. Men når det analyserede støjende webtekst – som er typisk, hvordan forbruger-orienterede sundhedsapps vil have adgang til information – returnerede klassificatoren NOT_ENOUGH_INFO for de fleste dokumenter, primært fordi forfattere af forbruger-orienteret sundhedsindhold normalt ikke erklærer deres position ved hjælp af deklarativ sprog, som klassificatoren forventer. Konsekvensen var, at disse mærker som uinformerende blev propageret ind i syntese-konteksten som støj. Fjernelse af dette trin for støjende korpora forbedrede lidt modstridende-opsporing.
Den virkelige flaskehals er upstream signal-kvalitet
Den vigtigste konklusion i denne studie er, at evnen til at genkende modstridende i kilder er begrænset af, hvor præcis informationen (data) om disse kilder er, mere end hvordan de blev bygget eller struktureret.
Beviskvalitetsudnyttelse – andelen af tilfælde, hvor syntesen foretrækker at citere den højere-kvalitetskilde, når begge er tilgængelige – var 0,83 på rene videnskabelige abstracts og faldt under 0,15 på støjende web-henting. Semantisk citationstrohedighed fulgte samme mønster, fra 0,66 på abstracts til 0,45 på forbruger-sundhedsindhold.

Identiske pipelines, forskellige korpora. Modstridende-håndtering er begrænset af de eksplicitte signaler i kilde-dokumenterne.
Der er en strukturel grund til dette. Virkelige hentede dokumenter mangler ofte de signaler, som enhver klassificator eller vægtmekanisme afhænger af: publikationstype-metadata, eksplicitte stance-erklæringer, metodologiske beskrivelser. Abstracts af peer-reviewed artikler gør påstande deklarativt omkring bestemte populationer, metoder og resultater. Præcis de samme påstande gøres inden for anekdotisk, overbevisende og afvigende sprog i forbruger-sundhedsartikler. Derfor producerer identiske systemer dramatisk forskellige adfærd downstream baseret på, hvad de modtager som input.
Dette understøttes også af den største ekspertvurdering af medicinsk RAG nogensinde offentliggjort, hvor attende medicinske eksperter bidrog med 80.502 annotationer på tværs af 800 model-outputs. Kun 22 procent af top-16 hentede passager var relevante. Standard RAG forringede faktualitet og fuldstændighed i forhold til non-RAG-baselines. Henting og bevis-selektion, ikke generation, var de dominerende fejlpunkter – en ekko af, hvad benchmark-arbejde på medicinsk RAG har rapporteret i to år.
Selv om der er en relativt begrænset implikation af denne opdagelse i forhold til anvendelse, kan det siges konklusivt, at evnen til at håndtere modstridende, når det hentes fra PubMed-abstracts, ikke kan overføres til en forbruger-orienteret website, uanset hvor avanceret resten af systemet er.
Evalueringens egen blind plet
At måle modstridende-håndtering er sværere, end det ser ud til, og selv en standard-tilgang til at måle modstridende-håndtering har sine egne problemer.
LLM-dommer-score repræsenterer den mest almindelige måde, hvorpå åbne RAG-outputs scores for konflikt-håndtering, og afviger fra strukturelle anerkendelseskontroller i forhold til, hvordan de udvikles. Prompt-strategier, der organiserer syntese i PICO-felter, modtager høje scores fra dommere, mens de fejler eksplicitte anerkendelses-tester åbenlyst. Dette er forventet: LLM-dommere favoriserer længere, mere omfattende svar og vil også se en begravet forbehold i resultatsektionen som grundighed, når intet i prosa-niveau henviser til konflikten.
Henting-strategi introducerer en anden fælde. Tilfældig henting producerer en modstridende-blindhedsrate på nul – en syntese kan ikke fejl at anerkende en modstrid, som dens hentede sæt ikke indeholder. Maksimal marginal relevans-henting reducerede semantisk citationstrohedighed ned til 0,11. Begge ser acceptabelt ud under en enkelt modstridende-håndtering-metrik, men begge mangler under parret evaluering.
Så par metrikkerne. Kør tre kontroller på hver syntese: en deterministisk strukturel kontrol for udtrykt sprog, der anerkender en konflikt; en LLM-dommer til dybde og balance; og en semantisk citation-kontrol, der bekræfter, at citeret indhold matcher dens kilde. Hver identificerer, hvad de andre ikke gør. Ingen kan være troværdig på egen hånd som en benchmark for modstridende-håndtering.
Fire handlinger for dette kvartal
- Test din baseline. Hver biomedicinsk, klinisk, regulatorisk RAG i produktion skal testes for modstridende-blindhed, før yderligere udrulning. For at udføre testen har du brug for en modstridende-parret test-sæt og en pr. forespørgsel-kontrol, der kontrollerer, om outputtet signalerer substansiel uenighed. En 72,6-procentig baseline er ikke en afrundingsfejl.
- Implementer struktureret syntese-prompts. De fire (krævede) sektioner – enighed, uenighed, beviskvalitet, konklusion – tvinger output-båndbredde på uenigheder. Der er ingen ny infrastruktur krævet; ingen træning krævet; ingen pr. forespørgsel-omkostninger; en enkelt ændring producerede en nitten-foldig reduktion!
- Brug ikke MMR-henting til modstridende-følsomme forespørgsler. Selv om MMR bruger diversificerede dokumenter til emne-dækning, optimerer det ikke for stance-dækning – hvilket er forkert, når målet er at hente begge sider af en uenighed. Derfor bør bm25 plus embedding-henting bruges som en sikrere standard. Men stance-bevidst diversificering ville være den retning, dette arbejde peger mod.
- Par dine evaluering-metrikker. Pensioner den enkelte LLM-dommer-score. Kombiner det med en strukturel kontrol for substansielt indhold under anerkendelses-overskrifter og en semantisk citation-kontrol, der bekræfter, at det citerede bevis understøtter den erklærede påstand.
Det bredere punkt
Den dominerende instinkt i RAG-udvikling er additiv: bedre hentere, bedre rerankere, rigere metadata, længere kontekstvinduer. Branchens samtale om hvorfor RAG-pipelines stadig fejler i produktion har i stor udstrækning fulgt samme form. For modstridende-håndtering var den effektive bevægelse subtraktiv – begrænsning af, hvad systemet er tilladt at producere, snarere end udvidelse af, hvad det får. En enkelt fire-delt syntese-prompt overgik en fem-trins pipeline. Det gjorde det ved at ændre, hvad modellen havde brug for at producere, snarere end hvad modellen kunne se.
Det gør ikke arkitektur irrelevant. Henting sætter en loft, tilfældig henting gør syntese meningsløs, og dårlig beviskvalitet kapsler alt downstream. Dette er, hvorfor spørgsmålet om om RAG-systemer løser problemet med pålidelighed fortsat dukker op. Men hvad der bestemmer, om modstridende bevis præsenteres som modstridende, viser sig at være senere i pipeline og billigere at ændre end mange af de andre komponenter, hvilket betyder, at ændringer, der er nødvendige for at forbedre pålidelighed, kan ske tidligere.
Det dyre arbejde – bedre modstridende-datasets, eksplicitte uenigheds-træningssignaler, stance-følsom henting, modstridende-native benchmarks – skal stadig gøres, og vil tage betydeligt længere tid.
Derfor, hvis du vil vide, om dit system fremhæver modstridende beviser som modstridende, skal du stille dig selv det ubehagelige spørgsmål og finde svaret denne uge: Fortæller dit system brugerne, når dens beviser modsiger hinanden?












