Fundamentele AI
De ce RAG-ul dvs. biomedical ascunde contradicțiile de la dvs.

Standardul RAG biomedical rezolvă în mod tacit dovezi contradictorii în aproximativ trei din patru interogări. Remedierea este structurală, nu informatională — și cea mai mare parte a complexității upstream pe care o adaugă echipele nu ajută.
Puneți o întrebare simplă unui asistent clinic cu recuperare augmentată — ajută melatonina cu jet lag? — și literatura pe care o recuperează nu va fi de acord cu ea însăși.
Recenzia Cochrane a concluzionat că melatonina este remarcabil de eficientă, cu opt din zece studii incluse care arată o reducere a jet lag-ului la zborurile care traversează cinci sau mai multe fusuri orare. Un studiu randomizat, cu dublă orbire, cu 257 de medici norvegieni în Journal of Psychiatry American a constatat că nu există niciun beneficiu din niciuna dintre cele trei regimuri de melatonină.
Ambele documente sunt reale. Ambele sunt metodologic serioase. Orice clinician care decide ce să recomande trebuie să știe că ele nu sunt de acord.
În testarea controlată, sinteza de obicei nu a spus asta. A produs un paragraf fluent, corect citat, care a căzut de partea uneia și nu a semnalat niciodată că există o altă parte.
Acesta este orbirea contradicției. Pe un benchmark de perechi de contradicții biomedicale, a apărut în 72,6 la sută din interogări (95% CI 0,697–0,755). Ieșirea a citat corect. Verificările calității standard au trecut. Dezacordul a dispărut pur și simplu.
Modul de eșec care pare un succes
În timp ce nu există o convergență directă în dovezi biomedicale, studiile arată rezultate contradictorii între utilizarea studiilor observaționale și a studiilor controlate randomizate (RCT) și, de asemenea, metode diferite utilizate pentru diferite populații de pacienți; cu toate acestea, un studiu poate include atât o metodologie puternică, cât și una slabă, ceea ce pare să aibă același efect.
Acesta nu este un caz unic. Analiza lui Ioannidis a cercetării clinice citate pe scară largă a constatat că 16 la sută din studiile cele mai citate au fost ulterior contrazise în mod direct, și că studiile observaționale au fost mult mai probabil să fie contrazise sau să aibă efectele revizuite în jos — cinci din șase, împotriva a nouă din treizeci și nouă. Astfel, problema nu este doar dezacordul dintre studii, ci mai degrabă o parte structurală a literaturii înseși.
Prin urmare, ca o funcție critică a oricărui sistem de generare augmentată de recuperare biomedical, generarea de dovezi despre dezacordurile dintre studii ar trebui să fie un obiectiv principal. Cu toate acestea, majoritatea sistemelor nu reușesc să îndeplinească această sarcină. Utilizând benchmark-ul HealthContradict cu 920 de exemple de perechi de contradicții, s-a demonstrat că un RAG standard de recuperare și generare a eșuat în a genera dezacordurile în aproximativ 73% din perechile testate. Problema nu este recuperarea. Sistemul recuperează ambele părți. Apoi rezolvă conflictul în mod tacit, în favoarea uneia dintre ele.
O examinare manuală a 50 de cazuri de eșec stratificate a produs un model pe care l-am numit aplatizare epistemologică. Ambele documente sunt citate individual de model, iar reprezentarea conflictului este descrisă în termeni de grade de încredere (“dovezi anecdote … studii științifice indică…”) ca și cum nu ar exista niciun conflict. Mai puțin de 5% din aceste cazuri de eșec au utilizat cuvintele “contradicție”, “conflict” sau “dezacord” deloc. Ieșirea generată a avut o rată de acuratețe a citării de 0,99. Acesta este exact punctul: acuratețea citării nu implică conștientizarea contradicției. Un sistem poate atribui fiecare propoziție perfect și totuși spune unui clinician ceva pe care baza de dovezi nu îl susține.
Trei caracteristici ale “sintezei” RAG creează un mediu clinic periculos.
Inversarea propunerii de valoare. Scopul RAG este de a afișa dovezi relevante pentru clinicieni. Prin urmare, prin eliminarea aspectului (aspectelor) acelei dovezi care sunt cel mai important pentru clinicienii care trebuie să o revizuiască, el își îndeplinește în mod efectiv opusul.
Crearea invizibilității. Deoarece nu există nicio margine, nicio întrerupere, niciun artefact de format; o “sinteză aplatizată” și o sinteză fidelă apar indistincte pe ecran.
Compunerea în mod tacit la scară. Nimic într-un set standard de evaluare nu semnalează acest lucru, astfel încât un sistem poate rula în producție timp de luni, în timp ce fiecare interogare conflictuală este rezolvată în mod tacit într-o direcție.
Informația nu este pârghia
O soluție evidentă la această problemă ar fi să informeze modelul. În mod evident, dacă modul de eșec a fost acela că modelul nu a identificat că două documente erau în contradicție, puteți adăuga pur și simplu o etichetă de poziție “SUPPORT” sau “CONTRADICT” la fiecare dintre documentele recuperate. Acest lucru ar trebui să îmbunătățească în mod evident performanța modelului. Nu a făcut-o.
Într-un experiment în care am adăugat etichete de poziție (prin annotare) pentru a oferi în mod explicit modelului informația că două documente erau în contradicție, am constatat că annotarea poziției explicite a mutat orbirea contradicției de la 93,8 la sută în brațul de control neannotat la 91,4 la sută — o diferență cu intervale de încredere care se suprapun și nicio semnificație practică. Deși modelul a primit informația că două documente erau în contradicție, distribuția sa de răspuns implicită a rămas neschimbată.
Înțelegerea mecanismului este utilă aici. Informațiile adăugate în mod pasiv la o solicitare nu modifică distribuția de răspuns implicită a modelului. Pentru întrebări biomedicale pline de contradicții, acea distribuție favorizează puternic o poziție consolidată. Etichetele de poziție devin tokenuri suplimentare — adesea reciclate în titlurile secțiunilor — în timp ce proza revine la tip.
Structura este pârghia
Ceea ce a funcționat a fost structural, și nu informational; în loc de a oferi modelului toate informațiile corecte despre documente, structura a necesitat ca sinteza să fie construită în termeni de posibile dezacorduri (Acord, Dezacord, Calitatea dovezilor, Concluzie). Scaffoldingul prompt oferă modelului nu mai multe informații decât controlul neannotat. Singura diferență este ceea ce modelul trebuie să facă.
Au existat reduceri de aproximativ nouăsprezece ori — de la 93,8 la sută la 4,9 la sută — în orbirea contradicției, fără nicio reantrenare, fără nicio modificare a conductei, fără nicio creștere a întârzierii și fără nicio creștere a costurilor pe interogare. Acesta nu este un raționament îmbunătățit. Acesta este pur și simplu o alocare forțată. Odată ce modelul trebuie să furnizeze o secțiune Dezacord, el se întoarce prin documentele pe care le-a recuperat inițial, căutând ceva de inclus în această secțiune.
Solicitanții structurați sunt mai puțin despre îmbunătățirea capacității modelului de a raționa și mai mult despre furnizarea unei guvernanțe ușoare asupra modului în care comportamentul de generare al modelului alocă spațiul de ieșire. Forțează modelul să aloce o anumită cantitate de spațiu de ieșire pentru dezacord (diferența dintre informațiile disponibile și informațiile care trebuie să apară pentru a îndeplini cerințele).
Acesta schimbă o ipoteză comună arhitecturală. Majoritatea îmbunătățirilor RAG propuse adaugă informații la context: mai multe documente, scoruri de recuperare, etichete de poziție, metadate de calitate a dovezilor. Cu excepția cazului în care promptul de sinteză are cerințe specifice pentru aceste informații pentru a modela structura de ieșire, majoritatea nu vor schimba comportamentul modelului. Schimbarea intrării deplasează masa la margini; schimbarea structurii de ieșire necesară schimbă distribuțiile direct
De ce nu ajută ajutoarele așteptate
Două elemente considerate esențiale pentru RAG-ul conștient de contradicții biomedicale au oferit foarte puțin atunci când au fost testate cu ablație controlată.
1) Dezmembrarea PICO. PICO (Populație, Intervenție, Comparație, Rezultat) este o modalitate organizată de a descompune întrebări clinice în părți componente pentru utilizare în medicină bazată pe dovezi. Ipoteza a fost că descompunerea afirmațiilor în câmpuri PICO ar limita deriva și ar îmbunătăți detectarea contradicției în dovezi eterogene. Eliminarea acestui nivel a rezultat într-o ieșire aproape indistinctă de cea generată de sistemul complet. Deși PICO poate fi util pentru organizarea gândirii în timpul luării deciziilor clinice; ca intrare inferată la momentul analizei pentru a sprijini detectarea contradicției, nu are nicio contribuție măsurabilă.
2) Clasificarea explicită a poziției. În contrast cu eliminarea PICO, clasificarea poziției explicite a funcționat slab, dar diferit. La corpora academice curate, a produs câștiguri mici pe anumite metrice. Cu toate acestea, atunci când a analizat textul web zgomotos — care este, de obicei, modul în care aplicațiile de sănătate cu orientare către consumatori vor avea acces la informații — clasificatorul a returnat NOT_ENOUGH_INFO pentru majoritatea documentelor, în principal pentru că autorii de conținut de sănătate cu orientare către consumatori nu declară, de obicei, poziția lor utilizând limbajul declarativ așteptat de clasificator. Consecința a fost că aceste etichete, ca fiind nefolositoare, au fost propagate în contextul sintezei ca zgomot. Eliminarea etapei pentru corpora zgomotoase a îmbunătățit ușor detectarea contradicției.
Bottleneck-ul real este calitatea semnalului upstream
Concluzia cea mai importantă a acestui studiu este că capacitatea de a recunoaște contradicții în surse este limitată de cât de precisă este informația (datele) despre aceste surse, mai mult decât de modul în care au fost construite sau structurate.
Utilizarea calității dovezilor — proporția cazurilor în care sinteza citează în mod preferențial sursa de calitate superioară atunci când ambele sunt disponibile — a fost 0,83 la abstracte științifice curate și a scăzut sub 0,15 la recuperarea webului zgomotos. Fidelitatea citării semantice a urmat același model, de la 0,66 la abstracte la 0,45 la conținutul de sănătate al consumatorilor.

Fluxuri identice, corpusuri diferite. Gestionarea contradicțiilor este limitată de cât de explicite sunt semnalele din documentele-sursă.
Există un motiv structural pentru acest lucru. Documentele recuperate din lumea reală lipsesc adesea de semnalele pe care se bazează orice clasificator sau mecanism de ponderare: metadate de tip de publicație, declarații explicite de poziție, descrieri de metodologie. Rezumatele articolelor peer-review fac aserțiuni declarative cu privire la populații, metodologii și rezultate specifice. Aceleași aserțiuni sunt făcute în limbaj anecdotic, persuasiv și evaziv în articolele de sănătate ale consumatorilor. Prin urmare, sisteme identice produc comportamente radical diferite în aval, în funcție de ceea ce primesc ca intrare.
Acest lucru este susținut și de cea mai mare evaluare a expertului medical RAG publicată vreodată, în care optsprezece experți medicali au contribuit cu 80.502 de annotări pe 800 de ieșiri ale modelului. Doar 22 la sută din trecerile din top-16 au fost relevante. RAG-ul standard a degradat faptualitatea și integralitatea în raport cu liniile de bază non-RAG. Recuperarea și selectarea dovezilor, nu generarea, au fost punctele de eșec dominant — un ecou al ceea ce lucrările de referință despre RAG medical au raportat în ultimii doi ani.
Deși există o implicare relativ limitată a acestei constatări în ceea ce privește aplicarea, se poate spune în mod concludent că capacitatea sistemului dvs. de a gestiona contradicții atunci când recuperează din rezumatele PubMed nu poate fi transferată pe un site web cu orientare către consumatori, indiferent de cât de avansat este restul sistemului.
Punctul orb al evaluării
Măsurarea manipulării contradicției este mai dificilă decât pare, iar chiar și o abordare standard pentru măsurarea manipulării contradicției are propriile sale probleme.
Scorarea LLM-judecător reprezintă cea mai obișnuită modalitate de a evalua ieșirile RAG deschise pentru manipularea conflictului și se abate de la verificările de recunoaștere structurală în ceea ce privește modul în care sunt dezvoltate. Strategiile de prompt care organizează sinteza în câmpuri PICO primesc scoruri ridicate de la judecători, în timp ce eşuează testele explicite de recunoaștere. Acest lucru este așteptat: judecătorii LLM au fost documentați ca favorizând răspunsuri mai lungi, mai elaborate și vor vedea o cavernă îngropată în secțiunea de rezultate ca o dovadă de minuțiozitate atunci când nimic din nivelul de proză nu face referire la conflict.
Strategia de recuperare introduce o a doua capcană. Recuperarea aleatoare produce o rată de orbire a contradicției de zero — o sinteză nu poate eșua în a recunoaște o contradicție pe care setul său de recuperare nu o conține. Relevanța marginală maximă a recuperării, pe de altă parte, a redus fidelitatea citării semantice până la 0,11. Fiecare pare acceptabil sub o singură metrică de manipulare a contradicției, dar ambele nu reușesc sub evaluarea pereche.
Deci perechea metricilor. Rulați trei verificări pe fiecare sinteză: o verificare structurală deterministă pentru limbajul exprimat care recunoaște un conflict; un judecător LLM pentru adâncime și echilibru; și o verificare a citării semantice care confirmă că conținutul citat se potrivește cu sursa sa. Fiecare identifică ceea ce ceilalți nu fac. Niciunul nu poate fi de încredere singur ca benchmark pentru manipularea contradicției.
Patru acțiuni pentru acest trimestru
- Testați-vă baza. Fiecare sistem RAG biomedical, clinic, regulator în producție trebuie testat pentru orbirea contradicției înainte de a fi distribuit în continuare. Pentru a efectua testul, aveți nevoie de un set de test cu perechi de contradicții și o verificare pe interogare care să semnaleze dezacordul substanțial. O bază de 72,6 la sută nu este o rotunjire.
- Implementați prompturi de sinteză structurate. Cele patru secțiuni (necesare) — Acord, Dezacord, Calitatea dovezilor, Concluzie — forțează benzile de ieșire pe dezacorduri. Nu este necesară nicio infrastructură nouă; nu este necesar niciun antrenament; nu este necesar niciun cost pe interogare; o singură schimbare a produs o reducere de nouăsprezece ori!
- Nu utilizați recuperarea MMR pentru interogări sensibile la contradicții. Deși MMR utilizează documente diversificate pentru acoperirea topicului, nu optimizează pentru acoperirea poziției — ceea ce este incorect atunci când scopul este de a recupera ambele părți ale unui dezacord. Prin urmare, ar trebui să se utilizeze recuperarea bm25 plus încorporarea ca o opțiune mai sigură. Cu toate acestea, diversificarea conștientă de poziție ar fi direcția în care această lucrare arată.
- Perechea metricilor dvs. de evaluare. Pensionați scorul unic LLM-judecător. Combinați-l cu o verificare structurală pentru conținut substanțial sub titlurile de recunoaștere și o verificare a citării semantice care verifică că dovezile citate susțin afirmația declarată.
Punctul mai larg
Instinctul dominant în dezvoltarea RAG este aditiv: recuperatori mai buni, rerankeri mai buni, metadate mai bogate, ferestre de context mai lungi. Conversația industriei despre de ce conductele RAG încă eșuează în producție a urmat în mare măsură aceeași formă. Pentru manipularea contradicției, mișcarea eficientă a fost subtractivă — constrângerea a ceea ce sistemul este permis să producă, mai degrabă decât extinderea a ceea ce i se dă. O singură prompt de sinteză cu patru părți a depășit o conductă cu cinci etape. A făcut-o schimbând ceea ce modelul trebuia să producă, nu ceea ce modelul putea vedea.
Acest lucru nu face arhitectura irelevantă. Recuperarea stabilește un plafon, recuperarea aleatoare face sinteza lipsită de sens, iar calitatea slabă a dovezilor limitează totul în aval. Acesta este motivul pentru care întrebarea dacă sistemele RAG rezolvă problema fiabilității continuă să reapară. Cu toate acestea, ceea ce determină dacă dovezile contradictorii sunt reprezentate ca fiind contradictorii se dovedește a fi mai târziu în conductă și mai ieftin de schimbat decât multe dintre celelalte componente, ceea ce înseamnă că schimbările necesare pentru a îmbunătăți fiabilitatea pot apărea mai devreme.
Lucrarea scumpă — seturi de date de contradicții mai bune, semnale de antrenare de dezacord explicit, recuperare sensibilă la poziție, benchmark-uri native de contradicții — încă trebuie făcută și va dura considerabil mai mult.
Prin urmare, dacă doriți să știți dacă sistemul dvs. prezintă dovezi contradictorii ca fiind contradictorii, ar trebui să vă puneți întrebarea incomodă și să găsiți răspunsul această săptămână: Vă spune sistemul utilizatorilor atunci când dovezile sale se contrazic?












