Fondamenti di IA
PerchÃĐ il tuo RAG biomedico nasconde le contraddizioni da te

Il RAG biomedico standard risolve silenziosamente le prove in conflitto in circa tre query su quattro. La soluzione ÃĻ strutturale, non informativa â e la maggior parte della complessità aggiunta a monte dalle squadre non aiuta.
Chiedi a un assistente clinico con funzionalità di recupero aumentato una semplice domanda â il melatonina aiuta con il jet lag? â e la letteratura che recupera non sarà dâaccordo con se stessa.
La revisione Cochrane ha concluso che il melatonina ÃĻ notevolmente efficace, con otto delle dieci prove incluse che mostrano una riduzione del jet lag sui voli che attraversano cinque o piÃđ fusi orari. Uno studio randomizzato e in doppio cieco di 257 medici norvegesi nella rivista American Journal of Psychiatry ha trovato nessun beneficio da nessuno dei tre regimi di melatonina.
Entrambi i documenti sono reali. Entrambi sono metodologicamente seri. Qualsiasi clinico che decide cosa raccomandare deve sapere che sono in disaccordo.
Nel test controllato, la sintesi di solito non lo diceva. Produceva un paragrafo fluente e correttamente citato che si schierava a favore di una posizione e non segnalava mai che esistesse unâaltra posizione.
Questo ÃĻ il cecità alle contraddizioni. Su un benchmark di contraddizioni accoppiate biomediche, si verificava nel 72,6 percento delle query (95% CI 0,697â0,755). Il output leggeva normalmente. Le citazioni risolvevano correttamente. I controlli di qualità standard superavano. Il disaccordo semplicemente scompariva.
Il modo di fallimento che sembra un successo
Mentre non câÃĻ una convergenza diretta nella prova biomedica, gli studi mostrano risultati in conflitto tra lâuso di studi osservazionali e studi clinici randomizzati (RCT) e anche metodi diversi utilizzati per diverse popolazioni di pazienti; tuttavia, uno studio puÃē anche includere sia una metodologia forte che debole, che sembrerebbe avere lo stesso peso.
Questo non ÃĻ un caso unico. Lâanalisi di Ioannidis sulla ricerca clinica piÃđ citata ha trovato che il 16 percento degli studi piÃđ citati sono stati successivamente contraddetti, e che gli studi osservazionali erano molto piÃđ probabili di essere contraddetti o di avere i loro effetti rivisti verso il basso â cinque su sei, contro nove su trentanove. Quindi, il problema non ÃĻ solo il disaccordo tra gli studi, ma piuttosto una parte strutturale della letteratura stessa.
Pertanto, come funzione critica di qualsiasi sistema di generazione biomedico con funzionalità di recupero aumentato, generare prove sulle disaccordi tra gli studi dovrebbe essere un obiettivo primario. Tuttavia, la maggior parte dei sistemi non riesce a realizzare questo compito. Utilizzando il benchmark HealthContradict con 920 esempi di contraddizioni accoppiate, si ÃĻ dimostrato che un RAG standard falliva nel generare le disaccordi in circa il 73% delle coppie testate. Il problema non ÃĻ il recupero. Il sistema recupera entrambi i lati. Poi risolve il conflitto silenziosamente, a favore di uno di loro.
Un esame manuale di 50 casi di fallimento stratificati ha prodotto un modello che ho definito appiattimento epistemologico. Entrambi i documenti sono citati individualmente dal modello, e la sua rappresentazione del conflitto ÃĻ descritta in termini di gradienti di confidenza (âevidenza aneddotica âĶ gli studi scientifici indicanoâĶâ) come se non ci fosse alcun conflitto. Meno del 5% di questi casi di fallimento utilizzavano le parole âcontraddizioneâ, âconflittoâ o âdisaccordoâ in assoluto. Lâoutput generato aveva un tasso di accuratezza delle citazioni di 0,99. Questo ÃĻ esattamente il punto: lâaccuratezza delle citazioni non implica la consapevolezza della contraddizione. Un sistema puÃē attribuire ogni frase in modo perfetto e comunque dire a un clinico qualcosa che la base di prove non supporta.
Tre caratteristiche della âsintesiâ RAG creano un ambiente clinico pericoloso.
Invertendo il valore della proposta. Lo scopo del RAG ÃĻ quello di visualizzare le prove rilevanti per i clinici. Pertanto, rimuovendo lâaspetto di quelle prove che sono piÃđ importanti per i clinici da esaminare, esso realizza il suo opposto.
Creando lâinvisibilità . PoichÃĐ non câÃĻ una copertura, o una troncatura, o un artefatto di formato; una âsintesi appiattitaâ e una sintesi fedele appaiono indistinguibili sullo schermo.
Compensando silenziosamente a scala. Nessuna cosa in un set di valutazione standard segnala, quindi un sistema puÃē funzionare in produzione per mesi mentre ogni query in conflitto ÃĻ risolta silenziosamente in una direzione.
Le informazioni non sono il perno
Una soluzione ovvia a questo problema sarebbe informare il modello. Chiaramente, se il modo di fallimento era che il modello non identificava che due documenti erano in conflitto, potresti semplicemente aggiungere unâetichetta di posizione âSUPPORTOâ o âCONTRADDIZIONEâ a ciascuno dei documenti recuperati. CiÃē dovrebbe ovviamente migliorare le prestazioni del modello. Non lo ha fatto.
In un esperimento in cui abbiamo aggiunto etichette di posizione (annotando) per dare esplicitamente al modello le informazioni che due documenti erano in conflitto, abbiamo trovato che lâannotazione esplicita della posizione ha spostato la cecità alle contraddizioni dal 93,8 percento nel braccio di controllo non annotato al 91,4 percento â una differenza con intervalli di confidenza sovrapposti e senza significato pratico. Sebbene il modello abbia ricevuto le informazioni che due documenti erano in conflitto, la sua risposta predefinita rimaneva invariata.
Capire il meccanismo ÃĻ utile qui. Le informazioni aggiunte passivamente a un prompt non cambiano la distribuzione predefinita del modello. Per le domande biomediche cariche di contraddizioni, quella distribuzione favorisce fortemente una posizione consolidata. Le etichette di posizione diventano token extra â spesso riciclati in titoli di sezione â mentre la prosa ritorna al tipo.
La struttura ÃĻ il perno
CiÃē che ha funzionato era strutturale, piuttosto che essere informativo; invece di fornire al modello tutto ciÃē che ÃĻ fattuale o corretto sui documenti, la struttura richiedeva che la sintesi fosse costruita in termini di possibili disaccordi (Accordo, Disaccordo, Qualità delle prove, Conclusione). Il prompt con scaffale fornisce al modello non piÃđ informazioni di quelle del controllo non annotato. La sola differenza ÃĻ ciÃē che il modello deve fare.
Ci sono state riduzioni di circa diciannove volte â dal 93,8 percento al 4,9 percento â nella cecità alle contraddizioni senza alcun ritraining, senza alcuna modifica della pipeline, senza alcun aumento della latenza e senza alcun aumento dei costi per query.
Questo non ÃĻ un miglioramento del ragionamento. Questo ÃĻ semplicemente unâallocazione forzata. Una volta che il modello deve fornire una sezione di disaccordo, torna indietro attraverso i documenti che inizialmente ha recuperato alla ricerca di qualcosa da includere in questa sezione.

Cecità alle contraddizioni in tre condizioni di sintesi in ablazione controllata. Lâaggiunta di informazioni sulla posizione ha spostato il tasso di 2,4 punti; il cambiamento della struttura di output richiesta ha spostato di 86,5.
La promozione strutturata ÃĻ meno sulla capacità del modello di ragionare e piÃđ sul fornire una leggera governance su come il comportamento di generazione del modello alloca lo spazio di output. Costringe il modello a spendere una certa quantità del suo spazio di output sul disaccordo (la differenza tra le informazioni disponibili e le informazioni che devono apparire per soddisfare i requisiti).
CiÃē cambia unâipotesi architettonica comune. La maggior parte delle proposte di miglioramento del RAG aggiunge informazioni al contesto: piÃđ documenti, punteggi di recupero, etichette di posizione, metadati di prova. A meno che il prompt di sintesi non abbia requisiti specifici per quelle informazioni per plasmare la struttura di output, la maggior parte non cambierà il comportamento del modello. Il cambiamento dellâinput sposta la massa ai margini; il cambiamento della struttura di output richiesta cambia le distribuzioni direttamente
PerchÃĐ gli strumenti attesi non aiutano
Due elementi comunemente considerati essenziali per il RAG biomedico consapevole delle contraddizioni hanno fornito molto poco quando testati con ablazione controllata.
1) Decomposizione PICO. PICO (Popolazione, Intervento, Confronto, Esito) ÃĻ un modo organizzato di scomporre le domande cliniche in parti componenti per lâuso nella medicina basata sulle prove. Lâipotesi era che la scomposizione delle affermazioni in campi PICO avrebbe limitato la deriva dellâambito e migliorato la rilevazione delle contraddizioni attraverso prove eterogenee. La rimozione di questo livello ha prodotto un output quasi indistinguibile da quello generato dal sistema completo. Mentre PICO puÃē essere utile per organizzare i propri pensieri durante la presa di decisioni cliniche; come input inferito al momento dellâanalisi per supportare la rilevazione delle contraddizioni, non ha alcun contributo misurabile.
2) Classificazione esplicita della posizione. A differenza della rimozione di PICO, la classificazione esplicita della posizione ha eseguito male ma in modo diverso. Sui corpora accademici puliti, ha prodotto piccoli guadagni su alcune metriche. Tuttavia, quando si analizzava il testo web rumoroso â che ÃĻ tipicamente come le app di salute dei consumatori avranno accesso alle informazioni â il classificatore restituiva NOT_ENOUGH_INFO per la maggior parte dei documenti, principalmente perchÃĐ gli autori di contenuti di salute dei consumatori non dichiarano normalmente la loro posizione utilizzando il linguaggio dichiarativo atteso dal classificatore. Di conseguenza, quelle etichette come non informative sono state propagate nel contesto di sintesi come rumore. La rimozione della fase per i corpora rumorosi ha migliorato marginalmente la rilevazione delle contraddizioni.
Il vero collo di bottiglia ÃĻ la qualità del segnale a monte
La conclusione piÃđ importante di questo studio ÃĻ che la capacità di riconoscere le contraddizioni nelle fonti ÃĻ limitata da quanto ÃĻ accurata lâinformazione (dati) su queste fonti, piÃđ che da come sono state costruite o strutturate.
Lâutilizzo della qualità delle prove â la proporzione dei casi in cui la sintesi cita preferenzialmente la fonte di alta qualità quando entrambe sono disponibili â era 0,83 su abstract scientifici puliti e scese al di sotto di 0,15 su recupero web rumoroso. La fedeltà delle citazioni semantiche ha seguito lo stesso modello, da 0,66 su abstract a 0,45 su contenuti di salute dei consumatori.

Identical pipelines, different corpora. Contradiction handling is capped by the explicitness of the signals in the source documents.
CâÃĻ una ragione strutturale per questo. I documenti recuperati nel mondo reale mancano frequentemente dei segnali sui quali qualsiasi classificatore o meccanismo di ponderazione dipende: metadati di tipo di pubblicazione, affermazioni di posizione esplicite, descrizioni di metodologia. Gli abstract degli articoli di revisione peer-to-peer fanno affermazioni dichiarative riguardo a popolazioni specifiche, metodologie e risultati. Le stesse affermazioni sono fatte allâinterno del linguaggio aneddotico, persuasivo e di copertura in articoli di salute dei consumatori. Pertanto, sistemi identici producono comportamenti diversi a valle in base a ciÃē che ricevono come input.
Questo ÃĻ anche supportato dalla piÃđ grande valutazione di esperti di RAG biomedico mai pubblicata, in cui diciotto esperti medici hanno contribuito con 80.502 annotazioni su 800 output del modello. Solo il 22 percento dei passaggi di recupero tra i primi 16 era rilevante. Il RAG standard ha degradato la fattualità e la completezza rispetto ai punti di riferimento non RAG. Il recupero e la selezione delle prove, non la generazione, sono stati i punti di fallimento dominanti â unâeco di ciÃē che il lavoro di benchmarking sul RAG biomedico ha riportato per due anni.
Sebbene ci sia unâimpressione relativamente limitata di questo risultato in termini di applicazione, si puÃē dire concludentemente che la capacità del tuo sistema di gestire le contraddizioni quando recupera da abstract di PubMed non puÃē essere trasferita a un sito web rivolto ai consumatori, indipendentemente da quanto avanzato sia il resto del tuo sistema.
Il punto cieco della valutazione
Misurare la gestione delle contraddizioni ÃĻ piÃđ difficile di quanto sembri, e anche un approccio standard per misurare la gestione delle contraddizioni ha i suoi problemi.
LLM-judge scoring rappresenta il modo piÃđ comune in cui lâoutput RAG a risposta aperta viene valutato per la gestione dei conflitti e si discosta anche dai controlli di riconoscimento strutturale in termini di come sono sviluppati. Le strategie di prompt che organizzano la sintesi in campi PICO ricevono punteggi elevati dai giudici mentre falliscono i test di riconoscimento esplicito. CiÃē ÃĻ atteso: i giudici LLM hanno documentato il favore per risposte piÃđ lunghe ed elaborate e vedranno anche una clausola sepolta nella sezione dei risultati come completezza quando nulla nel livello di prosa fa riferimento al conflitto.
La strategia di recupero introduce una seconda trappola. Il recupero casuale produce un tasso di cecità alle contraddizioni dello zero â una sintesi non puÃē fallire nel riconoscere una contraddizione che il suo set di recupero non contiene. La rilevanza marginale massima del recupero, dâaltra parte, ha ridotto la fedeltà delle citazioni semantiche a 0,11. Ognuno sembra accettabile sotto una singola metrica di gestione delle contraddizioni, ma entrambi mancano sotto la valutazione accoppiata.
Quindi accoppia le metriche. Esegui tre controlli su ogni sintesi: un controllo strutturale deterministico per il linguaggio espresso che riconosce un conflitto; un giudice LLM per la profondità e lâequilibrio; e un controllo di citazione semantica che conferma che il contenuto citato corrisponde alla sua fonte. Ognuno identifica ciÃē che gli altri non fanno. Nessuno puÃē essere affidabile da solo come benchmark per la gestione delle contraddizioni.
Quattro azioni per questo trimestre
- Testa la tua baseline. Ogni sistema RAG biomedico, clinico, regolatorio in produzione deve essere testato per la cecità alle contraddizioni prima di ulteriore distribuzione. Per eseguire il test, hai bisogno di un set di test di contraddizioni accoppiate e di un controllo per query che lâoutput segnali una disaccordo sostanziale. Una baseline del 72,6 percento non ÃĻ un errore di arrotondamento.
- Implementa prompt di sintesi strutturati. Le quattro sezioni richieste â accordo, disaccordo, qualità delle prove, conclusione â costringono la larghezza di banda di output sulle disaccordi. Non câÃĻ nuova infrastruttura richiesta; non câÃĻ addestramento richiesto; non câÃĻ costo per query; un solo cambiamento ha prodotto una riduzione di diciannove volte!
- Non utilizzare il recupero MMR per query sensibili alle contraddizioni. Sebbene il MMR utilizzi documenti diversificati per la copertura dei temi, non si ottimizza per la copertura della posizione â che ÃĻ scorretta quando lâobiettivo ÃĻ recuperare entrambi i lati di una disaccordo. Pertanto, il recupero bm25 piÃđ lâincorporazione dovrebbe essere utilizzato come default piÃđ sicuro. Tuttavia, la diversificazione consapevole della posizione sarebbe la direzione verso cui questo lavoro punta.
- Accoppia le tue metriche di valutazione. Ritira il singolo punteggio del giudice LLM. Combinalo con un controllo strutturale per contenuto sostanziale sotto intestazioni di riconoscimento e con un controllo di citazione semantica che verifica che le prove citate supportino lâaffermazione dichiarata.
Il punto piÃđ ampio
Lâistinto dominante nello sviluppo del RAG ÃĻ additivo: migliori recuperatori, migliori riordinatori, metadati piÃđ ricchi, finestre di contesto piÃđ lunghe. La conversazione dellâindustria su perchÃĐ le pipeline RAG falliscono ancora in produzione ha seguito grosso modo la stessa forma. Per la gestione delle contraddizioni, la mossa efficace ÃĻ stata sottrattiva â limitando cosa il sistema ÃĻ autorizzato a produrre piuttosto che espandere cosa gli ÃĻ dato. Un solo prompt di sintesi a quattro parti ha superato una pipeline a cinque fasi. CiÃē ÃĻ stato fatto cambiando cosa il modello doveva produrre, non cosa il modello poteva vedere.
CiÃē non rende lâarchitettura irrilevante. Il recupero stabilisce un tetto, il recupero casuale rende la sintesi senza senso e la scarsa qualità delle prove limita tutto il downstream. Questo ÃĻ il motivo per cui la domanda di se i sistemi RAG risolvono il problema dellâaffidabilità continua a riemergere. Tuttavia, ciÃē che determina se le prove in conflitto sono rappresentate come in conflitto si rivela essere piÃđ tardi nella pipeline e piÃđ economico da cambiare rispetto a molti degli altri componenti, il che significa che i cambiamenti necessari per migliorare lâaffidabilità possono verificarsi prima.
Il lavoro costoso â migliori set di dati di contraddizioni, segnali di addestramento di disaccordo espliciti, recupero sensibile alla posizione, benchmark nativi delle contraddizioni â deve ancora essere fatto e richiederà considerevolmente piÃđ tempo.
Pertanto, se vuoi sapere se il tuo sistema rappresenta le prove in conflitto come in conflitto, dovresti chiederti la domanda scomoda e trovare la risposta questa settimana: Il tuo sistema dice agli utenti quando le prove sono in conflitto?












