Fondamenti di IA

PerchÃĐ il tuo RAG biomedico nasconde le contraddizioni da te

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Il RAG biomedico standard risolve silenziosamente le prove in conflitto in circa tre query su quattro. La soluzione ÃĻ strutturale, non informativa — e la maggior parte della complessità aggiunta a monte dalle squadre non aiuta.

Chiedi a un assistente clinico con funzionalità di recupero aumentato una semplice domanda — il melatonina aiuta con il jet lag? — e la letteratura che recupera non sarà d’accordo con se stessa.

La revisione Cochrane ha concluso che il melatonina ÃĻ notevolmente efficace, con otto delle dieci prove incluse che mostrano una riduzione del jet lag sui voli che attraversano cinque o piÃđ fusi orari. Uno studio randomizzato e in doppio cieco di 257 medici norvegesi nella rivista American Journal of Psychiatry ha trovato nessun beneficio da nessuno dei tre regimi di melatonina.

Entrambi i documenti sono reali. Entrambi sono metodologicamente seri. Qualsiasi clinico che decide cosa raccomandare deve sapere che sono in disaccordo.

Nel test controllato, la sintesi di solito non lo diceva. Produceva un paragrafo fluente e correttamente citato che si schierava a favore di una posizione e non segnalava mai che esistesse un’altra posizione.

Questo ÃĻ il cecità alle contraddizioni. Su un benchmark di contraddizioni accoppiate biomediche, si verificava nel 72,6 percento delle query (95% CI 0,697–0,755). Il output leggeva normalmente. Le citazioni risolvevano correttamente. I controlli di qualità standard superavano. Il disaccordo semplicemente scompariva.

Il modo di fallimento che sembra un successo

Mentre non c’ÃĻ una convergenza diretta nella prova biomedica, gli studi mostrano risultati in conflitto tra l’uso di studi osservazionali e studi clinici randomizzati (RCT) e anche metodi diversi utilizzati per diverse popolazioni di pazienti; tuttavia, uno studio puÃē anche includere sia una metodologia forte che debole, che sembrerebbe avere lo stesso peso.

Questo non ÃĻ un caso unico. L’analisi di Ioannidis sulla ricerca clinica piÃđ citata ha trovato che il 16 percento degli studi piÃđ citati sono stati successivamente contraddetti, e che gli studi osservazionali erano molto piÃđ probabili di essere contraddetti o di avere i loro effetti rivisti verso il basso — cinque su sei, contro nove su trentanove. Quindi, il problema non ÃĻ solo il disaccordo tra gli studi, ma piuttosto una parte strutturale della letteratura stessa.

Pertanto, come funzione critica di qualsiasi sistema di generazione biomedico con funzionalità di recupero aumentato, generare prove sulle disaccordi tra gli studi dovrebbe essere un obiettivo primario. Tuttavia, la maggior parte dei sistemi non riesce a realizzare questo compito. Utilizzando il benchmark HealthContradict con 920 esempi di contraddizioni accoppiate, si ÃĻ dimostrato che un RAG standard falliva nel generare le disaccordi in circa il 73% delle coppie testate. Il problema non ÃĻ il recupero. Il sistema recupera entrambi i lati. Poi risolve il conflitto silenziosamente, a favore di uno di loro.

Un esame manuale di 50 casi di fallimento stratificati ha prodotto un modello che ho definito appiattimento epistemologico. Entrambi i documenti sono citati individualmente dal modello, e la sua rappresentazione del conflitto ÃĻ descritta in termini di gradienti di confidenza (“evidenza aneddotica â€Ķ gli studi scientifici indicanoâ€Ķ”) come se non ci fosse alcun conflitto. Meno del 5% di questi casi di fallimento utilizzavano le parole “contraddizione”, “conflitto” o “disaccordo” in assoluto. L’output generato aveva un tasso di accuratezza delle citazioni di 0,99. Questo ÃĻ esattamente il punto: l’accuratezza delle citazioni non implica la consapevolezza della contraddizione. Un sistema puÃē attribuire ogni frase in modo perfetto e comunque dire a un clinico qualcosa che la base di prove non supporta.

Tre caratteristiche della “sintesi” RAG creano un ambiente clinico pericoloso.

Invertendo il valore della proposta. Lo scopo del RAG ÃĻ quello di visualizzare le prove rilevanti per i clinici. Pertanto, rimuovendo l’aspetto di quelle prove che sono piÃđ importanti per i clinici da esaminare, esso realizza il suo opposto.

Creando l’invisibilità. PoichÃĐ non c’ÃĻ una copertura, o una troncatura, o un artefatto di formato; una “sintesi appiattita” e una sintesi fedele appaiono indistinguibili sullo schermo.

Compensando silenziosamente a scala. Nessuna cosa in un set di valutazione standard segnala, quindi un sistema puÃē funzionare in produzione per mesi mentre ogni query in conflitto ÃĻ risolta silenziosamente in una direzione.

Le informazioni non sono il perno

Una soluzione ovvia a questo problema sarebbe informare il modello. Chiaramente, se il modo di fallimento era che il modello non identificava che due documenti erano in conflitto, potresti semplicemente aggiungere un’etichetta di posizione “SUPPORTO” o “CONTRADDIZIONE” a ciascuno dei documenti recuperati. CiÃē dovrebbe ovviamente migliorare le prestazioni del modello. Non lo ha fatto.

In un esperimento in cui abbiamo aggiunto etichette di posizione (annotando) per dare esplicitamente al modello le informazioni che due documenti erano in conflitto, abbiamo trovato che l’annotazione esplicita della posizione ha spostato la cecità alle contraddizioni dal 93,8 percento nel braccio di controllo non annotato al 91,4 percento — una differenza con intervalli di confidenza sovrapposti e senza significato pratico. Sebbene il modello abbia ricevuto le informazioni che due documenti erano in conflitto, la sua risposta predefinita rimaneva invariata.

Capire il meccanismo ÃĻ utile qui. Le informazioni aggiunte passivamente a un prompt non cambiano la distribuzione predefinita del modello. Per le domande biomediche cariche di contraddizioni, quella distribuzione favorisce fortemente una posizione consolidata. Le etichette di posizione diventano token extra — spesso riciclati in titoli di sezione — mentre la prosa ritorna al tipo.

La struttura ÃĻ il perno

CiÃē che ha funzionato era strutturale, piuttosto che essere informativo; invece di fornire al modello tutto ciÃē che ÃĻ fattuale o corretto sui documenti, la struttura richiedeva che la sintesi fosse costruita in termini di possibili disaccordi (Accordo, Disaccordo, Qualità delle prove, Conclusione). Il prompt con scaffale fornisce al modello non piÃđ informazioni di quelle del controllo non annotato. La sola differenza ÃĻ ciÃē che il modello deve fare.

Ci sono state riduzioni di circa diciannove volte — dal 93,8 percento al 4,9 percento — nella cecità alle contraddizioni senza alcun ritraining, senza alcuna modifica della pipeline, senza alcun aumento della latenza e senza alcun aumento dei costi per query.

Questo non ÃĻ un miglioramento del ragionamento. Questo ÃĻ semplicemente un’allocazione forzata. Una volta che il modello deve fornire una sezione di disaccordo, torna indietro attraverso i documenti che inizialmente ha recuperato alla ricerca di qualcosa da includere in questa sezione.

Cecità alle contraddizioni in tre condizioni di sintesi in ablazione controllata. L’aggiunta di informazioni sulla posizione ha spostato il tasso di 2,4 punti; il cambiamento della struttura di output richiesta ha spostato di 86,5.

La promozione strutturata ÃĻ meno sulla capacità del modello di ragionare e piÃđ sul fornire una leggera governance su come il comportamento di generazione del modello alloca lo spazio di output. Costringe il modello a spendere una certa quantità del suo spazio di output sul disaccordo (la differenza tra le informazioni disponibili e le informazioni che devono apparire per soddisfare i requisiti).

CiÃē cambia un’ipotesi architettonica comune. La maggior parte delle proposte di miglioramento del RAG aggiunge informazioni al contesto: piÃđ documenti, punteggi di recupero, etichette di posizione, metadati di prova. A meno che il prompt di sintesi non abbia requisiti specifici per quelle informazioni per plasmare la struttura di output, la maggior parte non cambierà il comportamento del modello. Il cambiamento dell’input sposta la massa ai margini; il cambiamento della struttura di output richiesta cambia le distribuzioni direttamente

PerchÃĐ gli strumenti attesi non aiutano

Due elementi comunemente considerati essenziali per il RAG biomedico consapevole delle contraddizioni hanno fornito molto poco quando testati con ablazione controllata.

1) Decomposizione PICO. PICO (Popolazione, Intervento, Confronto, Esito) ÃĻ un modo organizzato di scomporre le domande cliniche in parti componenti per l’uso nella medicina basata sulle prove. L’ipotesi era che la scomposizione delle affermazioni in campi PICO avrebbe limitato la deriva dell’ambito e migliorato la rilevazione delle contraddizioni attraverso prove eterogenee. La rimozione di questo livello ha prodotto un output quasi indistinguibile da quello generato dal sistema completo. Mentre PICO puÃē essere utile per organizzare i propri pensieri durante la presa di decisioni cliniche; come input inferito al momento dell’analisi per supportare la rilevazione delle contraddizioni, non ha alcun contributo misurabile.

2) Classificazione esplicita della posizione. A differenza della rimozione di PICO, la classificazione esplicita della posizione ha eseguito male ma in modo diverso. Sui corpora accademici puliti, ha prodotto piccoli guadagni su alcune metriche. Tuttavia, quando si analizzava il testo web rumoroso — che ÃĻ tipicamente come le app di salute dei consumatori avranno accesso alle informazioni — il classificatore restituiva NOT_ENOUGH_INFO per la maggior parte dei documenti, principalmente perchÃĐ gli autori di contenuti di salute dei consumatori non dichiarano normalmente la loro posizione utilizzando il linguaggio dichiarativo atteso dal classificatore. Di conseguenza, quelle etichette come non informative sono state propagate nel contesto di sintesi come rumore. La rimozione della fase per i corpora rumorosi ha migliorato marginalmente la rilevazione delle contraddizioni.

Il vero collo di bottiglia ÃĻ la qualità del segnale a monte

La conclusione piÃđ importante di questo studio ÃĻ che la capacità di riconoscere le contraddizioni nelle fonti ÃĻ limitata da quanto ÃĻ accurata l’informazione (dati) su queste fonti, piÃđ che da come sono state costruite o strutturate.

L’utilizzo della qualità delle prove — la proporzione dei casi in cui la sintesi cita preferenzialmente la fonte di alta qualità quando entrambe sono disponibili — era 0,83 su abstract scientifici puliti e scese al di sotto di 0,15 su recupero web rumoroso. La fedeltà delle citazioni semantiche ha seguito lo stesso modello, da 0,66 su abstract a 0,45 su contenuti di salute dei consumatori.

Identical pipelines, different corpora. Contradiction handling is capped by the explicitness of the signals in the source documents.

C’ÃĻ una ragione strutturale per questo. I documenti recuperati nel mondo reale mancano frequentemente dei segnali sui quali qualsiasi classificatore o meccanismo di ponderazione dipende: metadati di tipo di pubblicazione, affermazioni di posizione esplicite, descrizioni di metodologia. Gli abstract degli articoli di revisione peer-to-peer fanno affermazioni dichiarative riguardo a popolazioni specifiche, metodologie e risultati. Le stesse affermazioni sono fatte all’interno del linguaggio aneddotico, persuasivo e di copertura in articoli di salute dei consumatori. Pertanto, sistemi identici producono comportamenti diversi a valle in base a ciÃē che ricevono come input.

Questo ÃĻ anche supportato dalla piÃđ grande valutazione di esperti di RAG biomedico mai pubblicata, in cui diciotto esperti medici hanno contribuito con 80.502 annotazioni su 800 output del modello. Solo il 22 percento dei passaggi di recupero tra i primi 16 era rilevante. Il RAG standard ha degradato la fattualità e la completezza rispetto ai punti di riferimento non RAG. Il recupero e la selezione delle prove, non la generazione, sono stati i punti di fallimento dominanti — un’eco di ciÃē che il lavoro di benchmarking sul RAG biomedico ha riportato per due anni.

Sebbene ci sia un’impressione relativamente limitata di questo risultato in termini di applicazione, si puÃē dire concludentemente che la capacità del tuo sistema di gestire le contraddizioni quando recupera da abstract di PubMed non puÃē essere trasferita a un sito web rivolto ai consumatori, indipendentemente da quanto avanzato sia il resto del tuo sistema.

Il punto cieco della valutazione

Misurare la gestione delle contraddizioni ÃĻ piÃđ difficile di quanto sembri, e anche un approccio standard per misurare la gestione delle contraddizioni ha i suoi problemi.

LLM-judge scoring rappresenta il modo piÃđ comune in cui l’output RAG a risposta aperta viene valutato per la gestione dei conflitti e si discosta anche dai controlli di riconoscimento strutturale in termini di come sono sviluppati. Le strategie di prompt che organizzano la sintesi in campi PICO ricevono punteggi elevati dai giudici mentre falliscono i test di riconoscimento esplicito. CiÃē ÃĻ atteso: i giudici LLM hanno documentato il favore per risposte piÃđ lunghe ed elaborate e vedranno anche una clausola sepolta nella sezione dei risultati come completezza quando nulla nel livello di prosa fa riferimento al conflitto.

La strategia di recupero introduce una seconda trappola. Il recupero casuale produce un tasso di cecità alle contraddizioni dello zero — una sintesi non puÃē fallire nel riconoscere una contraddizione che il suo set di recupero non contiene. La rilevanza marginale massima del recupero, d’altra parte, ha ridotto la fedeltà delle citazioni semantiche a 0,11. Ognuno sembra accettabile sotto una singola metrica di gestione delle contraddizioni, ma entrambi mancano sotto la valutazione accoppiata.

Quindi accoppia le metriche. Esegui tre controlli su ogni sintesi: un controllo strutturale deterministico per il linguaggio espresso che riconosce un conflitto; un giudice LLM per la profondità e l’equilibrio; e un controllo di citazione semantica che conferma che il contenuto citato corrisponde alla sua fonte. Ognuno identifica ciÃē che gli altri non fanno. Nessuno puÃē essere affidabile da solo come benchmark per la gestione delle contraddizioni.

Quattro azioni per questo trimestre

  1. Testa la tua baseline. Ogni sistema RAG biomedico, clinico, regolatorio in produzione deve essere testato per la cecità alle contraddizioni prima di ulteriore distribuzione. Per eseguire il test, hai bisogno di un set di test di contraddizioni accoppiate e di un controllo per query che l’output segnali una disaccordo sostanziale. Una baseline del 72,6 percento non ÃĻ un errore di arrotondamento.
  2. Implementa prompt di sintesi strutturati. Le quattro sezioni richieste — accordo, disaccordo, qualità delle prove, conclusione — costringono la larghezza di banda di output sulle disaccordi. Non c’ÃĻ nuova infrastruttura richiesta; non c’ÃĻ addestramento richiesto; non c’ÃĻ costo per query; un solo cambiamento ha prodotto una riduzione di diciannove volte!
  3. Non utilizzare il recupero MMR per query sensibili alle contraddizioni. Sebbene il MMR utilizzi documenti diversificati per la copertura dei temi, non si ottimizza per la copertura della posizione — che ÃĻ scorretta quando l’obiettivo ÃĻ recuperare entrambi i lati di una disaccordo. Pertanto, il recupero bm25 piÃđ l’incorporazione dovrebbe essere utilizzato come default piÃđ sicuro. Tuttavia, la diversificazione consapevole della posizione sarebbe la direzione verso cui questo lavoro punta.
  4. Accoppia le tue metriche di valutazione. Ritira il singolo punteggio del giudice LLM. Combinalo con un controllo strutturale per contenuto sostanziale sotto intestazioni di riconoscimento e con un controllo di citazione semantica che verifica che le prove citate supportino l’affermazione dichiarata.

Il punto piÃđ ampio

L’istinto dominante nello sviluppo del RAG ÃĻ additivo: migliori recuperatori, migliori riordinatori, metadati piÃđ ricchi, finestre di contesto piÃđ lunghe. La conversazione dell’industria su perchÃĐ le pipeline RAG falliscono ancora in produzione ha seguito grosso modo la stessa forma. Per la gestione delle contraddizioni, la mossa efficace ÃĻ stata sottrattiva — limitando cosa il sistema ÃĻ autorizzato a produrre piuttosto che espandere cosa gli ÃĻ dato. Un solo prompt di sintesi a quattro parti ha superato una pipeline a cinque fasi. CiÃē ÃĻ stato fatto cambiando cosa il modello doveva produrre, non cosa il modello poteva vedere.

CiÃē non rende l’architettura irrilevante. Il recupero stabilisce un tetto, il recupero casuale rende la sintesi senza senso e la scarsa qualità delle prove limita tutto il downstream. Questo ÃĻ il motivo per cui la domanda di se i sistemi RAG risolvono il problema dell’affidabilità continua a riemergere. Tuttavia, ciÃē che determina se le prove in conflitto sono rappresentate come in conflitto si rivela essere piÃđ tardi nella pipeline e piÃđ economico da cambiare rispetto a molti degli altri componenti, il che significa che i cambiamenti necessari per migliorare l’affidabilità possono verificarsi prima.

Il lavoro costoso — migliori set di dati di contraddizioni, segnali di addestramento di disaccordo espliciti, recupero sensibile alla posizione, benchmark nativi delle contraddizioni — deve ancora essere fatto e richiederà considerevolmente piÃđ tempo.

Pertanto, se vuoi sapere se il tuo sistema rappresenta le prove in conflitto come in conflitto, dovresti chiederti la domanda scomoda e trovare la risposta questa settimana: Il tuo sistema dice agli utenti quando le prove sono in conflitto?

Himanshu Goel ÃĻ un ricercatore di AI/ML specializzato nella generazione aumentata di recupero per domini ad alto rischio, tra cui workflow di documenti biomedici, finanziari e normativi.