Yapay zeka temelleri
Neden Biyomedikal RAGınız Size Çelişkileri Gizliyor

Standart biyomedikal RAG, yaklaşık dört sorgudan üçünde çatışan kanıtları sessizce çözer. Çözüm, yapısal değil, bilgilendirme değil — ve eklediğiniz çoğu yukarı akış karmaşıklığı yardımcı olmaz.
Bir retrieval-augmented klinik asistana basit bir soru sorun – melatonin jet lag ile yardımcı olur mu? – ve literatürü alacağından, kendisiyle anlaşmayacak.
Cochrane incelemesi melatoninin gerçekten etkili olduğunu kếtüledir, dahil edilen on çalışmanın sekizinde beş veya daha fazla zaman dilimini geçen uçuşlarda jet lag azaldı. Amerikan Psikiyatri Dergisi’nde yayımlanan 257 Norveçli doktorun katıldığı rastgele, çift kör bir çalışmada, üç melatonin rejiminden hiçbirinin faydası bulunmadı.
Her iki belge de gerçektir. Her ikisi de metodolojik olarak ciddidir. Hangi tavsiyede bulunacağını kararlaştıran herhangi bir klinisyen, onların anlaşmazlık içinde olduklarını bilmelidir.
Kontrol edilen testlerde, sentez genellikle böyle demedi. Bir taraf lehine, başka bir tarafın varlığını hiç sinyal vermeden, doğru bir şekilde alıntı yapılmış ve fluent bir paragraf üretti.
Bu, çelişki körlüğüdür. Bir çelişki-çiftlenmiş biyomedikal benchmark üzerinde, bu %72,6’da meydana geldi (95% CI 0,697-0,755). Çıktı normal olarak okundu. Alıntılar doğru bir şekilde çözüldü. Standart kalite kontrolleri geçti. Anlaşmazlık simplemente kayboldu.
başarılı gibi görünen başarısızlık modu
Biyo ilgili kanıtlarda doğrudan bir örtüşme olmadığından, gözlemsel çalışmaların kullanılması ile randomize kontrollü çalışmalar (RCT’ler) arasındaki çatışan sonuçlar ve farklı hasta popülasyonları için kullanılan çeşitli yöntemler hakkında çalışmalar vardır; ancak bir çalışma hem güçlü hem de zayıf metodoloji içerebilir, bu da aynı ağırlığa sahip gibi görünür.
Bu, özel bir durum değildir. Ioannidis’in yüksek alıntıya sahip klinik araştırmaların analizi en çok alıntı yapılan çalışmaların %16’sının tamamen çeliştiğini ve gözlemsel çalışmaların randomize çalışmalarına göre çeliştiğini veya etkilerinin aşağı yönde revize edildiğini buldu – altıdan beş, otuz dokuzdan dokuza karşı. Dolayısıyla, sorun sadece çalışmalar arasındaki anlaşmazlık değil, literatürün kendisinin yapısal bir parçası.
Dolayısıyla, herhangi bir biyomedikal retrieval-augmented generation sisteminin kritik bir fonksiyonu olarak, çalışmalar arasındaki anlaşmazlıklar hakkında kanıt oluşturmak birincil hedef olmalıdır. Ancak çoğu sistem bu görevi başaramaz. HealthContradict benchmark’ın 920 çelişki-çiftlenmiş örneğinde, standard bir retrieval-augmented generation (RAG) sisteminin yaklaşık %73’ünde anlaşmazlıkları oluşturamadığını gösterdi. Problemin nedeni alma değil, sistem her iki tarafı da alır, ancak sonra çatışmayı sessizce birine lehine çözer.
Bir el ile yapılan 50 stratified başarısızlık vakasının incelenmesi, epistemolojik düzleştirme olarak adlandırdığım bir model üretti. Her iki belge de model tarafından bireysel olarak alıntılanır ve çatışmanın betimlenmesi, bir çatışmanın varlığından bahsetmeden (“anekdotik kanıt … bilimsel çalışmalar gösteriyor…”) confidence gradyanları terimlerinde yapılır. Bu başarısızlık vakalarının %5’inden azı “çelişki”, “çatışma” veya “anlaşmazlık” kelimelerini kullanır. Üretilen çıktı, alıntı doğruluğu oranına sahiptir. Bu, tam da nokta: alıntı doğruluğu, çelişki farkındalığını ima etmez. Bir sistem her cümleyi mükemmel bir şekilde öznitelendirebilir ve仍然 bir klinisyene kanıtların desteklemediği bir şeyi söyleyebilir.
RAG’ın “sentez”inin üç özelliği, tehlikeli bir klinik ortam oluşturur.
Değer Önerisinin Tersine Çevrilmesi. RAG’ın amacı, klinisyenlere ilgili kanıtları göstermektir. Dolayısıyla, o kanıtların en önemli olanlarını kaldırarak, aslında amacının tersini gerçekleştirir.
Görünmezlik Oluşturma. Bir “düzleştirilmiş” sentez ve bir sadık sentez, ekranda birbirinden ayırt edilemez.
Sessizce Ölçeklendirerek Birleştirme. Standart bir değerlendirme setinde hiçbir şeyini işaret etmez, bu nedenle bir sistem aylarca üretim için çalışabilirken, her çatışmalı sorgu sessizce bir yönde çözülür.
Bilgi kolu değildir
Bu soruna açık bir çözüm, modeli bilgilendirmek olacaktır. Açıkçası, eğer başarısızlık modu modelin iki belgenin çatıştığını tanımlayamaması ise, einfach bir “SUPPORT” veya “CONTRADICT” stance etiketi eklemek gerekir. Bu, modelin performansını açıkça iyileştirmelidir. Ancak böyle olmadı.
Bir deneyde, stance etiketlerini (annotating aracılığıyla) açık bir şekilde ekleyerek modelin iki belgenin çatıştığını bilmesini sağladık, ancak bu, çelişki körlüğünü %93,8’den %91,4’e düşürdü – örtüşen güven aralıkları ve pratik bir anlam yoktu. Model, iki belgenin çatıştığını bildiği bilgisini aldı, ancak varsayılan yanıt dağılımları değişmedi.
Mekanizmayı anlamak burada faydalıdır. Pasif olarak bir promot’a eklenen bilgi, modelin varsayılan yanıt dağılımını değiştirmez. Çatışmalı biyomedikal sorular için, bu dağılım, güçlü bir şekilde, birleşik bir pozisyon lehine favours. Stance etiketleri, genellikle bölüm başlıklarına geri dönüştürülen ek token’lar haline gelir, mentre prose tipine geri döner.
Yapısal
Neyin çalıştığı yapısal, bilgilendirme değil; modelle, belgelerin doğru veya doğru olduğu hakkında her şeyi sağlamanın yerine, sentezi, mümkün olan anlaşmazlıklar (Anlaşma, Anlaşmazlık, Kanıt Kalitesi, Sonuç) terimlerinde inşa etmeyi gerektirir. İskeleli promot, modelin, annotaed kontrol kadar daha fazla bilgi vermez. Tek fark, modelin ne yapması gerektiğidir.
%93,8’den %4,9’a – yaklaşık on dokuz kat – bir azalma vardı, hiçbir yeniden eğitim, hiçbir boru hattı değişikliği, hiçbir artan gecikme ve hiçbir sorgu başına maliyet artışı olmadan. Bu, geliştirilmiş akıl yürütme değil, basitçe zorla tahsis.
Model, Disagreement bölümü için bir şeyler bulmak üzere, ilk olarak geri dönerek, başlangıçta aldığı belgeleri arar.

Kontrollü ablasyon altında çelişki körlüğü. Durum bilgisi oranını 2,4 puan değiştirdi; gerekli çıktı yapısını değiştirmek 86,5 puan değiştirdi.
Yapısal promt, modelin akıl yürütme yeteneğini artırmakla ilgili değil, daha çok, modelin generation davranışının çıktı alanını tahsis etmesini sağlayan hafif bir yönetim sağlar. Modelin, anlaşmazlık hakkında bir miktar çıktı alanını harcamasını zorlar (mevcut olan bilgi ile, gerektiği gibi görünmek için görünmesi gereken bilgi arasındaki fark).
Bu, ortak bir mimari varsayımını değiştirir. Çoğu önerilen RAG geliştirmesi, bağlamına daha fazla bilgi ekler: daha fazla belge, alma puanları, stance etiketleri, kanıt derecesi meta verileri. Sentetik promot, bu bilgileri çıktı yapısını şekillendirmek için özel gereksinimleri yoksa, çoğu model davranışını değiştirmez. Giriş değişikliği kenarlarda kütle değiştirir; gerekli çıktı yapılarını değiştirmek doğrudan dağılımları değiştirir
Neden beklenen yardımcılar yardımcı olmaz
İki unsur, çelişki-farkında biyomedikal RAG için temel olarak kabul edilir, ancak test edildiğinde kontrol edilen ablasyonla çok az şey sağladı.
1) PICO Ayrıştırma. PICO ( Popülasyon, Müdahale, Karşılaştırma, Sonuç ), kanıtlara dayalı tıpta klinisyen sorularını bileşenlerine ayırmak için organize bir yoludur. Hipotez, iddiaları PICO alanlarına ayırmanın kapsam driftini kısıtlayacağı ve çatışan kanıtlar across heterojen kanıtları tespit etmesini iyileştireceği yönündeydi. Bu seviyenin kaldırılması, üretilen çıktı, neredeyse tam sistem tarafından üretilen çıktı ile ayırt edilemezdi. PICO, klinik karar verme sırasında düşüncelerinizi organize etmek için faydalı olabilir, ancak analiz sırasında çatışma tespitini desteklemek için algoritma girişi olarak, ölçülebilir bir katkısı yoktur.
2) Açık Duruş Sınıflandırması. PICO kaldırmasına karşılık, açık duruş sınıflandırması farklı bir şekilde kötü performans gösterdi. Temiz akademik corpora’da, bazı metriklarda küçük kazançlar üretti. Ancak, tüketiciye yönelik sağlık içeriği gibi gürültülü web metinlerini analiz ettiğinde, sınıflandırıcı, çoğu belge için NOT_ENOUGH_INFO döndürdü, çünkü tüketiciye yönelik sağlık içeriği yazarları, sınıflandırıcı tarafından beklenen deklaratif dil kullanarak konumlarını normalde açıklamazlar. Dolayısıyla, bu etiketler, sentez bağlamına gürültü olarak propagandaya tabi tutuldu. Gürültülü corpora için bu aşamanın kaldırılması, çatışma tespitini biraz iyileştirdi.
Gerçek tıkanma, yukarı akış sinyal kalitesidir
Bu çalışmanın en önemli sonucu, kaynaklardaki çelişkileri tanımak yeteneğinin, nasıl inşa edildiklerinden veya yapıldıklarından daha çok, bu kaynaklar hakkındaki bilginin (veri) ne kadar doğru olduğuyla sınırlı olduğudur.
Kanıt kalitesi kullanım oranı – daha yüksek kaliteli kaynak tercih edildiğinde, her iki kaynak da mevcut olduğunda oran – temiz bilimsel abstract’lerde %0,83 ve gürültülü web almasında %0,15’in altına düştü. Anlamsal alıntı sadakati de aynı modele uydu, abstract’lerde %0,66’dan tüketici sağlığı içeriğinde %0,45’e düştü.

Aynı boru hatları, farklı corpora. Çelişki işleme, kaynak belgelerindeki sinyallerin açıklığıyla sınırlıdır.
Gerçek dünya alınan belgeler, genellikle bir sınıflandırıcı veya ağırlık mekanizmasının bağımlı olduğu ipuçlarını sık sık eksik bırakır: yayıncı türü meta verileri, açık duruş beyanları, metodoloji açıklamaları. Hakemli makalelerin abstract’leri, belirli popülasyonlar, metodolojiler ve sonuçlar hakkında beyanlarda bulunur. Aynı beyanları, tüketici sağlığı makalelerinde anekdotik, ikna edici ve çekingen bir dilde yapılır. Dolayısıyla, aynı sistemler, aldıkları girdilere bağlı olarak aşağı akışta dramatically farklı davranışlar üretir.
Bu, tıbbi RAG için şimdiye kadar yayımlanmış en büyük uzman değerlendirmesini de desteklemektedir, burada on sekiz tıp uzmanı 80.502 adet annotation yapmış ve 800 model çıktısı boyunca katkıda bulunmuştur. İlk 16 alınan pasajın sadece %22’si ilgiliydi. Standart RAG, gerçeksizlik ve tamamlıkta non-RAG başlangıç noktalarına göre bozuldu. Alma ve kanıt seçimi, generation değil, baskın başarısızlık noktalarıydı – tıbbi RAG benchmark çalışmasının iki yıldır bildirdiği gibi.
Bu bulgunun uygulama açısından sınırlı bir sonucu vardır, ancak kesinlikle denilebilir ki, PubMed abstract’lerinden alınan bir sistemin çelişkileri işleme yeteneği, bir tüketiciye yönelik web sitesine aktarılamaz, sistemi ne kadar gelişmiş olursa olsun.
Değerlendirmenin kendi kör noktası
Çelişki işlemenin ölçülmesi, göründüğünden daha zordur ve hatta standard bir yaklaşım, çelişki işlemenin ölçülmesi için kendi sorunlarına sahiptir.
LLM-judge puanlaması , açık uçlu RAG çıktısının conflict handling için puanlandığı en yaygın yoldur ve yapısal acknowledgment kontrollerinden, nasıl geliştirildikleri açısından farklıdır. PICO alanlarına organize eden promt stratejileri, yargıçlardan yüksek puanlar alır, ancak açık acknowledgment testlerini tamamen başarısız olur. Bu beklenenden farklı değildir: LLM yargıçları, daha uzun, daha ayrıntılı yanıtları tercih ettiğini ve bir sonuç bölümünde gömülü bir çekinceyi, çatışmaya hiçbir şeyin atıfta bulunmadığı durumlarda titizlik olarak göreceklerini belgelemiştir.
Alma stratejisi ikinci bir tuzağı tanıtır. Rastgele alma, çelişki körlüğü oranını sıfıra indirir – bir sentez, alınan kümesinin içinde olmayan bir çelişkiyi tanımak için başarısız olamaz. Maksimum marjinal ilgili alma , diğer yandan, anlamsal alıntı sadakatini %0,11’e düşürdü. Her ikisi de, tek bir çelişki işleme metriği altında kabul edilebilir görünür, ancak ikisi de çiftli değerlendirme altında başarısız olur.
Öyleyse, metrikları birleştirin. Her sentez için üç kontrol çalıştırın: çatışmayı tanıyan dilin ifade edildiğini gösteren deterministik yapısal bir kontrol; bir LLM yargıcı için derinlik ve denge; ve alıntı edilen içeriğin kaynakla eşleştiğini onaylayan anlamsal alıntı kontrolü. Her biri, diğerlerinin tanımlayamadıklarını tanımlar. Hiçbiri, çelişki işleme için tek başına güvenilir bir benchmark olarak güvenilmez.
Bu çeyrek için dört eylem
- Temel çizginizi test edin. Üretim için her biyomedikal, klinik, düzenleyici RAG sistemi, daha fazla dağıtımdan önce çelişki körlüğü için test edilmelidir. Testi gerçekleştirmek için, bir çelişki-çiftlenmiş test kümesi ve her bir çıktı, önemli bir anlaşmazlığı sinyalleyen bir sorgu başına kontrol gereklidir. %72,6’lık bir temel çizgi, bir yuvarlama hatası değildir.
- Yapısal sentez promt’larını uygulayın. Gerekli dört bölüm – anlaşma, anlaşmazlık, kanıt kalitesi, sonuç – çıktı bant genişliğini anlaşmazlıklara zorlar. Yeni altyapı gerekmez; eğitim gerekmez; sorgu başına maliyet artışı gerekmez; bir değişiklik, on dokuz katlı bir azalma üretti!
- Çelişki-duyarlı sorgular için MMR almasını kullanmayın. MMR, konuya yönelik kapsama için çeşitlendirilmiş belgeler kullanır, ancak anlaşmazlık için optimize etmez – bu, bir anlaşmazlığın her iki tarafını da almak istediğinde yanlış olur. Bu nedenle, bm25 artı gömme alması, daha güvenli bir varsayılan olarak kullanılmalıdır. Ancak, duruş farkındalığına dayalı çeşitlendirme, bu çalışmanın işaret ettiği yöndür.
- Değerlendirme metriğinizi birleştirin. Tek bir LLM-yargıç puanını emekliye ayırın. Bir yapısal kontrol ile birleştirin, anlaşmazlık alt başlıkları altında önemli içeriği tanıyan ve alıntı edilen kanıtların belirtilen iddiaları desteklediğini onaylayan anlamsal alıntı kontrolü.
Geniş perspective
RAG geliştirme中的 dominant içgüdü, eklemektir: daha iyi alıcılar, daha iyi yeniden sıralayıcılar, daha zengin meta veriler, daha uzun bağlam pencereleri. Endüstri konuşması, RAG boru hatlarının neden üretim için başarısız olduğuna largely aynı şekildedir. Çelişki işleme için, etkili hareket, çıkarıcı değil, sistemin çıktısını ne üretmesine izin verildiğini kısıtlayacak şekildeydi – bir dört parçalı sentez promt, beş aşamalı bir boru hattını outperformed etti. Bunu, modelin ne yapabileceğini değiştirmeyerek, modelin ne üretmesi gerektiğini değiştirerek yaptı.
Bu, mimarinin önemsiz olduğu anlamına gelmez. Alma, bir tavan oluşturur; rastgele alma, sentezi anlamsız kılar ve kötü kanıt kalitesi her şeyi aşağı akışta sınırlar. Bu, RAG sistemlerinin güvenilirlik sorununu çözdüğü sorusu neden hala ortaya çıkıyor. Ancak, çatışan kanıtların çatışan olarak temsil edilip edilmediğini belirleyen, boru hattının daha sonra ve değiştirilmesi daha ucuz olduğu için, güvenilirliği iyileştirmek için gereken değişiklikler daha sớm olabilir.
Pahalı iş – daha iyi çelişki veri kümeleri, açık anlaşmazlık eğitim sinyalleri, duruş-duyarlı alma, çelişki-yerel benchmark’lar – hala yapılması gerekiyor ve önemli ölçüde daha uzun süre alacak.
Dolayısıyla, sisteminizin çatışan kanıtları çatışan olarak sunduğunu öğrenmek istiyorsanız, kendinize bu hafta rahatsız edici soruyu sormalısınız ve cevabı bulmalısınız: Sisteminiz, kanıtların çatıştığını kullanıcıya söyler mi?












