Dasar-dasar AI
Mengapa Biomedical RAG Anda Menyembunyikan Kontradiksi Dari Anda

Standard biomedical RAG menyelesaikan bukti yang bertentangan secara diam-diam dalam sekitar tiga dari setiap empat kueri. Perbaikan adalah struktural, bukan informatif — dan sebagian besar kompleksitas upstream yang ditambahkan oleh tim tidak membantu.
Tanyakan asisten klinis retrieval-augmented sederhana — apakah melatonin membantu dengan jet lag? — dan literatur yang ditarik tidak akan setuju dengan dirinya sendiri.
Ulasan Cochrane menyimpulkan bahwa melatonin sangat efektif, dengan delapan dari sepuluh percobaan yang termasuk menunjukkan penurunan jet lag pada penerbangan yang melintasi lima atau lebih zona waktu. Sebuah percobaan acak, buta ganda dari 257 dokter Norwegia di Jurnal Psikiatri Amerika menemukan tidak ada manfaat dari tiga regimen melatonin.
Kedua dokumen tersebut nyata. Kedua dokumen tersebut metodologis serius. Setiap klinisi yang memutuskan apa yang harus direkomendasikan perlu tahu bahwa mereka tidak setuju.
Dalam pengujian terkontrol, sintesis biasanya tidak mengatakan demikian. Ini menghasilkan paragraf yang fasih, dengan kutipan yang benar, yang memihak pada satu sisi dan tidak pernah menandakan bahwa sisi lain ada.
Itu adalah kebutaan kontradiksi. Pada benchmark kontradiksi yang berpasangan biomedis, itu terjadi pada 72,6 persen dari kueri (95% CI 0,697–0,755). Keluaran membaca normal. Kutipan diselesaikan dengan benar. Pemeriksaan kualitas standar diluluskan. Perselisihan hanya menghilang.
Mode kegagalan yang terlihat seperti kesuksesan
Sementara tidak ada konvergensi langsung dalam bukti yang terkait dengan biomedis, studi menunjukkan hasil yang bertentangan antara penggunaan studi observasional versus uji klinis terkendali (RCT) dan juga metode yang berbeda yang digunakan untuk populasi pasien yang berbeda; namun, sebuah studi juga dapat mencakup metodologi yang kuat dan lemah, yang tampaknya memiliki bobot yang sama.
Ini bukan kasus unik. Analisis Ioannidis tentang penelitian klinis yang sangat dikutip menemukan bahwa 16 persen dari studi yang paling dikutip dibantah secara terbuka, dan bahwa studi observasional lebih mungkin daripada uji klinis terkendali untuk dibantah atau efeknya direvisi ke bawah — lima dari enam, melawan sembilan dari tiga puluh sembilan. Jadi, masalahnya bukan hanya perselisihan di antara studi tetapi lebih pada struktur literatur itu sendiri.
Oleh karena itu, sebagai fungsi kritis dari setiap sistem retrieval-augmented generation biomedis, menghasilkan bukti tentang perselisihan antara studi harus menjadi tujuan utama. Namun, sebagian besar sistem gagal menyelesaikan tugas ini. Dengan menggunakan HealthContradict benchmark’s 920 contoh kontradiksi yang berpasangan, terbukti bahwa RAG standar gagal menghasilkan perselisihan dalam sekitar 73% dari pasangan yang diuji. Masalahnya bukanlah pengambilan. Sistem mengambil kedua sisi. Kemudian menghilangkan konflik secara diam-diam, untuk mendukung salah satunya.
Pemeriksaan manual dari 50 kasus kegagalan yang distratifikasi menghasilkan pola yang saya sebut penghalusan epistemologis. Kedua dokumen dikutip secara individual oleh model, dan rendering konfliknya dijelaskan dalam hal gradien kepercayaan (“bukti anekdot … studi ilmiah menunjukkan…”) seolah-olah tidak ada konflik. Kurang dari 5% dari kasus kegagalan ini menggunakan kata “kontradiksi”, “konflik”, atau “perselisihan” sama sekali. Keluaran yang dihasilkan memiliki tingkat akurasi kutipan 0,99. Itu tepatnya titiknya: akurasi kutipan tidak menyiratkan kesadaran kontradiksi. Sistem dapat mengatribusikan setiap kalimat dengan sempurna dan masih mengatakan kepada seorang klinisi sesuatu yang basis bukti tidak mendukung.
Tiga fitur dari “sintesis” RAG menciptakan lingkungan klinis yang berbahaya.
Mengubah Nilai Proposition. Tujuan RAG adalah untuk menampilkan bukti yang relevan bagi klinisi. Oleh karena itu, dengan menghilangkan aspek bukti yang paling penting bagi klinisi untuk ditinjau, itu sebenarnya mencapai lawan dari tujuannya.
Menciptakan Ketidakvisibilitas. Karena tidak ada penyangga, atau pemotongan, atau artefak format; sintesis yang “dipegang” dan sintesis yang setia tampak tidak dapat dibedakan di layar.
Menggandakan Secara Diam-Diam pada Skala. Tidak ada dalam suite evaluasi standar yang menandai hal ini, sehingga sistem dapat berjalan dalam produksi selama beberapa bulan sementara setiap kueri yang konflik diam-diam diselesaikan dalam satu arah.
Informasi bukanlah tuas
Solusi yang jelas untuk masalah ini adalah memberi tahu model. Jelas, jika mode kegagalan adalah model tidak mengidentifikasi bahwa dua dokumen bertentangan, Anda bisa hanya menambahkan label “SUPPORT” atau “CONTRADICT” ke setiap dokumen yang ditarik. Ini seharusnya memperbaiki kinerja model. Tidak.
Dalam eksperimen di mana kami menambahkan label sikap (dengan mengannotasi) untuk secara eksplisit memberi tahu model bahwa dua dokumen bertentangan, kami menemukan bahwa anotasi sikap eksplisit memindahkan kebutaan kontradiksi dari 93,8 persen dalam kontrol yang tidak diannotasi ke 91,4 persen — perbedaan dengan interval kepercayaan yang tumpang tindih dan tidak ada signifikansi praktis. Meskipun model menerima informasi bahwa dua dokumen bertentangan, distribusi respons defaultnya tetap tidak berubah.
Memahami mekanisme berguna di sini. Informasi yang ditambahkan secara pasif ke prompt tidak mengubah distribusi respons default model. Untuk pertanyaan biomedis yang penuh kontradiksi, distribusi itu kuat mendukung posisi konsolidasi tunggal. Label sikap menjadi token tambahan — sering direcycle menjadi judul bagian — sementara prosa kembali ke jenisnya.
Struktur adalah tuas
Apa yang berhasil adalah struktural, bukan informatif; bukan memberikan model dengan semua yang faktual atau benar tentang dokumen, struktur memerlukan sintesis untuk dibangun dalam hal perselisihan yang mungkin (Kesepakatan, Perselisihan, Kualitas Bukti, Kesimpulan). Prompt yang discaffoldkan memberikan model tidak lebih banyak informasi daripada kontrol yang tidak diannotasi. Perbedaan satu-satunya adalah apa yang model harus lakukan.
Ada pengurangan sekitar sembilan belas kali lipat — dari 93,8 persen menjadi 4,9 persen — dalam kebutaan kontradiksi tanpa pelatihan ulang, tanpa modifikasi pipa, tanpa peningkatan latency, dan tanpa peningkatan biaya per kueri.
Ini bukan peningkatan alasan. Ini hanya alokasi yang dipaksa. Setelah model harus memberikan bagian Perselisihan, itu kembali melalui dokumen yang awalnya ditarik untuk mencari sesuatu untuk dimasukkan dalam bagian ini.

Kebutaan kontradiksi di bawah tiga kondisi sintesis yang terkendali. Menambahkan informasi sikap memindahkan tingkat sebesar 2,4 poin; mengubah struktur output yang diperlukan memindahkan sebesar 86,5.
Prompt yang terstruktur adalah kurang tentang meningkatkan kemampuan model untuk bernalar dan lebih tentang memberikan pengawasan ringan atas bagaimana perilaku generasi model mengalokasikan ruang output. Ini memaksa model untuk menghabiskan sejumlah ruang output pada perselisihan (perbedaan antara informasi yang tersedia dan informasi yang perlu muncul untuk memenuhi persyaratan).
Ini mengubah asumsi arsitektur yang umum. Sebagian besar peningkatan RAG yang diusulkan menambahkan informasi ke konteks: lebih banyak dokumen, skor pengambilan, label sikap, metadata bukti. Kecuali sintesis prompt memiliki persyaratan khusus untuk informasi tersebut untuk membentuk struktur output, sebagian besar tidak akan mengubah perilaku model. Mengubah input menggeser massa di pinggiran; mengubah struktur output yang diperlukan mengubah distribusi secara langsung
Mengapa bantuan yang diharapkan tidak membantu
Dua elemen yang umum dianggap penting untuk RAG biomedis yang sadar kontradiksi memberikan sedikit ketika diuji dengan penghapusan terkendali.
1) Pemecahan PICO. PICO (Populasi, Intervensi, Perbandingan, Hasil) adalah cara terorganisir untuk memecahkan pertanyaan klinis menjadi bagian-bagian komponen untuk digunakan dalam obat berbasis bukti. Hipotesisnya adalah bahwa memecahkan klaim menjadi bidang PICO akan mengurangi drift ruang lingkup dan meningkatkan deteksi kontradiksi di seluruh bukti yang heterogen. Penghapusan tingkat ini menghasilkan output yang hampir tidak dapat dibedakan dari output yang dihasilkan oleh sistem lengkap. Meskipun PICO dapat berguna untuk mengatur pikiran selama pengambilan keputusan klinis; sebagai input yang diinferensi pada saat analisis untuk mendukung deteksi kontradiksi, itu tidak memiliki kontribusi yang dapat diukur.
2) Klasifikasi Sikap Eksplisit. Berbeda dengan penghapusan PICO, klasifikasi sikap eksplisit berperforma buruk tetapi berbeda. Pada korpus akademis yang bersih, itu menghasilkan keuntungan kecil pada beberapa metrik. Namun, ketika menganalisis teks web yang berisik – yang biasanya merupakan cara aplikasi kesehatan menghadapi informasi – klasifikator mengembalikan NOT_ENOUGH_INFO untuk sebagian besar dokumen, terutama karena penulis konten kesehatan yang menghadapi konsumen tidak biasanya menyatakan posisi mereka menggunakan bahasa deklaratif yang diharapkan oleh klasifikator. Konsekuensinya, label-label tersebut sebagai tidak informatif kemudian dipropagasi ke konteks sintesis sebagai kebisingan. Penghapusan tahap untuk korpus yang berisik sedikit meningkatkan deteksi kontradiksi.
Hambatan nyata adalah kualitas sinyal upstream
Kesimpulan terpenting dari studi ini adalah bahwa kemampuan untuk mengenali kontradiksi dalam sumber terbatas oleh seberapa akurat informasi (data) tentang sumber tersebut, lebih dari bagaimana mereka dibangun atau distrukturkan.
Pemanfaatan kualitas bukti — proporsi kasus di mana sintesis lebih memilih mengutip sumber yang lebih berkualitas ketika keduanya tersedia — adalah 0,83 pada abstrak ilmiah yang bersih dan turun di bawah 0,15 pada pengambilan web yang berisik. Kesetiaan kutipan semantik mengikuti pola yang sama, dari 0,66 pada abstrak ke 0,45 pada konten kesehatan konsumen.

Pipa yang sama, korpus yang berbeda. Penanganan kontradiksi dibatasi oleh kesadaran sinyal dalam dokumen sumber.
Ada alasan struktural untuk ini. Dokumen yang ditarik secara nyata sering kali kekurangan sinyal yang diperlukan oleh klasifikator atau mekanisme pengaturan: metadata tipe publikasi, pernyataan sikap eksplisit, deskripsi metodologi. Abstrak dari artikel peer-review membuat asersi deklaratif tentang populasi, metodologi, dan hasil tertentu. Asersi yang sama dibuat dalam bahasa yang anekdot, persuasif, dan penyangga dalam artikel kesehatan konsumen. Oleh karena itu, sistem yang identik menghasilkan perilaku yang sangat berbeda berdasarkan apa yang mereka terima sebagai input.
Hal ini juga didukung oleh penilaian ahli medis RAG terbesar yang pernah dipublikasikan, di mana delapan belas ahli medis berkontribusi 80.502 anotasi di seluruh 800 output model. Hanya 22 persen dari pasangan yang ditarik yang relevan. RAG standar memburukkan faktualitas dan kelengkapan relatif terhadap baseline non-RAG. Pengambilan dan seleksi bukti, bukan generasi, adalah titik kegagalan yang dominan — sebuah gema dari apa yang kerja benchmark tentang RAG medis telah melaporkan selama dua tahun.
Meskipun ada implikasi yang relatif terbatas dari temuan ini dalam hal aplikasi, dapat dikatakan dengan pasti bahwa kemampuan sistem untuk menangani kontradiksi ketika mengambil dari abstrak PubMed tidak dapat dipindahkan ke situs web yang menghadapi konsumen, terlepas dari seberapa maju sistem lainnya.
Titik buta evaluasi
Mengukur penanganan kontradiksi lebih sulit daripada yang terlihat, dan bahkan pendekatan standar untuk mengukur penanganan kontradiksi memiliki serangkaian masalahnya sendiri.
Skor LLM-judge mewakili cara paling umum bahwa output RAG terbuka diukur untuk penanganan konflik dan juga menyimpang dari pemeriksaan pengakuan struktural dalam hal bagaimana mereka dikembangkan. Strategi prompt yang mengatur sintesis ke bidang PICO menerima skor tinggi dari hakim sementara gagal dalam tes pengakuan eksplisit secara keseluruhan. Ini diharapkan: hakim LLM telah didokumentasikan sebagai favorit respons yang lebih panjang dan lebih rinci dan juga akan melihat catatan yang terkubur dalam bagian hasil sebagai ketelitian ketika tidak ada yang dalam tingkat prosa merujuk pada konflik.
Strategi pengambilan memperkenalkan jebakan kedua. Pengambilan acak menghasilkan tingkat kebutaan kontradiksi nol — sintesis tidak dapat gagal mengakui kontradiksi yang tidak ada dalam himpunan yang ditarik. Pengambilan relevansi marginal maksimum, di sisi lain, mengurangi kesetiaan kutipan semantik ke .11. Keduanya terlihat dapat diterima di bawah satu metrik penanganan kontradiksi, tetapi keduanya gagal dalam evaluasi yang berpasangan.
Jadi, pasang metrik. Jalankan tiga pemeriksaan pada setiap sintesis: pemeriksaan struktural deterministik untuk bahasa yang diekspresikan yang mengakui konflik; hakim LLM untuk kedalaman dan keseimbangan; dan pemeriksaan kutipan semantik yang mengkonfirmasi bahwa konten yang dikutip sesuai dengan sumbernya. Masing-masing mengidentifikasi apa yang tidak dilakukan oleh yang lain. Tidak satu pun dapat dipercaya sendiri sebagai benchmark untuk penanganan kontradiksi.
Empat tindakan untuk kuartal ini
- Uji baseline Anda. Setiap sistem RAG biomedis, klinis, regulasi yang ada di produksi harus diuji untuk kebutaan kontradiksi sebelum penerapan lebih lanjut. Untuk melakukan tes, Anda memerlukan himpunan tes yang berpasangan kontradiksi dan pemeriksaan per kueri bahwa output menandakan perselisihan substansial. Baseline 72,6 persen bukanlah kesalahan pembulatan.
- Implementasikan prompt sintesis terstruktur. Empat bagian yang diperlukan – kesepakatan, perselisihan, kualitas bukti, kesimpulan – memaksa bandwidth output pada perselisihan. Tidak ada infrastruktur baru yang diperlukan; tidak ada pelatihan yang diperlukan; tidak ada biaya per kueri; satu perubahan menghasilkan pengurangan sembilan belas kali lipat!
- Jangan gunakan pengambilan MMR untuk kueri yang sensitif kontradiksi. Meskipun MMR menggunakan dokumen yang diversifikasi untuk cakupan topik, itu tidak dioptimalkan untuk cakupan sikap — yang salah ketika tujuannya adalah mengambil kedua sisi perselisihan. Oleh karena itu, pengambilan bm25 plus embedding harus digunakan sebagai default yang lebih aman. Namun, diversifikasi yang sadar sikap akan menjadi arah yang ditunjukkan oleh pekerjaan ini.
- Pasang metrik evaluasi Anda. Pensiun skor LLM-judge tunggal. Gabungkan dengan pemeriksaan struktural untuk konten substansial di bawah judul pengakuan dan pemeriksaan kutipan semantik yang memverifikasi bahwa bukti yang dikutip mendukung klaim yang dinyatakan.
Titik yang lebih luas
Insting dominan dalam pengembangan RAG adalah aditif: pengambil yang lebih baik, reranker yang lebih baik, metadata yang lebih kaya, jendela konteks yang lebih panjang. Pembicaraan industri tentang mengapa pipa RAG masih gagal dalam produksi sebagian besar mengikuti bentuk yang sama. Untuk penanganan kontradiksi, gerakan yang efektif adalah substraktif — membatasi apa yang sistem diizinkan untuk mengeluarkan daripada memperluas apa yang diberikan. Prompt sintesis empat bagian tunggal mengalahkan pipa lima tahap. Ini dilakukan dengan mengubah apa yang model harus produksi, bukan apa yang model bisa lihat.
Itu tidak membuat arsitektur tidak relevan. Pengambilan menetapkan batas, pengambilan acak membuat sintesis tidak berarti, dan kualitas bukti yang buruk membatasi semua hilir. Ini adalah mengapa pertanyaan tentang apakah sistem RAG menyelesaikan masalah keandalan terus muncul kembali. Namun, apa yang menentukan apakah bukti yang bertentangan direpresentasikan sebagai bertentangan ternyata lebih jauh di pipa dan lebih murah untuk diubah daripada komponen lainnya, yang berarti perubahan yang diperlukan untuk meningkatkan keandalan dapat terjadi lebih cepat.
Pekerjaan yang mahal — dataset kontradiksi yang lebih baik, sinyal pelatihan perselisihan yang eksplisit, pengambilan yang sadar sikap, benchmark asli kontradiksi — masih perlu dilakukan, dan akan memakan waktu lebih lama.
Oleh karena itu, jika Anda ingin tahu apakah sistem Anda menampilkan bukti yang bertentangan sebagai bertentangan, Anda harus bertanya pada diri sendiri pertanyaan yang tidak nyaman dan menemukan jawabannya minggu ini: Apakah sistem Anda mengatakan kepada pengguna ketika buktinya bertentangan?












