Pemimpin pemikiran

Alasan Nyata Mengapa Pipa RAG Anda Terus Mengalami Halusinasi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Anda tahu ritualnya. Pipa mengalami halusinasi di depan pelanggan, jadi Anda menukar model embedding. Kemudian Anda meningkatkan LLM. Kemudian Anda menambahkan prompt sistem yang mengatakan, dengan huruf besar yang semakin putus asa, HANYA GUNAKAN KONTEKS YANG DISEDIAKAN. Dan pagi ini itu dengan percaya diri mengutip dokumen kebijakan yang tidak ada.

Anda berada dalam perusahaan yang baik. Ketika RegLab dan peneliti HAI Stanford memeriksa alat penelitian hukum AI yang dijual oleh LexisNexis dan Thomson Reuters (TRI ), produk yang dipasarkan sebagai “bebas halusinasi” berkat generasi yang ditingkatkan dengan pengambilan, mereka menemukan tingkat halusinasi antara 17% dan 34% pada kueri hukum yang terdaftar sebelumnya. RAG benar-benar membantu: GPT-4 mentah mengalami halusinasi lebih banyak. Tapi kesenjangan antara “berkurang” dan “dihilangkan” adalah tempat sistem produksi hidup, dan kesenjangan itu memiliki struktur.

Halusinasi dalam pipa RAG jarang sekali kegagalan tunggal. Ini adalah tiga, bersama: pengambilan gagal secara diam-diam, model dilatih untuk menjawab secara tidak pasti, dan tidak ada dalam pipa yang mengukur ruang antara kedua fakta tersebut. Menukar model tidak menyelesaikan salah satu dari mereka.

Konspirator satu: pengambilan gagal lebih sering dari yang Anda pikir

Bukti terbaru di sini juga merupakan yang paling tidak nyaman. Pada November 2025, tim yang mencakup 18 ahli medis menghasilkan 80.502 anotasi di seluruh 800 output RAG pada kueri pasien dan gaya USMLE yang nyata. RAG standar tidak hanya gagal; itu memburukkan faktualitas hingga 6% dan kelengkapan hingga 5% dibandingkan dengan model yang sama yang berjalan tanpa pengambilan. Penyebab akar berada di hulu model LLM sepenuhnya: hanya 22% dari pasase yang diambil di antara 16 teratas yang relevan dengan kueri.

Sebelum Anda mengabaikan itu sebagai masalah domain yang sulit, Anthropic mengukur kegagalan pengambilan pada korpus yang bersih dan terawat sambil mengembangkan teknik pengambilan kontekstualnya dan menemukan bahwa pencarian embedding standar gagal untuk menampilkan potongan yang dibutuhkan dalam hasil 20 teratas 5,7% dari waktu. Satu kueri dari delapan belas, pada data yang terawat dengan baik, tanpa sesuatu yang eksotis terjadi.

Ini adalah mengapa taksonomi insinyur kanonik dari kegagalan RAG, Barnett et al.’s tujuh titik kegagalan, sangat penting: tiga dari tujuh (konten yang hilang, dokumen peringkat teratas yang terlewat, dan kegagalan konsolidasi konteks) terjadi sebelum model bahasa menghasilkan satu token. Unite.AI telah menerbitkan turunan menyeluruh tentang taksonomi itu dan kerangka evaluasi yang dipetakan ke sana, jadi saya tidak akan membangunnya lagi di sini. Poin yang ditambahkan artikel ini adalah tentang insentif: kesamaan embedding adalah proksi untuk relevansi, bukan jaminan dari itu, dan karya teoretis terbaru dari Google DeepMind menunjukkan bahwa embedding vektor tunggal memiliki batasan matematis yang keras pada kombinasi dokumen yang relevan yang dapat mereka wakili sepenuhnya. Pengambil yang mengembalikan potongan yang masuk akal tapi salah melakukan apa yang dilakukan oleh kesamaan kosinus.

Konspirator dua: model dilatih untuk menebak

Sekarang berikan konteks yang bermasalah itu kepada model bahasa, dan tanyakan apa yang diajarkan pelatihan model untuk dilakukan dengan celah.

OpenAI menjawab ini secara langsung dalam makalah September 2025-nya Mengapa Model Bahasa Mengalami Halusinasi: pelatihan dan evaluasi standar menghargai menebak daripada mengakui ketidakpastian. Benchmarks skor akurasi biner, abstain skor nol, dan sehingga, seperti siswa yang menghadapi ujian pilihan ganda, model belajar bahwa tebakan yang percaya diri mengalahkan yang kosong. Perbandingan makalah itu sendiri membuatnya konkrit: pada SimpleQA, satu model penalaran abstain 1% dari waktu dan salah 75% dari waktu, sedangkan model yang disetel berbeda abstain 52% dari waktu dan memotong tingkat kesalahan menjadi 26%.

Benchmark RAG khusus menunjukkan apa yang dilakukan insentif itu di dalam pipa. Benchmark RGB menguji apakah model menolak untuk menjawab ketika diberi hanya dokumen yang tidak relevan. Tingkat penolakan negatif terbaik di seluruh model yang diuji adalah 45%, yang berarti bahwa bahkan model terbaik, diberi hanya konteks sampah, menjawab secara tidak pasti lebih dari setengah waktu. ClashEval menemukan kegagalan cermin: ketika konteks yang diambil bertentangan dengan pengetahuan yang model sudah benar, model meninggalkan jawaban yang benar untuk konteks yang salah lebih dari 60% dari waktu. Kesetiaan gagal dalam kedua arah, dan FaithEval Salesforce menambahkan akhir yang mengganggu bahwa model yang lebih besar tidak dapat diandalkan lebih setia.

Tim interpretasi Anthropic bahkan mengikuti mekanisme. Dalam analisis mereka, penolakan adalah sirkuit default model; fitur “entitas yang diketahui” menekan penolakan itu ketika model mengenali sesuatu. Halusinasi terjadi ketika fitur itu gagal, ketika model mengenali bentuk pertanyaan Anda, kekurangan substansi, dan mengarang dengan lancar ke dalam celah.

Dan jika Anda berharap garis depan akan tumbuh melewati ini: Vectara papan peringkat halusinasi mengukur sesuatu yang jauh lebih mudah daripada RAG, meringkas dokumen tunggal yang ditempatkan langsung di depan model, dan pada pembaruan Mei 2026, GPT-4o masih memalsukan dalam 9,6% dari ringkasan dan Claude Opus 4 dalam 12%. Bahkan dengan pengambilan yang diselesaikan dengan sempurna, generasi bocor.

Perbaikan instingtif membuatnya lebih buruk

Menghadapi semua ini, sebagian besar tim mencapai volume. Ambil lebih banyak potongan. Beli jendela konteks yang lebih besar. Masukkan semua yang mungkin membantu dan biarkan model mengaturnya.

Bukti itu berjalan keras ke arah lain. Studi konteks rot Chroma menguji 18 model, termasuk GPT-4.1, Claude 4, dan Gemini 2.5, dan menemukan bahwa kinerja tumbuh “semakin tidak dapat diandalkan seiring pertumbuhan panjang input”, dengan satu dokumen pengalih perhatian secara signifikan memotong akurasi dan empat pengalih perhatian memotongnya secara substansial. Penelitian Lost in the Middle sebelumnya menemukan kurva U yang terkenal: informasi yang terkubur di tengah konteks diabaikan bahkan oleh model konteks panjang. Dan audit medis di atas adalah apa yang dinamika itu terlihat seperti dari ujung ke ujung, sistem yang mengambil enam belas pasase yang dari itu dua belas lebih tidak relevan, kemudian menyerahkan tumpukan itu kepada model yang dilatih untuk tidak mengatakan “Saya tidak tahu.”

Pengambilan lebih banyak tanpa presisi lebih banyak hanya memproduksi pengalih perhatian. Presisi mengalahkan recall dalam generasi yang berbasis, dan itu tidak dekat.

Konspirator tiga: tidak ada yang mengukur kesenjangan

Barnett et al. meletakkan kebenaran operasional dalam satu baris: “validasi sistem RAG hanya memungkinkan selama operasi.” Anda tidak dapat menandatangani pipa RAG di tahap, karena mode kegagalan adalah properti bersama dari korpus Anda, kueri Anda, dan pengguna Anda, tidak ada yang tetap diam.

Namun, sebagian besar pipa produksi melacak kualitas jawaban ujung-ke-ujung pada saat terbaik, yang menggabungkan dua konspirator di atas menjadi satu angka yang tidak dapat dijelaskan. Dekomposisi standar, kadang-kadang disebut triad RAG, memisahkan relevansi konteks (apakah pengambilan menemukan materi yang tepat?), ketertanahan (apakah jawaban menempel pada materi itu?), dan relevansi jawaban (apakah itu menjawab pertanyaan?). Kerangka seperti RAGAS dan TruLens mengimplementasikannya. Saya akan jujur bahwa tidak ada survei yang ketat yang ada untuk mengukur seberapa sedikit tim produksi yang menjalankan ini; apa yang ada adalah catatan praktisi, dan sebagian besar menggambarkan evaluasi oleh getaran. Jika tim Anda tidak memiliki dasbor yang membedakan kegagalan pengambilan dari kegagalan kesetiaan, setiap halusinasi akan terus terlihat seperti masalah model, dan Anda akan terus membeli perbaikan yang berbentuk model.

Apa yang sebenarnya berhasil, dalam urutan

Ukur pengambilan secara terpisah dari generasi. Perbaikan yang tidak glamor yang semua orang lewatkan, dan menurut saya item dengan leverage tertinggi dalam daftar ini, karena itu mengubah argumen tentang model mana yang harus dibeli menjadi diagnosis. Jika relevansi konteks buruk, tidak ada generator yang dapat menyelamatkan Anda. Jika ketertanahan buruk dengan konteks yang baik, tidak ada pengambil yang dapat.

Bangun tumpukan presisi. Angka yang diterbitkan Anthropic adalah demonstrasi terbersih tentang perbaikan pengambilan yang ditumpuk di mana saja: embedding potongan kontekstual memotong kegagalan pengambilan 20 teratas dari 5,7% menjadi 3,7%, menambahkan pencarian hibrida BM25 (pencocokan kata kunci klasik di samping pencarian vektor) membawanya ke 2,9%, dan menambahkan reranker, model tahap kedua yang mengukur kembali kandidat potongan untuk relevansi sebenarnya, mencapai 1,9%, pengurangan total 67%. Unite.AI telah menutupi mengapa pengambilan dua tahap mengalahkan beratnya secara rinci.

Menghargai penolakan. Resep OpenAI adalah untuk menghukum kesalahan yang percaya diri lebih dari ketidakpastian yang diungkapkan, dan Anda dapat mengimplementasikan versi lokal hari ini: meminta dan mengevaluasi respons “Saya tidak tahu”, dan menambahkan pemeriksaan dasar, model implikasi (NLI) yang memverifikasi setiap klaim yang dihasilkan didukung oleh teks yang diambil sebelum jawaban dikirim. RAGTruth bekerja menunjukkan bahwa detektor yang disetel dengan baik dapat mencocokkan prompting berbasis GPT-4 dalam menangkap klaim yang tidak didukung.

Tulis ulang kueri dan filter bukti. Dalam audit medis, reformulasi kueri plus penyaringan bukti memulihkan hingga 12 poin faktualitas. Murah, membosankan, efektif.

Pertimbangkan pengambilan agen terakhir. Pengambilan multi-langkah yang bernalar tentang apa yang harus diambil selanjutnya (primer di sini) benar-benar membantu kueri multi-hop yang sulit, tetapi itu menambahkan latensi, biaya, dan mode kegagalan baru. Ini adalah batu penjuru, bukan fondasi.

Model adalah bagian yang paling tidak rusak

Lihat kembali ritual dari pembukaan. Setiap langkah itu, pertukaran embedding, peningkatan model, prompt sistem yang berteriak, mengobati halusinasi sebagai cacat dalam generator. Bukti mengatakan bahwa generator melakukan apa yang dilatihnya, dengan bahan yang diberikan oleh pengambil Anda, tidak terlihat oleh metrik apa pun yang bisa mengatakan mana yang gagal.

Pipa RAG Anda tidak rusak. Ini patuh. Ini melakukan apa yang dihargai oleh insentifnya, dan sampai Anda mengukur pengambilan dan generasi secara terpisah dan membuat “Saya tidak tahu” menjadi kategori skoring bukan kegagalan, insentif itu mengatakan: tebak.

Gary adalah seorang penulis ahli dengan lebih dari 10 tahun pengalaman dalam pengembangan perangkat lunak, pengembangan web, dan strategi konten. Ia mengkhususkan diri dalam menciptakan konten berkualitas tinggi yang menarik dan menghasilkan konversi serta membangun loyalitas merek. Ia memiliki passion untuk menciptakan cerita yang menarik dan menginformasikan audiens, dan ia selalu mencari cara baru untuk melibatkan pengguna.