Lãnh đạo tư tưởng
Lý do thực sự khiến đường ống RAG của bạn tiếp tục ảo giác

Bạn biết nghi thức này. Đường ống ảo giác trước mặt khách hàng, vì vậy bạn đã thay thế mô hình nhúng. Sau đó, bạn nâng cấp LLM. Sau đó, bạn thêm một lời nhắc hệ thống nói, bằng chữ cái hoa ngày càng tuyệt vọng, CHỈ SỬ DỤNG CONTEXT CUNG CẤP. Và sáng nay, nó tự tin trích dẫn một tài liệu chính sách không tồn tại.
Bạn đang ở trong một công ty tốt. Khi các nhà nghiên cứu của RegLab và HAI tại Stanford kiểm tra các công cụ nghiên cứu pháp lý AI được bán bởi LexisNexis và Thomson Reuters (TRI ), sản phẩm được tiếp thị là “không ảo giác” nhờ vào việc tạo ra tăng cường, họ đã tìm thấy tỷ lệ ảo giác giữa 17% và 34% trên các truy vấn pháp lý đã đăng ký trước. RAG thực sự giúp đỡ: GPT-4 thô ảo giác nhiều hơn. Nhưng khoảng cách giữa “giảm” và “loại bỏ” là nơi các hệ thống sản xuất sống, và khoảng cách đó có một cấu trúc.
Ảo giác trong một đường ống RAG hiếm khi là một sự thất bại. Đó là ba, âm mưu: thu thập thất bại im lặng, mô hình được đào tạo để trả lời bất kể, và không có gì trong đường ống đo khoảng cách giữa hai sự kiện đó. Thay thế mô hình không giải quyết bất kỳ vấn đề nào trong số đó.
Đồng phạm một: thu thập thất bại thường xuyên hơn bạn nghĩ
Bằng chứng mới nhất ở đây cũng là điều khó chịu nhất. Vào tháng 11 năm 2025, một nhóm bao gồm 18 chuyên gia y tế đã sản xuất 80.502 chú thích trên 800 đầu ra RAG trên các truy vấn thực tế và phong cách USMLE. RAG tiêu chuẩn không chỉ không đạt yêu cầu; nó làm giảm tính xác thực lên đến 6% và tính đầy đủ lên đến 5% so với cùng mô hình chạy mà không có thu thập. Nguyên nhân gốc rễ nằm ở phía上 của LLM hoàn toàn: chỉ 22% đoạn văn được thu thập trong top-16 có liên quan đến truy vấn.
Trước khi bạn loại bỏ điều đó như một vấn đề khó khăn, Anthropic đã đo lường sự thất bại của thu thập trên các tập dữ liệu sạch, được thu thập trong khi phát triển kỹ thuật thu thập ngữ cảnh và tìm thấy rằng tìm kiếm nhúng tiêu chuẩn thất bại trong việc hiển thị phần cần thiết trong top 20 kết quả 5,7% thời gian. Một truy vấn trong số 18, trên dữ liệu được chăm sóc tốt, với không có điều gì kỳ lạ xảy ra.
Đây là lý do tại sao phân loại kỹ thuật đường ống RAG, Barnett et al.’s bảy điểm thất bại, rất quan trọng: ba trong số bảy (nội dung thiếu, tài liệu hàng đầu bị bỏ lỡ và thất bại trong việc hợp nhất ngữ cảnh) xảy ra trước khi mô hình ngôn ngữ tạo ra một token duy nhất. Unite.AI đã xuất bản một hướng dẫn chi tiết về phân loại đó và các khuôn khổ đánh giá tương ứng, vì vậy tôi sẽ không xây dựng lại nó ở đây. Điểm mà bài viết này thêm là về các khuyến khích: sự tương tự của nhúng là một đại diện cho sự liên quan, không phải là bảo đảm của nó, và các công việc lý thuyết gần đây từ Google DeepMind cho thấy rằng các nhúng vector đơn có giới hạn toán học cứng về các tổ hợp tài liệu liên quan mà chúng có thể đại diện tại tất cả. Một bộ thu thập trả về các phần có thể nhưng sai là làm chính xác những gì sự tương tự cosine làm.
Đồng phạm hai: mô hình được đào tạo để đoán
Bây giờ hãy trao đổi ngữ cảnh bị lỗi cho một mô hình ngôn ngữ, và hỏi mô hình được đào tạo để làm gì với các khoảng trống.
OpenAI đã trả lời trực tiếp trong bài báo tháng 9 năm 2025 Tại sao các mô hình ngôn ngữ ảo giác: đào tạo và đánh giá tiêu chuẩn thưởng cho việc đoán hơn là thừa nhận sự không chắc chắn. Các điểm chuẩn đánh giá độ chính xác nhị phân, từ chối đánh giá zero, và như vậy, các mô hình học rằng một đoán tự tin đánh bại một khoảng trống. So sánh của bài báo làm cho nó cụ thể: trên SimpleQA, một mô hình lý luận từ chối 1% thời gian và sai 75% thời gian, trong khi một mô hình khác được điều chỉnh khác từ chối 52% thời gian và cắt giảm tỷ lệ lỗi xuống 26%.
Các điểm chuẩn RAG cụ thể cho thấy những gì mà khuyến khích đó làm bên trong một đường ống. Điểm chuẩn RGB đã kiểm tra xem các mô hình có từ chối trả lời khi được trao chỉ các tài liệu không liên quan. Tỷ lệ từ chối tiêu cực tốt nhất trên tất cả các mô hình được thử nghiệm là 45%, có nghĩa là rằng ngay cả mô hình tốt nhất, khi được trao chỉ các tài liệu rác, trả lời bất kể hơn một nửa thời gian. ClashEval tìm thấy thất bại gương: khi nội dung thu thập mâu thuẫn với kiến thức mà mô hình đã có, mô hình từ bỏ câu trả lời đúng của mình để ủng hộ ngữ cảnh sai hơn 60% thời gian. Sự trung thực thất bại ở cả hai hướng, và FaithEval của Salesforce thêm một kết luận không an ủi rằng các mô hình lớn hơn không phải lúc nào cũng trung thực hơn.
Đội ngũ giải thích của Anthropic thậm chí đã theo dõi cơ chế. Trong phân tích của họ, từ chối là mạch mặc định của mô hình; một tính năng “thực thể đã biết” подав từ chối khi mô hình nhận ra một thứ gì đó. Ảo giác xảy ra khi tính năng đó không hoạt động, khi mô hình nhận ra hình dạng của câu hỏi của bạn, thiếu chất, và tạo ra một câu chuyện phù hợp vào khoảng trống.
Và nếu bạn hy vọng rằng tiền phong sẽ đơn giản vượt qua điều này: bảng xếp hạng ảo giác của Vectara đo lường một thứ gì đó dễ dàng hơn RAG, tóm tắt một tài liệu đơn được đặt trực tiếp trước mô hình, và tính đến thời điểm cập nhật tháng 5 năm 2026, GPT-4o vẫn tạo ra 9,6% tóm tắt và Claude Opus 4 trong 12%. Ngay cả khi thu thập được giải quyết hoàn hảo, tạo ra vẫn rò rỉ.
Giải pháp trực giác làm cho nó tồi tệ hơn
Khi đối mặt với tất cả những điều này, hầu hết các nhóm đều cố gắng tăng âm lượng. Thu thập nhiều phần hơn. Mua cửa sổ ngữ cảnh lớn hơn. Nhồi tất cả mọi thứ có thể giúp và để mô hình phân loại nó ra.
Bằng chứng chạy ngược lại. Nghiên cứu context rot của Chroma đã kiểm tra 18 mô hình, bao gồm GPT-4.1, Claude 4 và Gemini 2.5, và tìm thấy hiệu suất ngày càng không đáng tin cậy khi độ dài đầu vào tăng, với một tài liệu gây nhiễu đơn có thể cắt giảm độ chính xác và bốn tài liệu gây nhiễu cắt giảm đáng kể. Nghiên cứu Lost in the Middle trước đó đã tìm thấy đường cong U nổi tiếng: thông tin bị chôn vùi ở giữa ngữ cảnh bị bỏ qua ngay cả bởi các mô hình ngữ cảnh dài. Và kiểm toán y tế trên là những gì các động lực đó trông như thế nào từ đầu đến cuối, một hệ thống thu thập mười sáu đoạn văn trong đó mười hai đoạn văn trở lên không liên quan, sau đó trao chồng cho một mô hình được đào tạo không bao giờ nói “Tôi không biết.”
Thu thập nhiều hơn mà không có độ chính xác cao hơn chỉ sản xuất các tài liệu gây nhiễu. Độ chính xác đánh bại độ nhớ trong tạo ra có căn cứ, và nó không gần nhau.
Đồng phạm ba: không ai đo khoảng cách
Barnett et al. đã đặt sự thật hoạt động vào một dòng: “xác thực một hệ thống RAG chỉ có thể thực hiện được trong hoạt động.” Bạn không thể ký kết một đường ống RAG trong giai đoạn thử nghiệm, vì các chế độ thất bại của nó là một thuộc tính chung của cơ sở dữ liệu của bạn, các truy vấn của bạn và người dùng của bạn, không có gì trong số đó đứng yên.
Tuy nhiên, hầu hết các đường ống sản xuất theo dõi chất lượng trả lời cuối cùng ở mức tốt nhất, điều này trộn lẫn hai kẻ đồng phạm trên vào một số không thể giải thích được. Phân tích tiêu chuẩn, đôi khi được gọi là bộ ba RAG, tách biệt sự liên quan của ngữ cảnh (liệu thu thập có tìm thấy tài liệu đúng?), sự gắn kết (liệu câu trả lời gắn với tài liệu đó?), và sự liên quan của câu trả lời (liệu nó giải quyết câu hỏi?). Các khuôn khổ như RAGAS và TruLens thực hiện nó. Tôi sẽ trung thực rằng không có cuộc khảo sát nghiêm ngặt nào tồn tại để lượng hóa số lượng các nhóm sản xuất chạy; những gì tồn tại là hồ sơ của người hành nghề, và nó chủ yếu mô tả đánh giá bằng cảm giác. Nếu nhóm của bạn không có bảng điều khiển phân biệt sự thất bại của thu thập với sự thất bại của sự trung thực, mỗi ảo giác sẽ tiếp tục trông giống như một vấn đề mô hình, và bạn sẽ tiếp tục mua các giải pháp có hình dạng mô hình.
Điều gì thực sự hoạt động, theo thứ tự
Đo thu thập riêng biệt với tạo ra. Giải pháp không hấp dẫn mà mọi người bỏ qua, và theo quan điểm của tôi, là mục có lợi nhất trong danh sách này, vì nó chuyển đổi một cuộc tranh luận về mô hình nào để mua thành một chẩn đoán. Nếu sự liên quan của ngữ cảnh là xấu, không có máy tạo nào có thể cứu bạn. Nếu sự gắn kết là xấu với ngữ cảnh tốt, không có bộ thu thập nào có thể.
Xây dựng ngăn xếp chính xác. Các số liệu được xuất bản của Anthropic là sự chứng minh sạch nhất về các giải pháp thu thập xếp chồng ở bất kỳ nơi nào: các nhúng đoạn ngữ cảnh cắt giảm sự thất bại của thu thập top-20 từ 5,7% xuống 3,7%, thêm tìm kiếm BM25 hybrid (trùng khớp từ khóa cổ điển bên cạnh tìm kiếm vector) mang nó đến 2,9%, và thêm một bộ xếp hạng lại, một mô hình giai đoạn thứ hai đánh giá lại các đoạn ứng cử cho sự liên quan thực, đạt 1,9%, một giảm tổng thể 67%. Unite.AI đã bao gồm tại sao các bộ xếp hạng lại đánh bại trọng lượng của chúng trong chi tiết.
Phần thưởng cho việc từ chối. Phương pháp của OpenAI là phạt các lỗi tự tin hơn là sự không chắc chắn được thể hiện, và bạn có thể thực hiện phiên bản địa phương ngay hôm nay: yêu cầu và đánh giá các phản hồi “Tôi không biết”, và thêm một kiểm tra nền tảng, một mô hình suy luận (NLI) xác minh mỗi yêu cầu được tạo là được hỗ trợ bởi văn bản thu thập trước khi câu trả lời được gửi. Công việc RAGTruth cho thấy một bộ phát hiện tinh chỉnh nhỏ có thể phù hợp với việc tạo GPT-4 tại chỗ để bắt các yêu cầu không được hỗ trợ.
Viết lại truy vấn và lọc bằng chứng. Trong kiểm toán y tế, việc viết lại truy vấn và lọc bằng chứng đã phục hồi lên đến 12 điểm về tính xác thực. Rẻ, nhàm chán, hiệu quả.
Cân nhắc thu thập có chủ đích cuối cùng. Thu thập nhiều bước suy nghĩ về việc thu thập gì tiếp theo (hướng dẫn ở đây) thực sự giúp các truy vấn đa bước khó, nhưng nó thêm độ trễ, chi phí và các chế độ thất bại mới. Đó là một viên đá góc, không phải một nền tảng.
Mô hình là phần ít bị hỏng nhất
Hãy nhìn lại nghi thức từ đầu. Mỗi bước của nó, việc thay thế nhúng, nâng cấp mô hình, lời nhắc hệ thống hét lên, đều coi ảo giác là một khuyết tật của máy tạo. Bằng chứng cho thấy máy tạo đang làm những gì mà đào tạo của nó thưởng, với các tài liệu mà bộ thu thập của bạn đã trao cho nó, không được quan sát bởi bất kỳ số liệu nào có thể nói rằng cái nào trong số đó đang thất bại.
Đường ống RAG của bạn không bị hỏng. Nó vâng lời. Nó làm chính xác những gì mà các khuyến khích của nó thưởng, và cho đến khi bạn đo thu thập và tạo ra riêng biệt và làm cho “Tôi không biết” trở thành một danh mục điểm thay vì một thất bại, những khuyến khích đó nói: đoán.












