Nền tảng AI

Tại Sao Hệ Thống RAG Y Học Của Bạn Đang Che Giấu Mâu Thuẫn Từ Bạn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Hệ thống RAG y học tiêu chuẩn giải quyết bằng chứng mâu thuẫn im lặng trong khoảng ba trong số bốn truy vấn. Sự cố này là cấu trúc, không phải thông tin — và hầu hết sự phức tạp phía上 mà các nhóm thêm vào không giúp được.

Hãy hỏi một trợ lý lâm sàng tăng cường bằng cách thu thập thông tin một câu hỏi đơn giản — melatonin có giúp giảm jet lag không? — và tài liệu nó thu thập sẽ không đồng ý với chính nó.

Bài đánh giá Cochrane kết luận rằng melatonin rất hiệu quả, với tám trong số mười thử nghiệm bao gồm cho thấy giảm jet lag trên các chuyến bay vượt qua năm hoặc nhiều múi giờ. Một thử nghiệm ngẫu nhiên, mù đôi của 257 bác sĩ Na Uy trong Tạp chí Tâm thần học Mỹ tìm thấy không có lợi ích từ bất kỳ trong ba chế độ melatonin.

Cả hai tài liệu đều thực sự tồn tại. Cả hai đều nghiêm túc về phương pháp. Bất kỳ bác sĩ lâm sàng nào quyết định điều gì để khuyên nên biết họ không đồng ý.

Trong kiểm tra có kiểm soát, tổng hợp thường không nói như vậy. Nó tạo ra một đoạn văn trôi chảy, được trích dẫn chính xác, đứng về một phía và không bao giờ báo hiệu rằng một phía khác tồn tại.

Đó là sự mù mờ về mâu thuẫn. Trên một điểm chuẩn mâu thuẫn được ghép đôi về y sinh, nó xảy ra ở 72,6 phần trăm số truy vấn (95% CI 0,697–0,755). Đầu ra đọc bình thường. Trích dẫn được giải quyết chính xác. Kiểm tra chất lượng tiêu chuẩn đã vượt qua. Sự không đồng ý đơn giản biến mất.

Chế độ thất bại trông giống như thành công

Mặc dù không có sự hội tụ trực tiếp trong bằng chứng liên quan đến y sinh, các nghiên cứu cho thấy kết quả mâu thuẫn giữa việc sử dụng nghiên cứu quan sát và thử nghiệm ngẫu nhiên có kiểm soát (RCT) và cũng các phương pháp khác nhau được sử dụng cho các quần thể bệnh nhân khác nhau; tuy nhiên, một nghiên cứu cũng có thể bao gồm cả phương pháp mạnh và yếu, điều này dường như mang lại cùng một trọng lượng.

Đây không phải là trường hợp duy nhất. Phân tích của Ioannidis về nghiên cứu lâm sàng được trích dẫn nhiều tìm thấy rằng 16 phần trăm trong số các nghiên cứu được trích dẫn nhiều nhất đã bị mâu thuẫn hoàn toàn sau đó, và rằng các nghiên cứu quan sát nhiều hơn các thử nghiệm ngẫu nhiên để bị mâu thuẫn hoặc hiệu ứng của chúng bị修 đổi xuống — năm trong số sáu, so với chín trong số 39. Do đó, vấn đề không chỉ là sự không đồng ý giữa các nghiên cứu mà còn là một phần cấu trúc của chính văn bản.

Do đó, như một chức năng quan trọng của bất kỳ hệ thống tăng cường thu thập y sinh, việc tạo ra bằng chứng về sự không đồng ý giữa các nghiên cứu nên là một mục tiêu chính. Tuy nhiên, hầu hết các hệ thống không thể thực hiện được nhiệm vụ này. Sử dụng HealthContradict điểm chuẩn với 920 ví dụ mâu thuẫn ghép đôi cho thấy rằng một hệ thống RAG tiêu chuẩn đã không tạo ra sự không đồng ý trong khoảng 73% số cặp được kiểm tra. Vấn đề không phải là thu thập. Hệ thống thu thập cả hai phía. Sau đó, nó giải quyết mâu thuẫn im lặng, theo hướng có lợi cho một trong số chúng.

Một cuộc kiểm tra thủ công 50 trường hợp thất bại tạo ra một mẫu mà tôi đã gọi là phẳng về nhận thức. Cả hai tài liệu đều được trích dẫn riêng bởi mô hình, và việc mô tả mâu thuẫn của nó được mô tả theo các gradient tin cậy (“bằng chứng giai thoại … các nghiên cứu khoa học chỉ ra…”) như thể không có mâu thuẫn nào tồn tại. Dưới 5% số trường hợp thất bại này sử dụng các từ “mâu thuẫn”, “xung đột”, hoặc “sự không đồng ý” ở tất cả. Đầu ra được tạo ra có tỷ lệ độ chính xác trích dẫn là 0,99. Đó chính là điểm: độ chính xác trích dẫn không ngụ ý nhận thức về mâu thuẫn. Một hệ thống có thể gán mọi câu một cách hoàn hảo và vẫn nói với một bác sĩ lâm sàng điều mà cơ sở bằng chứng không hỗ trợ.

Ba tính năng của “tổng hợp” RAG tạo ra một môi trường lâm sàng nguy hiểm.

Đảo ngược giá trị đề xuất. Mục đích của RAG là hiển thị bằng chứng liên quan đến các bác sĩ lâm sàng. Do đó, bằng cách loại bỏ khía cạnh của bằng chứng đó mà quan trọng nhất cho các bác sĩ lâm sàng để xem xét, nó thực sự đạt được điều ngược lại.

Tạo ra sự vô hình. Vì không có sự rào cản, hoặc cắt ngắn, hoặc đặc điểm định dạng; một “tổng hợp phẳng” và một tổng hợp trung thành xuất hiện không thể phân biệt trên màn hình.

Đồng thời im lặng ở quy mô lớn. Không có gì trong một bộ đánh giá tiêu chuẩn cờ hiệu nó, vì vậy một hệ thống có thể chạy trong sản xuất trong nhiều tháng trong khi mọi truy vấn mâu thuẫn được giải quyết im lặng theo một hướng.

Thông tin không phải là đòn bẩy

Một giải pháp rõ ràng cho vấn đề này sẽ là thông báo cho mô hình. Rõ ràng, nếu chế độ thất bại là mô hình không xác định được hai tài liệu mâu thuẫn, bạn có thể thêm một nhãn “HỖ TRỢ” hoặc “MÂU THUẪN” vào từng tài liệu được thu thập. Điều này nên rõ ràng cải thiện hiệu suất cho mô hình. Nó không.

Trong một thí nghiệm nơi chúng tôi thêm nhãn quan điểm (bằng cách chú thích) để rõ ràng cung cấp cho mô hình thông tin rằng hai tài liệu mâu thuẫn, chúng tôi tìm thấy rằng chú thích quan điểm rõ ràng di chuyển mù mâu thuẫn từ 93,8 phần trăm trong cánh tay kiểm soát không chú thích đến 91,4 phần trăm — một sự khác biệt với độ tin cậy chồng chéo và không có ý nghĩa thực tế. Mặc dù mô hình nhận được thông tin rằng hai tài liệu mâu thuẫn, nhưng phân bố phản hồi mặc định của nó vẫn không thay đổi.

Hiểu cơ chế là hữu ích ở đây. Thông tin được thêm một cách thụ động vào một lời nhắc không thay đổi phân bố phản hồi mặc định của mô hình. Đối với các câu hỏi y sinh đầy mâu thuẫn, phân bố đó mạnh mẽ ủng hộ một vị trí hợp nhất duy nhất. Các nhãn quan điểm trở thành các token phụ — thường được tái chế thành tiêu đề phần — trong khi văn bản trở lại loại của nó.

Cấu trúc là đòn bẩy

Điều gì hoạt động là cấu trúc, trái ngược với thông tin; thay vì cung cấp cho mô hình tất cả những gì là thực tế hoặc chính xác về các tài liệu, cấu trúc yêu cầu tổng hợp phải được xây dựng theo các mâu thuẫn có thể (Đồng ý, Mâu thuẫn, Chất lượng bằng chứng, Kết luận). Lời nhắc có cấu trúc cung cấp cho mô hình không có thông tin hơn so với kiểm soát không chú thích. Sự khác biệt duy nhất là mô hình phải làm gì.

Có sự giảm khoảng mười chín lần — từ 93,8 phần trăm đến 4,9 phần trăm — trong mù mâu thuẫn mà không cần huấn luyện lại, không cần thay đổi đường ống, không cần độ trễ tăng và không cần tăng chi phí cho mỗi truy vấn.

Đây không phải là lý luận được cải thiện. Đây chỉ đơn giản là phân bổ bắt buộc. Một khi mô hình phải cung cấp một phần Mâu thuẫn, nó quay lại các tài liệu nó thu thập ban đầu để tìm kiếm điều gì đó để bao gồm trong phần này.

Mù mâu thuẫn dưới ba điều kiện tổng hợp được kiểm soát. Thêm thông tin quan điểm di chuyển tỷ lệ 2,4 điểm; thay đổi cấu trúc đầu ra yêu cầu di chuyển nó 86,5.

Định hướng cấu trúc là ít hơn về việc tăng cường khả năng lý luận của mô hình và nhiều hơn về việc cung cấp quản lý nhẹ về cách mô hình phân bổ không gian đầu ra. Nó buộc mô hình phải dành một số không gian đầu ra cho mâu thuẫn (sự khác biệt giữa thông tin có sẵn và thông tin cần xuất hiện để đáp ứng yêu cầu).

Điều này thay đổi một giả định kiến trúc chung. Hầu hết các cải tiến RAG được đề xuất thêm thông tin vào ngữ cảnh: nhiều tài liệu hơn, điểm thu thập, thẻ quan điểm, siêu dữ liệu chất lượng bằng chứng. Trừ khi lời nhắc tổng hợp có yêu cầu cụ thể cho thông tin đó để định hình cấu trúc đầu ra, hầu hết sẽ không thay đổi hành vi của mô hình. Thay đổi đầu vào thay đổi khối lượng ở biên; thay đổi cấu trúc đầu ra yêu cầu thay đổi phân bố trực tiếp

Tại sao những người giúp đỡ dự kiến không giúp đỡ

Hai yếu tố thường được coi là thiết yếu cho RAG y sinh nhận thức mâu thuẫn đã cung cấp rất ít khi được kiểm tra với sự loại bỏ có kiểm soát.

1) Phân tích PICO. PICO (Dân số, Can thiệp, So sánh, Kết quả) là một cách tổ chức để phá vỡ các câu hỏi lâm sàng thành các phần thành phần để sử dụng trong y học dựa trên bằng chứng. Giả thuyết là phân tích các tuyên bố thành các trường PICO sẽ hạn chế sự trôi dạt của phạm vi và cải thiện việc phát hiện mâu thuẫn trên các bằng chứng dị hướng. Loại bỏ mức này dẫn đến đầu ra gần như không thể phân biệt được với đầu ra được tạo ra bởi hệ thống hoàn chỉnh. Mặc dù PICO có thể hữu ích cho việc tổ chức suy nghĩ của bạn trong quá trình ra quyết định lâm sàng; như một đầu vào suy luận tại thời điểm phân tích để hỗ trợ phát hiện mâu thuẫn, nó không có đóng góp có thể đo lường được.

2) Phân loại quan điểm rõ ràng. Ngược lại với việc loại bỏ PICO, phân loại quan điểm rõ ràng hoạt động kém nhưng khác. Trên các tập hợp dữ liệu học thuật sạch, nó tạo ra các lợi ích nhỏ trên một số chỉ số. Tuy nhiên, khi phân tích văn bản web ồn ào — điều này thường là cách các ứng dụng sức khỏe hướng đến người tiêu dùng sẽ truy cập thông tin — bộ phân loại trả về NOT_ENOUGH_INFO cho hầu hết các tài liệu, chủ yếu vì các tác giả của nội dung sức khỏe hướng đến người tiêu dùng thường không tuyên bố vị trí của họ bằng ngôn ngữ khai báo mà bộ phân loại mong đợi. Do đó, các nhãn này không có thông tin được truyền vào ngữ cảnh tổng hợp như tiếng ồn. Loại bỏ giai đoạn này đối với các tập hợp dữ liệu ồn ào đã cải thiện một chút việc phát hiện mâu thuẫn.

Điểm nghẽn thực sự là chất lượng tín hiệu phía上

Kết luận quan trọng nhất của nghiên cứu này là khả năng nhận ra mâu thuẫn trong nguồn là bị giới hạn bởi độ chính xác của thông tin (dữ liệu) về các nguồn này, nhiều hơn là cách chúng được xây dựng hoặc cấu trúc.

Sử dụng chất lượng bằng chứng — tỷ lệ trường hợp mà tổng hợp ưu tiên trích dẫn nguồn chất lượng cao hơn khi cả hai đều có sẵn — là 0,83 trên các tóm tắt khoa học sạch và giảm xuống dưới 0,15 trên thu thập web ồn ào. Sự trung thực của trích dẫn ngữ nghĩa theo cùng một mẫu, từ 0,66 trên các tóm tắt đến 0,45 trên nội dung sức khỏe người tiêu dùng.

Các đường ống giống hệt, các tập hợp dữ liệu khác nhau. Xử lý mâu thuẫn bị giới hạn bởi sự rõ ràng của các tín hiệu trong các tài liệu nguồn.

Có một lý do cấu trúc cho điều này. Các tài liệu được thu thập trong thế giới thực thường thiếu các tín hiệu mà bất kỳ bộ phân loại hoặc cơ chế đánh trọng nào phụ thuộc vào: siêu dữ liệu loại xuất bản, tuyên bố quan điểm rõ ràng, mô tả phương pháp. Các tóm tắt của các bài báo được đánh giá ngang hàng tuyên bố một cách khai báo về các dân số, phương pháp và kết quả cụ thể. Các tuyên bố chính xác này được thực hiện trong ngôn ngữ thuyết phục, giai thoại và lảng tránh trong các bài viết sức khỏe người tiêu dùng. Do đó, các hệ thống giống hệt nhau tạo ra hành vi khác nhau đáng kể dựa trên đầu vào mà chúng nhận được.

Điều này cũng được hỗ trợ bởi đánh giá chuyên gia y tế lớn nhất về RAG từng được xuất bản, trong đó mười tám chuyên gia y tế đã đóng góp 80.502 chú thích trên 800 đầu ra mô hình. Chỉ 22 phần trăm đoạn văn được thu thập hàng đầu là相关. RAG tiêu chuẩn làm giảm tính xác thực và tính đầy đủ so với các baseline không phải RAG. Thu thập và chọn bằng chứng, không phải tạo, là các điểm thất bại chính — một hồi âm những gì công việc chuẩn về RAG y tế đã báo cáo trong hai năm.

Mặc dù có một ý nghĩa hạn chế của phát hiện này về ứng dụng, nhưng có thể nói một cách chắc chắn rằng khả năng của hệ thống bạn để xử lý mâu thuẫn khi nó thu thập từ các tóm tắt PubMed không thể được chuyển sang một trang web hướng đến người tiêu dùng bất kể hệ thống của bạn tiên tiến như thế nào.

Điểm mù của đánh giá

Đo lường xử lý mâu thuẫn khó hơn nó có vẻ, và thậm chí một cách tiếp cận tiêu chuẩn để đo lường xử lý mâu thuẫn cũng có những vấn đề của nó.

Đánh giá LLM-judge đại diện cho cách phổ biến nhất để chấm điểm đầu ra RAG mở cho xử lý mâu thuẫn và cũng khác với các kiểm tra xác nhận cấu trúc về cách chúng được phát triển. Các chiến lược lời nhắc tổ chức tổng hợp thành các trường PICO nhận được điểm cao từ các thẩm phán trong khi thất bại các kiểm tra xác nhận rõ ràng. Điều này là dự kiến: các thẩm phán LLM đã được ghi nhận là ưa thích các phản hồi dài hơn, chi tiết hơn và cũng sẽ xem một lưu ý ẩn trong phần kết quả như sự toàn diện khi không có gì trong cấp độ văn bản tham khảo đến mâu thuẫn.

Chiến lược thu thập giới thiệu một điểm thất bại thứ hai. Thu thập ngẫu nhiên tạo ra một tỷ lệ mù mâu thuẫn bằng không — một tổng hợp không thể không nhận ra một mâu thuẫn mà tập hợp thu thập của nó không chứa. Tương quan biên giới tối đa thu thập, mặt khác, giảm sự trung thực của trích dẫn ngữ nghĩa xuống 0,11. Mỗi cái trông có thể chấp nhận được theo một chỉ số xử lý mâu thuẫn duy nhất, nhưng cả hai đều không đạt được trong đánh giá ghép.

Vậy hãy ghép các chỉ số. Chạy ba kiểm tra trên mỗi tổng hợp: một kiểm tra cấu trúc quyết định để ngôn ngữ thể hiện xác nhận một mâu thuẫn; một thẩm phán LLM để độ sâu và sự cân bằng; và một kiểm tra trích dẫn ngữ nghĩa xác nhận rằng nội dung được trích dẫn phù hợp với nguồn của nó. Mỗi chỉ số xác định những gì các chỉ số khác không làm. Không có chỉ số nào có thể đáng tin cậy một mình như một điểm chuẩn cho xử lý mâu thuẫn.

Bốn hành động cho quý này

  1. Kiểm tra baseline của bạn. Mỗi hệ thống RAG y sinh, lâm sàng, quy định trong sản xuất phải được kiểm tra về mù mâu thuẫn trước khi triển khai thêm. Để thực hiện kiểm tra, bạn cần một tập hợp kiểm tra ghép mâu thuẫn và một kiểm tra mỗi truy vấn rằng đầu ra báo hiệu sự không đồng ý thực chất. Một baseline 72,6 phần trăm không phải là một lỗi làm tròn.
  2. Thực hiện các lời nhắc tổng hợp có cấu trúc. Bốn phần (bắt buộc) — Đồng ý, Mâu thuẫn, Chất lượng bằng chứng, Kết luận — buộc băng thông đầu ra trên mâu thuẫn. Không cần cơ sở hạ tầng mới; không cần huấn luyện; không cần độ trễ; một thay đổi tạo ra sự giảm 19 lần!
  3. Không sử dụng MMR thu thập cho các truy vấn nhạy cảm mâu thuẫn. Mặc dù MMR sử dụng các tài liệu đa dạng cho phạm vi chủ đề, nó không tối ưu hóa cho phạm vi quan điểm — điều này không chính xác khi mục tiêu là thu thập cả hai phía của một mâu thuẫn. Do đó, thu thập bm25 cộng với thu thập nhúng nên được sử dụng như một mặc định an toàn hơn. Tuy nhiên, đa dạng hóa quan điểm sẽ là hướng mà công việc này chỉ ra.
  4. Ghép các chỉ số đánh giá của bạn. Nghỉ hưu điểm số thẩm phán LLM đơn. Kết hợp nó với một kiểm tra cấu trúc cho nội dung thực chất dưới các tiêu đề xác nhận và một kiểm tra trích dẫn ngữ nghĩa xác nhận rằng bằng chứng được trích dẫn hỗ trợ tuyên bố được nêu.

Điểm rộng hơn

Động lực chính trong phát triển RAG là cộng thêm: thu thập tốt hơn, xếp hạng lại tốt hơn, siêu dữ liệu phong phú hơn, cửa sổ ngữ cảnh dài hơn. Cuộc trò chuyện trong ngành về tại sao các đường ống RAG vẫn thất bại trong sản xuất đã chủ yếu theo cùng một hình dạng. Đối với xử lý mâu thuẫn, động thái hiệu quả là trừ — hạn chế những gì hệ thống được phép đầu ra chứ không phải mở rộng những gì nó được đưa vào.

Điều đó không làm cho kiến trúc trở nên không liên quan. Thu thập đặt một trần; thu thập ngẫu nhiên làm cho tổng hợp trở nên vô nghĩa; và chất lượng bằng chứng kém giới hạn mọi thứ ở phía dưới. Đây là lý do tại sao câu hỏi liệu các hệ thống RAG có giải quyết được vấn đề về độ tin cậy tiếp tục xuất hiện. Tuy nhiên, những gì quyết định liệu bằng chứng mâu thuẫn có được thể hiện như mâu thuẫn hay không nằm sau trong đường ống và rẻ hơn để thay đổi, điều này có nghĩa là những thay đổi cần thiết để cải thiện độ tin cậy có thể xảy ra sớm hơn.

Công việc tốn kém — các tập hợp dữ liệu mâu thuẫn tốt hơn, tín hiệu đào tạo mâu thuẫn rõ ràng, thu thập nhạy cảm quan điểm, điểm chuẩn mâu thuẫn — vẫn cần được thực hiện và sẽ mất nhiều thời gian hơn.

Do đó, nếu bạn muốn biết liệu hệ thống của mình có hiển thị bằng chứng mâu thuẫn như mâu thuẫn hay không, bạn nên tự hỏi mình câu hỏi khó chịu và tìm câu trả lời trong tuần này: Liệu hệ thống của bạn có thông báo cho người dùng khi bằng chứng của nó mâu thuẫn không?

Himanshu Goel là một nhà nghiên cứu AI/ML chuyên về tạo sinh tăng cường cho các lĩnh vực quan trọng, bao gồm các quy trình làm việc tài liệu sinh học, tài chính và quy định.