AI 기초

의료용 RAG가 모순을 숨기는 이유

mm
Unite.AI를 Google의 선호 소스에 추가

표준 의료용 RAG는 약 4분의 3의 쿼리에서 충돌하는 증거를 조용히 해결합니다. 해결책은 구조적이며 정보적이지 않습니다. 업스트림 복잡성을 추가하는 대부분의 팀은 도움이 되지 않습니다.

검색 증강 임상 보조를 사용하여 간단한 질문을 하십시오. 멜라토닌은 제트 라그에 도움이 될까요? 검색한 문헌은 자신과 일치하지 않습니다.

코크란 리뷰는 멜라토닌이 매우 효과적이라고 결론지었으며 포함된 10개의 임상시험 중 8개에서 5개 이상의 시간대에 걸친 비행에서 제트 라그가 줄어든 것으로 나타났습니다. 노르웨이 의사 257명에 대한 무작위 대조군 연구는 미국 정신의학 저널에서 멜라토닌의 3가지 정의 중 어느 하나도 이익이 없다는 것을 발견했습니다.

두 문서는 실제 문서입니다. 두 문서는 모두 방법론적으로 심각합니다. 제트 라그에 대해 무엇을 추천할지 결정하는 모든 임상의는 그들이 동의하지 않는다는 것을 알아야 합니다.

통제된 테스트에서 합성은 일반적으로 그렇게 하지 않았습니다. 그것은 하나의 측면에 서서 다른 측면이 존재하지 않는다고 표시하지 않고 올바르게 인용된 문단을 생성했습니다.

이것은 모순 무시입니다. 의료 관련 모순 쌍 벤치마크에서 72.6 퍼센트의 쿼리(95% CI 0.697–0.755)에서 발생했습니다. 출력은 정상적으로 읽혔습니다. 인용문은 올바르게 해결되었습니다. 표준 품질 검사가 통과되었습니다. 단지 이의가 사라졌습니다.

성공으로 보이는 실패 모드

의료 관련 증거에는 직접적인 수렴이 없으며 관찰 연구와 무작위 대조군 시험(RCT) 사이에 충돌하는 결과가 보고되고 있으며 다양한 환자 집단을 위한 다양한 방법이 사용됩니다. 그러나 연구는 강력한 방법론과 약한 방법론을 모두 포함할 수 있습니다. 이는 동일한 가중치를 가질 것입니다.

이것은 고유한 경우가 아닙니다. Ioannidis의 고급 임상 연구 분석은 가장 많이 인용된 연구 중 16퍼센트가 이후에 완전히 반驳되었으며 관찰 연구는 무작위 시험보다 반驳되거나 효과가 낮아지는 경우가 더 많다는 것을 발견했습니다. 즉, 문제는 연구 간의 이의가 아니라 문헌 자체의 구조적인 부분입니다.

따라서 임상 의료 검색 증강 생성시스템의 임무 중 하나는 연구 간의 이의에 대한 증거를 생성하는 것입니다. 그러나 대부분의 시스템은 이 작업을 수행하지 못합니다. HealthContradict벤치마크의 920개의 모순 쌍 예시에서 표준 검색 증강 생성(RAG)이 모순을 생성하지 못하는 것으로 나타났습니다. 문제는 검색이 아닙니다. 시스템은 양쪽 모두를 검색합니다. 그런 다음 충돌을 조용히 해결합니다.

50개의 계층적 실패 사례를 수동으로 조사한 결과 认识론적 평탄화라는 패턴이 나타났습니다. 두 문서는 모두 모델에 의해 개별적으로 인용되며 충돌에 대한 모델의 렌더링은 “경험적 증거… 과학적 연구는…”와 같은 확신 그래디언트의 용어로 설명됩니다. 이러한 실패 사례 중 5% 미만이 “모순”, “충돌”, “이의”라는 단어를 사용했습니다. 생성된 출력은 인용 정확도 0.99를 가졌습니다. 그것이 바로 핵심입니다. 인용 정확도는 모순 인식과 다릅니다. 시스템은 모든 문장을 완벽하게 속성화할 수 있지만 임상의에게 증거 기반이 지원하지 않는 것을 말할 수 있습니다.

RAG의 “합성”의 세 가지 기능이 위험한 임상 환경을 만듭니다.

가치 제안의 반전. RAG의 목적은 임상의에게 관련된 증거를 표시하는 것입니다. 따라서 임상의가 검토해야 하는 증거의 측면을 제거함으로써 실제로 반대의 결과를 달성합니다.

가시성의 생성. 헤지나 자르기, 형식 아티팩트가 없기 때문에 “평탄화된” 합성과 충실한 합성은 화면상으로 구별할 수 없습니다.

조용한 증폭. 표준 평가 세트에서 아무것도 그것을 플래그하지 않으므로 시스템은 생산에서 몇 개월 동안 모든 충돌 쿼리가 조용히 한 방향으로 해결되는 동안 실행할 수 있습니다.

정보는 레버가 아님

이 문제에 대한 명백한 해결책은 모델에 정보를 제공하는 것입니다. 분명히, 실패 모드가 모델이 두 문서가 충돌한다는 것을 식별하지 못하는 경우라면, 모델에 “지지” 또는 “반대” 태그를 추가하여 충돌하는 두 문서를 제공하는 것이 당연합니다. 이것은 모델의 성능을 개선해야 합니다. 그러나 그것은 그렇게 하지 않았습니다.

태그를 추가하여(주석을 달음으로써) 모델에 두 문서가 충돌한다는 정보를 명시적으로 제공하는 실험에서, 명시적인 태도 주석은 모순 무시를 93.8 퍼센트에서 91.4 퍼센트로 이동시켰습니다. 중복되는 신뢰 구간이 있고 실제적인 의미가 없습니다. 모델은 두 문서가 충돌한다는 정보를 받았지만 기본 응답 분포는 변경되지 않았습니다.

기작을 이해하는 것이 여기서 유용합니다. 프롬프트에 추가된 정보는 모델의 기본 응답 분포를 변경하지 않습니다. 모순이 있는 의료 관련 질문의 경우, 그 분포는 하나의 통합된 위치를 강하게 선호합니다. 태도 레이블은 종종 섹션 제목으로 재활용되며 산문은 유형으로 돌아갑니다.

구조는 레버

작동한 것은 구조적이었습니다. 모델에 사실이나 문서에 대한 올바른 정보를 제공하는 대신, 합성을 가능한 이의(합의, 이의, 증거 품질, 결론)로 구성하도록 요구했습니다. 스캐폴딩된 프롬프트는 모델에 컨트롤과 같은 정보를 제공하지 않습니다. 모델이 해야 하는 일에만 차이가 있습니다.

대략 19배의 감소 — 93.8 퍼센트에서 4.9 퍼센트 — 모순 무시 없이 재훈련, 파이프라인 수정, 대기 시간 증가, 쿼리당 비용 증가 없이 발생했습니다.

이것은 향상된 추론이 아닙니다. 이것은 단순히 강제 할당입니다. 모델이 이의 섹션을 제공해야 하는 경우, 모델은 초기에 검색한 문서를 다시 검토하여 이의 섹션에 포함할 내용을 찾습니다.

제어된 절단에서 모순 무시下的 세 가지 합성 조건.

구조적 프롬프팅은 모델의 생성 행동이 출력 공간을 할당하는 방식에 대한 경량 거버넌스를 제공하는 것보다 모델의 추론 능력을 향상시키는 것에 관한 것입니다. 모델은 이의에 일부 출력 공간을 할애하도록 강제합니다(사용 가능한 정보와 출력 요구 사항을 충족하는 데 필요한 정보 사이의 차이).

이것은 공통의 아키텍처 가정을 변경합니다. 대부분의 제안된 RAG 강화 기능은 문脈에 정보를 추가합니다. 더 많은 문서, 검색 점수, 태도 태그, 증거 등급 메타데이터. 그러나 합성 프롬프트에 정보를 형성하는 특정 요구 사항이 없는 경우 대부분의 모델 동작을 변경하지 않습니다. 입력을 변경하면 주변에서 질량을 변경하지만, 필요한 출력 구조를 변경하면 분포를 직접 변경합니다

기대되는 도우미가 도움이 되지 않는 이유

모순 인식 의료 RAG에 필수적인 것으로 간주되는 두 가지 요소는 테스트에서 거의 도움이 되지 않았습니다.

1) PICO 분해. PICO(인구, 개입, 비교, 결과)는 임상 질문을 증거 기반 의학에서 사용하기 위한 구성 요소로 나누는 조직화된 방법입니다. 가설은 주장의 범위를 제한하고 모순을 감지하는 데 도움이 될 것이라고 생각했습니다. 그러나 이 수준을 제거한 결과는 완전한 시스템에 의해 생성된 출력과 거의 구별할 수 없었습니다. PICO는 임상 의사 결정을 하는 동안 생각을 조직하는 데 유용할 수 있지만, 분석 시 모순 감지를 지원하기 위한 추론 입력으로는 측정할 수 있는 기여도가 없습니다.

2) 명시적 태도 분류. PICO 제거와는 달리, 명시적 태도 분류는 성과가 좋지 않았지만 다르게 수행했습니다. 깨끗한 학술 코퍼스에서 일부 지표에 대해 작은 이익을 생성했습니다. 그러나 소음이 있는 웹 텍스트를 분석할 때, 일반적으로 소비자용 건강 앱이 정보에 접근하는 방식과 같이, 분류기는 대부분의 문서에 대해 NOT_ENOUGH_INFO를 반환했습니다. 주로 소비자용 건강 콘텐츠의 저자는 기대하는 분류기에 의해 선언된 언어를 사용하여 자신의 위치를 선언하지 않기 때문입니다. 따라서 이러한 레이블은 무의미한 것으로 번역되어 합성 문脈으로 노이즈로 전파되었습니다. 소음이 있는 코퍼스에서 이 단계를 제거하면 모순 감지를 약간 개선했습니다.

실제 병목은 업스트림 신호 품질

이 연구의 가장 중요한 결론은 소스의 모순을 인식하는 능력이 소스에 대한 정보(데이터)의 정확도에 의해 제한되며, 그것들이 어떻게 구축되었는지 또는 구조화되었는지보다 더 중요하다는 것입니다.

증거 품질 활용도 — 더 높은 품질의 소스를 우선적으로 인용하는 경우의 비율 —는 0.83에서 0.15로 떨어졌습니다. 의미 있는 인용 충실도도 동일한 패턴을 따랐습니다. 추상에서 0.66에서 소비자 건강 콘텐츠에서 0.45로.

동일한 파이프라인, 다른 코퍼스. 모순 처리는 소스 문서의 신호의 명확성에 의해 제한됩니다.

실제 검색된 문서는 종종 분류기 또는 가중치 메커니즘이 의존하는 큐를 자주 缺乏합니다. 출판 유형 메타데이터, 명시적인 태도 진술, 방법론 설명. 피어 리뷰된 논문의 추상은 특정 인구, 방법론 및 결과에 대해 선언적으로 주장을 합니다. 동일한 주장은 소비자 건강 기사에서 설득적이고 헤징 언어로 만들어집니다. 따라서 동일한 시스템은 다운스트림에서 Dramatically 다른 행동을 생성합니다.

의료 RAG에 대한 전문가 평가 중 가장 큰 것으로 발표된 것에서 18명의 의료 전문가가 80,502개의 주석을 기여했으며, 800개의 모델 출력을 걸쳐서, 상위 16개 검색된 문단 중 단 22퍼센트만 관련이 있었습니다. 표준 RAG는 비 RAG 기준선에 비해 사실성과 완전성을 저하했습니다. 검색 및 증거 선택이 아닌 생성이 주요 실패 지점이었습니다. 의료 RAG 벤치마크 연구에서 2년 동안 보고한 내용과 같습니다.

이 발견의 적용에는 상대적으로 제한된 의미가 있지만, 임상 의료 RAG가 PubMed 추상에서 모순을 처리하는 능력이 소비자용 웹사이트로 전달될 수 없다는 것을 결론지을 수 있습니다.

평가의 맹점

모순 처리를 측정하는 것은 생각보다 어렵고, 모순 처리를 측정하는 표준적인 접근법에도 자신의 문제가 있습니다.

LLM-판결 점수는 개방형 RAG 출력을 위해 충돌 처리를 평가하는 가장 일반적인 방법을 나타내며, 구조적 인식 확인과는 어떻게 개발되었는지에 따라 다릅니다. PICO 필드에서 합성을 조직하는 프롬프트 전략은 판결자로부터 높은 점수를 받지만 명시적인 인식 테스트에서 완전히 실패합니다. 이것은 예상됩니다. LLM 판결자는 더 긴, 더 정교한 응답을 선호하며, 결과 섹션에 묻힌 주의 사항을 철저함으로 간주할 것입니다.

검색 전략은 두 번째 함정을 도입합니다. 무작위 검색은 모순 무시율이 0입니다. 합성이 검색된 집합에 포함되지 않은 모순을 인식하지 못할 수 없습니다. 최대 마진 관련성검색은 의미 있는 인용 충실도를 0.11로 낮췄습니다. 각 항목은 하나의 모순 처리 메트릭에서 허용되지만, 쌍으로 평가하면 부족합니다.

따라서 메트릭을 쌍으로 합니다. 모든 합성에 대해 세 가지 확인을 실행하십시오. 모순을 인식하는 언어를 표현하는 결정적인 구조적 확인, 깊이와 균형에 대한 LLM 판결자, 인용된 내용이 원본과 일치하는지 확인하는 의미 있는 인용 확인. 각 항목은 다른 항목이 수행하지 않는 것을 식별합니다. 하나씩은 신뢰할 수 없습니다.

이 분기에 대한 4가지 조치

  1. 베이스라인을 테스트하십시오. 생산에 배포되기 전에 모든 의료, 임상, 규제 RAG 시스템을 모순 무시로 테스트해야 합니다. 테스트를 수행하려면 모순 쌍 테스트 세트와 쿼리당 확인이 필요합니다. 출력은 실질적인 이의를 신호해야 합니다. 72.6 퍼센트의 기준은 반올림 오차가 아닙니다.
  2. 구조적 합성 프롬프트를 구현하십시오. 필요한 4개 섹션(합의, 이의, 증거 품질, 결론) — 출력 대역폭을 이의에 강제합니다. 새로운 인프라는 필요하지 않습니다. 훈련이 필요하지 않습니다. 쿼리당 비용이 필요하지 않습니다. 하나의 변경으로 19배의 감소!
  3. 모순 민감한 쿼리에 대해 MMR 검색을 사용하지 마십시오. MMR은 주제별 범위를 위해 다양화된 문서를 사용하지만, 이의의 양쪽을 검색하는 데 최적화되지 않습니다. 따라서 bm25 및 임베딩 검색을 더 안전한 기본값으로 사용해야 합니다. 그러나 태도 인식 다양화는 이 연구가 가리키는 방향입니다.
  4. 평가 메트릭을 쌍으로 하십시오. 단일 LLM 판결 점수를 사용하지 마십시오. 그것을 인식 확인 및 인용된 증거가 주장된 주장을 확인하는 의미 있는 인용 확인과 결합하십시오.

더 넓은 관점

RAG 개발의 지배적인 본능은 추가적입니다. 더 나은 검색기, 더 나은 재정렬기, 더 풍부한 메타데이터, 더 긴 컨텍스트 창. RAG 파이프라인이 여전히 생산에서 실패하는 이유에 대한 산업 대화는 대부분 동일한 모양을 따랐습니다. 모순 처리의 경우, 효과적인 이동은 추가가 아닌 제거였습니다. 시스템이 출력할 수 있는 것을 제한하는 것보다, 시스템에 제공할 수 있는 것을 확장하는 것입니다. 4부분의 합성 프롬프트가 5단계 파이프라인을 능가했습니다. 그것은 모델이 생산할 수 있는 것을 변경하는 것이 아니라, 모델이 생산해야 하는 것을 변경함으로써 그렇게 했습니다.

그것은 아키텍처가 관련이 없다는 것을 의미하지 않습니다. 검색은 천장을 설정합니다. 무작위 검색은 합성이 의미가 없습니다. 나쁨 증거 품질은 모든 것을 다운스트림에서 캡합니다. 이것은 RAG 시스템이 신뢰성 문제를 해결하는지 여부에 대한 질문이 계속해서浮上하는 이유입니다. 그러나, 충돌하는 증거가 충돌하는 것으로 표시되는지 여부를 결정하는 것은 파이프라인의 더 뒤쪽에 있으며, 변경하기 더 저렴하기 때문에 신뢰성을 개선하는 데 필요한 변경은 더 일찍 발생할 수 있습니다.

비싼 작업 — 더 나은 모순 데이터 세트, 명시적인 이의 훈련 신호, 태도 민감한 검색, 모순 네이티브 벤치마크 — 여전히 수행해야 합니다. 그리고 더 오래 걸릴 것입니다.

따라서 시스템이 모순되는 증거를 모순된 것으로 표시하는지 여부를 알고 싶다면, 불편한 질문을 자신에게 물어보고 이번 주에 답을 찾으십시오. 시스템이 사용자에게 증거가 모순된다는 것을 알려주나요?

히만슈 고엘은 높은 위험 도메인, 즉 생물의학, 금융, 및 규제 문서 워크플로우를 위한 검색 증강 생성에 전문적인 인공지능/기계학습 연구자입니다.