사상 리더

실제로 귀하의 RAG 파이프라인이 왜 계속해서 환각을 일으키는지

mm
Unite.AI를 Google의 선호 소스에 추가

당신은 그 의식을 알고 있다. 파이프라인이 고객 앞에서 환각을 일으켰으므로, 임베딩 모델을 교체했다. 그런 다음 LLM을 업그레이드했다. 그런 다음 시스템 프롬프트를 추가했는데, 점점 더 절실한 대문자로, 제공된 컨텍스트만 사용하라고 말했다. 그리고 오늘 아침에는 존재하지 않는 정책 문서를 자신감 있게 인용했다.

당신은 좋은 회사에 속해 있다. 스탠퍼드의 RegLab과 HAI 연구자들이 LexisNexis와 Thomson Reuters (TRI ) 가 판매하는 AI 법률 연구 도구를 감사했을 때, RAG를 통해 “환각이 없는” 것으로 광고된 제품에서, 17%에서 34% 사이의 환각률을 벤치마크 쿼리에서 발견했다. RAG는 정말로 도움이 되었고, 원시 GPT-4는 훨씬 더 많은 환각을 일으켰다. 그러나 “감소된”과 “제거된” 사이의 간격은 생산 시스템이 살고 있는 곳이며, 그 간격에는 구조가 있다.

RAG 파이프라인에서의 환각은 거의 하나의 실패가 아니다. 그것은 세 가지, 음모의 결과이다: 검색이 조용히 실패하고, 모델이 어쩔 수 없이 대답하도록 훈련되었으며, 파이프라인의 아무도 그 두 가지 사실 사이의 간격을 측정하지 않는다. 모델을 교체하는 것은 아무 것도 해결하지 않는다.

음모자 1: 검색이 생각보다 더 자주 실패한다

여기서 가장 최근의 증거는 또한 가장 불편한 것이다. 2025년 11월, 18명의 의료 전문가가 포함된 팀이 실제 환자와 USMLE 스타일 쿼리에서 800개의 RAG 출력에 대한 80,502개의 주석을 생성했다. 표준 RAG는 단순히 성능을 낮추지 않았고, 사실성과 완전성을 모델이 검색 없이 실행할 때보다 각각 6%, 5% 낮췄다. 근본적인 원인은 모델 이전에 있었는데, 검색된 통행의 상위 16개 통행 중에 쿼리와 관련된 통행은 22%에 불과했다.

그것을 어려운 도메인 문제로 치부하기 전에, Anthropic은 컨텍스트 검색 기술을 개발하면서 깨끗한 큐레이션된 코퍼스에서 검색 실패를 측정했으며, 표준 임베딩 검색이 5.7%의 시간에 상위 20개 결과에 필요한 청크를 표시하지 못했다는 것을 발견했다. 18개 중 1개의 쿼리, 잘 정리된 데이터에서, 특별한 일이 일어나지 않는다.

이것은 RAG 실패의 정식 엔지니어링 분류법, Barnett et al.의 7가지 실패 지점이 중요한 이유이다: 7가지 중 3가지(누락된 콘텐츠, 최고 순위 문서 누락, 컨텍스트 통합 실패)는 언어 모델이 단 하나의 토큰을 생성하기 전에 발생한다. Unite.AI는 그 분류법과 해당 평가 프레임워크에 대한 철저한 소개를 게시했으므로, 여기서 그것을 다시 구축하지는 않을 것이다. 이 기사가 추가하는 점은 인센티브에 관한 것이다: 임베딩 유사성은 관련성의 대리자이지, 보장된 관련성이 아니며, 최근의 이론적 연구에서 Google DeepMind는 단일 벡터 임베딩이 표현할 수 있는 관련 문서의 조합에 대한 엄격한 수학적 제한이 있음을 나타냈다. 플라우즈블하지만 잘못된 청크를 반환하는 검색기는 정확히 코사인 유사성이 하는 일을 하고 있다.

음모자 2: 모델이 추측하도록 훈련되었다

이제 불완전한 컨텍스트를 언어 모델에 넘기고, 모델이 갭에 대해 무엇을 하는지 물어보라.

OpenAI는 2025년 9월에 발표한 언어 모델이 왜 환각을 일으키는지에 대해 직접적으로 대답했다: 표준적인 훈련과 평가에서는 추측을 불확실성보다獎賞한다. 벤치마크는 이진 정확도를 평가하며, 기권은 0점을 받으므로, 모델은 공백보다 확신 있는 추측을 배운다. 논문의 비교는 구체적으로 만들었다: SimpleQA에서, 하나의 추론 모델은 1%의 시간에 기권했고, 75%의 시간에 잘못되었으며, 다르게 조정된 형제 모델은 52%의 시간에 기권했고, 오류율을 26%로 낮췄다.

RAG 특정 벤치마크는 파이프라인 내에서 그 인센티브가 무엇을 하는지 보여준다. RGB 벤치마크는 모델이 관련없는 문서만을 받았을 때 답변을 거부하는지 테스트했다. 테스트된 모든 모델 중에서 최고의 부정적인 거부율은 45%였으며, 이는 모델이 아무 것도 받았을 때보다 더 자주 대답한다는 것을 의미한다. ClashEval은 모델이 이미 알고 있는 올바른 답변을 위해 검색된 컨텍스트를 포기하는 반대 실패를 발견했다. 두 방향 모두에서 충성도가 실패한다. Salesforce의 FaithEval은 더 큰 모델이 항상 더 충실하지 않다는 불안정한 후렴구를 추가한다.

Anthropic의 해석 가능성 팀은 그 메커니즘을 추적했다. 그들의 분석에서, 기권은 모델의 기본 회로이다; “알려진 엔티티” 기능이 기권을 억제한다. 환각은 기능이 오작동할 때 발생하며, 모델이 질문의 모양을 인식하지만 내용이 부족하고, 갭을 유창하게 채운다.

그리고 만약 당신이 그것이 단순히 앞으로 나아가면서 성장할 것이라고 희망한다면: Vectara의 환각 리더보드는 모델이 직접 앞에 있는 단일 문서를 요약하는 것을 측정하며, 2026년 5월 업데이트에서 GPT-4o는 여전히 9.6%의 요약에서 허구를 만들었고, Claude Opus 4는 12%였다. 검색이 완벽하게 해결되더라도, 생성이 새는 곳이 있다.

본능적인 해결책이 더 나쁘게 만든다

이 모든 것에 직면하여, 대부분의 팀은 볼륨을 잡는다. 더 많은 청크를 검색한다. 더 큰 컨텍스트 창을 구입한다. 도움이 될 수 있는 모든 것을 넣고 모델이 정리하게 한다.

증거는 반대 방향으로 진행된다. Chroma의 컨텍스트腐敗 연구는 18개의 모델, GPT-4.1, Claude 4, Gemini 2.5를 포함하여 테스트했으며, 성능이 입력 길이가 증가함에 따라 점점 더 불안정해진다는 것을 발견했으며, 단일 분산 문서는 정확도를 측정할 수 있을 정도로 절단하고, 4개의 분산 문서는 상당히 절단했다. 이전의 Lost in the Middle 연구는 유명한 U-곡선을 발견했으며, 중간에 묻혀 있는 정보는 심지어 긴 컨텍스트 모델에서도 무시된다. 그리고 위의 의료 감사는 시스템이 16개의 통행을 검색하여 12개 이상이 관련이 없을 때, “나는 모른다”고 말하지 않도록 훈련된 모델에게 그것을 넘기는 그 역학이 gì이다.

더 많은 검색 없이 더 많은 정밀도는 단지 분산 문서를 제조한다. 정밀도는 근거 있는 생성에서 재현보다 낫다.

음모자 3: 아무도 간격을 측정하지 않는다

Barnett et al.은 운영 진리를 한 줄에 넣었다: “RAG 시스템의 검증은 운영 중에만 가능하다.” 당신은 스테이징에서 RAG 파이프라인을 승인할 수 없다. 왜냐하면 그 실패 모드는 코퍼스, 쿼리 및 사용자의 공동 속성이며, 아무 것도 안정적이지 않기 때문이다.

그러나 대부분의 생산 파이프라인은 최종 답변 품질만을 추적하며, 위의 두 음모자를 하나의 설명할 수 없는 숫자로 혼합한다. 표준 분해, 때때로 RAG 삼위일체라고 불리는 것은, 컨텍스트 관련성(검색이 올바른 자료를 찾았는가?), 근거(답변이 그 자료에 달라붙는가?), 답변 관련성(그것이 질문에 답하는가?)을 분리한다. RAGAS와 TruLens와 같은 프레임워크가 이를 구현한다. 나는 엄격한 조사 결과가 없지만, 대부분의 생산 팀이 이러한 것을 실행하지 않는다는 것을 인정한다; 존재하는 것은 실무자 기록이며, 그것은 대부분 평가에 의해 설명된다. 만약 당신의 팀에 검색 실패와 충성도 실패를 구별하는 대시보드가 없다면, 모든 환각은 모델 문제처럼 보일 것이며, 당신은 계속해서 모델 형태의 해결책을 구입할 것이다.

실제로 작동하는 것

검색과 생성을 별도로 측정하라. 모든 사람이 건너뛰는 평범한 해결책이며, 내 견해로는 이 목록에서 가장 높은 레버리지 항목이다. 왜냐하면 그것은 모델을 구입해야 하는지에 대한 논쟁을 진단으로 변환하기 때문이다. 컨텍스트 관련성이 나쁘면, 생성기가 당신을 구할 수 없다. 근거가 나쁘면, 검색기가 당신을 구할 수 없다.

정밀도 스택을 구축하라. Anthropic의 발표된 숫자는 어디에서나 가장 깨끗한 스택된 검색 수정의 시연이다: 컨텍스트 청크 임베딩은 상위 20개 결과에서 검색 실패를 5.7%에서 3.7%로 낮추었고, BM25 하이브리드 검색(벡터 검색과 함께 키워드 일치)을 추가하여 2.9%로 낮추었고, 재랭커(후속 모델)를 추가하여 실제 관련성을 위해 후보 청크를 재평가하여 1.9%까지 도달했다. 이는 총 67%의 감소이다. Unite.AI는 2단계 검색이 왜 그만한 가치가 있는지 자세히 다루었다.

기권을獎賞하라. OpenAI의 처방은 확신 있는 오류보다 불확실성을獎賞하는 것이다. 당신은 오늘 바로 지역 버전을 구현할 수 있다: “나는 모른다” 응답을 프롬프트하고 평가하고, 근거 확인을 추가한다. 근거 확인은 NLI(연역 모델)로, 생성된 각 주장을 검색된 텍스트에 의해 지원되는지 확인한다. RAGTruth 작업은 작은 미세 조정된 탐지기가 GPT-4 기반 프롬프트를 따라가며 지원되지 않는 주장을 잡을 수 있음을 보여주었다.

쿼리와 증거를 필터링하라. 의료 감사에서, 쿼리 개선 및 증거 필터링은 사실성에 최대 12포인트를 회복했다. 저렴하고, 지루하고, 효과적이다.

에이전트 검색을 마지막으로 고려하라. 다음에 무엇을 가져올지에 대해 추론하는 다단계 검색(프리머 여기)은 실제로 어려운 멀티 홉 쿼리에 도움이 된다. 그러나 그것은 대기 시간, 비용 및 새로운 실패 모드를 추가한다. 그것은 기초가 아니라 마감이다.

모델은 가장 적게 고장난 부분이었다

처음부터 다시 nhìn보라. 그 의식의 모든 단계, 임베딩 교체, 모델 업그레이드, 시스템 프롬프트는 환각을 모델의 결함으로 취급했다. 증거는 모델이 훈련으로 인해 보상받는 것을 하고, 검색기가 제공한 자료로, 아무도 어느 쪽이 실패했는지 말할 수 있는 지표를 관찰하지 않았기 때문에,라고 말한다.

당신의 RAG 파이프라인은 고장나지 않았다. 그것은 복종한다. 그것은 정확히 그 인센티브가 보상하는 것을 하고 있으며, 검색과 생성을 별도로 측정하고 “나는 모른다”를 점수 카테고리로 만들기보다는 실패로 만들기까지, 그 인센티브는 말한다: 추측하라.

Gary는 소프트웨어 개발, 웹 개발, 콘텐츠 전략에 10년 이상의 경험을 가진 전문 작가입니다. 그는 전환을 유도하고 브랜드 충성도를 구축하는 고품질의 매력적인 콘텐츠를 생성하는 것을 전문으로 합니다. 그는 관객을 매료시키고 정보를 제공하는 이야기들을 만들어내는 것을熱情적으로 생각하며, 그는 항상 사용자를 참여시키는 새로운 방법을 찾고 있습니다.