Лидеры мнений
Настоящая причина, по которой ваша конвейерная линия RAG продолжает галлюцинировать

Вы знаете этот ритуал. Конвейерная линия галлюцинировала перед клиентом, поэтому вы поменяли модель вложения. Затем вы обновили большую языковую модель. Затем вы добавили системную подсказку, которая говорит, все более отчаянными заглавными буквами, ИСПОЛЬЗУЙТЕ ТОЛЬКО ПРЕДОСТАВЛЕННЫЙ КОНТЕКСТ. И этим утром она уверенно сослалась на документ политики, которого не существует.
Вы в хорошей компании. Когда исследователи RegLab и HAI из Стэнфорда проверили инструменты юридических исследований ИИ, продаваемые LexisNexis и Thomson Reuters (TRI ), продукты, продаваемые как “без галлюцинаций” благодаря генерации с помощью поиска, они обнаружили коэффициенты галлюцинации между 17% и 34% на заранее зарегистрированных юридических запросах. RAG действительно помог: сырая GPT-4 галлюцинировала гораздо больше. Но разрыв между “уменьшенным” и “ликвидированным” – это то место, где живут системы производства, и этот разрыв имеет структуру.
Галлюцинация в конвейерной линии RAG редко является одной неудачей. Это три, заговорщики: поиск неудачно проходит тихо, модель была обучена отвечать так же, и ничего в конвейерной линии не измеряет пространство между этими двумя фактами. Замена моделей не решает ни одну из них.
Заговорщик один: поиск неудачно проходит чаще, чем вы думаете
Самые свежие доказательства здесь также являются самыми неудобными. В ноябре 2025 года команда, в которую входили 18 медицинских экспертов, произвела 80 502 аннотации по 800 выходам RAG на реальных запросах пациентов и запросах в стиле USMLE. Стандартный RAG не только не оправдал ожиданий, но и ухудшил фактичность на 6% и полноту на 5% по сравнению с теми же моделями, работающими без поиска. Коренная причина лежала выше языковой модели: только 22% из 16 извлеченных отрывков были актуальны для запроса.
Прежде чем вы откажетесь от этого как от сложной проблемы, Anthropic измерил неудачу поиска на чистых, отредактированных корпорациях во время разработки своей контекстной техники поиска и обнаружил, что стандартный поиск вложения не смог найти необходимый фрагмент в топ-20 результатов 5,7% времени. Один запрос из 18, на хорошо ухоженных данных, без каких-либо экзотических событий.
Это почему каноническая инженерная таксономия неудач RAG, семь точек неудач Barnett et al., имеет такое большое значение: три из семи (пропущенный контент, пропущенные топ-ранговые документы и неудачи консолидации контекста) происходят до того, как языковая модель сгенерирует один токен. Unite.AI опубликовал подробный обзор этой таксономии и каркасов оценки, которые к ней относятся, поэтому я не буду ее восстанавливать здесь. Точка, которую добавляет эта статья, касается стимулов: подобие вложения является заменой актуальности, а не гарантией ее, и недавние теоретические работы Google DeepMind указывают на то, что единичные векторные вложения имеют жесткие математические ограничения на то, какие комбинации актуальных документов они могут представлять. Поисковик, который возвращает правдоподобные, но неправильные фрагменты, делает именно то, что делает косинусное подобие.
Заговорщик два: модель была обучена угадывать
Теперь передайте эту несовершенную контекстную информацию языковой модели и спросите, что ее обучение научило ее делать с пробелами.
OpenAI ответил на это напрямую в своей статье сентября 2025 года Почему языковые модели галлюцинируют: стандартное обучение и оценка вознаграждают угадывание над признанием неопределенности. Бенчмарки оценивают бинарную точность, воздержание оценивается как ноль, и поэтому модели учатся, что уверенное угадывание лучше, чем пустой ответ. Сравнение в статье делает это конкретным: на SimpleQA одна модель рассуждений воздержалась 1% времени и была неправильной 75% времени, в то время как другая модель, настроенная иначе, воздержалась 52% времени и снизила свою ошибку до 26%.
Бенчмарки RAG показывают, что этот стимул делает внутри конвейерной линии. Бенчмарк RGB проверил, отказываются ли модели отвечать, когда им передают только нерелевантные документы. Лучший показатель отрицательного отклонения во всех протестированных моделях составил 45%, что означает, что даже лучшая модель, получившая только мусорный контекст, ответила все равно более чем в половине случаев. ClashEval обнаружил зеркальную неудачу: когда извлеченный контент противоречил знаниям, которые модель уже имела, модели отказались от своего правильного ответа в пользу неправильного контекста более 60% времени. Верность неудачает в обоих направлениях, и FaithEval от Salesforce добавляет тревожный вывод, что более крупные модели не являются надежно более верными.
Команда интерпретируемости Anthropic даже отслежила механизм. В их анализе отказ является дефолтным контуром модели; функция “известной сущности” подавляет этот отказ, когда модель распознает что-то. Галлюцинация происходит, когда функция дает сбой, когда модель распознает форму вашего вопроса, не имеет содержания и конфабулирует гладко в пробел.
И если вы надеетесь, что авангард просто перерастет это: лидерборд галлюцинаций Vectara измеряет что-то гораздо проще, чем RAG, суммируя один документ, помещенный прямо перед моделью, и на момент его обновления в мае 2026 года GPT-4o все еще фабриковал в 9,6% сумм, а Claude Opus 4 в 12%. Даже с идеальным поиском генерация все равно протекает.
Интуитивное решение только ухудшает ситуацию
Столкнувшись со всем этим, большинство команд тянутся за объемом. Извлеките больше фрагментов. Купите больший контекстный окно. Засуньте все, что может помочь, и пусть модель разберется.
Доказательства говорят об обратном. Исследование контекстного разложения Chroma проверило 18 моделей, включая GPT-4.1, Claude 4 и Gemini 2.5, и обнаружило, что производительность становится “все более ненадежной с ростом длины входных данных”, с одним отвлекающим документом, который значительно снижает точность, и четырьмя отвлекающими документами, которые снижают ее существенно. Ранее исследование Lost in the Middle обнаружило знаменитую кривую U: информация, закопанная в середине контекста, игнорируется даже длинноконтекстными моделями. И медицинская проверка выше показывает, как эти динамики выглядят от начала до конца, система, извлекающая шестнадцать отрывков, из которых двенадцать и более нерелевантны, а затем передает эту кучу модели, обученной никогда не говорить “я не знаю”.
Больше поиска без большей точности только производит отвлекающие факторы. Точность побеждает полноту в генерации, основанной на контексте, и это не близко.
Заговорщик три: никто не измеряет разрыв
Barnett et al. поставили оперативную истину в одну строку: “валидация системы RAG возможна только во время эксплуатации”. Вы не можете подтвердить конвейерную линию RAG на этапе тестирования, потому что ее режимы неудач являются совместным свойством вашего корпуса, ваших запросов и ваших пользователей, ни один из которых не остается на месте.
Однако большинство конвейерных линий производства отслеживают только конечное качество ответа, что объединяет двух заговорщиков выше в одну неразрешимую цифру. Стандартная декомпозиция, иногда называемая триадой RAG, разделяет актуальность контекста (нашел ли поиск правильный материал?), основанность (придерживается ли ответ этого материала?) и актуальность ответа (относится ли он к вопросу?). Каркасы, такие как RAGAS и TruLens, реализуют это. Я буду честен, что нет строгого обзора, количественно определяющего, сколько команд производства запускают эти; что существует, так это запись практика, и она в основном описывает оценку настроением. Если ваша команда не имеет панели, различающей неудачи поиска и неудачи верности, каждая галлюцинация будет продолжать выглядеть как проблема модели, и вы будете продолжать покупать решения, похожие на модель.
Что действительно работает, по порядку
Измерьте поиск отдельно от генерации. Не гламурное решение, которое все пропускают, и, на мой взгляд, самый высокий приоритет в этом списке, потому что оно преобразует спор о том, какую модель купить, в диагноз. Если актуальность контекста плоха, никакой генератор не может спасти вас. Если основанность плоха с хорошим контекстом, никакой поисковик не может.
Создайте стек точности. Чистые числа Anthropic – это лучшая демонстрация исправлений поиска с помощью стека, где контекстные вложения фрагментов снизили неудачу поиска в топ-20 результатах с 5,7% до 3,7%, добавление гибридного поиска BM25 (классического поиска по ключевым словам наряду с векторным поиском) снизили его до 2,9%, и добавление переранжера, модели второго этапа, которая переоценивает кандидатские фрагменты на фактическую актуальность, достигли 1,9%, что составляет 67% общего снижения. Unite.AI освещал почему двухэтапный поиск работает лучше своего веса в деталях.
Наградите воздержание. Рецепт OpenAI – наказать уверенные ошибки больше, чем выраженную неопределенность, и вы можете реализовать местную версию сегодня: запрашивайте и оценивайте ответы “я не знаю”, и добавьте проверку основы, модель вывода (NLI), которая проверяет каждое сгенерированное утверждение на поддержку извлеченного текста перед тем, как ответ будет отправлен. Работа RAGTruth показала, что небольшой дообученный детектор может соответствовать промптингу GPT-4 при обнаружении неподдерживаемых утверждений.
Перепишите запросы и отфильтруйте доказательства. В медицинской проверке переформулировка запроса и фильтрация доказательств восстановили до 12 пунктов фактичности. Дешево, скучно, эффективно.
Рассмотрите агентный поиск в последнюю очередь. Многоступенчатый поиск, который рассуждает о том, что извлечь дальше (примечания здесь), действительно помогает в сложных многошаговых запросах, но он добавляет задержку, стоимость и новые режимы неудач. Это завершение, а не основа.
Модель была наименьшей частью, которая не была сломана
Вернитесь к ритуалу из начала. Каждый шаг его, замена вложения, обновление модели, кричащая системная подсказка, рассматривали галлюцинацию как дефект генератора. Доказательства говорят, что генератор делал то, что его обучение вознаграждало, с материалами, которые ваш поисковик передал ему, не замеченные никакой метрикой, которая могла бы сказать, какой из них неудачно прошел.
Ваша конвейерная линия RAG не сломана. Она послушна. Она делает именно то, что ее стимулы вознаграждают, и пока вы не измерите поиск и генерацию отдельно и не сделаете “я не знаю” категорией оценки вместо неудачи, эти стимулы говорят: угадай.












