Основы ИИ

Почему ваш биомедицинский RAG скрывает от вас противоречия

mm
Добавьте Unite.AI в избранные источники в Google

Стандартный биомедицинский RAG разрешает конфликтующие доказательства默но в примерно трех из четырех запросов. Исправление является структурным, а не информационным — и большая часть сложности, добавляемой командами, не помогает.

Задайте вопрос вспомогательному клиническому помощнику с функцией извлечения — помогает ли мелатонин при джетлаге? — и литература, которую он извлекает, не будет согласна с собой.

Обзор Cochrane пришел к выводу, что мелатонинremarkably эффективен, с восемью из десяти включенных испытаний, показавших снижение джетлага на рейсах, пересекающих пять или более часовых поясов. Рандомизированное, двойное слепое исследование 257 норвежских врачей в Американском журнале психиатрии не обнаружило никакой пользы от любого из трех режимов приема мелатонина.

Оба документа являются реальными. Оба являются методологически серьезными. Любой клиницист, решающий, что рекомендовать, должен знать, что они не согласны.

В контролируемых испытаниях синтез обычно не говорил об этом. Он произвел насыщенный, правильно процитированный абзац, который встал на одну сторону и никогда не сигнализировал о том, что существует другая сторона.

Это противоречивая слепота. На биомедицинском бенчмарке, парном с противоречиями, это произошло в 72,6 процента запросов (95% CI 0,697–0,755). Выходные данные читались нормально. Цитаты были разрешены правильно. Стандартные проверки качества прошли. Несогласие просто исчезло.

Режим неудачи, который выглядит как успех

Хотя нет прямого сходимости в биомедицинских доказательствах, исследования показывают противоречивые результаты между использованием наблюдательных исследований и рандомизированных контролируемых испытаний (РКИ) и также различными методами, используемыми для разных популяций пациентов; однако, исследование также может включать как сильную, так и слабую методологию, которая, кажется, имеет одинаковую значимость.

Это не уникальный случай. Анализ Ioannidis высоко цитируемых клинических исследований показал, что 16 процентов наиболее цитируемых исследований были позже полностью опровергнуты, и что наблюдательные исследования были гораздо более вероятны, чем рандомизированные испытания, быть опровергнутыми или иметь свои эффекты пересмотрены вниз — пять из шести, против девяти из тридцати девяти. Таким образом, проблема заключается не только в несогласии между исследованиями, но и в структурной части самой литературы.

Следовательно, как критическая функция любого биомедицинского системы генерации с извлечением, генерация доказательств о несогласиях между исследованиями должна быть основной целью. Однако большинство систем не могут выполнить эту задачу. Используя HealthContradict бенчмарк, состоящий из 920 пар противоречий, было показано, что стандартная система генерации с извлечением (RAG) не смогла сгенерировать несогласия примерно в 73% протестированных пар. Проблема не в извлечении. Система извлекает обе стороны. Затем она разрешает конфликт默но, в пользу одной из них.

Ручной осмотр 50 стратифицированных случаев неудач показал закономерность, которую я назвал эпистемологическим выравниванием. Оба документа цитируются индивидуально моделью, и ее представление конфликта описывается в терминах градиентов уверенности (“анекдотические доказательства … научные исследования указывают…”) как будто конфликта не существует. Менее 5% этих случаев неудач использовали слова “противоречие”, “конфликт” или “несогласие” вообще. Выходные данные, сгенерированные моделью, имели коэффициент точности цитирования 0,99. Это именно то, о чем идет речь: точность цитирования не подразумевает осведомленность о противоречиях. Система может атрибутировать каждое предложение идеально и все равно сказать клиницисту что-то, что доказательная база не поддерживает.

Три особенности “синтеза” RAG создают опасную клиническую среду.

Инверсия ценностного предложения. Цель RAG — отображать доказательства, имеющие отношение к клиницистам. Таким образом, удаляя аспекты этих доказательств, которые наиболее важны для клиницистов, он фактически достигает противоположного.

Создание невидимости. Поскольку нет ограждения, или обрезки, или артефакта формата; “выровненный” синтез и верный синтез выглядят неразличимыми на экране.

Умножение默но в масштабе. Ничто в стандартном наборе оценки не флагирует это, поэтому система может работать в производстве в течение месяцев, пока каждый конфликтный запрос默но разрешается в одном направлении.

Информация не является рычагом

Очевидным решением этой проблемы было бы проинформировать модель. Очевидно, если режим неудачи заключался в том, что модель не определила, что два документа противоречат, вы могли бы просто добавить метку “SUPPORT” или “CONTRADICT” к каждому из извлеченных документов. Это должно было бы улучшить производительность модели. Это не произошло.

В эксперименте, где мы добавили метки положения (аннотированные) для явного предоставления модели информации о том, что два документа противоречат, мы обнаружили, что явная аннотация положения переместила слепоту противоречий с 93,8 процента в неаннотированном контроле до 91,4 процента — разница с перекрывающимися интервалами доверия и без практической значимости. Хотя модель получила информацию о том, что два документа противоречат, ее стандартная реакция на распределение осталась неизменной.

Понимание механизма полезно здесь. Информация, добавленная пассивно в подсказку, не меняет стандартное распределение реакции модели. Для биомедицинских вопросов, наполненных противоречиями, это распределение сильно偏ствует в сторону единой консолидированной позиции. Метки положения становятся дополнительными токенами — часто переработанными в разделы — в то время как проза возвращается к своему типу.

Структура является рычагом

Что сработало, было структурным, а не информационным; вместо того, чтобы предоставить модели все, что является фактами или правильным о документах, структура требовала, чтобы синтез был построен в терминах возможных несогласий (Согласие, Несогласие, Качество доказательств, Вывод). Скафолдированная подсказка предоставляет модели не больше информации, чем неаннотированный контроль. Единственная разница заключается в том, что модель должна делать.

Были снижения примерно в девятнадцать раз — с 93,8 процента до 4,9 процента — в слепоте противоречий без какого-либо повторного обучения, без каких-либо изменений в конвейере, без каких-либо увеличений задержки и без каких-либо увеличений затрат на запрос.

Это не улучшенное рассуждение. Это просто принудительное распределение. Как только модель должна предоставить раздел “Несогласие”, она возвращается к документам, которые она изначально извлекла, ища что-то, чтобы включить в этот раздел.

Слепота противоречий при трех условиях синтеза в контролируемом анализе. Добавление информации о положении переместило показатель на 2,4 пункта; изменение требуемой структуры вывода переместило его на 86,5.

Структурированная подсказка менее связана с улучшением способности модели рассуждать и более связана с обеспечением легкого управления поведением генерации модели при распределении пространства вывода. Она заставляет модель тратить некоторое количество своего пространства вывода на несогласие (разница между доступной информацией и информацией, которая должна появиться, чтобы удовлетворить требованиям).

Это меняет общее архитектурное предположение. Большинство предложенных улучшений RAG добавляют информацию в контекст: больше документов, баллы извлечения, метки положения, метаданные доказательств. Если подсказка синтеза не имеет конкретных требований к этой информации для формирования структуры вывода, большинство из них не изменят поведение модели. Изменение входных данных смещает массу на окраинах; изменение требуемых структур вывода изменяет распределения напрямую

Почему ожидаемые помощники не помогают

Два элемента, обычно рассматриваемые как необходимые для осведомленности о противоречиях в биомедицинском RAG, показали очень мало при контролируемом анализе.

1) Декомпозиция PICO. PICO (Популяция, Вмешательство, Сравнение, Исход) — это организованный способ разбиения клинических вопросов на составные части для использования в доказательной медицине. Гипотеза заключалась в том, что декомпозиция утверждений в поля PICO ограничит смещение объема и улучшит обнаружение противоречий в гетерогенных доказательствах. Удаление этого уровня привело к выводу, практически неотличимому от того, который был сгенерирован полной системой. Хотя PICO может быть полезным для организации мыслей во время клинического принятия решений; как подразумеваемый вход на момент анализа для поддержки обнаружения противоречий, он не имеет измеримого вклада.

2) Явная классификация положения. В отличие от удаления PICO, явная классификация положения показала плохие результаты, но по-другому. На чистых академических корпусах она произвела небольшие выигрыши на некоторых метриках. Однако при анализе шумного веб-текста — который обычно является тем, как потребительские медицинские приложения получат доступ к информации — классификатор вернул NOT_ENOUGH_INFO для большинства документов, в основном потому, что авторы потребительского медицинского контента обычно не объявляют свою позицию с помощью декларативного языка, ожидаемого классификатором. Следовательно, эти метки как неинформативные были затем пропагированы в контекст синтеза как шум. Удаление этой стадии для шумных корпорумов незначительно улучшило обнаружение противоречий.

Настоящая бутылочное горлышко — качество сигнала вверх по потоку

Самый важный вывод этого исследования заключается в том, что способность распознавать противоречия в источниках ограничена точностью информации (данных) об этих источниках, больше, чем тем, как они были построены или структурированы.

Использование доказательств — доля случаев, когда синтез предпочтительно цитирует источник более высокого качества, когда оба доступны, — составила 0,83 на чистых научных абстрактах и упала ниже 0,15 на шумном веб-извлечении. Семантическая верность цитирования следовала той же схеме, с 0,66 на абстрактах до 0,45 на потребительском медицинском контенте.

Одни и те же конвейеры, разные корпуса. Обработка противоречий ограничена явностью сигналов в источниках документов.

Есть структурная причина для этого. Реальные извлеченные документы часто лишены сигналов, на которые полагается любой классификатор или механизм взвешивания: метаданные типа публикации, явные заявления о положении, описания методологии. Абстракты рецензируемых статей делают утверждения декларативно относительно конкретных популяций, методов и результатов. Точно такие же утверждения делаются в анекдотическом, убедительном и оговорочном языке в потребительских медицинских статьях. Следовательно, одинаковые системы производят существенно разное поведение вниз по потоку на основе того, что они получают в качестве входных данных.

Это также подтверждается крупнейшей экспертной оценкой медицинского RAG, когда восемнадцать медицинских экспертов внесли 80 502 аннотации в 800 выходных данных модели. Только 22 процента из 16 лучших извлеченных отрывков были актуальными. Стандартный RAG ухудшил фактичность и полноту по сравнению с не-RAG-базовыми линиями. Извлечение и выбор доказательств, а не генерация, были доминирующими точками неудач — эхо того, что бенчмарк-работа по медицинскому RAG сообщала в течение двух лет.

Хотя есть относительно ограниченное применение этого вывода, можно заключить, что способность вашей системы обрабатывать противоречия при извлечении из абстрактов PubMed не может быть перенесена на потребительское веб-приложение, независимо от того, насколько продвинута остальная часть вашей системы.

Слепое пятно оценки

Измерение обработки противоречий более сложно, чем кажется, и даже стандартный подход к измерению обработки противоречий имеет свои собственные проблемы.

Оценка LLM-judge представляет собой наиболее распространенный способ оценки вывода RAG для обработки конфликтов, а также отличается от проверок структурного признания в плане того, как они разрабатываются. Стратегии подсказок, которые организуют синтез в поля PICO, получают высокие баллы от судей, в то время как неудачно проходят явные проверки признания. Это ожидаемо: судьи LLM были задокументированы как предпочитающие более длинные, более сложные ответы и также будут рассматривать закопанную оговорку в разделе вывода как тщательность, когда ничего в уровне проза не ссылается на конфликт.

Стратегия извлечения вводит вторую ловушку. Случайное извлечение производит показатель слепоты противоречий, равный нулю — синтез не может не признать противоречие, которого нет в его извлеченном наборе. Максимальная маргинальная актуальность извлечения, с другой стороны, снизила семантическую верность цитирования до 0,11. Каждый выглядит приемлемым под одной метрикой обработки противоречий, но оба не оправдывают ожиданий при парной оценке.

Итак, объедините метрики. Запустите три проверки на каждый синтез: детерминированную структурную проверку на выраженный язык, признающий конфликт; судью LLM для глубины и баланса; и семантическую проверку цитирования, подтверждающую, что цитируемый контент соответствует его источнику. Каждая из них выявляет то, чего не видят другие. Ни одна из них не может быть достоверной сама по себе в качестве бенчмарка для обработки противоречий.

Четыре действия на этот квартал

  1. Протестируйте свою базовую линию. Каждая биомедицинская, клиническая, нормативная система RAG в производстве должна быть протестирована на слепоту противоречий перед дальнейшим развертыванием. Чтобы выполнить тест, вам нужен набор тестирования, парный с противоречиями, и проверка на запрос, чтобы выходные данные сигнализировали о существенном несогласии. Базовая линия 72,6 процента не является округлением.
  2. Реализуйте структурированные подсказки синтеза. Четыре (обязательных) раздела — согласие, несогласие, качество доказательств, вывод — заставляют выходное пространство сосредоточиться на несогласиях. Не требуется новой инфраструктуры; не требуется обучения; нет затрат на запрос; одно изменение произвело снижение в девятнадцать раз!
  3. Не используйте MMR-извлечение для запросов, чувствительных к противоречиям. Хотя MMR использует диверсифицированные документы для тематического покрытия, он не оптимизируется для покрытия положения — что является неправильным, когда цель состоит в том, чтобы извлечь обе стороны несогласия. Следовательно, bm25 плюс извлечение с помощью вложений должно использоваться в качестве более безопасного значения по умолчанию. Однако диверсификация, осведомленная о положении, будет направлением, на которое указывает эта работа.
  4. Объедините свои метрики оценки. Уберите единственный балл LLM-judge. Объедините его со структурной проверкой на существенный контент под заголовками признания и семантической проверкой цитирования, подтверждающей, что цитируемые доказательства поддерживают заявленный утверждение.

Более широкая точка

Доминирующий инстинкт в разработке RAG является аддитивным: лучшие извлекатели, лучшие реранкинги, более богатые метаданные, более длинные окна контекста. Обсуждение отрасли о том, почему конвейеры RAG все еще не работают в производстве, в основном следовало той же схеме. Для обработки противоречий эффективным шагом было вычитание — ограничение того, что система может выводить, а не расширение того, что она получает. Одна четырехчастная подсказка синтеза превзошла пятиступенчатый конвейер. Она сделала это, изменив то, что модель должна производить, а не то, что модель может видеть.

Это не делает архитектуру нерелевантной. Извлечение устанавливает потолок, случайное извлечение делает синтез бессмысленным, а плохое качество доказательств ограничивает все, что находится ниже. Это почему вопрос о том, решают ли системы RAG проблему надежности, продолжает возникать. Однако то, что определяет, представляется ли конфликтующее доказательство как конфликтующее, оказывается позже в конвейере и дешевле в изменении, чем многие другие компоненты, что означает, что изменения, необходимые для улучшения надежности, могут произойти раньше.

Дорогая работа — лучшие наборы противоречий, явные сигналы обучения на несогласия, извлечение, осведомленное о положении, бенчмарки, осведомленные о противоречиях — все еще предстоит сделать, и это займет значительно больше времени.

Следовательно, если вы хотите знать, представляет ли ваша система противоречивые доказательства как противоречивые, вы должны задать себе неудобный вопрос и найти ответ на этой неделе: Сообщает ли ваша система пользователям, когда ее доказательства противоречат?

Химаншу Гоэл - исследователь в области ИИ/МЛ, специализирующийся на генерации, дополненной извлечением информации, для высокорисковых областей, включая биомедицинские, финансовые и регуляторные документообороты.