Модели и платформы ИИ
Меньше – значит лучше: почему получение меньшего количества документов может улучшить ответы ИИ
Retrieval-Augmented Generation (RAG) – это подход к созданию систем ИИ, который сочетает языковую модель с внешним источником знаний. В простых терминах, ИИ сначала ищет соответствующие документы (например, статьи или веб-страницы), связанные с запросом пользователя, а затем использует эти документы для генерации более точного ответа. Этот метод был отмечен за помощь в поддержании больших языковых моделей (LLM) в поддержании фактов и снижении галлюцинаций, основываясь на реальных данных.
Интуитивно можно подумать, что чем больше документов ИИ получает, тем лучше будет его ответ. Однако недавние исследования показывают неожиданный поворот: когда речь идет о подаче информации ИИ, иногда меньше значит больше.
Меньше документов, лучшие ответы
Новое исследование исследователей из Еврейского университета в Иерусалиме изучило, как количество документов, предоставляемых системе RAG, влияет на ее производительность. Критически важно, что они сохранили общее количество текста постоянным – это означает, что если было предоставлено меньше документов, эти документы были немного расширены, чтобы заполнить одинаковую длину, как и много документов. Таким образом, любые различия в производительности можно было бы отнести к количеству документов, а не просто к более короткому вводу.
Исследователи использовали набор данных вопросов и ответов (MuSiQue) с вопросами викторины, каждый из которых первоначально был сопоставлен с 20 абзацами Википедии (только несколько из которых фактически содержали ответ, а остальные были отвлекающими факторами). Уменьшив количество документов с 20 до 2-4 действительно релевантных – и заполнив их немного дополнительным контекстом, чтобы сохранить постоянную длину – они создали сценарии, в которых ИИ имел меньше материала для рассмотрения, но все же примерно одинаковое общее количество слов для чтения.
Результаты были поразительными. В большинстве случаев модели ИИ отвечали более точно, когда им предоставлялись меньше документов, а не полный набор. Производительность значительно улучшилась – в некоторых случаях на 10% в точности (балл F1) при использовании системы только горстки поддерживающих документов вместо большого собрания. Этот контринтуитивный прирост был наблюдаем во всех различных открытых языковых моделях, включая варианты Llama от Meta и других, что указывает на то, что явление не связано с одной моделью ИИ.
Одна модель (Qwen-2) была заметным исключением, которое обрабатывало несколько документов без снижения балла, но почти все протестированные модели работали лучше с меньшим количеством документов в целом. Другими словами, добавление большего количества справочного материала за пределами ключевых релевантных фрагментов фактически ухудшало их производительность чаще, чем помогало.

Источник: Levy et al.
Почему это такой сюрприз? Обычно системы RAG проектируются под предположением, что получение более широкого спектра информации может только помочь ИИ – в конце концов, если ответ не находится в первых нескольких документах, он может быть в десятом или двадцатом.
Это исследование переворачивает этот сценарий, демонстрируя, что бездумное наращивание дополнительных документов может иметь обратный эффект. Даже когда общая длина текста сохранялась постоянной, простое присутствие многих разных документов (каждый со своим контекстом и особенностями) делало задачу ответа на вопрос более сложной для ИИ. Похоже, что за определенной точкой каждый дополнительный документ вводил больше шума, чем сигнала, сбивая модель и ухудшая ее способность извлечь правильный ответ.
Почему меньше может быть больше в RAG
Этот результат “меньше – значит больше” имеет смысл, когда мы рассматриваем, как модели ИИ языка обрабатывают информацию. Когда ИИ предоставляются только наиболее релевантные документы, контекст, который он видит, сосредоточен и свободен от отвлекающих факторов, как и студент, которому были даны только правильные страницы для изучения.
В исследовании модели показали значительно лучшую производительность, когда им предоставлялись только поддерживающие документы, с удаленным нерелевантным материалом. Остальной контекст был не только короче, но и чище – он содержал факты, которые прямо указывали на ответ и ничего больше. С меньшим количеством документов для обработки модель могла сосредоточить все свое внимание на релевантной информации, что делало ее менее вероятной для того, чтобы она отвлеклась или запуталась.
С другой стороны, когда было получено много документов, ИИ должен был просеять смесь релевантного и нерелевантного контента. Часто эти дополнительные документы были “podobnye, но нерелевантные” – они могли делиться темой или ключевыми словами с запросом, но не содержать ответ. Такой контент может ввести модель в заблуждение. ИИ мог тратить усилия на попытки соединить точки между документами, которые не ведут к правильному ответу, или, что еще хуже, он мог объединить информацию из нескольких источников неправильно. Это увеличивает риск галлюцинаций – случаев, когда ИИ генерирует ответ, который звучит правдоподобно, но не основан на каком-либо едином источнике.
По сути, подача слишком многих документов модели может разбавить полезную информацию и ввести противоречивые детали, что делает более сложным для ИИ определение того, что является истиной.
Интересно, что исследователи обнаружили, что если дополнительные документы были явно нерелевантными (например, случайный нерелевантный текст), модели были лучше в игнорировании их. Реальная проблема возникает из отвлекающих данных, которые выглядят релевантными: когда все полученные тексты находятся на подобных темах, ИИ предполагает, что он должен использовать все они, и он может испытывать трудности в определении, какие детали фактически важны. Это соответствует наблюдению исследования, что случайные отвлекающие факторы вызывали меньше путаницы, чем реалистичные отвлекающие факторы во входных данных. ИИ может фильтровать явный бред, но тонко неуместная информация – это хитрый ловушку – она проникает под видом релевантности и сбивает с толку ответ. Уменьшая количество документов до только действительно необходимых, мы избегаем создания этих ловушек.
Также есть практическая выгода: получение и обработка меньшего количества документов снижает вычислительную нагрузку на систему RAG. Каждый документ, который получен, должен быть проанализирован (встроен, прочитан и обработан моделью), что требует времени и вычислительных ресурсов. Устранение лишних документов делает систему более эффективной – она может находить ответы быстрее и с меньшими затратами. В сценариях, где точность улучшалась за счет сосредоточения на меньшем количестве источников, мы получаем выигрыш: лучшие ответы и более эффективный процесс.

Источник: Levy et al.
Переоценка RAG: будущие направления
Это новое доказательство того, что качество часто превосходит количество в получении, имеет важные последствия для будущего систем ИИ, которые полагаются на внешние знания. Оно предполагает, что разработчики систем RAG должны уделять приоритетное внимание умной фильтрации и ранжированию документов над простым количеством. Вместо того, чтобы получать 100 возможных отрывков и надеяться, что ответ где-то там, может быть мудрее получить только несколько самых релевантных.
Авторы исследования подчеркивают необходимость того, чтобы методы получения “нашли баланс между релевантностью и разнообразием” в информации, которую они предоставляют модели. Другими словами, мы хотим обеспечить достаточное освещение темы, чтобы ответить на вопрос, но не так много, чтобы основные факты были утоплены в море лишнего текста.
В будущем исследователи, вероятно, будут исследовать методы, которые помогут моделям ИИ более грациозно обрабатывать несколько документов. Одним из подходов является разработка лучших систем получения или переупорядочения, которые могут определить, какие документы действительно добавляют ценность, а какие только вводят конфликт. Другой подход заключается в улучшении самих языковых моделей: если одна модель (например, Qwen-2) смогла справиться с многими документами без потери точности, изучение того, как она была обучена или структурирована, могло бы дать подсказки для того, чтобы сделать другие модели более прочными. Может быть, будущие большие языковые модели будут включать механизмы для распознавания того, когда два источника говорят одно и то же (или противоречат друг другу) и сосредотачиваются соответственно. Целью будет сделать модели способными использовать разнообразный спектр источников без того, чтобы стать жертвой путаницы – эффективно получая лучшее из обоих миров (широта информации и ясность фокуса).
Также стоит отметить, что по мере того, как системы ИИ получают большие окна контекста (способность читать больше текста одновременно), простое сбрасывание большего количества данных в запрос не является серебряной пулей. Больше контекста не означает автоматически лучшее понимание. Это исследование показывает, что даже если ИИ может технически прочитать 50 страниц одновременно, предоставление ему 50 страниц смешанной информации может не дать хороший результат. Модель все еще выигрывает от того, что имеет отобранный, релевантный контент для работы, а не бездумную сброску. Фактически, интеллектуальное получение может стать еще более важным в эпоху гигантских окон контекста – чтобы обеспечить, что дополнительная емкость используется для ценной информации, а не шума.
Найденные результаты из “Больше документов, одинаковая длина” (умно названной статьи) побуждают к переоценке наших предположений в исследованиях ИИ. Иногда подача ИИ всей имеющейся информации не так эффективна, как мы думаем. Сосредотачиваясь на наиболее релевантных кусках информации, мы не только улучшаем точность ответов ИИ, но также делаем системы более эффективными и легче доверять. Это контринтуитивный урок, но с интересными последствиями: будущие системы RAG могут быть одновременно умнее и стройнее, тщательно выбирая меньше, лучших документов для получения.












