Взгляд Anderson

Почему ИИ не может просто признать, что не знает ответа?

mm
Добавьте Unite.AI в избранные источники в Google
Flux1.D Pro, Flux Kontext Pro, Firefly V3.

Большие языковые модели часто дают уверенные ответы, даже когда вопрос не может быть ответен. Новые исследования показывают, что эти модели часто признают проблему внутренне, но все равно продолжают выдавать ответ, раскрывая скрытый разрыв между тем, что они знают, и тем, что они говорят.

 

Каждый, кто провел разумное количество времени с ведущими большими языковыми моделями, такими как ChatGPT или Qwen, столкнулся с ситуациями, когда модель дает неправильный ответ (который может иметь или не иметь некоторые катастрофические местные последствия, в зависимости от того, насколько сильно вы на него полагались) – и, когда ошибка стала очевидной, она просто извинилась.

Причина, по которой ведущие модели LLM имеют такие трудности в признании того, что они не знают ответа на вопрос, является небольшой, но растущей областью исследования. ‘Уверенный, но неправильный’ ответ может быть особенно вредным в высокоцензурированном и отфильтрованном API-интерфейсе, таком как ChatGPT, поскольку такие модели агрессивно блокируют NSFW или другие ‘правонарушительные’ входные или выходные данные.

Это может дать пользователю ложное впечатление, что модель решительна и кардинальна, когда на самом деле отказ происходит из традиционного эвристического или блоклист-ориентированного фильтра, предназначенного для ограничения юридической ответственности компании-хозяина любой ценой, а не из каких-либо прозрений ИИ.

Из статьи 'AbstentionBench' от FAIR в Meta – слева, фигура подчеркивает диапазон типов неудач, захваченных в AbstentionBench, который тестирует поведение модели на более чем 35 000 невозможных вопросов; в центре, пример показывает, как модели часто реагируют с фабрикованными ответами вместо признания того, что им не хватает информации; и справа, абстенция отзывчивости снижается, когда модели настраиваются для рассуждения, а не для выполнения инструкций. Источник: https://arxiv.org/pdf/2506.09038

Из статьи ‘AbstentionBench’ от FAIR в Meta – слева, фигура подчеркивает диапазон типов неудач, захваченных в AbstentionBench, который тестирует поведение модели на более чем 35 000 невозможных вопросов; в центре, пример показывает, как модели часто реагируют с фабрикованными ответами вместо признания того, что им не хватает информации; и справа, абстенция отзывчивости снижается, когда модели настраиваются для рассуждения, а не для выполнения инструкций. Источник: https://arxiv.org/pdf/2506.09038

Новая статья из Китая утверждает, что модели LLM на самом деле тайно знают, что они не могут ответить на вопрос, заданный пользователем, но что они все равно вынуждены производить какой-то ответ, большинство времени, вместо того, чтобы иметь достаточно уверенности, чтобы решить, что действительный ответ недоступен из-за отсутствия информации от пользователя или ограничений модели.

Статья гласит:

‘[Мы] показываем, что [модели LLM] обладают достаточными когнитивными возможностями, чтобы признать недостатки в этих вопросах. Однако они не демонстрируют надлежащего поведения абстенции, раскрывая несоответствие между их внутренним познанием и внешней реакцией.’

Исследователи разработали легкий двухэтапный подход, который использует когнитивный мониторинг/зондирование для сканирования внутреннего процесса модели LLM на признаки того, что она понимает, что не может дать ответ; и затем вмешивается, чтобы обеспечить, что ‘полезная’ природа модели не усугубляет проблемы пользователя, ведя его по слепому или даже разрушительному пути.

Исследование использует намеренно неопределенные математические вопросы, чтобы проверить, могут ли модели признать, когда ответ невозможен; но этот подход рискует представить задачу как ‘хитрость’. На самом деле модели сталкиваются с гораздо более повседневными причинами для абстенции в разговоре, от неоднозначной формулировки до пробелов в знаниях области.

Новая работа озаглавлена Ответ на невозможный вопрос – это намеренно ошибаться: анализ и смягчение неудач абстенции в больших моделях рассуждения, и исходит от четырех исследователей из Государственного ключевого лаборатории новой программной технологии и Национального института науки о здравоохранении в Университете Нанкина.

Метод

(Поскольку нет подходящих соперников, чтобы противопоставить подходу авторов в тестах, и поскольку статья поэтому следует слегка нестандартному формату, а также не индексирует свои цитаты по обычному стандарту, мы попытаемся придерживаться его как можно лучше.)

В соответствии с предыдущими подходами, авторы сосредоточились на представлении моделей LLM с невозможными математическими вопросами из Синтетического невозможного математического (SUM) набора данных, оценивая пять семей моделей: из DeepSeek диапазона, R1-Distill-Llama-8B; R1-Distill-Qwen-7B, R1-Distill-Qwen-14B; и, из Qwen серии, Qwen3-8B, а также Qwen3-14B.

Невозможные проблемы в SUM были созданы путем удаления или повреждения необходимых элементов пятью способами: удаление ключевой информации; введение двусмысленности; наложение нереалистичных условий; ссылка на не связанные объекты; или удаление вопроса полностью.

Затем был выбран образец из 1 000 таких случаев для анализа, с использованием GPT-4o для генерации кратких объяснений в качестве основы для оценки.

Ответы моделей на невозможные вопросы оценивались с использованием стандартизированных подсказок с бюджетом в 10 000 токенов, в течение которого были наблюдены три основных поведенческих шаблона: в первом случае модель определила вопрос как неразрешимый и воздержалась – обычно реагируя с явным выражением неопределенности; во втором случае она дала полный ответ, изобретая недостающую информацию, такую как введение несуществующего $9,99 за обработку, чтобы оправдать окончательный результат (см. изображение ниже); в третьем случае, называемом когнитивной фиксацией, модель застряла в длительном цикле рассуждений, продолжая недействительные пути решения, даже после неявного признания того, что вопрос не имел жизнеспособного ответа:

Различные результаты ответов на невозможный вопрос.

Различные результаты ответов на невозможный вопрос.

Статья представляет тенденцию, при которой более крупные модели, кажется, чаще воздерживаются от ответа на невозможные вопросы, с уменьшением как фабрикованных ответов, так и фиксационного поведения:

Разбивка ответов моделей на невозможные математические проблемы, показывающая относительную частоту правильных абстенций, фабрикованных ответов и когнитивной фиксации в разных масштабах моделей.

Разбивка ответов моделей на невозможные математические проблемы, показывающая относительную частоту правильных абстенций, фабрикованных ответов и когнитивной фиксации в разных масштабах моделей.

Однако этот сдвиг ограничен по масштабу и оставляет значительную часть случаев неразрешенной правильной абстенцией, что указывает на то, что увеличение емкости само по себе не гарантирует более осторожное поведение.

Осведомленность о тупике

Чтобы проверить, могут ли языковые модели определить, когда вопрос на самом деле не имеет ответа, исследователи прервали рассуждение модели на полпути и попросили либо окончательный ответ, либо объяснение почему вопрос был невозможен.

Для случаев, когда модель продолжала рассуждение бесконечно, они остановили ее на слове ‘жди’, и попросили ответ; для случаев, когда модель быстро фабриковала ответ, они вставили перерыв на границе абзаца.

График слева показывает, как часто модели дают правильные абстенции, когда их прерывают во время рассуждения, с более высокими показателями для случаев фиксации, чем для фабрикованных ответов. График справа показывает, что большинство моделей могут объяснить, почему вопрос невозможен, когда их просят, даже если их окончательные ответы не отражают это понимание.

График слева показывает, как часто модели дают правильные абстенции, когда их прерывают во время рассуждения, с более высокими показателями для случаев фиксации, чем для фабрикованных ответов. График справа показывает, что большинство моделей могут объяснить, почему вопрос невозможен, когда их просят, даже если их окончательные ответы не отражают это понимание.

В многих из этих случаев модель дала правильную абстенцию или ясное объяснение, даже если она ранее произвела ошибочный ответ. Авторы предполагают, что это указывает на то, что модель часто признает проблему во время своего рассуждения, но не действует в соответствии с этим осознанием в своем окончательном выводе.

Чтение мыслей модели LLM

Чтобы проверить, отслеживают ли языковые модели внутренне, может ли вопрос быть ответом, исследователи обучили небольшие классификаторы на скрытых активациях моделей во время рассуждения, что позволило им проверить, различие между ответимыми и невозможными вопросами уже присутствует в внутренних сигналах модели – даже если оно не отражается в ее окончательном выводе.

Развивая идею о том, что высокоуровневые понятия, такие как правдивость или пол, могут быть линейно встроены в активации модели, ‘ответимость’* была протестирована на подобное представление.

Простые линейные классификаторы (зонды) были обучены на скрытых активациях через разные слои модели, используя выводы из механизма многоголового внимания прямо перед резидуальной связью.

Каждый зонд был обучен для различения ответимых и невозможных вопросов на основе внутренних активаций из процесса рассуждения. Входными данными были 2 200 пар вопросов, отобранных из набора данных SUM, с 2 000 использованными для обучения и 200 для валидации.

Во время вывода прогноз модели был усреднен по всем токенам, видимым на тот момент в процессе рассуждения, что позволило зонду отслеживать, как сигналы, связанные с ответимостью, возникали во времени:

Точность классификации линейных зондов, обученных для различения ответимых и невозможных вопросов, измеренная на разных этапах процесса рассуждения. Точность обычно улучшается по мере продвижения рассуждения, с более крупными моделями, достигающими более 85% к конечным этапам.

Точность классификации линейных зондов, обученных для различения ответимых и невозможных вопросов, измеренная на разных этапах процесса рассуждения. Точность обычно улучшается по мере продвижения рассуждения, с более крупными моделями, достигающими более 85% к конечным этапам.

Как показано выше, точность зонда стабильно улучшалась по мере продвижения рассуждения, с большинством моделей, превышающих 80% точности классификации к конечным этапам – что указывает на то, что даже когда внешнее поведение модели не отражает этого, внутренние представления часто несут четкий сигнал, указывающий на то, может ли вопрос быть ответом.

Упрямая настойчивость

Хотя более ранние результаты предполагают, что большие языковые модели часто признают, когда вопрос не может быть ответом, статья отмечает, что они все равно склонны продолжать генерировать ответ вместо того, чтобы выбрать абстенцию.

Чтобы изучить это несоответствие, исследователи проанализировали уверенность моделей в абстенции на конкретных этапах процесса рассуждения, сравнивая уверенность моделей в трех категориях вывода: правильная абстенция; фабрикованный ответ; и когнитивная фиксация.

Были использованы равные по размеру выборки для каждой категории, с определением уверенности как средней максимальной вероятности, присвоенной каждому токену вывода во время декодирования, на основе формулировки из предыдущей работы. Как показано на графике ниже, и фабрикованные ответы, и фиксационные случаи показали более низкую уверенность в абстенции по сравнению с правильной абстенцией:

Уровни уверенности, связанные с производством ответа абстенции 'Я не знаю' в разных типах ответов.

Уровни уверенности, связанные с производством ответа абстенции ‘Я не знаю’ в разных типах ответов.

Исследователи также измерили, как часто модели производили ответ ‘Я не знаю’ во время процесса рассуждения. График ниже указывает, что случаи правильной абстенции привели к более высокой частоте абстенции, в то время как две другие категории производили такие ответы реже:

Частота ответов 'Я не знаю', наблюдаемая на остановках во время рассуждения, показанная для разных типов результатов ответов.

Частота ответов ‘Я не знаю’, наблюдаемая на остановках во время рассуждения, показанная для разных типов результатов ответов.

Эти результаты предполагают, утверждают авторы, что хотя модели могут обнаружить невозможность ответа внутренне, они часто не имеют достаточно уверенности, чтобы действовать в соответствии с этим осознанием, указывая на постоянную тенденцию завершать задачу, а не признавать неопределенность.

Тесты

Развивая эти результаты, исследователи разработали двухэтапный метод, предназначенный для улучшения абстенции. Первый этап, когнитивный мониторинг, отслеживает скрытые состояния модели во время вывода, разделяя процесс рассуждения на естественные единицы, такие как предложения или паузы, отмеченные словами, такими как ‘жди’.

В конце каждого сегмента легкий линейный зонд, обученный на внутренних сигналах, связанных с ответимостью, оценивает вероятность того, что вопрос не может быть ответом. Если эта вероятность превышает заданный порог, процесс переходит ко второму этапу: вмешательству во время вывода, которое направляет модель на абстенцию, а не на фабрикацию ответа.

Когда модель показывает внутренние признаки того, что вопрос не может быть ответом, рассуждение прерывается вмешательством, которое подкрепляет это осознание и увеличивает вероятность абстенции. Как показано ниже, вмешательство представляет собой ‘руководящую подсказку’, которая напоминает модели, что вопрос может не иметь действительного ответа:

Подсказка для условного вмешательства во время вывода.

Подсказка для условного вмешательства во время вывода.

Метод также включает механизм раннего выхода, который предотвращает продолжение последовательности рассуждения ненужно, побуждая модель рассматривать абстенцию как законный и иногда предпочтительный выбор.

Для фазы тестирования исследователи использовали два набора данных: Невозможная математическая задача слова (UMWP) и вышеупомянутый SUM.

Тестовый набор SUM был использован для этой цели, содержащий 284 невозможных и 284 ответимых вручную проверенных вопросов. UMWP был построен из четырех источников математических задач слов: SVAMP; MultiArith; Grade School Math (GSM8K); и ASDiv.

Полный набор данных состоял из 5 200 задач, с 600 отобранными для тестирования, разделенными поровну между невозможными и ответимыми вопросами. Для невозможных элементов в UMWP GPT-4o сгенерировал основные объяснения того, почему они не могут быть решены.

Метрики

Производительность модели оценивалась с использованием четырех метрик: коэффициент абстенции, доля невозможных вопросов, где модель правильно воздерживается, отвечая ‘Я не знаю’, как указано; точность рассуждения, процент невозможных вопросов, где модель дает действительное объяснение того, почему вопрос не может быть решен; использование токенов, подробная информация о количестве токенов, сгенерированных во время рассуждения; и точность ответа, доля ответимых вопросов, где модель производит правильное окончательное решение.

Тестовые базовые показатели

Поскольку не существует стандартных базовых показателей для этой проблемы, исследователи сравнили свой метод с двумя альтернативами, Dynasor-CoT и Динамический ранний выход в моделях рассуждения (DEER), исходя из предположения, что правильная абстенция должна рассматриваться как правильный ответ, когда вопрос не имеет решения.

Dynasor-CoT побуждает модели производить промежуточные ответы и останавливается, когда один и тот же результат появляется три раза подряд, в то время как DEER контролирует уверенность на уровне предложения и останавливает рассуждение, когда порог достигается.

Третий базовый показатель, называемый Ванильным, относится к не измененным выводам модели. Тесты использовали вышеупомянутые пять вариантов Qwen и DeepSeek.

Агрегированные результаты показаны ниже:

Сравнение разных методов на ответимых и невозможных вопросах в больших моделях рассуждения, с наивысшими значениями в каждом столбце, показанными в жирном шрифте.

Сравнение разных методов на ответимых и невозможных вопросах в больших моделях рассуждения, с наивысшими значениями в каждом столбце, показанными в жирном шрифте. Пожалуйста, обратитесь к исходной статье для лучшего разрешения.

Новый подход произвел наивысшие показатели абстенции и точного рассуждения на невозможных вопросах. Для ответимых вопросов точность оставалась близкой к той, что была у ванильных моделей, и иногда улучшалась, что указывает на то, что нормальное решение проблем не пострадало.

Использование токенов также снизилось на 30% до 50% на невозможных случаях и слегка уменьшилось на ответимых, что указывает на большую эффективность.

Была также обнаружена связь между коэффициентом абстенции и точностью рассуждения, поскольку модели, которые чаще воздерживались, также давали лучшие объяснения, что авторы интерпретируют как указание на улучшение качества рассуждения.

Модели Qwen в целом превосходили дистиллированные (квантованные) версии, в то время как более крупные модели показали более сильную способность к абстенции, что указывает на то, что и архитектура, и масштаб имеют значение для надежного обнаружения невозможности ответа.

Наконец, авторы сообщают, что их новый метод снижает фабрикацию и фиксацию, повышая уровень правильных абстенций, в то время как базовые подходы, которые полагаются только на ‘ранние выходы’, иногда приводят к большему количеству фабрикованных ответов.

Они также сообщают о приросте как уверенности, так и частоты ответов ‘Я не знаю’, с мониторингом на основе скрытых сигналов, доказывающим свою эффективность больше, чем стратегии, которые полагаются на поведенческие сигналы.

Вывод

Неспособность моделей LLM воздерживаться от ответа на запрос, когда это необходимо, является одним из самых больших моментов трения в пользовательском опыте генеративного ИИ, не в последнюю очередь потому, что другие причуды интерфейса создают у пользователя иллюзию, что ИИ способен к осторожным ответам, когда – по крайней мере на данный момент – он обычно не таков.

Одна из проблем о любом прямом виде вмешательства, которое не вытекает напрямую из ‘характера’ модели, заключается в том, что оно может быть пере- или недоиспользовано, в зависимости от того, актуальны ли обнаруженные активации для модели, признающей поражение.

Дальше, логистический расход линейного зонда для мониторинга, скорее всего, не будет незначительным, и возможно, что более простые эвристические методы, подобные тем, которые ограничивают доступ к запрещенному контенту для пользователей, могут быть более дешевым решением, если якорные триггеры могут когда-либо быть адекватно определены.

 

* Естественно, это не соответствует apparent синониму ‘ответственность’, а скорее определяет, может ли конкретный вопрос быть ответом вообще.

Опубликовано в среду, 27 августа 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]