Модели и платформы ИИ
Когда метрики ИИ учат модели лгать

Галлюцинация ИИ — когда система производит ответы, которые звучат правильно, но на самом деле неверны, — остается одной из самых сложных проблем в области искусственного интеллекта. Даже самые современные модели, такие как DeepSeek-V3, Llama и последние релизы OpenAI, все еще производят неверную информацию с высокой уверенностью. В таких областях, как здравоохранение или право, такие ошибки могут привести к серьезным последствиям.
Традиционно галлюцинации рассматривались как побочный продукт того, как обучаются большие языковые модели: они учатся предсказывать следующее наиболее вероятное слово без проверки того, является ли информация истинной. Но новые исследования показывают, что проблема может не ограничиваться только обучением. Метрики, используемые для тестирования и сравнения производительности ИИ, могут фактически укреплять вводящее в заблуждение поведение, вознаграждая ответы, которые звучат убедительно, а не те, которые верны.
Эта смена перспективы переформулирует проблему. Если модели обучаются удовлетворять тест, а не говорить правду, то галлюцинации не являются случайными ошибками, а выученными стратегиями. Чтобы понять, почему это происходит, нам нужно посмотреть, почему модели ИИ выбирают угадывать, а не признавать свое незнание.
Почему модели ИИ угадывают
Чтобы понять, почему модели ИИ часто угадывают вместо того, чтобы признать, что они не знают, рассмотрим студента, который сталкивается с трудным экзаменационным вопросом. У студента есть два варианта: оставить ответ пустым и получить ноль баллов или сделать обоснованное предположение, которое может принести некоторые баллы. Рационально, угадывание кажется лучшим выбором, поскольку есть хотя бы шанс быть правым.
Модели ИИ сталкиваются с аналогичной ситуацией во время оценки. Большинство метрик используют бинарную систему оценки: правильные ответы получают баллы, а неправильные или неуверенные ответы получают ноль. Если модель спрашивают: “Какой день рождения исследователя?” и она действительно не знает, ответ “Я не знаю” считается провалом. Изобретение даты, однако, несет в себе некоторый шанс быть правильным — и даже если это неправильно, система не наказывает уверенное предположение больше, чем молчание.
Эта динамика объясняет, почему галлюцинации сохраняются, несмотря на обширные исследования по их устранению. Модели не ведут себя неправильно; они следуют стимулам, встроенным в оценку. Они учатся, что звучание уверенно является лучшим способом максимизировать свой балл, даже когда ответ неверен. В результате вместо выражения неуверенности модели толкаются к тому, чтобы давать авторитетные заявления — правильные или неправильные.
Математическая основа нечестности ИИ
Исследования показывают, что галлюцинации возникают из математических основ того, как языковые модели учатся. Даже если модель была обучена только на идеально точной информации, ее статистические цели все равно приведут к ошибкам. Это связано с тем, что генерация правильного ответа фундаментально сложнее, чем распознавание того, является ли ответ действительным.
Это помогает объяснить, почему модели часто терпят неудачу на фактах, которые не имеют четких закономерностей, таких как дни рождения или другие уникальные детали. Математический анализ показывает, что частота галлюцинаций в этих случаях будет не менее той, что составляет доля фактов, которые появляются только один раз в обучающих данных. Другими словами, чем реже информация в данных, тем больше модель будет бороться с ней.
Проблема не ограничивается редкими фактами. Структурные ограничения, такие как ограниченная емкость модели или архитектурный дизайн, также производят систематические ошибки. Например, ранние модели с очень короткими окнами контекста последовательно терпели неудачу в задачах, требующих длинноходового рассуждения. Эти ошибки не были случайными глюками, а предсказуемыми результатами математической основы модели.
Почему пост-обучение не решает проблему
После того, как модель ИИ обучена на огромных текстовых наборах данных, она обычно проходит тонкую настройку, чтобы сделать ее вывод более полезным и менее вредным. Однако этот процесс сталкивается с той же основной проблемой, которая вызывает галлюцинации в первую очередь; способом, которым мы оцениваем модели.
Наиболее распространенные методы тонкой настройки, такие как усиление обучения с помощью обратной связи человека, все еще полагаются на метрики, которые используют бинарную оценку. Эти метрики вознаграждают модели за уверенные ответы, не давая баллов, когда модель признает, что она не знает. В результате система, которая всегда отвечает с уверенностью, даже когда она неверна, может превзойти ту, которая честно выражает неуверенность.
Исследователи называют это проблемой наказания неуверенности. Даже передовые методы обнаружения или снижения галлюцинаций борются, когда основные метрики продолжают отдавать предпочтение чрезмерной уверенности. Другими словами, независимо от того, насколько сложны исправления, пока системы оценки вознаграждают уверенные предположения, модели будут смещаться в сторону неправильных, но уверенных ответов, а не честных признаний сомнений.
Иллюзия прогресса
Таблицы лидеров, широко распространенные в сообществе ИИ, усиливают эту проблему. Метрики, такие как MMLU, GPQA и SWE-bench, доминируют в исследовательских работах и объявлениях о продуктах. Компании подчеркивают свои результаты, чтобы показать быстрый прогресс. Однако, как отмечается в отчете, эти же метрики поощряют галлюцинации.
Модель, которая честно говорит “Я не знаю”, может быть безопаснее в реальных условиях, но она будет занимать более низкое место в таблице лидеров. Напротив, модель, которая фабрикует убедительные, но ложные ответы, будет набирать больше очков. Когда принятие, финансирование и престиж зависят от рейтингов таблицы лидеров, направление прогресса становится искаженным. Общественность видит нарратив постоянного улучшения, но под поверхностью модели обучаются обманывать.
Почему честная неуверенность имеет значение в ИИ
Галлюцинации не являются только исследовательской задачей; они имеют реальные последствия. В здравоохранении модель, которая фабрикует взаимодействие препаратов, может ввести в заблуждение врачей. В образовании модель, которая изобретает исторические факты, может дезинформировать студентов. В журналистике чат-бот, который производит ложные, но убедительные цитаты, может распространять дезинформацию. Эти риски уже видны. Индекс ИИ Стэнфорда 2025 сообщил, что метрики, предназначенные для измерения галлюцинаций, “боролись за то, чтобы получить признание”, даже когда принятие ИИ ускоряется. Тем временем метрики, которые доминируют в таблицах лидеров и которые вознаграждают уверенные, но ненадежные ответы, продолжают задавать направление прогресса.
Эти выводы подчеркивают как проблему, так и возможность. Анализируя математические корни галлюцинаций, исследователи определили четкие направления для построения более надежных систем ИИ. Ключом является то, чтобы перестать рассматривать неуверенность как ошибку и вместо этого признать ее важной возможностью, которая должна быть измерена и вознаграждена.
Эта смена перспективы имеет последствия, выходящие за рамки снижения галлюцинаций. Системы ИИ, которые могут точно оценить и передать свои собственные ограничения знаний, будут более подходящими для высокорисковых приложений, где чрезмерная уверенность несет серьезные риски. Медицинская диагностика, юридический анализ и научные исследования все требуют способности различать уверенные знания и обоснованные предположения.
Переоценка оценки для честного ИИ
Эти выводы подчеркивают, что построение более достоверных систем ИИ требует переоценки того, как мы измеряем способности ИИ. Вместо того, чтобы полагаться на простую систему оценки “правильно или неправильно”,框ки оценки должны вознаграждать модели за выражение неуверенности соответствующим образом. Это означает предоставление четких рекомендаций по порогам уверенности и соответствующим схемам оценки в инструкциях по метрикам.
Одним из перспективных подходов является создание явных целей уверенности, которые указывают, когда модели должны отвечать, а когда они должны воздержаться. Например, инструкции могут гласить, что ответы должны предоставляться только тогда, когда уверенность превышает определенный порог, с соответствующей корректировкой оценки. В этом случае неуверенность больше не является слабостью, а ценной частью ответственного поведения.
Ключом является то, чтобы сделать требования к уверенности прозрачными, а не неявными. Текущие метрики создают скрытые штрафы за неуверенность, которых модели учатся избегать. Явные цели уверенности позволят моделям оптимизировать фактически желаемое поведение: точные ответы, когда уверенность высока, и честные признания неуверенности, когда знания отсутствуют.
Итог
Галлюцинации ИИ не являются случайными ошибками — они укрепляются метриками, используемыми для измерения прогресса. Вознаграждая уверенные предположения над честной неуверенностью, текущие системы оценки толкают модели к обману, а не к надежности. Если мы хотим, чтобы ИИ был достоверным в высокорисковых областях, таких как здравоохранение, право и наука, нам нужно переоценить, как мы тестируем и вознаграждаем их. Прогресс должен измеряться не только точностью, но и способностью распознавать и признавать, чего модель не знает.












