Взгляд Anderson
Доказано, что цепочка рассуждений в крупных языковых моделях является «декоративной»

Новые исследования предлагают простой способ определить, что отполированные пошаговые объяснения всех текущих ведущих моделей языка ИИ – включая ChatGPT и Claude – являются всего лишь «декоративными» и, как правило, придумываются после того, как ИИ принял решение о ответе.
В прошлом году серия высокопрофильных исследований компаний, ориентированных на ИИ, включая Anthropic и Apple, указала на то, что так называемые «модели рассуждений» часто производят пошаговые объяснения, которые не отражают того, что на самом деле повлияло на их ответы.
По различным причинам, дискуссия вскоре превратилась в спорные опровержения и различные интерпретации (включая на этом сайте), оставив без ответа вопрос о том, является ли цепочка рассуждений (CoT) всего лишь косметической фриволностью, предназначенной для успокоения конечных пользователей, или доказательством истинного процесса рассуждения.

ChatGPT ‘показывает свою работу’ – но принял ли он решение о ответе?
Показать и рассказать
Теперь интересная новая статья из Индии предлагает дешевый и легко воспроизводимый метод для оценки того, действительно ли впечатляющие «анимации вывода» в интерфейсах ChatGPT и других крупных моделей языка (LLM) указывают на то, что ИИ работает через шаги к выводу.
Новые исследования проводились двумя исследователями из Индийского института информационных технологий Аллахабада (IIITA) в Аллахабаде и Национального института электроники и информационных технологий (NIELIT) в Дели.
Авторы обнаружили, что почти во всех случаях, на значительной части проприетарных и открытых моделей LLM, цепочка рассуждений, представленная пользователям, является «декоративной», изобретенной после того, как ИИ принял решение об ответе, который он будет представлять.
Тестирование моделей, таких как ChatGPT5.4, Claude Opus 4.6-R и DeepSeek-V3.2, авторы обнаружили, что удаление любого шага из 10-15 шагов CoT фактически изменило ответ менее 17% времени, и что любой отдельный шаг был достаточен для восстановления правильного ответа.
Авторы заявляют*:
‘Регуляторные рамки для ИИ в здравоохранении, финансах и праве все чаще требуют “объяснимых” [систем]. Наши результаты предполагают, что стандартный подход – просить модель показать свою работу – создает иллюзию прозрачности.
‘Объяснения являются плавными, уместными для области и неправильными в тонком смысле: они описывают рассуждения, которые модель не выполнила.
‘Медицинский ИИ, который пишет “эозинофилия предполагает эмболию”, не обязательно рассматривал эозинофилию. Он может иметь закономерность совпадения от вопроса к ответу и фабриковать рассуждения позже.
‘В соответствии с законом ЕС об ИИ (статья 13) система ИИ с высоким риском должна предоставлять “осмысленную информацию о логике, задействованной”. Наши результаты предполагают, что объяснения цепочки рассуждений от большинства передовых моделей не соответствуют этому стандарту – “логика, задействованная” в получении ответа, не является логикой, описанной в объяснении.’
Авторы наблюдают, что две из меньших моделей, протестированных ими, нарушили общую закономерность двусмысленности, но только в очень конкретных обстоятельствах: MiniMax-M25 продемонстрировал настоящую зависимость от шагов при работе с анализом настроений, а Kimi-K25 показал настоящую потребность в 39% обработки CoT – но только при работе с классификацией тем.
Во всех остальных случаях, как и в случае с более крупными и известными моделями, шаги рассуждения, продемонстрированные ими, казались полностью декоративными, а модели использовали обходные пути.
Меньшие модели стараются больше
Помимо десяти моделей API, протестированных авторами, они также протестировали ряд меньших открытых моделей†, варьирующихся от 0,8 до 8 миллиардов параметров (что довольно скромно), и обнаружили, что эти меньшие ИИ действительно рассуждают, и что цепочка рассуждений, которую они показывают, обычно – хотя и не всегда – необходима для получения полезных и точных выводов.
Меньшие модели продемонстрировали потребность в 55% шаговым рассуждением, в отличие от средней потребности в 11% у более крупных моделей, которые, по утверждению авторов, ‘научились полностью обходить многоступенчатое рассуждение, приходя к правильным ответам через внутренние обходные пути, которые их письменные рассуждения не отражают’.
Авторы полагают, что чем лучше модель выполняет задачу, тем меньше она требует шагов рассуждения (хотя это более дипломатический взгляд на концепцию отказа от рационального анализа в пользу того ответа, который был сильнее в распределении обучающих данных)††:
‘Маленькие модели честно рассуждают на математике, потому что должны—они не имеют параметрических знаний, чтобы обойти.
‘Передовые модели внутренне усвоили достаточно математических закономерностей, чтобы явная цепочка рассуждений стала излишней. Цепочка рассуждений все еще повышает точность (структурируя генерацию), но отдельные шаги больше не содержат уникальную информацию.’
Метод
Метод, используемый для тестирования моделей, основан на трех критериях:
Необходимость удаляет каждый шаг CoT в свою очередь и затем проверяет, изменился ли ответ. Любой шаг, удаление которого изменяет ответ, считается «необходимым»; Достаточность изолирует каждый шаг и проверяет, может ли он один восстановить ответ, и любой такой шаг считается достаточным; и Чувствительность к порядку перемешивает шаги и наблюдает, изменился ли ответ (поскольку настоящее рассуждение должно зависеть от последовательности, а не от ключевых слов).
В совокупности высокая необходимость и низкая достаточность указывают на настоящее пошаговое рассуждение, в то время как низкая необходимость и высокая достаточность указывают на объяснения, которые можно удалить, переставить или сократить без влияния на результат.
Авторы отмечают, что этот метод исключает любую необходимость в доступе к белому ящику модели, поскольку он может быть выполнен всего за несколько долларов на закрытых моделях API, таких как ChatGPT и Claude, и, конечно же, так же успешно на открытых моделях, которые можно установить локально.
Они также отмечают, что предыдущие исследования либо использовали открытые модели, которые позволяли внутренний анализ, либо использовали более простые бинарные ответы «да/нет», которые раскрывают гораздо меньше внутренних рассуждений модели API.
Минимальные затраты
Авторы определяют настоящее рассуждение через необходимость и достаточность, с высокой необходимостью и низкой достаточностью, указывающими на то, что каждый шаг имеет уникальный вес. Напротив, декоративное рассуждение показывает низкую необходимость и высокую достаточность, что означает, что шаги можно удалить или использовать отдельно без изменения ответа.
Необходимость сама по себе, по их словам, может скрыть это, поскольку могут существовать несколько действительных путей. Поэтому достаточность используется для проверки того, может ли отдельный шаг уже закодировать результат, и чувствительность к порядку проверяет, зависит ли модель от последовательности, а не от поверхностных сигналов.
Подход основан на рамке Intervention-Consistent Explanation (ICE), требует только текстовый вход и выход API, и для шестишаговой цепочки включает 15 оценок, стоимостью около 1-2 долларов за модель.
Рамка ICE классифицирует поведение модели по необходимости и достаточности на три закономерности: Декоративная показывает низкую необходимость и высокую достаточность, что означает, что шаги излишни, и ответ будет достигнут в любом случае. Это доминирует в большинстве моделей и задач; Настоящая показывает высокую необходимость и высокую достаточность, что означает, что каждый шаг имеет реальный сигнал (и, как упоминалось ранее, это появляется в MiniMax-M2.5 на анализе настроений); и Зависимая от контекста показывает высокую необходимость и низкую достаточность, что означает, что шаги работают только вместе в последовательности (что появляется в Kimi-K2.5 и MiniMax на классификации тем, и в небольших моделях при работе с математикой).
Тесты
Десять в основном моделей API, протестированных с помощью пересмотренного подхода ICE, были ChatGPT-5.4; Claude Opus 4.6-R; DeepSeek-V3.2; GPT-OSS-120B; Kimi-K2.5; Qwen3.5-397B; Qwen3.5-122B; MiniMax-M2.5; GLM-5; и Nemotron-Ultra (253 миллиарда параметров).
Каждая модель была протестирована на четырех задачах: классификации настроений (с использованием (SST-2); математические задачи с словами (с использованием GSM8K); классификация тем (с использованием AG News); и медицинские вопросы-ответы (с использованием (MedQA). Первоначальные тесты проводились на настроениях и математике:

Тесты для десяти ведущих моделей языка, оценивающие, как они обрабатывают пошаговое рассуждение. ‘Необходимость’ отслеживает, изменяется ли ответ при удалении шага; ‘достаточность’ проверяет, может ли один шаг восстановить ответ; и ‘перемешивание’ проверяет, имеет ли значение порядок. Большинство моделей дает убедительные, но не имеющие значения объяснения на SST-2 и GSM8K, в то время как MiniMax-M2.5 больше полагается на свои шаги для настроений. Обе MiniMax-M2.5 и Kimi-K2.5 демонстрируют настоящее пошаговое рассуждение на AG News. Source
Авторы заявляют:
‘Большинство моделей демонстрируют то, что мы называем “декоративным рассуждением” (Lucky Steps в таксономии ICE) – закономерность, при которой необходимость шага ниже 17% и достаточность шага превышает 60% как на настроениях, так и на математике.
‘В простых словах: вы можете удалить любой шаг рассуждения, и ответ почти никогда не изменится, но любой отдельный шаг один может восстановить ответ.’
На тесте SST-2 по классификации настроений GPT-5.4 почти никогда не полагался на свое письменное рассуждение, поскольку удаление шага изменило ответ всего в 0,1% случаев из 500, что указывает на то, что объяснение было добавлено после того, как решение было уже принято.
Claude Opus 4.6-R полагался на свои шаги немного больше, на 14,8%, но 91% его шагов один могли все еще произвести ответ; поэтому его более длинные объяснения были более подробными, но все еще в основном «украшенными».
Затем исследователи добавили другие области и протестировали снова:

Шаговая верность и точность в четырех областях: SST-2; GSM8K; AG News; и MedQA. Большинство пар моделей и задач остаются декоративными, несмотря на высокую точность, с ограниченными исключениями: MiniMax-M2.5 и Kimi-K2.5 демонстрируют контекстно-зависимое или действительно пошаговое рассуждение на AG News, в то время как общая производительность подтверждает, что низкая верность не объясняется случайными предположениями.
Авторы наблюдают:
‘Результаты в четырех областях подтверждают центральный вывод: декоративное рассуждение является универсальным во всех областях для моделей, использующих обходные пути. Claude Opus показывает 1,7% необходимости на MedQA (486 примеров, 93,4% точности) – модель пишет подробные медицинские цепочки рассуждений в среднем 5,8 шагов, но удаление любого шага почти никогда не меняет диагноз.’
AG News показал самые большие различия между моделями, с Kimi-K2.5 и MiniMax-M2.5, которые действительно полагались на свое пошаговое рассуждение, и большинством других систем, производящих объяснения, которые не оказывали существенного влияния на окончательный ответ.
DeepSeek-V3.2, протестированный на всех четырех задачах, оставался декоративным на протяжении всего процесса; несмотря на написание самых длинных объяснений, его ответы редко зависели от шагов.
Жесткость вывода
Тесты указали на четвертое явление, которое авторы назвали жесткостью вывода: некоторые модели просто не склонны выводить процессы рассуждения, в зависимости также от темы и, возможно, от других обстоятельств. Ниже мы видим рассуждения от Claude Opus при ответе на вопрос о медицинском состоянии 61-летнего мужчины; и ниже, что вывела GPT-OSS-120B:

Многословность vs. сдержанность.
Авторы отмечают, что жесткость вывода зависит от задачи:

По задачам модели сильно различаются в том, как часто они выбирают ‘показать свою работу’. Claude и DeepSeek производят многошаговые объяснения почти каждый раз, независимо от области, в отличие от Qwen3.5-397B, который редко когда-либо это делает. Другие меняют свое поведение в зависимости от задачи, с некоторыми, производящими подробные логические цепочки для классификации, но гораздо меньше для медицинских вопросов.
Они наблюдают:
‘Модели, которые наиболее вероятно обойдут рассуждение внутренне, также являются теми, которые наиболее вероятно опустят рассуждение внешне. GPT-OSS-120B производит многошаговые рассуждения для 99% вопросов настроений и 100% вопросов классификации тем – но только 38% медицинских вопросов. На 62% медицинских запросов она выводит только букву ответа.’
Закономерность не кажется случайной: GPT-OSS-120B производит многошаговые объяснения для почти всех вопросов настроений и классификации тем, но переключает на ответ в одну букву на большинстве медицинских вопросов (где она обычно не предоставляет никаких видимых рассуждений).
Авторы гипотезируют, что поскольку тесты на уровне шага требуют написанных цепочек для анализа, модель, которая отвечает в одном токене, не может быть оценена этими методами; отсутствие внешних рассуждений поэтому блокирует прямую оценку.
Статья заключает, что модели, отобранные для высокорискованных приложений, должны быть протестированы на верность, а также на точность, и предполагают, что модель, которая на 2% менее точна, но которая действительно рассуждает, может быть предпочтительнее – не в последнюю очередь потому, что она удовлетворяет регулирующим требованиям ЕС и других в отношении объяснимого ИИ. На данный момент, основываясь на доказательствах, найденных в исследовании, почти все LLM, способные к CoT, «обманывают» почти все время
Вывод
Это интересная статья, которая предоставляет более обширное тестирование и обсуждение на эту тему, чем мы можем осветить здесь, и я рекомендую читателю обратиться к исходному материалу.
Центральное сообщение, продолжающееся от прошлогодних противоречий, заключается в том, что платформы ИИ с высокими ставками могли быть готовы отклониться от стандартов, которые их модели еще не могут удовлетворять.
Более того, разрыв между масштабом и возможностями открытых и закрытых моделей, таких как ChatGPT, настолько велик, что обычно нельзя разумно сделать вывод о закрытых моделях из открытых установок, что еще больше увеличивает непрозрачность этих процессов и стандартов.
Однако редко, когда появляется真正я белая коробка методологии тестирования, которая может охватить как открытые, так и закрытые модели; но真正е средства от «дешевых трюков» этого типа, вероятно, будут происходить только тогда, когда мощные органы, такие как ЕС, будут угрожать дном линии крупных порталов ИИ.
*Мое преобразование внутренних цитат авторов в гиперссылки.
† Статья не раскрывает сплоченный список этих меньших моделей и включает дополнительные варианты одной модели, что делает определение окончательного списка вопросом вывода.
†† Акценты авторов.
Опубликовано впервые в среду, 25 марта 2026 года












