Взгляд Anderson
‘Зен’ Метод для предотвращения зрелищ языковых моделей

Сказать ChatGPT проверить случайный ответ перед решением реальной проблемы заставляет его думать усерднее и получать правильный ответ чаще – даже если предыдущий «случайный» ответ не имеет отношения к вашему реальному запросу.
Интересная новая статья из Китая разработала очень низкозатратный метод для предотвращения зрелищ языковых моделей, таких как ChatGPT, и для улучшения качества ответов: заставить модель проверить ответ на полностью не связанный вопрос сначала:

Пример не связанного вопроса, который может «освободить разум» языковой модели и помочь ей сосредоточиться на реальном последующем запросе. Источник
Этот «зен-удар» является невероятно дешевым способом улучшения производительности по сравнению с другими более сложными методами, такими как тонкая настройка, создание подсказок и параллельное выборочное тестирование, и он работает на открытых и закрытых моделях, указывая на открытие фундаментальной характеристики, общей для нескольких архитектур языковых моделей (а не хрупкой особенности, специфичной для определенных материалов или методов обучения).
Авторы описывают экономию масштаба, возможную за счет улучшения выходных данных в этом спартанском виде*:
‘Чтобы реализовать с минимальными дополнительными знаниями, VF только нужно предоставить случайный/тривиальный ответ в подсказке. Процесс верификации оказывается с меньшим количеством выходных токенов, чем обычный путь CoT, [иногда] даже без явного процесса верификации, поэтому [требуется] очень [мало] дополнительной вычислительной мощности.’
В тестах этот подход – называемый Verification-First (VF) – смог улучшить ответы в различных задачах, включая математическое рассуждение, на открытых и коммерческих платформах.
Одна из причин, почему этот метод работает, может быть связана с тем, как языковые модели впитывают и присваивают себе тенденции человеческой психологии, так что прямой вопрос может сделать модель «защищающейся» и «нервной», тогда как запрос на верификацию чужой работы не запускает эти «инстинкты выживания».
Основная идея заключается в том, что верификация ответа требует меньше усилий, чем генерация ответа с нуля, и может запустить другой путь рассуждения, который дополняет стандартный путь рассуждения.
Подсказка модели критиковать заданный ответ (т.е. ответ, который модель не создавала) также может активировать критическое мышление, которое помогает избежать чрезмерной уверенности в собственных первых впечатлениях модели.
Работа характеризует процесс в терминах обратного пути рассуждения:

Начиная с предложенного ответа и рассуждая в обратном направлении к вопросу, можно обнаружить сокращения или идеи, которые труднее найти, когда рассуждение идет вперед от проблемы.
Исследователи также конкретизировали центральную концепцию в Iter-VF, последовательный метод масштабирования во времени, который итеративно уточняет ответы, избегая проблемы накопления ошибок, характерной для стратегий самоисправления, часто встречающихся в архитектурах языковых моделей.
Новая работа называется Просьба к языковым моделям проверить сначала почти бесплатный обед и исходит от двух исследователей из кафедры электронной инженерии Университета Цинхуа в Пекине.
Метод
Центральная идея новой работы заключается в том, чтобы изменить обычный поток рассуждения в языковых моделях. Вместо того, чтобы просить модель решить проблему с нуля, ей сначала предлагается кандидат на ответ (часто неправильный или произвольный) и просится проверить, имеет ли этот ответ смысл.
Это подсказывает модели рассуждать в обратном направлении, работая в обратном направлении от предложенного ответа к вопросу. Как только верификация завершена, модель затем приступает к решению исходной проблемы, как обычно.
Это изменение, как утверждает статья, уменьшает бездумные ошибки и поощряет более вдумчивый режим рассуждения, помогающий языковой модели обнаружить скрытую структуру и избежать вводящих в заблуждение предположений.
Как видно из примеров ниже, даже подсказка модели проверить явно неправильную догадку, такую как ’10’ , может помочь ей восстановиться от ошибочного рассуждения и превзойти стандартный путь рассуждения:

Подсказка модели проверить ответ сначала помогает ей обнаружить несоответствия и более тщательно взаимодействовать с проблемой.
В отношении многих реальных проблем не легко предоставить догадку для модели, чтобы проверить, особенно когда задача открыта, такая как написание кода или вызов API. Поэтому, чтобы лучше адаптироваться, метод сначала дает свой лучший ответ, как обычно, и затем подает этот ответ обратно в формат Verification-First. Таким образом, модель проверяет и улучшает свой собственный выход:

Когда модель просится проверить свой предыдущий ответ, она обнаруживает ошибку в своем рассуждении и переписывает решение правильно.
Этот подход составляет вышеупомянутый Iter-VF. Модель повторяет этот цикл, уточняя свой ответ каждый раз, без необходимости переобучения или специального инструментария. В отличие от других стратегий самоисправления, которые могут накапливать контекст на протяжении итераций, Iter-VF учитывает только наиболее недавний ответ на каждом шаге. Этот марковский подход избегает компаундирующей путаницы,extendированных цепей рассуждения – слабости, особенно вредной для самоисправления.
Данные и тесты
Авторы оценивают метод в четырех областях: общих задачах рассуждения, где VF запускается с тривиальной догадкой; задачах, чувствительных к времени, где Iter-VF сравнивается с соперничающими методами масштабирования; открытых проблемах, таких как кодирование и вызовы API, где VF использует собственный предыдущий ответ модели; и закрытых коммерческих языковых моделях, где внутренние шаги рассуждения недоступны.
Для тестирования метода исследователи использовали три бенчмарка рассуждений: GSM8K и MATH500 для математических задач; и GPQA-Diamond для вопросов научного уровня.
В каждом случае модели была дана либо тривиальная догадка, такая как ‘1’ для числовых ответов; либо случайно перемешанный вариант multiple-choice, как стартовая точка для верификации. Не было добавлено никакого специального настройки или предварительных знаний, и базовая линия для сравнения была стандартной нулевой подсказкой пути рассуждения.
Тесты прошли через полный диапазон Qwen2.5 и Llama3 моделей, обученных на инструкциях, от 1B до 72B (параметров) в размере. Модели Qwen, использованные в работе, были Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct и Qwen2.5-72B-Instruct. Варианты Llama3 были Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct и Llama3.3-70B-Instruct.
Как показано ниже, улучшение от подсказки Verification-First сохранилось на всех масштабах моделей, с четкими выигрышами, видимыми даже при 1B параметрах и продолжающимися до 72B:

На всех размерах моделей Qwen2.5 и Llama3 подсказка Verification-First последовательно превосходила стандартную подсказку пути рассуждения на GSM8K, MATH500 и GPQA-Diamond.
Эффект оказался сильнейшим на вычислительно-тяжелых математических бенчмарках, таких как GSM8K и MATH500, где верификация неправильного ответа запускала лучшее рассуждение, чем попытка решить с нуля. На GPQA-Diamond, который зависит больше от хранимых знаний, чем от дедуктивной структуры, преимущество было меньшим, но последовательным.
Вычислительная стоимость Verification-First была скромной: в таблице ниже мы можем увидеть, что генерация шага верификации добавила около 20-50% больше выходных токенов по сравнению со стандартной подсказкой пути рассуждения:

Среднее количество выходных токенов, сгенерированных под каждой методом подсказки, на бенчмарках GSM8K, MATH500 и GPQA.
Несмотря на это, дополнительная стоимость оставалась намного ниже, чем у стратегий, требующих нескольких выборочных завершений или рекурсивного планирования.
На графике ниже мы можем увидеть, насколько чувствителен метод к качеству догадки. Удивительно, что даже когда догадка тривиальна (‘1’), невероятна (‘2025’) или случайный вариант multiple-choice, Verification-First все равно превосходит стандартную подсказку:

Выигрыши в точности от подсказки Verification-First, когда модели даны тривиальные, невероятные или правильные ответы для верификации на GSM8K, MATH500 и GPQA.
Как ожидается, точность прыгает еще выше, когда догадка оказывается правильным ответом; но метод работает хорошо в любом случае, что предполагает, что выигрыши не обусловлены информацией в догадке, а просто актом верификации.
Iter-VF также сравнивал с четырьмя стратегиями масштабирования во время тестирования, которые работают без переобучения или адаптации к задаче. В Самоисправлении модель была подсказана пересмотреть свои ответы, отражая на предыдущих шагах рассуждения; в PHP предыдущие ответы были добавлены к входным данным как контекстные подсказки, хотя не было дано никаких инструкций, как их использовать.
Кроме того, в Самоисправлении были отобраны несколько путей рассуждения и окончательный ответ был выбран большинством голосов; и, наконец, в Best-of-N были сгенерированы несколько выходов независимо и ранжированы с помощью верифицирующей подсказки, и был выбран ответ с наивысшим баллом.
Две версии Iter-VF были реализованы: одна, инициализированная тривиальной догадкой (‘1’), и другая, запущенная стандартным выходом CoT:

Точность и эффективность токенов на MATH500 при увеличивающихся бюджетах выхода, показывающие, что обе версии Iter-VF превосходят все базовые линии на всех масштабах моделей.
Iter-VF дал лучшие результаты, чем все другие методы, когда доступная вычислительная мощность была низкой, что авторы объяснили тем, как он проверяет ответы, а не тем, насколько хороши были первоначальные ответы (поскольку обе версии VF и CoT быстро достигли схожей точности).
PHP показал худшие результаты, даже хотя он повторно использовал предыдущие ответы как подсказки, вероятно, потому что языковые модели не использовали эти подсказки хорошо.
В отличие от PHP и Самоисправления, которые накапливают контекст на протяжении итераций, Iter-VF учитывает только наиболее недавний ответ на каждом шаге. Этот марковский подход избегает компаундирующей путаницы,extendированных цепей рассуждения – слабости, особенно вредной для Самоисправления.
Параллельные методы, такие как Самоисправление и Best-of-N, избегали этой проблемы, хотя их улучшения были более медленными и скромными.
(Примечание: раздел результатов, хотя и подробный, является неудобным и многословным чтением, и мы должны на этом этапе сократить большую часть оставшегося освещения, отсылая читателя к исходной статье для более подробной информации).
Когда тестируется на GPT-5 Nano и GPT-5 Mini, закрытых коммерческих моделях, которые скрывают полный след рассуждения и возвращают только окончательный ответ, Iter-VF улучшил производительность без опоры на промежуточные выходные данные. В таблице ниже мы можем увидеть выигрыши на MATH500 и GPQA, подтверждающие, что подход «сначала проверить, затем сгенерировать» остается жизнеспособным даже тогда, когда доступны только входные и окончательные ответы:

Точность на MATH500 и GPQA, когда Iter-VF применяется к моделям GPT-5 с скрытыми следами рассуждения.
Вывод
Хотя новая статья переходит в неясность после раздела результатов, открытие общей характеристики в классе моделей ИИ все равно является fascинirующим развитием. Каждый, кто регулярно использует языковую модель, интуитивно разработал ряд трюков, чтобы обойти ограничения моделей, поскольку каждое из них становится очевидным со временем, и возникает закономерность; и все надеются найти «трюк» столь же применимый и обобщенный, как этот.
Одной из самых больших проблем в реализации и обновлении окна контекста в языковой модели является нахождение баланса между сохранением прогресса сессии и возможностью выйти в новые направления при необходимости, не попадая в ложные зрелища или выходящие из темы выходные данные. В случае, представленном в новой статье, мы видим пример мягкого, но настойчивого «пробуждения», который, кажется, перефокусирует и перезапускает языковую модель без потери контекста. Будет интересно увидеть, адаптируют ли последующие проекты и эволюционируют этот метод.
Исследователи много говорят о чистой экономии своего нового метода – соображение, которое имело бы гораздо меньший вес даже 12 месяцев назад. В наши дни последствия гипермасштабного ИИ делают ясным, что экономия ресурсов, когда-то считавшаяся педантичной в «чистых исследованиях», теперь становится важной и необходимой.
* Пожалуйста, обратите внимание, что я ограничен от включения обычной численности цитат из статьи, поскольку стандарт английского, найденный в некоторых частях, мог бы запутать читателя. Таким образом, я взял на себя смелость суммировать ключевые идеи вместо этого и отсылаю читателя к исходной статье для проверки.
Опубликовано впервые в четверг, 4 декабря 2025 года












