Взгляд Anderson

Модели разговорного ИИ могут увеличить затраты за счет бессмысленного болтовни

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image: a salad full of chopped-up one-dollar bills. GPT-1, Firefly V3, et al.

Популярные модели разговорного ИИ тайно тратят огромное количество оплаченных токенов на бессмысленную болтовню. Пострадавшие модели фактически знают, что они делают это, но не могут остановить себя.

 

Большие модели рассуждений (Large Reasoning Models, LRM), такие как ChatGPT-5 и Google Gemini, взимают больше платы за рассуждение – прохождение проблемы шаг за шагом, что требует значительно больше вычислительной мощности, чем просто быстрое предсказание следующего слова. Симулированный процесс рассуждения занимает больше времени и стоит дороже; в результате пользователи платят за это “дополнительное время мышления”.

Однако, если вы недавно использовали современную модель LLM, вы могли заметить, что ваша выделенная часть токенов часто тратится на бессмысленную болтовню и ненужные слова, а не на решение проблем, которые вы задаете модели. Это может проявляться в виде чрезмерной лести, разветвленных и/или повторяющихся ответов – или даже в виде “болтовни”, как будто ИИ был пойман врасплох и пытается выговориться из неловкой ситуации.

Естественно, мы хотим, чтобы наши модели LLM признали поражение, предложили альтернативные пути или попросили разъяснений. Но даже заставить ИИ такого типа признать, что он не знает ответа, является значительной задачей сама по себе.

В meantime, пользователи на более низких или бесплатных тарифах могут обнаружить, что они быстро сожгли свои токены, независимо от того, насколько целевые или экономичные были их запросы и взаимодействия, потому что ИИ сам любит говорить; и в этом случае, говорить не дешево.

Салат из слов

В отношении вышеупомянутой “болтовни” новое академическое сотрудничество предлагает обоснование и решение, предлагая, что модели LLM с возможностями рассуждения склонны тратить токены, когда они попадают в “салат из слов” – состояние замешательства, где процесс рассуждения теряется в рекурсивных тупиках – за счет пользователя*.

Исследователи за новой работой обнаружили, что значительная часть токенов, обработанных в типичной модели LLM, состоит из повторений и излишеств – и что модель сама кажется понимает, что она в беде, хотя она не может остановить дорогостоящий цикл.

Работа гласит:

‘Мы показываем, что значительная часть этих токенов – это бесполезные повторения – что мы называем “салатом из слов” – которые истощают бюджет декодирования без добавления ценности. Интересно, что мы наблюдаем, что LRM осознают, когда они попадают в эти циклы: скрытые состояния токенов, следующих за каждым фрагментом рассуждения, демонстрируют закономерности, которые позволяют нам обнаружить поведение “салата из слов” на лету с помощью однослочного линейного классификатора.

‘Как только оно обнаружено, простой обрез и прямой регенеративный запрос дают значительную экономию длины с минимальной потерей качества.’

Решение, предложенное в новой работе, – это вмешательство, которое может прервать процесс ошибочной модели LRM на лету, без включения в обучающие данные или какого-либо ущерба что может возникнуть в результате тонкой настройки. Фреймворк, озаглавленный WordSaladChopper, был публично выпущен на GitHub.

Хотя первоначальная работа концентрируется на DeepSeek вариантах, таких как записи в серии Qwen и Llama, работа утверждает, что нежелательное поведение, скорее всего, применимо к гораздо большему кругу аналогично спроектированных моделей рассуждения (включая популярные предложения только API, такие как ChatGPT и Google Gemini).

Как отмечается в работе, предыдущие предложения, такие как Demystifying Long Chain-of-Thought Reasoning in LLMs и Small Models Struggle to Learn from Strong Reasoners также используют небольшое количество публично доступных моделей рассуждения (CoT) для установления более широкой проблемы среди этого класса моделей:

[LRM] склонны тратить огромное количество бюджета декодирования, просто повторяя себя дословно, с незначительными вариациями, или занимаясь бесконечным перечислением случаев, пока весь бюджет не будет [расходован] – мы называем такое поведение салатом из слов, термин, часто используемый для высмеивания публичных представителей за длинные, запутанные, наполненные жаргоном ответы, которые в конечном итоге лишены смысла или ясного значения.

‘Столбец “Оригинал” в [нижеуказанной таблице] показывает, что когда мы отвечаем на GPQA-Diamond, мы наблюдаем 55%+ токенов, сгенерированных моделями DeepSeek-R1-Distill, которые помечены как “токены салата из слов”, где они не добавляют ценности с семантической точки зрения.’

Доля токенов вывода, идентифицированных как семантически избыточные при ответе на GPQA-Diamond. WordSaladChopper снижает эту нагрузку с более 55% до менее 6% во всех протестированных моделях DeepSeek-R1-Distill, утверждают авторы. [ Источник ] https://arxiv.org/pdf/2511.00536

Доля токенов вывода, идентифицированных как семантически избыточные при ответе на GPQA-Diamond. WordSaladChopper снижает эту нагрузку с более 55% до менее 6% во всех протестированных моделях DeepSeek-R1-Distill, утверждают авторы. Источник

Авторы отмечают, что попытки сократить процесс рассуждения, сохраняя качество ответа, стали сильным направлением в исследовательской литературе, а именно long-to-short (L2S); и далее замечают, что, хотя их проектные цели аналогичны нескольким предыдущим инициативам, их собственный является первым, который предлагает ад hoc решение, которое не требует вмешательства в процесс обучения, редактирования модели или других возможных наложений на базовую архитектуру модели LLM; и в этой степени они считают, что их подход должен стать широко распространенным среди применимых систем:

‘Учитывая его низкую нагрузку, сильную экономию и отсутствие семантической ценности токенов салата из слов, мы считаем, что это не слишком смело утверждать, что [WordSaladChopper] – или аналогичный компонент – является необходимым для всех приложений LRM с учетом пользовательского опыта

Предварительные соображения

Чтобы отслеживать тенденцию моделей рассуждения повторяться, авторы разделили вывод моделей на фрагменты, где были двойные разрывы строк, а затем проверили, насколько каждый фрагмент был похож на предыдущие:

Оцененная доля фрагментов рассуждения, помеченных как салат из слов, при двух температурах декодирования (τ = 0,0, 0,6). Классификатор помечает фрагмент как 'салат из слов', когда он сильно похож на предыдущую часть вывода модели, что указывает на повторение, а не прогресс. Результаты показывают, что такое поведение широко распространено среди наборов данных и размеров моделей.

Оцененная доля фрагментов рассуждения, помеченных как салат из слов, при двух температурах декодирования (τ = 0,0, 0,6). Классификатор помечает фрагмент как ‘салат из слов’, когда он сильно похож на предыдущую часть вывода модели, что указывает на повторение, а не прогресс. Результаты показывают, что такое поведение широко распространено среди наборов данных и размеров моделей.

Если фрагмент был слишком похож, он был помечен как ‘салат из слов’ (по сути, бесполезное повторение).

Исследователи отмечают, что как только модель попадает в режим ‘салата из слов’, она очень маловероятно выйдет из него без внешней помощи, а вместо этого останется в дорогом цикле, пока бюджет пользователя не будет потраче톆:

‘Несомненно, это представляет собой катастрофическую проблему для пользователей, поскольку идеально более короткий раздел мышления теперь максимизируется бесполезными повторениями. Итак, пользователь по сути платит максимальную стоимость за (вероятно) неправильный ответ, терпя при этом самую длинную задержку от начала до конца.’

Доля фрагментов салата из слов, появляющихся до и после точки обрезки (т. е. момента, когда повторяющийся вывод начинает доминировать). Большинство повторений происходят после этой точки, показывая, что как только модель попадает в цикл салата из слов, она редко восстанавливается без вмешательства.

Доля фрагментов салата из слов, появляющихся до и после точки обрезки (т. е. момента, когда повторяющийся вывод начинает доминировать). Большинство повторений происходят после этой точки, показывая, что как только модель попадает в цикл салата из слов, она редко восстанавливается без вмешательства.

Исследователи рассказывают о своем удивлении, когда они обнаружили, что модели рассуждения LRM демонстрируют признаки осознания своего состояния ‘салата из слов’. Однако именно это осознание и то, как оно входит в вероятностное состояние рассуждения модели, позволяет ввести систему вмешательства:

‘Легкость этого линейного классификатора открывает дверь для обнаружения на лету, где мы можем эффективно вмешаться с помощью различных операций, чтобы решить проблемы моделей, попавших в циклы салата из слов.’

Метод

Чтобы обнаружить присутствие салата из слов во время вывода, авторы обучили простой линейный классификатор, который работает на скрытом состоянии каждого токена двойного перевода строки.

Любой фрагмент, следующий после того, как модель вошла в цикл повторения, рассматривался как салат из слов, с этим срезом (называемым точкой обрезки) использованным для маркировки обучающих данных. Тысяча следов рассуждения была сгенерирована с помощью S1-бенчмарка, и каждый след был разделен на фрагменты, разделенные переводами строк.

Концептуальная схема WordSaladChopper. Во время генерации скрытое состояние в каждом токене двойного перевода строки анализируется для обнаружения повторяющихся сегментов. Как только два фрагмента салата из слов помечены подряд, генерация останавливается. Фиксированный регенеративный запрос затем добавляется, позволяя модели продолжить и закончить свой ответ без превышения бюджета.

Концептуальная схема WordSaladChopper. Во время генерации скрытое состояние в каждом токене двойного перевода строки анализируется для обнаружения повторяющихся сегментов. Как только два фрагмента салата из слов помечены подряд, генерация останавливается. Фиксированный регенеративный запрос затем добавляется, позволяя модели продолжить и закончить свой ответ без превышения бюджета.

Если фрагмент был слишком похож на предыдущий, он был помечен как салат из слов. Как только был обнаружен первый устойчивый повтор, все последующие фрагменты также были помечены как салат из слов, чтобы отразить продолжение этих циклов.

Классификатор был реализован как один полностью связанный слой и был обучен на скрытых состояниях токенов, следующих за последним трансформаторным блоком. Отдельный классификатор был обучен для каждой модели, используя эти данные, и не проводилась тонкая настройка во время оценки.

Данные и тесты

Обучение и вывод использовали четыре NVIDIA A100 (80G VRAM) GPU, под оптимизатором Adam, с скоростью обучения 1×10-2, в течение 50 эпох.

Оценочные наборы данных были ‘Математика начальной школы’ 8000, также известные как GSM8K; MATH-500; GPQA-DIAMOND; и AIME25 (2025).

Тестируемые модели были DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; и DeepSeek-R1-Distill-Llama-8B, все под лицензией MIT.

Используемые метрики были точность и AUROC.

Точность и AUROC классификатора салата из слов на Qwen-7B по четырем бенчмаркам и двум температурам декодирования. Высокие баллы подтверждают, что начало повторения можно надежно обнаружить из скрытого состояния токена двойного перевода строки.

Точность и AUROC классификатора салата из слов на Qwen-7B по четырем бенчмаркам и двум температурам декодирования. Высокие баллы подтверждают, что начало повторения можно надежно обнаружить из скрытого состояния токена двойного перевода строки.

Из результатов, представленных здесь, авторы комментируют:

‘[Таблица результатов выше] показывает, что линейный классификатор чрезвычайно точен в обнаружении фрагментов салата из слов; однако [таблица результатов ниже] демонстрирует, что регенеративный запрос помогает восстановить точность задачи, потерянную из-за грубой обрезки.’

Точность Qwen-7B на каждом бенчмарке при τ = 0,6, сравнивая производительность до салата из слов (Оригинал), после обрезки (Обрезанный) и после применения регенерации (Регенерированный). Приросты от регенерации скромны, но последовательны, восстанавливая производительность до цикла в большинстве случаев.

Точность Qwen-7B на каждом бенчмарке при τ = 0,6, сравнивая производительность до салата из слов (Оригинал), после обрезки (Обрезанный) и после применения регенерации (Регенерированный). Приросты от регенерации скромны, но последовательны, восстанавливая производительность до цикла в большинстве случаев.

В таблице результатов ниже мы видим, что WordSaladChopper улучшил или сохранил точность, одновременно резко снижая длину вывода модели, до 57%:

Когда WordSaladChopper используется при жадном декодировании (τ = 0), он снижает длину вывода модели, иногда более чем на половину, сохраняя точность на том же уровне или немного лучше, производительность, которая остается последовательной среди разных моделей и задач (AIME25 опущена из-за предсказуемо нестабильных результатов в этом режиме).

Когда WordSaladChopper используется при жадном декодировании (τ = 0), он снижает длину вывода модели, иногда более чем на половину, сохраняя точность на том же уровне или немного лучше, производительность, которая остается последовательной среди разных моделей и задач (AIME25 опущена из-за предсказуемо нестабильных результатов в этом режиме).

Самые большие приросты наблюдались в более длинных ответах, особенно на GPQA-Diamond, где почти половина текста была удалена без ущерба для производительности. Ниже мы видим аналогичные результаты, когда добавлялась случайность во время генерации:

При более высокой температуре (τ = 0,6) WordSaladChopper продолжает сокращать вывод на 10-30 процентов, с точностью, остающейся стабильной или немного улучшенной во всех моделях и бенчмарках (результаты AIME25 усреднены для снижения дисперсии).

При более высокой температуре (τ = 0,6) WordSaladChopper продолжает сокращать вывод на 10-30 процентов, с точностью, остающейся стабильной или немного улучшенной во всех моделях и бенчмарках (результаты AIME25 усреднены для снижения дисперсии).

Здесь точность осталась стабильной, а вывод был сокращен. Во всех случаях система продолжала работать даже тогда, когда ответы модели становились более повторяющимися; и авторы отмечают, что поскольку классификатор проверяет только один токен за предложение, он работает чрезвычайно быстро, даже при использовании во время живой генерации.

Работа отмечает, что дополнительные стратегии в будущих исследованиях в этом направлении могли бы извлечь выгоду из предоставления модели небольшого регенеративного бюджета после вмешательства; непрерывного применения системы WordSaladChopper-типа на регенерации; и принуждения токена ‘конца мышления’ на модели, чтобы требовать ее лучший текущий ответ.

Наконец, исследователи комментируют качество текущего состояния оценки моделей рассуждения, с критическим тоном:

[Это] наша честная убежденность, что многие эффективные методы рассуждения кажутся эффективными частично потому, что текущие оценки рассуждения имеют много места для улучшения.

‘Если мы разработаем более полные наборы оценки – что мы обязательно сделаем в будущем – мы ожидаем увидеть, что многие эффективные методы рассуждения потерпят неудачу или поведут себя гораздо иначе, чем их обычные аналоги LRM.’

Вывод

На уровне, достигнутом ведущими системами, такими как ChatGPT, даже небольшие сдвиги в потреблении ресурсов пользователей могут иметь значительные последствия для инфраструктуры, логистики и затрат. Это делает эффективность общим приоритетом как для поставщиков, так и для более широкого исследовательского сообщества.

Если будет реализован, новый и легкий системный подход, предложенный в работе (который должен быть индивидуально обучен для каждой новой архитектуры модели), мог бы предотвратить бессмысленное сжигание токенов – что может дать клиенту впечатление, что поставщик ‘высасывает’ его выделение в расточительном или обманном порядке. На самом деле, поставщик выигрывает от предоставления полезного, а не избыточного вывода, который стоит столько же в вычислительных терминах, сколько и салат из слов.

 

* Хотя мы не будем развивать это здесь, это также распространяется на локально размещенные модели, которые могут быть как корпоративными, так и хобби, и где электрические и производственные потери салата из слов могут быть фактором, достойным внимания.

Как обычно, все выделение принадлежит авторам, и не мне. Где применимо, их внутренние цитаты были преобразованы в гиперссылки мной.

†† Здесь мы должны признать, что фреймворки и API могут выделять ‘суб-бюджет’ для запросов, так что один запрос не обязательно может сжечь выделение на день токенов – но это не обычная практика, ни обычно обсуждается среди поставщиков только API.

††† Я не склонен принять использование авторами аббревиатуры ‘LRM’, поскольку это не является в настоящее время общепринятой аббревиатурой, поэтому я буду использовать другую терминологию в этой статье, где это необходимо.

Опубликовано впервые в четверг, 6 ноября 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai