Взгляд Anderson
Неполитичные запросы могут увеличить стоимость корпоративного ChatGPT

Ответы ChatGPT требуют больше токенов, когда вы грубы с ним, что увеличивает ваш корпоративный счет; но сказать “пожалуйста” может уменьшить ваши затраты.
Говорят, что вежливость ничего не стоит; но что стоит невежливость? Что касается оплаты за ChatGPT, довольно много, согласно новому исследованию из США. Новая статья, из Университета Айовы, обнаружила, что быть грубым с ChatGPT увеличивает стоимость ответов – даже если ответы одинаковы для вежливых и невежливых запросов.
Авторы заявляют:
‘[Цена] выходных токенов составляет $12 за 1 миллион выходных токенов для GPT4. Мы обнаружили, что невежливые подсказки приводят к более чем 14 дополнительным токенам, что эквивалентно дополнительным затратам в размере $0,000168 за подсказку в среднем. Среднее количество запросов к API OpenAI превышает 2,2 миллиарда в день.
‘По сравнению с сценарием, в котором все подсказки вежливы, когда вместо этого подсказки невежливы, это генерирует дополнительный доход в размере $369 000 в день, просто из-за увеличения токенов, которые невежливые подсказки генерируют в результате.’
Хотя результат интересен сам по себе, авторы подчеркивают, что это необычное поведение может указывать на различные еще неизвестные странности в конфигурации человека/ИИ, некоторые или все из которых могут иметь финансовые последствия. Что касается причины, по которой грубость стоит клиентам дополнительные токены, авторы не спекулируют.
Чтобы установить достоверность синдрома, они переписали реальные подсказки ChatGPT, чередуя значения вежливости, сохраняя при этом смысл. Обе версии затем были переданы в GPT‑4‑Turbo, и были измерены различия в количестве выходных токенов, использованных для ответов.
Выводы, сделанные в статье, резко контрастируют с событиями в начале этого года, когда Сэм Альтман жаловался на то, что вежливость стоит OpenAI потенциально ‘десятков миллионов’ долларов в виде обработки токенов, связанных с вежливостью (таких как ‘пожалуйста’). Исследование, опубликованное в том же периоде, также указывало на то, что вежливость не имеет значения для получения лучших ответов (хотя оно не комментировало ‘дешевле’ ответов).
Если выводы новой статьи верны, любые корпоративные пользователи ChatGPT, которые следовали этой линии мышления, потратили бы больше на вывод ChatGPT в 2025 году, чем пользователи, предлагающие минимальную вежливость в обменах ChatGPT.
Авторы предлагают, что одним из возможных средств было бы установить потолок токенов для ответов, хотя это не подход, который системы LLM могут легко реализовать. Они отмечают, что подсказка является слабым инструментом для контроля затрат, поскольку LLM борются с выполнением явных инструкций по длине. В большинстве случаев это директива ‘ограничения’ не будет выполнена; кроме того, ответ может быть обрезан, поскольку LLM такого типа по сути угадывают следующее вероятное слово в предложении/абзаце и, таким образом, не знают, как история заканчивается – или где история заканчивается – до завершения обработки.
Отсутствуя точного решения – хотя предлагая, что более прозрачные подходы к ценообразованию должны быть реализованы в таких случаях – авторы заключают:
‘Традиционная мудрость предполагает, что вежливость подсказки не нужна при взаимодействии с LLM.
‘Напротив, наша работа демонстрирует, что невежливые подсказки увеличивают выходные токены, генерируя дополнительные затраты для корпоративных пользователей ИИ.’
Статья называется Прозрачность затрат корпоративного внедрения ИИ и написана тремя исследователями из Университета Айовы.
Метод
Данные для системы были получены из набора данных WildChat, который включает в себя коллекцию из 1 миллиона разговоров между пользователями и ChatGPT, и содержит более 2,5 миллиона взаимодействий:

Из веб-сайта, поддерживающего проект WildChat, примеры взаимодействий ChatGPT. Источник
Авторы отмечают, что WildChat содержит больше естественных взаимодействий, чем в некоторых более отредактированных наборах.
Они выбрали 20 000 английских подсказок из коллекции обменов GPT-4, удалив выходные данные в каждом случае (поскольку целью было передать подсказки еще раз для новых ответов). Только первое взаимодействие было выбрано, даже из более длинных обменов,
Результирующий набор был отфильтрован по категориям вежливым или невежливым, и все подсказки были классифицированы GPT-4-Turbo. Исследователи использовали саму модель, чтобы решить, является ли подсказка вежливой или нет, поскольку восприятие вежливости моделью было центральным для эксперимента.
Подсказки, помеченные как вежливые, могли включать явные сигналы, такие как слово ‘пожалуйста’, или могли быть вежливыми более косвенным образом. Все, что не было признано вежливым, было классифицировано как невежливое, даже если формулировка была нейтральной, а не антагонистической.
Чтобы изучить, как модель реагирует на вежливость, стандартные методы (т. е. те, которые рассматривают текст как набор измеримых характеристик) не могли быть использованы: поскольку вежливость была встроена в формулировку, суммирование подсказки как списка характеристик потеряло бы важный контекст.
Вместо этого каждая подсказка была переписана, чтобы обратить ее тон, сохраняя при этом все остальные элементы как можно более похожими, что позволило сравнить пары, которые различались только по вежливости:

Примеры того, как вежливые и невежливые подсказки были преобразованы в их контрфактические версии, сохраняя семантический смысл. Источник
Тесты
Каждая исходная подсказка была сопоставлена с переписанной версией, которая различалась только по уровню вежливости, и обе версии были переданы в одну и ту же модель GPT‑4‑Turbo через отдельные вызовы API. Количество токенов, сгенерированных в ответ на каждую версию, было записано, и разница между ними была рассмотрена как мера того, как тон повлиял на (токен) стоимость.
Температура была сохранена постоянной, чтобы предотвратить случайные вариации, и пары подсказок сохранялись только тогда, когда переписывание изменяло входные данные не более чем на пять токенов. Это обеспечило, что эффект, который изучался, возник из тона, а не из более широких изменений в формулировке:

Сводка статистики, показывающая, что вежливые подсказки привели к меньшему количеству выходных токенов, в среднем, чем невежливые подсказки, несмотря на то, что они имели немного больше входных токенов.
Основные результаты первого раунда тестов показали, что использование вежливой подсказки уменьшает длину выходных токенов на 14,426 токенов:

Результаты оценки, показывающие влияние форматирования вежливой подсказки на длину сгенерированных выходных токенов.
Анализ был повторен на трех подмножествах вежливых подсказок, чтобы проверить надежность: подсказки, использующие явные маркеры, такие как ‘пожалуйста’ или ‘спасибо’; те, которые используют только ‘пожалуйста’; и те, у которых неявная вежливость, такая как ‘можете ли вы’ или ‘не могли бы вы’:

Результаты оценки на основе типов вежливости.
Чтобы проверить надежность основных результатов, вторичная классификация вежливости подсказки была проведена с использованием фреймворка LIWC, который предоставляет детерминированный и повторяемый балл для лингвистических характеристик.
В отличие от вероятностной классификации GPT, LIWC может присвоить стабильный балл вежливости каждой подсказке, что позволяет оценить последовательность между разными методами. В этой части тестов подсказки были помечены как вежливые, если их балл вежливости LIWC был больше нуля, и как невежливые в противном случае.
Когда была измерена согласованность между классификациями GPT и LIWC, была обнаружена согласованность в 81%. Хотя это не является мерой точности, это соглашение обеспечило поддержку последовательности между системами.
Когда были проанализированы только подсказки с совпадающими метками вежливости GPT и LIWC, вежливые подсказки все еще привели к 14 меньшим выходным токенам; и когда вежливость измерялась на скользящей шкале, каждое увеличение вежливости уменьшало выход на пять токенов в среднем:

Экономия токенов от вежливости сохранялась при переклассификации с LIWC, как бинарным ярлыком, так и непрерывным баллом.
Устойчивость
Чтобы оценить, изменяется ли эффект вежливости в зависимости от различных типов подсказок, каждая подсказка была назначена одной из нескольких предопределенных категорий задач: поиск информации; генерация текста; редактирование и переписывание; классификация; суммаризация; и технические задачи.
Каждая подсказка была назначена меткой задачи путем сравнения ее вложения с вложениями предопределенных описаний задач, используя модель Sentence Transformers all‑MiniLM‑L6‑v2.
Косинусная подобие была рассчитана между каждой подсказкой и набором определений задач, и метка с наибольшим подобием была присвоена.
Типы задач затем были использованы как контрольные переменные в регрессии, чтобы проверить, изменяется ли эффект вежливости в зависимости от категории подсказки, и члены взаимодействия между задачей и обработкой также были введены, чтобы проверить наличия различного эффекта.
В обоих случаях вежливые подсказки последовательно производили более короткие выходные данные, и не было обнаружено никаких значимых различий по типам задач:

Регрессионные результаты, демонстрирующие, что вежливые подсказки уменьшили длину выходных данных во всех типах задач, без значимых эффектов взаимодействия.
Чтобы проверить, отражают ли более короткие ответы от вежливых подсказок снижение качества, выходные данные от исходных и контрфактических подсказок были сравнены по семантической подобии. Используя модель all‑MiniLM‑L6‑v2, каждый ответ был вложен в семантическое векторное пространство, и косинусная подобие была рассчитана между каждой парой, что дало среднюю подобие 0,78, указывающую на сильное совпадение в смысле, и предполагающую, что содержание осталось последовательным даже при изменении тона.
Стоп-слова
Чтобы понять, какой тип содержания уменьшается в более коротких выходных данных, были изучены наиболее часто опускаемые слова. Они были обнаружены как общие стоп-слова, такие как ‘иметь’, ‘больше’, ‘где’ и ‘в’, т. е. термины, которые служат грамматическим, а не семантическим ролям.
Чтобы подтвердить, что уменьшение токенов не было вызвано потерей осмысленного содержания, стоп-слова были удалены, и фразы до четырех слов были проанализированы на систематическое исчезновение; однако не было обнаружено никаких последовательных или семантически важных закономерностей, что предполагает, что уменьшения от вежливой формулировки не удаляли осмысленное или полезное содержание.
Таким образом, все еще казалось, что больше токенов тратится на ответы на грубые запросы, чем на вежливые – как своего рода ‘налог’ на грубость.
Исследование человека
Чтобы проверить, влияет ли качество выходных данных на тон подсказки, также было проведено исследование человека, используя случайную выборку из двадцати вежливых и двадцати невежливых пар подсказок.
После исключения подсказок на чувствительные или технические темы, ответы были оценены 401 участником по семибалльной шкале. Каждый участник видел только один ответ, полученный из одной из четырех условий: вежливый или невежливый, и либо исходный, либо контрфактический.
Не было обнаружено никаких значимых различий в воспринимаемом качестве между любыми из этих условий. Вежливые и невежливые выходные данные получили почти идентичные баллы, как и исходные и контрфактические версии.
Авторы утверждают, что эти результаты указывают на то, что уменьшение количества выходных токенов не было вызвано потерей качества, а вместо этого было вызвано перефразировкой или структурными сдвигами, которые тем не менее сохранили смысл.
Разница в стоимости, наблюдаемая в корпоративном запросе, поэтому, вряд ли отражает изменения в полезности или ясности, и ‘налог’ все еще действует.
Заключение
Хотя новая работа концентрируется на корпоративном использовании ChatGPT, пользователи более низкого уровня также затронуты этим синдромом, поскольку даже два базовых уровня имеют ограничения на использование; и – предположительно – обращение с ChatGPT грубо ускорит среднего пользователя к истощению дневного лимита токенов.
Новое исследование концентрируется на широко обсуждаемом и много изучаемом открытом вопросе в взаимодействиях человека/ИИ; но авторы подчеркивают, что вопросы вокруг вежливости должны быть рассмотрены как индикаторы возможного более глубокого источника лингвистических странностей, которые могут оказать влияние на затраты на вывод.
Опубликовано в среду, 19 ноября 2025 года












