Взгляд Anderson
Новые исследования ставят под сомнение систему «токенов» для оплаты услуг ИИ

Новые исследования показывают, что система оплаты услуг ИИ, основанная на токенах, может скрывать реальную стоимость от пользователей. Поставщики могут незаметно увеличивать стоимость, манипулируя количеством токенов или добавляя скрытые шаги. Некоторые системы выполняют дополнительные процессы, которые не влияют на результат, но все равно отражаются в счете. Были предложены инструменты для аудита, но без реального надзора пользователи остаются платить за больше, чем они осознают.
Почти во всех случаях то, за что мы платим как потребители за интерфейсы чата, основанные на ИИ, такие как ChatGPT-4o, в настоящее время измеряется в токенах: невидимых единицах текста, которые не замечаются во время использования, но подсчитываются с точной точностью для целей выставления счетов; и хотя каждая операция оплачивается по количеству обработанных токенов, пользователь не имеет прямого способа подтвердить количество токенов.
Несмотря на нашу (в лучшем случае) несовершенное понимание того, что мы получаем за нашу купленную «токен»-единицу, токен-основанная система оплаты стала стандартным подходом среди поставщиков, основанным на том, что может оказаться хрупким предположением о доверии.
Токен-слова
Токен не совсем то же самое, что слово, хотя он часто играет подобную роль, и большинство поставщиков используют термин «токен» для описания небольших единиц текста, таких как слова, знаки препинания или фрагменты слов. Например, слово ‘невероятное’ может быть посчитано как один токен одной системой, в то время как другая система может разделить его на ‘не’, ‘вер’ и ‘оятное’, с каждым фрагментом, увеличивающим стоимость.
Эта система применяется как к тексту, введенному пользователем, так и к ответу модели, с ценой, основанной на общем количестве этих единиц.
Трудность заключается в том, что пользователи не видят этого процесса. Большинство интерфейсов не показывают количество токенов во время разговора, и способ расчета токенов трудно воспроизвести. Даже если количество токенов показано после ответа, уже слишком поздно, чтобы сказать, было ли это справедливо, создавая несоответствие между тем, что видит пользователь, и тем, за что он платит.
Недавние исследования указывают на более глубокие проблемы: одно исследование показывает, как поставщики могут завышать стоимость без нарушения правил, просто увеличивая количество токенов способами, которые пользователь не может увидеть; другое раскрывает несоответствие между тем, что отображают интерфейсы, и тем, что фактически выставляется в счет, оставляя пользователей с иллюзией эффективности, где ее может не быть; и третье показывает, как модели регулярно генерируют внутренние шаги рассуждения, которые никогда не показываются пользователю, но все равно появляются в счете.
Результаты изображают систему, которая кажется точной, с точными числами, подразумевающими ясность, но чья основная логика остается скрытой. Независимо от того, является ли это конструктивным или структурным недостатком, результат один и тот же: пользователи платят за больше, чем они могут увидеть, и часто больше, чем они ожидают.
Дешевле дюжиной?
В первом из этих исследований – под названием «Ваш ЛЛМ завышает ли цену? Токенизация, прозрачность и стимулы» от четырех исследователей Института программных систем Макса Планка – авторы утверждают, что риски токен-основанной оплаты распространяются за пределы непрозрачности, указывая на встроенный стимул для поставщиков увеличивать количество токенов:
‘Суть проблемы заключается в том, что токенизация строки не уникальна. Например, рассмотрим, что пользователь отправляет запрос «Где проходит следующая NeurIPS?» поставщику, поставщик подает его в ЛЛМ, и модель генерирует ответ «|Сан|Диего|», состоящий из двух токенов.
‘Поскольку пользователь не осведомлен о генеративном процессе, поставщик, действующий в своих интересах, имеет возможность неправильно сообщить о токенизации вывода пользователю, не изменив при этом основную строку. Например, поставщик может просто поделиться токенизацией «|С|а|н| |Д|i|е|г|о|» и завышать цену для девяти токенов вместо двух!’
Исследование представляет собой эвристический метод, способный выполнять такой нечестный расчет без изменения видимого вывода и без нарушения правдоподобия при типичных условиях декодирования. Протестированный на моделях из серий LLaMA, Mistral и Gemma, используя реальные запросы, метод достигает измеримых завышений без аномалий:

Инфляция токенов с помощью «правдоподобного неправильного сообщения». Каждая панель показывает процент завышенных токенов, полученный в результате применения поставщиком алгоритма 1 к выводам 400 запросов LMSYS, при различных параметрах выборки (m и p). Все выводы были сгенерированы при температуре 1,3, с пятью повторениями для каждого параметра для расчета 90% доверительных интервалов. Источник: https://arxiv.org/pdf/2505.21627
Для решения проблемы исследователи призывают к оплате на основе количества символов вместо токенов, утверждая, что это единственный подход, который дает поставщикам стимул сообщать о использовании честно, и утверждают, что если цель — справедливая цена, то связывание стоимости с видимыми символами, а не с скрытыми процессами, — это единственный вариант, который выдерживает проверку.
Здесь есть несколько дополнительных соображений, однако (в большинстве случаев признанных авторами). Во-первых, предложенная схема, основанная на символах, вводит дополнительную бизнес-логику, которая может отдавать предпочтение поставщику над потребителем:
‘[П]оставщик, который никогда не завышает цену, имеет явный стимул сгенерировать самую короткую возможную последовательность токенов вывода, и улучшить текущие алгоритмы токенизации, такие как BPE, чтобы они сжимали последовательность токенов вывода как можно больше’
Оптимистический мотив здесь заключается в том, что поставщик тем самым поощряется производить краткий и более осмысленный и ценный вывод. На практике есть, очевидно, менее добродетельные способы для поставщика уменьшить количество текста.
Во-вторых, разумно предположить, утверждают авторы, что компании, вероятно, потребуют законодательства, чтобы перейти от архаичной системы токенов к более прозрачной, текст-основанной системе оплаты. В будущем стартап-инсургент может решить выделить свой продукт, запустив его с такой моделью ценообразования; но любой, у кого есть действительно конкурентный продукт (и работающий на более низком уровне, чем EEE категория), не заинтересован в этом.
Наконец, алгоритмы, такие как предложенный авторами, будут иметь свою собственную вычислительную стоимость; если стоимость расчета «наценки» превышает потенциальную выгоду, схема явно не имеет значения. Однако исследователи подчеркивают, что их предложенный алгоритм эффективен и экономичен.
Авторы предоставляют код для своих теорий на GitHub.
Переключение
Второе исследование – под названием Невидимые токены, видимые счета: срочная необходимость аудита скрытых операций в не透рачных сервисах ЛЛМ, от исследователей Университета Мэриленда и Беркли – утверждает, что несоответствующие стимулы в коммерческих языковых моделях API не ограничиваются только разделением токенов, но распространяются на целые классы скрытых операций.
Это включает в себя внутренние вызовы моделей, спекулятивные рассуждения, использование инструментов и взаимодействия между агентами – все это может быть выставлено в счет пользователю без видимости или возможности обжалования.

Ценообразование и прозрачность рассуждений ЛЛМ API среди основных поставщиков. Все перечисленные услуги взимают с пользователей плату за скрытые внутренние токены рассуждения, и ни одна из них не делает эти токены видимыми во время выполнения. Стоимость варьируется значительно, с моделью o1-pro от OpenAI, которая взимает в десять раз больше за миллион токенов, чем Claude Opus 4 или Gemini 2.5 Pro, несмотря на равную непрозрачность. Источник: https://www.arxiv.org/pdf/2505.18471
В отличие от традиционного выставления счетов, где количество и качество услуг верифицируемы, авторы утверждают, что сегодняшние платформы ЛЛМ работают под структурной непрозрачностью: пользователи взимают плату на основе отчетности о токенах и использовании API, но не имеют возможности подтвердить, что эти метрики отражают реальную или необходимую работу.
Исследование выявляет два ключевых вида манипуляций: инфляцию количества, когда количество токенов или вызовов увеличивается без пользы для пользователя; и понижение качества, когда используются модели или инструменты более низкого класса вместо премиальных компонентов:
‘В рассуждениях ЛЛМ API поставщики часто поддерживают несколько вариантов одной и той же модели, различающихся по емкости, обучающим данным или стратегии оптимизации (например, ChatGPT o1, o3). Понижение модели означает замenu более дешевых моделей, что может ввести несоответствие между ожидаемым и фактическим качеством обслуживания.
‘Например, запрос может быть обработан меньшей моделью, в то время как выставление счета остается неизменным. Эта практика трудна для обнаружения пользователями, поскольку окончательный ответ может все еще казаться правдоподобным для многих задач.’
Исследование документирует случаи, когда более 90% выставленных токенов никогда не показывались пользователям, с внутренними рассуждениями, увеличивающими использование токенов в разы больше, чем двадцать. Оправдано или нет, непрозрачность этих шагов лишает пользователей любой основы для оценки их актуальности или законности.
В агентных системах непрозрачность увеличивается, поскольку внутренний обмен между агентами ИИ может каждый раз вызывать дополнительные затраты без существенного влияния на окончательный результат:
‘Помимо внутренних рассуждений, агенты общаются, обмениваясь запросами, резюме и инструкциями по планированию. Каждый агент интерпретирует входные данные от других и генерирует выходные данные для руководства рабочим процессом. Эти межагентные сообщения могут потреблять значительное количество токенов, которые часто не отображаются пользователю.
‘Все токены, потребляемые во время координации агентов, включая сгенерированные запросы, ответы и инструкции, связанные с инструментами, обычно не отображаются пользователю. Когда агенты сами используют модели рассуждения, выставление счета становится еще более непрозрачным’
Для решения этих проблем авторы предлагают многослойную систему аудита, включающую криптографические доказательства внутренней деятельности, верифицируемые маркеры идентификации модели или инструмента и независимый надзор. Основная проблема, однако, структурна: текущие схемы оплаты ЛЛМ зависят от постоянной асимметрии информации, оставляя пользователей открытыми для затрат, которые они не могут проверить или разбить.
Считая невидимое
Окончательное исследование, от исследователей Университета Мэриленда, переформулирует проблему оплаты не как вопрос о неправильном использовании или неправильном сообщении, а как вопрос структуры. Исследование – под названием CoIn: Считая невидимые токены рассуждения в коммерческих непрозрачных ЛЛМ API, от десяти исследователей Университета Мэриленда – отмечает, что большинство коммерческих сервисов ЛЛМ теперь скрывают промежуточные рассуждения, которые способствуют окончательному ответу модели, но все равно взимают плату за эти токены.
Исследование утверждает, что это создает невидимую поверхность выставления счетов, где целые последовательности могут быть фабрикованы, инъецированы или завышены без обнаружения*:
‘[Это] невидимость позволяет поставщикам неправильно сообщать о количестве токенов или вводить низкозатратные, фабрикованные токены рассуждения, чтобы искусственно завысить количество токенов. Мы называем эту практику инфляцией количества токенов.
‘Например, один запуск высокоэффективной модели ARC-AGI, выполненный моделью o3 от OpenAI, потребовал 111 миллионов токенов, стоив 66 772,3 доллара. Учитывая этот масштаб, даже небольшие манипуляции могут привести к существенному финансовому влиянию.
‘Такая асимметрия информации позволяет компаниям ИИ значительно завышать стоимость для пользователей, тем самым подрывая их интересы.’
Для противодействия этой асимметрии авторы предлагают CoIn, систему аудита третьей стороны, предназначенную для верификации скрытых токенов без раскрытия их содержания, и которая использует хешированные отпечатки и семантические проверки для обнаружения признаков инфляции.

Обзор системы аудита CoIn для непрозрачных коммерческих ЛЛМ. Панель А показывает, как вложения токенов рассуждения хешируются в дерево Меркла для верификации количества токенов без раскрытия содержания токенов. Панель Б иллюстрирует семантические проверки действительности, где легкие нейронные сети сравнивают блоки рассуждения с окончательным ответом. Источник: https://arxiv.org/pdf/2505.13778
Один компонент верифицирует количество токенов криптографически с помощью дерева Меркла; другой оценивает актуальность скрытого содержания, сравнивая его с вложением ответа. Это позволяет аудиторам обнаружить заполнение или нерелевантность — признаки того, что токены вводятся просто для завышения счета.
Когда система была развернута в тестах, CoIn достигла успеха в обнаружении в 95% случаев для некоторых форм инфляции, с минимальным раскрытием основных данных. Хотя система все еще зависит от добровольного сотрудничества поставщиков и имеет ограниченное разрешение в пограничных случаях, ее основная точка зрения неоспорима: сама архитектура текущей системы оплаты ЛЛМ предполагает честность, которая не может быть проверена.
Заключение
Помимо преимущества получения предоплаты от пользователей, система оплаты на основе «токенов» (например, система «buzz» в CivitAI) помогает абстрагировать пользователей от истинной стоимости валюты, которую они тратят, или товара, который они покупают. Аналогично, предоставление поставщику возможности определять свои собственные единицы измерения еще больше оставляет потребителя в неведении о том, что он фактически тратит, в терминах реальных денег.
Мало понятый токен, который может быть потреблен и определен множеством способов, возможно, не является подходящей единицей измерения для потребления ЛЛМ — не в последнюю очередь потому, что он может стоить много больше токенов для расчета худшего результата ЛЛМ на неродном языке по сравнению с сессией на английском языке.
Однако оплата на основе символов, как предложили исследователи Макса Планка, вероятно, будет отдавать предпочтение более кратким языкам и штрафовать естественно многословные языки. Поскольку визуальные указания, такие как уменьшающийся счетчик токенов, вероятно, сделают нас немного более расточительными в наших сессиях ЛЛМ, кажется маловероятным, что такие полезные дополнения GUI появятся в ближайшее время — по крайней мере без законодательных действий.
* Акценты авторов. Мое преобразование внутренних цитат авторов в гиперссылки.
Опубликовано впервые в четверг, 29 мая 2025 года












