Лидеры мнений
Новая экономика ИИ построена на токенах — но мы измеряем их неправильно

Происходит сдвиг в ИИ, который большинство людей чувствуют, но еще не полностью понимают: мы перешли от подсчета запросов к подсчету токенов.
В эпоху веба мы измеряли системы в запросах в секунду. Это было чисто, интуитивно и в основном точно. Запрос приходил, ответ уходил, и вы могли масштабировать инфраструктуру вокруг этой модели.
Эта абстракция ушла.
В ИИ фундаментальной единицей больше не является запрос — это токен. Каждый запрос, каждый ответ и каждая цепочка рассуждений разбиваются на токены, представляющие работу системы, понесенные затраты и, все чаще, создаваемую ценность.
Естественно, что отрасль сплотилась вокруг этого сдвига, вводя метрики, такие как токены в секунду, стоимость за токен и даже доход за токен. Казалось бы, мы наконец нашли способ количественно оценить системы ИИ. Но эта формулировка неполна.
Отраслевая сокращение: токены равны ценности
Растет нарратив, что токены — это новая валюта ИИ — что больше токенов означает больше интеллекта и, следовательно, больше дохода. Это убедительная идея, но она упрощает то, что на самом деле происходит внутри этих систем.
Не все токены равны. Некоторые токены представляют реальную работу: анализ данных, генерация инсайтов, автоматизация рабочих процессов и поддержка решений, которые стимулируют бизнес-результаты. Другие намного менее значимы — непринужденная генерация контента, эксперименты или варианты использования, которые никогда не выходят в производство.
Вы уже можете увидеть это внутри предприятий. Одна команда может сгенерировать миллионы токенов для поддержки производительности разработчиков или операций клиентов, напрямую влияя на эффективность и доход. Другая команда может сгенерировать тот же объем, экспериментируя с инструментами, которые никогда не выходят за пределы внутреннего исследования. На бумаге счетчики токенов выглядят идентично. В реальности бизнес-ценность совершенно другая.
Относиться ко всем токенам как к взаимозаменяемым единицам ценности создает искаженное представление о том, что ИИ на самом деле делает внутри организации. Бизнес не строится на объеме токенов; он строится на том, что эти токены позволяют.
Чтобы понять эту разницу, необходимо заглянуть под поверхность и посмотреть, как эти системы на самом деле работают.
Почему ваш второй запрос быстрее вашего первого
Если вы когда-либо использовали инструмент, такой как ChatGPT, вы, вероятно, заметили, что ваш второй вопрос часто быстрее вашего первого. Это поведение не связано с тем, что модель становится умнее — это связано с тем, как система повторно использует контекст из предыдущих запросов.
Современные системы ИИ не обрабатывают каждый запрос изолированно. Они строят контекст, храня предыдущие запросы и ответы в памяти, часто в том, что называется кэшем KV. Этот кэш находится рядом с GPU, чтобы он мог быть быстро доступен при генерации последующих ответов.
Первый запрос дорог, потому что он инициализирует это состояние — выделяет память, обрабатывает входные данные и строит контекст. Последующие запросы повторно используют это состояние, что снижает задержку и улучшает отзывчивость.
Эта динамика становится более важной, когда окна контекста расширяются от тысяч до сотен тысяч — или даже миллионов — токенов. Чем больше контекста система сохраняет, тем больше давления она оказывает на память и инфраструктуру, что делает критически важным решить, что хранить, сжимать или удалять.
С точки зрения пользователя, кажется, что система работает быстрее. С точки зрения инфраструктуры это сложный компромисс между памятью, задержкой и стоимостью.
Вот где происходит настоящая работа: не только в самой модели, но и в системе, окружающей ее.
Окончательное ограничение: энергия
Как только вы переходите за пределы производительности модели, разговор быстро меняется.
Команды, запускающие ИИ в крупном масштабе, не спрашивают в первую очередь, какая модель лучше. Они спрашивают, как поддерживать ее.
Инфраструктура ИИ давит на физические пределы: доступность энергии, охлаждение и пропускная способность памяти. Центры обработки данных перестраиваются вокруг этих ограничений, и организации, развертывающие крупномасштабные системы ИИ, начинают работать более как коммунальные предприятия, чем традиционные компании по разработке программного обеспечения.
Мы уже видим это в крупных корпорациях, строящих инфраструктуру ИИ, где электроэнергия и охлаждение — а не возможности модели — становятся основным ограничением.
Нагрузки ИИ не масштабируются чисто или предсказуемо. Они накапливают спрос на вычисления, память и сеть в одно и то же время. Генерация большего количества токенов не просто вопрос добавления большего количества GPU; это вопрос о том, может ли основная инфраструктура выдержать энергию и тепловую нагрузку, необходимые для поддержания эффективной работы этих систем.
Стоимость генерации токена поэтому выходит за рамки вычислений. Она включает электроэнергию, охлаждение, физическую инфраструктуру и способность поддерживать производительность под нагрузкой без ухудшения.
Большинство обсуждений «стоимости за токен» не полностью отражают эту реальность. В крупном масштабе энергия становится бюджетом, а не просто еще одной статьей расходов.
Будущее не в больших моделях. Это в лучших системах.
В течение последних двух лет отрасль была сосредоточена на сравнениях моделей, изучая бенчмарки, рейтинги и инкрементные улучшения возможностей.
Этот фокус начинает смещаться.
В производственных средах производительность менее связана с выбором модели и более связана с тем, как ее использовать. Организации переходят к системам моделей — объединяя крупные и мелкие модели, маршрутизируя задачи умно и оптимизируя стоимость, задержку и пропускную способность на протяжении всего рабочего процесса.
Вместо отправки каждого запроса на одну большую модель системы разбивают рабочие нагрузки на более мелкие компоненты. Простые задачи могут быть обработаны более эффективными моделями, а более сложные рассуждения зарезервированы для более крупных. Контекст повторно используется, когда это возможно, и стратегии кэширования применяются агрессивно.
Эти решения часто имеют большее влияние на производительность и стоимость, чем переключение с одной модели на другую. В этом смысле токены остаются единицей работы, но система, которая генерирует и управляет ими, становится настоящим дифференциатором.
Наиболее упускаемый слой в системах ИИ
ИИ часто описывается в терминах моделей с одной стороны и приложений с другой, но слой между ними — это где живет большинство сложностей и возможностей.
Этот слой не только передвигает запросы; он формирует их. Он определяет, как течет трафик, как принимаются решения и как системы ведут себя в реальных условиях.
Доставка и безопасность не могут быть рассмотрены как отдельные проблемы здесь. Та же самая прослойка, которая маршрутизирует запросы и управляет контекстом, также является местом, где применяются политики, смягчаются риски и устанавливается доверие.
По мере роста сложности разрушаются отдельные решения. Что необходимо, так это унифицированная платформа, которая может координировать эти функции в реальном времени, а не шить их вместе после факта.
Вот где делаются компромиссы. Это то место, где контролируется стоимость, оптимизируется производительность и принимаются решения о безопасности в реальном времени. По мере масштабирования систем ИИ этот слой становится все более важным. Это разница между системой, которая работает хорошо в демонстрации, и системой, которая работает надежно и эффективно в производстве. Этот сдвиг имеет реальные последствия для того, как организации проектируют и управляют системами ИИ.
Что это значит для организаций
Когда предприятия переводят ИИ в производство, вопрос не только в том, какую модель использовать — это вопрос о том, как система вокруг нее спроектирована для работы.
Это означает мышление за пределами метрик токенов и бенчмарков моделей и сосредоточение внимания на том, как маршрутизируются запросы, как управляется контекст и как применяются политики на протяжении всего рабочего процесса.
Большинство организаций все еще шьют эти кусочки вместе — и этот подход не выдерживает реального производственного давления.
Мы измеряем не то
Токены предоставляют полезную абстракцию. Они дают отрасли способ количественно оценить что-то, что когда-то казалось неосязаемым, но они не являются полной картиной.
В настоящее время отрасль склоняется к тому, что легко измерить — счетчикам токенов, пропускной способности и метрикам стоимости — а не к тому, что имеет наибольшее значение. Без контекста эти цифры могут быть вводящими в заблуждение.
Следующая фаза ИИ не будет определяться тем, кто генерирует наибольшее количество токенов. Она будет определяться тем, кто понимает, что эти токены представляют, и кто может построить системы, которые превращают их в осмысленные, эффективные и масштабируемые результаты.
Потому что в конце концов токены не являются продуктом. Они просто являются побочным продуктом создания интеллекта.












