Líderes de pensamento
Por que os custos de tokens estão quebrando os orçamentos dos CFOs em 2026

Os custos de tokens de IA passaram de um detalhe tecnológico menor para um problema de orçamento ao nível do conselho em menos de um ano. Doze meses atrás, “custo de token” não era um item nas radar da maioria dos CFOs – agora está aparecendo em todos os lugares errados: nas notícias, memorandos internos, congelamentos de orçamento e teleconferências de resultados.
A Uber concedeu aos seus engenheiros acesso ao Claude Code no final de 2025. Em abril de 2026, a empresa havia consumido todo o seu orçamento anual de codificação de IA em quatro meses. Sua resposta foi limitar os gastos a $1,500 por funcionário, por mês, por ferramenta, como Bloomberg informou inicialmente. Permitir o uso simultâneo de duas ferramentas de codificação agente (por exemplo, Claude e Cursor) faz com que esse teto dobre para $3,000 por mês, ou $36,000 por engenheiro ao ano, para o uso de IA de uma pessoa. Estima‑se que a Uber tenha aproximadamente 4,000 engenheiros, o que equivaleria a um gasto de $144M em IA.
Os gastos da Meta podem ser maiores. Um memorando interno alertou que os custos de tokens de IA estavam a caminho de atingir bilhões de dólares em 2026. O motivo está na mecânica de como os agentes operam em escala. Quando um agente de IA se conecta a um código‑fonte para corrigir um bug ou escrever software, ele processa milhares de tokens de contexto de fundo a cada prompt. Agora, coloque isso dentro de uma organização do tamanho da Meta, adicione um impulso corporativo para que a engenharia use o Claude, e o uso de tokens não apenas cresce, explode.
De acordo com Índice de IA da Ramp, que acompanha pagamentos reais de fornecedores em mais de 70.000 empresas, o top 1% das empresas que adotam IA agora estão gastando aproximadamente $7.500 por empregado, por mês, em IA, e esse gasto está crescendo 14,1% mês a mês. Executivos da startup de recrutamento de IA Mercor tiveram dito publicamente que os custos de token de IA estão começando a se aproximar, ou exceder, a remuneração dos funcionários em algumas organizações.
Há uma lição a ser tirada aqui. Se as maiores empresas de tecnologia do mundo podem se surpreender com essa despesa, qualquer pessoa pode. O consumo de tokens tornou‑se uma categoria de despesa genuinamente nova, que não existia em nenhum P&L há dois anos. Ela não se comporta como os custos de software que as equipes financeiras passaram décadas aprendendo a modelar e incluir nos cálculos tradicionais de ROI. Compreender por que os custos de tokens de IA se comportam de forma tão diferente dos gastos tradicionais com software é o primeiro passo para controlá‑los.
Por que os custos de tokens de IA são tão difíceis de prever
O orçamento de software tradicional baseia‑se em uma suposição simples: o custo escala com o número de funcionários. Mais dez empregados significam dez assentos a mais, a um preço conhecido. Fácil de prever e planejar à medida que as empresas crescem ou licenciam novas plataformas de software.
Os tokens de IA quebram essa suposição. O custo escala com o uso, não com o número de funcionários, e o uso é extremamente desigual, difícil de prever e, no caso de agentes autônomos, nem mesmo está ligado a um ser humano sentado em um teclado. Um único engenheiro executando uma sessão de codificação agente pode gastar milhares de dólares em um mês sem aviso, porque o medidor está rodando independentemente de o resultado ser útil ou não. Muitos modelos também geram milhares de tokens ocultos e invisíveis apenas para “pensar” passo a passo antes de responder, multiplicando o custo por prompt.
Essa é a parte que a maioria das organizações não contabilizou: cada dólar de gasto novo com IA agente tem que vir de algum lugar. Para a maioria dos CFOs, isso não é um erro de arredondamento absorvido por um fundo de inovação; estamos falando de milhões de dólares em novos gastos que não existiam há dois anos. Isso se torna uma troca real contra o número de funcionários, outros investimentos em tecnologia ou orçamento discricionário em outras áreas da empresa.
Os três níveis de risco de gastos com IA empresarial
Ao observar como as organizações realmente gastam com IA, podemos ver um padrão mais claro surgindo. O risco de custos de IA não está distribuído de forma uniforme. Ele se concentra em locais específicos, e provavelmente apenas um dos três está atualmente sob controle em uma organização típica hoje.
Os usuários de negócios em vendas, marketing e operações utilizam principalmente ferramentas precificadas por assento: de $20 a $30 por usuário, por mês, de forma fixa. Esse é o nível que as finanças já sabem como orçar, porque ele se comporta exatamente como qualquer outro item SaaS que compraram nos últimos vinte anos.
Desenvolvedores que utilizam ferramentas de codificação agente são a origem das histórias ao estilo Uber e toda a categoria acabou de mudar de taxa fixa para precificação por medição. GitHub Copilot mudou para cobrança baseada em tokens em junho de 2026, e os desenvolvedores projetam faturas que saltam de $29 para $750 por mês, e de $50 para $3,000 por mês em sessões intensivas de agentes. A Uber não é um caso isolado aqui; é um vislumbre precoce de para onde a categoria inteira está caminhando.
Os agentes autônomos são o nível que quase ninguém modelou ainda. Não há conceito de “assento” para um agente. Ele funciona sem supervisão, cria sub‑agentes, tenta novamente em caso de falha e consome tokens o tempo todo, independentemente de produzir algo de valor. Essa é a camada com menos dados de custo e menos precedentes de orçamento.
Simplificando: o nível com o qual os CFOs se sentem mais à vontade também é o de menor risco financeiro. Os dois níveis que realmente estão estourando orçamentos são aqueles que se afastam da precificação previsível exatamente no momento em que o uso está crescendo mais rapidamente.
Fechando a lacuna de gestão de custos de IA
O ponto em comum entre Uber, Meta e o conjunto de dados mais amplo da Ramp é a falta de visibilidade. A maioria das organizações não possui uma camada entre um funcionário ou agente que abre uma ferramenta. Limites de gasto como os da Uber são uma solução brusca e posterior para um problema que realmente requer algo a montante.
Essa é a lacuna que uma categoria mais nova de ferramentas, frequentemente chamada de orquestração de agentes ou gateways de agentes, foi criada para preencher: direcionar cada tarefa ao modelo mais barato capaz de executá‑la, impor limites de gasto antes que sejam ultrapassados e fornecer ao financeiro um medidor em tempo real em vez de uma surpresa mensal.
Esta categoria está evoluindo rapidamente e já está se dividindo em algumas camadas distintas. Uma camada são gateways controlados por custo, que ficam entre as aplicações da organização e seus provedores de modelo, adicionando limites de gasto por equipe, roteamento automático para modelos mais baratos para tarefas simples e cache de respostas, os mesmos mecanismos que a Uber aplicou manualmente quando impôs seu limite. Uma segunda camada é a orquestração de agentes, que se concentra em coordenar múltiplos agentes trabalhando juntos, com visibilidade de custo cada vez mais incorporada em vez de adicionada posteriormente. E uma camada mais nova, voltada para finanças, está começando a tratar os gastos com IA da forma como as equipes de FinOps há muito tempo tratam os gastos com nuvem: atribuídos por equipe e recurso, orçados e revisados mensalmente em vez de descobertos depois do fato.
Então há uma abordagem arquitetural que visa limitar os gastos reduzindo a dependência de grandes LLMs. Algumas empresas começaram a criar uma arquitetura híbrida SLM/LLM, onde pequenos modelos de linguagem são treinados para um conjunto restrito de tarefas corporativas (por exemplo, políticas internas, atendimento ao cliente, processamento de documentos de empréstimo, análise de manifestos de embarque). A economia pode ser atraente.
De acordo com uma comparação de LLMs corporativos de 2026, com um milhão de conversas mensais, os custos dos LLMs de ponta hospedados variam de US$ 15.000 a US$ 75.000 por mês, enquanto um pequeno modelo de linguagem ajustado finamente e implantado internamente custa de US$ 150 a US$ 800 por mês no mesmo volume. Goldman Sachs, por exemplo, gerencia os gastos com IA em escala por meio de um gateway de modelo centralizado que classifica cada solicitação por tipo de tarefa e a encaminha para o modelo mais econômico para o trabalho, desde modelos leves de código aberto até LLMs de ponta, tudo dentro de seu próprio perímetro de segurança.
O ponto em comum é que a maioria das ferramentas atuais foi construída por e para engenheiros, para turbinar sua produtividade por meio do uso de agentes. A camada que a maioria das organizações ainda não tem é a que foi criada para responder diretamente à pergunta de um CFO: qual equipe, qual orçamento, como prever despesas e qual caso de uso de negócios é suportado por esse gasto? Essa é a lacuna que provavelmente será mais importante à medida que os gastos com IA agente continuarem a se acumular.
Há dois anos, nada disso existia como um item de linha. Hoje, os custos de tokens de IA são um dos itens de balanço que mais crescem e menos compreendidos, e a gestão de custos de IA está rapidamente se tornando uma disciplina financeira central, em vez de um projeto paralelo. Vimos uma história semelhante quando a nuvem foi adotada inicialmente e os custos explodiram na primeira onda. As organizações que planejam implantações de IA agente fariam bem em ter essa conversa entre engenharia e finanças agora e definir uma abordagem de gestão. Uber e Meta já demonstraram o que acontece quando você lida com isso depois do fato, em vez de antes.












