Modelos e plataformas de IA

Anthropic vincula o preço do Claude Opus 5.5 a sessões de codificação mais longas

mm
Adicione Unite.AI às suas fontes preferidas no Google

A Anthropic informou em 24 de setembro de 2026 que as sessões do Claude Code ficaram mais longas e com mais contexto nos últimos seis meses, detalhando em uma postagem no blog da Claude como a precificação e os mecanismos de cache do Claude Opus 5.5 abordam essa mudança. A empresa estima que o custo operacional do Opus 5.5 seja aproximadamente 40% inferior ao do Opus 5 para uma carga de trabalho típica cobrada por token.

Seis meses de dados de uso do Claude Code

A publicação, escrita por Michael Segner, baseia‑se em dados agregados de uso que cobrem de março a setembro de 2026. O número de prompts por sessão permaneceu estável, relata a publicação, enquanto o trabalho dentro de cada prompt aumentou: o modelo agora trabalha 3,3 vezes mais tempo por prompt e realiza mais de 40% de chamadas de modelo a mais em cada um, e as interrupções caíram 68%. Os desenvolvedores agora conectam um servidor de ferramentas ou utilizam uma habilidade cerca de duas vezes mais frequentemente, e colam texto em prompts um terço menos vezes.

A quantidade de contexto em cada solicitação aumentou 2,6 vezes ao longo do período, e a proporção de tokens de entrada para saída passou de 189:1 para 324:1. A Anthropic interpreta esses números como desenvolvedores que buscam um modelo que trabalhe mais tempo e esteja melhor informado para tarefas maiores e mais abertas, e afirma que a economia proporcionada pelo Opus 5.5 é maior exatamente nessas sessões mais longas e de alto contexto, quando o uso é cobrado por token.

A análise se baseia no lançamento do Claude Opus 5.5 pela Anthropic, que chegou com preços mais baixos que o Opus 5. Enquanto o lançamento definiu os preços, a publicação de 24 de setembro e uma análise complementar publicada em 22 de setembro de 2026 por Addy Osmani examinam o que esses preços significam para cargas de trabalho reais do Claude Code.

Preços de tokens e a redução da leitura de cache

Para uso cobrado por token, a Anthropic reduziu os preços dos tokens de entrada e saída em 20% e diminuiu o preço da leitura de um token em cache em 60%. A empresa afirma que a redução da leitura de cache tem o maior impacto porque as leituras de cache representam a maior parte do custo do trabalho agente e de codificação, e afirma que, na data da publicação, um token em cache no Opus 5.5 custa um quinto do preço dos modelos concorrentes e os supera.

A análise complementar de Osmani lista os preços da API do Opus 5.5 em US$ 4 por milhão de tokens de entrada, US$ 20 por milhão de tokens de saída e US$ 0,20 por milhão de leituras de cache. A esses preços, uma leitura em cache custa 5 % de um token de entrada novo, enquanto gravar no cache custa 1,25 vezes o preço de entrada para um cache de cinco minutos e duas vezes o preço de entrada para um cache de uma hora, com cada acesso renovando a vida útil gratuitamente. Nos planos Pro, Max ou Team, o preço mais baixo do Opus 5.5 é repassado aos limites do plano, permitindo cerca de 25 % mais uso em comparação ao Opus 5; o desconto adicional para leitura de cache se aplica apenas à precificação da API.

Aproveitar mudanças que protegem o cache

Mesmo com o contexto por solicitação aumentando aproximadamente 2,6 vezes, a parcela de entrada que não utiliza o cache caiu mais de 50 % ao longo do período de seis meses, relata a publicação. Ela credita uma série de mudanças no Claude Code que reduzem quebras acidentais de cache, abrangendo pequenas interrupções como um refresh de login e maiores como a inserção de instruções no meio da conversa ou o carregamento de ferramentas sob demanda. No Opus 5.5 e no Fable 5.1, os desenvolvedores também podem alterar os níveis de esforço durante a sessão sem redefinir o cache.

A documentação de cache de prompts oficial especifica que o comportamento de nível de esforço se aplica com uma chave de API ou uma assinatura Claude, e não na Amazon Bedrock, na Plataforma de Agentes do Google Cloud ou em um gateway de aplicativos Claude, nem quando a bandeira CLAUDECODEDISABLEEXPERIMENTALBETAS está ativada ou uma organização possui configuração HIPAA.

Desenvolvedores com chaves de API e provedores de nuvem agora podem definir um tempo de vida de cache de uma hora, que os assinantes já possuíam. A documentação mostra os padrões: uma hora para a conversa principal em uma assinatura Claude dentro do uso do plano, e cinco minutos para créditos de uso, chaves de API ou provedores de nuvem. A configuração promptCacheTtl ou a variável de ambiente CLAUDECODEPROMPTCACHETTL seleciona o tempo de vida mais longo, e ambos os controles exigem Claude Code v2.1.242 ou posterior.

Subagentes bifurcados agora iniciam a partir do cache da sessão principal em vez de pagar para reprocessar o mesmo contexto. A documentação explica que um fork assume o prompt de sistema do pai, o conjunto de ferramentas e todo o histórico da conversa, de modo que sua solicitação inicial lê diretamente do cache do pai.

Menos turnos por tarefa

A Anthropic relata que o Opus 5.5 pode concluir uma tarefa em menos turnos que outros modelos. Segundo a publicação, a Zeta Labs registrou menos turnos e chamadas de ferramentas por tarefa em comparação ao Opus 5, com quase metade do custo, e finalizou o dobro de suas tarefas mais difíceis.

A publicação alerta que o padrão não se aplicará a todas as tarefas, citando análise de Osmani: “Em uma tarefa bem delimitada, ambos os modelos terminam com aproximadamente o mesmo número de turnos, e o corte de preço é tudo o que se obtém. A diferença deve ser maior em tarefas abertas, onde um modelo pode gastar muitos turnos na ideia errada.”

A Anthropic também relata que o Opus 5.5 produz saída mais de 30 % mais rápido que o Opus 5. O ganho mantém o uso de tokens e a taxa de acertos de cache inalterados; a publicação observa que isso reduz a espera em execuções longas, já que o Claude passa mais tempo trabalhando sem supervisão.

A postagem encerra com práticas para proteger leituras em cache: execute /usage no Claude Code para ver qual parcela de uma sessão está sendo atendida a partir do cache, escolha o modelo quando a sessão começa em vez de mudar no meio, execute a compactação antes de se afastar em vez de depois, e, em uma chave de API ou provedor de nuvem, habilite o tempo de vida de cache de uma hora para sessões longas.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.