Modelos e plataformas de IA

Anthropic lança Claude Sonnet 5.5 com preço do Sonnet 5 inalterado

mm
Adicione Unite.AI às suas fontes preferidas no Google

Anthropic lançou Claude Sonnet 5.5 em 28 de setembro de 2026, o segundo modelo da família Claude 5.5. O modelo mantém o preço do Claude Sonnet 5 em US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, e a Anthropic afirma que ele gera resultados mais de 30 % mais rápido, custando até 30 % menos por tarefa em seus testes.

Em seu anúncio de lançamento, a Anthropic descreveu o Sonnet 5.5 como um complemento mais rápido e de menor custo ao Claude Opus 5.5, que a empresa afirma ser projetado para trabalhos complexos que exigem julgamento cuidadoso. O Sonnet 5.5 tem melhor desempenho em tarefas cotidianas bem definidas, correção de bugs e produção de documentos, slides e planilhas polidos, disse a Anthropic, acrescentando que também possui um olhar apurado para design.

O Claude Sonnet 5.5 está disponível em todas as plataformas, incluindo Amazon Web Services, Google Cloud e Microsoft Azure, sob o ID de modelo claude-sonnet-5-5, e é oferecido com retenção de dados zero, assim como o Opus 5.5 e o Sonnet 5.

Resultados de Benchmark Reportados

A Anthropic relata que o Sonnet 5.5 obtém 70,6 % no Terminal-Bench 4.0, uma avaliação de codificação agentiva, contra 10,3 % do Sonnet 5, com a pontuação listada do Opus 5.5 de 66,4 % refletindo seu resultado de esforço Xhigh. No conjunto principal do FrontierCode 1.1, o Sonnet 5.5 registra 46,2 % em esforço Máximo e 52,1 % em Xhigh, comparado a 42,4 % do Sonnet 5, 54,4 % do Opus 5.5 e 49,3 % do GPT-6 Sol da OpenAI. As pontuações reportadas do CursorBench 4.0 são 55,5 % para o Sonnet 5.5, 34,1 % para o Sonnet 5 e 57,8 % para o Opus 5.5.

Nas avaliações de trabalho cognitivo, a empresa relata uma pontuação GDPval-AA v2.1 de 1844 para o Sonnet 5.5, dois pontos abaixo dos 1846 do Opus 5.5 e cerca de 400 pontos acima dos 1449 do Sonnet 5, e uma pontuação AA-Briefcase v1.1 de 1811 contra 1822 do Opus 5.5 e 1359 do Sonnet 5. O anúncio também lista 64,5 % com ferramentas no Humanity’s Last Exam, 80,1 % de crédito parcial no OSWorld 2.1 e 61,6 % sem ferramentas no Chartography, um teste de reconhecimento visual de gráficos. A Anthropic afirma que o Sonnet 5.5 é o primeiro modelo Sonnet a superar Pokémon Red trabalhando apenas a partir de capturas de tela.

A empresa adverte que as pontuações de benchmark capturam apenas um aspecto das capacidades de um modelo e afirma que, em seus próprios testes e nos de avaliadores externos, o Opus 5.5 continua claramente mais forte em trabalhos complexos e abertos que exigem julgamento sustentado. Uma nota de rodapé indica que a Artificial Analysis executou o GDPval-AA e o AA‑Briefcase em um deployment pré‑lançamento com um bug de saídas estruturadas que foi corrigido e que, se algo, subestima o desempenho do Sonnet 5.5. Outra nota de rodapé observa que a OpenAI corrigiu recentemente um bug de compreensão de imagens no GPT‑6 Sol, que ainda pode não estar refletido nas pontuações de terceiros.

Resultados de Testadores Iniciais

O vice‑presidente de IA da CodeRabbit, David Loker, afirmou que o Sonnet 5.5 demonstra melhor julgamento que o Sonnet 5 em diferentes níveis de complexidade, consumindo significativamente menos tokens de saída, e que a CodeRabbit planeja migrar revisões simples e moderadas para o modelo agora, com mais nas próximas semanas. O líder de engenharia de IA da Base44, Gabriel Grinberg, relatou que, em 118 construções reais de aplicativos, o Sonnet 5.5 teve uma média de 3,6 iterações por construção contra 7,7 do Opus 5, apresentando o menor número de chamadas de ferramenta falhadas entre todos os modelos comparados pela Base44.

O engenheiro principal do Slack, Curtis Allen, relatou cerca de 14 % menos tokens de saída em avaliações offline do Slackbot sem alterações no prompt. O diretor de IA da Zendesk, Abhinay Kathuria, disse que os tickets foram processados 20 % mais rápido do que com os modelos Claude que a Zendesk utiliza em produção. A Balyasny Asset Management informou cerca de 121 000 tokens por resposta contra 497 000 do Sonnet 5 em um conjunto privado de 2 441 tarefas financeiras. A Box reportou resultados 2,4 vezes mais rápidos com 12 % menos tokens totais, e a Atlassian afirmou que os clientes podem executar os Rovo Agents até 30 % mais rápido do que com o Sonnet 5.

Preço, Velocidade e Migração

As preços listados do Sonnet 5.5 correspondem exatamente aos do Sonnet 5: US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída, US$ 0,20 por milhão de tokens de leitura de cache e US$ 2,50 por milhão de tokens de gravação de cache. O Opus 5.5 tem preços de US$ 4 por entrada, US$ 20 por saída e US$ 5 por gravações de cache. A Anthropic afirma que o Sonnet 5.5 normalmente necessita de muito menos tokens para o mesmo trabalho e é seu modelo Sonnet mais rápido até hoje.

O modelo oferece cinco níveis de esforço recalibrados: baixo, médio, alto, xhigh e max. Os padrões são Médio no Claude Code e nos aplicativos Claude e Alto na Claude Platform, que também é o padrão da API.

O guia de migração da Anthropic lista alterações críticas para desenvolvedores que migram do Sonnet 5. O pensamento adaptativo agora é executado por padrão, a configuração de pensamento desativado retorna um erro 400, e os desenvolvedores que executaram o Sonnet com pensamento desligado devem mudar para o novo entreconfiguração de ferramentas, a mais baixa disponível, antes da migração. A escolha forçada de ferramenta é rejeitada em favor da escolha automática de ferramenta emparelhada com ferramentas estritas, e o prompt cacheável mínimo cai para 512 tokens de 1.024 no Sonnet 5. A documentação também lista cinco categorias de motivos de recusa, abrangendo ciber, bio, frontierllm, raciocínioextração e geralprejuízos, e observa que as tentativas de fallback do lado do servidor repetem apenas as recusas de ciber e frontier_llm no Sonnet 5.

Constatações de Segurança e Salvaguardas

Porque as capacidades cibernéticas do Sonnet 5.5 são comparáveis às do Opus 5, a Anthropic afirmou que ele é o primeiro modelo Sonnet a ser lançado com as salvaguardas cibernéticas e os recursos de fallback usados nos modelos mais avançados da empresa. O system card relata que, com as salvaguardas desativadas, o Sonnet 5.5 teve média de 11,53 sinalizadores de capacidade e taxa de captura de 80% no ExploitBench, produzindo 178 explorações de execução arbitrária de código, contra uma do Sonnet 5. Ele completou 46,1% dos desafios do CyScenarioBench, em comparação com 0,7% do Sonnet 5, e gerou 50 sequestros de fluxo de controle no Benchmark de Exploração Binária, contra 3 do Sonnet 5.

As salvaguardas cibernéticas operam em três etapas: uma sondagem nas ativações internas do modelo, um classificador leve incorporado ao modelo e um classificador LLM treinado separadamente. O cartão relata 99,43% de recall no conjunto de cobertura de danos cibernéticos e taxa de sucesso de ataque de 21,0% na avaliação de robustez de retrocesso do atacante, melhorada em relação a 57,2% do Sonnet 5, ao mesmo tempo alertando os usuários para esperar recusas aumentadas mesmo em tarefas de cibersegurança benignas. Solicitações de maior risco recuam visivelmente para o Sonnet 5, e um Programa de Verificação Cibernética ampliado oferecerá em breve aos defensores verificados acesso em camadas a capacidades avançadas nos modelos Sonnet 5.5, Opus 5.5 e Claude Mythos.

As salvaguardas biológicas são os mesmos classificadores de uso nocivo implantados para o Opus 5, sem modelo de fallback, e o Life Sciences Verification Program da Anthropic cobre o acesso para toda a amplitude de trabalhos de biologia. O Sonnet 5.5 também é o primeiro modelo Sonnet com classificadores de segurança que bloqueiam a extração de raciocínio, e amplia o pensamento preservado de modo que o pensamento de um modelo não possa ser desvinculado da conta que o criou.

Na auditoria comportamental automatizada da Anthropic, que abrange cerca de 1.850 cenários, a empresa relata que o Sonnet 5.5 melhora ou iguala o Sonnet 5 na maioria das métricas de alinhamento, resistência a uso indevido e honestidade, registra a menor taxa de tentativas de fuga de sandbox entre os modelos testados e apresenta um pensamento mais ilegível que muitos modelos anteriores. O system card afirma que o Sonnet 5.5 não ultrapassa novos limites da Política de Escala Responsável, é considerado em conformidade com os limites CB-1 e Autonomy-1 da política e possui um risco avaliado baixo de desalinhamento catastrófico. O corte de conhecimento confiável do modelo é junho de 2026.

A Anthropic afirmou que o Claude Haiku 5.5, desenvolvido para aplicações de alto volume e sensíveis a custos, se juntará à família Claude 5.5 nas próximas semanas.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.