Modelos e plataformas de IA

OpenAI e Anthropic Lançam Modelos Rivais à Medida que a Corrida Armamentista de IA se Intensifica

mm
Adicione Unite.AI às suas fontes preferidas no Google

OpenAI e Anthropic lançaram novos modelos de bandeira dentro de minutos um do outro hoje, enquanto OpenAI lançou simultaneamente uma plataforma de agente empresarial e Perplexity introduziu um recurso de pesquisa de modelo múltiplo. Hoje trouxe mais anúncios significativos de produtos de IA em uma única tarde do que a maioria das semanas produz no total.

Aqui está o que foi lançado e o que isso significa.

Opus 4.6 da Anthropic: Equipes de Agentes e uma Janela de Um Milhão de Tokens

A Anthropic lançou Claude Opus 4.6, seu modelo mais capaz, com duas características de destaque: uma janela de contexto de um milhão de tokens e uma nova capacidade chamada Equipes de Agentes.

A janela de contexto é o maior feito técnico. Com um milhão de tokens, Opus 4.6 pode processar aproximadamente 3.000 páginas de texto em uma única solicitação — quatro vezes o limite de 256.000 tokens de seu antecessor. Combinado com o suporte a saída de 128.000 tokens, o modelo agora pode ingerir e trabalhar com entire bases de código, arquivos regulamentares ou corpora de pesquisa sem divisão ou resumo.

Equipes de Agentes, disponíveis no Claude Code, permitem que várias instâncias do Claude trabalhem em paralelo em uma base de código compartilhada. Em vez de um único agente executar tarefas sequencialmente, os desenvolvedores podem criar equipes onde um agente lida com alterações no frontend, outro escreve testes e um terceiro refatora a lógica do backend — todos coordenando no mesmo projeto simultaneamente.

Opus 4.6 também introduz o pensamento adaptativo, que permite que o modelo calibre quanto esforço de raciocínio investir em uma solicitação determinada. Perguntas simples recebem respostas rápidas; problemas complexos desencadeiam um pensamento mais profundo e prolongado. Os desenvolvedores podem ajustar isso por meio de controles de esforço em quatro níveis: baixo, médio, alto e máximo.

Nos benchmarks, Opus 4.6 alcança a pontuação mais alta no Terminal-Bench 2.0 para codificação agente e lidera o Exame Final da Humanidade, uma avaliação de raciocínio complexo. A Anthropic afirma uma vantagem de 144 pontos Elo sobre o GPT-5.2 na avaliação GDPval-AA e uma melhoria de 190 pontos em relação ao Opus 4.5.

O preço da API permanece inalterado em $5 por milhão de tokens de entrada e $25 por milhão de tokens de saída, embora as solicitações que excedam 200.000 tokens tenham uma taxa premium de $10/$37,50.

Em uma movimentação notável de empresa, a Anthropic anunciou uma pré-visualização de pesquisa do Claude no Microsoft PowerPoint, onde o modelo pode ler layouts e modelos de slide existentes e gerar ou editar apresentações preservando o formato de marca.

GPT-5.3-Codex da OpenAI: O Modelo que Ajudou a Construir a Si Mesmo

Minutos após o anúncio da Anthropic, a OpenAI lançou o GPT-5.3-Codex, seu modelo de codificação mais capaz. O lançamento une o desempenho de codificação de fronteira do GPT-5.2-Codex com as capacidades de raciocínio e conhecimento profissional do GPT-5.2 em um único sistema que também é 25% mais rápido.

A afirmação mais notável: o GPT-5.3-Codex ajudou a construir a si mesmo. A equipe Codex da OpenAI usou versões iniciais do modelo durante o seu próprio processo de treinamento — depurando execuções de treinamento, gerenciando infraestrutura de implantação e diagnosticando resultados de avaliação. É o primeiro reconhecimento público da OpenAI de que um modelo foi instrumental em seu próprio desenvolvimento, um marco que levanta questões tanto de eficiência quanto de segurança.

O GPT-5.3-Codex estabelece novos recordes da indústria no SWE-Bench Pro e Terminal-Bench, benchmarks que avaliam tarefas de engenharia de software do mundo real. O modelo pode lidar com tarefas de longa execução que envolvem pesquisa, uso de ferramentas e execução complexa, e os usuários podem interagir com ele no meio da tarefa sem perder o contexto — mais como colaborar com um colega de trabalho do que emitir comandos.

O modelo está disponível agora para todos os usuários do plano pago do ChatGPT por meio do aplicativo Codex, CLI, extensão de IDE e interface web. O acesso à API está por vir.

Para os desenvolvedores que escolhem entre geradores de código de IA, a imagem competitiva agora está nitidamente definida: Opus 4.6 lidera na coordenação de agentes e no trabalho de contexto de longo prazo, enquanto o GPT-5.3-Codex enfatiza velocidade e raciocínio integrado. Ambos reivindicam as melhores marcas em benchmarks sobrepostos, e ferramentas como Cursor e Xcode da Apple (AAPL ) suportam ambos, então os desenvolvedores podem mudar livremente.

Frontier da OpenAI: Agentes Empresariais Ganham Sua Própria Plataforma

Ao lado do lançamento do modelo, a OpenAI introduziu o Frontier, uma plataforma empresarial para construir, implantar e gerenciar agentes de IA. O Frontier se conecta a bancos de dados, sistemas de CRM, plataformas de RH, ferramentas de ticketing e outros aplicativos empresariais, e então permite que os agentes de IA executem processos através deles.

A OpenAI descreveu o Frontier como “uma camada semântica para a empresa” onde os funcionários humanos e os agentes de IA operam na mesma plataforma com acesso compartilhado a dados e controles de segurança. Os agentes recebem identidades semelhantes às dos funcionários, contexto organizacional compartilhado e permissões de nível empresarial.

A plataforma é agnóstica em relação ao modelo — as empresas podem gerenciar agentes construídos com base nos modelos da OpenAI ao lado daqueles da Google (GOOGL ), Microsoft e Anthropic. Os primeiros clientes incluem Intuit (INTU ), State Farm, Thermo Fisher e Uber.

O Frontier posiciona a OpenAI para competir diretamente com plataformas empresariais como o Agentforce da Salesforce (CRM ) e os agentes de IA da ServiceNow. A diferença: a OpenAI está construindo a partir da camada do modelo para cima, enquanto os incumbentes estão adicionando IA às ferramentas de fluxo de trabalho existentes. Se as empresas preferem sua infraestrutura de agente vinda de seu provedor de IA ou de seu fornecedor de software definirá a competição de IA empresarial em 2026.

Conselho de Modelo da Perplexity: Três Modelos, Uma Resposta

A Perplexity lançou o Model Council, um recurso que executa a mesma consulta em três modelos simultaneamente — Claude Opus, GPT e Gemini — e, em seguida, usa um modelo de síntese para reconciliar suas saídas em uma única resposta que sinaliza áreas de concordância e discordância.

Imagem: Perplexity

O pressuposto é que nenhum modelo único é confiavelmente o melhor em todas as consultas. Quando três modelos de fronteira convergem para a mesma resposta, a confiança é alta. Quando eles divergem, os usuários sabem que devem investigar mais a fundo. O Model Council está disponível para assinantes do Max e é posicionado para pesquisa de investimento, análise estratégica e tomada de decisões complexas.

O recurso reflete a estratégia da Perplexity de se diferenciar por meio da orquestração de vários modelos, em vez de construir modelos de base. À medida que a lacuna entre os chatbots de IA de fronteira se estreita em benchmarks individuais, agregar suas saídas pode provar ser mais valioso do que escolher um único fornecedor.

O Que Tudo Isso Significa

Esses lançamentos confirmam que a competição de IA mudou de capacidade do modelo para infraestrutura de produto. Tanto a OpenAI quanto a Anthropic têm modelos que lideram os mesmos benchmarks; a diferenciação agora vive no que você pode construir em cima deles.

A Perplexity, entretanto, está fazendo um argumento silencioso de que as guerras de modelo podem ser menos importantes do que como você combina modelos. Se o Model Council provar ser útil, sugere que o futuro não é escolher entre Claude e GPT — é usar ambos.

Para os desenvolvedores e empresas que avaliam sua pilha de IA, isso acabou de tornar a decisão mais difícil.

Alex McFarland é um jornalista e escritor de IA que explora os últimos desenvolvimentos em inteligência artificial. Ele colaborou com inúmeras startups de IA e publicações em todo o mundo.