Líderes de pensamento

Modelos abertos continuam melhorando. A economia está ficando mais confusa.

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os modelos de IA obviamente são melhores do que eram há 18 meses. Mas, quando comecei a analisar mais a fundo, as explicações habituais para esse progresso não se sustentavam.

Eles não melhoraram simplesmente porque ficaram maiores. “Código aberto está vencendo” está apenas parcialmente correto. E o conselho de observar as pontuações de benchmarks acabou sendo muito menos útil do que eu esperava. Essa ideia demorou um pouco para eu aceitar.

Então eu reuni 18 meses de dados de 46 modelos de oito laboratórios. Queria entender se a inteligência está se tornando uma commodity, se os modelos abertos estão alcançando a fronteira e o que as empresas devem medir ao escolher os sistemas sobre os quais construirão.

A principal constatação foi simples: uma pontuação de benchmark não é realmente uma propriedade de um modelo. Ela reflete o modelo, o software e o contexto ao seu redor, e quanto tempo e poder de computação lhe foram permitidos. Publicar um único número esconde os outros dois.

As implicações, porém, são muito mais amplas. As empresas estão comparando modelos individuais quando deveriam avaliar o sistema completo que precisa executar o trabalho.

Os benchmarks ocultam o sistema

Quando deixei de observar pontuações compostas e comparei os modelos teste a teste, a diferença entre os principais modelos de peso aberto e os proprietários não era representada por um único número.

No SWE-bench Verified, um teste mais antigo que apareceu em inúmeras divulgações de modelos, a diferença foi de 0,2 ponto. No SWE-bench Pro, um teste mais recente projetado em torno de trabalho de software realista e multilíngue com uma configuração padronizada, foi de 18,2 pontos.

A aparente diferença de modelo depende do benchmark

Benchmark Diferença Status
SWE-bench Verified 0.2 pts Saturado, contaminação sinalizada
GPQA Diamond 2.0 pts Saturado, teto em torno de 92–95%
Terminal-Bench 2.1 4.9 pts Ao vivo, agente
Humanity’s Last Exam 9.8 pts Ao vivo, raciocínio de fronteira
SWE-bench Pro 18.2 pts Ao vivo, estrutura padronizada

Fonte: análise de Jaspreet Singh sobre modelos de peso aberto e proprietários, julho de 2026.

O mesmo modelo também pode receber pontuações diferentes dependendo de quem realiza o teste. O Kimi K3 obteve 80,9% no Terminal-Bench 2.1 em uma avaliação independente e 88,3% quando seu fabricante reportou o resultado. Essa variação de 7,4 pontos é maior que a diferença entre aberto e fronteira em três dos cinco benchmarks que analisei.

Um modelo recebe instruções por meio do software ao seu redor, utiliza o contexto que lhe é fornecido, usa as ferramentas que pode acessar e opera dentro de um orçamento de raciocínio definido pelo desenvolvedor. Alterar essas condições faz com que o resultado mude também.

Benchmarks públicos são úteis para entender a direção do progresso. Eles são uma base fraca para decidir o que funcionará dentro da sua empresa.

A confiabilidade agente altera a matemática

Isso se torna mais importante à medida que a IA passa de responder perguntas para concluir uma sequência de ações.

Considere um fluxo de trabalho com 20 etapas, em que a IA acerta cada etapa 95% das vezes. Isso parece confiável. Contudo, ao longo de toda a sequência, o fluxo de trabalho tem sucesso em apenas 36% das vezes.

Um modelo melhor pode melhorar as chances em cada etapa, especialmente em trabalhos agentes difíceis. É a engenharia ao redor que determina se uma única etapa ruim arruína o trabalho. Salvar o progresso, verificar as saídas, tentar novamente com segurança e recuperar de falhas costuma separar uma demonstração convincente de um produto confiável.

A escolha do modelo ainda importa. Mas o modelo com a melhor pontuação não produz automaticamente o sistema mais confiável.

Escolha modelos de acordo com o trabalho

Os dados sustentam uma conclusão mais restrita do que cada lado do debate aberto versus proprietário costuma apresentar.

Modelos de peso aberto são competitivos para trabalhos bem definidos e de curto prazo, onde o resultado pode ser medido diretamente. Classificação, extração, resumir e geração estruturada cada vez mais se enquadram nessa categoria.

Modelos de fronteira ainda justificam seu preço premium em tarefas agentes mais longas, aderência a instruções sob pressão e trabalhos onde a falha é cara de detectar posteriormente. É aí que benchmarks mais recentes mostram uma diferença próxima a 18 pontos em vez de zero, e onde a camada de segurança fornecida por um fornecedor de modelo tem valor.

As empresas devem selecionar modelos por tarefa, mas não devem presumir que a troca é gratuita. Contexto, raciocínio e caches de prompts não se transferem de forma limpa entre provedores. Um modelo mais barato pode se tornar mais caro se a mudança de sistemas obrigar o trabalho a recomeçar ou acrescentar camadas de engenharia e governança.

A escolha de modelo está se tornando menos permanente. Trocar ainda é uma decisão arquitetônica.

À medida que a inteligência se torna mais barata, o julgamento continua caro

Capacidades gerais competentes estão se tornando extraordinariamente baratas. No topo da curva, porém, cada ponto adicional de desempenho custa mais que o anterior. Os últimos nove pontos de capacidade custam aproximadamente dez vezes o que tudo abaixo deles custa.

A maioria das empresas não precisa do modelo mais poderoso para cada solicitação. Elas precisam saber qual trabalho o justifica.

Resumir, extrair, classificar, redigir e traduzir estão avançando rumo à capacidade utilitária. O que ainda é escasso é o julgamento: saber qual das cinco respostas plausíveis está correta, perceber que a pergunta estava errada e decidir quando parar e solicitar a intervenção humana.

O julgamento provém de contexto proprietário, regras de negócios, fluxos de trabalho, conhecimento histórico e da engenharia que verifica o trabalho e contém falhas.

Construa a avaliação que ninguém mais pode executar

Para uma empresa, o benchmark mais valioso é construído a partir do seu próprio trabalho.

Crie um conjunto de avaliação privado com 50 a 200 tarefas reais da sua empresa. Mantenha o sistema circundante fixo, execute os testes repetidamente e avalie se a tarefa foi concluída corretamente, em vez de quão polida a resposta soa.

Aplique a mesma disciplina ao custo. O custo por token pode ser enganoso quando um modelo raciocina por mais tempo, requer mais tentativas ou gera mais trabalho para um revisor humano. Meça o custo por resultado aceito, em vez disso.

Comece com um número pequeno de modelos. Direcione o trabalho no início de uma tarefa em vez de mudar de provedor no meio dela. Considere a carga de segurança, governança e operacional de cada provedor adicional junto ao seu preço anunciado.

O mercado continuará produzindo novos vencedores de benchmark, e as empresas continuarão tentadas a reconstruir sua estratégia de IA em torno de cada um. Uma abordagem melhor é escolher modelos para o trabalho e, em seguida, avaliar todo o sistema nas condições em que ele deve operar.

O benchmark que deve orientar sua arquitetura é aquele que somente sua empresa pode executar.

Fundador e CEO, Jaspreet Singh, traz uma combinação de visão de produto e experiência como gerente geral e conduziu Druva a se tornar uma das empresas de crescimento mais rápido na indústria multibilionária de proteção e gerenciamento de dados. Seu espírito empreendedor lhe permitiu iniciar a Druva, que agora está avaliada em mais de $2 billion e é confiada mundialmente por milhares de empresas que lideram a adoção da era da nuvem. Seus insights de mercado e tecnologia o levaram a criar a primeira plataforma de proteção de dados nativa da nuvem, que oferece soluções tecnológicas inovadoras e um modelo de consumo distinto, rompendo com um legado de hardware e software envelhecidos.

Antes de fundar a Druva, Jaspreet ocupou cargos fundamentais na Veritas e na Ensim Corp. Além disso, possui várias patentes e tem um B.S. em Computer Science do Indian Institute of Technology, Guwahati.