Modelos e plataformas de IA

O DeepSeek Lança o V4 Pro como Seu Modelo de Bandeira Deixa a Visualização

mm
Adicione Unite.AI às suas fontes preferidas no Google

O DeepSeek lançou a versão de produção do seu modelo de bandeira, o DeepSeek V4 Pro, encerrando um período de visualização que durou quase quatro meses. A compilação, designada V4 Pro 0813, apareceu em 12 de agosto de 2026, como a versão de disponibilidade geral na página de modelos do OpenRouter, e a documentação da API do próprio DeepSeek agora lista o DeepSeek-V4-Pro-0813 como a versão do modelo por trás do endpoint deepseek-v4-pro.

A economia da API é a mesma da visualização: $0,435 por milhão de tokens de entrada em uma falha de cache, $0,003625 por milhão em uma acerto de cache, e $0,87 por milhão de tokens de saída, com uma janela de contexto de um milhão de tokens e uma saída máxima de 384.000 tokens. A página de preços do DeepSeek confirma a string de versão 0813, os preços e um limite de concorrência de 500 para o endpoint Pro em comparação com 2.500 para Flash.

O GA encerra uma implantação em etapas que o DeepSeek executou em público desde a primavera. A empresa visualizou a série V4 em 24 de abril de 2026, enviando pesos abertos para os modelos Pro e Flash sob a licença MIT, juntamente com o acesso à API. Em 31 de julho de 2026, ela promoveu o modelo Flash menor para o status oficial e disse em seu registro de alterações que o lançamento oficial do Pro “seguiria em breve.” Essa continuação é o que aterrissou com a compilação 0813.

O que a Compilação 0813 Está Sentada

O V4 Pro é um sistema de mistura de especialistas com 1,6 trilhão de parâmetros totais e 49 bilhões de ativos por token, de acordo com o cartão do modelo no Hugging Face. A arquitetura combina duas variantes de atenção que o DeepSeek chama de Atenção Comprimida Esparsa e Atenção Comprimida Pesadamente, que a empresa afirma reduzir a inferência de computação de token único para 27 por cento e o cache KV para 10 por cento do que a geração V3.2 precisava na configuração de um milhão de tokens. Ambos os modelos V4 foram pré-treinados em mais de 32 trilhões de tokens, com treinamento pós-treinamento que cresce especialistas específicos de domínio separadamente e, em seguida, os consolida em um modelo único por meio de destilação de política.

Os pesos abertos para as compilações de visualização estão disponíveis para download desde abril, e o repositório Pro registrou mais de 1,4 milhão de downloads no último mês no Hugging Face. O cartão recomenda uma janela de contexto de pelo menos 384.000 tokens ao executar o modo de raciocínio máximo do modelo localmente.

Os Números que o DeepSeek Está Apresentando

As principais alegações de avaliação são relatadas pelo fornecedor, do cartão do modelo e das próprias corridas do harness da empresa. Em seu esforço máximo de raciocínio, que o DeepSeek rotula V4-Pro-Max, o cartão relata:

  • Verificado SWE-bench: 80,6 por cento resolvido
  • Banco de Terminal 2.0: 67,9 por cento de precisão
  • GPQA Diamante: 90,1 por cento pass@1
  • Último Exame da Humanidade: 37,7 por cento pass@1
  • MMLU-Pro: 87,5 por cento
  • LiveCodeBench: 93,5 por cento pass@1
  • Avaliação do Codeforces: 3.206
  • MRCR em um milhão de tokens: 83,5 MMR

A tabela de comparação do cartão coloca essas pontuações contra sistemas de fronteira nomeados: V4-Pro-Max é superado pelo GPT-5.4 no esforço xHigh no Banco de Terminal 2.0 (67,9 para 75,1) e pelo Gemini-3.1-Pro no Último Exame da Humanidade (37,7 para 44,4), enquanto registra as pontuações mais altas da tabela para LiveCodeBench e Apex Shortlist. No SWE-bench Verificado, ele fica em 80,6, nivelado com o Gemini-3.1-Pro e uma fração atrás do Claude Opus 4.6 em 80,8. Nenhuma dessas colunas foi replicada por um avaliador independente para a compilação 0813.

A API expõe três modos de operação (não pensamento, um alto esforço de raciocínio e um esforço máximo que a documentação descreve como “empurrando o limite da capacidade de raciocínio do modelo”) e suporta o formato de conclusões de chat da OpenAI, o formato de mensagens da Anthropic e a API de respostas do próprio DeepSeek, com chamada de ferramenta e saída JSON em ambos os Pro e Flash.

Como o DeepSeek Chegou Aqui

O GA do Pro completa a segunda metade de uma estratégia de lançamento que colocou o modelo mais barato em primeiro lugar. Quando o V4-Flash foi oficial em 31 de julho de 2026, o DeepSeek publicou resultados de benchmark de agente que mostravam a compilação re-treinada Flash superando o V4-Pro-Preview em suas suítes de agente de codificação internas, uma movimentação deliberada que fez do modelo menor o padrão para cargas de trabalho de agente enquanto o modelo de bandeira permanecia em visualização. A compilação 0813 é a resposta do modelo de bandeira, e ela chega com a janela de contexto, o teto de saída e o conjunto de recursos do endpoint Pro inalterados em nome. A mudança é que o rótulo de visualização desapareceu.

A postura de preços merece atenção. Um aviso na página de preços do DeepSeek afirma que a empresa planeja “um aumento significativo” nos preços gerais da API em um futuro próximo, com detalhes a serem divulgados por meio de um aviso oficial. Por enquanto, as taxas listadas do V4 Pro permanecem nos níveis de visualização, e o preço médio pago efetivamente por meio do OpenRouter fica bem abaixo do preço de lista de $0,435, o que o OpenRouter atribui ao cache e aos descontos.

O DeepSeek passou o último ano construindo a partir do modelo em si: a série V4 é treinada em torno das cargas de trabalho de agente (assistente de codificação, automação de várias etapas, síntese de documentos longos) que o anúncio de visualização de abril disse que já impulsionam o desenvolvimento interno da empresa. Os laboratórios de pesos abertos chineses têm enviado modelos de bandeira em um ritmo quase mensal, desde o Kimi K3 da Moonshot até o M2.7 do MiniMax, e o GA do V4 Pro é a oferta do DeepSeek para manter seu modelo de bandeira à frente desse grupo.

O que Vem a Seguir

O item aberto é o novo peso. Os repositórios do Hugging Face ainda hospedam as compilações de visualização de abril, e a tabela de download do cartão do modelo aponta para esses artefatos; o DeepSeek não anunciou um cronograma para publicar os pesos 0813 ou disse se a compilação GA difere da visualização além do treinamento pós-treinamento. A cadência declarada da empresa para a linha V4, de acordo com seu registro de alterações, passa primeiro pela API.

No lado comercial, o aviso na página de preços compromete o DeepSeek a um anúncio oficial de seu plano de preços revisado, com o aumento se aplicando a todos os serviços da API. Até que o aviso seja emitido, o deepseek-v4-pro continua a servir a compilação 0813 às taxas publicadas em 12 de agosto de 2026 — $0,435 de entrada, $0,87 de saída, por milhão de tokens, com um milhão de tokens de contexto.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.