Modelos e plataformas de IA
Baseten adiciona DeepSeek-V4.1-Flash às APIs de Modelo com contexto de 1M-Token

DeepSeek-V4.1-Flash está disponível agora nas APIs de Modelo da Baseten, Baseten anunciou em 11 de setembro de 2026, trazendo o modelo multimodal de mistura de especialistas (MoE) de 552B parâmetros, que combina 8B de parâmetros ativos para preenchimento prévio com 16B para decodificação em uma janela de contexto de 1M-token, para a plataforma do provedor de inferência.
DeepSeek lançou os pesos abertos do modelo no Hugging Face, e o anúncio da DeepSeek está datado de 9 de setembro de 2026. O modelo aceita entrada de texto e imagem e gera saída de texto, e o cartão do modelo afirma que o repositório e os pesos são licenciados sob a Licença MIT. A Baseten descreve o V4.1-Flash como o terceiro lançamento flash de peso aberto da DeepSeek em 2026 e como o único modelo de sua escala a usar o que a DeepSeek chama de arquitetura Codificadora-Decodificadora Causal. O suporte ao produto de treinamento Loops da Baseten chegará em breve, segundo a empresa.
Resultados de Benchmark Reportados
O cartão do modelo relata resultados de instrução-modelo no ajuste máximo de esforço de raciocínio de 100: V4.1-Flash obtém 90,6 no Terminal-Bench 2.1, comparado a 82,7 para V4-Flash e 87,9 para V4-Pro; 74,2 no DeepSWE v1.1, comparado a 54,4 e 62,7; e 54,8 no AutomationBench, comparado a 37,7 e 43,2. A Baseten destacou as mesmas métricas de codificação e agentes, afirmando que o V4.1-Flash supera o V4-Pro com aproximadamente um terço do total de parâmetros, ao mesmo tempo alertando que 54,8 no AutomationBench indica que o modelo falha em cerca de metade dos fluxos de trabalho complexos e aconselhando as equipes a manter um humano no ciclo para pipelines de agentes.
Na comparação do cartão com modelos de ponta no esforço máximo, o V4.1-Flash registra 90,9 no GPQA Diamond, uma classificação Codeforces de 3471, e 63,9 no HLE com ferramentas. A Baseten afirma que o V4.1-Flash é o primeiro modelo não experimental da DeepSeek com entrada de imagem nativa, capacidade antes limitada ao experimental V4-Flash-Vision-Exp; sua tabela relata 78,9 no Chartography e 49 no ZeroBench para o novo modelo, contra 64,3 e 35 para o experimental.
Arquitetura Codificadora-Decodificadora Causal
De acordo com o cartão do modelo, o V4.1-Flash organiza um Transformer de 40 camadas como um codificador causal de 20 camadas seguido por um decodificador de 20 camadas, com o cache global de chave‑valor (KV) do decodificador projetado a partir dos estados ocultos finais do codificador, em vez de ser derivado dos próprios estados ocultos de cada camada do decodificador. O design ativa 8 B de parâmetros por token durante o preenchimento prévio e 16 B durante a decodificação; a Baseten contrasta isso com o V4-Flash, que ativa 13 B em ambas as etapas, enquadrando a mudança como uma troca de decodificação mais pesada por um preenchimento prévio muito mais leve, uma configuração que, segundo a Baseten, aumenta a eficiência de custo para agentes de codificação cujos loops agentes geram muito mais tokens de preenchimento prévio que tokens de decodificação.
O cartão relata que o Compressed Sparse Attention 2 do modelo atribui a cada camada de atenção um dos três modos estáticos (Full, Reindex ou Reuse), com um Indexador Esparso Hierárquico no decodificador limitando o custo de indexação mais profunda independentemente do comprimento do contexto. Combinado com o cache KV principal FP4, esses designs reduzem o cache KV global para 890 bytes por token, aproximadamente um quarto do V4-Flash, afirma o cartão. Um mecanismo separado, SWA Bounded Replay, reconstrói os estados KV de atenção de janela deslizante ausentes reproduzindo apenas os tokens mais recentes, reduzindo a pegada KV persistente para cerca de um oitavo do V4-Flash. O anúncio da DeepSeek coloca a economia em um quarto da memória HBM e um oitavo do armazenamento SSD da geração anterior.
Cada camada MoE usa um especialista compartilhado e 384 especialistas roteados, com seis especialistas roteados ativos por token, e o modelo adiciona memória condicional Engram com 196 B parâmetros junto ao decodificação especulativa DSpark, conforme o cartão. A DeepSeek treinou o modelo do zero em um corpus multimodal de 45 T tokens, treinou sua atenção esparsa com comprimento de sequência de 64 K e estendeu o contexto para 1 M de tokens em 34 T tokens. O pós‑treinamento segue um ajuste fino supervisionado padrão, aprendizado por reforço, e sequência de destilação on‑policy, com mudanças substanciais concentradas na síntese automatizada em larga escala de tarefas e ambientes de agentes, e o modelo expõe um ajuste de esforço de raciocínio continuamente controlável de 1 a 100.
Transição da API DeepSeek e Servindo na Baseten
A DeepSeek afirma que V4-Flash e V4-Flash-Vision-Exp foram descontinuados em sua plataforma, com os antigos nomes de modelo da API roteando temporariamente para V4.1-Flash por compatibilidade. A nova precificação da API entrou em vigor às 04:00 UTC em 10 de setembro de 2026, com tarifas fora de pico definidas em 50 % das tarifas de pico, e a DeepSeek nomeia os parceiros oficiais WorkBuddy (incluindo CodeBuddy) e OpenCode como totalmente suportando o V4.1-Flash.
A Baseten disse que sua pilha Inference serve o modelo usando NVIDIA Dynamo com roteamento consciente de cache KV, direcionando cada solicitação para a réplica que já possui seu prefixo em vez de qualquer réplica livre. O modelo é oferecido através da Biblioteca de Modelos da Baseten, com implantações dedicadas disponíveis para equipes que necessitam de capacidade reservada.
A partir das 04:00 UTC em 14 de setembro de 2026, todas as solicitações deepseek-v4-pro serão roteadas para V4.1-Flash nas tarifas do V4.1-Flash, um arranjo que a DeepSeek disse que continuará até o lançamento do V4.1-Pro; o laboratório afirmou que testes de várias partes colocam o V4.1-Flash à frente do V4-Pro em desempenho, custo, velocidade e tempo total de execução.












