Modelos y plataformas de IA
Baseten añade DeepSeek-V4.1-Flash a las API de modelos con contexto de 1 M de tokens

DeepSeek-V4.1-Flash está disponible ahora en las API de Modelos de Baseten, Baseten anunció el 11 de septiembre de 2026, ofreciendo el modelo multimodal de 552 B de parámetros tipo mixture-of-experts (MoE), que combina 8 B de parámetros activos para el pre‑relleno con 16 B para la decodificación a través de una ventana de contexto de 1 M de tokens, en la plataforma del proveedor de inferencia.
DeepSeek lanzó los pesos abiertos del modelo en Hugging Face, y el anuncio propio de DeepSeek está fechado el 9 de septiembre de 2026. El modelo acepta entrada de texto e imagen y genera salida de texto, y la tarjeta del modelo indica que el repositorio y los pesos están licenciados bajo la Licencia MIT. Baseten describe V4.1-Flash como el tercer lanzamiento flash de pesos abiertos de DeepSeek en 2026 y como el único modelo de su escala que utiliza lo que DeepSeek denomina una arquitectura Causal Encoder-Decoder. El soporte para el producto de entrenamiento Loops de Baseten llegará pronto, según la compañía.
Resultados de referencia reportados
La tarjeta del modelo informa resultados del modelo instruccional con el ajuste máximo de esfuerzo de razonamiento de 100: V4.1-Flash obtiene 90,6 en Terminal-Bench 2.1, comparado con 82,7 para V4-Flash y 87,9 para V4-Pro; 74,2 en DeepSWE v1.1, comparado con 54,4 y 62,7; y 54,8 en AutomationBench, comparado con 37,7 y 43,2. Baseten destacó las mismas cifras de codificación y agentes, diciendo que V4.1-Flash supera a V4-Pro con aproximadamente un tercio del total de parámetros, mientras advierte que un 54,8 en AutomationBench significa que el modelo falla en aproximadamente la mitad de los flujos de trabajo complejos y aconseja a los equipos mantener a un humano en el bucle para las canalizaciones de agentes.
En la comparación de la tarjeta con modelos de frontera con el máximo esfuerzo, V4.1-Flash registra 90,9 en GPQA Diamond, una puntuación de Codeforces de 3471, y 63,9 en HLE con herramientas. Baseten afirma que V4.1-Flash es el primer modelo no experimental de DeepSeek con entrada de imagen nativa, una capacidad previamente limitada al modelo experimental V4-Flash-Vision-Exp; su tabla muestra 78,9 en Chartography y 49 en ZeroBench para el nuevo modelo, frente a 64,3 y 35 para el experimental.
Arquitectura Causal Encoder-Decoder
Según la tarjeta del modelo, V4.1-Flash organiza un Transformador de 40 capas como un codificador causal de 20 capas seguido de un decodificador de 20 capas, con la caché global de claves‑valores (KV) del decodificador proyectada a partir de los estados ocultos finales del codificador en lugar de derivarse de los propios estados ocultos de cada capa del decodificador. El diseño activa 8 B de parámetros por token durante el pre‑relleno y 16 B durante la decodificación; Baseten contrasta esto con V4-Flash, que activa 13 B en ambos pasos, enmarcando el cambio como un intercambio de una decodificación más pesada por un pre‑relleno mucho más ligero, una configuración que, según Baseten, aumenta la eficiencia de costos para los agentes de codificación cuyos bucles agentes generan muchos más tokens de pre‑relleno que de decodificación.
La tarjeta indica que la Atención Escasa Comprimida 2 del modelo asigna a cada capa de atención uno de tres modos estáticos (Full, Reindex o Reuse), con un Indexador Escaso Jerárquico en el decodificador que limita el costo de indexación más profundo independientemente de la longitud del contexto. Combinado con la caché KV principal FP4, esos diseños reducen la caché KV global a 890 bytes por token, aproximadamente una cuarta parte de V4-Flash, según la tarjeta. Un mecanismo separado, SWA Bounded Replay, reconstruye los estados KV de atención deslizante faltantes reproduciendo solo los tokens más recientes, reduciendo la huella KV persistente a aproximadamente una octava parte de V4-Flash. El anuncio de DeepSeek sitúa el ahorro en una cuarta parte de la memoria HBM y una octava parte del almacenamiento SSD de la generación anterior.
Cada capa MoE utiliza un experto compartido y 384 expertos enrutados con seis expertos enrutados activos por token, y el modelo añade memoria condicional Engram con 196 B de parámetros junto con decodificación especulativa DSpark, según la tarjeta. DeepSeek entrenó el modelo desde cero en un corpus multimodal de 45 T tokens, entrenó su atención escasa con una longitud de secuencia de 64 K, y extendió el contexto a 1 M de tokens a 34 T tokens. El post‑entrenamiento sigue una afinación supervisada estándar, aprendizaje por refuerzo, y una secuencia de destilación en política, con cambios sustanciales concentrados en la síntesis automatizada a gran escala de tareas y entornos de agentes, y el modelo expone un ajuste de esfuerzo de razonamiento continuamente controlable de 1 a 100.
Transición de la API de DeepSeek y Servicio de Baseten
DeepSeek indica que V4-Flash y V4-Flash-Vision-Exp están retirados de su plataforma, con los nombres de modelo de la API antigua redirigiendo temporalmente a V4.1-Flash para compatibilidad. La nueva tarificación de la API entró en vigor a las 04:00 UTC del 10 de septiembre de 2026, con tarifas fuera de pico establecidas al 50 % de las tarifas pico, y DeepSeek nombra a sus socios oficiales WorkBuddy (incluyendo CodeBuddy) y OpenCode como totalmente compatibles con V4.1-Flash.
Baseten dijo que su Inference Stack sirve el modelo usando NVIDIA Dynamo con enrutamiento consciente de la caché KV, dirigiendo cada solicitud a la réplica que ya posee su prefijo en lugar de a cualquiera que esté libre. El modelo se ofrece a través de la Biblioteca de Modelos de Baseten, con implementaciones dedicadas disponibles para equipos que necesiten capacidad reservada.
Desde las 04:00 UTC del 14 de septiembre de 2026, todas las solicitudes deepseek-v4-pro se redirigirán a V4.1-Flash a tarifas de V4.1-Flash, un acuerdo que DeepSeek dijo que continuará hasta el lanzamiento de V4.1-Pro; el laboratorio dijo que pruebas realizadas por múltiples partes colocaron a V4.1-Flash por delante de V4-Pro en rendimiento, costo, velocidad y tiempo total de ejecución.












