Modèles et plateformes d’IA
Baseten ajoute DeepSeek-V4.1-Flash aux API de modèles avec un contexte de 1 M‑tokens

DeepSeek-V4.1-Flash est désormais disponible sur les API de modèles de Baseten, Baseten a annoncé le 11 septembre 2026, apportant le modèle multimodal à mélange d’experts (MoE) de 552 B‑paramètres, qui associe 8 B de paramètres actifs pour le préremplissage et 16 B pour le décodage sur une fenêtre de contexte de 1 M‑tokens, à la plateforme du fournisseur d’inférence.
DeepSeek a publié les poids ouverts du modèle sur Hugging Face, et l’annonce de DeepSeek est datée du 9 septembre 2026. Le modèle accepte les entrées texte et image et génère une sortie texte, et la fiche du modèle indique que le référentiel et les poids sont sous licence MIT. Baseten décrit V4.1-Flash comme la troisième version flash à poids ouvert de DeepSeek en 2026 et comme le seul modèle de cette envergure à utiliser ce que DeepSeek appelle une architecture encodeur‑décodeur causale. Le support du produit d’entraînement Loops de Baseten arrivera bientôt, selon la société.
Résultats de benchmark rapportés
La fiche du modèle indique les résultats du modèle d’instruction au réglage maximal d’effort de raisonnement de 100 : V4.1-Flash obtient 90,6 sur Terminal‑Bench 2.1, contre 82,7 pour V4‑Flash et 87,9 pour V4‑Pro ; 74,2 sur DeepSWE v1.1, contre 54,4 et 62,7 ; et 54,8 sur AutomationBench, contre 37,7 et 43,2. Baseten a souligné les mêmes chiffres de codage et d’agence, affirmant que V4.1‑Flash surpasse V4‑Pro avec à peu près un tiers du nombre total de paramètres, tout en avertissant qu’un score de 54,8 sur AutomationBench signifie que le modèle échoue dans environ la moitié des flux de travail complexes et en conseillant aux équipes de garder un humain dans la boucle pour les pipelines d’agents.
Dans la comparaison de la fiche avec les modèles de pointe au maximum d’effort, V4.1‑Flash obtient 90,9 sur GPQA Diamond, une cote Codeforces de 3471, et 63,9 sur HLE avec outils. Baseten indique que V4.1‑Flash est le premier modèle non expérimental de DeepSeek avec entrée d’image native, une capacité auparavant limitée au modèle expérimental V4‑Flash‑Vision‑Exp ; son tableau indique 78,9 sur Chartography et 49 sur ZeroBench pour le nouveau modèle, contre 64,3 et 35 pour le modèle expérimental.
Architecture encodeur‑décodeur causale
Selon la fiche du modèle, V4.1‑Flash organise un Transformer à 40 couches en un encodeur causal de 20 couches suivi d’un décodeur de 20 couches, le cache global clé‑valeur (KV) du décodeur étant projeté à partir des états cachés finaux de l’encodeur plutôt que dérivé des états cachés propres à chaque couche du décodeur. La conception active 8 B de paramètres par token pendant le préremplissage et 16 B pendant le décodage ; Baseten oppose cela à V4‑Flash, qui active 13 B pour les deux étapes, présentant le changement comme un échange d’un décodage plus lourd contre un préremplissage beaucoup plus léger, une configuration que Baseten affirme améliorer l’efficacité des coûts pour les agents de codage dont les boucles d’agents génèrent beaucoup plus de tokens de préremplissage que de tokens de décodage.
La fiche indique que le Compressed Sparse Attention 2 du modèle attribue à chaque couche d’attention l’un des trois modes statiques (Full, Reindex ou Reuse), avec un indexeur hiérarchique parcimonieux dans le décodeur limitant le coût d’indexation plus profond indépendamment de la longueur du contexte. Associés au cache KV principal FP4, ces conceptions réduisent le cache KV global à 890 octets par token, soit environ un quart de V4‑Flash, indique la fiche. Un mécanisme distinct, SWA Bounded Replay, reconstruit les états KV d’attention à fenêtre glissante manquants en ne rejouant que les tokens les plus récents, réduisant l’empreinte KV persistante à environ un huitième de V4‑Flash. L’annonce de DeepSeek estime les économies à un quart de la mémoire HBM et à un huitième du stockage SSD de la génération précédente.
Chaque couche MoE utilise un expert partagé et 384 experts routés avec six experts routés actifs par token, et le modèle ajoute une mémoire conditionnelle Engram de 196 B de paramètres en parallèle du décodage spéculatif DSpark, selon la fiche. DeepSeek a entraîné le modèle de zéro sur un corpus multimodal de 45 T tokens, a entraîné son attention parcimonieuse avec une longueur de séquence de 64 K, et a étendu le contexte à 1 M de tokens sur 34 T de tokens. Après l’entraînement, suit un affinement supervisé standard, apprentissage par renforcement, et une séquence de distillation en ligne, avec des changements substantiels concentrés sur la synthèse automatisée à grande échelle des tâches et environnements d’agents, et le modèle expose un réglage d’effort de raisonnement continuellement contrôlable de 1 à 100.
Transition de l’API DeepSeek et service Baseten
DeepSeek indique que les modèles V4‑Flash et V4‑Flash‑Vision‑Exp sont retirés de sa plateforme, les anciens noms d’API redirigeant temporairement vers V4.1‑Flash pour assurer la compatibilité. La nouvelle tarification de l’API est entrée en vigueur à 04 h 00 UTC le 10 septembre 2026, les tarifs hors pointe étant fixés à 50 % des tarifs de pointe, et DeepSeek désigne les partenaires officiels WorkBuddy (incluant CodeBuddy) et OpenCode comme soutenant pleinement V4.1‑Flash.
Baseten a déclaré que sa pile Inference sert le modèle en utilisant NVIDIA Dynamo avec un routage conscient du cache KV, orientant chaque requête vers la réplique qui détient déjà son préfixe plutôt que vers n’importe quelle réplique disponible. Le modèle est proposé via la Bibliothèque de modèles de Baseten, avec des déploiements dédiés disponibles pour les équipes nécessitant une capacité réservée.
À partir de 04 h 00 UTC le 14 septembre 2026, toutes les requêtes deepseek‑v4‑pro seront redirigées vers V4.1‑Flash aux tarifs de V4.1‑Flash, une disposition que DeepSeek a indiqué maintenir jusqu’au lancement de V4.1‑Pro ; le laboratoire a affirmé que les tests réalisés par plusieurs parties placent V4.1‑Flash devant V4‑Pro en termes de performances, de coûts, de vitesse et de durée d’exécution totale.












