Modèles et plateformes d’IA

DeepSeek lance V4 Pro en tant que modèle phare sortant de l’aperçu

mm
Ajouter Unite.AI à vos sources préférées sur Google

DeepSeek a publié la version de production de son modèle phare, DeepSeek V4 Pro, mettant fin à une période d’aperçu qui a duré près de quatre mois. La version, désignée V4 Pro 0813, est apparue le 12 août 2026, en tant que version de disponibilité générale sur la page de modèles d’OpenRouter, et la documentation de l’API de DeepSeek liste désormais DeepSeek-V4-Pro-0813 comme la version de modèle derrière le point de terminaison deepseek-v4-pro.

L’économie de l’API est la même que celle de l’aperçu : 0,435 $ par million de jetons d’entrée en cas de défaut de cache, 0,003625 $ par million en cas de réussite de cache, et 0,87 $ par million de jetons de sortie, avec une fenêtre de contexte d’un million de jetons et une sortie maximale de 384 000 jetons. La page de tarification de DeepSeek confirme la chaîne de version 0813, les tarifs et une limite de concurrence de 500 pour le point de terminaison Pro par rapport à 2 500 pour Flash.

La version de disponibilité générale met fin à une mise en œuvre progressive que DeepSeek a menée en public depuis le printemps. L’entreprise a présenté l’aperçu de la série V4 le 24 avril 2026, en livrant des poids ouverts pour les modèles Pro et Flash sous licence MIT, ainsi que l’accès à l’API. Le 31 juillet 2026, elle a promu le modèle Flash plus petit au statut officiel et a indiqué dans son journal des modifications que la sortie officielle du Pro « suivra bientôt ». C’est ce qui est arrivé avec la version 0813.

Sur quoi repose la version 0813

V4 Pro est un système de mélange d’experts avec 1,6 billion de paramètres au total et 49 milliards de paramètres actifs par jeton, selon la fiche de modèle sur Hugging Face. L’architecture combine deux variantes d’attention que DeepSeek appelle Compressed Sparse Attention et Heavily Compressed Attention, qui, selon l’entreprise, réduisent les calculs d’inférence pour un seul jeton à 27 % et la mise en cache KV à 10 % de ce dont la génération V3.2 avait besoin à la mise à l’échelle d’un million de jetons. Les deux modèles V4 ont été formés sur plus de 32 billions de jetons, avec une formation postérieure qui fait croître des experts spécifiques au domaine séparément, puis les consolide en un seul modèle par distillation sur la politique.

Les poids ouverts pour les versions d’aperçu sont téléchargeables depuis avril, et le référentiel Pro a enregistré plus de 1,4 million de téléchargements au cours du dernier mois sur Hugging Face. La fiche recommande une fenêtre de contexte d’au moins 384 000 jetons lors de l’exécution du mode de raisonnement maximum du modèle en local.

Les chiffres que DeepSeek met en avant

Les revendications d’évaluation sont des rapports du fournisseur, provenant de la fiche de modèle et des propres tests de harnais de l’entreprise. À son effort de raisonnement maximum, que DeepSeek étiquette V4-Pro-Max, la fiche signale :

  • SWE-bench Verified : 80,6 % résolus
  • Terminal Bench 2.0 : 67,9 % de précision
  • GPQA Diamond : 90,1 % de passage @1
  • Humanity’s Last Exam : 37,7 % de passage @1
  • MMLU-Pro : 87,5 %
  • LiveCodeBench : 93,5 % de passage @1
  • Codeforces rating : 3 206
  • MRCR à un million de jetons : 83,5 MMR

La table de comparaison de la fiche place ces scores par rapport aux systèmes de pointe nommés : V4-Pro-Max est devancé par GPT-5.4 à l’effort xHigh sur Terminal Bench 2.0 (67,9 à 75,1) et Gemini-3.1-Pro sur Humanity’s Last Exam (37,7 à 44,4), tandis que signalant les scores les plus élevés de LiveCodeBench et Apex Shortlist. Sur SWE-bench Verified, il se situe à 80,6, au même niveau que Gemini-3.1-Pro et légèrement derrière Claude Opus 4.6 à 80,8. Aucune de ces colonnes n’a encore été reproduite par un évaluateur indépendant pour la version 0813.

L’API expose trois modes de fonctionnement (sans réflexion, un effort de raisonnement élevé et un effort maximum que la documentation décrit comme poussant « les limites de la capacité de raisonnement du modèle ») et prend en charge le format OpenAI ChatCompletions, le format de messages Anthropic et le format de réponses DeepSeek, avec des appels d’outils et une sortie JSON sur les deux modèles Pro et Flash.

Comment DeepSeek en est arrivé là

La version de disponibilité générale de Pro achève la deuxième moitié d’une stratégie de sortie qui a mis le modèle moins cher en avant en premier. Lorsque V4-Flash est devenu officiel le 31 juillet 2026, DeepSeek a publié des résultats de benchmark d’agent montrant la version Flash ré-entraînée dépassant la version d’aperçu V4-Pro sur ses suites de codage d’agent internes, un mouvement délibéré qui a rendu le petit modèle le modèle par défaut pour les charges de travail d’agent tandis que le modèle phare restait en aperçu. La version 0813 est la réponse du modèle phare, et elle arrive avec la fenêtre de contexte, le plafond de sortie et l’ensemble de fonctionnalités du point de terminaison Pro inchangés. Le changement est que l’étiquette d’aperçu a disparu.

L’attitude de tarification mérite d’être surveillée. Un avis sur la page de tarification de DeepSeek indique que l’entreprise prévoit « une augmentation significative » du prix global de l’API dans un avenir proche, avec des détails à venir par avis officiel. Pour le moment, les tarifs V4 Pro au niveau de l’aperçu sont maintenus, et le prix moyen réellement payé via OpenRouter est bien inférieur au prix de liste de 0,435 $, que OpenRouter attribue à la mise en cache et aux remises.

DeepSeek a passé l’année dernière à élargir son modèle : la série V4 est formée autour des charges de travail d’agent (assistants de codage, automatisation multétape, synthèse de documents longs) que l’annonce d’aperçu d’avril a déclaré déjà conduire le développement interne de l’entreprise. Les laboratoires de poids ouverts chinois ont livré des modèles de classe phare à un rythme quasi mensuel, de Moonshot’s Kimi K3 à MiniMax’s agent-focused M2.7, et la version de disponibilité générale de V4 Pro est la tentative de DeepSeek pour maintenir son modèle phare à l’avant-garde de ce groupe.

Ce qui suit

L’élément ouvert est de nouveaux poids. Les référentiels Hugging Face hébergent toujours les versions d’aperçu d’avril, et la table de téléchargement de la fiche de modèle pointe vers ces artefacts ; DeepSeek n’a pas annoncé de calendrier pour la publication des poids 0813 ou indiqué si la version de disponibilité générale diffère de l’aperçu au-delà de la formation postérieure. La cadence déclarée de l’entreprise pour la ligne V4, selon son journal des modifications, passe d’abord par l’API.

Sur le plan commercial, l’avis de la page de tarification engage DeepSeek à une annonce officielle de son plan de tarification révisé, avec l’augmentation s’appliquant à l’ensemble des services d’API. Jusqu’à ce que cet avis soit publié, deepseek-v4-pro continue de servir la version 0813 aux tarifs publiés le 12 août 2026 — 0,435 $ d’entrée, 0,87 $ de sortie, par million de jetons, à un million de jetons de contexte.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.