Modèles et plateformes d’IA

Qwen3.8-Flash-Next prévisualise l’architecture Qwen4 avec 6 B paramètres actifs

mm
Ajouter Unite.AI à vos sources préférées sur Google

Qwen3.8-Flash-Next prévisualise l’architecture Qwen4 avec attention hybride et 6 B paramètres actifs

L’équipe Qwen d’Alibaba a publié Qwen3.8-Flash-Next le 26 août 2026, un modèle expérimental à poids ouvert qui prévisualise l’architecture destinée à soutenir Qwen4. Le modèle possède 125 B paramètres mais n’active que 6 B par jeton, une configuration que l’équipe présente comme une étape vers ce qu’elle appelle l’efficacité ultime en termes de coût.

Cette sortie est le premier modèle public construit sur cette conception. La fiche modèle Qwen3.8-Flash-Next le décrit comme un modèle de langage causal avec un encodeur visuel, entraîné à la fois en pré‑entraînement et en post‑entraînement, et indique une longueur de contexte native de 262,144 jetons extensible à 1 million. La fiche positionne le modèle comme une étape concrète d’efficacité plutôt que comme un fleuron de capacité: la préoccupation exprimée par l’équipe porte sur la façon dont les choix architecturaux influent sur le coût d’inférence à grande échelle, en particulier alors que les charges de travail agentiques à longs contextes deviennent le cas d’usage dominant.

Attention hybride, résidus à portes et embeddings n‑grammes

L’architecture repose sur quatre changements annoncés. Le premier est un schéma d’attention hybride revisité. Les modèles hybrides Qwen précédents associaient Gated DeltaNet à Gated Attention; Qwen3.8-Flash-Next remplace ce dernier par Qwen Sparse Attention, ou QSA, qui fonctionne au niveau du micro‑bloc plutôt que de sélectionner des jetons individuels. La fiche affirme que cela réduit considérablement la latence en contexte long. Le modèle organise ses 48 couches selon un motif récurrent: trois blocs de Gated DeltaNet alimentant une couche mixture‑of‑experts, suivis d’un bloc QSA alimentant une couche mixture‑of‑experts, le tout répété douze fois.

Le deuxième changement est un mécanisme de résidu à portes qui module l’information circulant à travers des flux résiduels élargis à l’aide d’une porte de lecture élément‑par‑élément dépendante des données et d’une porte d’écriture scalaire par branche. La fiche le présente comme un moyen d’obtenir une expressivité plus fine entre les couches tout en préservant la stabilité de l’entraînement et en maintenant une faible surcharge d’inférence.

Le troisième est une couche d’embedding n‑gramme. Plutôt que d’augmenter les paramètres via des experts supplémentaires, le modèle ajoute 51 B paramètres dans un embedding séparé indexé par de courts bigrammes et trigrammes à la couche 2. L’équipe décrit cela comme un axe de mise à l’échelle des paramètres qui nécessite moins de calcul que le mixture‑of‑experts et se prête davantage au déchargement vers des accélérateurs à mémoire limitée. La fiche indique également une couche de prédiction multi‑jeton de 4 B paramètres entraînée avec des étapes multiples.

Le quatrième est la recette d’entraînement elle‑même. Les optimiseurs Muon et AdamW sont appliqués à des catégories de poids spécifiques, et l’équipe affirme avoir éliminé les réchauffements traditionnels de la taille de lot au profit d’un démarrage direct à la taille de lot cible, guidé par des lois d’échelle réajustées. Selon la fiche, cela réduit considérablement le nombre total d’étapes d’optimisation tout en permettant des taux d’apprentissage plus élevés.

Benchmarks fournis par le vendeur et ce qu’ils mesurent

La fiche rapporte les résultats de benchmarks comparant Qwen3.8-Flash-Next à Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 et Claude-Opus-4.6 (Max). Il s’agit de chiffres fournis par le vendeur, évalués avec les propres outils de l’équipe, et ils doivent être interprétés en conséquence. En matière de codage agentique, la fiche indique un score DeepSWE 1.1 de 58,7 contre 42,2 pour Qwen3.8-27B et 54,4 pour DeepSeek-V4-Flash, avec la précision que DeepSWE a été exécuté avec deux outils (Claude Code et mini‑SWE‑agent) et que le meilleur score parmi les deux a été retenu. Sur SWE‑bench Pro, Qwen3.8-Flash-Next obtient 62,5, devant Qwen3.8-27B à 61,7 et Qwen3.7-Plus à 55,8, tous les modèles ayant été réévalués sur une version affinée du benchmark après que l’équipe a corrigé ce qu’elle qualifie de tâches problématiques.

Le schéma qui importe est la revendication d’efficacité, et non un chiffre isolé. La fiche indique 125 B paramètres au total avec 6 B activés, contre 397 B au total et 17 B activés pour Qwen3.7-Plus. Du côté des connaissances générales, le modèle affiche un score GPQA Diamond de 91,7, un score LiveCodeBench v6 de 91,9 et un score HLE de 35,9 évalué par GPT‑4o plutôt que par l’évaluateur par défaut du benchmark. La fiche fait preuve de transparence quant à ces choix, ce qui dépasse ce que proposent de nombreuses publications, mais il s’agit néanmoins de décisions prises par le vendeur.

Disponibilité et chemin vers Qwen4

Qwen3.8-Flash-Next est disponible dès maintenant sur Hugging Face sous la licence qwen-community-1.0, avec des poids en BF16 totalisant environ 180 B paramètres répartis entre le modèle de langage, l’embedding n‑gramme et la couche de prédiction multi‑jeton. La fiche recommande le déploiement via SGLang, vLLM ou TokenSpeed, et indique que Qwen3.8-Flash — la version orientée production construite sur cet aperçu avec un contexte par défaut de 1 M de jetons et des outils intégrés officiels — est la version destinée à une utilisation d’API gérée via Qwen Cloud.

Le libellé « Next » en est l’indicateur. L’équipe présente explicitement cela comme un aperçu expérimental de l’architecture qui soutiendra Qwen4, le plaçant dans la même catégorie que les précédentes versions de Qwen qui ont testé des orientations de conception avant un cycle phare. Que ce design spécifique devienne le socle de Qwen4 ou qu’il constitue une branche que l’équipe abandonnera plus tard, la publication documente où un grand laboratoire mise sur l’efficacité.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.