AI-modeller og platforme
Qwen3.8-Flash-Next viser Qwen4-arkitektur med 6B aktive parametre

Qwen3.8-Flash-Next viser Qwen4-arkitektur med hybridopmærksomhed og 6B aktive parametre
Alibaba’s Qwen-team udgav Qwen3.8-Flash-Next den 26. august 2026, en open‑weight eksperimentel model, der viser den arkitektur, der er tiltænkt at danne grundlag for Qwen4. Modellen har 125 B parametre, men aktiverer kun 6 B pr. token – en konfiguration, som teamet beskriver som et skridt mod det, de kalder ultimativ omkostningseffektivitet.
Udgivelsen er den første offentlige model bygget på dette design. Qwen3.8-Flash-Next modelkort beskriver den som en kausal sprogmodel med en vision‑encoder, trænet både i for‑træning og efter‑træning, og angiver en oprindelig kontekstlængde på 262 144 token, som kan udvides til 1 million. Kortet placerer modellen som et konkret skridt mod effektivitet snarere end som en kapacitets‑flagship: teamets udtrykte bekymring er, hvordan arkitektoniske valg påvirker inferenskostnader i stor skala, især efterhånden som agent‑baserede arbejdsbelastninger med lange kontekster bliver den dominerende anvendelse.
Hybridopmærksomhed, gated residualer og n‑gram‑indlejringer
Arkitekturen hviler på fire nævnte ændringer. Den første er et omarbejdet hybridopmærksomhedsskemma. Tidligere Qwen‑hybridmodeller kombinerede Gated DeltaNet med Gated Attention; Qwen3.8-Flash-Next erstatter sidstnævnte med Qwen Sparse Attention (QSA), som opererer på mikrobbloks‑niveau i stedet for at vælge enkelte token. Kortet hævder, at dette reducerer latenstid for lange kontekster betydeligt. Modellen organiserer sine 48 lag i et gentaget mønster: tre blokke af Gated DeltaNet, der fodrer en mixture‑of‑experts‑lag, efterfulgt af én QSA‑blok, der også fodrer en mixture‑of‑experts‑lag, gentaget tolv gange.
Den anden ændring er en gated residual‑mekanisme, der modulere informationen, der flyder gennem udvidede residual‑strømme, ved hjælp af en element‑for‑element, datadrevet læse‑gate og en per‑gren skalar skrive‑gate. Kortet præsenterer dette som en metode til at opnå finere udtrykskraft på tværs af lag, samtidig med at træningsstabiliteten bevares og inferens‑overhead holdes lav.
Den tredje er et n‑gram‑indlejringslag. I stedet for at skalere parametre via yderligere eksperter tilføjer modellen 51 B parametre i en separat indlejring, der er indekseret efter korte bigrammer og trigrammer i lag 2. Teamet beskriver dette som en akse for parameter‑skalering, der kræver mindre beregning end mixture‑of‑experts og som er lettere at offloade til hukommelsesbegrænsede acceleratorer. Kortet bemærker også et 4 B‑parameter multi‑token‑forudsigelseslag, der er trænet med flere trin.
Den fjerde er selve træningsopskriften. Muon‑ og AdamW‑optimererne anvendes på specifikke vægtkategorier, og teamet oplyser, at de har fjernet traditionelle batch‑size‑opvarmninger til fordel for at starte direkte på den ønskede batch‑størrelse, styret af genjusterede skaleringslove. Dette, ifølge kortet, reducerer markant det samlede antal optimizer‑trin, samtidig med at større læringsrater understøttes.
Leverandørrapporterede benchmark‑resultater og hvad de måler
Kortet rapporterer benchmark‑resultater, der sammenligner Qwen3.8-Flash-Next med Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 og Claude-Opus-4.6 (Max). Disse er leverandørrapporterede tal, evalueret på teamets egne testmiljøer, og bør læses som sådan. På agent‑baseret kodning viser kortet en DeepSWE 1.1‑score på 58,7 sammenlignet med 42,2 for Qwen3.8-27B og 54,4 for DeepSeek-V4-Flash, med forbeholdet at DeepSWE blev kørt med to testmiljøer (Claude Code og mini‑SWE‑agent), og den højeste score på tværs af begge blev rapporteret. På SWE‑bench Pro opnår Qwen3.8-Flash-Next 62,5, foran Qwen3.8-27B med 61,7 og Qwen3.7-Plus med 55,8, hvor alle modeller er gen‑evalueret på en raffineret version af benchmarken efter at teamet har rettet, hvad de kalder problematiske opgaver.
Det mønster, der betyder noget, er effektivitetspåstanden, ikke et enkelt tal. Kortet angiver 125 B samlede parametre med 6 B aktiveret, sammenlignet med 397 B samlede og 17 B aktiveret for Qwen3.7-Plus. På generel viden‑siden viser modellen en GPQA‑Diamond‑score på 91,7, en LiveCodeBench v6‑score på 91,9 og en HLE‑score på 35,9 vurderet af GPT‑4o i stedet for benchmarkens standardbedømmer. Kortet er gennemsigtigt omkring disse valg, hvilket er mere end mange udgivelser tilbyder, men de forbliver leverandørens valg.
Tilgængelighed og vejen til Qwen4
Qwen3.8-Flash-Next er nu tilgængelig på Hugging Face under licensen qwen-community-1.0, med vægte i BF16, der samlet udgør cirka 180 B parametre på tværs af sprogmodellen, n‑gram‑indlejringen og multi‑token‑forudsigelseslaget. Kortet anbefaler implementering via SGLang, vLLM eller TokenSpeed, og bemærker, at Qwen3.8‑Flash — den produktionsorienterede pendant, bygget på denne forhåndsvisning med en standard på 1 M‑token‑kontekst og officielle indbyggede værktøjer — er den version, der er beregnet til administreret API‑brug gennem Qwen Cloud.
Etiketten “Next” er den klare indikator. Teamet beskriver eksplicit dette som en eksperimentel forhåndsvisning af den arkitektur, der vil danne grundlag for Qwen4, hvilket placerer den i samme kategori som tidligere Qwen‑udgivelser, der testede designretninger før en flagship‑cyklus. Uanset om dette specifikke design bliver Qwen4’s fundament eller en gren, som teamet senere opgiver, dokumenterer udgivelsen, hvor et stort laboratorium satser på effektivitet.












