AI-modeller og plattformer
Qwen3.8-Flash-Next viser frem Qwen4-arkitektur med 6 B aktive parametere

Qwen3.8-Flash-Next viser frem Qwen4-arkitektur med hybrid oppmerksomhet og 6 B aktive parametere
Alibaba sitt Qwen‑team lanserte Qwen3.8-Flash-Next 26. august 2026, en åpen‑vekt eksperimentell modell som viser frem arkitekturen ment å danne grunnlaget for Qwen4. Modellen har 125 B parametere, men aktiverer kun 6 B per token, en konfigurasjon teamet beskriver som et steg mot det de kaller ultimate kostnadseffektivitet.
Utgivelsen er den første offentlige modellen bygget på dette designet. Qwen3.8-Flash-Next-modellkortet beskriver den som en kausal språkmodell med en visjons‑encoder, trent både gjennom forhåndstrening og ettertrening, og oppgir en innebygd kontekstlengde på 262 144 token, utvidbar til 1 million. Kortet posisjonerer modellen som et konkret effektivitetstrinn snarere enn en kapasitets‑flagship: teamets uttalte bekymring er hvordan arkitekturvalg påvirker inferenskostnad i stor skala, spesielt ettersom agent‑baserte arbeidsbelastninger med lange kontekster blir den dominerende brukssituasjonen.
Hybrid oppmerksomhet, gated residualer og n‑gram‑innbygginger
Arkitekturen hviler på fire oppgitte endringer. Den første er et omarbeidet hybrid‑oppmerksomhetsskjema. Tidligere Qwen‑hybridmodeller kombinerte Gated DeltaNet med Gated Attention; Qwen3.8-Flash-Next erstatter sistnevnte med Qwen Sparse Attention, eller QSA, som opererer på mikrobblokk‑nivå i stedet for å velge individuelle token. Kortet hevder at dette reduserer latenstiden for lange kontekster betydelig. Modellen organiserer sine 48 lag i et repeterende mønster: tre blokker av Gated DeltaNet som går inn i et mixture‑of‑experts‑lag, etterfulgt av én QSA‑blokk som går inn i et mixture‑of‑experts‑lag, gjentatt tolv ganger.
Den andre endringen er en gated residual‑mekanisme som modulerer informasjon som flyter gjennom utvidede residual‑strømmer ved hjelp av en element‑for‑element, datadrevet lesebrake og en per‑gren skalar skrivebrake. Kortet presenterer dette som en måte å oppnå finere nyansert uttrykksevne på tvers av lag, samtidig som treningsstabiliteten bevares og inferens‑overhead holdes lav.
Den tredje er et n‑gram‑innbyggingslag. I stedet for å skalere parametere gjennom ekstra eksperter, legger modellen til 51 B parametere i en separat innbygging indeksert etter korte bigrammer og trigrammer i lag 2. Teamet beskriver dette som en akse for parameter‑skalering som krever mindre beregning enn mixture‑of‑experts og som er mer egnet for avlasting til minne‑begrensede akseleratorer. Kortet bemerker også et 4 B‑parameter multi‑token‑prediksjonslag trent med flere steg.
Den fjerde er selve treningsoppskriften. Muon‑ og AdamW‑optimalisatorene anvendes på spesifikke vektkategorier, og teamet oppgir at den eliminerte tradisjonelle oppvarming av batch‑størrelse til fordel for å starte direkte på mål‑batch‑størrelsen, styrt av omtilpassede skaleringslover. Dette, ifølge kortet, reduserer total antall optimaliseringssteg betydelig samtidig som større læringsrater støttes.
Leverandør‑rapporterte ytelsesmålinger og hva de måler
Kortet rapporterer ytelsesmålinger som sammenligner Qwen3.8-Flash-Next med Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 og Claude-Opus-4.6 (Max). Dette er leverandør‑rapporterte tall, evaluert på teamets egne testmiljøer, og de bør leses som slik. For agentisk koding viser kortet en DeepSWE 1.1‑score på 58,7 versus 42,2 for Qwen3.8-27B og 54,4 for DeepSeek-V4-Flash, med forbeholdet at DeepSWE ble kjørt med to testmiljøer (Claude Code og mini‑SWE‑agent) og den høyeste scoren av begge ble rapportert. På SWE‑bench Pro oppnår Qwen3.8-Flash-Next 62,5, foran Qwen3.8-27B med 61,7 og Qwen3.7-Plus med 55,8, der alle modeller ble re‑evaluert på en raffinert versjon av benchmarken etter at teamet korrigerte det de kaller problematiske oppgaver.
Mønsteret som teller er effektivitetspåstanden, ikke et enkelt tall. Kortet oppgir 125 B totale parametere med 6 B aktiverte, versus 397 B totalt og 17 B aktiverte for Qwen3.7-Plus. På generell kunnskaps‑siden viser modellen en GPQA Diamond‑score på 91,7, en LiveCodeBench v6‑score på 91,9 og en HLE‑score på 35,9 vurdert av GPT‑4o i stedet for benchmarkens standardvurderer. Kortet er åpent om disse valgene, noe som er mer enn mange utgivelser tilbyr, men de forblir leverandørens valg.
Tilgjengelighet og veien til Qwen4
Qwen3.8-Flash-Next er nå tilgjengelig på Hugging Face under qwen-community-1.0‑lisensen, med vekter i BF16 som utgjør omtrent 180 B parametere fordelt på språkmodellen, n‑gram‑innbyggingen og multi‑token‑prediksjonslaget. Kortet anbefaler distribusjon via SGLang, vLLM eller TokenSpeed, og bemerker at Qwen3.8-Flash — den produksjons‑orienterte motparten bygget på denne forhåndsvisningen med en standard 1 M‑token‑kontekst og offisielle innebygde verktøy — er versjonen ment for administrert API‑bruk gjennom Qwen Cloud.
«Next»-etiketten er indikatoren. Teamet rammer dette tydelig inn som en eksperimentell forhåndsvisning av arkitekturen som vil danne grunnlaget for Qwen4, noe som plasserer den i samme kategori som tidligere Qwen‑utgivelser som testet designretninger før en flaggskip‑syklus. Enten dette spesifikke designet blir Qwen4s fundament eller en gren teamet senere forkaster, dokumenterer utgivelsen hvor ett stort laboratorium satser på sin effektivitet.












