AI-modellen en platforms
Qwen3.8-Flash-Next geeft een voorproefje van de Qwen4-architectuur met 6B actieve parameters

Qwen3.8-Flash-Next geeft een voorproefje van de Qwen4-architectuur met hybride aandacht en 6B actieve parameters
Het Qwen‑team van Alibaba bracht op 26 augustus 2026 Qwen3.8-Flash-Next uit, een open‑weight experimenteel model dat een voorproefje geeft van de architectuur die Qwen4 moet ondersteunen. Het model bevat 125 miljard parameters, maar activeert slechts 6 miljard per token, een configuratie die het team beschrijft als een stap naar wat zij ‘ultieme kostenefficiëntie’ noemen.
De uitgave is het eerste openbare model dat op dit ontwerp is gebouwd. De Qwen3.8-Flash-Next modelkaart beschrijft het als een causaal taalmodel met een vision‑encoder, getraind via zowel pre‑training als post‑training, en vermeldt een native contextlengte van 262.144 tokens, uitbreidbaar tot 1 miljoen. De kaart positioneert het model als een concrete efficiëntiestap in plaats van een capaciteits‑flagship: het team maakt zich zorgen over hoe architecturale keuzes de inferentiekosten op schaal beïnvloeden, vooral nu agentische workloads met lange contexten de dominante use‑case worden.
Hybride aandacht, gegateerde residuals en n‑gram‑embeddings
De architectuur berust op vier genoemde wijzigingen. De eerste is een herwerkte hybride‑aandachtsregeling. Vorige Qwen‑hybride modellen combineerden Gated DeltaNet met Gated Attention; Qwen3.8-Flash-Next vervangt de laatste door Qwen Sparse Attention, of QSA, dat op micro‑blockniveau werkt in plaats van individuele tokens te selecteren. Volgens de kaart vermindert dit de latentie bij lange contexten aanzienlijk. Het model rangschikt zijn 48 lagen in een herhalend patroon: drie blokken Gated DeltaNet die invoeren in een mixture‑of‑experts‑laag, gevolgd door één QSA‑blok dat invoert in een mixture‑of‑experts‑laag, twaalf keer herhaald.
De tweede wijziging is een gegateerd residual‑mechanisme dat de informatie die door verbrede residual‑stromen stroomt, moduleert met een element‑wise, data‑afhankelijke read‑gate en een per‑branch scalaire write‑gate. De kaart presenteert dit als een manier om fijnmazigere expressiviteit over lagen te verkrijgen, terwijl de trainingsstabiliteit behouden blijft en de inferentie‑overhead laag blijft.
De derde is een n‑gram‑embedding‑laag. In plaats van parameters te schalen via extra experts, voegt het model 51 miljard parameters toe in een aparte embedding die wordt geïndexeerd door korte bigrammen en trigrammen in laag 2. Het team beschrijft dit als een as voor parameter‑schaling die minder rekenkracht vereist dan mixture‑of‑experts en beter geschikt is voor offloading naar geheugen‑beperkte versnellers. De kaart vermeldt ook een 4 miljard‑parameter multi‑token‑voorspellingslaag die met meerdere stappen is getraind.
De vierde is het trainingsrecept zelf. De Muon‑ en AdamW‑optimizers worden toegepast op specifieke gewichtscategorieën, en het team stelt dat traditionele batch‑size warm‑ups zijn geëlimineerd ten gunste van direct starten met de doel‑batch‑size, geleid door opnieuw afgestelde schaalwetten. Dit, aldus de kaart, vermindert het totale aantal optimizer‑stappen aanzienlijk terwijl grotere leersnelheden worden ondersteund.
Vendor‑gerapporteerde benchmarks en wat ze meten
De kaart rapporteert benchmarkresultaten waarin Qwen3.8-Flash-Next wordt vergeleken met Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 en Claude-Opus-4.6 (Max). Dit zijn vendor‑gerapporteerde cijfers, geëvalueerd met de eigen harnesses van het team, en moeten als zodanig worden geïnterpreteerd. Voor agentisch programmeren vermeldt de kaart een DeepSWE 1.1‑score van 58,7 tegenover 42,2 voor Qwen3.8-27B en 54,4 voor DeepSeek-V4-Flash, met de kanttekening dat DeepSWE werd uitgevoerd met twee harnesses (Claude Code en mini‑SWE‑agent) en de hoogste score van beide werd gerapporteerd. Voor SWE‑bench Pro scoort Qwen3.8-Flash-Next 62,5, beter dan Qwen3.8-27B met 61,7 en Qwen3.7-Plus met 55,8, waarbij alle modellen opnieuw werden geëvalueerd op een verfijnde versie van de benchmark nadat het team de zogenoemde problematische taken had gecorrigeerd.
Het patroon dat telt, is de efficiëntieclaim, niet één enkel cijfer. De kaart vermeldt 125 miljard totale parameters met 6 miljard geactiveerd, tegenover 397 miljard totaal en 17 miljard geactiveerd voor Qwen3.7-Plus. Op het gebied van algemene kennis noteert het model een GPQA‑Diamond‑score van 91,7, een LiveCodeBench v6‑score van 91,9 en een HLE‑score van 35,9 beoordeeld door GPT‑4o in plaats van de standaard beoordelaar van de benchmark. De kaart is transparant over deze keuzes, wat meer is dan veel releases bieden, maar het blijft een keuze van de leverancier.
Beschikbaarheid en de weg naar Qwen4
Qwen3.8-Flash-Next is nu beschikbaar op Hugging Face onder de qwen-community-1.0‑licentie, met gewichten in BF16 die ongeveer 180 miljard parameters omvatten over het taalmodel, de n‑gram‑embedding en de multi‑token‑voorspellingslaag. De kaart raadt aan om te implementeren via SGLang, vLLM of TokenSpeed, en merkt op dat Qwen3.8-Flash — de productie‑gerichte tegenhanger die op dit preview‑model is gebouwd met een standaard context van 1 miljoen tokens en officiële ingebouwde tools — de versie is die bedoeld is voor beheerde API‑gebruik via Qwen Cloud.
Het label “Next” is de aanwijzing. Het team positioneert dit expliciet als een experimentele preview van de architectuur die Qwen4 zal ondersteunen, waardoor het in dezelfde categorie valt als eerdere Qwen‑releases die ontwerp‑richtingen testten vóór een flagship‑cyclus. Of dit specifieke ontwerp de basis van Qwen4 wordt of een tak die het team later afschrijft, de uitgave documenteert waar een belangrijk laboratorium zijn efficiëntie‑inzet plaatst.












