Modele i platformy AI
Qwen3.8-Flash-Next zapowiada architekturę Qwen4 z 6 mld aktywnych parametrów

Qwen3.8-Flash-Next zapowiada architekturę Qwen4 z hybrydową uwagą i 6 mld aktywnych parametrów
Zespół Qwen firmy Alibaba wydał Qwen3.8-Flash-Next 26 sierpnia 2026 r., otwarto‑wagowy model eksperymentalny, który zapowiada architekturę mającą stanowić podstawę Qwen4. Model posiada 125 mld parametrów, ale aktywuje jedynie 6 mld na token, co zespół opisuje jako krok w kierunku tego, co nazywa ostateczną efektywnością kosztową.
To wydanie jest pierwszym publicznym modelem zbudowanym na tej konstrukcji. Karta modelu Qwen3.8-Flash-Next model card opisuje go jako przyczynowy model językowy z enkoderem wizji, trenowany zarówno w fazie pre‑treningu, jak i post‑treningu, i podaje natywną długość kontekstu 262 144 tokenów, rozszerzalną do 1 miliona. Karta pozycjonuje model jako konkretny krok w kierunku efektywności, a nie flagowy model zdolnościowy: zespół podkreśla, że ich główną troską jest wpływ wyborów architektonicznych na koszt inferencji w dużej skali, szczególnie gdy zadania agentowe z długimi kontekstami stają się dominującym przypadkiem użycia.
Hybrydowa uwaga, bramkowane rezydua i osadzenia n‑gramowe
Architektura opiera się na czterech wymienionych zmianach. Pierwsza to przebudowany schemat hybrydowej uwagi. Poprzednie hybrydowe modele Qwen łączyły Gated DeltaNet z Gated Attention; Qwen3.8-Flash-Next zastępuje to drugie Qwen Sparse Attention (QSA), które działa na poziomie mikro‑bloków zamiast wybierania pojedynczych tokenów. Karta twierdzi, że znacząco skraca to opóźnienie przy długich kontekstach. Model układa swoje 48 warstw w powtarzający się wzorzec: trzy bloki Gated DeltaNet podłączone do warstwy mieszanki ekspertów, po czym jeden blok QSA podłączony do warstwy mieszanki ekspertów, powtórzone dwunastokrotnie.
Drugą zmianą jest bramkowany mechanizm rezydualny, który moduluję przepływ informacji przez rozszerzone strumienie rezydualne przy użyciu bramki odczytu element‑po‑elemencie, zależnej od danych, oraz skalarnej bramki zapisu dla każdej gałęzi. Karta przedstawia to jako sposób na uzyskanie bardziej szczegółowej ekspresji w warstwach przy zachowaniu stabilności treningu i niskiego narzutu inferencji.
Trzecią zmianą jest warstwa osadzeń n‑gramowych. Zamiast skalować liczbę parametrów poprzez dodatkowych ekspertów, model dodaje 51 mld parametrów w osobnym osadzeniu indeksowanym krótkimi bigramami i trigramami w warstwie 2. Zespół opisuje to jako oś skalowania parametrów, która wymaga mniej obliczeń niż mieszanka ekspertów i jest łatwiejsza do odciążenia na akceleratory o ograniczonej pamięci. Karta również zauważa warstwę predykcji wielotokenowej o 4 mld parametrów, trenowaną wielokrotnymi krokami.
Czwartą zmianą jest sam przepis treningowy. Optymalizatory Muon i AdamW są stosowane do określonych kategorii wag, a zespół podaje, że zrezygnowano z tradycyjnych rozgrzewek rozmiaru partii na rzecz rozpoczęcia od razu od docelowego rozmiaru partii, kierując się przystosowanymi prawami skalowania. Według karty, znacząco zmniejsza to łączną liczbę kroków optymalizatora, jednocześnie umożliwiając większe współczynniki uczenia.
Benchmarki zgłoszone przez dostawców i co mierzą
Karta podaje wyniki benchmarków porównujące Qwen3.8-Flash-Next z Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 oraz Claude-Opus-4.6 (Max). Są to liczby zgłoszone przez dostawcę, oceniane na własnych platformach zespołu i należy je tak interpretować. W zakresie kodowania agentowego karta wymienia wynik DeepSWE 1.1 równy 58,7 w porównaniu do 42,2 dla Qwen3.8-27B i 54,4 dla DeepSeek-V4-Flash, z zastrzeżeniem, że DeepSWE został uruchomiony na dwóch platformach (Claude Code i mini‑SWE‑agent) i podano najwyższy wynik spośród obu. W benchmarku SWE‑bench Pro Qwen3.8-Flash-Next uzyskał 62,5, wyprzedzając Qwen3.8-27B (61,7) oraz Qwen3.7-Plus (55,8), przy czym wszystkie modele zostały ponownie ocenione na ulepszonej wersji benchmarku po tym, jak zespół skorygował tak zwane problematyczne zadania.
Wzorzec, który ma znaczenie, to twierdzenie o efektywności, a nie pojedyncza liczba. Karta podaje łącznie 125 mld parametrów, z czego 6 mld jest aktywnych, w porównaniu do 397 mld łącznie i 17 mld aktywnych w Qwen3.7-Plus. W zakresie wiedzy ogólnej model uzyskuje wynik GPQA Diamond 91,7, wynik LiveCodeBench v6 91,9 oraz wynik HLE 35,9 oceniony przez GPT‑4o zamiast domyślnego oceniającego benchmark. Karta jest przejrzysta co do tych wyborów, co przewyższa wiele innych wydań, jednak pozostają to decyzje podjęte przez dostawcę.
Dostępność i droga do Qwen4
Qwen3.8-Flash-Next jest już dostępny na platformie Hugging Face na licencji qwen‑community‑1.0, a wagi w formacie BF16 liczą łącznie około 180 mld parametrów obejmujących model językowy, osadzenia n‑gramowe oraz warstwę predykcji wielotokenowej. Karta zaleca wdrożenie przy użyciu SGLang, vLLM lub TokenSpeed oraz zauważa, że Qwen3.8‑Flash — produkcyjny odpowiednik oparty na tej zapowiedzi, z domyślnym kontekstem 1 mln tokenów i oficjalnymi wbudowanymi narzędziami — jest wersją przeznaczoną do zarządzanego użycia API poprzez Qwen Cloud.
Etykieta „Next” jest wskazówką. Zespół wyraźnie określa to jako eksperymentalną zapowiedź architektury, która będzie podstawą Qwen4, co umieszcza ją w tej samej kategorii co wcześniejsze wydania Qwen testujące kierunki projektowe przed cyklem flagowym. Niezależnie od tego, czy ta konkretna konstrukcja stanie się fundamentem Qwen4, czy gałęzią, którą zespół później porzuci, wydanie dokumentuje, gdzie jedno z dużych laboratoriów lokuje swoje zakłady na efektywność.












