Моделі та платформи ШІ

Qwen3.8-Flash-Next демонструє архітектуру Qwen4 з 6 млрд активних параметрів

mm
Додайте Unite.AI до бажаних джерел у Google

Qwen3.8-Flash-Next демонструє архітектуру Qwen4 з гібридною увагою та 6 млрд активних параметрів

Команда Qwen компанії Alibaba випустила Qwen3.8-Flash-Next 26 серпня 2026 року — експериментальну модель з відкритими вагами, яка демонструє архітектуру, призначену стати основою Qwen4. Модель містить 125 млрд параметрів, але активує лише 6 млрд на токен, що команда позиціонує як крок до того, що вона називає остаточною економічною ефективністю.

Цей реліз — перша публічна модель, побудована за цим дизайном. Картка моделі Qwen3.8-Flash-Next описує її як каузальну мовну модель з візуальним енкодером, навчану як на етапі передтренування, так і після нього, і зазначає власну довжину контексту 262 144 токенів, розширювану до 1 млн. Картка позиціонує модель як конкретний крок до підвищення ефективності, а не як прапорцева модель за можливостями: команда підкреслює, що її турбує, як архітектурні рішення впливають на вартість інференсу у масштабі, особливо коли агентні навантаження з довгими контекстами стають домінуючим випадком використання.

Гібридна увага, затворені залишкові зв’язки та n‑грамні вбудовування

Архітектура базується на чотирьох зазначених змінах. Перша — оновлена схема гібридної уваги. Попередні гібридні моделі Qwen поєднували Gated DeltaNet з Gated Attention; Qwen3.8-Flash-Next замінює останню на Qwen Sparse Attention (QSA), яка працює на рівні мікроблоків, а не вибирає окремі токени. Картка стверджує, що це значно скорочує затримку при довгих контекстах. Модель розташовує свої 48 шарів у повторюваному шаблоні: три блоки Gated DeltaNet подаються у шар mixture‑of‑experts, після чого один блок QSA подається у шар mixture‑of‑experts, і цей цикл повторюється дванадцять разів.

Друга зміна — затворений залишковий механізм, який регулює інформацію, що проходить через розширені залишкові потоки, використовуючи поелементний, залежний від даних, ворота читання та скалярні ворота запису для кожної гілки. Картка представляє це як спосіб досягти більш детальної виразності між шарами, зберігаючи стабільність навчання та мінімізуючи накладні витрати інференсу.

Третя зміна — шар n‑грамних вбудовувань. Замість масштабування параметрів за рахунок додаткових експертів, модель додає 51 млрд параметрів у окреме вбудовування, індексоване короткими біграмами та триграмами на другому шарі. Команда описує це як напрямок масштабування параметрів, який вимагає менше обчислень, ніж mixture‑of‑experts, і краще підходить для перенесення на прискорювачі з обмеженою пам’яттю. Картка також зазначає шар передбачення мульти‑токенів з 4 млрд параметрів, навчений у кілька кроків.

Четверта зміна — сама технологія навчання. Оптимізатори Muon та AdamW застосовуються до певних категорій ваг, і команда стверджує, що це усунуло традиційні прогрівання розміру пакету на користь негайного старту з цільовим розміром пакету, орієнтуючись на переоформлені закони масштабування. За словами картки, це суттєво зменшує загальну кількість кроків оптимізатора, дозволяючи використовувати більші швидкості навчання.

Вендорно‑звітувані бенчмарки та їхнє значення

Картка повідомляє результати бенчмарків, порівнюючи Qwen3.8-Flash-Next з Qwen3.8-27B, Qwen3.7-Plus, DeepSeek-V4-Flash-0731 та Claude-Opus-4.6 (Max). Це вендорно‑звітувані дані, оцінені за допомогою власних інструментів команди, і їх слід трактувати саме так. За агентним кодуванням картка зазначає оцінку DeepSWE 1.1 у 58,7 у порівнянні з 42,2 у Qwen3.8-27B та 54,4 у DeepSeek-V4-Flash, з уточненням, що DeepSWE запускали на двох інструментах (Claude Code та mini‑SWE‑agent) і повідомляли найвищий результат серед них. За SWE‑bench Pro Qwen3.8-Flash-Next отримав 62,5, випереджаючи Qwen3.8-27B (61,7) та Qwen3.7‑Plus (55,8), причому всі моделі були переоцінені на оновленій версії бенчмарку після виправлення командою того, що вона називає проблемними завданнями.

Важливим є не окрема цифра, а загальна картина ефективності. Картка вказує 125 млрд загальних параметрів, з яких активовано 6 млрд, у порівнянні з 397 млрд загальних і 17 млрд активованих у Qwen3.7‑Plus. У розділі загальних знань модель отримала оцінку GPQA Diamond 91,7, LiveCodeBench v6 — 91,9, та HLE 35,9, оцінені GPT‑4o замість стандартного оцінювача бенчмарку. Картка відкрито повідомляє про ці вибори, що є кращим, ніж у багатьох інших релізів, проте це все ж рішення вендора.

Доступність та шлях до Qwen4

Qwen3.8-Flash-Next вже доступний на Hugging Face за ліцензією qwen-community-1.0, при цьому ваги у форматі BF16 становлять приблизно 180 млрд параметрів, розподілених між мовною моделлю, n‑грамним вбудовуванням та шаром передбачення мульти‑токенів. Картка рекомендує розгортання через SGLang, vLLM або TokenSpeed і зазначає, що Qwen3.8-Flash — орієнтований на продакшн аналог, побудований на цьому прев’ю з контекстом за замовчуванням у 1 млн токенів і офіційними вбудованими інструментами — призначений для використання в керованому API через Qwen Cloud.

Мітка «Next» і є підказкою. Команда явно позиціонує це як експериментальне прев’ю архітектури, яка стане основою Qwen4, що ставить її в ту ж категорію, що й попередні випуски Qwen, які тестували напрямки дизайну перед випуском флагманської моделі. Незалежно від того, чи стане цей конкретний дизайн фундаментом Qwen4, чи це лише гілка, яку команда згодом відкине, реліз документує, куди один великий лабораторний підрозділ вкладає свої ставки на ефективність.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.