Модели и платформы ИИ
Qwen3.8-Flash-Next демонстрирует архитектуру Qwen4 с 6 млрд активных параметров

Qwen3.8-Flash-Next демонстрирует архитектуру Qwen4 с гибридным вниманием и 6 млрд активных параметров
Команда Qwen компании Alibaba выпустила Qwen3.8-Flash-Next 26 августа 2026 года, открытая экспериментальная модель с открытыми весами, демонстрирующую архитектуру, предназначенную стать основой Qwen4. Модель содержит 125 млрд параметров, но активирует лишь 6 млрд на токен, что команда рассматривает как шаг к тому, что она называет предельной экономичностью.
Это первое публичное модельное построение на основе данного дизайна. Карточка модели Qwen3.8-Flash-Next описывает её как причинно‑ориентированную языковую модель с визуальным энкодером, обученную как на предобучении, так и на постобучении, и указывает нативную длину контекста 262 144 токенов с возможностью расширения до 1 млн. Карточка позиционирует модель как конкретный шаг к эффективности, а не как флагманскую возможность: команда подчёркивает, что её беспокоит влияние архитектурных решений на стоимость вывода в масштабах, особенно когда агентные нагрузки с длинными контекстами становятся доминирующим сценарием использования.
Гибридное внимание, гейтовые остатки и N‑граммные эмбеддинги
Архитектура опирается на четыре заявленных изменения. Первое — переработанная схема гибридного внимания. В предыдущих гибридных моделях Qwen сочетали Gated DeltaNet с Gated Attention; Qwen3.8-Flash-Next заменяет последнее на Qwen Sparse Attention (QSA), который работает на уровне микроблоков, а не выбирает отдельные токены. По словам карточки, это значительно сокращает задержку при работе с длинным контекстом. Модель организует свои 48 слоёв в повторяющийся шаблон: три блока Gated DeltaNet, подающие данные в слой mixture‑of‑experts, затем один блок QSA, также подающий данные в слой mixture‑of‑experts, и всё это повторяется двенадцать раз.
Второе изменение — гейтовый остаточный механизм, который регулирует поток информации через расширенные остаточные потоки с помощью поэлементного, зависящего от данных гейта чтения и скалярного гейта записи для каждой ветки. Карточка представляет это как способ добиться более тонкой выразительности на разных уровнях, сохраняя стабильность обучения и минимизируя накладные расходы вывода.
Третье — слой n‑граммных эмбеддингов. Вместо масштабирования параметров за счёт дополнительных экспертов, модель добавляет 51 млрд параметров в отдельный эмбеддинг, индексируемый короткими биграммами и триграммами на втором слое. Команда описывает это как ось масштабирования параметров, требующую меньше вычислений, чем mixture‑of‑experts, и более подходящую для выгрузки на ускорители с ограниченной памятью. В карточке также отмечен слой предсказания мульти‑токенов в 4 млрд параметров, обученный многократными шагами.
Четвёртое — сама обучающая рецептура. Оптимизаторы Muon и AdamW применяются к конкретным категориям весов, а команда заявила, что отказалась от традиционных разогревов размера пакета в пользу непосредственного начала с целевого размера пакета, руководствуясь пересчитанными законами масштабирования. По словам карточки, это существенно сокращает общее число шагов оптимизатора, одновременно позволяя использовать более высокие скорости обучения.
Вендорные бенчмарки и что они измеряют
Карточка приводит результаты бенчмарков, сравнивающие Qwen3.8-Flash-Next с Qwen3.8-27B, Qwen3.7-Plus, DeepSeek‑V4‑Flash‑0731 и Claude‑Opus‑4.6 (Max). Это вендорные цифры, полученные на собственных тестовых стендах команды, и их следует воспринимать соответственно. По агентному программированию карточка указывает показатель DeepSWE 1.1 = 58.7 против 42.2 у Qwen3.8-27B и 54.4 у DeepSeek‑V4‑Flash, с оговоркой, что DeepSWE запускался на двух стендах (Claude Code и mini‑SWE‑agent), и был зафиксирован наивысший результат среди них. По SWE‑bench Pro Qwen3.8-Flash-Next набирает 62.5, опережая Qwen3.8-27B (61.7) и Qwen3.7‑Plus (55.8), при этом все модели переоценивались на уточнённой версии бенчмарка после того, как команда исправила так называемые проблемные задачи.
Важен не отдельный показатель, а общий паттерн эффективности. В карточке указано 125 млрд параметров всего, из которых активировано 6 млрд, в сравнении с 397 млрд всего и 17 млрд активных у Qwen3.7‑Plus. По общим знаниям модель демонстрирует результат GPQA Diamond = 91.7, LiveCodeBench v6 = 91.9 и HLE = 35.9, оцененный GPT‑4o, а не стандартным оценщиком бенчмарка. Карточка открыто сообщает о таких выборах, чего не хватает во многих релизах, однако эти решения остаются за вендором.
Доступность и путь к Qwen4
Qwen3.8-Flash-Next уже доступен на Hugging Face под лицензией qwen‑community‑1.0, веса в формате BF16 составляют примерно 180 млрд параметров, охватывая языковую модель, n‑граммный эмбеддинг и слой предсказания мульти‑токенов. Карточка рекомендует развёртывание через SGLang, vLLM или TokenSpeed и отмечает, что Qwen3.8‑Flash — производственная версия, построенная на основе этой предварительной модели с контекстом по умолчанию в 1 млн токенов и официальными встроенными инструментами — предназначена для управляемого API‑доступа через Qwen Cloud.
Маркер «Next» говорит сам за себя. Команда явно позиционирует это как экспериментальный предварительный просмотр архитектуры, которая станет основой Qwen4, помещая её в ту же категорию, что и ранние выпуски Qwen, проверявшие направления дизайна перед флагманским циклом. Будет ли конкретный дизайн фундаментом Qwen4 или ветвью, которую позже откажутся, релиз фиксирует, где одна крупная лаборатория делает ставку на эффективность.












