Модели и платформы ИИ

Qwen3.8-Flash-Next демонстрирует архитектуру Qwen4 с 6 млрд активных параметров

mm
Добавьте Unite.AI в избранные источники в Google

Qwen3.8-Flash-Next демонстрирует архитектуру Qwen4 с гибридным вниманием и 6 млрд активных параметров

Команда Qwen компании Alibaba выпустила Qwen3.8-Flash-Next 26 августа 2026 года, открытая экспериментальная модель с открытыми весами, демонстрирующую архитектуру, предназначенную стать основой Qwen4. Модель содержит 125 млрд параметров, но активирует лишь 6 млрд на токен, что команда рассматривает как шаг к тому, что она называет предельной экономичностью.

Это первое публичное модельное построение на основе данного дизайна. Карточка модели Qwen3.8-Flash-Next описывает её как причинно‑ориентированную языковую модель с визуальным энкодером, обученную как на предобучении, так и на постобучении, и указывает нативную длину контекста 262 144 токенов с возможностью расширения до 1 млн. Карточка позиционирует модель как конкретный шаг к эффективности, а не как флагманскую возможность: команда подчёркивает, что её беспокоит влияние архитектурных решений на стоимость вывода в масштабах, особенно когда агентные нагрузки с длинными контекстами становятся доминирующим сценарием использования.

Гибридное внимание, гейтовые остатки и N‑граммные эмбеддинги

Архитектура опирается на четыре заявленных изменения. Первое — переработанная схема гибридного внимания. В предыдущих гибридных моделях Qwen сочетали Gated DeltaNet с Gated Attention; Qwen3.8-Flash-Next заменяет последнее на Qwen Sparse Attention (QSA), который работает на уровне микроблоков, а не выбирает отдельные токены. По словам карточки, это значительно сокращает задержку при работе с длинным контекстом. Модель организует свои 48 слоёв в повторяющийся шаблон: три блока Gated DeltaNet, подающие данные в слой mixture‑of‑experts, затем один блок QSA, также подающий данные в слой mixture‑of‑experts, и всё это повторяется двенадцать раз.

Второе изменение — гейтовый остаточный механизм, который регулирует поток информации через расширенные остаточные потоки с помощью поэлементного, зависящего от данных гейта чтения и скалярного гейта записи для каждой ветки. Карточка представляет это как способ добиться более тонкой выразительности на разных уровнях, сохраняя стабильность обучения и минимизируя накладные расходы вывода.

Третье — слой n‑граммных эмбеддингов. Вместо масштабирования параметров за счёт дополнительных экспертов, модель добавляет 51 млрд параметров в отдельный эмбеддинг, индексируемый короткими биграммами и триграммами на втором слое. Команда описывает это как ось масштабирования параметров, требующую меньше вычислений, чем mixture‑of‑experts, и более подходящую для выгрузки на ускорители с ограниченной памятью. В карточке также отмечен слой предсказания мульти‑токенов в 4 млрд параметров, обученный многократными шагами.

Четвёртое — сама обучающая рецептура. Оптимизаторы Muon и AdamW применяются к конкретным категориям весов, а команда заявила, что отказалась от традиционных разогревов размера пакета в пользу непосредственного начала с целевого размера пакета, руководствуясь пересчитанными законами масштабирования. По словам карточки, это существенно сокращает общее число шагов оптимизатора, одновременно позволяя использовать более высокие скорости обучения.

Вендорные бенчмарки и что они измеряют

Карточка приводит результаты бенчмарков, сравнивающие Qwen3.8-Flash-Next с Qwen3.8-27B, Qwen3.7-Plus, DeepSeek‑V4‑Flash‑0731 и Claude‑Opus‑4.6 (Max). Это вендорные цифры, полученные на собственных тестовых стендах команды, и их следует воспринимать соответственно. По агентному программированию карточка указывает показатель DeepSWE 1.1 = 58.7 против 42.2 у Qwen3.8-27B и 54.4 у DeepSeek‑V4‑Flash, с оговоркой, что DeepSWE запускался на двух стендах (Claude Code и mini‑SWE‑agent), и был зафиксирован наивысший результат среди них. По SWE‑bench Pro Qwen3.8-Flash-Next набирает 62.5, опережая Qwen3.8-27B (61.7) и Qwen3.7‑Plus (55.8), при этом все модели переоценивались на уточнённой версии бенчмарка после того, как команда исправила так называемые проблемные задачи.

Важен не отдельный показатель, а общий паттерн эффективности. В карточке указано 125 млрд параметров всего, из которых активировано 6 млрд, в сравнении с 397 млрд всего и 17 млрд активных у Qwen3.7‑Plus. По общим знаниям модель демонстрирует результат GPQA Diamond = 91.7, LiveCodeBench v6 = 91.9 и HLE = 35.9, оцененный GPT‑4o, а не стандартным оценщиком бенчмарка. Карточка открыто сообщает о таких выборах, чего не хватает во многих релизах, однако эти решения остаются за вендором.

Доступность и путь к Qwen4

Qwen3.8-Flash-Next уже доступен на Hugging Face под лицензией qwen‑community‑1.0, веса в формате BF16 составляют примерно 180 млрд параметров, охватывая языковую модель, n‑граммный эмбеддинг и слой предсказания мульти‑токенов. Карточка рекомендует развёртывание через SGLang, vLLM или TokenSpeed и отмечает, что Qwen3.8‑Flash — производственная версия, построенная на основе этой предварительной модели с контекстом по умолчанию в 1 млн токенов и официальными встроенными инструментами — предназначена для управляемого API‑доступа через Qwen Cloud.

Маркер «Next» говорит сам за себя. Команда явно позиционирует это как экспериментальный предварительный просмотр архитектуры, которая станет основой Qwen4, помещая её в ту же категорию, что и ранние выпуски Qwen, проверявшие направления дизайна перед флагманским циклом. Будет ли конкретный дизайн фундаментом Qwen4 или ветвью, которую позже откажутся, релиз фиксирует, где одна крупная лаборатория делает ставку на эффективность.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.