Модели и платформы ИИ
Baseten добавляет DeepSeek-V4.1-Flash в API моделей с контекстом в 1 М токенов

DeepSeek-V4.1-Flash теперь доступен в API моделей Baseten, Baseten объявил 11 сентября 2026 года, предоставив 552‑млрд‑параметров мультимодальную модель mixture-of-experts (MoE), в которой 8 млрд активных параметров используется для предзаполнения, а 16 млрд — для декодирования в окне контекста в 1 М токенов, на платформу поставщика инференса.
DeepSeek выпустил открытые веса модели на Hugging Face, а сообщение DeepSeek датировано 9 сентября 2026 года. Модель принимает текстовый и визуальный ввод и генерирует текстовый вывод, и карточка модели указывает, что репозиторий и веса лицензированы по MIT License. Baseten описывает V4.1-Flash как третье в 2026 году открытое flash‑издание DeepSeek и как единственную модель такого масштаба, использующую то, что DeepSeek называет архитектурой Causal Encoder-Decoder. Поддержка продукта обучения Loops от Baseten появится в ближайшее время, согласно компании.
Сообщённые результаты бенчмарков
Карточка модели сообщает результаты instruct‑model при максимальном уровне усилий рассуждения 100: V4.1-Flash набирает 90,6 в Terminal‑Bench 2.1, против 82,7 у V4‑Flash и 87,9 у V4‑Pro; 74,2 в DeepSWE v1.1, против 54,4 и 62,7; и 54,8 в AutomationBench, против 37,7 и 43,2. Baseten подчеркнул те же показатели кодирования и агентности, заявив, что V4.1‑Flash превосходит V4‑Pro при примерно одной трети общего количества параметров, при этом предупредив, что 54,8 в AutomationBench означает, что модель не справляется примерно с половиной сложных рабочих процессов, и посоветовал командам оставлять человека в цикле для агентных конвейеров.
В сравнении карточки с передовыми моделями при максимальном усилии V4.1‑Flash показывает 90,9 в GPQA Diamond, рейтинг Codeforces 3471, и 63,9 в HLE с инструментами. Baseten заявляет, что V4.1‑Flash — первая неэкспериментальная модель DeepSeek с нативным вводом изображений, возможность, ранее доступная только экспериментальной V4‑Flash‑Vision‑Exp; её таблица показывает 78,9 в Chartography и 49 в ZeroBench для новой модели, против 64,3 и 35 у экспериментальной.
Архитектура Causal Encoder-Decoder
Согласно карточке модели, V4.1‑Flash организует 40‑слойный Transformer как 20‑слойный каузальный энкодер, за которым следует 20‑слойный декодер; глобальный кэш ключ‑значение (KV) декодера формируется из окончательных скрытых состояний энкодера, а не из скрытых состояний каждого слоя декодера. Дизайн активирует 8 млрд параметров на токен во время предзаполнения и 16 млрд во время декодирования; Baseten сравнивает это с V4‑Flash, который активирует 13 млрд для обоих этапов, представляя изменение как замену более тяжёлого декодирования на гораздо более лёгкое предзаполнение, что, по словам Baseten, повышает экономичность для кодирующих агентов, чьи агентные циклы генерируют значительно больше токенов предзаполнения, чем декодирования.
Карточка сообщает, что Compressed Sparse Attention 2 модели назначает каждому слою внимания один из трёх статических режимов (Full, Reindex или Reuse), при этом иерархический разреженный индексатор в декодере ограничивает стоимость более глубокого индексирования независимо от длины контекста. В сочетании с основным кэшем KV FP4 эти конструкции снижают глобальный кэш KV до 890 байт на токен, примерно четверть от V4‑Flash, указывает карточка. Отдельный механизм, SWA Bounded Replay, восстанавливает недостающие состояния KV скользящего окна внимания, воспроизводя только самые последние токены, уменьшая постоянный объём KV примерно до одной восьмой от V4‑Flash. В объявлении DeepSeek экономия составляет одну четверть объёма HBM и одну восьмую объёма SSD‑хранилища предыдущего поколения.
Каждый слой MoE использует одного общего эксперта и 384 маршрутизируемых эксперта, при этом шесть маршрутизируемых экспертов активны на токен, а модель добавляет условную память Engram с 196 млрд параметров вместе со спекулятивным декодированием DSpark, согласно карточке. DeepSeek обучил модель с нуля на мультимодальном корпусе в 45 трлн токенов, обучил её разреженное внимание при длине последовательности 64 К, и расширил контекст до 1 М токенов при 34 трлн токенов. После обучения проводится стандартная контролируемая дообучка, обучение с подкреплением, и последовательность дистилляции on‑policy, при этом существенные изменения сосредоточены на крупномасштабном автоматическом синтезе задач агентов и окружений, а модель предоставляет непрерывно регулируемый параметр усилий рассуждения от 1 до 100.
Переход API DeepSeek и обслуживание в Baseten
DeepSeek сообщает, что V4‑Flash и V4‑Flash‑Vision‑Exp сняты с платформы, при этом старые названия моделей API временно перенаправляются на V4.1‑Flash для совместимости. Новое ценообразование API вступило в силу 10 сентября 2026 г. в 04:00 UTC, при этом тарифы в непиковые часы установлены на уровне 50 % от пиковых, а DeepSeek назвал официальными партнёрами WorkBuddy (включая CodeBuddy) и OpenCode, полностью поддерживающих V4.1‑Flash.
Baseten заявила, что её стек Inference обслуживает модель с помощью NVIDIA Dynamo с маршрутизацией, учитывающей кэш KV, направляя каждый запрос к реплике, уже содержащей его префикс, а не к любой свободной реплике. Модель предлагается через Model Library от Baseten, при этом доступны выделенные развертывания для команд, которым требуется зарезервированная ёмкость.
Начиная с 14 сентября 2026 г. в 04:00 UTC, все запросы deepseek‑v4‑pro будут перенаправляться на V4.1‑Flash по тарифам V4.1‑Flash, что, по словам DeepSeek, продлится до запуска V4.1‑Pro; лаборатория сообщила, что тесты несколькими сторонами показывают преимущество V4.1‑Flash над V4‑Pro по производительности, стоимости, скорости и общему времени выполнения.












