Моделі та платформи ШІ

Baseten додає DeepSeek‑V4.1‑Flash до Model API з контекстом у 1 млн токенів

mm
Додайте Unite.AI до бажаних джерел у Google

DeepSeek‑V4.1‑Flash вже доступний у Baseten Model API, Baseten оголосив 11 вересня 2026 р., додаючи 552‑млрд‑параметрову мультимодальну модель mixture‑of‑experts (MoE), яка поєднує 8 млрд активних параметрів для заповнення та 16 млрд для декодування у вікні контексту в 1 млн токенів, до платформи постачальника інференсу.

DeepSeek випустив відкриті ваги моделі на Hugging Face, а офіційне оголошення DeepSeek датовано 9 вересня 2026 р. Модель приймає текстовий та графічний вхід і генерує текстовий вихід, і карта моделі зазначає, що репозиторій і ваги ліцензовані за ліцензією MIT. Baseten описує V4.1‑Flash як третій у 2026 р. відкритий flash‑реліз DeepSeek і як єдину модель такого масштабу, що використовує те, що DeepSeek називає архітектурою Causal Encoder‑Decoder. Підтримка продукту навчання Loops від Baseten з’явиться незабаром, за словами компанії.

Зазначені результати бенчмарків

Карта моделі повідомляє результати instruct‑model при максимальному налаштуванні зусиль розумової обробки 100: V4.1‑Flash отримав 90,6 у Terminal‑Bench 2.1, у порівнянні з 82,7 у V4‑Flash та 87,9 у V4‑Pro; 74,2 у DeepSWE v1.1, у порівнянні з 54,4 та 62,7; і 54,8 у AutomationBench, у порівнянні з 37,7 та 43,2. Baseten підкреслив ті ж показники кодування та агентності, зазначивши, що V4.1‑Flash перевершує V4‑Pro, використовуючи приблизно третину загальної кількості параметрів, при цьому застерігаючи, що 54,8 у AutomationBench означає, що модель не справляється приблизно з половиною складних робочих процесів, і радить командам залишати людину в циклі для агентних конвеєрів.

У порівнянні карти з передовими моделями при максимальному зусиллі V4.1‑Flash набирає 90,9 у GPQA Diamond, рейтинг Codeforces 3471, та 63,9 у HLE з інструментами. Baseten стверджує, що V4.1‑Flash є першою неекспериментальною моделлю DeepSeek з вбудованим ввідом зображень, можливістю, раніше обмеженою експериментальною V4‑Flash‑Vision‑Exp; у її таблиці зазначено 78,9 у Chartography та 49 у ZeroBench для нової моделі, проти 64,3 та 35 для експериментальної.

Архітектура Causal Encoder‑Decoder

Згідно з картою моделі, V4.1‑Flash організовує 40‑шаровий Transformer як 20‑шаровий каузальний енкодер, за яким слідує 20‑шаровий декодер, причому глобальний кеш ключ‑значення (KV) декодера проєктується з останніх прихованих станів енкодера, а не отримується з власних прихованих станів кожного шару декодера. Дизайн активує 8 млрд параметрів на токен під час заповнення та 16 млрд під час декодування; Baseten порівнює це з V4‑Flash, який активує 13 млрд для обох етапів, представляючи зміну як заміну важчого декодування на значно легше заповнення, що, за словами Baseten, підвищує економічну ефективність для кодуючих агентів, чиї агентні цикли генерують набагато більше токенів заповнення, ніж токенів декодування.

У карті зазначено, що Compressed Sparse Attention 2 моделі призначає кожному шару уваги один із трьох статичних режимів (Full, Reindex або Reuse), з ієрархічним Sparse Indexer у декодері, який обмежує глибший індексувальний витрат незалежно від довжини контексту. У поєднанні з основним кешем KV FP4 ці рішення зменшують глобальний кеш KV до 890 байт на токен, приблизно чверть від V4‑Flash, згідно з картою. Окремий механізм, SWA Bounded Replay, відновлює відсутні стани KV скользячого вікна, відтворюючи лише найновіші токени, зменшуючи постійний слід KV приблизно до однієї восьмої від V4‑Flash. Оголошення DeepSeek зазначає, що економія становить одну чверть HBM і одну восьму SSD‑пам’яті попереднього покоління.

Кожен MoE‑шар використовує одного спільного експерта та 384 маршрутизованих експерти, з шістьма активними маршрутизованими експертами на токен, і модель додає умовну пам’ять Engram з 196 млрд параметрів разом з спекулятивним декодуванням DSpark, згідно з картою. DeepSeek навчила модель з нуля на 45 трлн‑токеновому мультимодальному корпусі, навчила її розріджену увагу при довжині послідовності 64 К, і розширила контекст до 1 млн токенів при 34 трлн токенах. Після навчання проводиться стандартне контрольоване тонке налаштування, підкріплювальне навчання, і послідовність дистиляції за політикою, з суттєвими змінами, сконцентрованими у масштабному автоматизованому синтезі агентних завдань та середовищ, і модель надає безперервно кероване налаштування зусиль розумової обробки від 1 до 100.

Перехід API DeepSeek та обслуговування Baseten

DeepSeek заявляє, що V4‑Flash та V4‑Flash‑Vision‑Exp виведені з експлуатації на його платформі, при цьому старі назви моделей API тимчасово перенаправляються на V4.1‑Flash для сумісності. Нове ціноутворення API набуло чинності о 04:00 UTC 10 вересня 2026 р., при цьому позапік-ставки встановлені на 50 % від пікових, і DeepSeek називає офіційних партнерів WorkBuddy (включаючи CodeBuddy) та OpenCode повністю підтримуючими V4.1‑Flash.

Baseten зазначив, що його стек Inference обслуговує модель за допомогою NVIDIA Dynamo з маршрутизацією, що враховує кеш KV, спрямовуючи кожен запит до репліки, яка вже містить його префікс, а не до вільної репліки. Модель пропонується через Model Library від Baseten, з окремими розгортаннями для команд, яким потрібна зарезервована потужність.

Починаючи з 04:00 UTC 14 вересня 2026 р., усі запити deepseek‑v4‑pro будуть перенаправлені на V4.1‑Flash за тарифами V4.1‑Flash, що, за словами DeepSeek, триватиме до запуску V4.1‑Pro; лабораторія зазначила, що тести кількох сторін показали перевагу V4.1‑Flash над V4‑Pro за продуктивністю, вартістю, швидкістю та загальним часом виконання.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.