Modely a platformy AI
Baseten přidává DeepSeek-V4.1-Flash do Model API s kontextem 1M tokenů

DeepSeek-V4.1-Flash je nyní k dispozici na Baseten Model API, Baseten oznámil 11. září 2026, přinášející multimodální model mixture-of-experts (MoE) s 552B parametry, který spojuje 8B aktivních parametrů pro předvyplnění s 16B pro dekódování v kontextovém okně o velikosti 1M tokenů, na platformu poskytovatele inference.
DeepSeek zveřejnil otevřené váhy modelu na Hugging Face a vlastní oznámení DeepSeek je datováno 9. září 2026. Model přijímá textové i obrazové vstupy a generuje textový výstup a karta modelu uvádí, že repozitář a váhy jsou licencovány pod licencí MIT. Baseten popisuje V4.1-Flash jako třetí otevřenou flash verzi DeepSeek v roce 2026 a jako jediný model této velikosti, který používá to, co DeepSeek nazývá architekturou Causal Encoder-Decoder. Podpora pro tréninkový produkt Baseten Loops bude brzy k dispozici, uvádí společnost.
Uvedené výsledky benchmarků
Karta modelu uvádí výsledky instruct-model při maximálním nastavení úsilí rozvažování 100: V4.1-Flash dosahuje 90,6 v Terminal-Bench 2.1, oproti 82,7 u V4-Flash a 87,9 u V4-Pro; 74,2 v DeepSWE v1.1, oproti 54,4 a 62,7; a 54,8 v AutomationBench, oproti 37,7 a 43,2. Baseten zdůraznil stejné ukazatele pro kódování a agenturní úlohy a uvedl, že V4.1-Flash překonává V4-Pro přibližně s třetinou celkových parametrů, přičemž varuje, že hodnota 54,8 v AutomationBench znamená, že model selže přibližně v polovině složitých pracovních postupů, a radí týmům, aby u agentních pipeline měli člověka v cyklu.
V porovnání karty s špičkovými modely při maximálním úsilí V4.1-Flash dosahuje 90,9 v GPQA Diamond, hodnocení Codeforces 3471, a 63,9 v HLE s nástroji. Baseten uvádí, že V4.1-Flash je první neexperimentální model DeepSeek s nativním vstupem obrazu, schopnost, která byla dříve omezena na experimentální V4-Flash-Vision-Exp; jeho tabulka uvádí 78,9 v Chartography a 49 v ZeroBench pro nový model, oproti 64,3 a 35 pro experimentální.
Architektura Causal Encoder-Decoder
Podle karty modelu V4.1-Flash organizuje 40vrstvý Transformer jako 20vrstvý kauzální enkodér následovaný 20vrstvým dekodérem, přičemž globální KV cache dekodéru je projekována z posledních skrytých stavů enkodéru místo toho, aby byla odvozena od skrytých stavů každé vrstvy dekodéru. Návrh aktivuje 8B parametrů na token během předvyplnění a 16B během dekódování; Baseten to kontrastuje s V4-Flash, který aktivuje 13B pro oba kroky, a popisuje změnu jako výměnu těžšího dekódování za mnohem lehčí předvyplnění, nastavení, o němž Baseten tvrdí, že zvyšuje nákladovou efektivitu pro kódovací agenty, jejichž agenturní smyčky generují mnohem více tokenů předvyplnění než dekódovacích tokenů.
Karta uvádí, že Compressed Sparse Attention 2 přiřazuje každé vrstvě pozornosti jeden ze tří statických režimů (Full, Reindex nebo Reuse), přičemž Hierarchical Sparse Indexer v dekodéru omezuje náklady na hlubší indexování nezávisle na délce kontextu. V kombinaci s hlavním FP4 KV cachováním tyto návrhy snižují globální KV cache na 890 bytů na token, což je zhruba čtvrtina V4-Flash, uvádí karta. Samostatný mechanismus SWA Bounded Replay rekonstruuje chybějící stavy KV pro posuvné okno pozornosti přehráním pouze nejnovějších tokenů, čímž snižuje trvalou KV stopu na přibližně jednu osminu V4-Flash. DeepSeek ve svém oznámení uvádí úsporu na úrovni čtvrtiny HBM a jedné osminy SSD úložiště předchozí generace.
Každá MoE vrstva používá jednoho sdíleného experta a 384 směrovaných expertů se šesti aktivními směrovanými experty na token a model přidává podmíněnou paměť Engram s 196B parametry vedle spekulativního dekódování DSpark, podle karty. DeepSeek trénoval model od nuly na multimodálním korpusu o 45T tokenů, trénoval jeho řídkou pozornost při délce sekvence 64K a rozšířil kontext na 1M tokenů při 34T tokenů. Po tréninku následuje standardní dozorované doladění, posilovací učení, a sekvence distilace on-policy, přičemž podstatné změny jsou soustředěny v rozsáhlé automatizované syntéze úkolů a prostředí agentů, a model poskytuje kontinuálně nastavitelný parametr úsilí rozvažování od 1 do 100.
Přechod DeepSeek API a poskytování Baseten
DeepSeek uvádí, že V4-Flash a V4-Flash-Vision-Exp jsou na jeho platformě ukončeny, přičemž staré názvy modelů API dočasně směrují na V4.1-Flash pro kompatibilitu. Nové cenové podmínky API vstoupily v platnost 04:00 UTC 10. září 2026, přičemž mimošpičkové sazby jsou nastaveny na 50 % špičkových sazeb, a DeepSeek označuje oficiální partnery WorkBuddy (včetně CodeBuddy) a OpenCode jako plně podporující V4.1-Flash.
Baseten uvedl, že jeho Inference Stack poskytuje model pomocí NVIDIA Dynamo s routováním vědomým KV cache, směrující každý požadavek k replikě, která již obsahuje jeho prefix, místo k libovolné volné replice. Model je nabízen prostřednictvím Baseten Model Library, s dedikovanými nasazeními dostupnými pro týmy potřebující rezervovanou kapacitu.
Od 04:00 UTC 14. září 2026 budou všechny požadavky deepseek-v4-pro směrovány na V4.1-Flash za sazeb V4.1-Flash, uspořádání, o kterém DeepSeek uvedl, že bude pokračovat až do uvedení V4.1-Pro; laboratoř uvedla, že testy více stran ukázaly, že V4.1-Flash předčí V4-Pro v oblasti výkonu, nákladů, rychlosti a celkové doby běhu.












