AI-modeller og platforme
Baseten tilføjer DeepSeek-V4.1-Flash til model-API’er med 1M-token kontekst

DeepSeek-V4.1-Flash er nu tilgængelig på Baseten Model API’er, Baseten annoncerede den 11. september 2026, og bringer den 552‑milliarder‑parameter multimodale mixture‑of‑experts (MoE)-model, som kombinerer 8 milliarder aktive parametre til forudfyldning med 16 milliarder til dekodning over et 1 M‑token kontekstvindue, til udbyderens inferensplatform.
DeepSeek udgav modellens åbne vægte på Hugging Face, og DeepSeek’s egen meddelelse er dateret den 9. september 2026. Modellen accepterer tekst‑ og billedinput og genererer tekstoutput, og modelkortet angiver, at repositoryet og vægtene er licenseret under MIT‑licensen. Baseten beskriver V4.1-Flash som DeepSeeks tredje open‑weight flash‑udgivelse i 2026 og som den eneste model i sin skala, der bruger det, DeepSeek kalder en Causal Encoder‑Decoder‑arkitektur. Support til Basetens Loops‑træningsprodukt kommer snart, ifølge virksomheden.
Rapporterede benchmarkresultater
Modelkortet rapporterer instruktion‑modelresultater ved den maksimale resonneringsindsatsindstilling på 100: V4.1-Flash opnår 90,6 på Terminal‑Bench 2.1, sammenlignet med 82,7 for V4‑Flash og 87,9 for V4‑Pro; 74,2 på DeepSWE v1.1, sammenlignet med 54,4 og 62,7; og 54,8 på AutomationBench, sammenlignet med 37,7 og 43,2. Baseten fremhævede de samme kodnings‑ og agent‑tal, og sagde at V4.1-Flash slår V4‑Pro med cirka en tredjedel af de samlede parametre, samtidig med at de advarede om, at en score på 54,8 på AutomationBench betyder, at modellen fejler omkring halvdelen af komplekse arbejdsgange, og anbefalede holdene at holde et menneske i løkken for agent‑pipeline‑processer.
I kortets sammenligning med frontier‑modeller ved maksimal indsats viser V4.1-Flash 90,9 på GPQA Diamond, en Codeforces‑rating på 3471, og 63,9 på HLE med værktøjer. Baseten oplyser, at V4.1-Flash er DeepSeeks første ikke‑eksperimentelle model med indbygget billedinput, en funktion der tidligere kun var tilgængelig i den eksperimentelle V4‑Flash‑Vision‑Exp; deres tabel viser 78,9 på Chartography og 49 på ZeroBench for den nye model, sammenlignet med 64,3 og 35 for den eksperimentelle.
Causal Encoder‑Decoder‑arkitektur
Ifølge modelkortet organiserer V4.1-Flash en 40‑lagers Transformer som en 20‑lagers causal encoder efterfulgt af en 20‑lagers decoder, hvor decoderens globale nøgle‑værdi‑cache (KV) projiceres fra de sidste encoder‑skjulte tilstande i stedet for at udledes fra hver decoders eget skjulte lag. Designet aktiverer 8 milliarder parametre pr. token under forudfyldning og 16 milliarder under dekodning; Baseten sammenligner dette med V4‑Flash, som aktiverer 13 milliarder for begge trin, og beskriver ændringen som at udveksle en tungere dekodning for en meget lettere forudfyldning, en opsætning som Baseten siger øger omkostningseffektiviteten for kodningsagenter, hvis agent‑loops genererer langt flere forudfyldningstokens end dekodningstokens.
Kortet rapporterer, at modellens Compressed Sparse Attention 2 tildeler hvert opmærksomhedslag en af tre statiske tilstande (Full, Reindex eller Reuse), med en Hierarchical Sparse Indexer i decoderen, der begrænser dybere indekseringsomkostninger uafhængigt af kontekstlængden. Kombineret med FP4‑hoved‑KV‑caching reducerer disse design den globale KV‑cache til 890 byte pr. token, cirka en fjerdedel af V4‑Flash, ifølge kortet. En separat mekanisme, SWA Bounded Replay, rekonstruerer manglende sliding‑window‑attention KV‑tilstande ved kun at afspille de seneste tokens, hvilket reducerer den vedvarende KV‑fodaftryk til cirka en ottendedel af V4‑Flash. DeepSeeks meddelelse angiver, at besparelsen svarer til en fjerdedel af HBM‑ og en ottendedel af SSD‑lagringen i den foregående generation.
Hvert MoE‑lag bruger én delt ekspert og 384 routed‑eksperter med seks routed‑eksperter aktive pr. token, og modellen tilføjer Engram‑betinget hukommelse med 196 milliarder parametre sammen med DSpark‑speculativ dekodning, ifølge kortet. DeepSeek trænede modellen fra bunden på et 45 T‑token multimodalt korpus, trænede sin sparsomme opmærksomhed ved en sekvenslængde på 64 K, og udvidede konteksten til 1 M tokens ved 34 T tokens. Eftertræning følger en standard superviseret finjustering, forstærkningslæring, og en on‑policy destillationssekvens, med væsentlige ændringer koncentreret i stor‑skala automatiseret syntese af agent‑opgaver og -miljøer, og modellen eksponerer en kontinuerligt justerbar resonneringsindsatsindstilling fra 1 til 100.
DeepSeek API‑overgang og Baseten‑betjening
DeepSeek oplyser, at V4‑Flash og V4‑Flash‑Vision‑Exp er udfaset på deres platform, hvor de gamle API‑modellnavne midlertidigt omdirigeres til V4.1‑Flash for kompatibilitet. Ny API‑prissætning trådte i kraft kl. 04:00 UTC den 10. september 2026, med lavtrafikpriser sat til 50 % af spidsbelastningspriserne, og DeepSeek navngiver de officielle partnere WorkBuddy (inklusive CodeBuddy) og OpenCode som fuldt understøttende V4.1‑Flash.
Baseten sagde, at deres Inference Stack betjener modellen ved hjælp af NVIDIA Dynamo med KV‑cache‑bevidst routing, som dirigerer hver anmodning til den replika, der allerede har dens præfiks, i stedet for den frie replika. Modellen tilbydes via Basetens Model Library, med dedikerede implementeringer tilgængelige for hold, der har brug for reserveret kapacitet.
Fra kl. 04:00 UTC den 14. september 2026 vil alle deepseek‑v4‑pro‑anmodninger blive omdirigeret til V4.1‑Flash til V4.1‑Flash‑priser, en ordning som DeepSeek sagde vil fortsætte indtil V4.1‑Pro lanceres; laboratoriet oplyste, at tests udført af flere parter placerede V4.1‑Flash foran V4‑Pro med hensyn til ydeevne, omkostninger, hastighed og samlet køretid.












