AI-modeller og plattformer
Baseten legger til DeepSeek‑V4.1‑Flash i modell‑API‑er med 1 M‑token‑kontekst

DeepSeek‑V4.1‑Flash er nå tilgjengelig på Baseten Model APIs, Baseten kunngjorde den 11. september 2026, og bringer den 552 B‑parameter‑multimodale mixture‑of‑experts (MoE)‑modellen, som kombinerer 8 B aktive parametere for pre‑fyll med 16 B for dekoding over et 1 M‑token‑kontekstvindu, til leverandørens inferensplattform.
DeepSeek publiserte modellens åpne vekter på Hugging Face, og DeepSeeks egen kunngjøring er datert 9. september 2026. Modellen aksepterer tekst‑ og bilde‑input og genererer tekst‑output, og modellkortet oppgir at depotet og vektene er lisensiert under MIT‑lisensen. Baseten beskriver V4.1‑Flash som DeepSeeks tredje åpne‑vekt‑flash‑utgivelse i 2026 og som den eneste modellen i sin skala som bruker det DeepSeek kaller en kausal encoder‑decoder‑arkitektur. Støtte for Basetens Loops‑treningsprodukt kommer snart, ifølge selskapet.
Rapporterte benchmark‑resultater
Modellkortet rapporterer instruksjons‑modellresultater ved maksimal resonneringsinnsatsinnstilling på 100: V4.1‑Flash får 90,6 på Terminal‑Bench 2.1, sammenlignet med 82,7 for V4‑Flash og 87,9 for V4‑Pro; 74,2 på DeepSWE v1.1, sammenlignet med 54,4 og 62,7; og 54,8 på AutomationBench, sammenlignet med 37,7 og 43,2. Baseten fremhevet de samme kode‑ og agent‑tallene, og sier at V4.1‑Flash slår V4‑Pro med omtrent en tredjedel av de totale parametrene, samtidig som de advarer om at en 54,8 på AutomationBench betyr at modellen mislykkes i omtrent halvparten av komplekse arbeidsflyter, og anbefaler team å holde et menneske i loopen for agent‑pipelines.
I kortets sammenligning med frontier‑modeller ved maksimal innsats, oppnår V4.1‑Flash 90,9 på GPQA Diamond, en Codeforces‑rangering på 3471, og 63,9 på HLE med verktøy. Baseten oppgir at V4.1‑Flash er DeepSeeks første ikke‑eksperimentelle modell med innebygd bilde‑input, en funksjon som tidligere var begrenset til den eksperimentelle V4‑Flash‑Vision‑Exp; tabellen viser 78,9 på Chartography og 49 på ZeroBench for den nye modellen, mot 64,3 og 35 for den eksperimentelle.
Kausal encoder‑decoder‑arkitektur
Ifølge modellkortet organiserer V4.1‑Flash en 40‑lags Transformer som en 20‑lags kausal encoder etterfulgt av en 20‑lags decoder, hvor dekoderens globale nøkkel‑verdi‑ (KV)‑cache projiseres fra de siste encoder‑skjulte tilstandene i stedet for å avledes fra hver dekoderlags egne skjulte tilstander. Designet aktiverer 8 B parametere per token under pre‑fyll og 16 B under dekoding; Baseten kontrasterer dette med V4‑Flash, som aktiverer 13 B for begge trinn, og beskriver endringen som en bytte av en tyngre dekoding for en mye lettere pre‑fyll, en oppsett Baseten sier øker kostnadseffektiviteten for kode‑agenter hvis agent‑sløyfer genererer langt flere pre‑fyll‑token enn dekodings‑token.
Kortet rapporterer at modellens Compressed Sparse Attention 2 tilordner hver oppmerksomhets‑lag én av tre statiske modus (Full, Reindex eller Reuse), med en Hierarchical Sparse Indexer i dekoderen som begrenser dypere indekseringskostnad uavhengig av kontekstlengde. Kombinert med FP4‑hoved‑KV‑caching reduserer disse designene den globale KV‑cachen til 890 byte per token, omtrent en fjerdedel av V4‑Flash, ifølge kortet. En separat mekanisme, SWA Bounded Replay, rekonstruerer manglende sliding‑window‑attention‑KV‑tilstander ved kun å gjenskape de siste tokenene, og reduserer den vedvarende KV‑fotavtrykket til omtrent en åttendedel av V4‑Flash. DeepSeeks kunngjøring angir besparelsene til en fjerdedel av HBM‑ og en åttendedel av SSD‑lagringen til forrige generasjon.
Hvert MoE‑lag bruker én delt ekspert og 384 rutede eksperter med seks rutede eksperter aktive per token, og modellen legger til Engram‑betinget minne med 196 B parametere sammen med DSpark‑spekulativ dekoding, ifølge kortet. DeepSeek trente modellen fra bunnen på et 45 T‑token multimodalt korpus, trente sin sparsomme oppmerksomhet med en sekvenslengde på 64 K, og utvidet konteksten til 1 M token ved 34 T token. Etter‑trening følger en standard overvåket fin‑tuning, forsterkningslæring, og en on‑policy destillasjonssekvens, med vesentlige endringer konsentrert i storskalig automatisert syntese av agent‑oppgaver og miljøer, og modellen eksponerer en kontinuerlig kontrollerbar resonneringsinnsatsinnstilling fra 1 til 100.
DeepSeek API‑overgang og Baseten‑tjeneste
DeepSeek oppgir at V4‑Flash og V4‑Flash‑Vision‑Exp er avviklet på plattformen, med de gamle API‑modellnavnene midlertidig omdirigert til V4.1‑Flash for kompatibilitet. Ny API‑prising trådte i kraft kl. 04:00 UTC 10. september 2026, med lavtrafikkpriser satt til 50 % av topp‑prisene, og DeepSeek navngir de offisielle partnerne WorkBuddy (inkludert CodeBuddy) og OpenCode som fullt støttende V4.1‑Flash.
Baseten sa at deres Inference Stack betjener modellen ved bruk av NVIDIA Dynamo med KV‑cache‑bevisst ruting, og styrer hver forespørsel til den replikaen som allerede har prefiksen i stedet for hvilken som helst ledig replika. Modellen tilbys gjennom Basetens Model Library, med dedikerte distribusjoner tilgjengelige for team som trenger reservert kapasitet.
Fra kl. 04:00 UTC 14. september 2026 vil alle deepseek‑v4‑pro‑forespørsler bli omdirigert til V4.1‑Flash til V4.1‑Flash‑priser, en ordning DeepSeek sa vil fortsette til V4.1‑Pro lanseres; laboratoriet oppga at tester av flere parter plasserer V4.1‑Flash foran V4‑Pro på ytelse, kostnad, hastighet og total kjøretid.












