AI-modeller och plattformar

Baseten lägger till DeepSeek-V4.1-Flash till modell‑API:er med 1 M‑token‑kontext

mm
Lägg till Unite.AI bland dina föredragna källor på Google

DeepSeek-V4.1-Flash är nu tillgänglig på Basetens modell‑API:er, Baseten meddelade den 11 september 2026, och för med sig den multimodala blandade‑experter‑modellen (MoE) med 552 B parametrar, som kombinerar 8 B aktiva parametrar för förifyllning med 16 B för avkodning över ett 1 M‑token‑kontextfönster, till leverantörens inferensplattform.

DeepSeek släppte modellens öppna vikter på Hugging Face, och DeepSeeks eget meddelande är daterat 9 september 2026. Modellen accepterar text‑ och bildinmatning och genererar textutdata, och modellkortet anger att förrådet och vikterna är licensierade under MIT‑licensen. Baseten beskriver V4.1-Flash som DeepSeeks tredje öppna‑vikt‑flash‑utgåva år 2026 och som den enda modellen i sin skala som använder det DeepSeek kallar en kausal encoder‑decoder‑arkitektur. Stöd för Basetens Loops‑träningsprodukt kommer snart, enligt företaget.

Rapporterade benchmarkresultat

Modellkortet rapporterar instruktions‑modellresultat vid den maximala resonemangsinsatsinställningen 100: V4.1-Flash får 90,6 på Terminal‑Bench 2.1, jämfört med 82,7 för V4‑Flash och 87,9 för V4‑Pro; 74,2 på DeepSWE v1.1, jämfört med 54,4 och 62,7; och 54,8 på AutomationBench, jämfört med 37,7 och 43,2. Baseten framhöll samma kod‑ och agent‑siffror och säger att V4.1-Flash slår V4‑Pro med ungefär en tredjedel av de totala parametrarna, samtidigt som de varnar för att 54,8 på AutomationBench innebär att modellen misslyckas med ungefär hälften av komplexa arbetsflöden och rekommenderar att team behåller en människa i loopen för agent‑pipelines.

I kortets jämförelse med frontier‑modeller vid maximal insats visar V4.1-Flash 90,9 på GPQA Diamond, en Codeforces‑ranking på 3471, och 63,9 på HLE med verktyg. Baseten uppger att V4.1-Flash är DeepSeeks första icke‑experimentella modell med inbyggd bildinmatning, en funktion som tidigare var begränsad till den experimentella V4‑Flash‑Vision‑Exp; dess tabell visar 78,9 på Chartography och 49 på ZeroBench för den nya modellen, jämfört med 64,3 och 35 för den experimentella.

Kausal encoder‑decoder‑arkitektur

Enligt modellkortet organiserar V4.1-Flash en 40‑lagers Transformer som en 20‑lagers kausal encoder följt av en 20‑lagers decoder, där decoderns globala nyckel‑värde‑cache (KV‑cache) projiceras från de sista encoder‑dolda tillstånden snarare än hämtas från varje decoders egna dolda tillstånd. Designen aktiverar 8 B parametrar per token under förifyllning och 16 B under avkodning; Baseten kontrasterar detta med V4‑Flash, som aktiverar 13 B för båda stegen, och beskriver förändringen som ett byte av en tyngre avkodning mot en mycket lättare förifyllning, en konfiguration som Baseten säger ökar kostnadseffektiviteten för kodningsagenter vars agent‑loopar genererar långt fler förifyllningstoken än avkodningstoken.

Kortet rapporterar att modellens Compressed Sparse Attention 2 tilldelar varje uppmärksamhetslager ett av tre statiska lägen (Full, Reindex eller Reuse), med en hierarkisk sparsam indexerare i decodern som begränsar djupare indexeringskostnad oberoende av kontextlängd. Kombinerat med FP4‑huvud‑KV‑cachning minskar dessa designer den globala KV‑cachen till 890 byte per token, ungefär en fjärdedel av V4‑Flash, enligt kortet. En separat mekanism, SWA Bounded Replay, rekonstruerar saknade sliding‑window‑attention‑KV‑tillstånd genom att återspela endast de senaste tokenen, vilket minskar den bestående KV‑avtrycket till ungefär en åttondel av V4‑Flash. DeepSeeks meddelande anger att besparingarna motsvarar en fjärdedel av HBM‑ och en åttondel av SSD‑lagringen jämfört med föregående generation.

Varje MoE‑lager använder en delad expert och 384 dirigerade experter med sex dirigerade experter aktiva per token, och modellen lägger till Engram‑villkorligt minne med 196 B parametrar tillsammans med DSpark‑speculativ avkodning, enligt kortet. DeepSeek tränade modellen från grunden på ett multimodalt korpus med 45 T‑token, tränade dess sparsa uppmärksamhet med en sekvenslängd på 64 K och utökade kontexten till 1 M token vid 34 T token. Efterträning följer en standardiserad övervakad finjustering, förstärkningsinlärning, och en on‑policy‑destillationssekvens, med väsentliga förändringar koncentrerade till storskalig automatiserad syntes av agentuppgifter och miljöer, och modellen erbjuder en kontinuerligt styrbar resonemangsinsatsinställning från 1 till 100.

DeepSeek API‑övergång och Baseten‑tjänst

DeepSeek uppger att V4‑Flash och V4‑Flash‑Vision‑Exp har pensionerats på deras plattform, med de gamla API‑modellnamnen tillfälligt omdirigerade till V4.1‑Flash för kompatibilitet. Ny API‑prissättning trädde i kraft kl. 04:00 UTC den 10 september 2026, med lågtidspriser satta till 50 % av högtrafikpriserna, och DeepSeek namnger de officiella partnerna WorkBuddy (inklusive CodeBuddy) och OpenCode som fullt stödjande V4.1‑Flash.

Baseten sade att deras Inference Stack levererar modellen med NVIDIA Dynamo och KV‑cache‑medveten routning, och styr varje förfrågan till den replika som redan har dess prefix snarare än till någon ledig replika. Modellen erbjuds via Basetens Model Library, med dedikerade distributioner tillgängliga för team som behöver reserverad kapacitet.

Från och med kl. 04:00 UTC den 14 september 2026 kommer alla deepseek‑v4‑pro‑förfrågningar att omdirigeras till V4.1‑Flash till V4.1‑Flash‑priser, ett arrangemang som DeepSeek säger kommer att fortsätta tills V4.1‑Pro lanseras; laboratoriet uppgav att tester av flera parter placerade V4.1‑Flash före V4‑Pro när det gäller prestanda, kostnad, hastighet och total körtid.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.