AI-mallit ja alustat
Baseten lisää DeepSeek-V4.1-Flash -mallin API:iin 1M-tokenin kontekstilla

DeepSeek-V4.1-Flash on nyt saatavilla Basetenin mallin API:ssa, Baseten ilmoitti 11. syyskuuta 2026, tuoden 552B-parametrisen multimodaalisen mixture-of-experts (MoE) -mallin, jossa on 8B aktiivista parametria esitäytölle ja 16B dekoodaukselle 1M-tokenin kontekstialueella, inferenssipalvelun alustalle.
DeepSeek julkaisi mallin avoimet painot Hugging Facessa, ja DeepSeekin oma ilmoitus on päivätty 9. syyskuuta 2026. Malli hyväksyy teksti- ja kuva‑syötteet ja tuottaa teksti‑tulosteen, ja mallikortti kertoo, että repositorio ja painot on lisensoitu MIT‑lisenssillä. Baseten kuvaa V4.1-Flashia DeepSeekin kolmantena avoimen painon flash‑julkaisuna vuonna 2026 ja ainoana tämän mittakaavan mallina, joka käyttää DeepSeekin kutsumaa Causal Encoder-Decoder -arkkitehtuuria. Basetenin Loops‑koulutustuotteen tuki on tulossa pian, yhtiön mukaan.
Raportoituja benchmark-tuloksia
Mallikortti raportoi ohjeistusmallin tulokset maksimikäsittelyponnistuksen asetuksella 100: V4.1-Flash saa 90,6 pistettä Terminal-Bench 2.1:ssä, verrattuna V4-Flashin 82,7:ään ja V4-Pro:n 87,9:ään; 74,2 pistettä DeepSWE v1.1:ssä, verrattuna 54,4 ja 62,7; sekä 54,8 pistettä AutomationBenchissä, verrattuna 37,7 ja 43,2. Baseten korosti samoja koodaus- ja agenttifigureita, todeten että V4.1-Flash päihittää V4-Pro:n noin kolmasosalla kokonaisparametreista, samalla varoittaen että 54,8 AutomationBenchissä tarkoittaa, että malli epäonnistuu noin puolella monimutkaisista työnkuluista, ja neuvoten tiimejä pitämään ihmisen mukana agenttiputkissa.
Kortin vertailussa huippumallien kanssa maksimaalisen ponnistuksen tasolla V4.1-Flash saavuttaa 90,9 pistettä GPQA Diamondissa, Codeforces‑arviona 3471, ja 63,9 pistettä HLE:ssä työkalujen kanssa. Baseten toteaa, että V4.1-Flash on DeepSeekin ensimmäinen ei‑kokeellinen malli, jossa on natiivi kuvan syöte, ominaisuus, joka aiemmin rajoittui kokeelliseen V4-Flash-Vision-Exp:iin; sen taulukko näyttää 78,9 pistettä Chartographyssa ja 49 pistettä ZeroBenchissä uudelle mallille, verrattuna 64,3 ja 35 kokeelliseen.
Causal Encoder-Decoder -arkkitehtuuri
Mallikortin mukaan V4.1-Flash järjestää 40‑kerroksisen Transformer‑mallin 20‑kerroksiseksi kausaaliseksi enkooderiksi, jota seuraa 20‑kerroksinen dekooderi, ja dekooderin globaali avain‑arvo (KV) -välimuisti projisoidaan viimeisistä enkooderin piilotiloista sen sijaan, että se johdettaisiin jokaisen dekooderin kerroksen omista piilotiloista. Suunnittelu aktivoi 8 B parametria tokenia kohden esitäytössä ja 16 B dekoodauksessa; Baseten vertaa tätä V4-Flashiin, jossa aktivoi 13 B molemmissa vaiheissa, esittäen muutoksen raskaamman dekoodauksen vaihtamisena kevyempään esitäyttöön, asetelma jonka Baseten mukaan lisää kustannustehokkuutta koodausagenteille, joiden agenttipiirit tuottavat paljon enemmän esitäyttötokeneita kuin dekoodaustokeneita.
Kortti raportoi, että mallin Compressed Sparse Attention 2 määrittää jokaiselle huomiointikerrokselle yhden kolmesta staattisesta tilasta (Full, Reindex tai Reuse), ja dekooderissa oleva Hierarchical Sparse Indexer rajoittaa syvemmän indeksointikustannuksen riippumatta kontekstin pituudesta. Yhdistettynä FP4‑pää‑KV‑välimuistiin nämä suunnittelut pienentävät globaalin KV‑välimuistin 890 tavuun tokenia kohden, noin neljänneksen V4-Flashin tasosta, kortin mukaan. Erillinen mekanismi, SWA Bounded Replay, rekonstruoi puuttuvat liukuvuusikkunan‑huomiointiin liittyvät KV‑tilat toistamalla vain viimeisimmät tokenit, vähentäen pysyvän KV‑jalanjäljen noin kahdeksannelle V4-Flashin tasolle. DeepSeekin ilmoitus asettaa säästöt neljännekseen HBM‑muistista ja kahdeksanteen SSD‑tallennustilasta edelliseen sukupolveen verrattuna.
Jokainen MoE‑kerros käyttää yhtä jaettua asiantuntijaa ja 384 reititettyä asiantuntijaa, joista kuusi on aktiivisena tokenia kohden, ja malliin lisätään Engram‑ehdollinen muisti, jossa on 196 B parametria, sekä DSpark‑spesulatiivinen dekoodaus, kortin mukaan. DeepSeek koulutti mallin alusta alkaen 45 T‑tokenin multimodaaliseen korpukseen, koulutti sen harvan huomion 64 K sekvenssipituudella ja laajensi kontekstin 1 M tokeniin 34 T tokenin yhteismäärällä. Jälkikoulutus noudattaa tavallista valvottua hienosäätöä, vahvistusoppimista, ja politiikassa tapahtuvaa destillaatioketjua, jossa merkittävät muutokset keskittyvät laajamittaiseen automatisoituun agenttitehtävien ja -ympäristöjen synteesiin, ja malli tarjoaa jatkuvasti säädettävän päättelyponnistuksen asetuksen välillä 1–100.
DeepSeek API -siirtymä ja Basetenin tarjoilu
DeepSeek ilmoittaa, että V4-Flash ja V4-Flash-Vision-Exp on poistettu sen alustalta, ja vanhat API‑mallinimet ohjautuvat tilapäisesti V4.1-Flashiin yhteensopivuuden vuoksi. Uusi API‑hinnoittelu astui voimaan klo 04:00 UTC 10. syyskuuta 2026, ja ruuhka‑ajan ulkopuoliset hinnat on asetettu 50 % huippuhinnoista, ja DeepSeek nimeää virallisiksi kumppaneiksi WorkBuddy (mukaan lukien CodeBuddy) ja OpenCode, jotka tukevat V4.1-Flashia täysin.
Baseten kertoi, että sen Inference-pino palvelee mallia käyttäen NVIDIA Dynamo -ratkaisua, jossa KV‑välimuistitietoinen reititys ohjaa jokaisen pyynnön replikkaan, joka jo pitää sen etuliitettä, eikä vapaaseen replikkaan. Malli on tarjolla Basetenin Mallikirjaston kautta, ja omistetut käyttöönotot ovat saatavilla tiimeille, jotka tarvitsevat varattua kapasiteettia.
Alkaen klo 04:00 UTC 14. syyskuuta 2026, kaikki deepseek-v4-pro‑pyynnöt ohjataan V4.1-Flashiin V4.1-Flash‑hinnoilla, järjestely jonka DeepSeek sanoo jatkuvan, kunnes V4.1-Pro julkaistaan; laboratorio totesi, että useiden osapuolten testit asettavat V4.1-Flashin V4-Pro:n eteen suorituskyvyssä, kustannuksissa, nopeudessa ja kokonaisajassa.












