Modele i platformy AI
Baseten dodaje DeepSeek-V4.1-Flash do interfejsów API modeli z kontekstem 1M tokenów

DeepSeek-V4.1-Flash jest już dostępny w Baseten Model APIs, Baseten ogłosił 11 września 2026 roku, wprowadzając multimodalny model mieszanki ekspertów (MoE) o 552 miliardach parametrów, który łączy 8 miliardy aktywnych parametrów przy wstępnym wypełnianiu z 16 miliardami przy dekodowaniu w oknie kontekstu o długości 1 M tokenów, do platformy dostawcy inferencji.
DeepSeek udostępnił otwarte wagi modelu na platformie Hugging Face, a własne ogłoszenie DeepSeek datuje się na 9 września 2026 roku. Model przyjmuje tekst i obrazy jako wejście oraz generuje tekst jako wyjście, a karta modelu informuje, że repozytorium i wagi są licencjonowane na warunkach licencji MIT. Baseten opisuje V4.1-Flash jako trzecią w 2026 roku otwartą wersję flash DeepSeek oraz jedyny model tej skali wykorzystujący to, co DeepSeek nazywa architekturą Causal Encoder-Decoder. Według firmy wsparcie dla produktu szkoleniowego Loops firmy Baseten pojawi się wkrótce.
Zgłoszone wyniki benchmarków
Karta modelu podaje wyniki modelu instrukcyjnego przy maksymalnym ustawieniu wysiłku rozumowania 100: V4.1-Flash uzyskuje 90,6 w Terminal-Bench 2.1, w porównaniu do 82,7 dla V4-Flash i 87,9 dla V4-Pro; 74,2 w DeepSWE v1.1, w porównaniu do 54,4 i 62,7; oraz 54,8 w AutomationBench, w porównaniu do 37,7 i 43,2. Baseten podkreślił te same wyniki kodowania i agentowe, stwierdzając, że V4.1-Flash przewyższa V4-Pro przy około jednej trzeciej całkowitej liczby parametrów, jednocześnie ostrzegając, że wynik 54,8 w AutomationBench oznacza, że model nie radzi sobie z około połową złożonych przepływów pracy i zalecając zespołom utrzymanie człowieka w pętli w pipeline’ach agentów.
W porównaniu karty z modelami wiodącymi przy maksymalnym wysiłku, V4.1-Flash uzyskuje 90,9 w GPQA Diamond, rating Codeforces 3471, oraz 63,9 w HLE z narzędziami. Baseten stwierdza, że V4.1-Flash jest pierwszym modelem DeepSeek nie‑eksperymentalnym z natywnym wejściem obrazu, funkcją dotychczas ograniczoną do eksperymentalnego V4-Flash-Vision-Exp; w jego tabeli podano 78,9 w Chartography i 49 w ZeroBench dla nowego modelu, w porównaniu do 64,3 i 35 dla wersji eksperymentalnej.
Architektura Causal Encoder-Decoder
Zgodnie z kartą modelu, V4.1-Flash organizuje 40‑warstwowy Transformer jako 20‑warstwowy kodownik przyczynowy, po którym następuje 20‑warstwowy dekoder, przy czym globalna pamięć klucz‑wartość (KV) dekodera jest projektowana z końcowych stanów ukrytych kodownika, a nie wyprowadzana z własnych stanów ukrytych każdej warstwy dekodera. Projekt aktywuje 8 miliardów parametrów na token podczas wstępnego wypełniania i 16 miliardów podczas dekodowania; Baseten zestawia to z V4-Flash, który aktywuje 13 miliardów w obu krokach, opisując zmianę jako wymianę cięższego dekodowania na znacznie lżejsze wstępne wypełnianie, co według Baseten zwiększa efektywność kosztową agentów kodujących, których pętle agentowe generują znacznie więcej tokenów wstępnych niż tokenów dekodowania.
Karta informuje, że Compressed Sparse Attention 2 modelu przydziela każdej warstwie uwagi jeden z trzech statycznych trybów (Full, Reindex lub Reuse), a hierarchiczny indeksator rzadki w dekoderze ogranicza koszt głębszego indeksowania niezależnie od długości kontekstu. W połączeniu z głównym buforowaniem KV w formacie FP4, te rozwiązania zmniejszają globalną pamięć KV do 890 bajtów na token, czyli mniej więcej jednej czwartej V4-Flash, jak podaje karta. Oddzielny mechanizm, SWA Bounded Replay, odtwarza brakujące stany KV uwagi okna przesuwnikowego, odtwarzając jedynie najnowsze tokeny, co redukuje trwały ślad KV do około jednej ósmej V4-Flash. Ogłoszenie DeepSeek podaje oszczędności na poziomie jednej czwartej pamięci HBM i jednej ósmej pamięci SSD poprzedniej generacji.
Każda warstwa MoE wykorzystuje jednego wspólnego eksperta oraz 384 ekspertów routowanych, przy czym sześć ekspertów routowanych jest aktywnych na token, a model dodaje warunkową pamięć Engram o 196 miliardach parametrów wraz z spekulacyjnym dekodowaniem DSpark, zgodnie z kartą. DeepSeek wytrenował model od podstaw na multimodalnym korpusie o 45 trilionach tokenów, wytrenował jego rzadką uwagę przy długości sekwencji 64 K oraz rozszerzył kontekst do 1 M tokenów przy 34 T tokenach. Po treningu następuje standardowe nadzorowane dostrajanie, uczenie ze wzmocnieniem, oraz sekwencja destylacji on‑policy, przy czym istotne zmiany skoncentrowane są na dużej skali automatycznej syntezie zadań i środowisk agentów, a model udostępnia ciągle regulowane ustawienie wysiłku rozumowania od 1 do 100.
Przejście API DeepSeek i usługi Baseten
DeepSeek informuje, że V4-Flash i V4-Flash-Vision-Exp zostały wycofane na jego platformie, a stare nazwy modeli API tymczasowo kierują do V4.1-Flash w celu zachowania kompatybilności. Nowe ceny API weszły w życie o 04:00 UTC 10 września 2026 roku, przy czym stawki poza szczytem ustalono na 50 % stawek szczytowych, a DeepSeek wymienia oficjalnych partnerów WorkBuddy (w tym CodeBuddy) oraz OpenCode jako w pełni wspierających V4.1-Flash.
Baseten oświadczył, że jego stos Inference obsługuje model przy użyciu NVIDIA Dynamo z routowaniem świadomym pamięci KV, kierując każde żądanie do repliki już posiadającej jego prefiks, a nie do dowolnej wolnej repliki. Model jest dostępny w Bibliotece Modeli Baseten, a dedykowane wdrożenia są dostępne dla zespołów potrzebujących zarezerwowanej pojemności.
Od 04:00 UTC 14 września 2026 roku wszystkie żądania deepseek-v4-pro będą kierowane do V4.1-Flash po stawkach V4.1-Flash, co DeepSeek zapowiedział, że będzie obowiązywać do uruchomienia V4.1-Pro; laboratorium podało, że testy przeprowadzone przez wiele podmiotów wykazały, że V4.1-Flash wypada lepiej od V4-Pro pod względem wydajności, kosztów, szybkości i całkowitego czasu działania.












