KI-Modelle und Plattformen
Baseten fügt DeepSeek-V4.1-Flash zu Modell-APIs mit 1M-Token-Kontext hinzu

DeepSeek-V4.1-Flash ist jetzt über die Baseten Model APIs verfügbar, Baseten kündigte an am 11. September 2026, und bringt das 552B‑Parameter‑multimodale Mixture‑of‑Experts‑Modell (MoE) auf die Plattform des Inferenz‑Anbieters, das 8 B aktive Parameter für das Vorbefüllen mit 16 B für das Dekodieren über ein 1 M‑Token‑Kontextfenster kombiniert.
DeepSeek veröffentlichte die offenen Gewichte des Modells auf Hugging Face, und DeepSeek eigene Ankündigung ist vom 9. September 2026 datiert. Das Modell akzeptiert Text‑ und Bildeingaben und erzeugt Textausgaben, und die Modellkarte gibt an, dass das Repository und die Gewichte unter der MIT‑Lizenz stehen. Baseten beschreibt V4.1-Flash als DeepSeeks dritte Open‑Weight‑Flash‑Veröffentlichung des Jahres 2026 und als das einzige Modell seiner Größe, das die von DeepSeek genannte Causal Encoder‑Decoder‑Architektur verwendet. Laut dem Unternehmen wird die Unterstützung für Basetens Loops‑Training‑Produkt bald verfügbar sein.
Berichtete Benchmark-Ergebnisse
Die Modellkarte berichtet Instruktions‑Modellergebnisse bei der maximalen Denkaufwands‑Einstellung von 100: V4.1-Flash erzielt 90,6 bei Terminal-Bench 2.1, verglichen mit 82,7 für V4-Flash und 87,9 für V4-Pro; 74,2 bei DeepSWE v1.1, verglichen mit 54,4 bzw. 62,7; und 54,8 bei AutomationBench, verglichen mit 37,7 und 43,2. Baseten hob dieselben Coding‑ und agentischen Kennzahlen hervor und erklärte, dass V4.1-Flash V4-Pro mit etwa einem Drittel der Gesamtparameter übertrifft, warnte jedoch, dass ein Wert von 54,8 bei AutomationBench bedeutet, dass das Modell etwa die Hälfte komplexer Workflows scheitern lässt, und riet Teams, für Agent-Pipelines einen Menschen im Loop zu behalten.
In der Vergleichstabelle der Karte mit Frontier-Modellen bei maximalem Aufwand erzielt V4.1-Flash 90,9 bei GPQA Diamond, eine Codeforces-Bewertung von 3471, und 63,9 bei HLE mit Werkzeugen. Baseten gibt an, dass V4.1-Flash DeepSeeks erstes nicht-experimentelles Modell mit nativer Bildeingabe ist, eine Fähigkeit, die zuvor nur dem experimentellen V4-Flash-Vision-Exp vorbehalten war; seine Tabelle berichtet 78,9 bei Chartography und 49 bei ZeroBench für das neue Modell, gegenüber 64,3 bzw. 35 für das experimentelle.
Kausale Encoder-Decoder-Architektur
Laut der Modellkarte organisiert V4.1-Flash einen 40‑schichtigen Transformer als 20‑schichtigen kausalen Encoder, gefolgt von einem 20‑schichtigen Decoder, wobei der globale Schlüssel‑Wert‑Cache (KV) des Decoders aus den finalen Encoder‑Hidden‑States projiziert wird, anstatt aus den eigenen Hidden‑States jeder Decoder‑Schicht abgeleitet zu werden. Das Design aktiviert 8 B Parameter pro Token während des Vorbefüllens und 16 B während des Dekodierens; Baseten stellt demgegenüber V4-Flash, das für beide Schritte 13 B aktiviert, und beschreibt die Änderung als Tausch eines schwereren Dekodierens gegen ein wesentlich leichteres Vorbefüllen, ein Setup, das Baseten zufolge die Kosteneffizienz für Coding-Agents erhöht, deren agentische Schleifen deutlich mehr Vorbefüll‑Tokens als Dekodier‑Tokens erzeugen.
Die Karte berichtet, dass das Compressed Sparse Attention 2 des Modells jeder Aufmerksamkeits‑Schicht einen von drei statischen Modi zuweist (Full, Reindex oder Reuse), wobei ein hierarchischer Sparse-Indexer im Decoder die tiefergehenden Indexierungskosten unabhängig von der Kontextlänge begrenzt. In Kombination mit dem FP4‑Haupt‑KV‑Caching reduzieren diese Designs den globalen KV-Cache auf 890 Byte pro Token, etwa ein Viertel von V4-Flash, so die Karte. Ein separater Mechanismus, SWA Bounded Replay, rekonstruiert fehlende Sliding-Window-Attention‑KV‑Zustände, indem nur die neuesten Tokens wiederholt werden, und reduziert den dauerhaften KV-Fußabdruck auf etwa ein Achtel von V4-Flash. DeepSeeks Ankündigung gibt die Einsparungen mit einem Viertel des HBM- und einem Achtel des SSD-Speichers der vorherigen Generation an.
Jede MoE-Schicht verwendet einen gemeinsamen Experten und 384 geroutete Experten, wobei pro Token sechs geroutete Experten aktiv sind, und das Modell fügt laut Karte Engram-bedingten Speicher mit 196 B Parametern neben DSpark-spekulativer Dekodierung hinzu. DeepSeek trainierte das Modell von Grund auf auf einem 45‑T‑Token-multimodalen Korpus, trainierte seine spärliche Aufmerksamkeit bei einer Sequenzlänge von 64 K und erweiterte den Kontext auf 1 M-Token bei 34 T-Token. Das Nach-Training folgt einem standardmäßigen überwachten Feintuning, Verstärkungslernen, und einer On-Policy-Distillationssequenz, wobei wesentliche Änderungen in der groß-skalierten automatisierten Synthese von Agent-Aufgaben und -Umgebungen konzentriert sind, und das Modell stellt eine kontinuierlich steuerbare Denkaufwands-Einstellung von 1 bis 100 bereit.
DeepSeek-API-Transition und Baseten-Bereitstellung
DeepSeek gibt an, dass V4-Flash und V4-Flash-Vision-Exp auf seiner Plattform eingestellt werden, wobei die alten API-Modellnamen vorübergehend zu V4.1-Flash weitergeleitet werden, um Kompatibilität zu gewährleisten. Neue API-Preise traten am 10. September 2026 um 04:00 UTC in Kraft, wobei die Nebenzeiten-Tarife bei 50 % der Spitzenzeiten liegen, und DeepSeek nennt die offiziellen Partner WorkBuddy (einschließlich CodeBuddy) und OpenCode als vollständig unterstützend für V4.1-Flash.
Baseten sagte, sein Inference-Stack bedient das Modell mit NVIDIA Dynamo und KV-Cache-bewusster Weiterleitung, wobei jede Anfrage an die Replikat-Instanz geleitet wird, die bereits das Präfix hält, anstatt an ein beliebiges freies Replikat. Das Modell wird über Basetens Model Library angeboten, wobei dedizierte Deployments für Teams verfügbar sind, die reservierte Kapazität benötigen.
Ab 14. September 2026 um 04:00 UTC werden alle deepseek-v4-pro-Anfragen zu V4.1-Flash zu V4.1-Flash-Tarifen weitergeleitet, eine Regelung, die DeepSeek angab, bis zum Start von V4.1-Pro fortbestehen wird; das Labor sagte, Tests mehrerer Parteien hätten V4.1-Flash in Bezug auf Leistung, Kosten, Geschwindigkeit und Gesamtlaufzeit gegenüber V4-Pro vorn platziert.












