Model dan platform AI
Baseten Menambahkan DeepSeek-V4.1-Flash ke API Model dengan Konteks 1M-Token

DeepSeek-V4.1-Flash kini tersedia di Baseten Model APIs, Baseten mengumumkan pada 11 September 2026, membawa model multimodal mixture-of-experts (MoE) dengan 552B parameter, yang menggabungkan 8B parameter aktif untuk prefill dengan 16B untuk decode dalam jendela konteks 1M-token, ke platform penyedia inferensi.
DeepSeek merilis bobot terbuka model tersebut di Hugging Face, dan pengumuman DeepSeek sendiri tertanggal 9 September 2026. Model ini menerima masukan teks dan gambar serta menghasilkan keluaran teks, dan kartu model menyatakan bahwa repositori dan bobot dilisensikan di bawah MIT License. Baseten menggambarkan V4.1-Flash sebagai rilis flash bobot terbuka ketiga DeepSeek pada tahun 2026 dan sebagai satu-satunya model dengan skala tersebut yang menggunakan apa yang disebut DeepSeek sebagai arsitektur Causal Encoder-Decoder. Dukungan untuk produk pelatihan Loops milik Baseten akan segera hadir, menurut perusahaan.
Hasil Benchmark yang Dilaporkan
Kartu model melaporkan hasil instruct-model pada pengaturan upaya penalaran maksimum 100: V4.1-Flash mencetak 90.6 pada Terminal-Bench 2.1, dibandingkan dengan 82.7 untuk V4-Flash dan 87.9 untuk V4-Pro; 74.2 pada DeepSWE v1.1, dibandingkan dengan 54.4 dan 62.7; dan 54.8 pada AutomationBench, dibandingkan dengan 37.7 dan 43.2. Baseten menyoroti angka coding dan agen yang sama, menyatakan bahwa V4.1-Flash mengungguli V4-Pro dengan kira-kira sepertiga total parameter, sambil memperingatkan bahwa skor 54.8 pada AutomationBench berarti model gagal pada kira-kira setengah alur kerja kompleks dan menyarankan tim untuk menjaga kehadiran manusia dalam loop untuk pipeline agen.
Dalam perbandingan kartu dengan model frontier pada upaya maksimum, V4.1-Flash mencatat 90.9 pada GPQA Diamond, peringkat Codeforces 3471, dan 63.9 pada HLE dengan alat. Baseten menyatakan bahwa V4.1-Flash adalah model non-eksperimental pertama DeepSeek dengan masukan gambar native, kemampuan yang sebelumnya terbatas pada V4-Flash-Vision-Exp eksperimental; tabelnya melaporkan 78.9 pada Chartography dan 49 pada ZeroBench untuk model baru, dibandingkan dengan 64.3 dan 35 untuk yang eksperimental.
Arsitektur Causal Encoder-Decoder
Menurut kartu model, V4.1-Flash menyusun Transformer 40 lapisan menjadi encoder kausal 20 lapisan yang diikuti oleh decoder 20 lapisan, dengan cache key-value (KV) global decoder diproyeksikan dari keadaan tersembunyi encoder akhir alih-alih diturunkan dari keadaan tersembunyi masing-masing lapisan decoder. Desain ini mengaktifkan 8B parameter per token selama prefill dan 16B selama decode; Baseten membandingkannya dengan V4-Flash, yang mengaktifkan 13B untuk kedua langkah, menggambarkan perubahan tersebut sebagai pertukaran decode yang lebih berat dengan prefill yang jauh lebih ringan, sebuah pengaturan yang, kata Baseten, meningkatkan efisiensi biaya untuk agen coding yang loop agennya menghasilkan jauh lebih banyak token prefill daripada token decode.
Kartu tersebut melaporkan bahwa Compressed Sparse Attention 2 model menetapkan setiap lapisan perhatian ke salah satu dari tiga mode statis (Full, Reindex, atau Reuse), dengan Hierarchical Sparse Indexer di decoder yang membatasi biaya pengindeksan yang lebih dalam secara independen dari panjang konteks. Dikombinasikan dengan caching KV utama FP4, desain tersebut mengurangi cache KV global menjadi 890 byte per token, kira-kira seperempat V4-Flash, menurut kartu. Mekanisme terpisah, SWA Bounded Replay, merekonstruksi keadaan KV attention jendela geser yang hilang dengan memutar ulang hanya token terbaru, mengurangi jejak KV yang persisten menjadi kira-kira seperdelapan V4-Flash. Pengumuman DeepSeek menyatakan penghematan sebesar seperempat HBM dan seperdelapan penyimpanan SSD dibandingkan generasi sebelumnya.
Setiap lapisan MoE menggunakan satu pakar bersama dan 384 pakar terarah dengan enam pakar terarah aktif per token, dan model menambahkan memori kondisional Engram dengan 196B parameter bersama decoding spekulatif DSpark, menurut kartu. DeepSeek melatih model dari awal pada korpus multimodal 45T-token, melatih attention sparse dengan panjang urutan 64K, dan memperluas konteks menjadi 1M token pada 34T token. Pasca-pelatihan mengikuti fine-tuning terawasi standar, pembelajaran penguatan, dan urutan distilasi on-policy, dengan perubahan substansial terfokus pada sintesis otomatis berskala besar dari tugas dan lingkungan agen, serta model membuka pengaturan upaya penalaran yang dapat dikontrol secara kontinu dari 1 hingga 100.
Transisi API DeepSeek dan Penyajian Baseten
DeepSeek menyatakan bahwa V4-Flash dan V4-Flash-Vision-Exp dihentikan di platformnya, dengan nama model API lama sementara diarahkan ke V4.1-Flash untuk kompatibilitas. Harga API baru mulai berlaku pada 04:00 UTC 10 September 2026, dengan tarif off-peak ditetapkan pada 50% tarif puncak, dan DeepSeek menamai mitra resmi WorkBuddy (termasuk CodeBuddy) dan OpenCode sebagai pendukung penuh V4.1-Flash.
Baseten mengatakan Inference Stack melayani model menggunakan NVIDIA Dynamo dengan routing yang menyadari cache KV, mengarahkan setiap permintaan ke replika yang sudah menyimpan prefiksnya daripada replika mana pun yang bebas. Model ini disediakan melalui Model Library Baseten, dengan penyebaran khusus tersedia bagi tim yang membutuhkan kapasitas terreservasi.
Mulai 04:00 UTC 14 September 2026, semua permintaan deepseek-v4-pro akan diarahkan ke V4.1-Flash dengan tarif V4.1-Flash, sebuah pengaturan yang, kata DeepSeek, akan berlanjut hingga V4.1-Pro diluncurkan; laboratorium tersebut menyatakan bahwa pengujian oleh beberapa pihak menempatkan V4.1-Flash di atas V4-Pro dalam hal kinerja, biaya, kecepatan, dan total waktu proses.












