Yapay zeka modelleri ve platformları
Baseten, Model API’lerine 1M-Token Bağlamıyla DeepSeek-V4.1-Flash Ekliyor

DeepSeek-V4.1-Flash artık Baseten Model API’lerinde mevcut, Baseten duyurdu 11 Eylül 2026’da, 552B parametreli çok modlu uzman karışımı (MoE) modelini, 1M-token bağlam penceresinde ön doldurma için 8B aktif parametreyi, kod çözme için 16B parametreyle eşleştirerek, çıkarım sağlayıcısının platformuna getiriyor.
DeepSeek, modelin açık ağırlıklarını Hugging Face’te yayınladı ve DeepSeek’in kendi duyurusu 9 Eylül 2026 tarihli. Model metin ve görüntü girişi kabul ediyor ve metin çıktısı üretiyor, ayrıca model kartı depolama ve ağırlıkların MIT Lisansı altında lisanslandığını belirtiyor. Baseten, V4.1-Flash’i DeepSeek’in 2026 yılındaki üçüncü açık-ağırlıklı flash sürümü ve ölçeği itibarıyla DeepSeek’in “Causal Encoder-Decoder” mimarisini kullanan tek model olarak tanımlıyor. Baseten’in Loops eğitim ürününe destek yakında geliyor, şirket belirtiyor.
Raporlanan Performans Sonuçları
Model kartı, maksimum akıl yürütme çabası ayarı 100’deki instruct-model sonuçlarını rapor ediyor: V4.1-Flash, Terminal-Bench 2.1’de 90.6 puan alırken, V4-Flash 82.7 ve V4-Pro 87.9 puan almıştır; DeepSWE v1.1’de 74.2 puan, karşılaştırmalı olarak 54.4 ve 62.7; ve AutomationBench’te 54.8 puan, karşılaştırmalı olarak 37.7 ve 43.2. Baseten, aynı kodlama ve ajan figürlerini vurgulayarak, V4.1-Flash’in toplam parametrelerin yaklaşık üçte biriyle V4-Pro’yu geride bıraktığını belirtti, ancak AutomationBench’te 54.8 puanın modelin karmaşık iş akışlarının yaklaşık yarısında başarısız olduğu konusunda uyarıda bulundu ve ekiplerin ajan boru hatları için bir insanı döngüde tutmalarını tavsiye etti.
Kartın, sınır modelleriyle maksimum çaba karşılaştırmasında, V4.1-Flash GPQA Diamond’da 90.9, Codeforces derecelendirmesi 3471 ve araçlarla HLE’de 63.9 puan alıyor. Baseten, V4.1-Flash’in yerel görüntü girişi olan DeepSeek’in ilk deneysel olmayan modeli olduğunu, bu yeteneğin daha önce yalnızca deneysel V4-Flash-Vision-Exp için sınırlı olduğunu belirtiyor; tablosu yeni model için Chartography’de 78.9 ve ZeroBench’te 49 puan gösterirken, deneysel model için 64.3 ve 35 puan rapor ediyor.
Causal Encoder-Decoder Mimarisi
Model kartına göre, V4.1-Flash 40 katmanlı bir Transformer’ı 20 katmanlı causal encoder ve ardından 20 katmanlı decoder olarak düzenliyor; decoder’ın global anahtar-değer (KV) önbelleği, her decoder katmanının kendi gizli durumlarından türetilmek yerine son encoder gizli durumlarından projekte ediliyor. Tasarım, ön doldurma sırasında token başına 8B parametre ve kod çözme sırasında 16B parametre etkinleştiriyor; Baseten, her iki adımda da 13B etkinleştiren V4-Flash ile bunu karşılaştırarak, değişikliği daha ağır bir kod çözmeyi çok daha hafif bir ön doldurma ile takas etmek olarak çerçeveliyor; Baseten bu yapılandırmanın, ajan döngüleri ön doldurma token’larını kod çözme token’larından çok daha fazla üreten kodlama ajanları için maliyet verimliliğini artırdığını belirtiyor.
Kart, modelin Compressed Sparse Attention 2’nin her dikkat katmanına üç statik moddan (Full, Reindex veya Reuse) birini atadığını, decoder’da bağlamsal uzunluktan bağımsız olarak daha derin indeksleme maliyetini sınırlayan Hiyerarşik Seyrek İndeksleyici bulunduğunu bildiriyor. FP4 ana KV önbelleklemesiyle birleştirildiğinde, bu tasarımlar global KV önbelleğini token başına 890 bayta düşürüyor; bu, V4-Flash’in yaklaşık dörtte biri, kart belirtiyor. Ayrı bir mekanizma olan SWA Bounded Replay, sadece en son token’ları yeniden oynatarak eksik kayan pencere dikkat KV durumlarını yeniden oluşturuyor ve kalıcı KV ayak izini V4-Flash’in yaklaşık sekizde birine indiriyor. DeepSeek’in duyurusu, tasarrufun önceki neslin HBM’inin dörtte biri ve SSD depolamasının sekizde biri olduğunu belirtiyor.
Her MoE katmanı bir ortak uzman ve 384 yönlendirilmiş uzman kullanır; token başına altı yönlendirilmiş uzman aktiftir ve model, kartına göre, 196B parametreli Engram koşullu belleği DSpark spekülatif kod çözmesiyle birlikte ekliyor. DeepSeek, modeli sıfırdan 45T-token çok modlu bir korpus üzerinde eğitti, seyrek dikkatini 64K dizi uzunluğunda eğitti ve bağlamı 34T token’da 1M token’a genişletti. Eğitim sonrası, standart denetimli ince ayar, takviye öğrenmesi ve politika içi damıtma dizisini izler; önemli değişiklikler, ajan görevleri ve ortamlarının büyük ölçekli otomatik sentezine odaklanmıştır ve model 1’den 100’e kadar sürekli kontrol edilebilir akıl yürütme çabası ayarını sunar.
DeepSeek API Geçişi ve Baseten Sunumu
DeepSeek, V4-Flash ve V4-Flash-Vision-Exp’in platformunda kullanımdan kaldırıldığını, eski API model adlarının uyumluluk için geçici olarak V4.1-Flash’e yönlendirildiğini belirtiyor. Yeni API fiyatlandırması 10 Eylül 2026 04:00 UTC’de yürürlüğe girdi, düşük yoğunluklu oranlar yoğun oranların %50’si olarak belirlendi ve DeepSeek, resmi ortakları WorkBuddy (CodeBuddy dahil) ve OpenCode’u V4.1-Flash’i tam olarak destekleyen olarak adlandırıyor.
Baseten, Çıkarım Yığını’nın modeli NVIDIA Dynamo’yu KV önbellek farkındalıklı yönlendirme ile hizmet ettiğini, her isteği serbest olan bir kopya yerine ön ekini zaten tutan kopyaya yönlendirdiğini söyledi. Model, Baseten’in Model Kütüphanesi aracılığıyla sunuluyor ve rezerve kapasiteye ihtiyaç duyan ekipler için özel dağıtımlar mevcut.
14 Eylül 2026 04:00 UTC’den itibaren, tüm deepseek-v4-pro istekleri V4.1-Flash oranlarıyla V4.1-Flash’e yönlendirilecek; bu düzenlemenin V4.1-Pro lansmanına kadar devam edeceğini DeepSeek belirtti; laboratuvar, birden çok tarafın testlerinin V4.1-Flash’i performans, maliyet, hız ve toplam çalışma süresi açısından V4-Pro’dan önde tuttuğunu söyledi.












