AI 모델 및 플랫폼
Baseten, DeepSeek-V4.1-Flash를 1M 토큰 컨텍스트와 함께 모델 API에 추가

DeepSeek-V4.1-Flash가 이제 Baseten Model API에서 이용 가능하며, Baseten은 2026년 9월 11일에 552B 파라미터 멀티모달 혼합 전문가(MoE) 모델을 도입했습니다. 이 모델은 1M 토큰 컨텍스트 윈도우에서 프리필에 8B 활성 파라미터, 디코드에 16B 파라미터를 결합합니다, 추론 제공자의 플랫폼에.
DeepSeek는 모델의 오픈 가중치를 Hugging Face에 공개했으며, DeepSeek의 공식 발표는 2026년 9월 9일자입니다. 이 모델은 텍스트와 이미지 입력을 받아 텍스트 출력을 생성하며, 모델 카드는 저장소와 가중치가 MIT 라이선스 하에 제공된다고 명시합니다. Baseten은 V4.1-Flash를 DeepSeek의 2026년 세 번째 오픈‑weight flash 릴리즈이자, DeepSeek가 Causal Encoder-Decoder 아키텍처라고 부르는 규모의 유일한 모델이라고 설명합니다. Baseten의 Loops 훈련 제품에 대한 지원이 곧 제공될 예정이라고 회사는 밝혔습니다.
보고된 벤치마크 결과
모델 카드에 따르면 최대 추론 노력 설정인 100에서 instruct-model 결과가 보고되었습니다: V4.1-Flash는 Terminal-Bench 2.1에서 90.6점을 기록했으며, V4-Flash는 82.7점, V4-Pro는 87.9점에 비해 높습니다; DeepSWE v1.1에서는 74.2점으로 54.4점 및 62.7점보다 우수합니다; AutomationBench에서는 54.8점으로 37.7점 및 43.2점보다 높습니다. Baseten은 동일한 코딩 및 에이전시 수치를 강조하며, V4.1-Flash가 전체 파라미터의 약 1/3만 사용하면서 V4-Pro를 능가한다고 언급했습니다. 또한 AutomationBench에서 54.8점은 모델이 복잡한 워크플로의 약 절반을 실패한다는 의미이며, 에이전트 파이프라인에서는 인간을 루프에 유지할 것을 팀에 권고했습니다.
카드에서 최첨단 모델과 최대 노력으로 비교한 결과, V4.1-Flash는 GPQA Diamond에서 90.9점, Codeforces 등급 3471점, 그리고 도구가 포함된 HLE에서 63.9점을 기록했습니다. Baseten은 V4.1-Flash가 DeepSeek의 최초 비실험적 모델로서 네이티브 이미지 입력을 지원한다고 밝혔으며, 이는 이전에 실험적 모델인 V4-Flash-Vision-Exp에만 제한됐던 기능입니다. 표에 따르면 새 모델은 Chartography에서 78.9점, ZeroBench에서 49점을 기록했으며, 실험 모델은 각각 64.3점과 35점을 보였습니다.
Causal Encoder-Decoder 아키텍처
모델 카드에 따르면, V4.1-Flash는 40층 Transformer를 20층 인과적 인코더와 그 뒤에 20층 디코더로 구성합니다. 디코더의 전역 키‑값(KV) 캐시는 각 디코더 층의 자체 은닉 상태가 아니라 최종 인코더 은닉 상태에서 투사됩니다. 이 설계는 프리필 시 토큰당 8B 파라미터, 디코드 시 16B 파라미터를 활성화합니다; Baseten은 이를 V4-Flash와 비교하는데, V4-Flash는 두 단계 모두 13B를 활성화합니다. Baseten은 이 변화를 무거운 디코드를 훨씬 가벼운 프리필로 교환하는 것으로 설명했으며, 이러한 설정이 프리필 토큰을 디코드 토큰보다 훨씬 많이 생성하는 코딩 에이전트의 비용 효율성을 높인다고 밝혔습니다.
카드에 따르면 모델의 Compressed Sparse Attention 2는 각 어텐션 층에 세 가지 정적 모드(Full, Reindex, Reuse) 중 하나를 할당하고, 디코더의 계층적 희소 인덱서는 컨텍스트 길이에 관계없이 더 깊은 인덱싱 비용을 제한합니다. FP4 메인 KV 캐싱과 결합하면 이러한 설계로 전역 KV 캐시가 토큰당 890바이트로 감소하며, 이는 V4-Flash의 약 1/4에 해당합니다(카드에 명시). 별도의 메커니즘인 SWA Bounded Replay는 최신 토큰만 재생하여 누락된 슬라이딩 윈도우 어텐션 KV 상태를 복원함으로써 지속적인 KV 사용량을 V4-Flash의 약 1/8로 줄입니다. DeepSeek의 발표에 따르면 이러한 절감 효과는 이전 세대 대비 HBM의 1/4, SSD 저장소의 1/8에 해당합니다.
카드에 따르면 각 MoE 층은 하나의 공유 전문가와 384개의 라우팅된 전문가를 사용하며, 토큰당 6개의 라우팅된 전문가가 활성화됩니다. 또한 모델은 196B 파라미터의 Engram 조건부 메모리를 DSpark 추론 디코딩과 함께 추가합니다. DeepSeek는 45T 토큰 규모의 멀티모달 코퍼스를 사용해 모델을 처음부터 학습했으며, 희소 어텐션을 64K 시퀀스 길이로 훈련하고 컨텍스트를 1M 토큰(34T 토큰)으로 확장했습니다. 학습 후에는 표준 감독식 미세조정, 강화 학습, 그리고 정책 기반 증류 순서를 따르며, 주요 변화는 대규모 자동화된 에이전트 작업 및 환경 합성에 집중되고, 모델은 1에서 100까지 연속적으로 제어 가능한 추론 노력 설정을 제공합니다.
DeepSeek API 전환 및 Baseten 서비스
DeepSeek는 V4-Flash와 V4-Flash-Vision-Exp가 플랫폼에서 폐기되었으며, 기존 API 모델 이름이 호환성을 위해 일시적으로 V4.1-Flash로 라우팅된다고 밝혔습니다. 새로운 API 가격은 2026년 9월 10일 04:00 UTC에 적용되었으며, 비피크 요금은 피크 요금의 50%로 설정되었습니다. 또한 DeepSeek는 공식 파트너인 WorkBuddy(코드버디 포함)와 OpenCode가 V4.1-Flash를 완전히 지원한다고 명시했습니다.
Baseten은 Inference 스택이 NVIDIA Dynamo와 KV 캐시 인식 라우팅을 사용해 모델을 제공하며, 각 요청을 프리픽스를 이미 보유하고 있는 복제본으로 안내하고 자유 복제본에 보내지 않는다고 밝혔습니다. 이 모델은 Baseten의 Model Library를 통해 제공되며, 예약 용량이 필요한 팀을 위해 전용 배포 옵션도 제공됩니다.
2026년 9월 14일 04:00 UTC부터 모든 deepseek-v4-pro 요청은 V4.1-Flash 요금으로 V4.1-Flash에 라우팅되며, 이 조치는 V4.1-Pro가 출시될 때까지 지속될 것이라고 DeepSeek가 밝혔습니다. 연구소는 다수의 테스트에서 V4.1-Flash가 성능, 비용, 속도 및 전체 실행 시간 측면에서 V4-Pro보다 앞선다고 전했습니다.












