โมเดลและแพลตฟอร์ม AI
Baseten เพิ่ม DeepSeek-V4.1-Flash ให้กับ Model APIs พร้อมบริบท 1M-Token

DeepSeek-V4.1-Flash พร้อมให้บริการแล้วบน Baseten Model APIs, Baseten ประกาศ เมื่อ 11 กันยายน 2026, นำโมเดล multimodal mixture-of-experts (MoE) ขนาด 552B-parameter ที่จับคู่พารามิเตอร์ที่ทำงาน 8B สำหรับการเติมข้อมูลล่วงหน้าและ 16B สำหรับการถอดรหัสผ่านหน้าต่างบริบท 1M-token ไปยังแพลตฟอร์มผู้ให้บริการการอนุมาน
DeepSeek ปล่อยน้ำหนักเปิดของโมเดลบน Hugging Face, และ ประกาศของ DeepSeek เอง มีวันที่ 9 กันยายน 2026. โมเดลรับอินพุตเป็นข้อความและภาพและสร้างเอาต์พุตเป็นข้อความ, และ การ์ดโมเดล ระบุว่าที่เก็บและน้ำหนักได้รับอนุญาตภายใต้ MIT License. Baseten อธิบายว่า V4.1-Flash เป็นการปล่อย flash น้ำหนักเปิดครั้งที่สามของ DeepSeek ในปี 2026 และเป็นโมเดลเดียวในระดับนี้ที่ใช้สถาปัตยกรรม Causal Encoder-Decoder ที่ DeepSeek เรียก. การสนับสนุนผลิตภัณฑ์การฝึก Loops ของ Baseten จะเปิดให้บริการเร็ว ๆ นี้, ตามบริษัท
ผลการทดสอบเบนช์มาร์คที่รายงาน
การ์ดโมเดลรายงานผลการสั่งงานโมเดลที่การตั้งค่าความพยายามในการให้เหตุผลสูงสุดที่ 100: V4.1-Flash ได้คะแนน 90.6 ใน Terminal-Bench 2.1, เทียบกับ 82.7 ของ V4-Flash และ 87.9 ของ V4-Pro; 74.2 ใน DeepSWE v1.1, เทียบกับ 54.4 และ 62.7; และ 54.8 ใน AutomationBench, เทียบกับ 37.7 และ 43.2. Baseten เน้นตัวเลขด้านการเขียนโค้ดและเอเจนต์เดียวกัน, กล่าวว่า V4.1-Flash แซง V4-Pro ด้วยพารามิเตอร์ทั้งหมดประมาณหนึ่งในสาม, พร้อมเตือนว่าคะแนน 54.8 ใน AutomationBench หมายความว่าโมเดลล้มเหลวประมาณครึ่งหนึ่งของเวิร์กโฟลว์ที่ซับซ้อนและแนะนำให้ทีมรักษามนุษย์ในลูปสำหรับสายงานเอเจนต์
ในการเปรียบเทียบของการ์ดกับโมเดลแนวหน้าที่ความพยายามสูงสุด, V4.1-Flash ได้คะแนน 90.9 ใน GPQA Diamond, คะแนน Codeforces 3471, และ 63.9 ใน HLE พร้อมเครื่องมือ. Baseten ระบุว่า V4.1-Flash เป็นโมเดลแรกของ DeepSeek ที่ไม่ใช่การทดลองพร้อมการรับภาพโดยตรง, ความสามารถที่ก่อนหน้านี้จำกัดอยู่ใน V4-Flash-Vision-Exp ที่เป็นการทดลอง; ตารางของมันแสดง 78.9 ใน Chartography และ 49 ใน ZeroBench สำหรับโมเดลใหม่, เทียบกับ 64.3 และ 35 สำหรับรุ่นทดลอง
สถาปัตยกรรม Causal Encoder-Decoder
ตามการ์ดโมเดล, V4.1-Flash จัดระเบียบ Transformer 40 ชั้นเป็น Encoder เชิงสาเหตุ 20 ชั้นตามด้วย Decoder 20 ชั้น, โดยแคชค่า key-value (KV) ทั่วโลกของ Decoder ถูกฉายจากสถานะซ่อนของ Encoder ชั้นสุดท้ายแทนที่จะได้จากสถานะซ่อนของแต่ละชั้น Decoder. การออกแบบนี้เปิดใช้งานพารามิเตอร์ 8B ต่อโทเคนในขั้นตอนเติมข้อมูลล่วงหน้าและ 16B ในขั้นตอนถอดรหัส; Baseten เปรียบเทียบกับ V4-Flash ที่เปิดใช้งาน 13B สำหรับทั้งสองขั้นตอน, โดยมองการเปลี่ยนแปลงนี้เป็นการแลกเปลี่ยนการถอดรหัสที่หนักขึ้นกับการเติมข้อมูลล่วงหน้าที่เบากว่า, การตั้งค่านี้ Baseten กล่าวว่าช่วยเพิ่มประสิทธิภาพต้นทุนสำหรับเอเจนต์เขียนโค้ดที่ลูปเอเจนต์สร้างโทเคนเติมข้อมูลล่วงหน้ามากกว่าการถอดรหัสอย่างมาก
การ์ดระบุว่า Compressed Sparse Attention 2 ของโมเดลกำหนดให้แต่ละชั้นความสนใจหนึ่งในสามโหมดคงที่ (Full, Reindex, หรือ Reuse), พร้อม Hierarchical Sparse Indexer ใน Decoder ที่จำกัดต้นทุนการทำดัชนีลึกโดยไม่ขึ้นกับความยาวบริบท. เมื่อรวมกับการแคช KV หลักแบบ FP4, การออกแบบเหล่านี้ลดแคช KV ทั่วโลกเหลือ 890 ไบต์ต่อโทเคน, ประมาณหนึ่งในสี่ของ V4-Flash, ตามการ์ด. กลไกแยกต่างหาก, SWA Bounded Replay, สร้างสถานะ KV ของ sliding-window-attention ที่หายไปโดยเล่นซ้ำเฉพาะโทเคนล่าสุด, ลดรอยเท้า KV คงที่เหลือประมาณหนึ่งในแปดของ V4-Flash. การประกาศของ DeepSeek ระบุว่าการประหยัดเท่ากับหนึ่งในสี่ของ HBM และหนึ่งในแปดของพื้นที่จัดเก็บ SSD ของรุ่นก่อนหน้า
แต่ละชั้น MoE ใช้ผู้เชี่ยวชาญร่วมหนึ่งคนและผู้เชี่ยวชาญที่กำหนดเส้นทาง 384 คนโดยมีผู้เชี่ยวชาญที่กำหนดเส้นทางทำงาน 6 คนต่อโทเคน, และโมเดลเพิ่ม Engram conditional memory ขนาด 196B-parameter พร้อมการถอดรหัสเชิงสันนิษฐาน DSpark, ตามการ์ด. DeepSeek ฝึกโมเดลจากศูนย์บนคอร์ปัส multimodal ขนาด 45T-token, ฝึกความสนใจแบบ sparse ที่ความยาวลำดับ 64K, และขยายบริบทเป็น 1M โทเคนที่ 34T-token. หลังการฝึกจะทำตามการปรับแต่งแบบมีผู้ควบคุมแบบมาตรฐาน, การเรียนรู้แบบเสริมแรง, และลำดับการสกัดกั้นแบบ on‑policy, โดยการเปลี่ยนแปลงสำคัญมุ่งเน้นที่การสังเคราะห์อัตโนมัติขนาดใหญ่ของงานและสภาพแวดล้อมของเอเจนต์, และโมเดลเปิดให้ตั้งค่าความพยายามในการให้เหตุผลที่ควบคุมได้ต่อเนื่องตั้งแต่ 1 ถึง 100
การเปลี่ยนแปลง API ของ DeepSeek และการให้บริการโดย Baseten
DeepSeek ระบุว่า V4-Flash และ V4-Flash-Vision-Exp ถูกยกเลิกบนแพลตฟอร์มของตน, โดยชื่อโมเดล API เก่าจะชั่วคราวส่งต่อไปยัง V4.1-Flash เพื่อความเข้ากันได้. การกำหนดราคาของ API ใหม่มีผลตั้งแต่ 04:00 UTC วันที่ 10 กันยายน 2026, โดยอัตรานอกช่วงพีคตั้งเป็น 50% ของอัตราพีค, และ DeepSeek ระบุว่าพันธมิตรอย่างเป็นทางการ WorkBuddy (รวมถึง CodeBuddy) และ OpenCode รองรับ V4.1-Flash อย่างเต็มที่
Baseten กล่าวว่า Inference Stack ให้บริการโมเดลโดยใช้ NVIDIA Dynamo พร้อมการกำหนดเส้นทางที่รับรู้แคช KV, ชี้นำแต่ละคำขอไปยังสำเนาที่มีพรีฟิกซ์อยู่แล้วแทนที่จะเป็นสำเนาที่ว่าง. โมเดลนี้มีให้ผ่าน Model Library ของ Baseten, โดยมีการปรับใช้เฉพาะสำหรับทีมที่ต้องการความจุสำรอง
ตั้งแต่ 04:00 UTC วันที่ 14 กันยายน 2026, คำขอ deepseek-v4-pro ทั้งหมดจะส่งต่อไปยัง V4.1-Flash ตามอัตรา V4.1-Flash, การจัดการนี้ DeepSeek กล่าวว่าจะดำเนินต่อไปจนกว่า V4.1-Pro จะเปิดตัว; ห้องปฏิบัติการกล่าวว่าการทดสอบจากหลายฝ่ายทำให้ V4.1-Flash ดีกว่า V4‑Pro ในด้านประสิทธิภาพ, ค่าใช้จ่าย, ความเร็ว, และระยะเวลาการทำงานรวม












