Mô hình và nền tảng AI

Baseten Thêm DeepSeek-V4.1-Flash vào API Mô hình Với Ngữ cảnh 1M Token

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

DeepSeek-V4.1-Flash hiện đã có sẵn trên API Mô hình của Baseten, Baseten thông báo vào ngày 11 tháng 9 năm 2026, mang mô hình đa phương tiện hỗn hợp các chuyên gia (MoE) với 552B tham số, kết hợp 8B tham số hoạt động cho giai đoạn tiền điền và 16B cho giải mã trên cửa sổ ngữ cảnh 1M token, đến nền tảng cung cấp suy luận.

DeepSeek đã phát hành trọng số mở của mô hình trên Hugging Face, và thông báo của DeepSeek được ghi ngày 9 tháng 9 năm 2026. Mô hình chấp nhận đầu vào văn bản và hình ảnh và tạo ra đầu ra văn bản, và thẻ mô hình cho biết kho lưu trữ và trọng số được cấp phép theo Giấy phép MIT. Baseten mô tả V4.1-Flash là bản phát hành flash trọng số mở thứ ba của DeepSeek trong năm 2026 và là mô hình duy nhất cùng quy mô sử dụng kiến trúc Causal Encoder-Decoder mà DeepSeek gọi là. Hỗ trợ cho sản phẩm đào tạo Loops của Baseten sẽ sớm ra mắt, theo công ty.

Kết quả Đánh giá Tiêu chuẩn Được Báo cáo

Thẻ mô hình báo cáo kết quả mô hình hướng dẫn ở mức nỗ lực suy luận tối đa là 100: V4.1-Flash đạt 90.6 trên Terminal-Bench 2.1, so với 82.7 của V4-Flash và 87.9 của V4-Pro; 74.2 trên DeepSWE v1.1, so với 54.4 và 62.7; và 54.8 trên AutomationBench, so với 37.7 và 43.2. Baseten nhấn mạnh các số liệu lập trình và tác nhân tương tự, cho rằng V4.1-Flash vượt trội hơn V4-Pro với khoảng một phần ba tổng số tham số, đồng thời cảnh báo rằng điểm 54.8 trên AutomationBench đồng nghĩa mô hình thất bại khoảng một nửa các quy trình phức tạp và khuyên các nhóm nên giữ một con người trong vòng lặp cho các pipeline tác nhân.

Trong so sánh của thẻ với các mô hình tiên tiến ở mức nỗ lực tối đa, V4.1-Flash đạt 90.9 trên GPQA Diamond, với xếp hạng Codeforces là 3471, và 63.9 trên HLE có công cụ. Baseten cho biết V4.1-Flash là mô hình không thử nghiệm đầu tiên của DeepSeek có đầu vào hình ảnh gốc, một khả năng trước đây chỉ có trong V4-Flash-Vision-Exp thử nghiệm; bảng của nó báo cáo 78.9 trên Chartography và 49 trên ZeroBench cho mô hình mới, so với 64.3 và 35 cho phiên bản thử nghiệm.

Kiến trúc Causal Encoder-Decoder

Theo thẻ mô hình, V4.1-Flash sắp xếp một Transformer 40 lớp thành bộ mã hoá nhân quả 20 lớp tiếp theo là bộ giải mã 20 lớp, với bộ nhớ đệm khóa-giá trị (KV) toàn cục của bộ giải mã được chiếu từ trạng thái ẩn cuối cùng của bộ mã hoá thay vì được tạo ra từ trạng thái ẩn riêng của mỗi lớp giải mã. Thiết kế này kích hoạt 8B tham số cho mỗi token trong giai đoạn tiền điền và 16B trong giai đoạn giải mã; Baseten so sánh điều này với V4-Flash, vốn kích hoạt 13B cho cả hai bước, mô tả sự thay đổi như việc đổi lấy một quá trình giải mã nặng hơn để có một giai đoạn tiền điền nhẹ hơn nhiều, một cấu hình mà Baseten cho rằng tăng hiệu quả chi phí cho các tác nhân lập trình có vòng lặp tác nhân tạo ra nhiều token tiền điền hơn token giải mã.

Thẻ mô hình báo cáo rằng Compressed Sparse Attention 2 của mô hình gán mỗi lớp chú ý một trong ba chế độ tĩnh (Full, Reindex, hoặc Reuse), với một Hierarchical Sparse Indexer trong bộ giải mã giới hạn chi phí chỉ mục sâu hơn một cách độc lập với độ dài ngữ cảnh. Kết hợp với bộ nhớ đệm KV chính FP4, các thiết kế này giảm bộ nhớ đệm KV toàn cục xuống 890 byte cho mỗi token, khoảng một phần tư so với V4-Flash, theo thẻ. Một cơ chế riêng biệt, SWA Bounded Replay, tái tạo các trạng thái KV chú ý cửa sổ trượt bị thiếu bằng cách phát lại chỉ các token mới nhất, giảm dấu vết KV cố định xuống khoảng một phần tám của V4-Flash. Thông báo của DeepSeek đưa mức tiết kiệm lên một phần tư bộ nhớ HBM và một phần tám bộ nhớ SSD so với thế hệ trước.

Mỗi lớp MoE sử dụng một chuyên gia chia sẻ và 384 chuyên gia định tuyến, với sáu chuyên gia định tuyến hoạt động cho mỗi token, và mô hình bổ sung bộ nhớ có điều kiện Engram với 196B tham số cùng với giải mã suy đoán DSpark, theo thẻ. DeepSeek đã huấn luyện mô hình từ đầu trên một tập dữ liệu đa phương tiện 45T-token, huấn luyện chú ý thưa thớt với độ dài chuỗi 64K, và mở rộng ngữ cảnh lên 1M token ở 34T token. Giai đoạn sau huấn luyện tuân theo một quy trình tinh chỉnh giám sát tiêu chuẩn, học tăng cường, và chuỗi chưng cất theo chính sách, với các thay đổi đáng kể tập trung vào việc tổng hợp tự động quy mô lớn các nhiệm vụ và môi trường của tác nhân, và mô hình cung cấp một thiết lập nỗ lực suy luận có thể điều chỉnh liên tục từ 1 đến 100.

Chuyển Đổi API DeepSeek và Dịch Vụ Baseten

DeepSeek cho biết V4-Flash và V4-Flash-Vision-Exp đã được ngừng sử dụng trên nền tảng của mình, với các tên mô hình API cũ tạm thời chuyển hướng tới V4.1-Flash để tương thích. Giá API mới có hiệu lực vào lúc 04:00 UTC ngày 10 tháng 9 năm 2026, với mức giá ngoài giờ cao điểm được đặt ở 50% mức giá cao điểm, và DeepSeek công bố các đối tác chính thức WorkBuddy (bao gồm CodeBuddy) và OpenCode là những người hỗ trợ đầy đủ V4.1-Flash.

Baseten cho biết Inference Stack của mình cung cấp mô hình bằng cách sử dụng NVIDIA Dynamo với định tuyến nhận thức bộ nhớ đệm KV, hướng mỗi yêu cầu tới bản sao đã có tiền tố thay vì bất kỳ bản sao nào còn trống. Mô hình được cung cấp qua Thư viện Mô hình của Baseten, với các triển khai riêng dành cho các nhóm cần dung lượng dự trữ.

Bắt đầu từ 04:00 UTC ngày 14 tháng 9 năm 2026, tất cả các yêu cầu deepseek-v4-pro sẽ được chuyển hướng tới V4.1-Flash với mức giá V4.1-Flash, một sắp xếp mà DeepSeek cho biết sẽ tiếp tục cho đến khi V4.1-Pro ra mắt; phòng thí nghiệm cho biết các thử nghiệm của nhiều bên đã đặt V4.1-Flash vượt trội hơn V4-Pro về hiệu năng, chi phí, tốc độ và thời gian chạy tổng cộng.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.