Mô hình và nền tảng AI
Cerebras báo cáo tăng gấp 5 lần thông lượng suy luận nhờ phân tách

Cerebras Systems cho biết vào ngày 1 tháng 10 năm 2026 rằng họ đã tăng thông lượng suy luận gấp 5 lần trong các kết quả ban đầu bằng kỹ thuật gọi là phân tách, với cùng số lượng hệ thống Cerebras và không mất tốc độ tạo token. Thông tin này được công bố trong Phân tách suy luận từ nền tảng, một bài đăng blog của công ty do Isaac Tai và Zhenwei Gao viết, mở đầu cho một loạt bài dự kiến về chủ đề này.
Bài viết đặt khung cho loạt bài dành cho độc giả đã nghe đến thuật ngữ phân tách, hoặc tuyên bố rằng giai đoạn prefill bị ràng buộc bởi tính toán và giai đoạn decode bị ràng buộc bởi bộ nhớ, và tự hỏi mỗi khái niệm thực sự có nghĩa gì. Nó xây dựng lời giải thích từ đầu, bắt đầu bằng cách các bộ tăng tốc cân bằng giữa phép tính số học và việc di chuyển dữ liệu.
Prefill và Decode Đặt Các Yêu Cầu Khác Nhau lên Phần Cứng
Bài viết định nghĩa độ mạnh tính toán (arithmetic intensity) là số phép toán dấu chấm động chia cho số byte được truyền giữa bộ nhớ và các đơn vị tính toán của bộ tăng tốc. Trong một ví dụ, việc cộng hai ma trận thực hiện 1 FLOP cho mỗi 6 byte di chuyển, tức độ mạnh tính toán 0,167 FLOP trên mỗi byte, và tỉ lệ này giữ nguyên khi ma trận lớn lên. Phép nhân ma trận lại hoạt động khác: mỗi giá trị đầu ra được tạo từ toàn bộ một hàng của một đầu vào và toàn bộ một cột của đầu vào còn lại, vì vậy các giá trị đã tải vào đóng góp cho nhiều đầu ra hơn và độ mạnh tính toán tăng lên cùng kích thước đầu vào.
Bài viết giải thích rằng suy luận là một chuỗi các phép nhân ma trận như vậy giữa các trọng số cố định của mô hình và các token đầu vào, và nó chạy trong hai giai đoạn với các hồ sơ độ mạnh tính toán khác nhau. Trong giai đoạn prefill, toàn bộ lời nhắc được xử lý song song như một phép toán ma trận lớn, và các lời nhắc thực tế có thể chứa hàng nghìn hoặc thậm chí hàng trăm nghìn token. Trong giai đoạn decode, các token được tạo ra từng cái một, và mô hình dựa vào bộ nhớ cache KV, nơi lưu trữ các khóa và giá trị được tính cho các token trước đó để chúng được tái sử dụng thay vì tính lại.
Cả hai giai đoạn vẫn phải di chuyển toàn bộ trọng số của mô hình, có thể lên tới hàng trăm gigabyte hoặc terabyte, tới các đơn vị tính toán cho mỗi token được tạo. Bài viết cho thấy việc di chuyển bộ nhớ gần như không thay đổi trong khi độ mạnh tính toán giảm sau giai đoạn prefill, và nó trích dẫn khoảng cách này là lý do việc tăng thêm năng lực tính toán thuần túy không nhất thiết làm token đến nhanh hơn trong giai đoạn decode.
Disaggregation Chia Suy Luận Thành Các Bể Riêng Biệt
Trong môi trường sản xuất, một máy chủ suy luận thường xử lý nhiều yêu cầu đồng thời, và khi prefill và decode chạy trên cùng một phần cứng, prefill tốn nhiều tính toán có thể làm chậm các yêu cầu decode đang hoạt động. Bộ lập lịch sau đó phải lựa chọn giữa việc đưa các yêu cầu mới tới token đầu tiên nhanh chóng, duy trì luồng phản hồi hoạt động mượt mà, và tối đa hoá tổng thông lượng. Gộp batch cho phép các yêu cầu đồng thời chia sẻ công việc đọc trọng số mô hình, nhưng các batch lớn hơn có thể khiến mỗi bước decode mất thời gian lâu hơn, vì vậy tổng thông lượng có thể tăng trong khi mỗi người dùng nhận token chậm hơn.
Bài viết mô tả phân tách như một mẫu thiết kế hệ thống chạy hai giai đoạn trên các bể phần cứng riêng biệt. Khi các giai đoạn được tách ra, các nhà vận hành có thể phân bổ phần cứng, thiết lập chính sách batch, và ưu tiên độ trễ hoặc thông lượng cho mỗi giai đoạn một cách độc lập: một hệ thống có mục tiêu thời gian tới token đầu tiên nghiêm ngặt có thể dự trữ thêm năng lực cho prefill, trong khi một hệ thống được xây dựng để truyền phát mượt mà có thể cấp cho decode một bể lớn hơn hoặc được lên lịch chặt chẽ hơn. Các bể cũng có thể được mở rộng riêng lẻ.
Việc tách ra tạo ra một yêu cầu mới. Sau khi prefill xây dựng bộ nhớ cache KV, trạng thái đặc thù cho yêu cầu đó phải được chuyển sang bể decode, nơi nó được tải vào bộ nhớ trước khi quá trình sinh tiếp tục, trong khi các trọng số mô hình đã được tải sẵn trong cả hai bể. Bài viết lưu ý rằng việc chuyển giao này thêm chi phí mạng và phối hợp, rằng bất kỳ bể nào cũng có thể nằm im nếu năng lực không khớp với nhu cầu, và độ trễ bổ sung phụ thuộc vào việc cache di chuyển qua các máy đặt chung hay qua các khu vực. Nó lập luận rằng phân tách trở nên hấp dẫn nhất ở quy mô lớn, nơi lợi ích từ việc định kích thước và lên lịch độc lập cho các bể có thể vượt qua chi phí chuyển và vận hành, và rằng nó thay đổi giao diện điều khiển của hệ thống phục vụ thay vì chỉ làm mượt luồng truyền.
Phần Cứng Hỗn Hợp, Kết Quả Sớm và Đối Tác
Cerebras cho biết họ đang dẫn đầu trong việc phát triển phân tách hỗn hợp, kết hợp nhiều loại chip trong một hệ thống suy luận và phân bổ phần cứng khác nhau cho các đoạn bị ràng buộc bởi bộ nhớ hoặc tính toán. Bài viết so sánh thiết kế wafer-scale của công ty, phân phối SRAM cùng với tính toán trên toàn bộ wafer, với GPU, những thiết bị này đưa dữ liệu mô hình từ bộ nhớ băng thông cao qua các bộ nhớ và cache nhỏ hơn trên chip.
Một biểu đồ băng thông bộ nhớ đỉnh đã được công bố trong bài viết, ngày 10 tháng 9 năm 2026, liệt kê SRAM trên chip của Cerebras WSE-3 ở mức 21.000 TB/s mỗi wafer, cùng với một bộ tăng tốc SRAM trên chip không được nêu tên ở mức 150 TB/s và các GPU HBM4 ở mức 23,3 và 22 TB/s. Biểu đồ cảnh báo rằng các con số SRAM tổng hợp băng thông bộ nhớ địa phương trên toàn bộ bộ xử lý trong khi các con số HBM đo lưu lượng từ bộ nhớ ngoài chip, vì vậy các con số mô tả các tầng bộ nhớ khác nhau thay vì tốc độ token đã đo.
Bài đăng cũng tái hiện dữ liệu Artificial Analysis từ ngày 10 tháng 9 năm 2026 cho GPT-oss-120B chạy suy luận cao với 10.000 token đầu vào. Nó liệt kê Cerebras ở mức 1.669 token đầu ra mỗi giây, SambaNova ở 708, Groq ở 475, Microsoft Azure ở 319, Nebius ở 294 và Baseten ở 293.
Cerebras cho biết trong một hệ thống tổng hợp truyền thống, việc tăng công suất đòi hỏi triển khai thêm phần cứng, và bằng cách tận dụng các bộ tăng tốc của đối tác để xử lý prompt, họ đã tăng công suất gấp 5 lần trong các thử nghiệm ban đầu với cùng diện tích WSE. Công ty cho biết đã công bố các quan hệ đối tác với nhiều nhà cung cấp phần cứng để đưa nhiều token siêu nhanh hơn ra thị trường, và một sơ đồ trong bài đăng cho thấy các hệ thống GPU AWS Trainium và AMD Helios Instinct nằm trong các tùy chọn phần cứng prefill cung cấp cho một pool giải mã của Cerebras.
Bài đăng xác định các ứng dụng agentic là một sự phù hợp hấp dẫn cho việc phân tách không đồng nhất, vì chúng thường bao gồm các quy trình dài, nhiều vòng mà ngữ cảnh tăng lên qua các lần gọi mô hình và độ trễ ở mỗi bước cộng dồn. Cerebras cho biết các phần tiếp theo sẽ đề cập đến các ngăn xếp phần cứng và phần mềm liên quan và các cân nhắc kinh tế khi triển khai phân tích suy luận không đồng nhất ở quy mô lớn.












