Mô hình và nền tảng AI
Cerebras Chạy GPT-5.6 Sol của OpenAI với Tốc Độ 750 Token/giây trong Tầng Ultrafast Mới

Cerebras (CBRS ) hiện đang chạy mô hình chủ lực của OpenAI với tốc độ mà chưa có đám mây GPU nào công khai sánh bằng. Vào ngày 13 tháng 8 năm 2026, nhà sản xuất chip quy mô wafer‑scale đã công bố rằng nó cung cấp GPT‑5.6 Sol trên một tầng dịch vụ mới của OpenAI gọi là Ultrafast, đạt tới 750 token đầu ra mỗi giây và, theo tài khoản của OpenAI, chạy mô hình nhanh gấp tới 14 lần so với xử lý tiêu chuẩn. Ultrafast lần đầu xuất hiện trong API của OpenAI như một bản preview giới hạn cho một nhóm khách hàng được chọn, và sẽ mở rộng truy cập khi năng lực tăng lên.
Khẳng định trung tâm là một tuyên bố cụ thể: trí tuệ biên giới mà không chịu hình phạt về tốc độ. GPT‑5.6 Sol là mô hình mạnh nhất của OpenAI, và trên silicon của Cerebras nó tạo token nhanh đủ để tích hợp vào các sản phẩm thời gian thực thay vì phải chờ xử lý qua đêm. Cả hai công ty đều mô tả tầng này như việc loại bỏ sự đánh đổi giữa một mô hình đủ thông minh cho công việc quan trọng và một mô hình đủ nhanh để sử dụng ngay trong khi công việc đang diễn ra.
Số Liệu Tốc Độ Đằng Sau Ultrafast
Con số 750 token đầu ra mỗi giây là tiêu đề, nhưng các so sánh đáng chú ý hơn là các bài chạy đối đầu mà Cerebras công bố. So với tốc độ đầu ra được báo cáo bởi Artificial Analysis, công ty cho biết GPT‑5.6 Sol trên Ultrafast chạy nhanh gấp 11× so với Claude Fable 5 và nhanh gấp 5× so với Opus 4.8 ở chế độ Fast.
Cerebras cũng đã đưa tầng này qua một vòng kiểm tra toàn diện của Humanity’s Last Exam, một bộ chuẩn 2.500 câu hỏi ở mức độ khó tương đương tiến sĩ. GPT‑5.6 Sol trên Ultrafast trả lời hết 2.500 câu hỏi trong 11 giờ 11 phút; Claude Fable 5 cần 78 giờ 27 phút để đạt được kết luận tương đương: chậm hơn gần 7×, theo số liệu của Cerebras. Trên GDP‑Val, một chuẩn đoán cho công việc tri thức có giá trị kinh tế, công ty báo cáo tốc độ tăng 5.6× từ đầu đến cuối so với xử lý tiêu chuẩn mà không giảm chất lượng.
Đây là các đánh giá do nhà cung cấp thực hiện, và Cerebras đã nêu rõ: so sánh Humanity’s Last Exam được thực hiện bởi Cerebras vào ngày 10 tháng 7 và từ 13–15 tháng 7 năm 2026, và con số GDP‑Val đến từ các thử nghiệm nội bộ vào ngày 31 tháng 7 năm 2026. Hãy xem chúng như các đo lường của công ty, không phải kết quả độc lập.
Tại Sao Chip Wafer‑Scale Chiến Thắng Về Độ Trễ
Cơ chế ở đây rất quan trọng, vì nó giải thích tại sao một nhà sản xuất chip tương đối nhỏ lại có thể phục vụ mô hình lớn nhất của OpenAI với tốc độ mà các GPU truyền thống chưa đạt được. Việc suy luận nhanh trên mô hình lớn về cơ bản là một vấn đề di chuyển dữ liệu: trên GPU, trọng tải mô hình phải được chuyển liên tục giữa bộ nhớ trên chip và bộ nhớ ngoài chip để tạo ra mỗi token tiếp theo, và băng thông bộ nhớ trở thành nút thắt.
Câu trả lời của Cerebras là loại bỏ việc di chuyển đó. Động cơ Wafer‑Scale của họ gói 44 GB SRAM lên một chip kích thước wafer duy nhất, vì vậy trọng tải mô hình luôn ở trên chip và các token chảy qua các lớp được pipeline trên các wafer mà không bị gián đoạn. Vì trọng tải không bao giờ rời silicon, cách tiếp cận này mở rộng cùng kích thước mô hình — đây là lập luận của công ty rằng lợi thế tốc độ sẽ duy trì khi các mô hình biên giới ngày càng lớn. Về mặt kinh tế suy luận, đó là toàn bộ trò chơi: chi phí và độ trễ khi phục vụ một mô hình phụ thuộc vào tốc độ cung cấp trọng tải cho bộ tính toán, và việc giữ 44 GB trên một die tấn công trực tiếp vào yếu tố này.
Một Đối Tác 10 Tỷ USD Đạt Được Sản Phẩm Chủ Lực
Ultrafast là sản phẩm nổi bật nhất của một mối quan hệ đã được xây dựng trong nhiều tháng. OpenAI đã chọn Cerebras cho 10 tỷ USD trong tính toán độ trễ thấp vào đầu năm 2026, và lần ra mắt này đặt năng lực đó phía sau mô hình hàng đầu của công ty thay vì một mô hình nhỏ hơn hay chuyên biệt. OpenAI mô tả Ultrafast là “bước tiếp theo” trong quan hệ đối tác nhằm mang lại suy luận siêu‑độ trễ thấp cho nền tảng của mình.
Đối với Cerebras, vị trí này có ý nghĩa lớn. Startup này đã lâu khẳng định kiến trúc wafer‑scale là hình dạng phù hợp cho suy luận ngay cả khi trọng tâm thị trường đang nghiêng về các nhà cung cấp GPU — một cuộc tranh đấu đang diễn ra trong lĩnh vực tăng tốc khi các đối thủ cố gắng tích hợp mô hình trực tiếp vào silicon của họ. Khi nắm được lớp phục vụ cho sản phẩm chủ lực của OpenAI, Cerebras có được một khách hàng tham chiếu sản xuất ở đỉnh cao thị trường. Mô hình này còn là trụ cột cho dòng GPT‑5.6 mà OpenAI ra mắt (Sol là mẫu flagship, cùng với Terra cân bằng và Luna tiết kiệm chi phí), vì vậy Ultrafast gắn Cerebras vào đầu danh sách đó.
Ai Nhận Được Và Dành Cho Mục Đích Gì
OpenAI định vị tầng này cho các công việc nhạy thời gian, có mức độ rủi ro cao: phản ứng sự cố khi sự cố vẫn đang diễn ra, nghiên cứu tài chính khi thị trường biến động, hỗ trợ khách hàng và giọng nói thời gian thực, thương mại điện tử, và các vòng nghiên cứu trực tiếp mà trước đây phải chạy qua đêm. Truy cập sớm đã được cấp cho các công ty trong lĩnh vực lập trình, thương mại và tài chính, bao gồm Jane Street, Podium, Basis và Rogo.
“Sự tăng tốc độ mà Cerebras mang lại thật ấn tượng,” John Crepezzi, AI Assistants tại Jane Street, nói trong thông báo của OpenAI. “Nó cho phép các cách sử dụng mô hình khác nhau, và làm cho việc các nhà phát triển làm việc một cách tập trung và hiệu quả hơn cùng với chúng trở nên thực tiễn.”
OpenAI giữ việc triển khai hẹp một cách có chủ đích. Công ty cho biết đang dùng giai đoạn preview để tìm hiểu nơi mà sự thay đổi tốc độ hàng chục lần tạo ra giá trị lớn nhất, và sẽ mở rộng truy cập khi năng lực tăng lên. Cả OpenAI và Cerebras đều đang nhận đăng ký nhận cập nhật khi phạm vi preview mở rộng.
Điều Gì Sẽ Xảy Ra Tiếp Theo
Điều có thể quan sát ngay trong ngắn hạn là năng lực, không phải khả năng. Ultrafast là một bản preview giới hạn, và cả hai công ty liên kết bất kỳ khả dụng rộng rãi nào với sự tăng trưởng năng lực thay vì một ngày cố định — vì vậy tốc độ mở rộng là điều cần theo dõi. Câu hỏi lâu dài là liệu lợi thế bộ nhớ trên chip của Cerebras có duy trì khi các mô hình của OpenAI mở rộng hay không, và đó chính là cược mà kiến trúc wafer‑scale được xây dựng dựa trên.












