Mô hình và nền tảng AI
Cerebras Chạy OpenAI’s GPT-5.6 Sol ở 750 Tokens Per Second trong Tier Ultrafast Mới

Cerebras hiện đang chạy mô hình flagship của OpenAI với tốc độ mà không có dịch vụ đám mây GPU nào công khai sánh được. Vào ngày 13 tháng 8 năm 2026, nhà sản xuất chip wafer-scale đã công bố rằng họ cung cấp GPT-5.6 Sol trên một dịch vụ mới của OpenAI gọi là Ultrafast, mang lại tối đa 750 token đầu ra mỗi giây và, theo tài khoản của OpenAI, chạy mô hình nhanh hơn 14 lần so với xử lý Tiêu chuẩn. Ultrafast ra mắt đầu tiên trong OpenAI API như một bản xem trước hạn chế cho một nhóm khách hàng được chọn, với quyền truy cập mở rộng khi khả năng tăng trưởng.
Đề xuất ở trung tâm là một đề xuất cụ thể: trí tuệ tiền phong mà không có hình phạt về tốc độ. GPT-5.6 Sol là mô hình mạnh nhất của OpenAI, và trên silicon Cerebras, nó tạo ra token đủ nhanh để đặt bên trong sản phẩm thời gian thực thay vì sau một công việc hàng loạt qua đêm. Cả hai công ty đều mô tả cấp độ này như là loại bỏ sự đánh đổi giữa một mô hình đủ thông minh cho công việc quan trọng và một mô hình đủ nhanh để sử dụng trong khi công việc vẫn đang diễn ra.
Số Tốc Độ Đằng Sau Ultrafast
Con số 750 token đầu ra mỗi giây là tiêu đề, nhưng so sánh trực tiếp mà Cerebras công bố là đáng chú ý hơn. So với tốc độ đầu ra được báo cáo bởi Artificial Analysis, công ty cho biết GPT-5.6 Sol trên Ultrafast chạy nhanh hơn 11 lần so với Claude Fable 5 và 5 lần nhanh hơn so với Opus 4.8 ở chế độ Fast.
Cerebras cũng đưa cấp độ này qua một lần chạy đầy đủ của Humanity’s Last Exam, một điểm chuẩn 2.500 câu hỏi được thiết kế cho trình độ PhD. GPT-5.6 Sol trên Ultrafast đã trả lời tất cả 2.500 câu hỏi trong 11 giờ và 11 phút; Claude Fable 5 cần 78 giờ và 27 phút để đạt được kết luận tương đương: chậm hơn gần 7 lần, theo cách nói của Cerebras. Trên GDP-Val, một điểm chuẩn cho công việc tri thức có giá trị kinh tế, công ty báo cáo một tốc độ tăng 5,6 lần so với xử lý Tiêu chuẩn mà không có sự suy giảm chất lượng.
Đây là những đánh giá do nhà cung cấp thực hiện, và Cerebras rõ ràng về điều đó: so sánh Humanity’s Last Exam được đánh giá bởi Cerebras vào ngày 10 và 13-15 tháng 7 năm 2026, và con số GDP-Val đến từ thử nghiệm của riêng họ vào ngày 31 tháng 7 năm 2026. Hãy coi chúng là các phép đo của công ty, không phải là kết quả độc lập.
Tại Sao Chip Wafer-Scale Thắng Về Tốc Độ
Cơ chế này rất quan trọng, vì nó giải thích tại sao một nhà sản xuất chip tương đối nhỏ lại phục vụ mô hình lớn nhất của OpenAI với tốc độ mà các nhà cung cấp GPU chưa từng sánh được. Sự suy luận nhanh trên một mô hình lớn cơ bản là một vấn đề về việc di chuyển dữ liệu: trên GPU, trọng số mô hình phải được di chuyển liên tục giữa bộ nhớ trên chip và lưu trữ ngoài chip để tạo ra mỗi token tiếp theo, và băng thông bộ nhớ trở thành nút thắt.
Giải pháp của Cerebras là loại bỏ sự di chuyển đó. Động cơ Wafer-Scale của họ chứa 44 GB SRAM trên một chip cỡ wafer duy nhất, vì vậy trọng số của mô hình vẫn trên chip và token chảy qua các lớp được phân cấp trên wafer mà không bị gián đoạn. Bởi vì trọng số không bao giờ rời khỏi silicon, cách tiếp cận này có thể mở rộng với kích thước mô hình — đó là lập luận của công ty rằng lợi thế về tốc độ vẫn được giữ khi các mô hình tiền phong phát triển. Đối với kinh tế suy luận, đó là toàn bộ trò chơi: chi phí và độ trễ của việc phục vụ một mô hình được chi phối bởi tốc độ bạn có thể cung cấp trọng số cho tính toán, và giữ 44 GB trên một chip tấn công trực tiếp vào điều đó.
Một Quan Hệ Hợp Tác 10 Tỷ Đô La Đạt Được Flagship
Ultrafast là sản phẩm có thể thấy được nhất từ một mối quan hệ đã được xây dựng trong vài tháng. OpenAI đã chọn Cerebras cho 10 tỷ đô la trong tính toán độ trễ thấp hơn vào đầu năm 2026, và việc ra mắt này đặt khả năng đó sau mô hình hàng đầu của công ty thay vì một mô hình nhỏ hơn hoặc chuyên dụng. OpenAI mô tả Ultrafast như “bước tiếp theo” trong quan hệ hợp tác để mang lại suy luận độ trễ thấp cho nền tảng của mình.
Đối với Cerebras, vị trí này rất quan trọng. Startup đã lâu nay cho rằng kiến trúc wafer-scale của họ là hình dạng đúng cho suy luận ngay cả khi trọng tâm của thị trường nằm với các nhà cung cấp GPU — một cuộc cạnh tranh đang diễn ra trên toàn bộ kinh doanh gia tốc khi các công ty đã thành lập chuyển sang nhúng mô hình trực tiếp vào silicon của họ. Việc đặt lớp phục vụ cho mô hình flagship của OpenAI mang lại cho Cerebras một tài khoản tham chiếu sản xuất tại đầu của thị trường. Mô hình chính là GPT-5.6 (Sol là flagship, cùng với Terra cân bằng và Luna tiết kiệm chi phí), vì vậy Ultrafast gắn Cerebras vào đầu của dòng sản phẩm đó.
Ai Nhận Được Nó Và Nó Dùng Để Làm Gì
OpenAI đang định vị cấp độ này cho công việc nhạy cảm với thời gian, quan trọng: phản ứng với sự cố trong khi sự cố vẫn đang diễn ra, nghiên cứu tài chính trong khi điều kiện thị trường đang di chuyển, hỗ trợ khách hàng thời gian thực và giọng nói, thương mại, và vòng lặp nghiên cứu trực tiếp mà trước đây chạy qua đêm. Truy cập sớm đã được cấp cho các công ty trên mã, thương mại và tài chính, bao gồm Jane Street, Podium, Basis và Rogo.
> “Sự tăng tốc do Cerebras mang lại thật ấn tượng,” theo John Crepezzi, Trợ lý AI tại Jane Street, trong thông báo của OpenAI. “Nó cho phép sử dụng mô hình theo những cách khác nhau và giúp các nhà phát triển làm việc một cách tập trung và hiệu quả hơn cùng với chúng.”
OpenAI đang giữ việc triển khai hẹp có chủ ý. Công ty cho biết họ đang sử dụng giai đoạn xem trước để tìm hiểu nơi một sự thay đổi tốc độ theo cấp số nhân tạo ra giá trị nhất, và sẽ mở rộng quyền truy cập khi khả năng tăng trưởng. Cả OpenAI và Cerebras đều đang nhận đăng ký để cập nhật khi bản xem trước được mở rộng.
Cái Gì Xảy Ra Tiếp Theo
Điều quan sát được trong thời gian gần là khả năng, không phải khả năng. Ultrafast là một bản xem trước hạn chế, và cả hai công ty đều gắn sự sẵn có rộng hơn với sự tăng trưởng khả năng chứ không phải một ngày cố định — vì vậy tốc độ mở rộng là điều cần theo dõi. Câu hỏi dài hơn là liệu lợi thế bộ nhớ trên chip của Cerebras có giữ được khi các mô hình của OpenAI phát triển, điều mà kiến trúc wafer-scale được xây dựng.












