Mô hình và nền tảng AI
Cerebras Ra Mắt Qwen3‑235B: Một Thời Đại Mới Cho Tốc Độ, Quy Mô và Chi Phí Của Trí Tuệ Nhân Tạo

Cerebras Systems (CBRS ) đã chính thức ra mắt Qwen3‑235B, một mô hình trí tuệ nhân tạo tiên tiến với hỗ trợ ngữ cảnh đầy đủ 131.000 token, thiết lập một tiêu chuẩn mới cho hiệu suất trong lý luận, tạo mã và ứng dụng trí tuệ nhân tạo cấp doanh nghiệp. Hiện tại có sẵn qua Cerebras Inference Cloud, mô hình này cung cấp các khả năng tương đương với các hệ thống trí tuệ nhân tạo tiên tiến nhất trên thị trường ngày nay – trong khi hoạt động với tốc độ nhanh hơn 30 lần và chi phí thấp hơn 1/10 so với các mô hình mã nguồn đóng hàng đầu hiện nay.
Lý Luận Trí Tuệ Nhân Tạo Thời Gian Thực Đạt Tốc Độ Đột Phá
Lý luận trí tuệ nhân tạo đã từng là một quá trình chậm, với các mô hình lớn thường mất một phút hoặc hơn để phản hồi các truy vấn phức tạp. Cerebras loại bỏ nút thắt này. Được trang bị bộ xử lý Wafer-Scale Engine 3 (WSE‑3) độc quyền, Qwen3‑235B đạt 1.500 token mỗi giây, một kỷ lục thế giới cho suy luận trí tuệ nhân tạo tiên phong.
Mức hiệu suất này biến đổi trải nghiệm người dùng – cắt giảm độ trễ từ 60-120 giây xuống chỉ 0,6 giây, ngay cả khi xử lý các nhiệm vụ lý luận tiên tiến hoặc chạy các công việc đa bước như tạo mã tăng cường (RAG). Theo kết quả benchmark từ Artificial Analysis, không có nhà cung cấp nào – mã nguồn mở hay mã nguồn đóng – hiện tại sánh kịp với tốc độ suy luận này cho một mô hình tiên phong.
Một Tiêu Chuẩn Mới Về Ngữ Cảnh: 131K Token Cho Các Ứng Dụng Thế Giới Thực
Song song với việc ra mắt này, Cerebras đã mở rộng cửa sổ ngữ cảnh của mô hình từ 32K lên 131K token đầy đủ được hỗ trợ bởi Qwen3‑235B. Nhảy vọt này trong kích thước ngữ cảnh cho phép mô hình tiêu thụ và lý luận trên các khối lượng dữ liệu khổng lồ – bao gồm toàn bộ cơ sở mã, kho tài liệu đa tài liệu và tài liệu kỹ thuật dài.
Trong khi ngữ cảnh 32K cho phép thực hiện các nhiệm vụ tạo mã cơ bản, 131K mở cửa cho phát triển cấp sản xuất. Trí tuệ nhân tạo có thể hoạt động như một cộng tác viên mã sâu, tổng hợp hàng chục tệp và quản lý các phụ thuộc phức tạp trong thời gian thực – làm cho nó lý tưởng cho các trường hợp sử dụng doanh nghiệp trong kỹ thuật phần mềm, phân tích tài liệu và tính toán khoa học.
Tại Sao Cerebras Khác Biệt: Phần Cứng Được Thiết Kế Cho Trí Tuệ Nhân Tạo Từ Đầu
Được thành lập bởi một nhóm các kiến trúc sư máy tính tiên phong, nhà nghiên cứu trí tuệ nhân tạo và kỹ sư hệ thống, Cerebras Systems đã thực hiện một cách tiếp cận khác biệt để giải quyết các thách thức của việc mở rộng trí tuệ nhân tạo tạo mã. Thay vì dựa vào các cụm GPU, Cerebras đã xây dựng một siêu máy tính trí tuệ nhân tạo chuyên dụng xung quanh chip của riêng họ: Wafer-Scale Engine 3.
Chip này không giống bất cứ thứ gì trong ngành công nghiệp. Nó có kích thước bằng một đĩa ăn và chứa hàng trăm nghìn lõi được tối ưu hóa cho trí tuệ nhân tạo với bộ nhớ trên chip đo bằng tens của gigabyte. Thiết kế này cho phép tính toán và bộ nhớ ngồi cạnh nhau – loại bỏ độ trễ, hạn chế băng thông và phức tạp trong việc điều phối các giải pháp đa GPU truyền thống.
Bằng cách nhóm các hệ thống CS-3, Cerebras có thể tạo ra các siêu máy tính trí tuệ nhân tạo có khả năng chạy các mô hình có tham số nghìn tỷ với dễ dàng, tất cả trong khi tránh gánh nặng kỹ thuật của tính toán phân tán. Cách tiếp cận thống nhất này là nền tảng của tốc độ suy luận kỷ lục và khả năng ngữ cảnh mới.
Hiệu Suất Mixture-of-Experts Cho Phép Giảm Chi Phí Đột Biến
Qwen3‑235B được xây dựng bằng cách sử dụng kiến trúc mixture-of-experts (MoE) – một thiết kế mô hình kích hoạt chỉ một tập con các chuyên gia nội bộ tùy thuộc vào đầu vào, dẫn đến hiệu quả tính toán được cải thiện đáng kể.
Do đó, Cerebras có thể cung cấp mô hình này với một điểm giá thấp hơn đáng kể so với các lựa chọn thay thế mã nguồn đóng. Cụ thể, suy luận có sẵn với $0,60 cho mỗi triệu token đầu vào và $1,20 cho mỗi triệu token đầu ra, đại diện cho việc giảm hơn 90% chi phí so với các mô hình độc quyền từ OpenAI, Anthropic hoặc Google.
Tích Hợp Mượt Mà Với Cline Trong VS Code
Để trình diễn tốc độ và ứng dụng thực tế của Qwen3‑235B, Cerebras đã hợp tác với Cline, đại lý mã hóa hàng đầu trong Microsoft Visual Studio Code, hiện đã được hơn 1,8 triệu nhà phát triển cài đặt.
Người dùng Cline có thể truy cập Qwen3‑32B với ngữ cảnh 64K như một phần của cấp miễn phí. Với thông báo hôm nay, hỗ trợ sẽ mở rộng để bao gồm Qwen3‑235B và ngữ cảnh đầy đủ 131K của nó, cho phép mức độ suy luận và tạo mã trong trình soạn thảo trước đây không thể đạt được trong thời gian thực.
Saoud Rizwan, CEO của Cline, giải thích, “Với suy luận của Cerebras, các nhà phát triển sử dụng Cline đang có cái nhìn về tương lai, khi Cline suy luận qua các vấn đề, đọc cơ sở mã và viết mã gần như thời gian thực. Mọi thứ diễn ra quá nhanh đến mức các nhà phát triển vẫn giữ được dòng chảy, lặp lại với tốc độ suy nghĩ. Loại suy luận nhanh này không chỉ tốt để có – nó cho chúng tôi thấy những gì có thể khi trí tuệ nhân tạo thực sự theo kịp các nhà phát triển.”
Một Lựa Chọn Mở Thay Thế Cho Các Mô Hình Đóng
Hiệu suất của Qwen3‑235B tương đương với một số mô hình trí tuệ nhân tạo tiên tiến nhất trên thị trường hiện nay, bao gồm Claude 4 Sonnet, Gemini 2.5 Flash và DeepSeek R1, như được xác thực bởi các điểm chuẩn độc lập. Tuy nhiên, Cerebras cung cấp nó dưới dạng mở, mang lại sự minh bạch và khả năng di chuyển mà các mô hình đóng không có.
Cách tiếp cận mô hình mở này trao quyền cho các doanh nghiệp:
- Tùy chỉnh và tinh chỉnh trên dữ liệu độc quyền
- Triển khai trí tuệ nhân tạo trên cơ sở hạ tầng riêng hoặc trong môi trường đám mây lai
- Tránh khóa nhà cung cấp và rủi ro bảo mật dữ liệu
Kết hợp với nền tảng đám mây có thể mở rộng của Cerebras và triển khai tùy chọn trên cơ sở của hệ thống CS-3, các tổ chức có quyền kiểm soát đầy đủ cách trí tuệ nhân tạo được áp dụng cho các nhiệm vụ quan trọng.
Điều Này Có Nghĩa Là Gì Cho Ngành Công Nghiệp
Ra mắt Qwen3‑235B đánh dấu một điểm chuyển. Cerebras đã tái định nghĩa ranh giới của những gì có thể với các mô hình ngôn ngữ lớn bằng cách kết hợp trí tuệ tiên phong với tốc độ và hiệu quả chi phí chưa từng có.
Bây giờ, đã có thể xây dựng các công cụ trí tuệ nhân tạo có thể:
- Phản hồi trong thời gian thực với các truy vấn của nhà phát triển
- Suy luận trên toàn bộ tài liệu hoặc cơ sở tri thức
- Tạo và gỡ lỗi mã cấp sản xuất trực tiếp trong IDE
- Mở rộng đến các trường hợp sử dụng doanh nghiệp mà không cần GPU hoặc hóa đơn suy luận hàng tháng sáu con số
Khi nhu cầu về cơ sở hạ tầng trí tuệ nhân tạo tăng trưởng, Cerebras chứng minh rằng bạn không cần phải thỏa hiệp giữa hiệu suất, giá cả và tính mở. Thiết kế phần cứng-phần mềm của họ, từ Wafer-Scale Engine đến Cerebras Inference Cloud, chỉ ra một mô hình triển khai trí tuệ nhân tạo mới – nhanh hơn, đơn giản hơn và dễ tiếp cận hơn.
Tư Duy Cuối Cùng
Bằng cách phát hành Qwen3‑235B với ngữ cảnh 131K, suy luận siêu nhanh và giá token phải chăng, Cerebras Systems đã đặt mình như một trong những đối thủ thực sự của các công ty dẫn đầu dựa trên GPU. Đối với các doanh nghiệp, nhà nghiên cứu và nhà phát triển, việc ra mắt này không chỉ là một mô hình nhanh hơn – nó là một điểm chuyển biến mang trí tuệ nhân tạo thời gian thực, cấp sản xuất và mở trong tầm tay.












