Model dan platform AI

Cerebras Meluncurkan Qwen3‑235B: Era Baru untuk Kecepatan, Skala, dan Biaya AI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Cerebras Systems (CBRS ) telah secara resmi meluncurkan Qwen3‑235B, sebuah model AI canggih dengan dukungan konteks penuh 131.000 token, yang menetapkan standar baru untuk kinerja dalam penalaran, generasi kode, dan aplikasi AI skala perusahaan. Sekarang tersedia melalui Cerebras Inference Cloud, model ini menawarkan kemampuan yang setara dengan sistem frontier yang paling canggih—sambil beroperasi 30 kali lebih cepat dan sepuluh kali lebih murah daripada model tertutup terkemuka saat ini.

Penalaran AI Waktu Nyata Mencapai Kecepatan Pecahan

Penalaran AI secara historis telah lambat, dengan model besar sering membutuhkan waktu satu menit atau lebih untuk merespons kueri kompleks. Cerebras menghilangkan bottleneck ini. Ditenagai oleh Wafer-Scale Engine 3 (WSE‑3) miliknya, Qwen3‑235B mencapai 1.500 token per detik, rekor dunia untuk inferensi AI frontier.

Tingkat kinerja ini mengubah pengalaman pengguna—memotong latensi dari 60-120 detik menjadi hanya 0,6 detik, bahkan ketika memproses tugas penalaran lanjutan atau menjalankan alur kerja multi-langkah seperti generasi yang ditingkatkan dengan pengambilan (RAG). Menurut hasil benchmark dari Artificial Analysis, tidak ada penyedia lain—terbuka atau tertutup—yang saat ini mencocokkan kecepatan inferensi ini untuk model frontier-level.

Standar Baru dalam Konteks: 131K Token untuk Aplikasi Dunia Nyata

Bersamaan dengan peluncuran ini, Cerebras telah memperluas jendela konteks modelnya dari 32K menjadi 131K token yang didukung oleh Qwen3‑235B. Lompatan ini dalam ukuran konteks memungkinkan model untuk mengonsumsi dan menalar atas volume data yang masif—meliputi basis kode penuh, repositori multi-dokumen, dan materi teknis panjang.

Sementara konteks 32K memungkinkan tugas generasi dasar, 131K membuka pintu untuk pengembangan produksi. AI sekarang dapat berfungsi sebagai kolaborator kode dalam, mensintesis puluhan file dan mengelola ketergantungan kompleks secara real-time—membuatnya ideal untuk kasus penggunaan perusahaan dalam rekayasa perangkat lunak, analisis dokumen, dan komputasi ilmiah.

Mengapa Cerebras Berbeda: Perangkat Keras yang Dirancang untuk AI dari Awal

Didirikan oleh tim arsitek komputer, peneliti AI, dan insinyur sistem, Cerebras Systems telah mengambil pendekatan yang sangat berbeda untuk memecahkan tantangan penskalaan AI generatif. Daripada mengandalkan klaster GPU, Cerebras membangun superkomputer AI khusus di sekitar chipnya: Wafer-Scale Engine 3.

Chip ini tidak seperti apa pun di industri. Ini membentang seukuran piring makan dan menampung ratusan ribu inti AI-optimalkan dengan memori on-chip yang diukur dalam puluhan gigabyte. Desain itu memungkinkan komputasi dan memori untuk duduk berdampingan—menghilangkan latensi, keterbatasan bandwidth, dan kompleksitas orkestrasi solusi multi-GPU tradisional.

Dengan mengklaster sistem CS-3, Cerebras dapat membuat superkomputer AI yang dapat menjalankan model triliun parameter dengan mudah, semuanya tanpa beban teknis komputasi terdistribusi. Pendekatan terpadu ini adalah landasan dari kecepatan inferensi rekor dan kemampuan konteks tinggi.

Efisiensi MoE Memungkinkan Pengurangan Biaya Dramatis

Qwen3‑235B dibangun menggunakan arsitektur mixture-of-experts (MoE)—desain model yang mengaktifkan hanya subset ahli internal tergantung pada input, menghasilkan efisiensi komputasi yang jauh lebih baik.

Karena itu, Cerebras dapat menawarkan model ini pada titik harga yang jauh lebih rendah daripada alternatif sumber tertutup. Secara khusus, inferensi tersedia seharga $0,60 per juta token input dan $1,20 per juta token output, yang mewakili pengurangan biaya lebih dari 90% dibandingkan dengan model proprietari dari OpenAI, Anthropic, atau Google.

Integrasi Tanpa Masalah dengan Cline di VS Code

Untuk menunjukkan kecepatan Qwen3‑235B dan aplikasi dunia nyata, Cerebras telah bermitra dengan Cline, agen pengkodean agenik terkemuka di Microsoft Visual Studio Code, yang saat ini dipasang oleh lebih dari 1,8 juta pengembang.

Pengguna Cline dapat mengakses Qwen3‑32B dengan konteks 64K sebagai bagian dari tingkat gratis. Dengan pengumuman hari ini, dukungan akan diperluas untuk mencakup Qwen3‑235B dan konteks penuh 131K, memungkinkan tingkat penalaran dan generasi kode dalam editor yang sebelumnya tidak dapat dicapai secara real-time.

Saoud Rizwan, CEO Cline, menjelaskan, “Dengan inferensi Cerebras, pengembang yang menggunakan Cline mendapatkan gambaran tentang masa depan, karena Cline menalar melalui masalah, membaca basis kode, dan menulis kode hampir secara real-time. Semuanya terjadi sangat cepat sehingga pengembang tetap dalam aliran, mengiterasi dengan kecepatan pikiran. Jenis inferensi cepat ini bukan hanya enak untuk dimiliki—menunjukkan kepada kita apa yang mungkin ketika AI benar-benar mengikuti pengembang.”

Alternatif Terbuka untuk Model Tertutup

Kinerja Qwen3‑235B setara dengan beberapa model AI paling canggih di pasar saat ini, termasuk Claude 4 Sonnet, Gemini 2.5 Flash, dan DeepSeek R1, seperti yang divalidasi oleh benchmark independen. Namun, Cerebras menyajikannya dalam format akses terbuka, menawarkan transparansi dan portabilitas yang tidak dimiliki model tertutup.

Pendekatan model terbuka ini memberdayakan perusahaan untuk:

  • Mengkustomisasi dan menyetel halus pada data proprietari
  • Menggunakan AI pada infrastruktur pribadi atau lingkungan cloud hybrid
  • Menghindari ketergantungan vendor dan risiko privasi data

Kombinasi dengan platform cloud yang dapat diskalakan oleh Cerebras dan penerapan opsional on-premise dari sistem CS-3, organisasi memperoleh kontrol penuh atas bagaimana AI diterapkan pada tugas kritis.

Apa yang Dimaksud untuk Industri

Peluncuran Qwen3‑235B menandai titik balik. Cerebras telah mendefinisikan kembali batas apa yang mungkin dilakukan dengan model bahasa besar dengan menggabungkan kecerdasan frontier dengan kecepatan dan efisiensi biaya yang belum pernah terjadi sebelumnya.

Sekarang memungkinkan untuk membangun alat AI yang:

  • Merespons dalam waktu nyata terhadap kueri pengembang
  • Menalar atas dokumentasi penuh atau basis pengetahuan
  • Menghasilkan dan memecahkan kode produksi secara langsung di dalam IDE
  • Menskalakan ke kasus penggunaan perusahaan tanpa penyebaran GPU atau tagihan inferensi bulanan enam angka

Ketika permintaan akan infrastruktur AI tumbuh, Cerebras menunjukkan bahwa Anda tidak perlu mengorbankan kinerja, harga, dan keterbukaan. Desain perangkat lunak-kerasnya, dari Wafer-Scale Engine hingga Cerebras Inference Cloud, menunjuk ke model baru penerapan AI—yang lebih cepat, lebih sederhana, dan jauh lebih dapat diakses.

Pikiran Terakhir

Dengan merilis Qwen3‑235B dengan konteks 131K, inferensi ultra-cepat, dan harga token yang terjangkau, Cerebras Systems telah memposisikan diri sebagai salah satu tantangan sejati bagi pendahulu yang didorong oleh GPU. Bagi perusahaan, peneliti, dan pengembang, peluncuran ini lebih dari sekadar model yang lebih cepat—ini adalah titik infleksi yang membawa AI waktu nyata, produksi, dan terbuka dalam jangkauan.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.