Model dan platform AI
Cerebras Menjalankan GPT-5.6 Sol dari OpenAI dengan Kecepatan 750 Token per Detik di Tingkat Ultrafast Baru

Cerebras (CBRS ) kini menjalankan model unggulan OpenAI dengan kecepatan yang belum pernah disamai oleh layanan cloud GPU mana pun. Pada 13 Agustus 2026, pembuat chip wafer‑scale mengumumkan bahwa ia menyalakan GPT-5.6 Sol pada tingkatan layanan OpenAI baru yang disebut Ultrafast, memberikan hingga 750 token keluaran per detik dan, menurut pernyataan OpenAI, menjalankan model hingga 14× lebih cepat dibandingkan pemrosesan Standard. Ultrafast pertama kali diluncurkan di API OpenAI sebagai pratinjau terbatas untuk sekelompok pelanggan terpilih, dengan akses yang akan meluas seiring pertumbuhan kapasitas.
Pernyataan inti adalah satu yang spesifik: kecerdasan frontier tanpa penalti kecepatan. GPT-5.6 Sol adalah model paling canggih dari OpenAI, dan pada silikon Cerebras ia menghasilkan token cukup cepat untuk ditempatkan dalam produk real‑time daripada berada di belakang pekerjaan batch semalam. Kedua perusahaan menggambarkan tingkatan ini sebagai menghilangkan kompromi antara model yang cukup pintar untuk pekerjaan berisiko tinggi dan yang cukup cepat untuk digunakan saat pekerjaan masih berlangsung.
Angka Kecepatan di Balik Ultrafast
Angka 750 token keluaran per detik adalah sorotan utama, namun perbandingan yang lebih menggugah adalah hasil uji head‑to‑head yang dipublikasikan Cerebras. Dibandingkan dengan kecepatan keluaran yang dilaporkan oleh Artificial Analysis, perusahaan menyatakan bahwa GPT-5.6 Sol pada Ultrafast berjalan 11× lebih cepat daripada Claude Fable 5 dan 5× lebih cepat daripada Opus 4.8 pada mode Fast.
Cerebras juga menguji tingkatan ini dengan menjalankan Humanity’s Last Exam secara lengkap, sebuah benchmark 2.500 pertanyaan dengan tingkat kesulitan setara PhD. GPT-5.6 Sol pada Ultrafast menjawab semua 2.500 pertanyaan dalam 11 jam 11 menit; Claude Fable 5 memerlukan 78 jam 27 menit untuk mencapai kesimpulan yang sebanding: hampir 7× lebih lambat, menurut Cerebras. Pada GDP‑Val, sebuah benchmark untuk pekerjaan pengetahuan yang bernilai ekonomi, perusahaan melaporkan percepatan end‑to‑end sebesar 5,6× dibandingkan pemrosesan Standard tanpa penurunan kualitas.
Ini adalah evaluasi yang dijalankan vendor, dan Cerebras menegaskan hal tersebut: perbandingan Humanity’s Last Exam di‑benchmark oleh Cerebras pada 10 Juli serta 13–15 Juli 2026, dan angka GDP‑Val berasal dari pengujian internal pada 31 Juli 2026. Anggaplah ini sebagai pengukuran milik perusahaan, bukan hasil independen.
Mengapa Chip Wafer‑Scale Unggul dalam Latensi
Mechanisme ini penting karena menjelaskan mengapa pembuat chip yang relatif kecil dapat melayani model terbesar OpenAI dengan kecepatan yang belum dapat ditandingi oleh GPU incumbent. Inferensi cepat pada model besar pada dasarnya merupakan masalah pergerakan data: pada GPU, bobot model harus dipindahkan berulang‑ulang antara memori on‑chip dan penyimpanan off‑chip untuk menghasilkan setiap token berikutnya, dan bandwidth memori menjadi kendala utama.
Jawaban Cerebras adalah menghilangkan pergerakan tersebut. Wafer‑Scale Engine mereka menampung 44 GB SRAM pada satu chip berukuran wafer, sehingga bobot model tetap berada di dalam chip dan token mengalir melalui lapisan‑lapisan yang dipipelining melintasi wafer tanpa gangguan. Karena bobot tidak pernah meninggalkan silikon, pendekatan ini dapat diskalakan seiring ukuran model — yang menjadi argumen perusahaan bahwa keunggulan kecepatan tetap berlaku saat model frontier berkembang. Dalam ekonomi inferensi, itulah seluruh permainan: biaya dan latensi melayani model didominasi oleh seberapa cepat Anda dapat memberi bobot ke unit komputasi, dan mempertahankan 44 GB pada satu die secara langsung menangani hal itu.
Kemitraan $10 Miliar Mencapai Model Unggulan
Ultrafast adalah produk paling terlihat dari hubungan yang telah dibangun selama berbulan‑bulan. OpenAI menunjuk Cerebras untuk komputasi latensi rendah senilai $10 miliar pada awal 2026, dan peluncuran ini menempatkan kapasitas tersebut di belakang model utama perusahaan, bukan model yang lebih kecil atau khusus. OpenAI menggambarkan Ultrafast sebagai “langkah selanjutnya” dalam kemitraan untuk membawa inferensi ultra‑low‑latency ke platformnya.
Bagi Cerebras, penempatan ini penting. Startup tersebut telah lama berargumen bahwa arsitektur wafer‑scale adalah bentuk yang tepat untuk inferensi bahkan ketika pusat gravitasi pasar berada pada pemasok GPU — sebuah persaingan yang terjadi di seluruh bisnis akselerator saat incumbent beralih ke menyematkan model langsung ke dalam silikon mereka. Menjadi lapisan layanan untuk model unggulan OpenAI memberi Cerebras referensi akun produksi di puncak pasar. Model itu sendiri menjadi jangkar keluarga GPT-5.6 yang diluncurkan OpenAI (Sol sebagai flagship, bersama Terra yang seimbang dan Luna yang hemat biaya), sehingga Ultrafast menempatkan Cerebras di depan rangkaian tersebut.
Siapa yang Mendapatkannya dan Untuk Apa
OpenAI menempatkan tingkatan ini untuk pekerjaan yang sensitif waktu dan berisiko tinggi: respons insiden saat gangguan masih berlangsung, riset keuangan saat kondisi pasar berubah, dukungan pelanggan dan suara real‑time, perdagangan, serta siklus riset langsung yang sebelumnya dijalankan semalaman. Akses awal telah diberikan kepada perusahaan di bidang pemrograman, perdagangan, dan keuangan, termasuk Jane Street, Podium, Basis, dan Rogo.
“Peningkatan kecepatan yang dibawa oleh Cerebras sangat mengesankan,” kata John Crepezzi, AI Assistants di Jane Street, dalam pengumuman OpenAI. “Hal ini memungkinkan cara berbeda dalam menggunakan model, dan menjadikannya praktis bagi pengembang untuk bekerja secara lebih terfokus dan produktif bersamanya.”
OpenAI sengaja menjaga peluncuran tetap terbatas. Perusahaan menyatakan bahwa periode pratinjau digunakan untuk mempelajari di mana perubahan kecepatan berordo magnitudo menghasilkan nilai paling besar, dan akan memperluas akses seiring pertumbuhan kapasitas. Baik OpenAI maupun Cerebras menerima pendaftaran untuk pembaruan saat pratinjau meluas.
Apa yang Akan Terjadi Selanjutnya
Hal yang dapat diamati dalam jangka pendek adalah kapasitas, bukan kemampuan. Ultrafast adalah pratinjau terbatas, dan kedua perusahaan mengaitkan ketersediaan yang lebih luas dengan pertumbuhan kapasitas bukan tanggal tetap — sehingga kecepatan ekspansi menjadi hal yang perlu dipantau. Pertanyaan jangka panjang adalah apakah keunggulan memori on‑chip Cerebras tetap berlaku saat model OpenAI berkembang, yang merupakan taruhan tepat pada arsitektur wafer‑scale.












