Model dan platform AI

Cerebras Jalankan GPT-5.6 Sol OpenAI pada 750 Token Per Detik di Tier Ultrafast Baru

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Cerebras kini menjalankan model bendera OpenAI dengan kecepatan yang belum pernah dicapai oleh cloud GPU mana pun. Pada 13 Agustus 2026, pembuat chip wafer-skala mengumumkan bahwa mereka memungkinkan GPT-5.6 Sol pada layanan tier baru OpenAI yang disebut Ultrafast, yang menghasilkan hingga 750 token keluaran per detik dan, menurut akun OpenAI, menjalankan model hingga 14× lebih cepat daripada pemrosesan Standar. Ultrafast diluncurkan pertama kali di OpenAI API sebagai pratinjau terbatas untuk sekelompok kecil pelanggan, dengan akses yang diperluas seiring pertumbuhan kapasitas.

Klaim di pusatnya adalah satu yang spesifik: kecerdasan frontier tanpa penalti kecepatan. GPT-5.6 Sol adalah model paling mampu OpenAI, dan pada silikon Cerebras, ia menghasilkan token dengan kecepatan yang cukup untuk duduk di dalam produk waktu nyata daripada di belakang pekerjaan batch malam. Kedua perusahaan membingkai tier ini sebagai penghapusan tradeoff antara model yang cukup pintar untuk pekerjaan dengan taruhan tinggi dan yang cukup cepat untuk digunakan saat pekerjaan masih berlangsung.

Angka Kecepatan di Balik Ultrafast

Angka 750 token keluaran per detik adalah yang paling menonjol, tetapi perbandingan yang lebih mengungkap adalah perbandingan head-to-head yang diterbitkan Cerebras. Melawan kecepatan keluaran yang dilaporkan oleh Artificial Analysis, perusahaan tersebut mengatakan GPT-5.6 Sol pada Ultrafast menjalankan 11× lebih cepat daripada Claude Fable 5 dan 5× lebih cepat daripada Opus 4.8 pada mode Cepat.

Cerebras juga melewati tier ini melalui satu putaran penuh dari Humanity’s Last Exam, sebuah benchmark 2.500 pertanyaan yang ditujukan pada tingkat kesulitan PhD. GPT-5.6 Sol pada Ultrafast menjawab semua 2.500 pertanyaan dalam 11 jam dan 11 menit; Claude Fable 5 membutuhkan 78 jam dan 27 menit untuk mencapai kesimpulan yang setara: hampir 7× lebih lambat, menurut Cerebras. Pada GDP-Val, sebuah benchmark untuk pekerjaan pengetahuan yang berharga secara ekonomi, perusahaan tersebut melaporkan percepatan akhir-ke-akhir sebesar 5,6× daripada pemrosesan Standar tanpa degradasi kualitas.

Ini adalah evaluasi yang dijalankan oleh vendor, dan Cerebras secara eksplisit mengenainya: perbandingan Humanity’s Last Exam diujikan oleh Cerebras pada 10 dan 13-15 Juli 2026, dan angka GDP-Val berasal dari pengujian mereka sendiri pada 31 Juli 2026. Perlakukan mereka sebagai pengukuran perusahaan, bukan hasil independen.

Mengapa Chip Wafer-Skala Menang pada Latensi

Mekanisme ini penting, karena menjelaskan mengapa sebuah pembuat chip yang relatif kecil melayani model terbesar OpenAI dengan kecepatan yang belum dicapai oleh pendahulu GPU. Inferensi cepat pada model besar pada dasarnya adalah masalah pergerakan data: pada GPU, bobot model harus dipindahkan berulang kali antara memori pada chip dan penyimpanan off-chip untuk menghasilkan setiap token berikutnya, dan bandwidth memori menjadi bottleneck.

Jawaban Cerebras adalah menghilangkan pergerakan itu. Mesin Wafer-Skala mereka memuat 44 GB SRAM ke dalam satu chip berukuran wafer, sehingga bobot model tetap pada chip dan token mengalir melalui lapisan yang dipipai melintasi wafer tanpa gangguan. Karena bobot tidak pernah meninggalkan silikon, pendekatan ini berkembang dengan ukuran model — yang merupakan argumen perusahaan bahwa keunggulan kecepatan bertahan saat model frontier tumbuh. Untuk ekonomi inferensi, itu adalah permainan utama: biaya dan latensi melayani model didominasi oleh seberapa cepat Anda dapat memberi makan bobot ke komputasi, dan menjaga 44 GB tetap berada pada satu die menyerang langsung.

Kemitraan $10 Miliar Mencapai Kapal Bendera

Ultrafast adalah produk paling terlihat dari hubungan yang telah berkembang selama beberapa bulan. OpenAI menunjuk Cerebras untuk $10 miliar dalam komputasi latensi rendah lebih awal di 2026, dan peluncuran ini meletakkan kapasitas tersebut di belakang model teratas perusahaan daripada yang lebih kecil atau khusus. OpenAI menggambarkan Ultrafast sebagai “langkah berikutnya” dalam kemitraan untuk membawa inferensi latensi ultra-rendah ke platform mereka.

Bagi Cerebras, penempatan ini signifikan. Startup ini telah lama berargumen bahwa arsitektur wafer-skala mereka adalah bentuk yang tepat untuk inferensi bahkan ketika pusat gravitasi pasar berada dengan pemasok GPU — sebuah kontes yang sedang berlangsung di seluruh bisnis akselerator saat pendahulu bergerak untuk mengintegrasikan model langsung ke dalam silikon mereka. Mendapatkan lapisan pelayanan untuk model bendera OpenAI memberi Cerebras akun referensi produksi di puncak pasar. Model itu sendiri mengaitkan keluarga GPT-5.6 OpenAI yang diluncurkan (Sol sebagai kapal bendera, di samping Terra yang seimbang dan Luna yang efisien biaya), sehingga Ultrafast mengaitkan Cerebras ke bagian depan lineup tersebut.

Siapa yang Mendapatkannya dan Untuk Apa

OpenAI memosisikan tier ini pada pekerjaan yang sensitif waktu, dengan taruhan tinggi: respons insiden saat pemadaman masih berlangsung, penelitian keuangan saat kondisi pasar bergerak, dukungan pelanggan waktu nyata dan suara, komersial, dan loop penelitian langsung yang sebelumnya berjalan semalam. Akses awal telah diberikan kepada perusahaan di seluruh coding, komersial, dan keuangan, termasuk Jane Street, Podium, Basis, dan Rogo.

> “Peningkatan kecepatan yang dibawa oleh Cerebras sangat mengesankan,” kata John Crepezzi, AI Assistants di Jane Street, dalam pengumuman OpenAI. “Ini memungkinkan cara-cara berbeda untuk menggunakan model, dan membuatnya praktis bagi pengembang untuk bekerja dengan lebih fokus dan produktif bersama mereka.”

OpenAI menjaga peluncuran tetap sempit dengan sengaja. Perusahaan tersebut mengatakan bahwa mereka menggunakan periode pratinjau untuk mempelajari di mana perubahan kecepatan sebesar orde besarnya menciptakan nilai terbesar, dan akan memperluas akses seiring pertumbuhan kapasitas. Baik OpenAI maupun Cerebras menerima pendaftaran untuk pembaruan saat pratinjau diperluas.

Apa yang Terjadi Selanjutnya

Yang dapat diamati di dekat adalah kapasitas, bukan kemampuan. Ultrafast adalah pratinjau terbatas, dan kedua perusahaan mengikat ketersediaan yang lebih luas pada pertumbuhan kapasitas daripada tanggal tetap — sehingga kecepatan ekspansi adalah hal yang perlu diperhatikan. Pertanyaan yang lebih panjang adalah apakah keunggulan memori pada chip Cerebras bertahan saat model OpenAI tumbuh, yang merupakan taruhan yang dibangun di atas arsitektur wafer-skala.

Theo Nash adalah seorang spesialis yang dihasilkan oleh AI di Unite.AI, yang meliputi infrastruktur AI, komputasi, dan sistem perangkat keras yang memungkinkan kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI skala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.
Dengan perspektif analitis dan berbasis teknik, Theo memeriksa bagaimana kemajuan dalam GPU, silikon kustom, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memperhatikan khusus pada pertukaran kinerja, efisiensi energi, skalabilitas, dan kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.
Artikel yang ditulis oleh Theo Nash dihasilkan oleh AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang pesat.