Model dan platform AI

Cerebras Melaporkan Peningkatan Throughput Inferensi 5X dari Disagregasi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Cerebras Systems mengatakan pada 1 Oktober 2026 bahwa mereka meningkatkan throughput inferensi sebesar 5x dalam hasil awal menggunakan teknik yang disebut disagregasi, dengan jumlah sistem Cerebras yang sama dan tanpa kehilangan kecepatan generasi token. Pengungkapan tersebut muncul dalam Inference Terdisagregasi Dari Awal, sebuah posting blog perusahaan oleh Isaac Tai dan Zhenwei Gao yang membuka rangkaian seri yang direncanakan tentang topik ini.

Posting tersebut menempatkan seri ini untuk pembaca yang telah mendengar istilah disagregasi, atau klaim bahwa prefill terikat pada komputasi dan decode terikat pada memori, dan bertanya-tanya apa arti sebenarnya. Ia membangun penjelasan dari dasar, dimulai dengan bagaimana akselerator menyeimbangkan aritmetika dengan pergerakan data.

Prefill dan Decode Menuntut Kebutuhan Berbeda pada Perangkat Keras

Posting tersebut mendefinisikan intensitas aritmetika sebagai jumlah operasi floating-point dibagi dengan jumlah byte yang dipindahkan antara memori dan unit komputasi akselerator. Dalam salah satu contohnya, penjumlahan dua matriks melakukan 1 FLOP untuk setiap 6 byte yang dipindahkan, menghasilkan intensitas aritmetika sebesar 0,167 FLOP per byte, dan rasio tersebut tetap konstan seiring pertumbuhan matriks. Perkalian matriks berperilaku berbeda: setiap nilai output dibangun dari seluruh baris satu input dan seluruh kolom input lainnya, sehingga nilai yang dimuat berkontribusi pada lebih banyak output dan intensitas aritmetika meningkat seiring ukuran input.

Inferensi, jelas posting tersebut, adalah rangkaian perkalian matriks semacam itu antara bobot tetap model dan token masukan, dan dijalankan dalam dua fase dengan profil intensitas yang berbeda. Selama prefill, seluruh prompt diproses secara paralel sebagai operasi matriks besar, dan prompt dunia nyata dapat berisi ribuan bahkan ratusan ribu token. Selama decode, token dihasilkan satu per satu, dan model mengandalkan KV cache, yang menyimpan kunci dan nilai yang dihitung untuk token sebelumnya sehingga dapat digunakan kembali alih-alih dihitung ulang.

Kedua fase tetap harus memindahkan semua bobot model, yang dapat mencapai ratusan gigabyte atau terabyte, ke unit komputasi untuk setiap token yang dihasilkan. Posting tersebut menunjukkan pergerakan memori tetap hampir konstan sementara intensitas aritmetika menurun setelah prefill, dan menyebutkan kesenjangan itu sebagai alasan mengapa menambah kapasitas komputasi mentah tidak selalu membuat token tiba lebih cepat selama decode.

Disagregasi Membagi Inferensi Menjadi Kolam Terpisah

Dalam produksi, sebuah server inferensi biasanya menangani banyak permintaan secara bersamaan, dan ketika prefill dan decode berjalan pada perangkat keras yang sama, prefill yang intensif komputasi dapat memperlambat permintaan decode yang aktif. Penjadwal kemudian harus memilih antara memberikan token pertama pada permintaan baru dengan cepat, menjaga respons aktif mengalir lancar, dan memaksimalkan total throughput. Batching memungkinkan permintaan bersamaan berbagi pekerjaan membaca bobot model, tetapi batch yang lebih besar dapat membuat setiap langkah decode memakan waktu lebih lama, sehingga total throughput dapat meningkat sementara setiap pengguna menerima token lebih lambat.

Posting tersebut menggambarkan disagregasi sebagai pola desain sistem yang menjalankan dua fase dalam kolam perangkat keras terpisah. Setelah tahap-tahap dipisahkan, operator dapat mengalokasikan perangkat keras, mengatur kebijakan batching, dan memprioritaskan latensi atau throughput untuk setiap fase secara independen: sistem dengan target waktu-ke-token-pertama yang ketat dapat menyisihkan lebih banyak kapasitas untuk prefill, sementara sistem yang dibangun untuk streaming mulus dapat memberikan decode kolam yang lebih besar atau dijadwalkan lebih ketat. Kolam tersebut juga dapat diskalakan secara individual.

Pem​isahan memperkenalkan persyaratan baru. Setelah prefill membangun KV cache, status khusus permintaan tersebut harus dipindahkan ke kolam decode, di mana ia dimuat ke memori sebelum generasi dapat dilanjutkan, sementara bobot model sudah dimuat di kedua kolam. Posting tersebut mencatat bahwa serah terima menambah overhead jaringan dan koordinasi, bahwa salah satu kolam dapat menganggur jika kapasitas tidak sesuai dengan permintaan, dan bahwa latensi tambahan bergantung pada apakah cache dipindahkan antar mesin yang berlokasi bersama atau antar wilayah. Ia berargumen bahwa disagregasi paling menarik pada skala besar, di mana keuntungan dari penentuan ukuran dan penjadwalan kolam secara independen dapat melebihi biaya transfer dan operasional, serta bahwa hal ini mengubah antarmuka kontrol sistem layanan bukan sekadar memperhalus streaming.

Perangkat Keras Heterogen, Hasil Awal, dan Kemitraan

Cerebras mengatakan bahwa mereka memimpin pengembangan disagregasi heterogen, menggabungkan berbagai jenis chip dalam satu sistem inferensi dan menugaskan perangkat keras yang berbeda ke segmen yang terikat memori atau terikat komputasi. Posting tersebut membandingkan desain wafer-scale perusahaan, yang mendistribusikan SRAM bersamaan dengan komputasi di seluruh wafer, dengan GPU, yang menyiapkan data model dari memori berbandwidth tinggi melalui memori on-chip dan cache yang lebih kecil.

Diagram bandwidth memori puncak yang dipublikasikan dalam posting, bertanggal 10 September 2026, mencantumkan SRAM on-chip Cerebras WSE-3 sebesar 21.000 TB/s per wafer, bersama dengan akselerator SRAM on-chip yang tidak disebutkan sebesar 150 TB/s dan GPU HBM4 sebesar 23,3 dan 22 TB/s. Diagram tersebut memperingatkan bahwa angka SRAM menjumlahkan bandwidth memori lokal di seluruh prosesor sementara angka HBM mengukur lalu lintas dari memori off-chip, sehingga angka-angka tersebut menggambarkan tingkatan memori yang berbeda bukan kecepatan token yang diukur.

Postingan tersebut juga menampilkan data Artificial Analysis dari 10 September 2026 untuk GPT-oss-120B yang menjalankan penalaran tinggi dengan 10.000 token masukan. Data tersebut mencantumkan Cerebras sebesar 1.669 token keluaran per detik, SambaNova sebesar 708, Groq sebesar 475, Microsoft Azure sebesar 319, Nebius sebesar 294, dan Baseten sebesar 293.

Cerebras mengatakan bahwa dalam sistem teragregasi tradisional, meningkatkan kapasitas berarti menambah lebih banyak perangkat keras, dan dengan memanfaatkan akselerator mitra untuk menangani pemrosesan prompt, kapasitas meningkat 5 kali lipat dalam pengujian awal dengan jejak WSE yang sama. Perusahaan tersebut menyatakan telah mengumumkan kemitraan dengan berbagai mitra perangkat keras untuk menghadirkan token yang lebih ultra cepat ke pasar, dan diagram dalam postingan menunjukkan sistem GPU AWS Trainium dan AMD Helios Instinct di antara opsi perangkat keras prefill yang memberi makan pool dekode Cerebras.

Postingan tersebut mengidentifikasi aplikasi agen sebagai kecocokan menarik untuk disagregasi heterogen, karena biasanya melibatkan alur kerja panjang multi‑giliran di mana konteks berkembang di antara panggilan model dan penundaan pada setiap langkah terakumulasi. Cerebras mengatakan bahwa instalasi berikutnya akan membahas tumpukan perangkat keras dan perangkat lunak yang terlibat serta pertimbangan ekonomi dalam menerapkan inferensi terdisagregasi pada skala besar.

Theo Nash adalah seorang spesialis yang dihasilkan AI di Unite.AI, yang mencakup infrastruktur AI, komputasi, dan sistem perangkat keras yang mendukung kecerdasan buatan modern. Pekerjaannya berfokus pada fondasi teknis di balik beban kerja AI berskala besar, termasuk pusat data, akselerator, jaringan, dan tumpukan perangkat lunak yang menghubungkannya.

Dengan perspektif analitis dan berorientasi rekayasa, Theo meneliti bagaimana kemajuan pada GPU, silikon khusus, arsitektur memori, dan sistem terdistribusi memungkinkan generasi baru model AI. Ia memberi perhatian khusus pada kompromi kinerja, efisiensi energi, skalabilitas, serta kendala praktis yang membentuk penerapan infrastruktur AI di dunia nyata.

Artikel yang ditulis oleh Theo Nash dihasilkan AI dan ditinjau oleh tim editorial Unite.AI untuk memastikan akurasi teknis, kejelasan, dan liputan yang bertanggung jawab atas lanskap komputasi AI yang berkembang cepat.