Yapay zeka modelleri ve platformları
Cerebras, Dağınıklaştırmadan 5 Kat Çıkarım Verimliliği Artışı Bildirdi

Cerebras Systems, 1 Ekim 2026 tarihinde, aynı sayıda Cerebras sistemi ve token üretim hızlarında herhangi bir kayıp olmadan, dağınıklaştırma adı verilen bir teknik kullanarak erken sonuçlarda çıkarım verimliliğini 5 kat artırdığını söyledi. Açıklama, Temelden Dağınıklaştırılmış Çıkarım başlıklı, Isaac Tai ve Zhenwei Gao tarafından yazılan ve konuyla ilgili planlı bir seriyi başlatan şirket blog gönderisinde yer aldı.
Gönderi, seriyi dağınıklaştırma terimini duymuş ya da ön doldurmanın (prefill) hesaplama sınırlı, çözümlemenin (decode) ise bellek sınırlı olduğu iddiasını duymuş ve bu terimlerin ne anlama geldiğini merak eden okuyuculara yönelik çerçeveliyor. Açıklamayı temelden inşa ederek, hızlandırıcıların aritmetiği veri hareketiyle nasıl dengelediğiyle başlıyor.
Ön Doldurma ve Çözümleme Donanım Üzerinde Farklı Talepler Oluşturur
Gönderi, aritmetik yoğunluğu, bellek ile bir hızlandırıcının hesap birimleri arasında aktarılan bayt sayısına bölünen kayan nokta işlemi sayısı olarak tanımlıyor. Örneklerinden birinde, iki matrisin toplanması her 6 bayt veri hareketi başına 1 FLOP gerçekleştiriyor; bu, bayt başına 0,167 FLOP’luk bir aritmetik yoğunluk ve bu oran matrisler büyüdükçe sabit kalıyor. Matris çarpımı ise farklı davranır: her çıktı değeri bir girdinin tüm satırı ve diğerinin tüm sütunu kullanılarak oluşturulur, bu yüzden yüklenen değerler daha fazla çıktıya katkıda bulunur ve aritmetik yoğunluk giriş boyutu arttıkça artar.
Gönderinin açıkladığına göre, çıkarım, bir modelin sabit ağırlıkları ile giriş tokenları arasındaki bu tür matris çarpımlarının bir zinciridir ve farklı yoğunluk profilleriyle iki aşamada çalışır. Ön doldurma sırasında, tüm istem paralel olarak büyük bir matris işlemi şeklinde işlenir ve gerçek dünyadaki istemler binlerce hatta yüz binlerce token içerebilir. Çözümleme aşamasında ise tokenlar tek tek üretilir ve model, daha önceki tokenlar için hesaplanan anahtar ve değerleri saklayan KV önbelleğine dayanır; böylece bu değerler yeniden hesaplanmak yerine yeniden kullanılır.
Her iki aşama da üretilen her token için modelin tüm ağırlıklarını, potansiyel olarak yüzlerce gigabayt ya da terabayt seviyesinde, hesap birimlerine taşımak zorundadır. Gönderi, ön doldurmadan sonra aritmetik yoğunluğun düşerken bellek hareketinin neredeyse sabit kaldığını gösteriyor ve bu boşluğu, ham hesaplama kapasitesinin eklenmesinin çözümleme sırasında tokenların daha hızlı gelmesini garanti etmediği gerekçesi olarak sunuyor.
Dağınıklaştırma, Çıkarımı Ayrı Havuzlara Bölüyor
Üretimde, bir çıkarım sunucusu genellikle birçok isteği aynı anda yönetir ve ön doldurma ile çözümleme aynı donanımda çalıştığında, hesaplama yoğun ön doldurma aktif çözümleme isteklerini duraklatabilir. Zamanlayıcılar bu durumda yeni isteklerin ilk tokena hızlıca ulaşmasını sağlamak, aktif yanıtların sorunsuz akışını sürdürmek ve toplam verimliliği en üst düzeye çıkarmak arasında seçim yapmak zorundadır. Toplu işleme (batching), eşzamanlı isteklerin model ağırlıklarını okuma işini paylaşmasını sağlar, ancak daha büyük toplular her çözümleme adımının daha uzun sürmesine neden olabilir; bu yüzden toplam verimlilik artarken her kullanıcı tokenları daha yavaş alır.
Gönderi, dağınıklaştırmayı iki aşamayı ayrı donanım havuzlarında çalıştıran bir sistem tasarım deseni olarak tanımlıyor. Aşamalar ayrıldıktan sonra, operatörler donanımı tahsis edebilir, toplu işleme politikalarını belirleyebilir ve her aşama için gecikme ya da verimliliği bağımsız olarak önceliklendirebilir: ilk token süresi hedefleri katı olan bir sistem ön doldurma için daha fazla kapasite ayırabilirken, sorunsuz akışa odaklanan bir sistem çözümleme için daha büyük ya da daha sıkı zamanlanmış bir havuz sağlayabilir. Havuzlar ayrıca ayrı ayrı ölçeklendirilebilir.
Ayrım yeni bir gereklilik getirir. Ön doldurma KV önbelleğini oluşturduktan sonra, bu isteğe özgü durum çözümleme havuzuna aktarılmalı ve üretim devam etmeden önce belleğe yüklenmelidir; model ağırlıkları ise her iki havuzda da zaten yüklüdür. Gönderi, bu devrinin ağ ve koordinasyon maliyeti eklediğini, kapasite talebi karşılamazsa herhangi bir havuzun boşta kalabileceğini ve ek gecikmenin önbelleğin aynı konumda bulunan makineler arasında mı yoksa bölgeler arasında mı taşındığına bağlı olduğunu belirtiyor. Dağınıklaştırmanın ölçeklendirilmiş ortamlarda en çekici olduğunu, havuzların bağımsız olarak boyutlandırılması ve zamanlanmasından elde edilen kazançların aktarım ve işletme maliyetlerini aşabileceğini ve bunun yalnızca akışı yumuşatmak yerine hizmet sisteminin kontrol arayüzünü değiştirdiğini savunuyor.
Heterojen Donanım, Erken Sonuçlar ve Ortaklıklar
Cerebras, heterojen dağınıklaştırma geliştirmesinde öncü olduğunu, bir çıkarım sisteminde birden fazla çip türünü birleştirerek bellek sınırlı veya hesaplama sınırlı segmentlere farklı donanımlar atadığını söyledi. Gönderi, şirketin tüm wafer boyunca SRAM’i hesaplama ile birlikte dağıtan wafer‑ölçekli tasarımını, yüksek bant genişliğine sahip bellekten daha küçük çip‑içi bellekler ve önbellekler aracılığıyla model verilerini yönlendiren GPU’larla karşılaştırıyor.
Gönderide, 10 Eylül 2026 tarihli yayınlanan en yüksek bellek‑bant genişliği grafiği, Cerebras WSE‑3 çip‑içi SRAM’ini wafer başına 21.000 TB/s olarak listelerken, isimsiz bir çip‑içi SRAM hızlandırıcısını 150 TB/s ve HBM4 GPU’ları 23,3 ve 22 TB/s olarak gösteriyor. Grafik, SRAM değerlerinin bir işlemci üzerindeki yerel bellek bant genişliğini topladığını, HBM değerlerinin ise çip dışı bellek trafiğini ölçtüğünü belirterek, bu sayıların ölçülen token hızları yerine farklı bellek katmanlarını tanımladığını uyarıyor.
Gönderi ayrıca 10 Eylül 2026 tarihli Artificial Analysis verilerini, 10.000 giriş tokeniyle yüksek akıl yürütme çalıştıran GPT-oss-120B için yeniden üretir. Cerebras’ı saniyede 1.669 çıktı tokeni, SambaNova’yı 708, Groq’yu 475, Microsoft Azure’u 319, Nebius’u 294 ve Baseten’i 293 olarak listeler.
Cerebras, geleneksel bir toplu sistemde kapasite artırmanın daha fazla donanım dağıtmak anlamına geldiğini ve ortak hızlandırıcıları kullanarak istem işleme görevini üstlenmesiyle aynı WSE ayak izinde erken testlerde kapasiteyi 5 kat artırdığını söyledi. Şirket, piyasaya daha ultra hızlı tokenlar getirmek için birden fazla donanım ortağıyla ortaklıklar duyurduğunu ve gönderideki bir diyagramın, Cerebras decode havuzunu besleyen ön doldurma donanım seçenekleri arasında AWS Trainium ve AMD Helios Instinct GPU sistemlerini gösterdiğini belirtti.
Gönderi, ajan uygulamalarını heterojen ayrıştırma için çekici bir uyum olarak tanımlıyor, çünkü bunlar genellikle bağlamın model çağrıları boyunca büyüdüğü ve her adımda gecikmelerin biriktiği uzun, çok turlu iş akışlarını içeriyor. Cerebras, bir sonraki bölümlerin ilgili donanım ve yazılım yığınlarını ve ölçekli ayrık çıkarım uygulamanın ekonomik ödünleşimlerini kapsayacağını söyledi.












