Yapay zeka modelleri ve platformları
Cerebras, OpenAI’nın GPT-5.6 Sol Modelini Yeni Ultrafast Katmanında Saniyede 750 Token Hızında Çalıştırıyor

Cerebras (CBRS ) artık OpenAI’nın amiral gemisi modelini, hiçbir GPU bulutunun kamuoyuna duyurmadığı bir hızda çalıştırıyor. 13 Ağustos 2026’da, wafer‑scale çip üreticisi duyurdu ki, GPT‑5.6 Sol’u Ultrafast adlı yeni bir OpenAI hizmet katmanında çalıştırıyor ve saniyede 750 çıktı tokenine kadar sunuyor; OpenAI’nın hesabına göre model, Standart işleme göre 14× daha hızlı çalışıyor. Ultrafast, OpenAI API’sinde sınırlı bir ön izleme olarak seçkin bir müşteri grubuna ilk kez sunuluyor ve kapasite arttıkça erişim genişliyor.
Merkezdeki iddia belirli: hızdan ödün vermeden en gelişmiş zekâyı sunmak. GPT-5.6 Sol, OpenAI’nın en yetenekli modeli ve Cerebras çiplerinde, gece boyunca toplu işler çalıştırmak yerine gerçek zamanlı ürünlerde kullanılabilecek kadar hızlı token üretiyor. İki şirket de bu hizmet katmanını, kritik işler için yeterince akıllı bir model ile iş devam ederken kullanılabilecek kadar hızlı bir model arasında seçim yapma zorunluluğunu ortadan kaldıran bir çözüm olarak sunuyor.
Ultrafast’ın Arkasındaki Hız Sayıları
Saniyede 750 çıktı tokeni dikkat çekiyor, ancak Cerebras’ın yayımladığı doğrudan karşılaştırmalar daha açıklayıcı. Şirket, Artificial Analysis’in bildirdiği çıktı hızlarına göre Ultrafast üzerindeki GPT-5.6 Sol’un Claude Fable 5’ten 11 kat, Fast modundaki Opus 4.8’den ise beş kat hızlı olduğunu söylüyor.
Cerebras ayrıca bu katmanı, 2,500 soruluk ve doktora seviyesinde zorlukta tasarlanmış Humanity’s Last Exam benchmark’ında tam bir geçişten geçirdi. Ultrafast üzerindeki GPT-5.6 Sol, 2,500 sorunun tamamını 11 saat 11 dakikada yanıtladı; Claude Fable 5 ise karşılaştırılabilir sonuçlara ulaşmak için 78 saat 27 dakika gerekti: Cerebras’a göre neredeyse 7× daha yavaş. GDP-Val adlı, ekonomik açıdan değerli bilgi işine yönelik bir benchmark’ta şirket, Standart işleme kıyasla uçtan uca 5.6× bir hız artışı sağlandığını ve kalite kaybı olmadığını rapor ediyor.
Bu değerlendirmeleri tedarikçinin kendisi yaptı ve Cerebras bunu açıkça belirtiyor: Humanity’s Last Exam karşılaştırması 10 ve 13–15 Temmuz 2026’da Cerebras tarafından test edildi; GDP-Val rakamı ise şirketin 31 Temmuz 2026 tarihli kendi testinden geliyor. Bunları bağımsız sonuçlar olarak değil, şirketin kendi ölçümleri olarak değerlendirin.
Neden Wafer‑Scale Çip Gecikmede Kazanıyor
Buradaki mekanizma önemli; çünkü görece küçük bir çip üreticisinin, OpenAI’ın en büyük modelini yerleşik GPU üreticilerinin ulaşamadığı hızlarda nasıl çalıştırdığını açıklıyor. Büyük bir modelde hızlı çıkarım, temelde bir veri taşıma sorunudur: GPU’larda her yeni token üretilirken model ağırlıklarının çip üzerindeki bellek ile çip dışındaki depolama arasında tekrar tekrar taşınması gerekir ve bellek bant genişliği darboğaz hâline gelir.
Cerebras’ın yanıtı bu hareketi ortadan kaldırmaktır. Wafer‑Scale Engine’i, tek bir wafer‑boyutundaki çipe 44 GB SRAM yerleştirir; böylece model ağırlıkları çip içinde kalır ve tokenler, wafer’lar arasında kesintisiz bir şekilde katmanlar boyunca boru hattı gibi akışır. Ağırlıklar silikonun dışına hiç çıkmadığı için yaklaşım model boyutuyla ölçeklenir — bu da şirketin, hız avantajının sınır‑ötesi modeller büyüdükçe de geçerli olacağı argümanıdır. Çıkarım ekonomisinde bu, bütün oyunun özüdür: bir modeli sunmanın maliyeti ve gecikmesi, ağırlıkları ne kadar hızlı işleme besleyebildiğinize bağlıdır ve 44 GB’yi tek bir die’de tutmak bu sorunu doğrudan hedef alır.
10 Milyar Dolarlık Ortaklık Amiral Gemiyi Eriyor
Ultrafast, aylar süren bir ilişkinin şimdiye kadar en görünür ürünüdür. OpenAI, 2026’nın başlarında Cerebras’ı düşük gecikmeli hesaplama için 10 milyar dolarlık bir ortaklığa yönlendirmişti ve bu lansman, bu kapasiteyi şirketin en büyük modeli üzerine, daha küçük ya da özelleşmiş bir modelin üzerine değil, konumlandırıyor. OpenAI, Ultrafast’ı platformuna ultra‑düşük gecikmeli çıkarım getirmek için ortaklığın “bir sonraki adımı” olarak tanımlıyor.
Cerebras için bu konumlandırma önemlidir. Startup, wafer‑scale mimarisinin, pazarın ağırlık merkezinin GPU tedarikçileri yanında olduğu bir ortamda bile çıkarım için doğru yapı olduğunu uzun süredir savunuyor — bu, mevcut firmaların modelleri doğrudan silikonlarına yerleştirmeye yöneldiği bir rekabeti hızlandırıcı iş dünyasında ortaya çıkarıyor. OpenAI’nın amiral gemisi için hizmet katmanını kazanmak, Cerebras’a pazarın en üstünde bir üretim referans hesabı sağlar. Model, OpenAI’nın piyasaya sürdüğü GPT‑5.6 ailesinin (Sol amiral gemi, dengeli Terra ve maliyet‑verimli Luna ile birlikte) temelini oluşturur; böylece Ultrafast, Cerebras’ı bu serinin önüne konumlandırır.
Kimler Kullanacak ve Ne İçin
OpenAI, bu katmanı zaman duyarlı ve yüksek riskli işler için konumlandırıyor — bir kesinti hâlâ devam ederken olay müdahalesi, piyasa koşulları değişirken finansal araştırma, gerçek zamanlı müşteri desteği ve ses, ticaret ve bir zamanlar gece boyunca çalışan canlı araştırma döngüleri. Erken erişim, kodlama, ticaret ve finans alanlarında faaliyet gösteren şirketlere verildi; bunlar arasında Jane Street, Podium, Basis ve Rogo yer alıyor.
“Cerebras’ın getirdiği hız artışı etkileyici,” dedi Jane Street’te AI Assistants görevinde bulunan John Crepezzi, OpenAI’nın duyurusunda. “Bu, modelleri kullanmanın farklı yollarını mümkün kılıyor ve geliştiricilerin onlarla daha odaklı ve üretken bir şekilde çalışmasını pratik hâle getiriyor.”
OpenAI, dağıtımı kasıtlı olarak sınırlı tutuyor. Şirket, ön izleme sürecini, bir mertebe büyüklüğünde hız değişiminin en çok değeri nerede yarattığını öğrenmek için kullandığını ve kapasite arttıkça erişimi genişleteceğini belirtiyor. Hem OpenAI hem de Cerebras, ön izleme genişledikçe güncellemeler için kayıt alıyor.
Sonra Ne Olacak
Kısa vadede gözlemlenen şey kapasite, yetenek değil. Ultrafast sınırlı bir ön izleme ve her iki şirket de daha geniş bir kullanılabilirliği sabit bir tarihe değil, kapasite artışına bağlıyor — bu yüzden genişleme hızı izlenmesi gereken unsur. Uzun vadeli soru ise, Cerebras’ın çip‑içi bellek avantajının OpenAI modelleri ölçeklendikçe devam edip etmeyeceği; bu, wafer‑scale mimarisinin üzerine kurulduğu tam olarak bu bahis.
Orijinal makalenin kaynakları: unite.ai [1] · unite.ai [2] · openai.com [3]












