Yapay zeka modelleri ve platformları

Cerebras, OpenAI’nin GPT-5.6 Sol Modelini 750 Token/Saniye Hızında Çalıştırıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Cerebras, şimdiye kadar hiçbir GPU bulutunun kamuoyu önünde eşleştiremediği bir hızda OpenAI’nin amiral gemisi modelini çalıştırıyor. 13 Ağustos 2026’da, wafer-ölçekli çip üreticisi duyurdu ki OpenAI’nin GPT-5.6 Sol modelini yeni bir OpenAI hizmeti olan Ultrafast’te çalıştırıyor ve bu, 750 çıktı tokeni/saniye hızı ve OpenAI’nin hesabına göre Standard işlemeden 14 kata kadar daha hızlı çalışıyor. Ultrafast, OpenAI API’sinde sınırlı bir ön izleme olarak seçili bir müşteri grubuna sunuluyor ve kapasite arttıkça erişimi genişletiliyor.

Merkezdeki iddia, bir hız cezası olmadan sınır inteligansıdır. GPT-5.6 Sol, OpenAI’nin en yetenekli modeli ve Cerebras silikonunda tokenleri gerçek zamanlı ürünlerin içine koyacak kadar hızlı üretiyor, bu da gecelik toplu işlerin arkasında değil. Her iki şirket de bu tier’ı, yüksek riskli işler için yeterli zeka ve yeterli hız arasında bir ticaret yapılmasına gerek kalmadan sunuyor.

Ultrafast’in Hız Sayıları

750 çıktı tokeni/saniye rakamı başlıktır, ancak Cerebras tarafından yayınlanan baş-a-baş çalıştırma karşılaştırmaları daha önemli. Yapay Zeka Analizi tarafından bildirilen çıktı hızlarına karşı, şirket GPT-5.6 Sol’un Ultrafast’te 11 kata kadar Claude Fable 5’ten ve 5 kata kadar Opus 4.8’in Fast modundan daha hızlı çalıştığını söylüyor.

Cerebras, ayrıca Humanity’s Last Exam adlı 2.500 soruluk bir benchmark’ı tamamladı, bu benchmark PhD seviyesindeki zorluğu hedefliyor. GPT-5.6 Sol, Ultrafast’te 11 saat ve 11 dakika içinde 2.500 soruyu yanıtladı; Claude Fable 5, benzer sonuçlara ulaşmak için 78 saat ve 27 dakika benötirdi – Cerebras’ın hesabına göre yaklaşık 7 kata kadar daha yavaş. GDP-Val’de, ekonomik olarak değerli bilgi işleri için bir benchmark’ta, şirket Standard işlemedenQUALITY bozulmadan 5.6 kata kadar bir hız artışı bildiriyor.

Bu değerlendirmeler, Cerebras tarafından yürütülen değerlendirmeler ve şirket bu konuda açık. Humanity’s Last Exam karşılaştırması, 10 ve 13-15 Temmuz 2026’da Cerebras tarafından benchmark edildi ve GDP-Val rakamı, 31 Temmuz 2026’da kendi testlerinden geliyor. Bunları şirketin kendi ölçümleri olarak ele alın, bağımsız sonuçlar olarak değil.

Wafer-Ölçekli Çipin Gecikme Zamanında Neden Kazandığı

Mekanizma burada önemli, çünkü neden bir göreceli olarak küçük çip üreticisinin OpenAI’nin en büyük modelini, GPU devlerinin eşleştiremediği hızlarda çalıştırdığını açıklıyor. Büyük bir modelde hızlı çıkarım, temelde bir veri-hareketi problemidir: GPU’lar üzerinde model ağırlıkları, her bir sonraki tokeni üretmek için tekrarlı olarak çip-içi hafızadan ve dış depolamadan taşınmalıdır ve bu, bant genişliği ile sınırlıdır.

Cerebras’ın cevabı, bu hareketi ortadan kaldırmaktır. Wafer-Ölçekli Motoru, tek bir wafer-büyüklüğünde çipe 44 GB’lık SRAM’ı paketliyor, bu da model ağırlıklarının çip üzerinde kalmasını ve tokenlerin kesintisiz olarak katmanlar boyunca akmasını sağlıyor. Ağırlıklar hiçbir zaman silikondan ayrılmadığı için, bu yaklaşım model büyüklüğü ile ölçekleniyor – bu, şirketin hız avantajının, sınır modelleri büyüdükçe korunacağı iddiasıdır. Çıkarım ekonomisi için, bu tüm oyun budur: bir modeli sunmanın maliyeti ve gecikmesi, ağırlıkları hesaplama birimlerine ne kadar hızlı besleyebileceğinize bağlıdır ve 44 GB’ı tek bir yonga üzerinde tutmak bunu doğrudan hedef alır.

10 Milyar Dolarlık Ortaklık Amiral Gemisine Ulaşıyor

Ultrafast, aylar içinde oluşan bir ilişkinin en görünür ürünü. OpenAI, Cerebras’ı 10 milyar dolarlık düşük gecikme zamanı hesaplama için seçti ve bu lansman, bu kapasiteyi şirketin en büyük modeline değil, daha küçük veya uzmanlaşmış bir modeline koyuyor. OpenAI, Ultrafast’i platformuna ultra-düşük gecikme zamanı çıkarmaya yönelik ortaklığın bir sonraki adımı olarak tanımlıyor.

Cerebras için, bu yerleştirme önemli. Startup, uzun süredir wafer-ölçekli mimarisinin çıkarım için doğru şekil olduğunu savunuyor, bu da pazarın merkezindeki yerin GPU tedarikçileri ile birlikte bir yarışma olarak devam ediyor. OpenAI’nin amiral gemisi modelinin sunucu katmanını elde etmek, Cerebras’a pazarın en üstünde bir üretim referans hesabını veriyor. Model itself, OpenAI’nin GPT-5.6 ailesini başlattığı (Sol olarak amiral gemisi, Terra ve Luna ile birlikte) Ultrafast’i bu hatanın önüne koyuyor.

Kim Alıyor ve Ne İçin

OpenAI, bu tier’ı zaman duyarlı, yüksek riskli işler için konumlandırıyor: bir kesinti devam ederken olay yanıtı, finansal araştırma mientras pazar koşulları değişirken, gerçek zamanlı müşteri desteği ve ses, ticaret ve canlı araştırma döngüleri. Erken erişim, kodlama, ticaret ve finans gibi şirketlere verildi, bunlar arasında Jane Street, Podium, Basis ve Rogo bulunmakta.

> “Cerebras tarafından getirilen hız artışı etkileyici,” dedi John Crepezzi, Jane Street’teki AI Asistanları, OpenAI’nin duyurusunda. “Bu, modelleri farklı şekillerde kullanmayı mümkün kılıyor ve geliştiricilerin onlarla birlikte daha odaklanmış ve üretken bir şekilde çalışmasını sağlıyor.”

OpenAI, rollout’u kasıtlı olarak dar tutuyor. Şirket, bir büyüklük sırası hız değişiminin en fazla değer yarattığı yerleri öğrenmek için ön izleme dönemini kullanıyor ve kapasite arttıkça erişimi genişletecek. Hem OpenAI hem de Cerebras, ön izlemenin genişletilmesi ile ilgili güncellemeler için kayıt yaptırıyor.

Sonraki Neyin Olacağı

Yakın zamanda gözlemlenebilir şey, kapasite, yetenek değil. Ultrafast, sınırlı bir ön izleme ve her iki şirket de daha geniş bir erişimi, bir tarih yerine kapasite büyümesine bağlıyor – bu nedenle genişleme hızı izlenmesi gereken şey. Daha uzun vadeli soru, Cerebras’ın çip-içi-hafıza avantajının, OpenAI’nin modelleri büyüdükçe korunup korunamayacağı, ki bu da wafer-ölçekli mimarinin üzerine kurulduğu bahis.

Theo Nash yapay zeka altyapısı, hesaplamalar ve modern yapay zekayı güçlendirerek donanımsal sistemler konusunda uzmanlaşmış bir yapay zeka üreten uzman olarak Unite.AI'de çalışmaktadır. Çalışmaları, büyük ölçekli yapay zeka iş yüklerinin arkasındaki teknik temellere odaklanmaktadır, bunlar veri merkezleri, hızlandırıcılar, ağlar ve bunları birleştiren yazılım yığınlarını içermektedir.
Analitik ve mühendislik odaklı bir perspektifle, Theo, GPU'lar, özel silikon, bellek mimarileri ve dağıtılmış sistemlerdeki gelişmelerin yeni nesil yapay zeka modellerini nasıl mümkün kıldığını inceliyor. Performans ticaretinin, enerji verimliliğinin, ölçeklenebilirliğin ve yapay zeka altyapısının gerçek dünya dağıtımını şekillendiren pratik kısıtlara özel dikkat gösteriyor.
Theo Nash tarafından yazılan makaleler, teknik doğruluk, açıklık ve hızla gelişen yapay zeka hesaplaması manzarasının sorumlu bir şekilde kapsülendiğinden emin olmak için Unite.AI'nin editör ekibi tarafından incelenerek oluşturulmaktadır.