Yapay zeka modelleri ve platformları
Z.ai, 100.000 Çin Çipinde GLM-5.3-Flash Çıkarımını Detaylandırıyor

Z.ai, 17 Eylül 2026 tarihinde, teknik rapor yayınlayarak, GLM-5.3-Flash modeli için sıfırdan, 100.000’den fazla Çin yapımı AI hızlandırıcıdan oluşan bir küme üzerinde tam üretim kalitesinde bir çıkarım hizmeti nasıl inşa ettiğini açıkladı. Şirkete göre, çalışmanın büyük bir kısmı altyapı mühendisleri yerine GLM-5.3 tarafından desteklenen bir Infra Agent tarafından yürütüldü ve GLM-5.3-Flash için tüm üretim çıkarımları sistemde çalışıyor.
Z.ai, daha önce hiç kimsenin bu ölçeklerde Çin yapımı hızlandırıcı kümesi çalıştırmadığını belirtti. Şirket, çip üzerindeki bellek kapasitesi ve bant genişliğinin nispeten sınırlı olmasını, yeni bir model mimarisini, 1M tokenlık bağlam penceresini ve çok modlu istekleri, ayrıca çekirdek desteğinin eksik olduğu ve mühendislerin belgelenmesi gereken davranışları tahmin etmek zorunda kaldığı olgunlaşmamış bir ekosistemi gerekçe gösterdi.
GLM-5.3-Flash, Ağustos 26, 2026’da başlatıldı, GLM-5 serisindeki ilk yerel çok modlu model olarak, seyrek ve lineer dikkat kombinasyonunu birleştiren hibrit bir mimari altında toplam 320 milyar parametre ve 18 milyar aktif parametreye sahiptir. Yayınlanmadan önce, Z.ai modeli OpenCode ve OpenRouter üzerinde anonim olarak ox-alpha adıyla test etti ve şirket, lansmandan bir hafta içinde her iki platformda da en çok kullanılan model haline geldiğini, altı gün içinde 62 trilyondan fazla token işlediğini belirtti.
Yoğun Geri Bildirim Yöntemi
Hikayenin merkezinde bir sistem sorunu bulunuyor: uçtan uca metrikler bir ajana sonuçların kötüleştiğini söyleyebilir, ancak nedenini açıklamaz. Başarısız bir sayısal doğruluk testi, ilk token süresinde %30 artış ya da çıktı verimliliğinde %20 düşüş, hangi katmanın sorumlu olduğunu ya da bir sonraki testin ne olması gerektiğini göstermez. Z.ai’nin yanıtı, yoğun geri bildirim olarak adlandırdığı yöntem, doğruluk testlerini, çalışma zamanı günlüklerini, yürütme izlerini, çalışma zamanı olaylarını, mikro ölçümlemeleri ve uçtan uca metrikleri tekrarlanabilir iş akışlarına entegre eder; bu sayede ajan, her hipotezi yerel olarak doğrulayabilir ve her değişiklikten sonra tam bir dağıtım ve yük testi beklemek zorunda kalmaz.
Şirket, bu tür geri bildirim için üç zorunlu özelliği tanımlıyor. Geri bildirim yerel olmalı ve mümkün olduğunca belirli başlatma parametreleri, kod değişiklikleri, çekirdekler, giriş koşulları, iş parçacıkları, yürütme aralıkları veya kod yollarına bağlanmalıdır. Ucuz ve zamanında elde edilebilmelidir. Ayrıca, gözlemlenen korelasyonların tek başına bir kök nedeni kanıtlamadığı için, referans uygulamalar ve kontrollü deneyler aracılığıyla nesnel doğrulamayı desteklemelidir.
Hikayenin tanımladığı başlatma döngüsünde, mühendisler hedefleri ve sistem sınırlarını belirleyip sayısal semantik, eşzamanlılık davranışı ve üretim riskiyle ilgili kritik değişiklikleri gözden geçirdi, ajanın ise analiz, hipotezler ve kod değişikliklerini yönettiği anlatılıyor. Ortak olarak optimize ettikleri yığın, lineer dikkat ve LM Head için düğüm içi tensör paralelliğini, ReplaySSM, W8A8 kantizasyonunu, karışık hassasiyetli INT8/FP8/BF16 önbellek kantizasyonunu ve Katman Bölümlemesini, Encode-Prefill-Decode ayrık mimarisi altında birleştirdi.
Üç Mühendislik Vakası
İlk vaka sayısal doğrulukla ilgilidir. Bölünmüş ve bölünmemiş çekirdek yürütme yollarının karşılaştırılmasıyla KDA çekirdeğinin Bağlam Paralelliği yolunda bir doğruluk sorunu ortaya çıktı: tl.dot işlemi, girdileri FP32 olsa bile varsayılan olarak TF32 hesaplamasını kullanıyordu, bu da durum birleştirme sırasında hataların birikmesine ve bağlam uzunluğu arttıkça sorunun büyümesine neden oldu. Düzeltme, giriş hassasiyetini tf32x3 olarak açıkça ayarladı; bu, daha yüksek hassasiyetli bir sonuç elde etmek için üç TF32 Tensor Core işlemi kullanır.
Hikayeye göre, düzeltmeler Flash Linear Attention’a yukarı akışta birleştirildi. çekme isteği, 27 Ağustos 2026’da açılıp birleştirildi, tf32x3 affine zincirini durum güncelleme ve dönüşüm birleştirme çekirdeklerinde isteğe bağlı bir doğruluk yolu olarak uygular, Bağlam Paralelliği testlerini ekler ve tf32 desteği olmayan platformlarda (AMD, NPU’lar ve hesaplama yeteneği 8.0’ın altında NVIDIA GPU’lar) açıkça ieee hassasiyetine geri döner.
İkinci vaka KV Transfer eşzamanlılık darboğazıyla ilgilidir. Hikayeye göre, mühendisler aynı iş yükü altında Prefill ile KV Transfer’in, yalnızca Prefill temeline göre %5 içinde çalışması gerektiği bir kabul kriteri belirledi. Ajans, bazı senaryolarda %20’yi aşan boşluklar buldu ve bunları DeepEP v1.2.1’e bağladı; bu sürümde ne intranodedispatch ya da intranodecombine çağrısı Python GIL’ini açıkça serbest bırakmıyordu. Bu çağrılar kilidi tuttuğu sürece, aynı süreçteki Mooncake Transfer Python iş parçacığı zamanında GIL’i elde edemedi, bu da aktarım görevlerinin zamanlamasını ve gönderimini geciktirdi ve hesaplama ile örtüşmesi azaldı. Hikaye, aynı sürümdeki internode_dispatch’in zaten GIL’i serbest bıraktığını, kod yorumunda amacın CPU beklerken diğer iş parçacıklarındaki KV Transfer’i engellememek olduğunu belirtiyor. İlgili C++ yürütme aralıklarında düzeltme GIL’i serbest bıraktıktan sonra, aynı test koşulları altında boşluğun %1’in altına düştüğünü rapor ediyor.
Üçüncü durum çekirdek performansını ilgilendiriyor. Z.ai, ajanın SGLang, Flash Linear Attention ve DeepGEMM gibi projelerde el yazısı çekirdeklerinden teknikleri, uygulanabilirlik koşulları, dönüşüm yöntemleri, kaynak kısıtlamaları ve doğrulama kanıtları içeren yeniden kullanılabilir optimizasyon iskeletlerine dönüştürdüğünü belirtti. Temsilci bir KDA Decode çekirdeğinde, şirket, ajanın bölüm optimizasyonunun yürütme süresini %9,6 azalttığını rapor etti. Geri bildirim, hesaplamayı birincil darboğaz olarak tanımladıktan sonra, ajan çekirdeğin V‑boyutlu döşemelerini birleştirdi; bu döşemeler aynı FP32 normalizasyon ve geçit hesaplamalarını dört kez tekrarlıyordu ve bunları kayıt‑rezident ara sonuçlarla ve tek bir warp‑seviyesi indirgeme ile tek bir iş parçacığı bloğuna dönüştürdü; şirketin raporuna göre bu, önceki sürüme göre 1,71× hız artışı sağladı.
Belirtilen Sonuçlar ve Özyinelemeli Kendini Geliştirme
Z.ai, GLM-5.3-Flash’ın ilk model uyarlamasından üretim hazır hale gelmesine iki haftadan daha kısa bir sürede ulaştığını ve uçtan uca verimliliğin başlangıçtaki temel seviyeye göre nihai olarak üç katına çıktığını rapor ediyor. Şirket ayrıca donanım kullanım verimliliği ve token başına maliyetin, ana akım NVIDIA GPU’larıyla karşılaştırılabilir seviyelere ulaştığını belirtti.
Şirket, bu çabayı, modelin çalıştığı çıkarım sistemini optimize etmede yer alması nedeniyle özyinelemeli kendini geliştirmeye erken bir örnek olarak çerçeveliyor. Aynı zamanda Z.ai, henüz özyinelemeli kendini geliştirmeye ulaşmadığını ve hedeflerin seçilmesi, sınırların belirlenmesi ve riskin değerlendirilmesinin hâlâ insanlar tarafından üstlenilmesi gereken sorumluluklar olduğunu, bu sorumlulukların insanlarda kalması gerektiğine inandığını ifade ediyor.












