Yapay zeka modelleri ve platformları

Z.ai GLM-5.3’ü Frontier Kodlama ve Beklenenden Daha Hızlı Gelişen Siber Kapasite ile Lansman Yapıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Z.ai, 14 Ağustos 2026’da GLM-5.3’ü yayınladı, şirket bu güncellemenin GLM-5.2’nin aynı temel modelini koruduğunu ve her yetenek kazancının ölçeklendirilmiş post-eğitimden geldiğini söylüyor. Başlıca sonuçlar kodlamada, Z.ai modelin ölçeklendirilmiş post-eğitimden gelen yetenek kazancının tüm açık ağırlıklı sistemlerin en güçlüsü olduğunu söylüyor ve siber güvenlikte, şirketin yeteneklerin beklenenden daha hızlı büyüdüğünü söylüyor. Ağırlıklar henüz halka açık değil: Z.ai, güvenlik değerlendirmesi ve sertleştirme tamamlandıktan sonra yaklaşık iki hafta içinde onları yayınlayacağını söylüyor.

Şirketin duyurusuna göre, GLM-5.3 şu anda Z.ai’nin API’si ve GLM Kodlama Planı aracılığıyla kullanılabilir ve tüm mevcut kodlama planı abonelerine dağıtıldı.

Lansman, DeepSeek’in kendi bayrak gemisi V4 Pro‘yu ön izlemeden çıkardığı günlerden sonra geldi ve Z.ai’nin karşılaştırma tablosu GLM-5.3’ü doğrudan DeepSeek-V4 Pro, Moonshot’un Kimi K3 ve OpenAI’nin GPT-5.6 Sol’a karşı kodlama, siber ve ajans paketlerinde karşılaştırıyor.

Çalışma Ortamlarının Daha Büyük Bir Kümesinde Post-Eğitim

Z.ai’nin tarif ettiği gibi reçete, mimari değişikliği değil, çevre ölçeklendirilmesidir. GLM-5.2 eğitim yığınını (IndexShare adlı uzun bağlam tekniği, SAO adlı uzun süreli görevler için pekiştirme öğrenimi yöntemi ve büyük ölçekli asenkron RL için açık kaynaklı bir çerçeve olan slime) tanıttı ve şirket, GLM-5.3’ün bu yığın üzerine inşa edilen daha çeşitli görev ortamlarına daha fazla hesaplama harcamasından kaynaklandığını söylüyor.

Bu ortamlar, kodlama egzersizleri yerine profesyonel çalışma birimleri gibi tasarlandı. Şirketin verdiği bir örnekte, model bir ML altyapı mühendisinin çalışma ortamına yerleştirilir, hesaplama kümelerine, iç belgelere, kod tabanlarına ve deney sonuçlarına erişimi vardır ve tıkanıklıkları teşhis etmesi, optimizasyonları uygulaması ve ölçülebilir bir uçtan uca hız artışı sağlaması gerekir. Bazı görevler, Z.ai’nin dediği gibi, deneyimli bir mühendis için birkaç gün sürebilir. Ortamları yüksek hacimde üretmek için, Z.ai, görev kalıplarını çalıştırılabilir uzun süreli ortamlara dönüştüren araştırma ajanları, her görevin gerçekten çözülebileceğini doğrulayan bir yargıç ajansı ve réféans çözüme erişimi olmadan sentezlenen doğrulayıcılar içeren boru hatları oluşturdu. Ödül sinyali kendisi, görevlerin bir alt kümesi için makine tarafından üretilir, çözüm yolları ödül kısayollarını kapatmak için kullanılır. Z.ai, boru hatlarının hala anlamlı insan-müdahalesi gerektirdiğini belirtiyor.

Rapor edilen sonuçlar, bu reçeteyi tahmin edeceği şekilde takip ediyor: En büyük kazançlar en uzun süreli değerlendirmelerde oturuyor. Terminal-Bench 3.0’da GLM-5.3, 4.6’dan 28.3’e karşı GLM-5.2’ye karşı ilerler; DeepSWE v1.1’de, 46.2’den 66.9’a; Ajanların Son Sınavı’nın CLI varyantında, 23.8’den 28.5’e. Tüm rakamlar satıcı tarafından raporlanan, her bir test için kılıf, bağlam uzunluğu ve örnekleme ayarlarını kapsayan metodoloji dipnotlarıyla birlikte duyuruda yer alıyor.

Diğer modellerle karşılaştırıldığında, resim karışık. Z.ai’nin kendi Z.ai Code Bench’inde, şirket %50’lik bir cải thiện rapor ediyor ve modelin, benzer çabayla Claude Opus 4.8’i geçtiğini, daha az çıktı tokeni tüketerek (her görev için yaklaşık 50.000 çıktı tokeninde %31,4 ve 120.000’de %29,5) ve Anthropic’in Claude Fable 5’in gerisinde kalırken, maksimum çabayla %39,5’e ulaştığını söylüyor. Kamu paketlerinde, GLM-5.3, Terminal-Bench 3.0 ve DeepSWE gibi daha zorlu kodlama değerlendirmelerinde GPT-5.6 Sol ve Fable 5’ten geri kalıyor. Özel bir test olarak, şirket Z.ai Code Bench’in kamu test kümelerinden kaynaklanan kirlilik riskini azalttığını savunuyor.

Z.ai’nin Planlamadığını Söylediği Siber Sonuç

İkinci başlık, Z.ai’nin kendisinin beklenmedik olarak adlandırdığıdır. Şirket, post-eğitime zafiyet keşfi verileri ve ortamları tanıttı ve modelin bireysel zayıflıkları bulma ve hakkında akıl yürütme yeteneğinin artmasını bekliyordu. Bunun yerine, şirket diyor ki, yetenek beklenenden daha hızlı büyümeye devam etti ve model, izole edilmiş hata bulma yerine, birden fazla aşama boyunca sömürme zincirleri oluşturarak, eksiksiz sömürme zincirleri için tutarlı planlar oluşturdu.

Rapor edilen rakamlar bu iddiayı takip ediyor. CyberGym’de, modelin beyaz kutu kaynak kodundan zafiyetleri tanımlayabilme ve doğrulayabilme yeteneğini test eden CyberGym’de, GLM-5.3 %84,5 puan alıyor, bu GLM-5.2’nin %77,2’sinden ve karşılaştırma kümesindeki her modelden daha yüksek. ExploitBench’de, gerçek zafiyetlerin ve bunların sömürülmesinin daha derin akıl yürütmesini gerektiren ExploitBench’de, GLM-5.3, selefinin puanını ikiye katlıyor, %54,4’ten %24,4’e çıkıyor. ExploitGym’de, zaman normalize edilmiş bütçelerle tamamlanan sömürme görevlerini sayan ExploitGym’de, GLM-5.3, iki saat içinde 105 görevi ve altı saat içinde 130 görevi tamamlarken, GLM-5.2 yalnızca 29 ve 39 görevi tamamlamıştı. Z.ai’nin bu modelin açıklaması nettir: Sömürme zincirinin ne kadar yukarıda olursa, GLM-5.2’den kazanılan avantaj o kadar büyük ve kapalı sınır modellerine kalan açıklık o kadar geniştir, Mythos 5’in aynı bütçelerle 181 ve 247 ExploitGym görevini tamamladığı belirtiliyor.

Z.ai ayrıca, kontrol edilen testlerin ötesinde transferi test ettiğini bildiriyor. Çin’deki birkaç güvenlik ekibiyle birlikte çalışan şirket, GLM-5.2’den bu yana, 269 açık kaynaklı projede 2.436 zafiyet bulduğunu, bunların 1.097’sinin kritik veya yüksek şiddette olduğunu, sistem çekirdekleri, işletim sistemleri, tarayıcı motorları ve ağ protokollerini kapsadığını söylüyor. Birçoğu yıllarca fark edilmemişti; şirketin dediğine göre en eskisi 1981’de tanıtılmıştı.

Buluntular, her bir sorunu açıklama sürecini izleyen Z.ai Güvenlik Açıklama Defteri‘ne besleniyor: 53’ü kamuoyuna açıklanmış ve CVE atanmış, 2.383’ü masih ambargo altında. Recent girişler arasında, Linux çekirdeğinde bir use-after-free, Apple Safari’yi etkileyen bir WebKit bellek işleme hatası ve bir parametre doğrulama hatası bulunan FreeBSD yer alıyor.

API için, GLM-5.3 üç düşünme çabası seviyesini (düşük, yüksek ve maksimum) destekler ve artık düşünmeyi devre dışı bırakmayı разрешmez, bu, daha önce düşünmeyi devre dışı bırakan uygulamalar için bir kıran değişikliktir.

Açık Ağırlık Sürümünün Bıraktığı Açık

Duyurunun ağırlık yayınlanmasından iki hafta arasındaki boşluk, bu lansmanda bir iş yapıyor. Z.ai, gecikmeyi açıkça güvenlik değerlendirmesi ve sertleştirmeye bağlıyor ve sertleştirilen şey, şirketin kendisinin beklenenden daha hızlı gelişen saldırı güvenlik yeteneğine sahip olduğunu söylediği bir model. Z.ai, ağırlıkların, iki haftalık güvenlik değerlendirmesi ve sertleştirme döneminin ardından herkes tarafından indirilebileceğini söylüyor.

Siber sonuçlar, sınır laboratuvarlarının altyapılara neler yapabileceğini kamuoyuna gösterdiği bir haftada geliyor: OpenAI,recent olarak kendi test modellerinin Hugging Face’i bir kırmızı takım egzersizinde ihlal ettiğini açıkladı. Z.ai’nin açıklama defteri, bu yeteneğin yapıcı karşıtıdır: Aynı yetenek hem on yıllarca eski hataları yüzeye çıkarır hem de zincirleri oluşturur, ve 1.097 kritik ve yüksek şiddette bulgu, koordine edilmiş açıklama yoluyla ilerliyor.

Bağımsız değerlendiricilerin GLM-5.3’ün rakamlarını tekrarlayıp tekrarlayamayacağı (özellikle Z.ai’nin kendi kılıf yapılandırmalarında çalıştırdığı in-house Code Bench sonuçları ve siber puanlar) bu lansmanın açık ağırlıklı kodlama modelleri için gerçek bir adım olup olmadığını ve ne kadarının değerlendirme seçimi olduğunu belirleyecektir. Ağırlık yayınlanması, Ağustos 2026’nın sonunda bekleniyor ve bu test o zaman başlayacak.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.