एआई मॉडल और प्लेटफ़ॉर्म

Z.ai ने GLM-5.3 लॉन्च किया है जिसमें फ्रंटियर कोडिंग और साइबर क्षमता है जो इसके प्रशिक्षण से अधिक हो गई है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Z.ai ने 14 अगस्त, 2026 को GLM-5.3 जारी किया, जो एक अपडेट है जिसे कंपनी कहती है कि GLM-5.2 के समान बेस मॉडल को बनाए रखता है और स्केल-अप पोस्ट-ट्रेनिंग से हर क्षमता लाभ प्राप्त करता है। मुख्य परिणाम कोडिंग में हैं, जहां Z.ai रिपोर्ट करता है कि मॉडल सबसे मजबूत ओपन-वेट्स सिस्टम है जिसे उसने मापा है, और साइबर सुरक्षा में, जहां कंपनी कहती है कि क्षमता अप्रत्याशित रूप से तेजी से बढ़ी है क्योंकि प्रशिक्षण का दायरा बढ़ा है। वजन अभी तक सार्वजनिक नहीं हैं: Z.ai कहता है कि यह उन्हें लगभग दो सप्ताह में जारी करेगा, सुरक्षा मूल्यांकन और कठोरता पूरी होने के बाद।

कंपनी की घोषणा के अनुसार, GLM-5.3 अब Z.ai के API और इसके GLM कोडिंग प्लान के माध्यम से उपलब्ध है, और सभी मौजूदा कोडिंग प्लान ग्राहकों के लिए रोल आउट किया गया है।

यह रिलीज़ DeepSeek द्वारा अपने फ्लैगशिप V4 Pro को पूर्वावलोकन से बाहर करने के कुछ दिनों बाद आता है, और Z.ai की तुलना तालिका GLM-5.3 को सीधे DeepSeek-V4 Pro, Moonshot के Kimi K3, और OpenAI के GPT-5.6 Sol के खिलाफ कोडिंग, साइबर, और एजेंटिक सूट में रखती है।

एक बड़े काम के वातावरण सेट पर पोस्ट-ट्रेनिंग

नुस्खा, जैसा कि Z.ai इसका वर्णन करता है, वास्तुकला परिवर्तन के बजाय वातावरण स्केलिंग है। GLM-5.2 ने प्रशिक्षण स्टैक (एक लंबे संदर्भ तकनीक को IndexShare, एक पुनरावृत्ति सीखने की विधि को SAO, और slime, एक ओपन-सोर्स फ्रेमवर्क को बड़े पैमाने पर असिंक्रोनस आरएल) पेश किया और कंपनी कहती है कि GLM-5.3 उस स्टैक पर और अधिक विविध कार्य वातावरण बनाने पर अधिक कंप्यूटे खर्च करने से आया है।

वे वातावरण पेशेवर काम की इकाइयों की तरह बनाए गए हैं, न कि कोडिंग अभ्यास की। एक उदाहरण में, कंपनी एक मॉडल को एक एमएल इंफ्रास्ट्रक्चर इंजीनियर के काम के वातावरण में रखती है, जिसमें कंप्यूट क्लस्टर, आंतरिक दस्तावेज़, कोडबेस, और प्रयोग परिणामों तक पहुंच है, और उसे बोतलनेक का निदान करना, अनुकूलन लागू करना, और एक मापनीय अंत-से-अंत तेजी प्रदान करना है। कुछ कार्य, Z.ai कहता है, कई दिनों के काम का प्रतिनिधित्व करते हैं एक अनुभवी इंजीनियर के लिए। बड़े पैमाने पर वातावरण बनाने के लिए, Z.ai ने पाइपलाइनें बनाईं जिनमें अनुसंधान एजेंट वास्तविक काम से कार्य पैटर्न को दौड़ने योग्य लंबी दूरी के वातावरण में परिवर्तित करते हैं, एक न्यायाधीश एजेंट प्रत्येक कार्य की जांच करता है कि यह वास्तव में हल किया जा सकता है, और सत्यापनकर्ता संदर्भ समाधान तक पहुंच के बिना संश्लेषित किए जाते हैं। पुरस्कार संकेत खुद एक कार्य के उपसेट के लिए मशीन-जनित है, समाधान траजेक्टरी का उपयोग पुरस्कार शॉर्टकट बंद करने के लिए किया जाता है। Z.ai नोट करता है कि पाइपलाइनें अभी भी महत्वपूर्ण मानव-इन-द-लूप कार्य की आवश्यकता है।

रिपोर्ट किए गए परिणाम उस नुस्खे की भविष्यवाणी की पैटर्न का पालन करते हैं: सबसे बड़े लाभ सबसे लंबी दूरी के मूल्यांकन पर बैठते हैं। टर्मिनल-बेंच 3.0 पर, GLM-5.3 4.6 से 28.3 तक जाता है GLM-5.2 के खिलाफ; डीपएसडब्ल्यूई वी1.1 पर, 46.2 से 66.9 तक; एजेंट्स लास्ट एग्जाम के सीएलआई वेरिएंट पर, 23.8 से 28.5 तक। सभी आंकड़े विक्रेता-रिपोर्ट किए गए हैं, प्रत्येक बेंचमार्क के लिए हार्नेस, संदर्भ लंबाई, और नमूना सेटिंग्स को कवर करने वाले पदचिह्न विधि में शामिल हैं।

अन्य मॉडलों के खिलाफ, तस्वीर मिश्रित है। Z.ai के इनहाउस कोड बेंच पर, कंपनी 50% सुधार की रिपोर्ट करती है और कहती है कि मॉडल क्लॉड ओपस 4.8 को समान प्रयास पर पीछे छोड़ता है, जबकि कम आउटपुट टोकन (31.4% लगभग 50,000 आउटपुट टोकन प्रति कार्य के खिलाफ 29.5% 120,000) की खपत करता है, जबकि एंथ्रोपिक के क्लॉड फेबल 5 के पीछे रहता है, जो अधिकतम प्रयास पर 39.5% तक पहुंचता है। सार्वजनिक सूट पर, GLM-5.3 जीपीटी-5.6 सोल और फेबल 5 के पीछे कई कठिन कोडिंग मूल्यांकन पर, जिनमें टर्मिनल-बेंच 3.0 और डीपएसडब्ल्यूई शामिल हैं। एक निजी बेंचमार्क के रूप में, कंपनी तर्क देती है कि Z.ai कोड बेंच सार्वजनिक परीक्षण सेट से संदूषण जोखिम को कम करता है।

साइबर परिणाम जो Z.ai कहता है कि उसने योजना नहीं बनाई थी

दूसरा हेडलाइन वह है जिसे Z.ai खुद अप्रत्याशित के रूप में झंडा देता है। कंपनी ने दुर्वलता खोज डेटा और वातावरण पोस्ट-ट्रेनिंग में पेश किया, उम्मीद करते हुए कि मॉडल व्यक्तिगत दोषों को खोजने और तर्क करने में बेहतर हो जाएगा। इसके बजाय, यह कहता है, क्षमता प्रशिक्षण के दायरे के रूप में जारी रही, और मॉडल ने एकल बग-खोज से आगे बढ़कर शोषण के पूरे श्रृंखला के लिए सुसंगत योजनाएं बनाना शुरू कर दिया।

रिपोर्ट किए गए संख्या उस दावे को ट्रैक करते हैं। साइबरजिम पर, जो यह परीक्षण करता है कि क्या एक मॉडल व्हाइट-बॉक्स सोर्स कोड से दुर्वलता की पहचान और मान्य कर सकता है, GLM-5.3 84.5% स्कोर करता है, GLM-5.2 के 77.2% से ऊपर, और Z.ai की तुलना सेट में हर मॉडल से आगे। एक्सप्लोइटबेंच पर, जो वास्तविक दुर्वलता और उनके शोषण के बारे में गहरी तर्क की मांग करता है, यह अपने पूर्ववर्ती को दोगुना से अधिक करता है, 54.4% से 24.4%। एक्सप्लोइटजिम पर, जो समय-सामान्य बजट के तहत पूरे किए गए शोषण कार्यों की गिनती करता है, यह दो घंटे के भीतर 105 कार्य और छह घंटे के भीतर 130 कार्य पूरे करता है, GLM-5.2 के 29 और 39 के मुकाबले। Z.ai का सारांश इस पैटर्न का सीधा है: शोषण श्रृंखला में एक बेंचमार्क जितना ऊपर बैठता है, GLM-5.2 से लाभ उतना ही बड़ा है, और बंद फ्रंटियर मॉडल के लिए शेष अंतर उतना ही चौड़ा है, मिथोस 5 181 और 247 एक्सप्लोइटजिम कार्यों को同 बजट पर पूरा करता है।

Z.ai यह भी रिपोर्ट करता है कि यह नियंत्रित बेंचमार्क से परे स्थानांतरण का परीक्षण कर रहा है। चीन में कई सुरक्षा टीमों के साथ काम करते हुए, कंपनी कहती है कि उसके मॉडल ने GLM-5.2 के बाद से 269 ओपन-सोर्स परियोजनाओं में 2,436 दुर्वलता की पहचान की है, जिनमें 1,097 को महत्वपूर्ण या उच्च तीव्रता वाला दर्जा दिया गया है, जो सिस्टम कERNEL, ऑपरेटिंग सिस्टम, ब्राउज़र इंजन, और नेटवर्क प्रोटोकॉल को शामिल करते हैं। कई वर्षों से अनदेखी की गई थीं; कंपनी के अनुसार, सबसे पुरानी 1981 में पेश की गई थी।

परिणाम एक सार्वजनिक Z.ai सुरक्षा प्रकटीकरण लेजर को खिलाते हैं, जो प्रत्येक मुद्दे को प्रकटीकरण प्रक्रिया के माध्यम से ट्रैक करता है: 53 सार्वजनिक रूप से प्रकट किए गए हैं जिनमें लॉन्च पर सीवीई असाइन किए गए हैं, 2,383 अभी भी प्रतिबंधित हैं। हाल के प्रविष्टियों में लिनक्स कर्नेल में एक उपयोग-หลังจาก-मुक्त, एप्पल सफारी को प्रभावित करने वाली वेबकिट मेमोरी हैंडलिंग दोष, और फ्रीबीएसडी में एक पैरामीटर मान्यकरण बग शामिल हैं।

एपीआई के लिए, GLM-5.3 तीन सोच प्रयास स्तरों (निम्न, उच्च, और अधिकतम) का समर्थन करता है और अब सोच को अक्षम करने की अनुमति नहीं देता है, जो पहले सोच को बंद करके चलने वाले अनुप्रयोगों के लिए एक ब्रेकिंग परिवर्तन है।

ओपन-वेट रिलीज़ क्या खुला छोड़ती है

घोषणा और वजन रिलीज़ के बीच दो सप्ताह का अंतर इस लॉन्च में काम कर रहा है। Z.ai इस देरी को सुरक्षा मूल्यांकन और कठोरता से जोड़ता है, और जो कठोर किया जा रहा है वह एक मॉडल है जिसे कंपनी खुद अप्रत्याशित रूप से तेजी से आक्रामक सुरक्षा क्षमता विकसित करने के रूप में वर्णित करती है, इसके सबसे बड़े लाभ शोषण के अंत में हैं। Z.ai कहता है कि वजन दो सप्ताह की सुरक्षा मूल्यांकन और कठोरता अवधि के बाद किसी के द्वारा डाउनलोड किए जा सकेंगे।

साइबर परिणाम एक सप्ताह में आते हैं जब फ्रंटियर लैब्स सार्वजनिक रूप से यह प्रदर्शित कर रहे हैं कि एजेंटिक मॉडल बुनियादी ढांचे के लिए क्या कर सकते हैं: ओपनएआई हाल ही में बताया कि इसके अपने परीक्षण मॉडल हगिंग फेस को एक लाल-टीम अभ्यास में उल्लंघन कर चुके हैं। Z.ai का प्रकटीकरण लेजर उस क्षमता का निर्माणकारी समकक्ष है: उसी कौशल जो शोषण श्रृंखला को सतहित करता है वह दशकों पुराने बगों को पैच करने के लिए भी सतहित करता है, और 1,097 महत्वपूर्ण और उच्च तीव्रता वाले निष्कर्ष समन्वित प्रकटीकरण के माध्यम से आगे बढ़ रहे हैं।

स्वतंत्र मूल्यांकनकर्ता GLM-5.3 के संख्या को दोहराते हैं (विशेष रूप से इनहाउस कोड बेंच परिणाम और साइबर स्कोर जो Z.ai ने अपने हार्नेस कॉन्फ़िगरेशन में चलाए) यह निर्धारित करेगा कि इस लॉन्च में कितना वास्तविक कदम है खुला-वजन कोडिंग मॉडल के लिए और कितना मूल्यांकन विकल्प है। वजन रिलीज़, जो अगस्त 2026 के अंत में अपेक्षित है, जब उस परीक्षण की शुरुआत होती है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।