AIモデルとプラットフォーム
Z.ai、GLM-5.3をリリース – フロンティアコーディングとサイバー能力を強化

Z.aiは2026年8月14日、GLM-5.3をリリースしました。このアップデートでは、GLM-5.2と同じベースモデルを使用し、すべての機能向上はスケールアップされたポストトレーニングから得られるということです。主な成果はコーディングとサイバーセキュリティです。Z.aiは、GLM-5.3が最も強力なオープンウェイトシステムであると述べています。また、サイバーセキュリティでは、会社が予想していたよりも能力が速く成長したとも述べています。ウェイトはまだ公開されていません。Z.aiによると、安全性の評価とハードニングが完了した後、約2週間でリリースされる予定です。
会社の発表によると、GLM-5.3は現在、Z.aiのAPIとGLMコーディングプランを通じて利用可能であり、すべての既存のコーディングプランのサブスクライバーにロールアウトされています。
リリースは、DeepSeekが自身のフラグシップV4 Proをプレビューから外した数日後に来ています。Z.aiの比較表では、GLM-5.3を、コーディング、サイバー、エージェントスイートでDeepSeek-V4 Pro、MoonshotのKimi K3、OpenAIのGPT-5.6 Solと直接比較しています。
より大きな作業環境でのポストトレーニング
Z.aiによると、レシピはアーキテクチャの変更ではなく、環境のスケーリングです。GLM-5.2ではトレーニングスタック(IndexShareという長文脈技術、SAOという長ホライズンタスクの強化学習方法、slimeという大規模非同期RLのオープンソースフレームワーク)が導入され、GLM-5.3はそのスタック上でより多くのコンピューティングリソースと多様なタスク環境を使用したものです。
これらの環境は、コーディングの練習ではなく、プロの仕事の単位に似たものを模しています。会社が示した例では、モデルはMLインフラエンジニアの作業環境に配置され、コンピューティングクラスター、内部ドキュメント、コードベース、実験結果へのアクセスが可能であり、ボトルネックを診断し、最適化を実装し、測定可能なエンドツーエンドのスピードアップを達成する必要があります。会社によると、一部のタスクは、経験豊富なエンジニアにとって数日間の仕事に相当します。環境を大量に生成するために、Z.aiは、タスクパターンを実行可能な長ホライズン環境に変換する研究エージェント、タスクが実際に解決可能であることを検証するジャッジエージェント、リファレンスソリューションへのアクセスなしに検証者を合成するパイプラインを構築しました。報酬シグナル自体は、タスクのサブセットに対してマシンによって生成され、ソルバートラジェクトリが報酬ショートカットを閉じるために使用されます。Z.aiは、パイプラインではまだ人間の介入が必要であると述べています。
報告された結果は、予想どおりのパターンに従っています。最も大きな利益は、最も長いホライズンの評価にあります。Terminal-Bench 3.0では、GLM-5.3はGLM-5.2の4.6から28.3に上昇しました。DeepSWE v1.1では、46.2から66.9に上昇しました。Agents’ Last ExamのCLIバリアントでは、23.8から28.5に上昇しました。すべての数字はベンダーが報告したもので、各ベンチマークのハーネス、コンテキストの長さ、サンプリング設定に関するメソッドのフットノートが発表に含まれています。
他のモデルと比較すると、状況は混合しています。Z.aiの自社Code Benchでは、会社は50%の改善を報告し、同等の努力でClaude Opus 4.8を上回り、出力トークンを少なくして(各タスクあたり約50,000の出力トークンで31.4%、120,000で29.5%)AnthropicのClaude Fable 5(最大努力で39.5%)に次ぐ結果を残しています。パブリックスイートでは、GLM-5.3は、Terminal-Bench 3.0やDeepSWEなどのより困難なコーディング評価で、GPT-5.6 SolやFable 5に後れを取っています。Z.aiは、Z.ai Code Benchはパブリックテストセットからの汚染リスクを軽減するプライベートベンチマークであると主張しています。
Z.aiが計画していなかったサイバー結果
2番目の見出しは、Z.ai自身が予想外であったと述べているものです。会社は、モデルが個々の欠陥を発見して推論する能力を高めることを期待しながら、脆弱性の発見データと環境をポストトレーニングに導入しました。しかし、会社によると、能力はトレーニングのスケールアップに伴って増加し続け、モデルは単なるバグの発見ではなく、複数の段階での悪用を跨いだ計画的な悪用チェーンの形成を開始しました。
報告された数字は、この主張を裏付けています。CyberGymでは、モデルが白ボックスソースコードから脆弱性を特定して検証できるかどうかをテストし、GLM-5.3は84.5%のスコアを達成し、GLM-5.2の77.2%と比較テストセットのすべてのモデルを上回りました。ExploitBenchでは、実際の脆弱性とその悪用についてのより深い推論を要求し、GLM-5.3は54.4%から24.4%に大幅に上昇しました。ExploitGymでは、時間規範化された予算内で完了したタスク数を数え、GLM-5.3は2時間以内に105タスク、6時間以内に130タスクを完了し、GLM-5.2の29と39を上回りました。Z.aiのパターンの要約は簡潔です。悪用チェーンの上の方にあるベンチマークでは、GLM-5.2からの利益は大きく、クローズドフロンティアモデルのギャップは広くなり、Mythos 5は同じ予算内で181と247のExploitGymタスクを完了しました。
Z.aiは、制御されたベンチマークを超えた転送もテストしたと報告しています。中国の複数のセキュリティチームと協力し、会社はGLM-5.2以降、269のオープンソースプロジェクトで2,436の脆弱性を特定し、そのうち1,097が重大または高重度であると述べています。これらの多くは、数年間見過ごされていました。会社によると、最も古いものは1981年に導入されました。
これらの発見は、公開されたZ.aiセキュリティディスクロージャーレジャーにフィードされ、各問題をディスクロージャプロセスを通じて追跡しています。53の問題は、CVEが割り当てられ、公開されています。2,383の問題はまだエンバーゴの下にあります。最近のエントリには、Linuxカーネルのuse-after-free、WebKitのメモリハンドリングの欠陥(Apple Safariに影響)、FreeBSDのパラメータ検証バグが含まれます。
APIの場合、GLM-5.3は3つの思考努力レベル(低、 高、最大)をサポートし、思考を無効にすることはできません。これは、以前は思考を無効にしていたアプリケーションに対する重大な変更です。
オープンウェイトリリースが残すもの
発表とウェイトリリースの2週間の間隔は、このリリースで重要な役割を果たしています。Z.aiは、遅延を明示的に安全性の評価とハードニングに結び付け、ハードニングされるのは、会社自身が予想よりも速くオフенсивセキュリティ能力を開発したと述べているモデルであると述べています。Z.aiによると、ウェイトは、2週間の安全性評価とハードニング期間が完了した後、誰でもダウンロードできるようになります。
サイバーリサルトは、フロンティアラボがインフラストラクチャに対してエージェントモデルが何ができるかを公開的に実証している週に到来しました。OpenAIは最近、自身のテストモデルがHugging Faceを侵害したことを、レッドチーム演習で発表しました。Z.aiのディスクロージャーレジャーは、その機能の構造的な対称です。同じスキルがエクスプロイトをチェーン化するのと同時に、十年以上前に導入されたバグを表面化してパッチを適用するための調整されたディスクロージャに向けて1,097の重大なおよび高重度の調査結果を移動させています。
独立した評価者がGLM-5.3の数字(特に、Z.aiの自社Code Benchの結果と、Z.aiが自身のハーネス構成で実行したサイバースコア)を再現するかどうかが、オープンウェイトコーディングモデルの真正なステップであるか、評価の選択であるかを決定します。ウェイトリリースは、2026年8月末に予想されており、そのテストの開始時期です。












