Mô hình và nền tảng AI

Z.ai Ra Mắt GLM-5.3 Với Mã Hóa Frontier Và Khả Năng An Ninh Mạng Tăng Cường

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Z.ai đã phát hành GLM-5.3 vào ngày 14 tháng 8 năm 2026, một bản cập nhật mà công ty cho biết vẫn giữ nguyên mô hình cơ sở như GLM-5.2 và tất cả các khả năng tăng cường đều đến từ việc tăng quy mô sau đào tạo. Kết quả nổi bật nhất là trong lĩnh vực mã hóa, nơi Z.ai báo cáo rằng mô hình này là hệ thống mã hóa mở mạnh nhất mà họ đã đo được, và trong lĩnh vực an ninh mạng, nơi công ty cho biết khả năng tăng trưởng nhanh hơn so với dự kiến khi đào tạo được tăng quy mô. Trọng lượng không được công khai: Z.ai cho biết họ sẽ phát hành chúng trong khoảng hai tuần, sau khi đánh giá an toàn và tăng cường hoàn thành.

Theo thông báo của công ty, GLM-5.3 hiện có sẵn thông qua API của Z.ai và Kế hoạch Mã hóa GLM, và đã được triển khai cho tất cả người đăng ký kế hoạch mã hóa hiện có.

Sự ra mắt này diễn ra vài ngày sau khi DeepSeek tung ra V4 Pro của mình ra khỏi giai đoạn xem trước, và bảng so sánh của Z.ai đặt GLM-5.3 trực tiếp cạnh DeepSeek-V4 Pro, Kimi K3 của Moonshot và GPT-5.6 Sol của OpenAI trên các bộ mã hóa, an ninh mạng và các bộ công cụ khác.

Đào tạo trên một Bộ Môi Trường Làm Việc Lớn Hơn

Công thức, như Z.ai mô tả, là việc tăng quy mô môi trường chứ không phải thay đổi kiến trúc. GLM-5.2 đã giới thiệu chồng đào tạo (một kỹ thuật dài gọi là IndexShare, một phương pháp học tăng cường cho các nhiệm vụ dài gọi là SAO, và slime, một khuôn khổ mã nguồn mở cho học tăng cường không đồng bộ lớn) và công ty cho biết GLM-5.3 đến từ việc chi tiêu nhiều tính toán hơn cho nhiều môi trường nhiệm vụ đa dạng hơn được xây dựng trên chồng đó.

Các môi trường này được xây dựng để giống với các đơn vị công việc chuyên nghiệp chứ không phải các bài tập mã hóa. Trong một ví dụ mà công ty đưa ra, một mô hình được đặt trong môi trường làm việc của một kỹ sư cơ sở hạ tầng ML, với quyền truy cập vào các cụm tính toán, tài liệu nội bộ, cơ sở mã và kết quả thí nghiệm, và phải chẩn đoán các nút thắt, thực hiện tối ưu hóa và cung cấp tốc độ cuối cùng có thể đo lường được. Một số nhiệm vụ, Z.ai cho biết, đại diện cho vài ngày làm việc của một kỹ sư có kinh nghiệm. Để tạo ra các môi trường với số lượng lớn, Z.ai đã xây dựng các đường ống trong đó các tác nhân nghiên cứu chuyển đổi các mẫu nhiệm vụ từ công việc thực tế thành các môi trường dài горизонт có thể chạy được, một tác nhân thẩm phán xác minh từng nhiệm vụ thực sự có thể giải quyết được, và các thẩm phán được tổng hợp mà không có quyền truy cập vào giải pháp tham chiếu. Tín hiệu phần thưởng bản thân được tạo tự động cho một tập hợp con các nhiệm vụ, với các đường đi giải quyết được sử dụng để đóng các đường tắt phần thưởng. Z.ai lưu ý rằng các đường ống vẫn đòi hỏi công việc có ý nghĩa của con người trong vòng lặp.

Kết quả được báo cáo theo mẫu mà công thức đó dự đoán: các lợi ích lớn nhất nằm trên các đánh giá dài горизонт. Trên Terminal-Bench 3.0, GLM-5.3 di chuyển từ 4,6 đến 28,3 so với GLM-5.2; trên DeepSWE v1.1, từ 46,2 đến 66,9; trên Agents’ Last Exam’s CLI biến thể, từ 23,8 đến 28,5. Tất cả các số liệu đều được báo cáo bởi nhà cung cấp, với các chú thích phương pháp trong thông báo bao gồm các thiết lập harness, chiều dài ngữ cảnh và mẫu cho từng điểm chuẩn.

So với các mô hình khác, bức tranh là hỗn hợp. Trên Z.ai Code Bench nội bộ, công ty báo cáo sự cải thiện 50% so với GLM-5.2 và cho biết mô hình này đạt điểm cao hơn Claude Opus 4.8 với nỗ lực tương đương trong khi tiêu thụ ít token đầu ra hơn (31,4% ở khoảng 50.000 token đầu ra mỗi nhiệm vụ so với 29,5% ở 120.000) trong khi vẫn còn tụt lại phía sau Claude Fable 5 của Anthropic, đạt 39,5% với nỗ lực tối đa. Trên các bộ công cụ công khai, GLM-5.3 tụt lại phía sau GPT-5.6 Sol và Fable 5 trên một số đánh giá mã hóa khó hơn, bao gồm Terminal-Bench 3.0 và DeepSWE. Với tư cách là một điểm chuẩn riêng, công ty cho rằng Z.ai Code Bench giảm thiểu rủi ro ô nhiễm từ các tập kiểm tra công khai.

Kết Quả An Ninh Mạng Z.ai Nói Rằng Họ Không Dự Kiến

Tiêu đề thứ hai là tiêu đề mà Z.ai tự mình đánh dấu là không dự kiến. Công ty đã giới thiệu dữ liệu khám phá lỗ hổng và môi trường vào đào tạo sau, dự kiến mô hình sẽ trở nên tốt hơn trong việc tìm kiếm và lý luận về các lỗ hổng cá nhân. Thay vào đó, họ cho biết khả năng tiếp tục tăng trưởng khi đào tạo được tăng quy mô, và mô hình bắt đầu lý luận trên nhiều giai đoạn khai thác, tạo ra các kế hoạch hợp lý cho các chuỗi khai thác hoàn chỉnh thay vì chỉ tìm kiếm lỗ hổng riêng lẻ.

Các số liệu được báo cáo theo dõi yêu cầu đó. Trên CyberGym, nơi kiểm tra xem một mô hình có thể xác định và xác thực các lỗ hổng từ mã nguồn trắng hay không, GLM-5.3 đạt điểm 84,5%, tăng từ 77,2% của GLM-5.2 và dẫn đầu mọi mô hình trong tập so sánh của Z.ai. Trên ExploitBench, đòi hỏi lý luận sâu hơn về các lỗ hổng thực tế và khai thác của chúng, nó tăng hơn gấp đôi so với người tiền nhiệm, từ 24,4% đến 54,4%. Trên ExploitGym, đếm các nhiệm vụ khai thác được hoàn thành trong ngân sách thời gian chuẩn hóa, nó hoàn thành 105 nhiệm vụ trong hai giờ và 130 trong sáu giờ, so với 29 và 39 của GLM-5.2. Tóm tắt của Z.ai về mẫu là trực tiếp: càng lên cao trong chuỗi khai thác, điểm chuẩn nằm, càng lớn lợi ích từ GLM-5.2, và càng rộng khoảng cách còn lại đến các mô hình biên giới đóng, với Mythos 5 hoàn thành 181 và 247 nhiệm vụ ExploitGym trong cùng ngân sách.

Z.ai cũng báo cáo thử nghiệm chuyển giao ngoài các điểm chuẩn được kiểm soát. Làm việc với một số đội an ninh mạng ở Trung Quốc, công ty cho biết mô hình của họ đã xác định được 2.436 lỗ hổng trên 269 dự án mã nguồn mở kể từ GLM-5.2, bao gồm 1.097 lỗ hổng được xếp loại nghiêm trọng hoặc cao, bao gồm các hạt nhân hệ thống, hệ điều hành, động cơ trình duyệt và giao thức mạng. Nhiều lỗ hổng đã không được chú ý trong nhiều năm; lỗ hổng lâu đời nhất, công ty cho biết, được giới thiệu vào năm 1981.

Các phát hiện này cung cấp cho Sổ Ledger Phát Hiện An Ninh Mạng Của Z.ai, theo dõi từng vấn đề qua quá trình tiết lộ: 53 vấn đề được công bố công khai với CVE được chỉ định tại thời điểm ra mắt, 2.383 vấn đề vẫn còn trong tình trạng phong tỏa. Các mục gần đây bao gồm một lỗi sử dụng sau khi giải phóng trong hạt nhân Linux, một lỗi xử lý bộ nhớ WebKit ảnh hưởng đến Apple Safari và một lỗi xác thực tham số trong FreeBSD.

Đối với API, GLM-5.3 hỗ trợ ba cấp độ nỗ lực suy nghĩ (thấp, cao và tối đa) và không còn cho phép tắt suy nghĩ, một thay đổi phá vỡ đối với các ứng dụng trước đây chạy với suy nghĩ tắt.

Điều Gì Phát Hành Trọng Lượng Mở Để lại Mở

Khoảng thời gian hai tuần giữa thông báo và phát hành trọng lượng đang thực hiện công việc trong lần ra mắt này. Z.ai gắn khoảng thời gian trì hoãn này rõ ràng với đánh giá an toàn và tăng cường, và thứ đang được tăng cường là một mô hình mà công ty tự mô tả là đã phát triển khả năng an ninh mạng tấn công nhanh hơn dự kiến, với lợi ích lớn nhất trên đầu cuối của chuỗi khai thác. Z.ai cho biết trọng lượng sẽ có thể tải xuống bởi bất kỳ ai sau khoảng thời gian hai tuần đánh giá an toàn và tăng cường.

Các kết quả an ninh mạng cũng đến trong một tuần khi các phòng thí nghiệm biên giới đang công khai chứng minh những gì các mô hình tác nhân có thể làm đối với cơ sở hạ tầng: OpenAI gần đây đã mô tả các mô hình thử nghiệm của chính họ đã xâm phạm Hugging Face trong một bài tập đỏ. Sổ Ledger Phát Hiện An Ninh Mạng của Z.ai là đối tác xây dựng của khả năng đó: cùng một kỹ năng mà tạo ra các chuỗi khai thác cũng đưa ra các lỗi cũ đã có từ hàng chục năm và 1.097 phát hiện nghiêm trọng và cao đang được chuyển qua quá trình tiết lộ phối hợp.

Liệu các nhà đánh giá độc lập có tái tạo được các số liệu của GLM-5.3 (đặc biệt là các kết quả Code Bench nội bộ của Z.ai và các điểm an ninh mạng mà Z.ai đã chạy trong các cấu hình harness của riêng họ) sẽ xác định bao nhiêu phần của lần ra mắt này là một bước chân thực đối với các mô hình mã hóa mở và bao nhiêu là lựa chọn đánh giá. Phát hành trọng lượng, dự kiến vào cuối tháng 8 năm 2026, là khi quá trình thử nghiệm đó bắt đầu.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.