AI 모델 및 플랫폼
Z.ai, GLM-5.3 출시 – 프론티어 코딩 및 사이버 능력 강화

Z.ai는 2026년 8월 14일 GLM-5.3를 출시했으며, 이는 GLM-5.2와 동일한 기본 모델을 사용하고 확장된 사후 교육에서 모든 기능 향상을 얻는다는 업체의 설명입니다. 주요 결과는 코딩과 사이버 보안 분야에서 나타났습니다. Z.ai는 GLM-5.3가 가장 강력한 오픈 웨이트 시스템이라고 주장하며, 사이버 보안 분야에서는 예상보다 더 빠르게 성장했다고 밝혔습니다. 그러나 웨이트는 아직 공개되지 않았으며, Z.ai는 안전성 평가와 강화가 완료된 후 약 2주 후에 웨이트를 공개할 예정입니다.
업체의 발표에 따르면, GLM-5.3는 현재 Z.ai의 API와 GLM 코딩 플랜을 통해 사용할 수 있으며, 모든 기존 코딩 플랜 가입자에게 배포되었습니다.
이번 출시 는 DeepSeek이 자사의 플래그십 V4 Pro를 미리 보기에서 출시한 지 며칠 후에 이루어졌으며, Z.ai의 비교 표는 GLM-5.3를 DeepSeek-V4 Pro, Moonshot의 Kimi K3, OpenAI의 GPT-5.6 Sol과 함께 코딩, 사이버, 에이전트 스위트에서 직접 비교합니다.
더 큰 작업 환경 세트에서 사후 교육
Z.ai는 환경 확장과 아키텍처 변경이 아닌 환경 확장을 통해 GLM-5.3를 개발했다고 설명합니다. GLM-5.2는 훈련 스택을 도입했으며, 이는 IndexShare, SAO, slime를 포함합니다. Z.ai는 GLM-5.3가 이 스택을 사용하여 더 많은 컴퓨팅 파워와 다양한 작업 환경을 통해 개발되었다고 밝혔습니다.
이러한 환경은 코딩 연습이 아닌 전문 작업 단위와 유사하게 설계되었습니다. 예를 들어, ML 인프라 엔지니어의 작업 환경에서 모델은 컴퓨팅 클러스터, 내부 문서, 코드베이스, 실험 결과에 액세스할 수 있으며, 병목 현상을 진단하고 최적화를 구현하여 측정 가능한 최종 속도 향상을 달성해야 합니다. 일부 작업은 경험豊富한 엔지니어에게 수일간의 작업에 해당합니다. Z.ai는 작업 환경을 대량으로 생성하기 위해 파이프라인을 구축했으며, 연구 에이전트가 실제 작업에서 작업 패턴을 실행 가능한 장기 지평 환경으로 변환하고, 심사 에이전트가 각 작업이 실제로 해결 가능하도록 확인하며, 버IFIER가 참조 솔루션에 액세스하지 않고 생성됩니다. 보상 신호 자체는 작업의 하위 집합에 대해 기계적으로 생성되며, 솔버 트레이저리가 보상 단축을 닫습니다. Z.ai는 파이프라인이 여전히 의미 있는 인간의 개입이 필요하다고 지적합니다.
보고된 결과는 이러한 레시피를 예상하는 패턴을 따릅니다. 가장 큰 이익은 가장 긴 지평 평가에 있습니다. Terminal-Bench 3.0에서 GLM-5.3는 4.6에서 28.3으로, DeepSWE v1.1에서 46.2에서 66.9로, Agents’ Last Exam의 CLI 변형에서 23.8에서 28.5로 향상되었습니다. 모든 수치는 벤더에서 보고된 수치이며, 각 벤치마크에 대한 하ーネ스, 컨텍스트 길이 및 샘플링 설정에 대한 방법론적 주석이 발표에서 포함되어 있습니다.
다른 모델과 비교하면 그림은 혼합되어 있습니다. Z.ai의 자체 Code Bench에서, 업체는 50%의 향상을 보고 있으며, 모델이 유사한 노력에서 Claude Opus 4.8을 능가하는 것으로 나타났으며, 출력 토큰 수를 줄였습니다(약 50,000개의 출력 토큰당 31.4% vs. 120,000개당 29.5%). 그러나 Anthropic의 Claude Fable 5는 최대 노력에서 39.5%를 달성하며, GLM-5.3는 뒤처집니다. 공개 스위트에서, GLM-5.3는 Terminal-Bench 3.0 및 DeepSWE와 같은 더 어려운 코딩 평가에서 GPT-5.6 Sol 및 Fable 5를 따릅니다. Z.ai는 자체 벤치마크인 Code Bench가 공공 테스트 세트의 오염 위험을 줄인다고 주장합니다.
Z.ai가 계획하지 않은 사이버 결과
두 번째 헤드라인은 Z.ai가 자체적으로 예상치 못한 것으로 표시합니다. 업체는 취약성 발견 데이터와 환경을 사후 교육에 도입했으며, 모델이 개별 결점을 찾고 이유를 더 잘하는 능력을 기대했습니다. 그러나 업체는 능력이 예상보다 더 빠르게 성장했으며, 모델이 단일 결점을 찾는 것보다 다단계 악용 체인을 형성하고 완전한 악용 체인을 위한 일관된 계획을 수립하기 시작했다고 보고합니다.
보고된 숫자는 이러한 주장을 따릅니다. CyberGym에서, 모델이白箱 소스 코드에서 취약성을 식별하고 검증할 수 있는지 테스트할 때, GLM-5.3는 84.5%의 점수를 얻었으며, GLM-5.2의 77.2%를 상회하며, Z.ai의 비교 집합에 있는 모든 모델을 앞섰습니다. ExploitBench에서, 모델이 실제 취약성과 그 악용에 대해 더 깊은 이유를 제공해야 할 때, GLM-5.3는 전임 모델의 54.4%에서 24.4%로 두 배 이상 증가했습니다. ExploitGym에서, 모델이 시간 정상화된 예산 내에서 완료한 악용 작업 수를 측정할 때, GLM-5.3는 2시간 내에 105개의 작업과 6시간 내에 130개의 작업을 완료했으며, GLM-5.2는 각각 29개와 39개였습니다. Z.ai의 요약은 직접적입니다. 악용 체인의 위쪽에 있는 벤치마크일수록 GLM-5.2에서 얻은 이익이 더 크고, 클로즈드 프론티어 모델과의 격차가 더 넓습니다. Mythos 5는 동일한 예산에서 181개와 247개의 ExploitGym 작업을 완료했습니다.
Z.ai는 또한 제어된 벤치마크를 넘어서 전환을 테스트했다고 보고합니다. 중국의 여러 보안 팀과 협력하여, 업체의 모델은 GLM-5.2 이후 269개의 오픈 소스 프로젝트에서 2,436개의 취약성을 식별했으며, 그 중 1,097개는 심각하거나 높은 심각도로 평가되었습니다. 시스템 커널, 운영 체제, 브라우저 엔진 및 네트워크 프로토콜을 포함한 범위는 광범위했습니다. 많은 경우 수년 동안 발견되지 않았으며, 업체는 가장 오래된 경우 1981년에 도입되었다고 밝혔습니다.
이러한 발견은 공공 Z.ai 보안 공개 레저에 공급되며, 각 문제를 공개 프로세스를 통해 추적합니다. 53건의 문제는 현재 공개되어 있으며 CVE가 할당되어 있으며, 2,383건은 아직 공개되지 않았습니다. 최근 항목에는 Linux 커널의 use-after-free, Apple Safari에 영향을 미치는 WebKit 메모리 처리 결점 및 FreeBSD의 매개 변수 검증 버그가 포함됩니다.
API의 경우, GLM-5.3는 낮은, 높은, 최대 생각 노력 수준을 지원하며, 더 이상 생각을 비활성화할 수 없습니다. 이는 이전에 생각을 비활성화한 상태로 실행한 애플리케이션에 대한 중단 변경입니다.
오픈 웨이트 출시로 남겨진 것
발표와 웨이트 출시 사이의 2주간의 간격은 이 출시에서 중요한 역할을 합니다. Z.ai는 이 지연을 명시적으로 안전성 평가와 강화에 연결하며, 강화되는 것은 업체 자체가 예상보다 더 빠르게 공격적인 사이버 보안 능력을 개발했다고 설명하는 모델입니다. Z.ai는 웨이트가 2주간의 안전성 평가와 강화 기간 이후 누구나 다운로드할 수 있을 것이라고 밝혔습니다.
사이버 결과는 프론티어 랩이 공개적으로 에이전트 모델이 인프라에 미칠 수 있는 영향을 보여주는 주에 도착했습니다. OpenAI는 최근 자체 테스트 모델이 레드 팀 연습에서 Hugging Face를 침해했다고 밝혔습니다. Z.ai의 공개 레저는 이러한 능력의 건설적인 대응입니다. 동일한 기술이 결점을 발견하는 데 사용되며, 1,097개의 심각하거나 높은 심각도의 발견이 조정된 공개를 통해 진행 중입니다.
독립적인 평가자가 GLM-5.3의 숫자(특히 Z.ai의 자체 하ーネ스 구성에서 실행된 Code Bench 결과와 사이버 점수)를 복제할 것인지 여부는 이 출시가 오픈 웨이트 코딩 모델에 대한 진정한 단계인지, 아니면 평가 선택인지 결정할 것입니다. 웨이트 출시, 2026년 8월 말에 예상되는 것은 이러한 테스트가 시작되는 때입니다.












