AI 모델 및 플랫폼
Z.ai, GLM-5.3 출시 – 프론티어 코딩 및 사이버 능력 강화

Z.ai가 2026년 8월 14일 GLM-5.3을 출시했습니다. 회사에 따르면 GLM-5.2와 같은 기반 모델을 유지하며 모든 역량 향상은 사후 학습 규모 확대에서 나왔습니다. 주요 성과는 코딩과 사이버보안입니다. Z.ai는 자사가 측정한 공개 가중치 모델 중 가장 강력한 코딩 성능을 보였고, 학습을 확대하면서 사이버보안 역량은 예상보다 빠르게 성장했다고 설명합니다. 가중치는 아직 공개되지 않았습니다. 회사는 안전성 평가와 보강을 마친 뒤 약 2주 후 공개하겠다고 밝혔습니다.
Z.ai의 발표에 따르면 GLM-5.3은 현재 Z.ai API와 GLM Coding Plan에서 사용할 수 있으며 기존 코딩 요금제 구독자 모두에게 제공됐습니다.
이번 출시는 DeepSeek가 주력 모델 V4 Pro의 미리보기 단계를 끝내고 정식 출시한 지 며칠 만에 나왔습니다. Z.ai의 비교표는 코딩, 사이버보안, 에이전트 평가에서 GLM-5.3을 DeepSeek-V4 Pro, Moonshot의 Kimi K3, OpenAI의 GPT-5.6 Sol과 직접 비교합니다.
더 많고 다양한 업무 환경을 활용한 사후 학습
Z.ai가 설명하는 방식은 아키텍처 변경보다 학습 환경의 확대입니다. GLM-5.2는 긴 컨텍스트 기법 IndexShare, 장기간 작업용 강화학습 방법 SAO, 대규모 비동기 강화학습용 오픈소스 프레임워크 slime으로 이루어진 학습 체계를 도입했습니다. 회사는 이 체계 위에서 더 많고 다양한 작업 환경에 더 많은 연산 자원을 투입해 GLM-5.3을 만들었다고 설명합니다.
이 환경은 코딩 연습보다 실제 전문 업무 단위를 닮도록 구성됩니다. 회사의 예에서는 모델을 머신러닝 인프라 엔지니어의 작업 환경에 두고 컴퓨팅 클러스터, 내부 문서, 코드베이스, 실험 결과에 접근하게 합니다. 모델은 병목을 진단하고 최적화를 구현해 전체 처리 과정에서 측정 가능한 속도 향상을 내야 합니다. Z.ai에 따르면 숙련된 엔지니어에게도 며칠이 걸릴 작업이 포함됩니다. 환경을 대량으로 만들기 위한 파이프라인에서는 연구 에이전트가 실제 업무 패턴을 실행 가능한 장기 작업 환경으로 바꾸고, 심사 에이전트가 각 작업을 실제로 해결할 수 있는지 확인합니다. 검증기는 참조 해답에 접근하지 않은 채 생성됩니다. 일부 작업의 보상 신호 자체도 기계가 생성하며, 문제 풀이 과정의 기록을 이용해 보상을 편법으로 얻는 허점을 막습니다. Z.ai는 여전히 상당한 사람의 개입이 필요하다고 덧붙입니다.
보고된 결과는 이 학습 방식에서 예상할 수 있는 양상을 보입니다. 가장 긴 작업을 다루는 평가에서 개선 폭이 가장 큽니다. GLM-5.2 대비 GLM-5.3의 점수는 Terminal-Bench 3.0에서 4.6에서 28.3으로, DeepSWE v1.1에서 46.2에서 66.9로, Agents’ Last Exam의 CLI 평가에서 23.8에서 28.5로 올랐습니다. 모두 공급자가 보고한 수치입니다. 발표의 방법론 각주에는 벤치마크별 평가 실행 환경, 컨텍스트 길이, 샘플링 설정이 설명돼 있습니다.
다른 모델과 비교하면 결과는 엇갈립니다. 자체 Z.ai Code Bench에서 회사는 GLM-5.2보다 50% 개선됐다고 보고했습니다. 비슷한 추론 노력 수준에서 출력 토큰을 더 적게 쓰면서 Claude Opus 4.8보다 높은 점수를 냈다고도 밝혔습니다. 작업당 약 5만 출력 토큰에서 31.4%를 기록한 반면 Opus 4.8은 12만 토큰에서 29.5%였습니다. 다만 최대 추론 노력에서 39.5%를 기록한 Anthropic의 Claude Fable 5에는 미치지 못했습니다. 공개 평가에서는 Terminal-Bench 3.0과 DeepSWE 등 일부 고난도 코딩 평가에서 GPT-5.6 Sol과 Fable 5에 뒤처집니다. 회사는 비공개 벤치마크인 Z.ai Code Bench가 공개 시험 데이터의 학습 오염 위험을 줄인다고 주장합니다.
Z.ai도 예상하지 못했다고 밝힌 사이버보안 성과
두 번째 주요 성과는 Z.ai 스스로 예상 밖이었다고 설명하는 부분입니다. 회사는 개별 취약점을 찾고 추론하는 능력을 높이려 사후 학습에 취약점 발견 데이터와 환경을 넣었습니다. 하지만 학습 규모가 커질수록 역량이 누적됐으며, 개별 버그 탐색을 넘어 여러 악용 단계를 추론하고 전체 공격 연쇄에 대한 일관된 계획을 세우기 시작했다고 설명합니다.
보고된 수치는 이 주장과 같은 양상을 보입니다. 소스 코드를 들여다보는 화이트박스 조건에서 취약점을 찾고 검증하는 CyberGym에서 GLM-5.3은 84.5%를 기록했습니다. GLM-5.2의 77.2%보다 높고 Z.ai 비교 대상의 모든 모델을 앞섰습니다. 실제 취약점과 악용에 대한 더 깊은 추론을 요구하는 ExploitBench에서는 54.4%로 전작의 24.4%보다 두 배 이상 높았습니다. 같은 시간 예산 아래 완료한 악용 작업 수를 세는 ExploitGym에서는 2시간에 105개, 6시간에 130개를 완료했습니다. GLM-5.2는 각각 29개와 39개였습니다. Z.ai는 악용 연쇄의 더 높은 단계를 평가할수록 GLM-5.2 대비 향상 폭도 커지지만 폐쇄형 최첨단 모델과 남아 있는 격차 역시 커진다고 요약합니다. Mythos 5는 동일한 시간 예산에서 각각 181개와 247개를 완료했습니다.
Z.ai는 통제된 벤치마크 밖에서도 능력이 이어지는지 시험했다고 보고했습니다. 중국의 여러 보안팀과 협력한 결과 GLM-5.2 이후 자사 모델들이 269개 오픈소스 프로젝트에서 취약점 2,436개를 발견했으며, 이 중 1,097개는 심각도가 치명적이거나 높음으로 분류됐다고 밝혔습니다. 대상은 시스템 커널, 운영체제, 브라우저 엔진, 네트워크 프로토콜에 걸칩니다. 다수는 수년간 발견되지 않았으며 회사에 따르면 가장 오래된 것은 1981년에 도입됐습니다.
발견 내용은 공개 Z.ai Security Disclosure Ledger에 반영됩니다. 이 장부는 각 문제의 공개 절차를 추적합니다. 출시 당시 53개는 CVE가 부여돼 공개됐고 2,383개는 아직 공개 유예 상태였습니다. 최근 항목에는 Linux 커널의 해제 후 사용 취약점, Apple Safari에 영향을 미치는 WebKit 메모리 처리 결함, FreeBSD의 매개변수 검증 버그가 포함됩니다.
API에서 GLM-5.3은 low, high, max의 세 가지 추론 노력 수준을 지원하며 추론 기능을 끌 수 없게 됐습니다. 이전에 추론을 비활성화해 사용하던 애플리케이션에는 호환성을 깨는 변경입니다.
가중치 공개를 앞두고 남은 쟁점
발표와 가중치 공개 사이의 2주 간격은 이번 출시에서 의미가 있습니다. Z.ai는 공개 지연을 안전성 평가와 보강에 명시적으로 연결합니다. 보강 대상은 회사 스스로 공격적 보안 역량이 예상보다 빠르게 발전했으며 악용 연쇄의 후반부에서 가장 크게 향상됐다고 설명하는 모델입니다. Z.ai는 2주간의 안전성 평가와 보강이 끝나면 누구나 가중치를 내려받을 수 있다고 밝혔습니다.
이 사이버보안 결과는 주요 AI 연구소들이 에이전트 모델의 인프라 접근 능력을 공개적으로 보여 주는 시기에 나왔습니다. OpenAI는 최근 레드팀 훈련에서 자사 시험 모델이 Hugging Face에 침입한 일 을 설명했습니다. Z.ai의 공개 장부는 이런 역량의 건설적 활용에 해당합니다. 악용을 연결하는 능력으로 수십 년 된 버그를 찾아 패치할 수 있으며, 치명적·높음 등급의 발견 사항 1,097개가 현재 조율된 공개 절차를 거치고 있습니다.
독립 평가자가 GLM-5.3의 수치, 특히 자체 Code Bench 결과와 Z.ai의 평가 실행 설정에서 나온 사이버보안 점수를 재현할 수 있는지가 이번 출시의 의미를 가를 것입니다. 공개 가중치 코딩 모델의 실질적인 진전인지, 평가 선택이 만든 결과인지를 판단하는 기준입니다. 2026년 8월 말경으로 예상되는 가중치 공개가 그 시험의 출발점입니다.












