AI 모델 및 플랫폼
Z.ai, 100,000개의 중국산 칩으로 구축된 GLM-5.3-Flash 추론 세부 정보

Z.ai는 2026년 9월 17일에 기술 계정을 공개하여 100,000개가 넘는 중국산 AI 가속기 클러스터에서 자체적으로 GLM-5.3-Flash 모델을 위한 완전한 프로덕션급 추론 서비스를 처음부터 구축한 과정을 설명했습니다. 회사에 따르면, 작업의 대부분은 인프라 엔지니어만이 아니라 GLM-5.3으로 구동되는 인프라 에이전트에 의해 수행되었으며, GLM-5.3-Flash의 모든 프로덕션 추론은 해당 시스템에서 실행됩니다.
Z.ai는 이전에 이 규모의 중국산 가속기 클러스터를 운영한 사례가 없다고 밝혔습니다. 회사는 칩 내 메모리 용량과 대역폭이 상대적으로 제한적이며, 새로운 모델 아키텍처, 1백만 토큰 컨텍스트 윈도우, 멀티모달 요청 등이 있으며, 커널 지원이 미완성이고 엔지니어들이 문서화되어야 할 동작을 추측해야 하는 미성숙한 생태계가 동반된다고 지적했습니다.
GLM-5.3-Flash는 2026년 8월 26일에 출시되었습니다, GLM-5 시리즈에서 최초로 네이티브 멀티모달 모델이며, 희소와 선형 어텐션을 결합한 하이브리드 아키텍처 아래 총 3200억 개의 파라미터와 180억 개의 활성 파라미터를 가지고 있습니다. 출시 전, Z.ai는 OpenCode와 OpenRouter에서 모델을 익명으로 ox-alpha라는 이름으로 테스트했으며, 출시 일주일 만에 두 플랫폼 모두에서 가장 많이 사용된 모델이 되어 6일 동안 62조 개 이상의 토큰을 처리했다고 회사는 밝혔습니다.
밀집 피드백 방법
이 보고서의 핵심은 시스템 문제에 있습니다: 엔드투엔드 메트릭은 결과가 악화되었음을 에이전트에게 알려줄 수 있지만 그 이유는 알 수 없습니다. 수치 정확도 테스트 실패, 첫 토큰까지의 시간이 30% 증가, 혹은 출력 처리량이 20% 감소하는 상황은 어느 레이어가 원인인지 혹은 다음에 무엇을 테스트해야 하는지를 보여주지 못합니다. Z.ai가 ‘밀집 피드백’이라고 부르는 이 해결책은 정확성 테스트, 런타임 로그, 실행 추적, 런타임 이벤트, 마이크로벤치마크 및 엔드투엔드 메트릭을 반복 가능한 워크플로우로 결합하여 에이전트가 각 가설을 로컬에서 검증하도록 하며, 매 변경마다 전체 배포 및 부하 테스트를 기다릴 필요가 없게 합니다.
회사는 이러한 피드백에 대해 세 가지 필수 속성을 정의합니다. 첫째, 가능한 한 특정 런치 파라미터, 코드 변경, 커널, 입력 조건, 스레드, 실행 구간 또는 코드 경로와 연결된 로컬이어야 합니다. 둘째, 비용이 저렴하고 획득 시기가 신속해야 합니다. 셋째, 관찰된 상관관계만으로는 근본 원인을 규명할 수 없으므로, 기준 구현 및 통제된 실험을 통한 객관적 검증을 지원해야 합니다.
런치 루프에서 보고된 바에 따르면, 엔지니어들은 목표와 시스템 경계를 정의하고 수치 의미, 동시성 동작, 프로덕션 위험과 관련된 중요한 변경 사항을 검토했으며, 에이전트는 분석, 가설 설정 및 코드 변경을 담당했습니다. 그들이 공동으로 최적화한 스택은 선형 어텐션 및 LM 헤드를 위한 인트라노드 텐서 병렬화, ReplaySSM, W8A8 양자화, 혼합 정밀도 INT8/FP8/BF16 캐시 양자화, 그리고 레이어 스플릿을 포함했으며, Encode-Prefill-Decode 분산 아키텍처 하에서 구현되었습니다.
세 가지 엔지니어링 사례
첫 번째 사례는 수치 정확도와 관련됩니다. 분할된 커널 실행 경로와 분할되지 않은 경로를 비교한 검증에서 KDA 커널의 컨텍스트 병렬성 경로에 정확도 문제가 드러났습니다: tl.dot 연산이 입력이 FP32임에도 불구하고 기본적으로 TF32 연산을 사용했기 때문에 상태 병합 과정에서 오류가 누적되고 컨텍스트 길이가 늘어날수록 오류가 가중되었습니다. 이 문제를 해결하기 위해 입력 정밀도를 tf32x3으로 명시적으로 설정했으며, 이는 세 개의 TF32 텐서 코어 연산을 사용해 더 높은 정밀도의 결과를 제공합니다.
보고서에 따르면, 해당 수정 사항은 Flash Linear Attention에 상류로 병합되었습니다. 풀 리퀘스트는 2026년 8월 27일에 열리고 병합되었으며, 상태 업데이트 및 변환 병합 커널에 tf32x3 어핀 체인을 선택적 정확도 경로로 적용하고, 컨텍스트 병렬성 테스트를 추가하며, tf32를 지원하지 않는 플랫폼(AMD, NPU, 그리고 컴퓨트 능력 8.0 미만의 NVIDIA GPU)에서는 ieee 정밀도로 명시적으로 되돌아갑니다.
두 번째 사례는 KV Transfer 동시성 병목 현상과 관련됩니다. 보고서에 따르면, 엔지니어들은 동일한 워크로드 하에서 Prefill과 KV Transfer를 합친 실행 시간이 Prefill만의 기준선보다 5% 이내여야 한다는 수용 기준을 설정했습니다. 에이전트는 일부 시나리오에서 20%를 초과하는 차이를 발견하고 이를 DeepEP v1.2.1으로 추적했으며, 해당 버전에서는 디스패치와 인트라노드combine 호출이 Python GIL을 명시적으로 해제하지 않았습니다. 이러한 호출이 락을 유지하는 동안 동일 프로세스의 Mooncake Transfer Python 스레드는 제때 GIL을 획득할 수 없어 전송 작업의 스케줄링 및 제출이 지연되고 계산과의 겹침이 감소했습니다. 보고서는 같은 버전의 internode_dispatch는 이미 GIL을 해제했으며, 코드 주석에 CPU가 대기하는 동안 다른 스레드의 KV Transfer를 차단하지 않으려는 의도가 명시되어 있다고 언급했습니다. 관련 C++ 실행 구간에서 GIL을 해제하도록 수정한 후, 동일한 테스트 조건에서 차이가 1% 이하로 감소했다고 보고했습니다.
세 번째 사례는 커널 성능과 관련됩니다. Z.ai는 에이전트가 SGLang, Flash Linear Attention, DeepGEMM을 포함한 프로젝트에서 손으로 작성한 커널의 기술을 추출하여 적용 조건, 변환 방법, 자원 제약 및 검증 증거를 담은 재사용 가능한 최적화 골격으로 만들었습니다. 대표적인 KDA Decode 커널에서, 회사는 에이전트의 분할 최적화가 실행 시간을 9.6% 단축했다고 보고했습니다. 피드백을 통해 계산이 주요 병목임이 확인된 후, 에이전트는 동일한 FP32 정규화 및 게이팅 연산을 네 번 반복하던 커널의 V-차원 타일을 레지스터에 상주하는 중간 결과와 하나의 워프 수준 축소를 포함하는 단일 스레드 블록으로 병합했으며, 이를 통해 이전 버전 대비 1.71× 속도 향상이 이루어졌다고 회사는 보고했습니다.
제시된 결과 및 재귀적 자기 개선
Z.ai는 GLM-5.3-Flash가 초기 모델 적용 단계에서 프로덕션 준비 단계까지 2주 미만에 완료되었으며, 최종 엔드투엔드 처리량이 초기 기준 대비 세 배로 증가했다고 보고했습니다. 또한 회사는 하드웨어 활용 효율성과 토큰당 비용이 주류 NVIDIA GPU와 비교 가능한 수준에 도달했다고 밝혔습니다.
회사는 이 노력을 재귀적 자기 개선의 초기 사례로 설명하면서, 모델이 실행되는 추론 시스템 최적화에 참여했음을 언급했습니다. 동시에 Z.ai는 아직 재귀적 자기 개선에 도달하지 못했으며, 목표 선택, 경계 설정 및 위험 평가와 같은 책임은 인간이 계속해서 담당해야 할 인간의 책임이라고 주장했습니다.












