GLM, 자체 추론 인프라 구축
- •Z.ai는 GLM-5.3이 2주 미만에 GLM-5.3-Flash 추론 인프라 구축을 도왔다고 밝혔다
- •GLM-5.3-Flash는 중국산 AI 가속기 100,000개 이상에서 실행되며 62조 토큰을 처리했다
- •촘촘한 피드백은 Infra Agent가 KDA Context Parallelism 정밀도 버그 등 정확성 문제를 찾는 데 도움을 줬다
Z.ai는 2026년 9월 17일 GLM-5.3이 GLM-5.3-Flash의 프로덕션 추론 인프라 구축을 도왔고, 초기 적응 단계에서 프로덕션 준비까지 2주 미만에 진행됐다고 밝혔다. 회사에 따르면 GLM-5.3-Flash의 모든 프로덕션 추론은 중국산 AI 가속기 100,000개 이상으로 구성된 클러스터 위에서 처음부터 구축한 시스템에서 실행되며, 작업의 상당 부분은 GLM-5.3 기반 Infra Agent가 수행했다.
Z.ai는 이번 프로젝트를 Recursive Self-Improvement, 즉 RSI(AI가 자체 후속 모델을 개선하는 방식)의 초기 사례로 설명했다. 회사는 사이버보안 연구가 2025년 10월 시작된 뒤 보안 파트너들이 GLM을 활용해 실제 코드베이스에서 수천 개 취약점을 발견했으며, 이에 따라 책임 있는 사용을 위한 신뢰 기반 접근 프로그램을 설계했다고 밝혔다. 또한 GLM-4.7 이전의 내부 코딩 활용이 부분적으로 의무감에 따른 것이었다면, GLM-5.3은 팀의 일상적인 코딩 파트너가 됐다고 설명했다.
GLM-5.3-Flash 배포는 새로운 모델 아키텍처, 1M-token 컨텍스트 창, 멀티모달 요청을 지원해야 했고, 동시에 칩 메모리 용량과 대역폭이 제한된 하드웨어에서 작동해야 했다. Z.ai는 중국산 가속기가 이 규모로 배포된 전례가 없었으며, 생태계가 미성숙하고 커널 지원이 완전하지 않았고 문서도 추론해야 하는 경우가 많았다고 밝혔다.
GLM-5.3-Flash는 OpenCode와 OpenRouter에서 익명 모델명 Ox-Alpha로 테스트됐다. Z.ai에 따르면 출시 1주 안에 두 플랫폼 모두에서 가장 많이 사용된 모델이 됐고, 6일 동안 62조 토큰 이상을 처리했다.
Z.ai는 서빙 스택이 대역폭 대신 연산을, 장치 메모리 대신 통신을 활용하는 공격적인 메모리 최적화를 사용했다고 밝혔다. 이 스택은 노드 내부 텐서 병렬화, ReplaySSM, W8A8 양자화, INT8/FP8/BF16을 사용하는 혼합 정밀도 캐시 양자화, Layer Split, Encode-Prefill-Decode, 즉 EPD 분리형 아키텍처(서빙 단계를 자원별로 나누는 구조)를 결합했다. 이러한 최적화로 종단 간 서빙 성능은 약 3x 향상됐고, 하드웨어 활용 효율과 토큰당 비용은 주류 NVIDIA GPU와 견줄 만한 수준에 도달했다.
회사는 촘촘한 피드백이 Infra Agent를 엔지니어링 작업에 유용하게 만들었다고 밝혔다. Z.ai는 “TTFT increased by 30%”나 “output throughput dropped by 20%” 같은 종단 간 지표에만 의존하지 않고, 정확성 테스트, 런타임 로그, 실행 추적, 런타임 이벤트, 마이크로벤치마크, 종단 간 지표를 에이전트 작업 흐름에 통합했다. 목표는 문제를 특정 커널, 입력 조건, 코드 경로, 스레드, 실행 구간, 실행 파라미터와 연결하는 것이었다.
정확성 사례 중 하나는 KDA 커널의 Context Parallelism 경로에서 발생한 수치 정확도 문제였다. Z.ai는 CP 결과와 non-CP 결과를 비교한 결과 상태 전파와 병합 계산이 원인으로 좁혀졌다고 밝혔다. tl.dot은 입력이 FP32여도 기본값으로 TF32를 사용했고, 긴 컨텍스트에서 누적 오차가 발생했다. 수정은 두 연산에 input_precision="tf32x3"를 명시적으로 설정하는 방식으로 이뤄졌으며, 수치 정확도 수정 사항은 PR #1180을 통해 Flash Linear Attention 업스트림에 병합됐다.