모델 출시
Z.ai, 사후 학습만 새로 한 GLM-5.3 공개
- Z.ai가 GLM-5.3을 공개했다.
- 베이스 모델은 GLM-5.2와 같고 사후 학습만으로 복잡한 코딩과 장기 과제 성능을 끌어올렸다고 밝혔다.
- 사내 코드 벤치마크에서는 GLM-5.2 대비 50% 향상됐다고 한다.
| 모델 | GLM-5.3 |
|---|---|
| 저장소 | zai-org/GLM-5.3 |
| 모델 | GLM-5.3-BF16 |
| 저장소 | zai-org/GLM-5.3-BF16 |
| 개방성 | 오픈형 |
| 라이선스 | glm-5.3 |
무엇이 나왔나
- Z.ai가 텍스트 생성 모델 GLM-5.3을 공개했다.
- 회사는 이 모델이 GLM-5.2와 견줘 복잡한 코딩과 오래 이어지는 과제에서 크게 나아졌다고 밝혔다.
- 영어와 중국어를 지원한다고 적혀 있다.
- 또 하나 회사가 내세운 것은 보안 관련 능력이다.
- 사후 학습 규모를 키우자 예상보다 빠르게 이 능력이 자라났고, 취약점 발견을 재는 CyberGym에서 가장 높은 점수를 냈으며, 공격 사슬의 뒷단으로 갈수록 향상 폭이 커져 익스플로잇 계열 벤치마크에서는 GLM-5.2의 두 배가 넘는다고 밝혔다.
규모와 구조
- GLM-5.3은 GLM-5.2와 같은 베이스 모델을 쓴다.
- 회사는 모든 성능 향상이 사후 학습에서 나온 것이라고 설명했다.
- 가중치는 Hugging Face에 공개돼 있으며, BF16 판(zai-org/GLM-5.3-BF16)도 함께 올라와 있다.
- 라이선스 이름은 glm-5.3이다.
배포는 SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth에서 지원하며, Ascend NPU 환경에서는 vLLM-Ascend, xLLM, SGLang 같은 추론 프레임워크를 쓸 수 있다고 밝혔다.
회사가 밝힌 수치
- 사내 Z.ai Code Bench에서 GLM-5.2보다 50% 향상됐다.
- Terminal Bench 3.0과 Agents' Last Exam을 비롯한 공개 벤치마크에서 오픈소스 모델 가운데 가장 높은 점수를 냈다.
- 익스플로잇 계열 벤치마크에서 GLM-5.2의 두 배를 넘는 점수를 냈다.
사고 예산 조절과 채팅 설정
- GLM-5.3은
reasoning_effort값으로 생각하는 분량을 조절할 수 있다. low,high,max세 단계를 받으며, 값을 넘기지 않거나 다른 값을 넣으면max로 동작한다.low나high를 쓰려면 직접 넘겨야 한다.- 벤치마크 점수를 재현하려면 기본값인
max를 그대로 두라고 회사는 안내했다.
- 채팅 템플릿의
clear_thinking은 값을 넘기지 않으면false가 된다. - 대화 용도로 쓸 때는
clear_thinking=true를 직접 넘기라고 밝혔다.
벤치마크
| 벤치마크 | 무엇을 재나 | GLM-5.3 (—) | GLM-5.2 (—) | Kimi K3 (—) | GPT-5.6 Sol (—) |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 터미널 환경 작업 수행 | 88.2 | 81.0 | 88.3 | 88.8 |
| Terminal Bench 3.0 | 터미널 환경 작업 수행 | 28.3 | 4.6 | 17.4 | 34.6 |
| DeepSWE (v1.1) | — | 66.9 | 46.2 | 67.5 | 72.7 |
| NL2Repo | — | 58.0 | 48.9 | 58.0 | — |
| ProgramBench (Almost Solved) | — | 19.0 | 9.5 | 17.5 | 23.0 |
| FrontierSWE | — | 78.1 | 67.5 | — | — |
| SWE-Marathon (v1.1) | — | 42.5 | 19.4 | 48.1 | 42.5 |
| PostTrainBench | — | 39.8 | 31.7 | 32.0 | 36.2 |
| CyberGym | 취약점 발견 | 84.5 | 77.2 | 80.0 | 83.6 |
| ExploitGym (2h / 6h) | 취약점 공격 수행 | 105 / 130 | 29 / 39 | 36 / 70 | 216 / 293 |
| ExploitBench | 취약점 공격 수행 | 54.4 | 24.4 | 32.2 | 76.5 |
| Toolathlon Verified | 도구 사용 | 73.0 | 59.9 | 76.5 | 74.9 |
| AutomationBench (v1.0.6) | — | 48.2 | 26.2 | 46.7 | 45.8 |
| Agents' Last Exam (ALE-CLI) | — | 28.5 | 23.8 | 27.6 | 28.6 |
| HLE w/ Tools | 도구를 쓴 고난도 문제 풀이 | 62.5 | 54.7 | 59.8 | 64.5 |
| GDPval-AA v2 | — | 1769 | 1508 | 1682 | 1730 |
- 측정 조건은 항목마다 다르다.
- 회사는 Terminal Bench 2.1·3.0, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon 등을 Claude Code 2.1.207 환경에서 쟀고, GDPval-AA v2는 Artificial Analysis가, FrontierSWE는 Proximal이 측정했다고 밝혔다.