llmfeed

Z.ai, 사후 학습만 새로 한 GLM-5.3 공개

Z.ai
  • Z.ai가 GLM-5.3을 공개했다.
  • 베이스 모델은 GLM-5.2와 같고 사후 학습만으로 복잡한 코딩과 장기 과제 성능을 끌어올렸다고 밝혔다.
  • 사내 코드 벤치마크에서는 GLM-5.2 대비 50% 향상됐다고 한다.
모델GLM-5.3
저장소zai-org/GLM-5.3
모델GLM-5.3-BF16
저장소zai-org/GLM-5.3-BF16
개방성오픈형
라이선스 glm-5.3

무엇이 나왔나

  • Z.ai가 텍스트 생성 모델 GLM-5.3을 공개했다.
  • 회사는 이 모델이 GLM-5.2와 견줘 복잡한 코딩과 오래 이어지는 과제에서 크게 나아졌다고 밝혔다.
  • 영어와 중국어를 지원한다고 적혀 있다.
  • 또 하나 회사가 내세운 것은 보안 관련 능력이다.
  • 사후 학습 규모를 키우자 예상보다 빠르게 이 능력이 자라났고, 취약점 발견을 재는 CyberGym에서 가장 높은 점수를 냈으며, 공격 사슬의 뒷단으로 갈수록 향상 폭이 커져 익스플로잇 계열 벤치마크에서는 GLM-5.2의 두 배가 넘는다고 밝혔다.

규모와 구조

  • GLM-5.3은 GLM-5.2와 같은 베이스 모델을 쓴다.
  • 회사는 모든 성능 향상이 사후 학습에서 나온 것이라고 설명했다.
  • 가중치는 Hugging Face에 공개돼 있으며, BF16 판(zai-org/GLM-5.3-BF16)도 함께 올라와 있다.
  • 라이선스 이름은 glm-5.3이다.

배포는 SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth에서 지원하며, Ascend NPU 환경에서는 vLLM-Ascend, xLLM, SGLang 같은 추론 프레임워크를 쓸 수 있다고 밝혔다.

회사가 밝힌 수치

  • 사내 Z.ai Code Bench에서 GLM-5.2보다 50% 향상됐다.
  • Terminal Bench 3.0과 Agents' Last Exam을 비롯한 공개 벤치마크에서 오픈소스 모델 가운데 가장 높은 점수를 냈다.
  • 익스플로잇 계열 벤치마크에서 GLM-5.2의 두 배를 넘는 점수를 냈다.

사고 예산 조절과 채팅 설정

  • GLM-5.3은 reasoning_effort 값으로 생각하는 분량을 조절할 수 있다.
  • low, high, max 세 단계를 받으며, 값을 넘기지 않거나 다른 값을 넣으면 max로 동작한다.
  • low나 high를 쓰려면 직접 넘겨야 한다.
  • 벤치마크 점수를 재현하려면 기본값인 max를 그대로 두라고 회사는 안내했다.
  • 채팅 템플릿의 clear_thinking은 값을 넘기지 않으면 false가 된다.
  • 대화 용도로 쓸 때는 clear_thinking=true를 직접 넘기라고 밝혔다.

벤치마크

벤치마크 무엇을 재나 GLM-5.3 (—) GLM-5.2 (—) Kimi K3 (—) GPT-5.6 Sol (—)
Terminal Bench 2.1 터미널 환경 작업 수행 88.2 81.0 88.3 88.8
Terminal Bench 3.0 터미널 환경 작업 수행 28.3 4.6 17.4 34.6
DeepSWE (v1.1) — 66.9 46.2 67.5 72.7
NL2Repo — 58.0 48.9 58.0 —
ProgramBench (Almost Solved) — 19.0 9.5 17.5 23.0
FrontierSWE — 78.1 67.5 — —
SWE-Marathon (v1.1) — 42.5 19.4 48.1 42.5
PostTrainBench — 39.8 31.7 32.0 36.2
CyberGym 취약점 발견 84.5 77.2 80.0 83.6
ExploitGym (2h / 6h) 취약점 공격 수행 105 / 130 29 / 39 36 / 70 216 / 293
ExploitBench 취약점 공격 수행 54.4 24.4 32.2 76.5
Toolathlon Verified 도구 사용 73.0 59.9 76.5 74.9
AutomationBench (v1.0.6) — 48.2 26.2 46.7 45.8
Agents' Last Exam (ALE-CLI) — 28.5 23.8 27.6 28.6
HLE w/ Tools 도구를 쓴 고난도 문제 풀이 62.5 54.7 59.8 64.5
GDPval-AA v2 — 1769 1508 1682 1730
  • 측정 조건은 항목마다 다르다.
  • 회사는 Terminal Bench 2.1·3.0, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon 등을 Claude Code 2.1.207 환경에서 쟀고, GDPval-AA v2는 Artificial Analysis가, FrontierSWE는 Proximal이 측정했다고 밝혔다.

같은 발표의 다른 판

원문