모델 출시
Z.ai, GLM-5 계열 첫 멀티모달 모델 GLM-5.3-Flash 공개
- Z.ai가 GLM-5 계열 첫 네이티브 멀티모달 모델 GLM-5.3-Flash를 공개했다.
- 전체 파라미터 320B에 활성 파라미터는 18B이며, 희소 어텐션과 선형 어텐션을 섞은 구조를 처음 적용했다.
- MIT 라이선스로 공개됐다.
| 모델 | GLM-5.3-Flash |
|---|---|
| 저장소 | zai-org/GLM-5.3-Flash |
| 개방성 | 오픈형 |
| 파라미터 | 320B |
| 라이선스 | MIT |
무엇이 나왔나
- Z.ai가 GLM-5.3-Flash를 공개했다.
- 회사는 이 모델이 GLM-5 계열에서 처음으로 태생부터 멀티모달로 만들어진 모델이라고 밝혔다.
- 모델 카드에는 영어와 중국어가 지원 언어로 적혀 있고, 텍스트 생성 용도로 분류되어 있으며 MIT 라이선스로 배포된다.
- 가중치는 Hugging Face에 공개됐고, SGLang·vLLM·TokenSpeed·KTransformers로 직접 서비스에 올릴 수 있다.
- Z.ai API Platform에서 API로도 쓸 수 있다.
규모와 구조
- 전체 파라미터는 320B이고, 이 가운데 실제로 활성화되는 파라미터는 18B이다.
- 회사는 새로 학습한 베이스 모델에서 출발했으며, 성능과 효율을 함께 노려 구조와 학습 방식을 다시 설계했다고 밝혔다.
- GLM 계열에서 처음으로 희소 어텐션과 선형 어텐션을 결합한 하이브리드 구조를 도입했다.
- 회사는 이 구조로 긴 문맥을 다룰 때의 서비스 비용을 크게 낮추면서도 긴 문맥 처리 능력은 유지했다고 설명했다.
- 또한 확장 효율을 높이기 위해 Manifold-Constrained Hyper-Connections(mHC)를 적용했다.
사전학습에는 30조(30T) 토큰 규모의 멀티모달 말뭉치를 썼다고 밝혔다.
회사가 밝힌 수치
- 회사는 GLM-5.3-Flash가 여러 벤치마크와 실제 작업에서 GLM-5.2를 앞서면서 가격은 10분의 1 수준이라고 밝혔다.
- 또 코딩과 에이전트 벤치마크에서는 Claude Opus 4.8에 근접했다고 밝혔다.
- 다만 모델 카드에는 개별 점수가 표로 실려 있지 않다.
- 카드에는 평가에 쓴 벤치마크의 측정 조건이 적혀 있다.
- HLE w/ tools(전체 세트)는 최대 생성 길이 163,840토큰, 최대 문맥 길이 300,000토큰에서 문맥 관리 전략을 써서 측정했고 채점 모델로 GPT-5.6-luna(medium)를 썼다.
- NL2Repo는 1M 문맥에서 max_new_tokens 64k로, DeepSWE는 mini-swe-agent 하네스와 400K 문맥에서, Terminal-Bench 2.1은 Claude Code 2.1.207에서 측정했다.
- Toolathlon Verified는 공식 평가 서비스를 통해 3회 독립 실행의 pass@1 평균을 보고했고, AutomationBench는 v1.0.6에서, GDPval-AA v2는 Artificial Analysis가 평가했다.
- BabyVision은 최대 문맥 164K 토큰에서 입력 이미지의 짧은 변을 최소 1.5K 픽셀로 맞춰 측정했다.