모델 출시
XHToken, 더 작은 범용 모델 Spark-X2.5-1.7B도 함께 공개
- XHToken이 Spark-X2.5 계열의 작은 판인 Spark-X2.5-1.7B를 아파치 2.0으로 공개했다.
- 하이브리드 어텐션 구조와 1M 토큰 컨텍스트, 200개 넘는 언어 지원을 같은 계열에서 그대로 이어받았다.
| 모델 | Spark-X2.5-1.7B |
| 개방성 | 폐쇄형 |
| 컨텍스트 |
1M |
| 라이선스 |
Apache-2.0 |
무엇이 나왔나
- XHToken이 Spark-X2.5-1.7B를 공개했다.
- 대화·글쓰기·번역·추론·코딩·도구 사용·에이전트 작업을 두루 다루도록 만든 범용 소형 언어 모델로, 200개가 넘는 언어를 지원한다.
- 라이선스는 Apache 2.0이다.
규모와 구조
- 전체 어텐션 층 1개와 슬라이딩 윈도 어텐션(SWA) 층 3개를 결합한 하이브리드 어텐션 구조를 쓴다.
- 회사는 이 설계로 긴 컨텍스트 처리에 드는 계산 부담을 줄이면서 최대 1M 토큰 컨텍스트를 기본 지원하고, 성능과 추론 효율, KV 캐시 크기 사이의 균형을 맞췄다고 밝혔다.
- 하드웨어로는 NVIDIA, 화웨이, Hygon, HOUMO.AI 등을 지원하고, vLLM·SGLang·llama.cpp·MLX 같은 추론 프레임워크, Ollama·LM Studio를 통한 배포, LLaMA-Factory를 이용한 미세조정이 가능하다.
- Codex, Claude Code, OpenClaw, Hermes 등 에이전트 하네스와 연동된다고 회사는 밝혔다.
학습
- 사전 학습에는 웹 문서, 책, 학술 자료, 코드, 백과사전 자료를 아우르는 약 20조 토큰이 쓰였다.
- 긴 컨텍스트 능력은 수천억 토큰 규모의 별도 단계에서 시퀀스 길이를 1M 토큰까지 늘려가며 익혔다.
- 사후 학습은 지도 미세조정으로 지시 따르기와 구조화된 출력 능력을 세운 뒤, 언어 이해·추론·프로그래밍·도구 사용 에이전트 행동·지시 따르기 영역에서 대규모 강화학습을 적용했고, 영역별 교사 정책을 MOPD로 하나의 배포용 모델에 합쳤다.
- 학습은 화웨이 Ascend 클러스터에서 이뤄졌다.
벤치마크
| 벤치마크 |
무엇을 재나 |
Spark-X2.5-1.7B (—) |
Qwen3.5-2B (—) |
Gemma4-12B (—) |
| BFCL-V4 |
함수 호출·도구 사용 |
46.9 |
43.6* |
37.4 |
| τ²-bench |
대화형 에이전트 과제 |
65.3 |
48.8* |
69.0* |
| τ³-bench |
— |
20.1 |
4.1 |
13.3 |
| MCP-Atlas |
— |
23.4 |
14.8 |
30.5* |
| MCP-Mark |
— |
2.3 |
– |
– |
| Workspace Bench |
— |
18.9 |
7.7 |
– |
| VitaBench2.0 |
— |
8.3 |
5.2 |
12.4 |
| BrowseComp |
웹 탐색 정보 찾기 |
29.7 |
3.1 |
10.0 |
| SWE-Bench Pro |
실제 저장소 코드 수정 |
10.4 |
1.9 |
21.9* |
| SWE-Bench Verified |
실제 저장소 코드 수정 |
28.3 |
6.8 |
44.2* |
| SWE-Bench Multilingual |
여러 언어 코드 수정 |
23.3 |
5.0 |
32.5* |
| SciCode |
과학 코드 작성 |
18.2 |
6.0 |
39.8 |
| Gaokao 2026 |
중국 대입 시험 수학 |
114.8 |
94.0 |
130.6 |
| AIME 2026 |
수학 경시 문제 |
69.4 |
30.8 |
82.1* |
| HMMT Feb 2026 |
수학 경시 문제 |
48.4 |
21.5 |
65.6 |
| IMO-AnswerBench |
올림피아드 수학 |
45.4 |
– |
57.2 |
| IFEval |
지시 따르기 |
89.5 |
78.6* |
94.8 |
| IFBench |
지시 따르기 |
66.3 |
41.3* |
73.5* |
| AA-LCR |
긴 문맥 추론 |
24.3 |
25.6* |
55.3* |
| HLE |
전문가 수준 난문제 |
6.3 |
2.1 |
13.1 |
| GPQA |
대학원 수준 과학 지식 |
43.8 |
44.6 |
72.8 |
- 모든 평가는 사고(thinking) 모드로 진행됐고,
*는 공개된 모델 카드나 논문에 실린 값, –는 아직 측정되지 않은 항목이다. - Gaokao 2026은 2026년 중국 가오카오 5종(전국 I·전국 II·베이징·상하이·톈진)으로 각 150점 만점이다.