모델 출시
XHToken, 소형 범용 모델 Spark-X2.5-4B 공개
- XHToken이 범용 소형 모델 Spark-X2.5-4B를 아파치 2.0 라이선스로 공개했다.
- 전체 어텐션 1개 층과 슬라이딩 윈도 어텐션 3개 층을 섞은 구조로 1M 토큰 컨텍스트를 기본 지원하고, 200개가 넘는 언어를 다룬다.
무엇이 나왔나
- XHToken이 Spark-X2.5-4B를 공개했다.
- 대화·글쓰기·번역·추론·코딩·도구 사용·에이전트 작업 등 일상적인 여러 과제를 두루 다루도록 만든 범용 언어 모델이라고 회사는 설명한다.
- 200개가 넘는 언어를 지원하며, 공개된 저장소에는 사후 학습을 마친 모델의 가중치와 설정 파일이 Hugging Face Transformers 형식으로 담겨 있다.
- 라이선스는 Apache 2.0이다.
규모와 구조
- 전체 어텐션 층 1개와 슬라이딩 윈도 어텐션(SWA) 층 3개를 결합한 하이브리드 어텐션 구조를 쓴다.
- 회사는 이 설계로 긴 컨텍스트 모델에서 흔히 생기는 계산 부담을 줄이면서 최대 1M 토큰의 컨텍스트 창을 기본으로 지원한다고 밝혔다.
- 에이전트 작업에서 성능과 추론 속도, KV 캐시 크기 사이의 균형을 맞추는 것을 목표로 두 방식의 장점을 합쳤다는 설명이다.
- 배포와 호환 범위도 함께 공개됐다.
- NVIDIA, 화웨이, Hygon, HOUMO.AI 등 여러 하드웨어 플랫폼을 지원하고, vLLM·SGLang·llama.cpp·MLX 같은 추론 프레임워크와 Ollama·LM Studio를 통한 배포, LLaMA-Factory를 이용한 미세조정이 가능하다.
- 회사는 여러 하드웨어에서 비슷한 크기의 모델보다 TTFT와 TOPT, 전체 추론 효율이 낫다고 밝혔다.
- 또한 Codex, Claude Code, OpenClaw, Hermes 등 에이전트 하네스와 긴밀히 연동된다고 덧붙였다.
학습
- 사전 학습에는 웹 문서, 책, 학술 자료, 코드, 백과사전 자료를 아우르는 약 20조 토큰이 쓰였다.
- 수학·논리·코드 등 비중이 높은 영역 사이의 데이터 배합을 여러 차례 실험해 정했다고 회사는 밝혔다.
- 긴 컨텍스트 능력은 수천억 토큰 규모의 별도 학습 단계에서 시퀀스 길이를 1M 토큰까지 늘려가며 익혔다.
- 사후 학습은 선별한 데이터로 지도 미세조정을 먼저 진행해 지시 따르기와 구조화된 출력, 과제 완수 능력을 갖추게 하고, 이어 언어 이해·추론·프로그래밍·도구 사용 에이전트 행동·지시 따르기 등 여러 영역에서 대규모 강화학습을 적용했다.
- 이 과정에서 영역별로 특화된 교사 정책들이 만들어지고, 이를 MOPD로 하나의 배포용 모델에 합쳤다.
- 학습은 화웨이 Ascend 클러스터에서 이뤄졌다.
벤치마크
| 벤치마크 |
무엇을 재나 |
Spark-X2.5-4B (—) |
Qwen3.5-4B (—) |
Gemma4-12B (—) |
| BFCL-V4 |
함수 호출·도구 사용 |
65.1 |
50.3* |
37.4 |
| τ²-bench |
대화형 에이전트 과제 |
75.1 |
79.9* |
69.0* |
| τ³-bench |
— |
30.4 |
6.7 |
13.3 |
| MCP-Atlas |
— |
54.6 |
40.8* |
30.5* |
| MCP-Mark |
— |
14.2 |
12.5 |
– |
| Workspace Bench |
— |
31.2 |
21.3 |
– |
| VitaBench2.0 |
— |
25.2 |
18.2 |
12.4 |
| BrowseComp |
웹 탐색 정보 찾기 |
40.9 |
14.3 |
10.0 |
| SWE-Bench Pro |
실제 저장소 코드 수정 |
44.4 |
29.4* |
21.9* |
| SWE-Bench Verified |
실제 저장소 코드 수정 |
41.6 |
38.8* |
44.2* |
| SWE-Bench Multilingual |
여러 언어 코드 수정 |
53.3 |
27.7 |
32.5* |
| SciCode |
과학 코드 작성 |
34.7 |
24.0 |
39.8 |
| Gaokao 2026 |
중국 대입 시험 수학 |
133.4 |
130.3 |
130.6 |
| AIME 2026 |
수학 경시 문제 |
90.7 |
83.0 |
82.1* |
| HMMT Feb 2026 |
수학 경시 문제 |
81.2 |
69.7 |
65.6 |
| IMO-AnswerBench |
올림피아드 수학 |
74.2 |
68.5 |
57.2 |
| IFEval |
지시 따르기 |
93.0 |
89.8* |
94.8 |
| IFBench |
지시 따르기 |
75.0 |
59.2 |
73.5* |
| AA-LCR |
긴 문맥 추론 |
56.3 |
57.0* |
55.3* |
| HLE |
전문가 수준 난문제 |
12.3 |
8.6 |
13.1 |
| GPQA |
대학원 수준 과학 지식 |
67.4 |
67.2 |
72.8 |
- 모든 평가는 사고(thinking) 모드로 진행됐고,
*는 공개된 모델 카드나 논문에 실린 값, –는 아직 측정되지 않은 항목이다. - Gaokao 2026은 2026년 중국 가오카오 5종(전국 I·전국 II·베이징·상하이·톈진)으로 각 150점 만점이다.