llmfeed

XHToken, 더 작은 범용 모델 Spark-X2.5-1.7B도 함께 공개

XHToken
  • XHToken이 Spark-X2.5 계열의 작은 판인 Spark-X2.5-1.7B를 아파치 2.0으로 공개했다.
  • 하이브리드 어텐션 구조와 1M 토큰 컨텍스트, 200개 넘는 언어 지원을 같은 계열에서 그대로 이어받았다.
모델Spark-X2.5-1.7B
개방성폐쇄형
컨텍스트 1M
라이선스 Apache-2.0

무엇이 나왔나

  • XHToken이 Spark-X2.5-1.7B를 공개했다.
  • 대화·글쓰기·번역·추론·코딩·도구 사용·에이전트 작업을 두루 다루도록 만든 범용 소형 언어 모델로, 200개가 넘는 언어를 지원한다.
  • 라이선스는 Apache 2.0이다.

규모와 구조

  • 전체 어텐션 층 1개와 슬라이딩 윈도 어텐션(SWA) 층 3개를 결합한 하이브리드 어텐션 구조를 쓴다.
  • 회사는 이 설계로 긴 컨텍스트 처리에 드는 계산 부담을 줄이면서 최대 1M 토큰 컨텍스트를 기본 지원하고, 성능과 추론 효율, KV 캐시 크기 사이의 균형을 맞췄다고 밝혔다.
  • 하드웨어로는 NVIDIA, 화웨이, Hygon, HOUMO.AI 등을 지원하고, vLLM·SGLang·llama.cpp·MLX 같은 추론 프레임워크, Ollama·LM Studio를 통한 배포, LLaMA-Factory를 이용한 미세조정이 가능하다.
  • Codex, Claude Code, OpenClaw, Hermes 등 에이전트 하네스와 연동된다고 회사는 밝혔다.

학습

  • 사전 학습에는 웹 문서, 책, 학술 자료, 코드, 백과사전 자료를 아우르는 약 20조 토큰이 쓰였다.
  • 긴 컨텍스트 능력은 수천억 토큰 규모의 별도 단계에서 시퀀스 길이를 1M 토큰까지 늘려가며 익혔다.
  • 사후 학습은 지도 미세조정으로 지시 따르기와 구조화된 출력 능력을 세운 뒤, 언어 이해·추론·프로그래밍·도구 사용 에이전트 행동·지시 따르기 영역에서 대규모 강화학습을 적용했고, 영역별 교사 정책을 MOPD로 하나의 배포용 모델에 합쳤다.
  • 학습은 화웨이 Ascend 클러스터에서 이뤄졌다.

벤치마크

벤치마크 무엇을 재나 Spark-X2.5-1.7B (—) Qwen3.5-2B (—) Gemma4-12B (—)
BFCL-V4 함수 호출·도구 사용 46.9 43.6* 37.4
τ²-bench 대화형 에이전트 과제 65.3 48.8* 69.0*
τ³-bench — 20.1 4.1 13.3
MCP-Atlas — 23.4 14.8 30.5*
MCP-Mark — 2.3 – –
Workspace Bench — 18.9 7.7 –
VitaBench2.0 — 8.3 5.2 12.4
BrowseComp 웹 탐색 정보 찾기 29.7 3.1 10.0
SWE-Bench Pro 실제 저장소 코드 수정 10.4 1.9 21.9*
SWE-Bench Verified 실제 저장소 코드 수정 28.3 6.8 44.2*
SWE-Bench Multilingual 여러 언어 코드 수정 23.3 5.0 32.5*
SciCode 과학 코드 작성 18.2 6.0 39.8
Gaokao 2026 중국 대입 시험 수학 114.8 94.0 130.6
AIME 2026 수학 경시 문제 69.4 30.8 82.1*
HMMT Feb 2026 수학 경시 문제 48.4 21.5 65.6
IMO-AnswerBench 올림피아드 수학 45.4 – 57.2
IFEval 지시 따르기 89.5 78.6* 94.8
IFBench 지시 따르기 66.3 41.3* 73.5*
AA-LCR 긴 문맥 추론 24.3 25.6* 55.3*
HLE 전문가 수준 난문제 6.3 2.1 13.1
GPQA 대학원 수준 과학 지식 43.8 44.6 72.8
  • 모든 평가는 사고(thinking) 모드로 진행됐고, *는 공개된 모델 카드나 논문에 실린 값, –는 아직 측정되지 않은 항목이다.
  • Gaokao 2026은 2026년 중국 가오카오 5종(전국 I·전국 II·베이징·상하이·톈진)으로 각 150점 만점이다.

원문