llmfeed

XHToken, 소형 범용 모델 Spark-X2.5-4B 공개

XHToken
  • XHToken이 범용 소형 모델 Spark-X2.5-4B를 아파치 2.0 라이선스로 공개했다.
  • 전체 어텐션 1개 층과 슬라이딩 윈도 어텐션 3개 층을 섞은 구조로 1M 토큰 컨텍스트를 기본 지원하고, 200개가 넘는 언어를 다룬다.
모델Spark-X2.5-4B
저장소XHToken/Spark-X2.5-4B
개방성오픈형
컨텍스트 1M
라이선스 Apache-2.0

무엇이 나왔나

  • XHToken이 Spark-X2.5-4B를 공개했다.
  • 대화·글쓰기·번역·추론·코딩·도구 사용·에이전트 작업 등 일상적인 여러 과제를 두루 다루도록 만든 범용 언어 모델이라고 회사는 설명한다.
  • 200개가 넘는 언어를 지원하며, 공개된 저장소에는 사후 학습을 마친 모델의 가중치와 설정 파일이 Hugging Face Transformers 형식으로 담겨 있다.
  • 라이선스는 Apache 2.0이다.

규모와 구조

  • 전체 어텐션 층 1개와 슬라이딩 윈도 어텐션(SWA) 층 3개를 결합한 하이브리드 어텐션 구조를 쓴다.
  • 회사는 이 설계로 긴 컨텍스트 모델에서 흔히 생기는 계산 부담을 줄이면서 최대 1M 토큰의 컨텍스트 창을 기본으로 지원한다고 밝혔다.
  • 에이전트 작업에서 성능과 추론 속도, KV 캐시 크기 사이의 균형을 맞추는 것을 목표로 두 방식의 장점을 합쳤다는 설명이다.
  • 배포와 호환 범위도 함께 공개됐다.
  • NVIDIA, 화웨이, Hygon, HOUMO.AI 등 여러 하드웨어 플랫폼을 지원하고, vLLM·SGLang·llama.cpp·MLX 같은 추론 프레임워크와 Ollama·LM Studio를 통한 배포, LLaMA-Factory를 이용한 미세조정이 가능하다.
  • 회사는 여러 하드웨어에서 비슷한 크기의 모델보다 TTFT와 TOPT, 전체 추론 효율이 낫다고 밝혔다.
  • 또한 Codex, Claude Code, OpenClaw, Hermes 등 에이전트 하네스와 긴밀히 연동된다고 덧붙였다.

학습

  • 사전 학습에는 웹 문서, 책, 학술 자료, 코드, 백과사전 자료를 아우르는 약 20조 토큰이 쓰였다.
  • 수학·논리·코드 등 비중이 높은 영역 사이의 데이터 배합을 여러 차례 실험해 정했다고 회사는 밝혔다.
  • 긴 컨텍스트 능력은 수천억 토큰 규모의 별도 학습 단계에서 시퀀스 길이를 1M 토큰까지 늘려가며 익혔다.
  • 사후 학습은 선별한 데이터로 지도 미세조정을 먼저 진행해 지시 따르기와 구조화된 출력, 과제 완수 능력을 갖추게 하고, 이어 언어 이해·추론·프로그래밍·도구 사용 에이전트 행동·지시 따르기 등 여러 영역에서 대규모 강화학습을 적용했다.
  • 이 과정에서 영역별로 특화된 교사 정책들이 만들어지고, 이를 MOPD로 하나의 배포용 모델에 합쳤다.
  • 학습은 화웨이 Ascend 클러스터에서 이뤄졌다.

벤치마크

벤치마크 무엇을 재나 Spark-X2.5-4B (—) Qwen3.5-4B (—) Gemma4-12B (—)
BFCL-V4 함수 호출·도구 사용 65.1 50.3* 37.4
τ²-bench 대화형 에이전트 과제 75.1 79.9* 69.0*
τ³-bench — 30.4 6.7 13.3
MCP-Atlas — 54.6 40.8* 30.5*
MCP-Mark — 14.2 12.5 –
Workspace Bench — 31.2 21.3 –
VitaBench2.0 — 25.2 18.2 12.4
BrowseComp 웹 탐색 정보 찾기 40.9 14.3 10.0
SWE-Bench Pro 실제 저장소 코드 수정 44.4 29.4* 21.9*
SWE-Bench Verified 실제 저장소 코드 수정 41.6 38.8* 44.2*
SWE-Bench Multilingual 여러 언어 코드 수정 53.3 27.7 32.5*
SciCode 과학 코드 작성 34.7 24.0 39.8
Gaokao 2026 중국 대입 시험 수학 133.4 130.3 130.6
AIME 2026 수학 경시 문제 90.7 83.0 82.1*
HMMT Feb 2026 수학 경시 문제 81.2 69.7 65.6
IMO-AnswerBench 올림피아드 수학 74.2 68.5 57.2
IFEval 지시 따르기 93.0 89.8* 94.8
IFBench 지시 따르기 75.0 59.2 73.5*
AA-LCR 긴 문맥 추론 56.3 57.0* 55.3*
HLE 전문가 수준 난문제 12.3 8.6 13.1
GPQA 대학원 수준 과학 지식 67.4 67.2 72.8
  • 모든 평가는 사고(thinking) 모드로 진행됐고, *는 공개된 모델 카드나 논문에 실린 값, –는 아직 측정되지 않은 항목이다.
  • Gaokao 2026은 2026년 중국 가오카오 5종(전국 I·전국 II·베이징·상하이·톈진)으로 각 150점 만점이다.

원문