llmfeed

중국텔레콤 인공지능기술, MoE 모델 Xing4.0-29B-A4B 공개

XingChen
  • 중국텔레콤 인공지능기술이 Xing 계열 신모델 Xing4.0-29B-A4B를 Apache 2.0으로 공개했다.
  • 전체 29B 가운데 토큰당 4B만 활성화하는 MoE 구조이며, 256K 컨텍스트를 기본 지원하고 512K까지 늘릴 수 있다.
모델Xing4.0-29B-A4B
저장소XingChen-AGI/Xing4.0-29B-A4B
개방성오픈형
파라미터 29B (4B active)
라이선스 Apache-2.0

무엇이 나왔나

  • 중국텔레콤 인공지능기술(China Telecom Artificial Intelligence Technology Co., Ltd.)이 Xing 계열의 새 대규모 언어 모델 Xing4.0-29B-A4B를 공개했다.
  • Xing 계열은 이전에 TeleChat으로 불렸던 계보다.
  • 가중치와 설정 파일은 Hugging Face Transformers 형식으로 배포되며, 라이선스는 Apache 2.0이다.
  • 회사는 Transformers와 vLLM, SGLang, KTransformers 등 주요 추론 프레임워크에서 쓸 수 있다고 밝혔다.

회사는 이 모델이 mHC + MLA + MTP 구조를 바탕으로 여러 단계 계획 수립, 도구 호출, 복잡한 추론 연쇄 실행을 지원하며, 긴 컨텍스트에서도 작업 일관성과 실행 안정성을 유지하도록 만들었다고 설명했다.

  • 미세조정은 LLaMA-Factory와 MindFormers를, 추론과 배포는 SGLang, vLLM, KTransformers를 지원한다.
  • 또한 OpenCode, Claude Code, OpenClaw, Hermes 같은 에이전트 프레임워크에 맞춘 적응과 형식 정렬을 했다고 밝혔다.
  • 회사가 권한 용도는 자체 데이터로 가볍게 손보는 하위 과제 미세조정이다.
  • 의도 분류, 표 이해, 계약서 검토, 지식 기반 질의응답 같은 특정 분야에 맞춘 활용을 예로 들었다.

규모와 구조

  • 전체 파라미터는 29B이고 토큰당 활성화되는 파라미터는 4B다.
  • 컨텍스트 길이는 256K를 기본으로 지원하며 512K까지 확장할 수 있다.
항목 값
파라미터 29B (4B 활성)
레이어 수 40
히든 크기 3584
Dense FFN 중간 크기 9216
전문가 중간 크기 1024
어텐션 방식 MLA
라우팅 전문가 수 64
토큰당 활성 전문가 수 4
공유 전문가 수 1
컨텍스트 길이 256K (512K까지 확장 가능)

회사가 밝힌 수치

  • 회사는 이 모델이 이 규모에서 전 과정을 Ascend NPU 플랫폼과 MindSpore 프레임워크로만 학습한 첫 모델이라고 밝혔다.
  • 학습은 MindSpore/MindFormers를 이용해 Ascend 910C 클러스터에 맞췄고, mHC를 위한 기능 적응과 융합 연산자 개발을 함께 했다고 설명했다.

또한 세밀한 MoE 통신 최적화, 선택적 재계산, DVM 자동 그래프-연산자 융합, Ascend C mHC 융합 연산자 등을 더해 학습 처리량을 기본 상태보다 약 96% 끌어올렸다고 밝혔다.

벤치마크

벤치마크 무엇을 재나 Xing4.0-29B-A4B (29B-A4B) Gemma4-26B-A4B (26B-A4B) Qwen3.6-35B-A3B (35B-A3B)
IFBench 지시 따르기 69.67 72.67 65.50
AIME2026 수학 경시 문제 풀이 90.00 88.30 92.70
AA.LCR — 61.00 66.00 62.00
Tau3-Bench 도구 쓰는 대화 에이전트 64.63 58.90 67.20
Claw-Eval — 76.55 71.49 74.54
SWE-bench Verified 실제 저장소 버그 수정 75.00 53.00 76.00
Terminal-Bench 2.1 터미널 작업 수행 57.50 30.00 51.50
SWE-bench Multilingual 여러 언어 코드 수정 66.00 51.00 67.20
DeepresearchBII — 60.80 39.30 59.70

회사는 SWE-bench Verified와 SWE-bench Multilingual은 SWE-agent 하네스에서 210K 컨텍스트로, Terminal-Bench 2.1은 terminus-2에서 24시간 제한과 3회 평균으로, Claw-Eval과 DeepresearchBII는 256K 컨텍스트로 측정했다고 밝혔다.

원문