llmfeed

SK텔레콤, 688B 규모 MoE 모델 A.X K2를 아파치 2.0으로 공개

SK텔레콤
  • SK텔레콤이 A.X K1의 후속인 MoE 언어 모델 A.X K2를 아파치 2.0 라이선스로 공개했다.
  • 총 688B 파라미터 중 토큰당 33B만 활성화되며, 생각 모드와 비생각 모드를 한 모델에서 고를 수 있고 컨텍스트는 256K다.
모델A.X K2
저장소skt/A.X-K2
모델A.X-K2-NVFP4
저장소skt/A.X-K2-NVFP4
개방성오픈형
컨텍스트 256K
파라미터 688B-A33B
라이선스 Apache-2.0

무엇이 나왔나

  • SK텔레콤이 A.X K1의 후속 모델인 A.X K2를 공개했다.
  • 텍스트만 다루는 범용 기반 모델이며, 아파치 2.0 라이선스로 가중치가 공개돼 연구와 상업적 이용이 모두 가능하다고 회사는 밝혔다.
  • 한국 정부의 Sovereign AI 기반 모델 사업의 하나로 개발됐고, 한국어와 한국 문화에 대한 이해를 갖춘 대규모 모델을 목표로 했다고 설명했다.

규모와 구조

  • 전문가 혼합(MoE) 구조의 디코더 전용 트랜스포머로, 전체 파라미터는 688B, 토큰당 활성 파라미터는 33B다.
  • 라우팅 전문가 256개와 공유 전문가 1개로 이뤄지고, 토큰마다 전문가 8개와 공유 전문가 1개가 켜진다. A.X K1에서는 라우팅 전문가가 192개였고, 활성 파라미터 수는 33B로 유지됐다.
  • 레이어 61개(밀집 1 + MoE 60), 어텐션 헤드 64개, 히든 크기 7168, 밀집 레이어 중간 크기 18432, 전문가 중간 크기 2048, 어휘 크기 163,840이다.
  • 컨텍스트 길이는 262,144 토큰(256K)이다. 128K까지는 직접 학습했고, YaRN 스케일링으로 256K까지 늘렸다.

어텐션과 정규화

  • 회사는 두 가지 기법을 묶은 Sparse Gated Attention(SGA) 을 썼다고 밝혔다.
  • Multi-head Latent Attention(MLA) 위에 헤드별 출력 게이트를 두고, 가벼운 인덱서가 질의마다 상위 k개(k = 2048) 토큰만 골라 긴 입력에서 어텐션 계산량을 줄인다.
  • 입력 길이가 수만 토큰대로 늘어날 때 A.X K1보다 처리량이 높고 출력 토큰당 시간(TPOT)과 첫 토큰까지의 시간(TTFT)이 짧다고 회사는 설명했다.
  • 또 RMSNorm 직후에 입력에 따라 달라지는 게이트를 두는 Gated Norm 을 적용해, 값이 크게 튀는 활성값을 억제했다고 밝혔다.
  • 이 덕분에 A.X K1에서 쓰던 이중 정규화 없이도 학습이 안정적으로 유지됐고, FP8·NVFP4 같은 저정밀 배포에 유리한 활성값 분포가 나왔다고 한다.

FP8 학습과 배포

  • A.X K2는 순전파와 역전파 모두 FP8(MXFP8, E4M3)로 처음부터 학습됐고, 마스터 가중치와 기울기는 FP32였다고 회사는 밝혔다.
  • 공개된 체크포인트도 블록 스케일 FP8(E4M3)로 배포돼 별도의 사후 양자화 없이 FP8로 서비스할 수 있고, BF16 대비 메모리 사용량이 절반이라고 설명했다.
  • FP8 가중치는 디스크에서 약 647GiB이고, KV 캐시와 활성값을 합치면 최소 800GiB 이상의 GPU 메모리를 잡아야 한다고 안내했다.

토크나이저는 A.X K1의 대용량 BBPE 기반 토크나이저를 물려받았고, 영어·한국어·중국어·일본어·스페인어 다섯 언어와 소스 코드·구조화된 텍스트에 맞춰 최적화됐다.

생각 모드와 비생각 모드

  • Think-Fusion 학습 방식으로 한 모델이 두 가지 응답 방식을 지원한다.
  • 생각 모드는 답 앞에 <think>...</think> 로 추론 과정을 만들고, 비생각 모드는 짧고 바로 답하는 응답을 만든다.
  • 프롬프트마다 생각·비생각 응답이 짝지어진 지도 미세조정 데이터로 한 갈래로 학습한 뒤 여러 단계의 온폴리시 강화학습을 거쳐, 범주별 특성이 아니라 명시적인 제어 토큰으로 모드를 익히게 했다고 회사는 설명했다.
  • 정확도가 중요할 때는 생각 모드, 지연이나 비용이 중요할 때는 비생각 모드를 쓰라고 권했다.

학습 데이터

  • 사전학습에는 웹 텍스트, 소스 코드, 논문, STEM·질의응답 자료, 도서, 합성 데이터를 합쳐 약 8.2조 토큰이 쓰였다.
  • 난도를 높여 가는 세 단계 커리큘럼(일반 지식 6.4조 → 고품질 추론 1.4조 → 롱컨텍스트 확장 0.36조)으로 구성됐고, 1단계 언어 비율은 영어 72.7%, 한국어 15.4%, 코드 8.3%, 일본어·스페인어·중국어가 각각 1% 안팎이다.
  • 후보 풀 약 16.2조 토큰을 걸러 실제 학습에 쓴 8.2조 토큰을 만들었다고 밝혔다.
  • 영어 웹 텍스트는 Nemotron-CC-v2.1이 가장 큰 비중을 차지하는 집계 코퍼스에서, 코드는 Nemotron-Pretraining-Code-v2에서, 다국어는 FineWeb2에서 왔다.
  • 한국어 웹 텍스트는 자체 수집(약 1.37조 토큰)에 자체 PDF 파싱과 합성 데이터를 더했으며, 이 자체 구성 요소는 공개하지 않는다.
  • 자체 수집 코퍼스는 학습 전에 내부 개인정보 마스킹을 거쳐, 이메일 주소나 전화번호 같은 식별자를 <|email|> 같은 유형별 대체 토큰으로 바꿨다고 밝혔다.
  • 자체 수집 웹 데이터는 robots.txt를 따라 모았다고 설명했다.
  • 후속 학습은 지도 미세조정 두 단계와 다중 과제 강화학습, 안전·레드팀 강화학습으로 이뤄졌다.
  • 지도 미세조정에는 도구 사용·수학·지식·코드·일반 대화·지시 따르기·안전을 다루는 생각/비생각 짝 데이터 약 60.6B 토큰이, 이어지는 강화학습에는 약 10만 개 프롬프트가 쓰였다.
  • 안전 학습은 ESSA를 바탕으로 하며 무조건 거부보다 안전한 응답에 보상을 준다고 밝혔다.

권한 용도와 권하지 않은 용도

  • 회사는 다단계 추론과 도구 사용, 한국어·영어 어시스턴트, 소프트웨어 개발, 수학과 지식 질의응답, 최대 256K 토큰의 롱컨텍스트 작업, 기반 모델로서의 추가 적응을 용도로 들었다.
  • 다만 완성된 응용이 아니므로 중요한 결정에는 사람이 개입하고 응용 수준의 안전장치를 더해야 한다고 밝혔다.
  • 반대로 의료, 금융 자격 판단, 채용, 법률, 법 집행, 안전에 직결되는 결정을 이 모델만으로 내려서는 안 된다고 했다.
  • 불법 콘텐츠나 타인의 권리를 침해하는 자료 생성, 표적 허위정보와 실제 인물·조직 사칭, 안전 동작 우회, 법적 근거 없는 개인정보 처리도 하지 말라고 요청했다.
  • 이미지·음성·영상 입력은 지원하지 않으며, 다섯 언어 밖의 언어는 검증되지 않았다.
  • 한계로는 사실 오류 가능성, 중국어·일본어·스페인어의 검증 부족, 웹 데이터에서 오는 사회적 편향, 적대적 프롬프트에 대한 안전성의 한계를 들었다.
  • 에이전트 능력은 중간 수준이며 BrowseComp에서 비교 모델보다 낮다고 스스로 밝혔고, 이는 후속 학습의 에이전트 강화학습이 제한적이었기 때문이라고 설명했다.
  • 편향에 대한 별도의 정량 평가는 하지 않았다고 덧붙였다.

실행 환경

  • A.X K2는 Hugging Face Transformers에서 axk2 아키텍처로 기본 지원되며, trust_remote_code=True 나 별도 모델링 파일이 필요하지 않다.
  • 이 통합은 v5.14.1 이후에 병합됐다.
  • Transformers 경로에서는 sdpa 와 eager 어텐션만 쓸 수 있고 flash_attention_2 와 flex_attention 은 지원하지 않으며, 희소 어텐션 선택을 밀집 마스크로 처리한다.
  • 긴 컨텍스트와 서비스 용도로는 vLLM 경로를 쓰라고 권했다.
  • vLLM은 회사가 만든 포크(upstream vLLM v0.23.0에 A.X K2 지원만 더한 것)로 돌아가며, 상위 저장소 반영은 준비 중이라고 밝혔다.
  • 256K 컨텍스트는 별도 플래그 없이 동작하고, needle-in-a-haystack 검색은 32K·128K·256K에서 확인했다고 한다.

그 밖의 결과

  • 회사는 최종 정답형 벤치마크 외에도 A.X K2가 IMO 2025에서 35/42점을 받아 앞의 다섯 문제를 모두 7/7로 맞히며 금메달 기준에 도달했고, 반복적 증명 개선 방법으로 KMO26 2차 8문제의 증명을 모두 맞혔다고 밝혔다.
  • NIAH 평가에서는 YaRN 스케일링 계수 1·2·4를 적용한 128K·256K·512K 모든 길이와 삽입 위치에서 만점을 받았고, NVFP4(전문가만 W4A4) 양자화 뒤에도 같았다고 설명했다.

벤치마크

벤치마크 무엇을 재나 A.X K2 (688B-A33B) A.X K1 (519B-A33B) Qwen3.5 (397B-A17B) Kimi-K2.6 (—)
AIME26 수학 경시 문제 풀이 97.1 91.3 92.5 95.4
Apex 고난도 수학 문제 45.8 1.0 13.5 20.8
Apex-shortlist 고난도 수학 문제 88.6 50.8 61.2 72.6
KMO26 (1st round) 한국수학올림피아드 문제 92.5 85.0 78.8 88.1
KMMLU-Pro 한국어 전문 지식 80.5 68.9 78.4 73.4
KoBALT 한국어 언어 능력 73.0 51.0 69.9 66.0
CLIcK 한국 문화·상식 이해 91.6 85.3 88.4 80.9
LiveCodeBench v6 (Feb–May) 코딩 문제 풀이 84.0 74.9 82.6 86.5
SciCode 과학 연구용 코드 작성 41.0 24.1 42.0 53.5
Humanity's Last Exam 전문가급 난제 지식 27.8 8.3 27.3 35.9
GPQA Diamond 대학원 수준 과학 문제 85.6 76.4 89.3 91.1
IFBench 지시 따르기 75.9 63.2 78.8 76.0
AA-LCR 긴 문서 기반 추론 66.0 26.0 65.7 69.7
τ²-Bench* (Telecom) 도구 사용 대화 처리 98.0 86.0 95.6 95.9
BrowseComp (≤10 searches) 웹 검색 기반 정보 탐색 9.3 – 26.9 21.5
RULER (overall) 긴 컨텍스트 이해 94.6 — — —
  • 모든 모델은 생각 모드로 평가됐고 점수는 백분율이다.
  • 별표(*)가 붙은 벤치마크는 Artificial Analysis가 측정했다.
  • RULER 종합값은 4K부터 256K까지의 평균이다.

같은 발표의 다른 판

원문