llmfeed

Motif Technologies, 314B 규모 MoE 모델 Motif 3 공개

모티프
  • Motif Technologies가 총 314B 파라미터 중 토큰당 13.2B만 쓰는 MoE 모델 Motif 3를 냈다.
  • 256K 컨텍스트를 지원하고, 가중치는 MIT 라이선스로 신청 없이 누구나 받을 수 있다.
모델Motif 3
저장소Motif-Technologies/Motif-3
모델Motif-3-NVFP4
저장소Motif-Technologies/Motif-3-NVFP4
개방성오픈형
컨텍스트 262,144
파라미터 314B-A13B
라이선스 MIT

무엇이 나왔나

  • Motif Technologies가 디코더 전용 Mixture-of-Experts(MoE) 언어 모델 Motif 3를 공개했다.
  • 전체 파라미터는 약 3,140억 개이고 토큰마다 실제로 쓰이는 파라미터는 약 132억 개다.
  • 회사는 이 모델을 자체 설계로 처음부터 만들었다고 밝혔다.

구조

회사가 밝힌 사양은 다음과 같다.

  • 층 수 53개(밀집 2개 + MoE 51개), 은닉 차원 4096, 첫 두 층의 밀집 FFN 중간 차원 12,288
  • 어텐션은 Grouped Differential Latent Attention(GDLA)이며 출력에 게이트를 둔다. 쿼리 헤드 80개, KV 헤드 16개
  • 라우팅 전문가 384개 중 토큰당 8개를 쓰고, 공유 전문가 1개를 함께 쓴다
  • 활성 함수는 Expert-Specific PolyNorm, 잔차 연결은 수정된 manifold-constrained hyper-connections(mHC)
  • Multi-Token Prediction(MTP) 헤드 1개 층을 내장해 self-speculative decoding을 지원한다
  • 컨텍스트 길이 262,144(256K), 어휘 크기 220,160, 텐서 형식 bfloat16
  • 회사 설명에 따르면 GDLA는 비대칭 신호·잡음 헤드와 토큰에 따라 달라지는 차분 계수를 쓰는 grouped differential attention에 Multi-head Latent Attention의 압축된 KV 잠재 표현을 합친 것으로, KV 캐시 요구량을 크게 줄인다.
  • Expert-Specific PolyNorm은 SiLU 게이트를 전문가별로 따로 학습되는 다항 정규화로 바꿔 활성값의 이상치를 줄인다.
  • mHC는 일반적인 잔차 덧셈을 4개 병렬 잔차 흐름의 이중 확률(Birkhoff 폴리토프) 혼합으로 대체하며, 사후 매핑 배수를 사전학습 동안 2에서 1로 서서히 낮춘다.

학습

  • 사전학습은 약 12.5조 토큰으로 이뤄졌고, 웹 문서·STEM·코드·수학·다국어·특화 도메인 자료를 담았다.
  • 한국어와 추론 중심 자료, 법률·금융 자료에 비중을 더 뒀다고 회사는 밝혔다.
  • 사후학습은 일반 지도 미세조정, 강화학습으로 훈련한 6개 전문 교사 모델, 소프트웨어 공학 교사 모델을 Multi-teacher On-Policy Distillation(MOPD)으로 묶어 하나의 통합 모델로 만들었다.

컨텍스트는 윈도를 고려한 컨텍스트 병렬화로 학습했다고 한다.

회사가 밝힌 강점과 배포 형태

회사는 영어·한국어·코드·수학에 대한 토크나이저 효율을 내세우며, 긴 호흡의 에이전트형 도구 사용과 터미널 기반 문제 해결에서 특히 성능이 좋고 환각에 민감한 평가에서는 답을 보류하는 판단이 잘 조정되어 있다고 밝혔다.

  • 가중치는 별도 신청 없이 누구나 내려받을 수 있으며 MIT 라이선스로 공개됐다.
  • 회사는 vLLM으로 배포하는 방식을 권하고, B200과 H200 GPU에서 시험했다고 밝혔다.
  • 더 작은 용량이 필요한 경우 NVFP4로 양자화한 체크포인트도 함께 제공된다.

벤치마크

벤치마크 무엇을 재나 Motif 3 (314B-A13B) MiniMax-3 (428B-A23B) DS-v4-Pro (1.6T-A49B)
GDPVal v2 실무 과업 수행 38.7 44.4 40.2
τ²-Bench Telecom 통신 분야 도구 사용 94.7 88.9 96.2
τ³-Banking 금융 분야 도구 사용 35.3 15.3 30.1
ITBench* IT 운영 문제 해결 51.5 — 38.3
SWE-Bench Verified 실제 코드 수정 76.2 75.0 77.4
Terminal-Bench 2.1 터미널 작업 수행 74.9 65.2 64.0
SciCode 과학 계산 코드 작성 40.6 45.4 50.0
IMOAnswerBench 올림피아드 수학 83.2 — 89.8
Apex-Shortlist — 75.5 — 85.8
GPQA Diamond 대학원 수준 과학 지식 83.4 92.9 88.8
HLE 고난도 종합 지식 37.0 39.0 37.5
CritPt — 6.6 3.7 12.9
OmniScience — Accuracy 과학 지식 정확도 30.1 16.7 42.9
OmniScience — Non-Hallucination 환각 억제 71.6 81.6 5.9
AA-LCR 긴 문맥 추론 72.3 80.3 70.0
IFBench 지시 따르기 78.2 82.9 76.5
  • Motif 3 측정은 온도 1.0, top-p 0.95, 최대 시퀀스 길이 262,144 토큰으로 했고, 비교 모델 점수는 각 벤치마크 리더보드에 올라온 값을 가져왔다고 회사는 밝혔다.
  • *는 공개 데이터셋만 쓴 경우다.

같은 발표의 다른 판

원문