모델 출시
Motif Technologies, 314B 규모 MoE 모델 Motif 3 공개
- Motif Technologies가 총 314B 파라미터 중 토큰당 13.2B만 쓰는 MoE 모델 Motif 3를 냈다.
- 256K 컨텍스트를 지원하고, 가중치는 MIT 라이선스로 신청 없이 누구나 받을 수 있다.
| 모델 | Motif 3 |
|---|---|
| 저장소 | Motif-Technologies/Motif-3 |
| 모델 | Motif-3-NVFP4 |
| 저장소 | Motif-Technologies/Motif-3-NVFP4 |
| 개방성 | 오픈형 |
| 컨텍스트 | 262,144 |
| 파라미터 | 314B-A13B |
| 라이선스 | MIT |
무엇이 나왔나
- Motif Technologies가 디코더 전용 Mixture-of-Experts(MoE) 언어 모델 Motif 3를 공개했다.
- 전체 파라미터는 약 3,140억 개이고 토큰마다 실제로 쓰이는 파라미터는 약 132억 개다.
- 회사는 이 모델을 자체 설계로 처음부터 만들었다고 밝혔다.
구조
회사가 밝힌 사양은 다음과 같다.
- 층 수 53개(밀집 2개 + MoE 51개), 은닉 차원 4096, 첫 두 층의 밀집 FFN 중간 차원 12,288
- 어텐션은 Grouped Differential Latent Attention(GDLA)이며 출력에 게이트를 둔다. 쿼리 헤드 80개, KV 헤드 16개
- 라우팅 전문가 384개 중 토큰당 8개를 쓰고, 공유 전문가 1개를 함께 쓴다
- 활성 함수는 Expert-Specific PolyNorm, 잔차 연결은 수정된 manifold-constrained hyper-connections(mHC)
- Multi-Token Prediction(MTP) 헤드 1개 층을 내장해 self-speculative decoding을 지원한다
- 컨텍스트 길이 262,144(256K), 어휘 크기 220,160, 텐서 형식 bfloat16
- 회사 설명에 따르면 GDLA는 비대칭 신호·잡음 헤드와 토큰에 따라 달라지는 차분 계수를 쓰는 grouped differential attention에 Multi-head Latent Attention의 압축된 KV 잠재 표현을 합친 것으로, KV 캐시 요구량을 크게 줄인다.
- Expert-Specific PolyNorm은 SiLU 게이트를 전문가별로 따로 학습되는 다항 정규화로 바꿔 활성값의 이상치를 줄인다.
- mHC는 일반적인 잔차 덧셈을 4개 병렬 잔차 흐름의 이중 확률(Birkhoff 폴리토프) 혼합으로 대체하며, 사후 매핑 배수를 사전학습 동안 2에서 1로 서서히 낮춘다.
학습
- 사전학습은 약 12.5조 토큰으로 이뤄졌고, 웹 문서·STEM·코드·수학·다국어·특화 도메인 자료를 담았다.
- 한국어와 추론 중심 자료, 법률·금융 자료에 비중을 더 뒀다고 회사는 밝혔다.
- 사후학습은 일반 지도 미세조정, 강화학습으로 훈련한 6개 전문 교사 모델, 소프트웨어 공학 교사 모델을 Multi-teacher On-Policy Distillation(MOPD)으로 묶어 하나의 통합 모델로 만들었다.
컨텍스트는 윈도를 고려한 컨텍스트 병렬화로 학습했다고 한다.
회사가 밝힌 강점과 배포 형태
회사는 영어·한국어·코드·수학에 대한 토크나이저 효율을 내세우며, 긴 호흡의 에이전트형 도구 사용과 터미널 기반 문제 해결에서 특히 성능이 좋고 환각에 민감한 평가에서는 답을 보류하는 판단이 잘 조정되어 있다고 밝혔다.
- 가중치는 별도 신청 없이 누구나 내려받을 수 있으며 MIT 라이선스로 공개됐다.
- 회사는 vLLM으로 배포하는 방식을 권하고, B200과 H200 GPU에서 시험했다고 밝혔다.
- 더 작은 용량이 필요한 경우 NVFP4로 양자화한 체크포인트도 함께 제공된다.
벤치마크
| 벤치마크 | 무엇을 재나 | Motif 3 (314B-A13B) | MiniMax-3 (428B-A23B) | DS-v4-Pro (1.6T-A49B) |
|---|---|---|---|---|
| GDPVal v2 | 실무 과업 수행 | 38.7 | 44.4 | 40.2 |
| τ²-Bench Telecom | 통신 분야 도구 사용 | 94.7 | 88.9 | 96.2 |
| τ³-Banking | 금융 분야 도구 사용 | 35.3 | 15.3 | 30.1 |
| ITBench* | IT 운영 문제 해결 | 51.5 | — | 38.3 |
| SWE-Bench Verified | 실제 코드 수정 | 76.2 | 75.0 | 77.4 |
| Terminal-Bench 2.1 | 터미널 작업 수행 | 74.9 | 65.2 | 64.0 |
| SciCode | 과학 계산 코드 작성 | 40.6 | 45.4 | 50.0 |
| IMOAnswerBench | 올림피아드 수학 | 83.2 | — | 89.8 |
| Apex-Shortlist | — | 75.5 | — | 85.8 |
| GPQA Diamond | 대학원 수준 과학 지식 | 83.4 | 92.9 | 88.8 |
| HLE | 고난도 종합 지식 | 37.0 | 39.0 | 37.5 |
| CritPt | — | 6.6 | 3.7 | 12.9 |
| OmniScience — Accuracy | 과학 지식 정확도 | 30.1 | 16.7 | 42.9 |
| OmniScience — Non-Hallucination | 환각 억제 | 71.6 | 81.6 | 5.9 |
| AA-LCR | 긴 문맥 추론 | 72.3 | 80.3 | 70.0 |
| IFBench | 지시 따르기 | 78.2 | 82.9 | 76.5 |
- Motif 3 측정은 온도 1.0, top-p 0.95, 최대 시퀀스 길이 262,144 토큰으로 했고, 비교 모델 점수는 각 벤치마크 리더보드에 올라온 값을 가져왔다고 회사는 밝혔다.
*는 공개 데이터셋만 쓴 경우다.