모델 출시
샤오미, 옴니모달 MoE 모델 MiMo-V2.6-Pro-RL 공개
- 샤오미가 MiMo-V2.6 계열의 대표 모델 MiMo-V2.6-Pro-RL을 MIT 라이선스로 공개했다.
- 전체 1.02T·활성 42B의 희소 MoE 구조로 텍스트·이미지·영상·음성을 함께 받고, 컨텍스트 길이는 100만 토큰이다.
| 모델 | MiMo-V2.6-Pro-RL |
|---|---|
| 저장소 | XiaomiMiMo/MiMo-V2.6-Pro-RL |
| 개방성 | 오픈형 |
| 컨텍스트 | 1M |
| 파라미터 | 1.02T total / 42B activated |
| 라이선스 | MIT |
무엇이 나왔나
- 샤오미 MiMo 팀이 MiMo-V2.6 계열의 대표 체크포인트인 MiMo-V2.6-Pro-RL을 공개했다.
- 텍스트와 이미지, 영상, 음성을 한 모델에서 다루는 옴니모달 모델이며, 긴 저장소 코드와 도구 실행 기록, 여러 세션에 걸친 에이전트 실행을 다루기 위해 100만 토큰 컨텍스트를 지원한다고 회사는 밝혔다.
- 라이선스는 MIT이고 지원 언어는 영어와 중국어로 적혀 있다.
- 같은 계열의 MiMo-V2.6-Flash-RL도 함께 내려받을 수 있게 올려두었다.
가중치는 Hugging Face와 ModelScope에서 배포되며, AI Studio, MiMo Code, Xiaomi MiMo Desktop, Xiaomi MiMo Open Platform API, OpenRouter에서도 쓸 수 있다고 회사는 밝혔다.
규모와 구조
- 구조: 희소 MoE(Mixture of Experts), 전체 1.02T 파라미터 가운데 42B가 활성화된다.
- 컨텍스트: 100만 토큰.
- 언어 모델 본체: 70개 층(SWA 60개, GA 10개), 은닉 크기 6144, Q/KV 헤드 128/8, 헤드 차원 QK 192·V 128, 슬라이딩 윈도 크기 128, 라우팅 전문가 384개 가운데 8개 활성화. 첫 Transformer 블록은 전역 어텐션과 밀집 FFN을 쓰고, 나머지 블록은 지역 SWA와 GA를 번갈아 배치하며 공유 전문가 없이 희소 MoE FFN을 쓴다.
- 비전 인코더 MiMo ViT: 681M 파라미터, 28개 층(SWA 24개, GA 4개), 은닉 크기 1280, 패치 크기 2×16×16, 공간 병합 2×2.
- 오디오 인코더: AudioTokenizer 인코더가 308M 파라미터로 24개 층(SWA 12개, GA 12개)과 RVQ 코드북 20개를 쓰고, 오디오 패치 인코더는 6개 층 127M 파라미터로 패치마다 네 프레임을 묶어 25Hz를 6.25Hz로 줄인다.
- Multi-Token Prediction(MTP): 5개 층 SWA 방식의 추측 디코더로, 윈도 크기는 1024이며 한 번의 순전파에서 뒤따르는 토큰 7개를 예측해 병렬 검증에 쓴다.
학습 방법
- 회사는 이 계열을 강화학습(RL) 연산량과 환경 다양성, 채점 연산량을 함께 늘리는 방향으로 만들었다고 설명했다.
- 코딩, 범용 에이전트, 시각, 사이버보안을 영역별로 따로 돌리지 않고 하나의 혼합 RL 실행으로 학습했으며, 여러 과제와 여러 하네스를 같은 배치에 섞어 학습 때 보지 못한 하네스로도 전략이 옮겨가게 했다고 밝혔다.
- 채점 쪽에서는 통과·실패 이분 신호로 통과한 해답들의 순위를 가릴 수 없다는 점을 들어, 그룹 안의 롤아웃끼리 비교하는 방식을 썼다고 한다.
- Groupwise Reward Synthesis(GRS)는 서로 대비되는 롤아웃에서 과제별 채점 기준을 오프라인으로 만들어 테스트 결과와 합치고, Groupwise Advantage Redistribution(GAR)은 통과한 경로를 온라인으로 순위 매겨 더 나은 해답 쪽으로 어드밴티지를 옮긴다.
- 회사는 이 방식이 더 짧은 경로와 더 적은 토큰 사용으로 유도한다고 밝혔다.
- 정렬 단계에서는 모델이 자신의 어긋난 답변을 되짚어 다시 쓰게 하는 자기 교정으로 콜드 스타트를 하고, RL 전 과정에서 환경 강화와 적대적 선별, 검증기 교차 확인으로 보상 해킹을 막았다고 설명했다.
- 혼합 RL 이후에는 Multi-Prefix Multi-Teacher On-Policy Distillation(MOPD2)을 적용해, 교사 경로와 SFT 시연의 대화 기록을 재활용해 앞선 턴을 다시 생성하지 않고 결정 지점만 학습시켰다고 밝혔다.
회사가 밝힌 수치
강화학습은 완전 비동기 방식의 Group Relative Policy Optimization(GRPO)으로 돌렸고, 한 스텝에 프롬프트 1,568개 × 롤아웃 16개를 써서 한 번의 업데이트마다 수십억 토큰 규모를 처리했다고 밝혔다.
벤치마크
| 벤치마크 | 무엇을 재나 | MiMo-V2.6 Pro (1.02T total / 42B activated) | MiMo-V2.5 Pro (—) | MiMo-V2.6 Flash (—) | Claude Opus 5 (—) |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 코딩 에이전트 | 71.9 | 19.0 | 67.9 | 74.0 |
| ProgramBench | 코딩 에이전트 | 26.5 | 12.5 | 26.0 | 37.0 |
| MiMo Code Bench | 코딩 에이전트 | 63.2 | 40.4 | 61.2 | 68.6 |
| AutomationBench v1.0.6 | 범용 에이전트 | 53.1 | 16.0 | 52.3 | 50.3 |
| Toolathlon-Verified | 도구 사용 에이전트 | 76.9 | 49.1 | 73.6 | 80.6 |
| GDPval-AA 2.1 | 범용 에이전트 | 1673 | 1107 | - | 1708 |
| Agents' Last Exam | 범용 에이전트 | 31.6 | 13.2 | 27.6 | 31.6 |
| Terminal Bench 4.0 | 터미널 작업 수행 | 34.9 | 1.5 | 28.8 | 49.0 |
| Terminal Bench 2.1 | 터미널 작업 수행 | 89.9 | 65.2 | 87.6 | 89.1 |
| OSWorld-Verified | 컴퓨터 화면 조작 | 82.0 | - | 80.8 | 83.4 |
| JobBench | 범용 에이전트 | 62.0 | 25.0 | 61.2 | 65.7 |
| CyberGym | 사이버보안 | 94.0 | 40.0 | 95.1 | - |
| MiMo Cyber Bench | 사이버보안 | 80.2 | 0.0 | 77.2 | - |
| ExploitGym | 사이버보안 | 17.8 | 0.2 | 6.0 | 22.1 |
| ExploitBench | 사이버보안 | 47.9 | 16.6 | 25.3 | 70.0 |
| SEC Bench Pro | 사이버보안 | 66.3 | 17.7 | 47.5 | - |
| MiMo VisualCoding | 시각 에이전트 | 72.3 | - | 71.5 | 70.0 |