llmfeed

샤오미, MiMo-V2.6-Flash-RL 공개 — 텍스트·이미지·영상·음성을 함께 받는 309B MoE 모델

샤오미
  • 샤오미 MiMo 팀이 MiMo-V2.6 계열의 효율 균형 체크포인트 MiMo-V2.6-Flash-RL을 MIT 라이선스로 공개했다.
  • 총 309B 중 15B만 활성화하는 Sparse MoE 구조이고, 컨텍스트는 1M 토큰이다.
모델MiMo-V2.6-Flash-RL
저장소XiaomiMiMo/MiMo-V2.6-Flash-RL
개방성오픈형
컨텍스트 1M
파라미터 309B total / 15B activated
라이선스 MIT
시행2026-09-21

무엇이 나왔나

  • 샤오미 MiMo 팀이 MiMo-V2.6 계열의 효율 균형 체크포인트라고 밝힌 MiMo-V2.6-Flash-RL을 공개했다.
  • 텍스트·이미지·영상·음성을 한 모델에서 받으며, 긴 저장소와 도구 호출 기록, 여러 세션에 걸친 에이전트 실행을 위해 1M 토큰 컨텍스트를 지원한다고 회사는 설명했다.
  • 라이선스는 MIT이고, Hugging Face와 ModelScope에서 가중치를 받을 수 있다.
  • 같은 계열의 MiMo-V2.6-Pro-RL도 함께 내려받을 수 있게 올라와 있다.
  • 이 밖에 AI Studio, MiMo Code, Xiaomi MiMo Desktop, Xiaomi MiMo Open Platform API, OpenRouter에서도 쓸 수 있다.

규모와 구조

  • 구조: Sparse MoE, 총 309B 파라미터 중 15B 활성화
  • 컨텍스트 길이: 1M 토큰
  • 입력 형태: 텍스트, 이미지, 영상, 음성
  • 언어 모델 본체: 48층(SWA 39층 / GA 9층), hidden size 4096, SWA 헤드 Q/KV 64/8, GA 헤드 Q/KV 64/4, 헤드 차원 QK/V 192/128, sliding window 128, routed experts 총 256개 중 8개 활성화
  • 첫 번째 Transformer 블록은 글로벌 어텐션과 dense FFN을 쓰고, 나머지 블록은 지역 SWA와 GA를 번갈아 쓴다. 두 경우 모두 공유 전문가가 없는 sparse MoE FFN을 쓴다고 밝혔다.
  • 비전 인코더 MiMo ViT: 681M 파라미터, 28층(SWA 24층 + Full 4층), hidden size 1280, 어텐션 헤드 Q/KV 32/8, 헤드 차원 64, 패치 크기 2×16×16, sliding window 좌우 각 64, spatial merge 2×2
  • 음성 인코더: AudioTokenizer 인코더는 24층(SWA 12층 / GA 12층), hidden 1024, RVQ 코드북 20개, 308M 파라미터다. 오디오 패치 인코더는 6층 127M 파라미터로, 패치마다 4프레임을 묶어 25Hz를 6.25Hz로 줄인다.
  • Multi-Token Prediction(MTP): 5층 SWA 기반 추측 디코더(window 1024)로, 한 번의 순전파에서 뒤따르는 토큰 7개를 예측해 병렬 검증에 쓴다.

회사가 밝힌 학습 방식

  • 회사는 이 계열이 강화학습 연산량, 환경의 다양성, 채점기 연산량을 함께 키우는 방향으로 만들어졌다고 설명했다.
  • 밝힌 내용은 다음과 같다.
  • You Only RL Once: 코딩, 일반 에이전트, 시각, 사이버보안을 영역별로 따로 돌리지 않고 한 번의 혼합 강화학습으로 학습했다. 여러 과제와 여러 실행 환경을 같은 배치에 섞어, 학습에서 본 적 없는 실행 환경으로도 전략이 옮겨간다고 밝혔다.
  • 강화학습 규모: 완전 비동기 Group Relative Policy Optimization(GRPO)을 큰 배치로 돌렸고, 한 스텝에 프롬프트 1,568개 × 롤아웃 16개를 쓰며 한 번의 업데이트마다 수십억 토큰을 쓴다고 밝혔다.
  • Groupwise Agentic Grading: 통과/실패 이분 판정으로는 통과한 답들의 우열을 가릴 수 없어 보상 신호 자체를 키웠다고 설명했다. Groupwise Reward Synthesis(GRS)는 서로 대비되는 롤아웃에서 과제별 채점 기준을 오프라인으로 만들어 테스트 결과와 합치고, Groupwise Advantage Redistribution(GAR)은 통과한 경로들을 온라인으로 순위 매겨 더 나은 해답 쪽으로 어드밴티지를 옮긴다. 이 과정이 더 짧은 경로와 과제당 더 적은 토큰 쪽으로 모델을 이끈다고 밝혔다.
  • Aligned RL: 모델이 자기가 어긋난 응답을 되돌아보고 다시 쓰게 하는 자기 교정으로 초기 학습을 시작했고, 학습 내내 환경 강화와 적대적 선별, 검증기 교차 확인으로 보상 해킹을 막았다고 설명했다.
  • MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation): 혼합 강화학습 뒤에, 학생 모델이 스스로 만든 롤아웃과 접두사를 고정한 단일 턴 롤아웃(Teacher-Prefix, SFT-Prefix)을 함께 쓴다. 교사 경로와 SFT 시범의 앞부분 기록을 재사용해 앞선 턴을 다시 만들지 않고도 판단 지점만 학습시켜, 검증하기 어려운 과제로 능력을 넓혔다고 밝혔다.

벤치마크

벤치마크 무엇을 재나 MiMo-V2.6 Flash (309B/15B 활성) MiMo-V2.5 Pro (—) MiMo-V2.6 Pro (—) Claude Opus 5 (—)
DeepSWE v1.1 코딩 에이전트 67.9 19.0 71.9 74.0
ProgramBench 코딩 에이전트 26.0 12.5 26.5 37.0
MiMo Code Bench 코딩 에이전트 61.2 40.4 63.2 68.6
AutomationBench v1.0.6 일반 에이전트 52.3 16.0 53.1 50.3
Toolathlon-Verified 일반 에이전트 73.6 49.1 76.9 80.6
GDPval-AA 2.1 일반 에이전트 - 1107 1673 1708
Agents' Last Exam 일반 에이전트 27.6 13.2 31.6 31.6
Terminal Bench 4.0 터미널 작업 수행 28.8 1.5 34.9 49.0
Terminal Bench 2.1 터미널 작업 수행 87.6 65.2 89.9 89.1
OSWorld-Verified 컴퓨터 화면 조작 80.8 - 82.0 83.4
JobBench 일반 에이전트 61.2 25.0 62.0 65.7
CyberGym 사이버보안 95.1 40.0 94.0 -
MiMo Cyber Bench 사이버보안 77.2 0.0 80.2 -
ExploitGym 사이버보안 6.0 0.2 17.8 22.1
ExploitBench 사이버보안 25.3 16.6 47.9 70.0
SEC Bench Pro 사이버보안 47.5 17.7 66.3 -
MiMo VisualCoding 시각 에이전트 71.5 - 72.3 70.0

원문