샤오미 MiMo 팀이 MiMo-V2.6 계열의 효율 균형 체크포인트라고 밝힌 MiMo-V2.6-Flash-RL을 공개했다.
텍스트·이미지·영상·음성을 한 모델에서 받으며, 긴 저장소와 도구 호출 기록, 여러 세션에 걸친 에이전트 실행을 위해 1M 토큰 컨텍스트를 지원한다고 회사는 설명했다.
라이선스는 MIT이고, Hugging Face와 ModelScope에서 가중치를 받을 수 있다.
같은 계열의 MiMo-V2.6-Pro-RL도 함께 내려받을 수 있게 올라와 있다.
이 밖에 AI Studio, MiMo Code, Xiaomi MiMo Desktop, Xiaomi MiMo Open Platform API, OpenRouter에서도 쓸 수 있다.
규모와 구조
구조: Sparse MoE, 총 309B 파라미터 중 15B 활성화
컨텍스트 길이: 1M 토큰
입력 형태: 텍스트, 이미지, 영상, 음성
언어 모델 본체: 48층(SWA 39층 / GA 9층), hidden size 4096, SWA 헤드 Q/KV 64/8, GA 헤드 Q/KV 64/4, 헤드 차원 QK/V 192/128, sliding window 128, routed experts 총 256개 중 8개 활성화
첫 번째 Transformer 블록은 글로벌 어텐션과 dense FFN을 쓰고, 나머지 블록은 지역 SWA와 GA를 번갈아 쓴다. 두 경우 모두 공유 전문가가 없는 sparse MoE FFN을 쓴다고 밝혔다.
비전 인코더 MiMo ViT: 681M 파라미터, 28층(SWA 24층 + Full 4층), hidden size 1280, 어텐션 헤드 Q/KV 32/8, 헤드 차원 64, 패치 크기 2×16×16, sliding window 좌우 각 64, spatial merge 2×2
음성 인코더: AudioTokenizer 인코더는 24층(SWA 12층 / GA 12층), hidden 1024, RVQ 코드북 20개, 308M 파라미터다. 오디오 패치 인코더는 6층 127M 파라미터로, 패치마다 4프레임을 묶어 25Hz를 6.25Hz로 줄인다.
Multi-Token Prediction(MTP): 5층 SWA 기반 추측 디코더(window 1024)로, 한 번의 순전파에서 뒤따르는 토큰 7개를 예측해 병렬 검증에 쓴다.
회사가 밝힌 학습 방식
회사는 이 계열이 강화학습 연산량, 환경의 다양성, 채점기 연산량을 함께 키우는 방향으로 만들어졌다고 설명했다.
밝힌 내용은 다음과 같다.
You Only RL Once: 코딩, 일반 에이전트, 시각, 사이버보안을 영역별로 따로 돌리지 않고 한 번의 혼합 강화학습으로 학습했다. 여러 과제와 여러 실행 환경을 같은 배치에 섞어, 학습에서 본 적 없는 실행 환경으로도 전략이 옮겨간다고 밝혔다.
강화학습 규모: 완전 비동기 Group Relative Policy Optimization(GRPO)을 큰 배치로 돌렸고, 한 스텝에 프롬프트 1,568개 × 롤아웃 16개를 쓰며 한 번의 업데이트마다 수십억 토큰을 쓴다고 밝혔다.
Groupwise Agentic Grading: 통과/실패 이분 판정으로는 통과한 답들의 우열을 가릴 수 없어 보상 신호 자체를 키웠다고 설명했다. Groupwise Reward Synthesis(GRS)는 서로 대비되는 롤아웃에서 과제별 채점 기준을 오프라인으로 만들어 테스트 결과와 합치고, Groupwise Advantage Redistribution(GAR)은 통과한 경로들을 온라인으로 순위 매겨 더 나은 해답 쪽으로 어드밴티지를 옮긴다. 이 과정이 더 짧은 경로와 과제당 더 적은 토큰 쪽으로 모델을 이끈다고 밝혔다.
Aligned RL: 모델이 자기가 어긋난 응답을 되돌아보고 다시 쓰게 하는 자기 교정으로 초기 학습을 시작했고, 학습 내내 환경 강화와 적대적 선별, 검증기 교차 확인으로 보상 해킹을 막았다고 설명했다.
MOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation): 혼합 강화학습 뒤에, 학생 모델이 스스로 만든 롤아웃과 접두사를 고정한 단일 턴 롤아웃(Teacher-Prefix, SFT-Prefix)을 함께 쓴다. 교사 경로와 SFT 시범의 앞부분 기록을 재사용해 앞선 턴을 다시 만들지 않고도 판단 지점만 학습시켜, 검증하기 어려운 과제로 능력을 넓혔다고 밝혔다.