모델 출시
OpenBMB, 온디바이스용 MiniCPM5-2B 공개 — 파라미터 약 25억, 컨텍스트 131,072
- OpenBMB가 MiniCPM5 시리즈 두 번째 모델 MiniCPM5-2B를 Apache-2.0으로 공개했다.
- 파라미터 약 25억, 컨텍스트 131,072의 dense 모델로 온디바이스 실행을 겨냥했고 학습 데이터셋도 함께 냈다.
| 모델 | MiniCPM5-2B |
|---|---|
| 저장소 | openbmb/MiniCPM5-2B |
| 개방성 | 오픈형 |
| 컨텍스트 | 131,072 |
| 파라미터 | 2,516,756,480 |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- OpenBMB가 MiniCPM5 시리즈의 두 번째 모델인 MiniCPM5-2B를 공개했다.
- 앞서 나온 MiniCPM5-1B에 이어, 같은 학습 방식을 그대로 키운 dense 2B 트랜스포머라고 회사는 밝혔다.
- 온디바이스와 로컬 배포, 자원이 넉넉하지 않은 환경을 겨냥해 만들었다고 한다.
- 회사가 권한 쓰임새는 로컬 어시스턴트, 코딩 에이전트, 도구 사용 워크플로, 그리고 작은 모델이 필요한 추론 상황이다.
- 배포 용량을 작게 유지하면서 긴 컨텍스트를 기본으로 지원한다는 설명이다.
- 같은 이름으로 여러 형태가 함께 올라왔다.
- 최종 공개판(RL + OPD 사후학습)인 MiniCPM5-2B 외에 SFT만 거친 MiniCPM5-2B-SFT, 중간학습 체크포인트 MiniCPM5-2B-Midtrain, 사전학습만 한 MiniCPM5-2B-Base, llama.cpp·Ollama·LM Studio용 MiniCPM5-2B-GGUF, Apple Silicon용 4비트 MiniCPM5-2B-MLX, 4비트 양자화판 MiniCPM5-2B-GPTQ, 추론 가속을 위한 드래프트 모델 MiniCPM5-2B-DSpark가 있다.
- 모델과 함께 학습에 쓴 데이터셋도 UltraData 계열로 공개했다.
- 웹 사전학습 데이터 UltraX, L0~L3 등급으로 관리한 코드 데이터 UltraData-Code, 에이전트 학습 샘플 50만 건이 담긴 UltraData-SFT-Agent-2609, 수학·코드·일반지식·롱컨텍스트 추론을 다루는 RL 샘플 8만 건 이상의 UltraData-RL-2609 등이다.
- 라이선스는 Apache-2.0이며, 저장소와 가중치 모두 여기에 해당한다.
- 회사는 이 모델의 답변이 정치·건강·금융·법률 같은 민감한 주제에서 전문가 검토를 거치지 않았으므로 전문적인 조언으로 취급하지 말라고 밝혔다.
규모와 구조
- 종류: Causal Language Model
- 구조: 표준
LlamaForCausalLM - 파라미터 수: 2,516,756,480 (약 25억)
- 임베딩 제외 파라미터 수: 1,981,982,720
- 레이어 수: 42
- 어텐션 헤드(GQA): Q 16개, KV 2개
- 컨텍스트 길이: 131,072
- 표준
LlamaForCausalLM구조를 쓰기 때문에 별도 커널이나 모델 코드 수정 없이 주요 추론 엔진에서 바로 불러올 수 있다고 회사는 설명했다. - 도구 호출은 XML 형태로 내보내며, SGLang의
minicpm5파서가 이를 OpenAI 호환tool_calls로 바꿔 준다고 밝혔다.
학습 방식
- 학습은 기본 학습, 중간 학습, 사후 학습 세 단계로 이뤄졌다.
- 기본 학습에서는 안정 학습과 감쇠 학습을 거치고, 중간 학습에서 목표 능력과 데이터 분포에 맞춘다.
- 사후 학습은 SFT, RL, OPD 순서다.
- 먼저 400B 토큰 규모의 deep-thinking SFT로 깊은 사고와 일반 대화 능력을 만들고, 수학·코드·에이전트·글쓰기 등 영역별 RL 교사 모델을 따로 학습한 뒤, On-Policy Distillation(OPD)으로 이 교사들을 하나의 공개 모델에 증류했다.
- RL 단계에서는 JustRL II에 서술된 크리틱 기반 알고리즘을 썼다고 한다.
- OPD는 RL로 만든 16개 전문가 모델(에이전트 전문가 5개 포함)의 능력을 합치는 방식으로, 각 응답 위치에서 학생과 교사 로짓 사이의 전체 어휘 역 KL 발산을 어드밴티지 추정값으로 계산해 기존의 검증 기반 어드밴티지를 대체한다.
- 각 RL 교사를 학습할 때 쓴 프롬프트를 그대로 증류 데이터로 재사용하므로 별도 코퍼스를 만들지 않는다고 밝혔다.
또한 FlagOS의 다중 칩 시스템 소프트웨어 스택을 통해 9종의 AI 칩에 적응된 판이 FlagRelease에 공개됐다.
회사가 밝힌 수치
- 회사가 고른 비교 대상 안에서 MiniCPM5-2B의 평균 점수는 53.9로, 함께 실린 더 큰 모델들의 최고치(51.1)보다 높다고 밝혔다.
- RL + OPD 단계가 추론과 범용 능력을 평균 10.96점, 에이전트 능력을 6.96점 끌어올렸다고 밝혔다.
- 비교군은 같은 크기대의 LFM2.5-2.6B, Qwen3.5-2B, Gemma-4-E2B-it이며, 참고용으로 Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it, LFM2.5-8B-A1B를 함께 실었다.
- 강점이 두드러진 영역으로 코드 추론, 수학 추론, 롱컨텍스트 이해, 도구 사용, 여러 에이전트 과제를 들었다.
벤치마크
| 벤치마크 | 무엇을 재나 | MiniCPM5-2B (2,516,756,480) | Qwen3.5-2B (—) | LFM2.5-8B-A1B (—) |
|---|---|---|---|---|
| Average | 전체 평균 | 53.9 | 28.0 | 28.4 |
| LiveCodeBench v6 | 코드 작성 문제 해결 | 69.1 | 20.2 | 39.8 |
| LCB-Pro 25Q2 (Easy) | 코드 문제(쉬움) | 68.0 | 10.3 | 27.8 |
| LCB-Pro 25Q2 (Medium) | 코드 문제(중간) | 17.5 | 0.0 | 0.0 |
| OJBench | 알고리즘 문제 풀이 | 32.5 | 2.6 | 8.2 |
| SciCode (wbg) | 과학 계산 코드 작성 | 26.3 | 2.8 | 7.8 |
| AIME 2025 | 수학 경시 문제 | 86.5 | 29.6 | 46.0 |
| AIME 2026 | 수학 경시 문제 | 86.5 | 29.0 | 56.7 |
| HMMT Feb 2026 | 수학 경시 문제 | 63.8 | 20.5 | 38.5 |
| MATH-500 | 일반 수학 문제 | 94.6 | 85.8 | 93.2 |
| IFBench | 지시 따르기 | 66.3 | 46.0 | 51.0 |
| IFEval | 지시 따르기 | 86.7 | 77.5 | 90.8 |
| Multi-IF | 여러 차례 지시 따르기 | 71.8 | 57.1 | 71.4 |
| MMLU-Pro | 폭넓은 지식·추론 | 70.8 | 64.3 | 63.1 |
| MMLU-Redux | 폭넓은 지식 | 84.7 | 80.0 | 80.0 |
| HLE | 고난도 종합 지식 | 8.9 | 2.6 | 6.9 |
| GPQA-Diamond | 대학원급 과학 문제 | 70.2 | 45.6 | 51.3 |
| SuperGPQA | 넓은 분야 전문 지식 | 40.8 | 38.6 | 34.5 |
| AA-LCR | 긴 문서 추론 | 59.0 | 28.7 | 0.0 |
| NoLiMa | 긴 문맥 속 정보 찾기 | 68.1 | 17.1 | 0.5 |
| LongBenchPro | 롱컨텍스트 이해 | 44.8 | 8.2 | 19.6 |
| LongBench v2 | 롱컨텍스트 이해 | 43.7 | 24.9 | 30.4 |
| τ³-Bench Banking | 금융 상황 도구 사용 | 20.8 | 2.1 | 3.4 |
| τ²-Bench Telecom | 통신 상황 도구 사용 | 97.1 | 69.0 | 16.1 |
| BFCL v4 | 함수 호출 정확도 | 66.6 | 43.6 | 49.2 |
| SWE-bench Verified | 실제 저장소 버그 수정 | 46.4 | 5.0 | 0.4 |
| SWE-bench Pro | 실제 저장소 버그 수정 | 14.4 | 0.8 | 0.4 |
| Terminal-Bench v2.1 | 터미널 작업 수행 | 8.6 | 3.0 | 1.9 |
| BrowseComp-ZH | 중국어 웹 검색 | 43.5 | 18.2 | 13.2 |
| BrowseComp Top100 | 웹 검색 탐색 | 39.7 | 19.3 | 9.7 |
| GAIA Text-103 | 도구 활용 종합 과제 | 88.7 | 47.9 | 41.1 |
| GDPval-AA v2 | 실무 업무 수행 | 19.6 | 0.0 | 0.0 |
| Claw-Gym | 에이전트 과제 | 59.2 | 25.5 | 2.7 |
| WildClaw | 에이전트 과제 | 23.9 | 9.2 | 4.5 |
| QwenClaw | 에이전트 과제 | 42.9 | 18.2 | 4.5 |
회사는 일부 점수(원문에서 † 표시)가 Artificial Analysis 공식 공개값이고 나머지는 내부에서 재현한 값이라고 밝혔다.