llmfeed

OpenBMB, 온디바이스용 MiniCPM5-2B 공개 — 파라미터 약 25억, 컨텍스트 131,072

OpenBMB
  • OpenBMB가 MiniCPM5 시리즈 두 번째 모델 MiniCPM5-2B를 Apache-2.0으로 공개했다.
  • 파라미터 약 25억, 컨텍스트 131,072의 dense 모델로 온디바이스 실행을 겨냥했고 학습 데이터셋도 함께 냈다.
모델MiniCPM5-2B
저장소openbmb/MiniCPM5-2B
개방성오픈형
컨텍스트 131,072
파라미터 2,516,756,480
라이선스 Apache-2.0

무엇이 나왔나

  • OpenBMB가 MiniCPM5 시리즈의 두 번째 모델인 MiniCPM5-2B를 공개했다.
  • 앞서 나온 MiniCPM5-1B에 이어, 같은 학습 방식을 그대로 키운 dense 2B 트랜스포머라고 회사는 밝혔다.
  • 온디바이스와 로컬 배포, 자원이 넉넉하지 않은 환경을 겨냥해 만들었다고 한다.
  • 회사가 권한 쓰임새는 로컬 어시스턴트, 코딩 에이전트, 도구 사용 워크플로, 그리고 작은 모델이 필요한 추론 상황이다.
  • 배포 용량을 작게 유지하면서 긴 컨텍스트를 기본으로 지원한다는 설명이다.
  • 같은 이름으로 여러 형태가 함께 올라왔다.
  • 최종 공개판(RL + OPD 사후학습)인 MiniCPM5-2B 외에 SFT만 거친 MiniCPM5-2B-SFT, 중간학습 체크포인트 MiniCPM5-2B-Midtrain, 사전학습만 한 MiniCPM5-2B-Base, llama.cpp·Ollama·LM Studio용 MiniCPM5-2B-GGUF, Apple Silicon용 4비트 MiniCPM5-2B-MLX, 4비트 양자화판 MiniCPM5-2B-GPTQ, 추론 가속을 위한 드래프트 모델 MiniCPM5-2B-DSpark가 있다.
  • 모델과 함께 학습에 쓴 데이터셋도 UltraData 계열로 공개했다.
  • 웹 사전학습 데이터 UltraX, L0~L3 등급으로 관리한 코드 데이터 UltraData-Code, 에이전트 학습 샘플 50만 건이 담긴 UltraData-SFT-Agent-2609, 수학·코드·일반지식·롱컨텍스트 추론을 다루는 RL 샘플 8만 건 이상의 UltraData-RL-2609 등이다.
  • 라이선스는 Apache-2.0이며, 저장소와 가중치 모두 여기에 해당한다.
  • 회사는 이 모델의 답변이 정치·건강·금융·법률 같은 민감한 주제에서 전문가 검토를 거치지 않았으므로 전문적인 조언으로 취급하지 말라고 밝혔다.

규모와 구조

  • 종류: Causal Language Model
  • 구조: 표준 LlamaForCausalLM
  • 파라미터 수: 2,516,756,480 (약 25억)
  • 임베딩 제외 파라미터 수: 1,981,982,720
  • 레이어 수: 42
  • 어텐션 헤드(GQA): Q 16개, KV 2개
  • 컨텍스트 길이: 131,072
  • 표준 LlamaForCausalLM 구조를 쓰기 때문에 별도 커널이나 모델 코드 수정 없이 주요 추론 엔진에서 바로 불러올 수 있다고 회사는 설명했다.
  • 도구 호출은 XML 형태로 내보내며, SGLang의 minicpm5 파서가 이를 OpenAI 호환 tool_calls로 바꿔 준다고 밝혔다.

학습 방식

  • 학습은 기본 학습, 중간 학습, 사후 학습 세 단계로 이뤄졌다.
  • 기본 학습에서는 안정 학습과 감쇠 학습을 거치고, 중간 학습에서 목표 능력과 데이터 분포에 맞춘다.
  • 사후 학습은 SFT, RL, OPD 순서다.
  • 먼저 400B 토큰 규모의 deep-thinking SFT로 깊은 사고와 일반 대화 능력을 만들고, 수학·코드·에이전트·글쓰기 등 영역별 RL 교사 모델을 따로 학습한 뒤, On-Policy Distillation(OPD)으로 이 교사들을 하나의 공개 모델에 증류했다.
  • RL 단계에서는 JustRL II에 서술된 크리틱 기반 알고리즘을 썼다고 한다.
  • OPD는 RL로 만든 16개 전문가 모델(에이전트 전문가 5개 포함)의 능력을 합치는 방식으로, 각 응답 위치에서 학생과 교사 로짓 사이의 전체 어휘 역 KL 발산을 어드밴티지 추정값으로 계산해 기존의 검증 기반 어드밴티지를 대체한다.
  • 각 RL 교사를 학습할 때 쓴 프롬프트를 그대로 증류 데이터로 재사용하므로 별도 코퍼스를 만들지 않는다고 밝혔다.

또한 FlagOS의 다중 칩 시스템 소프트웨어 스택을 통해 9종의 AI 칩에 적응된 판이 FlagRelease에 공개됐다.

회사가 밝힌 수치

  • 회사가 고른 비교 대상 안에서 MiniCPM5-2B의 평균 점수는 53.9로, 함께 실린 더 큰 모델들의 최고치(51.1)보다 높다고 밝혔다.
  • RL + OPD 단계가 추론과 범용 능력을 평균 10.96점, 에이전트 능력을 6.96점 끌어올렸다고 밝혔다.
  • 비교군은 같은 크기대의 LFM2.5-2.6B, Qwen3.5-2B, Gemma-4-E2B-it이며, 참고용으로 Qwen3.5-4B, granite-4.2-3B, Nemotron-3-Nano-4B, Gemma-4-E4B-it, LFM2.5-8B-A1B를 함께 실었다.
  • 강점이 두드러진 영역으로 코드 추론, 수학 추론, 롱컨텍스트 이해, 도구 사용, 여러 에이전트 과제를 들었다.

벤치마크

벤치마크 무엇을 재나 MiniCPM5-2B (2,516,756,480) Qwen3.5-2B (—) LFM2.5-8B-A1B (—)
Average 전체 평균 53.9 28.0 28.4
LiveCodeBench v6 코드 작성 문제 해결 69.1 20.2 39.8
LCB-Pro 25Q2 (Easy) 코드 문제(쉬움) 68.0 10.3 27.8
LCB-Pro 25Q2 (Medium) 코드 문제(중간) 17.5 0.0 0.0
OJBench 알고리즘 문제 풀이 32.5 2.6 8.2
SciCode (wbg) 과학 계산 코드 작성 26.3 2.8 7.8
AIME 2025 수학 경시 문제 86.5 29.6 46.0
AIME 2026 수학 경시 문제 86.5 29.0 56.7
HMMT Feb 2026 수학 경시 문제 63.8 20.5 38.5
MATH-500 일반 수학 문제 94.6 85.8 93.2
IFBench 지시 따르기 66.3 46.0 51.0
IFEval 지시 따르기 86.7 77.5 90.8
Multi-IF 여러 차례 지시 따르기 71.8 57.1 71.4
MMLU-Pro 폭넓은 지식·추론 70.8 64.3 63.1
MMLU-Redux 폭넓은 지식 84.7 80.0 80.0
HLE 고난도 종합 지식 8.9 2.6 6.9
GPQA-Diamond 대학원급 과학 문제 70.2 45.6 51.3
SuperGPQA 넓은 분야 전문 지식 40.8 38.6 34.5
AA-LCR 긴 문서 추론 59.0 28.7 0.0
NoLiMa 긴 문맥 속 정보 찾기 68.1 17.1 0.5
LongBenchPro 롱컨텍스트 이해 44.8 8.2 19.6
LongBench v2 롱컨텍스트 이해 43.7 24.9 30.4
τ³-Bench Banking 금융 상황 도구 사용 20.8 2.1 3.4
τ²-Bench Telecom 통신 상황 도구 사용 97.1 69.0 16.1
BFCL v4 함수 호출 정확도 66.6 43.6 49.2
SWE-bench Verified 실제 저장소 버그 수정 46.4 5.0 0.4
SWE-bench Pro 실제 저장소 버그 수정 14.4 0.8 0.4
Terminal-Bench v2.1 터미널 작업 수행 8.6 3.0 1.9
BrowseComp-ZH 중국어 웹 검색 43.5 18.2 13.2
BrowseComp Top100 웹 검색 탐색 39.7 19.3 9.7
GAIA Text-103 도구 활용 종합 과제 88.7 47.9 41.1
GDPval-AA v2 실무 업무 수행 19.6 0.0 0.0
Claw-Gym 에이전트 과제 59.2 25.5 2.7
WildClaw 에이전트 과제 23.9 9.2 4.5
QwenClaw 에이전트 과제 42.9 18.2 4.5

회사는 일부 점수(원문에서 † 표시)가 Artificial Analysis 공식 공개값이고 나머지는 내부에서 재현한 값이라고 밝혔다.

원문