모델 출시
IBM 소형 추론 모델 Granite-4.2-3B 공개
- IBM이 Granite 4.2 계열의 소형 추론 모델 Granite-4.2-3B를 공개했다.
- 파라미터 3B 밀집 구조로 답하기 전에 생각하는 과정을 내장했고, 생각의 깊이를 세 가지 모드로 고를 수 있다.
- 라이선스는 Apache 2.0이다.
| 모델 | Granite-4.2-3B |
|---|---|
| 저장소 | ibm-granite/granite-4.2-3b |
| 개방성 | 오픈형 |
| 파라미터 | 3B |
| 라이선스 | Apache-2.0 |
무엇이 나왔나
- IBM의 Granite 팀이 Granite 4.2 계열에서 가장 작은 추론 모델인 Granite-4.2-3B를 Hugging Face에 공개했다.
- 모델 카드에 적힌 출시일은 2026년 8월 25일이다.
- 가중치는 Apache 2.0 라이선스로 풀려 상업용과 연구용 모두에 쓸 수 있다.
- 원본 bfloat16 판과 함께 granite-4.2-3b-fp8, granite-4.2-3b-mxfp4, granite-4.2-3b-nvfp4 저장소도 함께 올라왔다.
- Granite 4.2 세대의 핵심 변화는 모델이 최종 답을 내기 전에
<think>...</think>안에서 단계별로 생각하는 추론 기능을 기본으로 갖췄다는 점이다. - IBM은 이 기능으로 수학, 코딩, 여러 단계에 걸친 논리 문제, 에이전트식 도구 호출 성능이 올랐다고 밝혔다.
- 생각 방식은 세 가지 중에서 고를 수 있다.
- 기본값인 전체 생각 모드, 생각 없이 바로 답하는 모드, 짧게만 생각하는 저노력(low-effort) 모드다.
- 질문마다 답의 깊이와 응답 속도 사이에서 균형을 맞출 수 있다는 것이 회사의 설명이다.
- 도구를 부를 때도 어떤 도구를 왜 부를지 먼저 생각한 뒤 호출한다.
- 회사가 꼽은 주 용도는 추론, 코드 생성, 도구 호출, 에이전트 작업, 다국어 대화다.
- OpenCode, Pi, OpenHands 같은 에이전트식 코딩 도구의 바탕 모델로도 쓸 수 있다고 밝혔다.
- 시험을 거친 언어는 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어의 12개다.
- 실제 서비스에 쓸 때는 위험 요소를 걸러내는 Granite Guardian과 함께 쓰기를 권했다.
규모와 구조
- 파라미터는 3B이고, 디코더만 쓰는 밀집(dense) 트랜스포머 구조다.
- 기본으로 다루는 문맥 길이는 128K 토큰이며, 긴 문맥 확장을 거쳐 512K 토큰까지 늘릴 수 있다.
- 층 수 40, 임베딩 크기 2560
- 그룹 쿼리 어텐션(GQA): 어텐션 헤드 40개, KV 헤드 8개, 헤드 크기 64
- 위치 표현: RoPE(θ = 10,000,000)
- 피드포워드: SwiGLU 활성화 MLP(은닉 크기 8192)
- 정규화: RMSNorm
- 입력과 출력 임베딩을 따로 둔다
학습 방식
- Granite-4.2-3B는 Granite-4.1-3B-Base를 바탕으로 여러 단계의 후속 학습을 거쳐 만들어졌다.
- 지도 미세조정 단계에서는 허용적 라이선스의 공개 데이터, 추론·도구 호출·생각 과정을 겨냥해 내부에서 만든 합성 데이터, 다양한 과제에서 모은 에이전트 작업 기록, 사람이 쓴 데이터를 골라 섞었다.
- 이어 GRPO 방식의 강화학습을 수학, 코드, 과학, 지시 따르기, 도구 사용, 일반 대화, 구조화된 출력 등 여러 환경에서 진행했다.
- 대부분의 환경은 정답을 검증할 수 있는 보상을 주고, 열린 질문은 생성형 보상 모델이 채점했다.
- 생성과 정책 갱신은 서로 다른 GPU 묶음에서 비동기로 돌아갔다.
- 마지막으로 선호 정렬(RLHF) 단계에서 유용성, 대화 품질, 안전성을 다듬었다.
- 강화학습에는 NeMo RL을, 학습 환경에는 NeMo Gym을 썼다.
학습은 CoreWeave가 운영하는 NVIDIA GB200 NVL72 클러스터에서 이뤄졌다.
벤치마크
| 벤치마크 | 무엇을 재나 | Granite-4.2-3B (3B) | Granite 4.2 8B (8B) | Granite 4.2 30B (30B) |
|---|---|---|---|---|
| SWE Bench Multilingual | 여러 언어 저장소의 실제 이슈 해결 | NA | 30.78 | 41.89 |
| SWE Bench Pro | 어려운 실제 소프트웨어 이슈 해결 | NA | 19.11 | 33.29 |
| SWE Bench Verified | 검증된 실제 깃허브 이슈 해결 | NA | 47.67 | 57 |
| Terminal-Bench 2.1 | 터미널 명령줄 작업 수행 | NA | 20.56 | 29.24 |
| τ³-bench (AVG) | 도구를 쓰는 대화형 에이전트 과제 | 45.78 | 58.06 | 62.00 |
| BFCL (v4) | 함수 호출 정확도 | 52.41 | 52.39 | 61.39 |
| ProfBench | — | 32.10 | 41.20 | 42.90 |
| BirdBench | 자연어를 SQL로 바꾸기 | NA | 41.07 | 41.85 |
| GDPval | 실제 직업 업무 산출물 품질 | NA | 1189 | 1225 |
| AIME25 | 경시대회 수학 문제 풀이 | 78.33 | 86.67 | 89.17 |
| HMMT Feb25 | 경시대회 수학 문제 풀이 | 66.67 | 78.33 | 89.17 |
| GPQA | 대학원 수준 과학 문제 | 54.80 | 64.14 | 66.41 |
| LiveCodeBench v6 | 코딩 문제 풀이 | 69.71 | 73.24 | 75.77 |
| SciCode | 과학 연구용 코드 작성 | 24.11 | 36.09 | 38.76 |
| MMLU-Pro | 여러 분야 지식과 추론 | 67.84 | 74.04 | 77.60 |
| MMLU-ProX lite (IBM) | 다국어 지식과 추론 | 27.78 | 61.06 | 66.64 |
| Arena-Hard-V2 | 어려운 질문에 대한 답변 품질 | 34.96 | 65.19 | 67.93 |
| IFBench (prompt) | 지시 따르기 | 74.33 | 79.33 | 77.17 |
| RULER 64K | 긴 문맥 속 정보 활용 | 67.52 | 80.99 | 89.96 |
| RULER 128K | 긴 문맥 속 정보 활용 | 55.30 | 71.41 | 81.38 |
평가는 NeMo Evaluator SDK를 바탕으로 한 평가 체계로 진행했다고 회사가 밝혔다.