모델 출시
IBM, 추론 기능을 내장한 오픈소스 모델 Granite-4.2-30B 공개
- IBM이 Granite 4.2 계열의 300억 파라미터 추론 모델 Granite-4.2-30B를 아파치 2.0 라이선스로 공개했다.
- 생각 모드를 세 가지로 전환할 수 있고 도구 호출과 긴 문맥을 지원한다.
| 모델 | Granite-4.2-30B |
|---|---|
| 저장소 | ibm-granite/granite-4.2-30b |
| 개방성 | 오픈형 |
| 파라미터 | 30B |
| 라이선스 | Apache-2.0 |
| 시행 | 2026-08-25 |
무엇이 나왔나
- IBM이 Granite 4.2 계열의 추론 모델 Granite-4.2-30B를 공개했다.
- 아파치 2.0 라이선스로 배포되며, IBM은 상업적 이용과 학술적 이용 모두 제약 없이 가능하다고 밝혔다.
- Granite 4.2 세대는 최종 답을 내놓기 전에 단계별로 사고 과정을 거치는 기능을 모델 자체에 넣은 것이 특징이다.
- Granite-4.2-30B는
<think>...</think>안에서 사고 과정을 만들어 내며, 회사는 이 방식이 수학·코딩·여러 단계를 거치는 논리 문제와 도구 호출 작업에서 성능을 높인다고 설명했다.
- 생각 모드는 세 가지다.
- 기본값인 전체 생각 모드(
enable_thinking=True), 사고 과정 없이 바로 답하는 모드(enable_thinking=False), 간단한 질문에 짧게만 사고하는 저부담 모드(low_effort=True)를 한 모델 안에서 골라 쓸 수 있다. - 여러 차례 이어지는 대화에서는 이전 답변의 사고 내용이 기본적으로 잘려 나가(
truncate_history_thinking=True) 문맥 창을 아끼며, 값을 꺼서 전체 사고 기록을 남길 수도 있다.
- 도구 호출은 어떤 도구를 왜 부를지 모델이 먼저 따져 본 뒤 호출을 만들어 내는 방식이며, 도구는 OpenAI 함수 정의 형식으로 적는다.
- IBM은 이 모델을 추론, 코드 생성, 도구 호출, 에이전트 작업, 다국어 대화에 쓰라고 권했다.
- 시험을 마친 언어는 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어 열두 가지이며, 다른 언어도 동작할 수 있으나 충분히 검증하지 않았다고 밝혔다.
- 안전 면에서는 정렬 작업을 거쳤지만 부정확하거나 편향된, 또는 안전하지 않은 답을 낼 수 있다고 적었다.
<think>태그 안의 내용은 내부 사고 과정이라 다듬어지지 않은 중간 생각일 수 있으며 최종 결론이 아니라고도 덧붙였다.- 배포 시에는 Granite Guardian을 함께 써서 위험을 걸러 내라고 권했다.
규모와 구조
- 파라미터는 300억 개이고, 디코더 전용 밀집 트랜스포머 구조(GraniteForCausalLM)다.
- 정밀도는 bfloat16이다.
- 어텐션: Grouped Query Attention, 어텐션 헤드 32개와 KV 헤드 8개
- 위치 임베딩: RoPE(θ = 10,000,000)
- 피드포워드: SwiGLU 활성화를 쓰는 MLP, 은닉 크기 32768
- 정규화: RMSNorm(ε = 1e-5)
- 입력 임베딩과 출력 임베딩을 묶지 않고 따로 둠
- 임베딩 크기 4096, 층 64개, 어텐션 헤드 크기 128, 시퀀스 길이 131072
문맥 길이는 기본적으로 128K를 지원하며, 긴 문맥 확장으로 512K까지 늘어난다고 회사는 밝혔다.
학습 방식
- Granite-4.2-30B는 Granite-4.1-30B-Base를 바탕으로 후속 학습을 거쳤다.
- 학습은 세 단계다.
- 사전 학습 단계의 기반이 되는 Granite-4.1-30B-Base는 대규모 영어와 다국어 말뭉치로 학습됐다.
- 지도 미세 조정 단계에서는 지시 따르기, 사고 과정, 추론 데이터를 썼고, 학습 자료는 허용적 라이선스의 공개 데이터셋, 추론·도구 호출·사고 과정을 겨냥해 내부에서 만든 합성 데이터, 여러 과제에서 모은 에이전트 실행 기록, 사람이 직접 쓴 선별 데이터 네 갈래로 이뤄졌다.
- 30B 모델에는 2차 지도 미세 조정 단계를 추가로 두어 에이전트 데이터를 더 많이 뽑아 쓰고 일반 복습 데이터는 적게 남겼으며, 1차보다 낮은 학습률에서 1에폭만 돌렸다.
- 강화 학습 단계에서는 Group Relative Policy Optimization(GRPO)을 여러 환경에 걸쳐 여러 차례 적용했다.
- 수학, 코드, 과학, 지시 따르기, 도구 사용, 일반 대화, 구조화된 출력 환경이 섞여 있고, 대부분은 검증 가능한 보상을 주며 열린 질문은 생성형 보상 모델이 채점했다.
- 생성과 정책 갱신을 서로 다른 GPU 자원에서 비동기로 돌리고 가중치를 도중에 갱신하는 방식을 썼다.
- 그 뒤에는 도움됨과 대화 품질, 안전성을 다듬는 선호 정렬(RLHF) 단계를 거쳤다.
- 강화 학습에는 NeMo RL을, 환경 구동에는 NeMo Gym을 썼다.
- 학습에는 CoreWeave가 운영하는 NVIDIA GB200 NVL72 클러스터를 썼다.
- 랙 안에서는 72기 GPU NVLink 영역으로, 랙 사이에서는 논블로킹 팻트리 구조의 NDR 400 Gb/s InfiniBand 망으로 통신했다.
배포 형태
- 모델은 vLLM과 SGLang(v0.5.18 이상)으로 서비스할 수 있고, OpenAI 호환 API로 부를 수 있다.
- vLLM에서는 저장소에 함께 들어 있는
granite_thinking_parser(vLLM v0.20 이상 필요)를 추론 파서로 쓰라고 권했고, 내장nemotron_v3파서로도 동작하지만 앞의 파서가 사고 출력 형식을 더 잘 다듬는다고 밝혔다. granite_thinking_parser의 기본 지원은 곧 vLLM과 SGLang에 들어갈 예정이라고 한다.- 도구 호출 파서로는
qwen3_coder를 쓴다. - 기본 가중치 외에 fp8, mxfp4, nvfp4로 양자화한 저장소도 함께 올라와 있다.
- OpenAI 호환 API로 추론과 도구 호출을 지원하는 만큼 OpenCode, Pi, OpenHands 같은 에이전트형 코딩 도구의 기반 모델로도 쓸 수 있다고 회사는 밝혔다.
벤치마크
| 벤치마크 | 무엇을 재나 | Granite-4.2-30B (30B) | 8B Dense (8B) | 3B Dense (3B) |
|---|---|---|---|---|
| SWE Bench Multilingual | 여러 언어 코드 이슈 해결 | 41.89 | 30.78 | NA |
| SWE Bench Pro | 실제 저장소 이슈 해결 | 33.29 | 19.11 | NA |
| SWE Bench Verified | 실제 코드 버그 수정 | 57 | 47.67 | NA |
| Terminal-Bench 2.1 | 터미널 작업 수행 | 29.24 | 20.56 | NA |
| τ³-bench (AVG) | 도구를 쓰는 대화 에이전트 | 62.00 | 58.06 | 45.78 |
| BFCL (v4) | 함수 호출 정확도 | 61.39 | 52.39 | 52.41 |
| ProfBench | — | 42.90 | 41.20 | 32.10 |
| BirdBench | — | 41.85 | 41.07 | NA |
| GDPval | — | 1225 | 1189 | NA |
| AIME25 | 수학 경시 문제 | 89.17 | 86.67 | 78.33 |
| HMMT Feb25 | 수학 경시 문제 | 89.17 | 78.33 | 66.67 |
| GPQA | 대학원 수준 과학 지식 | 66.41 | 64.14 | 54.80 |
| LiveCodeBench v6 | 코딩 문제 풀이 | 75.77 | 73.24 | 69.71 |
| SciCode | 과학 계산 코드 작성 | 38.76 | 36.09 | 24.11 |
| MMLU-Pro | 폭넓은 지식과 추론 | 77.60 | 74.04 | 67.84 |
| MMLU-ProX lite (IBM) | 여러 언어 지식과 추론 | 66.64 | 61.06 | 27.78 |
| Arena-Hard-V2 | 어려운 질문 응답 품질 | 67.93 | 65.19 | 34.96 |
| IFBench (prompt) | 지시 따르기 | 77.17 | 79.33 | 74.33 |
| RULER 64K | 긴 문맥 이해 | 89.96 | 80.99 | 67.52 |
| RULER 128K | 긴 문맥 이해 | 81.38 | 71.41 | 55.30 |
평가는 NeMo Evaluator SDK를 기반으로 한 평가 프레임워크로 수행했다고 회사는 밝혔다.