llmfeed

IBM, 추론 기능을 내장한 오픈소스 모델 Granite-4.2-30B 공개

IBM
  • IBM이 Granite 4.2 계열의 300억 파라미터 추론 모델 Granite-4.2-30B를 아파치 2.0 라이선스로 공개했다.
  • 생각 모드를 세 가지로 전환할 수 있고 도구 호출과 긴 문맥을 지원한다.
모델Granite-4.2-30B
저장소ibm-granite/granite-4.2-30b
개방성오픈형
파라미터 30B
라이선스 Apache-2.0
시행2026-08-25

무엇이 나왔나

  • IBM이 Granite 4.2 계열의 추론 모델 Granite-4.2-30B를 공개했다.
  • 아파치 2.0 라이선스로 배포되며, IBM은 상업적 이용과 학술적 이용 모두 제약 없이 가능하다고 밝혔다.
  • Granite 4.2 세대는 최종 답을 내놓기 전에 단계별로 사고 과정을 거치는 기능을 모델 자체에 넣은 것이 특징이다.
  • Granite-4.2-30B는 <think>...</think> 안에서 사고 과정을 만들어 내며, 회사는 이 방식이 수학·코딩·여러 단계를 거치는 논리 문제와 도구 호출 작업에서 성능을 높인다고 설명했다.
  • 생각 모드는 세 가지다.
  • 기본값인 전체 생각 모드(enable_thinking=True), 사고 과정 없이 바로 답하는 모드(enable_thinking=False), 간단한 질문에 짧게만 사고하는 저부담 모드(low_effort=True)를 한 모델 안에서 골라 쓸 수 있다.
  • 여러 차례 이어지는 대화에서는 이전 답변의 사고 내용이 기본적으로 잘려 나가(truncate_history_thinking=True) 문맥 창을 아끼며, 값을 꺼서 전체 사고 기록을 남길 수도 있다.
  • 도구 호출은 어떤 도구를 왜 부를지 모델이 먼저 따져 본 뒤 호출을 만들어 내는 방식이며, 도구는 OpenAI 함수 정의 형식으로 적는다.
  • IBM은 이 모델을 추론, 코드 생성, 도구 호출, 에이전트 작업, 다국어 대화에 쓰라고 권했다.
  • 시험을 마친 언어는 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어 열두 가지이며, 다른 언어도 동작할 수 있으나 충분히 검증하지 않았다고 밝혔다.
  • 안전 면에서는 정렬 작업을 거쳤지만 부정확하거나 편향된, 또는 안전하지 않은 답을 낼 수 있다고 적었다.
  • <think> 태그 안의 내용은 내부 사고 과정이라 다듬어지지 않은 중간 생각일 수 있으며 최종 결론이 아니라고도 덧붙였다.
  • 배포 시에는 Granite Guardian을 함께 써서 위험을 걸러 내라고 권했다.

규모와 구조

  • 파라미터는 300억 개이고, 디코더 전용 밀집 트랜스포머 구조(GraniteForCausalLM)다.
  • 정밀도는 bfloat16이다.
  • 어텐션: Grouped Query Attention, 어텐션 헤드 32개와 KV 헤드 8개
  • 위치 임베딩: RoPE(θ = 10,000,000)
  • 피드포워드: SwiGLU 활성화를 쓰는 MLP, 은닉 크기 32768
  • 정규화: RMSNorm(ε = 1e-5)
  • 입력 임베딩과 출력 임베딩을 묶지 않고 따로 둠
  • 임베딩 크기 4096, 층 64개, 어텐션 헤드 크기 128, 시퀀스 길이 131072

문맥 길이는 기본적으로 128K를 지원하며, 긴 문맥 확장으로 512K까지 늘어난다고 회사는 밝혔다.

학습 방식

  • Granite-4.2-30B는 Granite-4.1-30B-Base를 바탕으로 후속 학습을 거쳤다.
  • 학습은 세 단계다.
  • 사전 학습 단계의 기반이 되는 Granite-4.1-30B-Base는 대규모 영어와 다국어 말뭉치로 학습됐다.
  • 지도 미세 조정 단계에서는 지시 따르기, 사고 과정, 추론 데이터를 썼고, 학습 자료는 허용적 라이선스의 공개 데이터셋, 추론·도구 호출·사고 과정을 겨냥해 내부에서 만든 합성 데이터, 여러 과제에서 모은 에이전트 실행 기록, 사람이 직접 쓴 선별 데이터 네 갈래로 이뤄졌다.
  • 30B 모델에는 2차 지도 미세 조정 단계를 추가로 두어 에이전트 데이터를 더 많이 뽑아 쓰고 일반 복습 데이터는 적게 남겼으며, 1차보다 낮은 학습률에서 1에폭만 돌렸다.
  • 강화 학습 단계에서는 Group Relative Policy Optimization(GRPO)을 여러 환경에 걸쳐 여러 차례 적용했다.
  • 수학, 코드, 과학, 지시 따르기, 도구 사용, 일반 대화, 구조화된 출력 환경이 섞여 있고, 대부분은 검증 가능한 보상을 주며 열린 질문은 생성형 보상 모델이 채점했다.
  • 생성과 정책 갱신을 서로 다른 GPU 자원에서 비동기로 돌리고 가중치를 도중에 갱신하는 방식을 썼다.
  • 그 뒤에는 도움됨과 대화 품질, 안전성을 다듬는 선호 정렬(RLHF) 단계를 거쳤다.
  • 강화 학습에는 NeMo RL을, 환경 구동에는 NeMo Gym을 썼다.
  • 학습에는 CoreWeave가 운영하는 NVIDIA GB200 NVL72 클러스터를 썼다.
  • 랙 안에서는 72기 GPU NVLink 영역으로, 랙 사이에서는 논블로킹 팻트리 구조의 NDR 400 Gb/s InfiniBand 망으로 통신했다.

배포 형태

  • 모델은 vLLM과 SGLang(v0.5.18 이상)으로 서비스할 수 있고, OpenAI 호환 API로 부를 수 있다.
  • vLLM에서는 저장소에 함께 들어 있는 granite_thinking_parser(vLLM v0.20 이상 필요)를 추론 파서로 쓰라고 권했고, 내장 nemotron_v3 파서로도 동작하지만 앞의 파서가 사고 출력 형식을 더 잘 다듬는다고 밝혔다.
  • granite_thinking_parser의 기본 지원은 곧 vLLM과 SGLang에 들어갈 예정이라고 한다.
  • 도구 호출 파서로는 qwen3_coder를 쓴다.
  • 기본 가중치 외에 fp8, mxfp4, nvfp4로 양자화한 저장소도 함께 올라와 있다.
  • OpenAI 호환 API로 추론과 도구 호출을 지원하는 만큼 OpenCode, Pi, OpenHands 같은 에이전트형 코딩 도구의 기반 모델로도 쓸 수 있다고 회사는 밝혔다.

벤치마크

벤치마크 무엇을 재나 Granite-4.2-30B (30B) 8B Dense (8B) 3B Dense (3B)
SWE Bench Multilingual 여러 언어 코드 이슈 해결 41.89 30.78 NA
SWE Bench Pro 실제 저장소 이슈 해결 33.29 19.11 NA
SWE Bench Verified 실제 코드 버그 수정 57 47.67 NA
Terminal-Bench 2.1 터미널 작업 수행 29.24 20.56 NA
τ³-bench (AVG) 도구를 쓰는 대화 에이전트 62.00 58.06 45.78
BFCL (v4) 함수 호출 정확도 61.39 52.39 52.41
ProfBench — 42.90 41.20 32.10
BirdBench — 41.85 41.07 NA
GDPval — 1225 1189 NA
AIME25 수학 경시 문제 89.17 86.67 78.33
HMMT Feb25 수학 경시 문제 89.17 78.33 66.67
GPQA 대학원 수준 과학 지식 66.41 64.14 54.80
LiveCodeBench v6 코딩 문제 풀이 75.77 73.24 69.71
SciCode 과학 계산 코드 작성 38.76 36.09 24.11
MMLU-Pro 폭넓은 지식과 추론 77.60 74.04 67.84
MMLU-ProX lite (IBM) 여러 언어 지식과 추론 66.64 61.06 27.78
Arena-Hard-V2 어려운 질문 응답 품질 67.93 65.19 34.96
IFBench (prompt) 지시 따르기 77.17 79.33 74.33
RULER 64K 긴 문맥 이해 89.96 80.99 67.52
RULER 128K 긴 문맥 이해 81.38 71.41 55.30

평가는 NeMo Evaluator SDK를 기반으로 한 평가 프레임워크로 수행했다고 회사는 밝혔다.

같은 발표의 다른 판

원문