llmfeed

IBM 소형 추론 모델 Granite-4.2-3B 공개

IBM
  • IBM이 Granite 4.2 계열의 소형 추론 모델 Granite-4.2-3B를 공개했다.
  • 파라미터 3B 밀집 구조로 답하기 전에 생각하는 과정을 내장했고, 생각의 깊이를 세 가지 모드로 고를 수 있다.
  • 라이선스는 Apache 2.0이다.
모델Granite-4.2-3B
저장소ibm-granite/granite-4.2-3b
개방성오픈형
파라미터 3B
라이선스 Apache-2.0

무엇이 나왔나

  • IBM의 Granite 팀이 Granite 4.2 계열에서 가장 작은 추론 모델인 Granite-4.2-3B를 Hugging Face에 공개했다.
  • 모델 카드에 적힌 출시일은 2026년 8월 25일이다.
  • 가중치는 Apache 2.0 라이선스로 풀려 상업용과 연구용 모두에 쓸 수 있다.
  • 원본 bfloat16 판과 함께 granite-4.2-3b-fp8, granite-4.2-3b-mxfp4, granite-4.2-3b-nvfp4 저장소도 함께 올라왔다.
  • Granite 4.2 세대의 핵심 변화는 모델이 최종 답을 내기 전에 <think>...</think> 안에서 단계별로 생각하는 추론 기능을 기본으로 갖췄다는 점이다.
  • IBM은 이 기능으로 수학, 코딩, 여러 단계에 걸친 논리 문제, 에이전트식 도구 호출 성능이 올랐다고 밝혔다.
  • 생각 방식은 세 가지 중에서 고를 수 있다.
  • 기본값인 전체 생각 모드, 생각 없이 바로 답하는 모드, 짧게만 생각하는 저노력(low-effort) 모드다.
  • 질문마다 답의 깊이와 응답 속도 사이에서 균형을 맞출 수 있다는 것이 회사의 설명이다.
  • 도구를 부를 때도 어떤 도구를 왜 부를지 먼저 생각한 뒤 호출한다.
  • 회사가 꼽은 주 용도는 추론, 코드 생성, 도구 호출, 에이전트 작업, 다국어 대화다.
  • OpenCode, Pi, OpenHands 같은 에이전트식 코딩 도구의 바탕 모델로도 쓸 수 있다고 밝혔다.
  • 시험을 거친 언어는 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어의 12개다.
  • 실제 서비스에 쓸 때는 위험 요소를 걸러내는 Granite Guardian과 함께 쓰기를 권했다.

규모와 구조

  • 파라미터는 3B이고, 디코더만 쓰는 밀집(dense) 트랜스포머 구조다.
  • 기본으로 다루는 문맥 길이는 128K 토큰이며, 긴 문맥 확장을 거쳐 512K 토큰까지 늘릴 수 있다.
  • 층 수 40, 임베딩 크기 2560
  • 그룹 쿼리 어텐션(GQA): 어텐션 헤드 40개, KV 헤드 8개, 헤드 크기 64
  • 위치 표현: RoPE(θ = 10,000,000)
  • 피드포워드: SwiGLU 활성화 MLP(은닉 크기 8192)
  • 정규화: RMSNorm
  • 입력과 출력 임베딩을 따로 둔다

학습 방식

  • Granite-4.2-3B는 Granite-4.1-3B-Base를 바탕으로 여러 단계의 후속 학습을 거쳐 만들어졌다.
  • 지도 미세조정 단계에서는 허용적 라이선스의 공개 데이터, 추론·도구 호출·생각 과정을 겨냥해 내부에서 만든 합성 데이터, 다양한 과제에서 모은 에이전트 작업 기록, 사람이 쓴 데이터를 골라 섞었다.
  • 이어 GRPO 방식의 강화학습을 수학, 코드, 과학, 지시 따르기, 도구 사용, 일반 대화, 구조화된 출력 등 여러 환경에서 진행했다.
  • 대부분의 환경은 정답을 검증할 수 있는 보상을 주고, 열린 질문은 생성형 보상 모델이 채점했다.
  • 생성과 정책 갱신은 서로 다른 GPU 묶음에서 비동기로 돌아갔다.
  • 마지막으로 선호 정렬(RLHF) 단계에서 유용성, 대화 품질, 안전성을 다듬었다.
  • 강화학습에는 NeMo RL을, 학습 환경에는 NeMo Gym을 썼다.

학습은 CoreWeave가 운영하는 NVIDIA GB200 NVL72 클러스터에서 이뤄졌다.

벤치마크

벤치마크 무엇을 재나 Granite-4.2-3B (3B) Granite 4.2 8B (8B) Granite 4.2 30B (30B)
SWE Bench Multilingual 여러 언어 저장소의 실제 이슈 해결 NA 30.78 41.89
SWE Bench Pro 어려운 실제 소프트웨어 이슈 해결 NA 19.11 33.29
SWE Bench Verified 검증된 실제 깃허브 이슈 해결 NA 47.67 57
Terminal-Bench 2.1 터미널 명령줄 작업 수행 NA 20.56 29.24
τ³-bench (AVG) 도구를 쓰는 대화형 에이전트 과제 45.78 58.06 62.00
BFCL (v4) 함수 호출 정확도 52.41 52.39 61.39
ProfBench — 32.10 41.20 42.90
BirdBench 자연어를 SQL로 바꾸기 NA 41.07 41.85
GDPval 실제 직업 업무 산출물 품질 NA 1189 1225
AIME25 경시대회 수학 문제 풀이 78.33 86.67 89.17
HMMT Feb25 경시대회 수학 문제 풀이 66.67 78.33 89.17
GPQA 대학원 수준 과학 문제 54.80 64.14 66.41
LiveCodeBench v6 코딩 문제 풀이 69.71 73.24 75.77
SciCode 과학 연구용 코드 작성 24.11 36.09 38.76
MMLU-Pro 여러 분야 지식과 추론 67.84 74.04 77.60
MMLU-ProX lite (IBM) 다국어 지식과 추론 27.78 61.06 66.64
Arena-Hard-V2 어려운 질문에 대한 답변 품질 34.96 65.19 67.93
IFBench (prompt) 지시 따르기 74.33 79.33 77.17
RULER 64K 긴 문맥 속 정보 활용 67.52 80.99 89.96
RULER 128K 긴 문맥 속 정보 활용 55.30 71.41 81.38

평가는 NeMo Evaluator SDK를 바탕으로 한 평가 체계로 진행했다고 회사가 밝혔다.

같은 발표의 다른 판

원문